Warum ein lokales LLM schon vor der Antwort 6.300 Tokens verbraucht – und wie wir 76 % davon eingespart haben
MCP-Werkzeuge machen lokale LLMs mächtig – können aber überraschend viel Kontext kosten. In einem Jan-Setup belegten Basic-Memory-Tools bereits vor der ersten eigentlichen Antwort mehr als 5.000 Tokens. Eine kontrollierte Messung führte schließlich zu einem schlanken MCP-Wrapper, der den gesamten Start-Overhead…
