Context Engineering: wie ein KI-Agent grosse Datenmengen liest

Context Engineering ist die Arbeit daran, was ein KI-Agent in jedem Schritt in seinem Kontextfenster sieht. Das Kontextfenster ist der Arbeitsspeicher des Sprachmodells, und er ist begrenzt. Anthropic deckelt in Claude Code jede Werkzeug-Antwort standardmässig auf 25'000 Tokens. Die Kernregel lautet: Die Grenze sitzt im Werkzeug, nicht im Prompt. Eine Lesung ist nie grösser als das, was im Kontext sichtbar sein darf. Nach diesen Regeln bauen wir bei Vectoryon unseren Agenten für Schweizer KMU.

Dieser Text richtet sich an Geschäftsführer und IT-Verantwortliche, die wissen wollen, warum ein KI-Agent an einem langen PDF oder einer grossen Excel-Liste scheitern kann und wie man das verhindert. Oben steht die einfache Erklärung, darunter die Technik. Was ein KI-Agent grundsätzlich ist, erklärt die Seite KI-Agenten für KMU.

Was ist Context Engineering?

Context Engineering beschreibt, welche Informationen ein KI-Agent zu welchem Zeitpunkt zu sehen bekommt. Ein Agent arbeitet in einer Schleife: Er ruft ein Werkzeug auf, liest das Ergebnis, entscheidet den nächsten Schritt. Jedes Ergebnis landet im Kontextfenster, dem Bereich, den das Sprachmodell gleichzeitig überblickt. Mit jedem Schritt wird dieser Bereich voller.

Anthropic beschreibt den Kontext darum als begrenzte Ressource mit abnehmendem Grenznutzen. Jedes zusätzliche Token verbraucht einen Teil des «Aufmerksamkeitsbudgets» des Modells. Der Grund liegt in der Transformer-Architektur: Jedes Token bezieht sich auf jedes andere, bei n Tokens sind das n² Beziehungen. Je länger der Kontext, desto schlechter erfasst das Modell diese Beziehungen. Anthropic verweist dazu auf Messungen zum Effekt «context rot».

Prompt Engineering fragt, wie man eine Anweisung formuliert. Context Engineering fragt, was neben der Anweisung im Fenster steht: frühere Werkzeug-Ergebnisse, Dokumentauszüge, Zwischenstände. Das Ziel formuliert Anthropic so: die kleinste Menge an Tokens mit hohem Informationsgehalt finden, die das gewünschte Ergebnis am wahrscheinlichsten macht.

Für ein KMU heisst das konkret: Ein Agent, der eine Offerte aus einer langen Ausschreibung vorbereiten soll, darf die Ausschreibung nicht auf einmal lesen. Er braucht Werkzeuge, die ihm die Unterlagen in verdaulichen Stücken geben, und einen Weg, später zu einer Stelle zurückzufinden.

Warum ein grösserer Prompt das Problem nicht löst

Die naheliegende Antwort auf zu viele Daten ist ein grösseres Kontextfenster oder ein Prompt mit der Anweisung «fasse dich kurz». Beides greift zu spät. Das Team von Manus schreibt, dass moderne Sprachmodelle Kontextfenster von 128'000 Tokens und mehr bieten, dies in echten Agenten-Abläufen aber oft nicht reicht und manchmal sogar schadet.

Manus nennt drei Gründe. Erstens können einzelne Beobachtungen riesig sein, etwa eine Webseite oder ein PDF. Zweitens sinkt die Leistung des Modells ab einer gewissen Länge, auch wenn das Fenster technisch mehr fasst. Drittens kosten lange Eingaben Geld, auch mit Zwischenspeicher. Bei Manus kommen im Schnitt rund 100 Eingabe-Tokens auf ein Ausgabe-Token.

Ein Prompt kann ein Werkzeug nicht daran hindern, ein riesiges Ergebnis zurückzugeben. Steht das Ergebnis einmal im Kontext, hat es Platz verbraucht, egal was im Prompt steht. Darum gehört die Grenze in das Werkzeug selbst: Das Werkzeug entscheidet, wie viel es zurückgibt, und sagt dem Agenten, wie er an den Rest kommt.

Seitenweise lesen mit Cursor: wie MCP es regelt

Das Model Context Protocol (MCP) ist ein offener Standard, über den KI-Agenten mit Werkzeugen und Datenquellen sprechen. Für Listen, die gross werden können, schreibt die MCP-Spezifikation eine seitenweise Ausgabe vor, die Pagination. Sie arbeitet mit einem Cursor statt mit Seitennummern.

Der Ablauf: Der Server liefert die erste Seite und, falls mehr Ergebnisse vorhanden sind, ein Feld `nextCursor`. Der Agent schickt diesen Cursor mit der nächsten Anfrage zurück und erhält die nächste Seite. Fehlt der Cursor, ist die Liste zu Ende.

Zwei Regeln der Spezifikation sind für Context Engineering zentral. Erstens bestimmt der Server die Seitengrösse, und der Client darf keine feste Grösse annehmen. Damit liegt die Grenze beim Werkzeug, nicht beim Modell. Zweitens ist der Cursor opak: Der Client darf sein Format nicht deuten, ihn nicht verändern und nicht über eine Sitzung hinaus speichern. Der Agent kann also nicht «Seite 47» erraten und dabei Daten überspringen oder doppelt lesen.

Die MCP-Spezifikation regelt Pagination für Listen wie verfügbare Werkzeuge, Ressourcen und Prompts. Dasselbe Muster eignet sich für Werkzeuge, die Mails, Dateien oder Tabellenzeilen lesen. Nach diesem Muster stellen wir die Lese-Werkzeuge von Vectoryon Schritt für Schritt um: eine Seite pro Aufruf, ein opaker Cursor für die nächste. Nicht jedes Werkzeug arbeitet heute schon so.

Antwort-Deckel im Werkzeug: fest begrenzt, mit Hinweis

Ein Antwort-Deckel ist eine feste Obergrenze, wie viel ein Werkzeug in den Kontext des Agenten schreiben darf. Anthropic empfiehlt für jedes Werkzeug, das viel Kontext verbrauchen kann, eine Kombination aus Pagination, Bereichsauswahl, Filter und Kürzung, jeweils mit sinnvollen Standardwerten. Claude Code begrenzt Werkzeug-Antworten standardmässig auf 25'000 Tokens.

Der Agent pi zeigt, wie man Deckel und volle Daten trennt. Im Codemode ruft der Agent Werkzeuge aus einem Skript auf. Die Ausgabe eines Shell-Befehls kann dort bis 1 MiB umfassen, das Modell selbst sieht davon höchstens 2000 Zeilen oder 50 KB. MCP-Werkzeuge geben im Skript ihr vollständiges Ergebnis zurück, inklusive `structuredContent`. Das Skript rechnet mit den vollen Daten, ins Fenster des Modells kommt nur das Ergebnis.

Wird eine Antwort gekürzt, muss das Werkzeug das sagen. Anthropic rät, gekürzte Antworten mit hilfreichen Anweisungen zu versehen, etwa der Empfehlung, mehrere kleine, gezielte Suchen statt einer breiten zu machen. Ein guter Kürzungstext nennt, wie viel fehlt und wie der Agent an den Rest kommt: mit dem Cursor, mit einem engeren Filter oder mit einem Bereich.

Für ein KMU bedeutet das: Eine Excel-Liste mit zehntausenden Zeilen sprengt den Agenten nicht. Das Werkzeug gibt die ersten Zeilen, die Gesamtzahl und den Weg zur nächsten Seite zurück. Der Agent filtert dann nach dem, was er wirklich braucht.

Verweis statt Volltext: damit bei Kompression nichts verloren geht

Läuft ein Agent lange, wird sein Kontext irgendwann voll. Dann wird komprimiert: Alte Werkzeug-Ergebnisse werden entfernt oder der Verlauf zusammengefasst. Anthropic nennt das Compaction. Das Risiko: Eine Information, die zehn Schritte später wichtig wird, ist weg. Manus schreibt dazu, dass jede nicht umkehrbare Kompression dieses Risiko trägt.

Die Lösung ist ein Verweis, der die Kompression überlebt. Manus gestaltet Kompression umkehrbar: Der Inhalt einer Webseite darf aus dem Kontext fallen, solange die URL erhalten bleibt. Der Inhalt eines Dokuments darf fehlen, solange der Dateipfad bleibt. Der Agent kann die Quelle jederzeit neu öffnen.

LangChain macht es in seinen Deep Agents ähnlich. Ist eine Werkzeug-Antwort grösser als 20'000 Tokens, wird sie in eine Datei ausgelagert. Im Kontext bleiben der Dateipfad und eine Vorschau der ersten 10 Zeilen. Erreicht der Kontext 85 Prozent des Fensters, ersetzt das System ältere Werkzeug-Aufrufe durch einen Verweis auf die Datei. Erst wenn das nicht mehr reicht, fasst es zusammen, und die Originalnachrichten bleiben als Datei erhalten.

Anthropic nennt das Prinzip «just in time»: Statt alle Daten vorab zu laden, hält der Agent leichte Kennungen wie Dateipfade, gespeicherte Abfragen oder Links und lädt die Daten erst bei Bedarf über ein Werkzeug. Für unseren Agenten heisst das: Jedes Ergebnis soll eine Kennung tragen, über die der Agent die Quelle wieder öffnen kann.

Fünf Techniken im Überblick

TechnikWas das Werkzeug tutBeleg aus der Quelle
Pagination mit CursorLiefert eine Seite und einen opaken Cursor für die nächsteMCP: Server bestimmt die Seitengrösse
Antwort-DeckelBegrenzt, wie viel in den Kontext gelangtClaude Code: 25'000 Tokens, pi: 2000 Zeilen oder 50 KB
Kürzung mit HinweisSagt, was fehlt und wie der Agent weiterliestAnthropic: gekürzte Antworten mit Anweisungen versehen
Auslagern mit VerweisLegt grosse Ergebnisse ab, im Kontext bleiben Pfad und VorschauLangChain: ab 20'000 Tokens, Vorschau 10 Zeilen
Umkehrbare KompressionEntfernt Inhalte, behält URL oder PfadManus: URL bleibt, Inhalt darf fallen
AI JOURNEY
Vectoryon AI
Gemeinsam ins neue Zeitalter
01DSG‑KI‑Richtlinie
Fundament
DSG‑KI‑Richtlinie
Wer künstliche Intelligenz einsetzt, verarbeitet Personendaten. Wir schreiben mit Ihnen die Richtlinie, die festlegt, welche Daten in welches Modell dürfen. Grundlage ist das revidierte Datenschutzgesetz.
01 / 07
02Chat für alle Mitarbeitenden
Zugang
Chat‑Funktion für alle Mitarbeitenden
Künstliche Intelligenz wirkt erst, wenn sie alle nutzen können. Jede Person erhält einen Zugang, der auf den Daten Ihres Unternehmens arbeitet statt auf dem offenen Internet.
02 / 07
03Erste KI‑Automationen
Hebel
Erste KI‑Automationen
Wir suchen die Abläufe, die täglich Zeit kosten, und lassen sie von Agenten vorbereiten. Freigegeben wird weiterhin von einem Menschen.
03 / 07
04Analyse des Geschäftsmodells
Strategie
Ihr Geschäftsmodell im KI‑Zeitalter
Künstliche Intelligenz verschiebt gerade, womit Unternehmen Geld verdienen. Wir analysieren mit Ihnen, welche Teile Ihres Geschäftsmodells KI angreifbar macht und welche sie stärkt.
04 / 07
05Neue Märkte erschliessen
Wachstum
Neue Märkte durch künstliche Intelligenz
Künstliche Intelligenz schafft bereits heute neue Märkte, die weltweit erschlossen werden. Wir analysieren mit Ihnen, welche davon zu Ihrem Unternehmen passen und womit Sie dort auftreten.
05 / 07
06Agentic‑AI‑First‑Ansatz
Haltung
Agentic‑AI‑First‑Ansatz
Ab hier bauen wir Ihre Kernprozesse gemeinsam so um, dass Sie kurz- und mittelfristig von grossen Produktivitätssteigerungen profitieren können.
06 / 07
07Eigenes Agentic OS
Ziel
Ihr eigenes Agentic OS
Ihr eigenes Betriebssystem: Ihre Prozesse, Ihre Daten, Ihre Agenten. Es entwickelt Ihr Unternehmen selbständig datengetrieben weiter, im UI, im Hintergrund und in Ihren Kundenprozessen. Was Ihre Mitbewerber noch von Hand entscheiden, hat Ihr System bereits vorbereitet.
Sehen Sie es in Aktion
07 / 07
HEUTEAGENTIC OS

Wo sind die Grenzen?

  • Mehr Schritte: Wer seitenweise liest, braucht mehr Werkzeug-Aufrufe. Anthropic hält fest, dass das Erkunden zur Laufzeit langsamer ist als das Abrufen vorbereiteter Daten.
  • Der Agent sieht nie alles gleichzeitig. Eine Frage, die den Anfang eines langen Dokuments mit dem Ende vergleicht, muss er in Etappen beantworten und sich Zwischenstände merken.
  • Die Suche muss gut sein. Lädt der Agent Daten erst bei Bedarf, findet er nur, was seine Suche trifft. Eine schlecht beschriebene Ablage bleibt auch mit gutem Context Engineering schwer zu durchsuchen.
  • Zusammenfassungen verlieren Details. Ein Verweis hilft nur, wenn der Agent erkennt, dass er die Quelle neu öffnen muss.
  • Die Werkzeuge brauchen Arbeit. Pagination, Deckel und Kürzungstexte müssen in jedes Werkzeug eingebaut werden. Ein grösseres Modell ersetzt diese Arbeit nicht.

Häufige Fragen

Was ist Context Engineering in einfachen Worten?

Context Engineering legt fest, welche Informationen ein KI-Agent in jedem Schritt sieht. Ziel ist, dass im begrenzten Arbeitsspeicher des Modells nur steht, was für den nächsten Schritt nötig ist.

Was ist ein Kontextfenster?

Das Kontextfenster ist die Menge Text, gemessen in Tokens, die ein Sprachmodell gleichzeitig verarbeitet. Dazu gehören Anweisung, Gesprächsverlauf und alle Werkzeug-Ergebnisse. Ist es voll, muss etwas weichen.

Worin unterscheiden sich Prompt Engineering und Context Engineering?

Prompt Engineering formuliert die Anweisung. Context Engineering steuert alles, was neben der Anweisung im Kontext steht, vor allem die Ergebnisse der Werkzeuge über viele Schritte hinweg.

Warum vergisst ein KI-Agent bei langen Dokumenten etwas?

Weil das Kontextfenster begrenzt ist und die Leistung des Modells mit wachsender Länge sinkt. Wird komprimiert, fallen Inhalte heraus. Bleibt dabei ein Verweis wie Dateipfad oder URL erhalten, kann der Agent die Stelle neu öffnen.

Was bedeutet Pagination mit Cursor?

Das Werkzeug liefert die Daten seitenweise. Mit jeder Seite kommt ein Cursor, eine undurchsichtige Kennung für die Position. Der Agent schickt ihn zurück und erhält die nächste Seite. So regelt es das Model Context Protocol.

Hilft ein Modell mit grösserem Kontextfenster?

Es verschiebt die Grenze. Anthropic erwartet, dass die wirksame Kontextlänge wächst, der Bedarf an sparsamen Werkzeugen aber bleibt. Grosse Ergebnisse kosten weiterhin Geld und Genauigkeit.

Quellen

Die Zahlen und Regeln in diesem Text stammen aus diesen Quellen, Stand 8. Oktober 2026.

  1. 1Anthropic: Writing effective tools for agents
  2. 2Anthropic: Effective context engineering for AI agents (29. September 2025)
  3. 3Model Context Protocol, Spezifikation 2025-06-18: Pagination
  4. 4pi: Codemode
  5. 5Manus: Context Engineering for AI Agents, Lessons from Building Manus
  6. 6LangChain: Context Management for Deep Agents

Weiterlesen