Context engineering : comment un agent IA lit de gros volumes de données
Le context engineering consiste à décider ce qu'un agent IA voit dans sa fenêtre de contexte à chaque étape. La fenêtre de contexte est la mémoire de travail du modèle de langage, et elle est limitée. Anthropic plafonne par défaut chaque réponse d'outil à 25'000 tokens dans Claude Code. La règle de base : la limite se trouve dans l'outil, pas dans le prompt. Une lecture n'est jamais plus grande que ce qui peut être visible dans le contexte. Nous construisons l'agent de Vectoryon pour les PME suisses selon ces règles.
Ce texte s'adresse aux dirigeants et aux responsables informatiques : pourquoi un agent IA peut échouer devant un long PDF ou une grande liste Excel, et comment l'éviter. Les bases sont sur la page Agents IA pour PME.
Qu'est-ce que le context engineering ?
Le context engineering décrit quelles informations un agent IA reçoit à quel moment. Un agent travaille en boucle : il appelle un outil, lit le résultat, décide de l'étape suivante. Chaque résultat s'ajoute à la fenêtre de contexte, qui se remplit à chaque étape.
Anthropic décrit donc le contexte comme une ressource limitée au rendement décroissant. Chaque token supplémentaire consomme une part du « budget d'attention » du modèle. La raison tient à l'architecture Transformer : chaque token se rapporte à tous les autres, soit n² relations pour n tokens. Plus le contexte est long, moins bien le modèle saisit ces relations. Anthropic renvoie à des mesures sur l'effet appelé « context rot ».
Le prompt engineering se demande comment formuler une consigne. Le context engineering se demande ce qui figure à côté de la consigne : résultats d'outils antérieurs, extraits de documents, états intermédiaires. Anthropic formule l'objectif ainsi : trouver le plus petit ensemble de tokens à forte valeur informative qui rend le résultat souhaité le plus probable.
Pour une PME : un agent qui prépare une offre à partir d'un long appel d'offres ne lit pas tout le document d'un coup. Ses outils livrent les pièces par morceaux, et il peut revenir à un passage précis.
Pourquoi un prompt plus grand ne règle pas le problème
La réponse évidente à trop de données serait une fenêtre de contexte plus grande, ou un prompt qui demande d'être bref. Les deux arrivent trop tard. L'équipe de Manus écrit que les modèles actuels offrent des fenêtres de 128'000 tokens et plus, mais que cela ne suffit souvent pas dans de vrais scénarios d'agents, et que cela peut même nuire.
Manus cite trois raisons. D'abord, une seule observation peut être énorme, par exemple une page web ou un PDF. Ensuite, la performance du modèle baisse au-delà d'une certaine longueur, même si la fenêtre en accepte davantage. Enfin, les longues entrées coûtent cher, même avec un cache. Chez Manus, le rapport moyen est d'environ 100 tokens d'entrée pour un de sortie.
Un prompt ne peut pas empêcher un outil de renvoyer un résultat gigantesque, et une fois dans le contexte, ce résultat prend la place. C'est pourquoi la limite appartient à l'outil lui-même : l'outil décide combien il renvoie et indique à l'agent comment obtenir la suite.
Lire page par page avec un curseur : ce que prévoit MCP
Le Model Context Protocol (MCP) est un standard ouvert qui relie les agents IA aux outils et aux sources de données. Pour les longues listes, la spécification MCP prévoit une pagination avec un curseur plutôt qu'avec des numéros de page.
Le déroulement : le serveur livre la première page et, s'il reste des résultats, un champ `nextCursor`. L'agent renvoie ce curseur avec la requête suivante et reçoit la page d'après. Sans curseur, la liste est terminée.
Deux règles de la spécification comptent pour le context engineering. D'abord, le serveur fixe la taille des pages et le client ne doit pas supposer de taille fixe. La limite reste donc du côté de l'outil, pas du modèle. Ensuite, le curseur est opaque : le client ne doit ni l'interpréter, ni le modifier, ni le garder d'une session à l'autre. L'agent ne peut pas deviner « la page 47 ».
La spécification MCP applique la pagination aux listes d'outils, de ressources et de prompts. Le même schéma convient aux outils qui lisent des e-mails, des fichiers ou des lignes de tableau. C'est selon ce schéma que nous adaptons progressivement les outils de lecture de Vectoryon : une page par appel, un curseur opaque pour la suivante. Tous les outils ne fonctionnent pas encore ainsi.
Un plafond de réponse dans l'outil, avec une indication
Un plafond de réponse limite ce qu'un outil peut écrire dans le contexte de l'agent. Anthropic recommande de combiner pagination, sélection de plage, filtrage et troncature, avec des valeurs par défaut raisonnables. Claude Code limite par défaut les réponses d'outils à 25'000 tokens.
L'agent pi montre comment séparer plafond et données complètes. En mode Codemode, l'agent appelle les outils depuis un script. La sortie d'une commande shell peut y atteindre 1 MiB, alors que le modèle n'en voit au plus que 2000 lignes ou 50 KB. Dans le script, les outils MCP renvoient leur résultat complet, `structuredContent` compris. Le script calcule sur les données complètes, seul le résultat entre dans la fenêtre du modèle.
Si une réponse est tronquée, l'outil doit le dire. Anthropic conseille d'accompagner les réponses tronquées d'instructions utiles, par exemple la recommandation de faire plusieurs petites recherches ciblées plutôt qu'une seule recherche large. Un bon texte de troncature indique ce qui manque et comment l'agent obtient la suite : avec le curseur, avec un filtre plus étroit ou avec une plage.
Pour une PME : une liste Excel de plusieurs dizaines de milliers de lignes ne fait pas déborder l'agent. L'outil renvoie les premières lignes, le total et le chemin vers la suite, puis l'agent filtre.
Une référence plutôt que le texte complet, pour ne rien perdre à la compression
Quand un agent travaille longtemps, son contexte se remplit et il faut compresser : retirer d'anciens résultats ou résumer l'historique, ce qu'Anthropic appelle compaction. Le risque : une information qui deviendra importante dix étapes plus tard a disparu. Manus écrit que toute compression irréversible comporte ce risque.
La solution est une référence qui survit à la compression. Manus rend la compression réversible : le contenu d'une page web peut sortir du contexte tant que l'URL est conservée. Le contenu d'un document peut manquer tant que le chemin du fichier reste. L'agent peut rouvrir la source à tout moment.
LangChain procède de façon semblable dans ses Deep Agents. Si une réponse d'outil dépasse 20'000 tokens, elle est déplacée dans un fichier. Dans le contexte restent le chemin du fichier et un aperçu des 10 premières lignes. Quand le contexte atteint 85 pour cent de la fenêtre, le système remplace d'anciens appels d'outils par une référence au fichier. En dernier recours, il résume et garde les messages d'origine dans un fichier.
Anthropic appelle ce principe « just in time » : l'agent garde des identifiants légers comme des chemins de fichiers, des requêtes enregistrées ou des liens, et charge les données au besoin par un outil. Pour notre agent, chaque résultat doit porter un identifiant qui permet de rouvrir la source.
Cinq techniques en un coup d'œil
| Technique | Ce que fait l'outil | Référence dans la source |
|---|---|---|
| Pagination avec curseur | Livre une page et un curseur opaque pour la suivante | MCP : le serveur fixe la taille des pages |
| Plafond de réponse | Limite ce qui entre dans le contexte | Claude Code : 25'000 tokens, pi : 2000 lignes ou 50 KB |
| Troncature avec indication | Dit ce qui manque et comment continuer la lecture | Anthropic : accompagner les réponses tronquées d'instructions |
| Délestage avec référence | Dépose les gros résultats, garde chemin et aperçu dans le contexte | LangChain : dès 20'000 tokens, aperçu de 10 lignes |
| Compression réversible | Retire le contenu, garde l'URL ou le chemin | Manus : l'URL reste, le contenu peut sortir |
Où sont les limites ?
- Plus d'étapes : lire page par page demande plus d'appels. Selon Anthropic, explorer à l'exécution est plus lent que récupérer des données préparées.
- L'agent ne voit jamais tout en même temps. Une question qui compare le début d'un long document avec sa fin doit être traitée par étapes, avec des états intermédiaires.
- La recherche doit être bonne. L'agent ne trouve que ce que sa recherche atteint, et un classement mal décrit reste difficile à parcourir.
- Les résumés perdent des détails. Une référence n'aide que si l'agent comprend qu'il doit rouvrir la source.
- Les outils demandent du travail. Pagination, plafonds et textes de troncature doivent être intégrés dans chaque outil. Un modèle plus grand ne remplace pas ce travail.
Questions fréquentes
Qu'est-ce que le context engineering en termes simples ?
Il fixe quelles informations un agent IA voit à chaque étape, pour que sa mémoire de travail limitée ne contienne que l'utile.
Qu'est-ce qu'une fenêtre de contexte ?
La quantité de texte, mesurée en tokens, qu'un modèle traite en même temps : consigne, historique et résultats d'outils. Pleine, elle oblige à retirer quelque chose.
Quelle différence entre prompt engineering et context engineering ?
Le prompt engineering formule la consigne. Le context engineering gère tout ce qui l'entoure dans le contexte, surtout les résultats d'outils.
Pourquoi un agent IA oublie-t-il des choses dans les longs documents ?
La fenêtre est limitée et la performance baisse avec la longueur. Une compression retire des contenus. Si le chemin du fichier ou l'URL reste, l'agent peut rouvrir le passage.
Que signifie la pagination avec curseur ?
L'outil livre les données page par page, chacune avec un curseur opaque. L'agent le renvoie et reçoit la page suivante, comme le prévoit le Model Context Protocol.
Un modèle avec une plus grande fenêtre de contexte aide-t-il ?
Il déplace la limite. Anthropic s'attend à ce que la longueur de contexte effective augmente et à ce que le besoin d'outils économes demeure.
Sources
Les chiffres et les règles de ce texte proviennent de ces sources, état au 8 octobre 2026.
- 1Anthropic : Writing effective tools for agents
- 2Anthropic : Effective context engineering for AI agents (29 septembre 2025)
- 3Model Context Protocol, spécification 2025-06-18 : Pagination
- 4pi : Codemode
- 5Manus : Context Engineering for AI Agents, Lessons from Building Manus
- 6LangChain : Context Management for Deep Agents
Pour aller plus loin
- Qu'est-ce qu'un agent IA ? Définition, différence avec l'assistant et le chatbot, limites.
- Qu'est-ce qu'un assistant IA ? Comment un assistant travaille sur les données de l'entreprise.
- IA en Suisse Cadre légal, lieu des données et choix du fournisseur.
- Réserver une démo Tester Vectoryon avec vos propres documents.