Jev et le nettoyage du contexte des agents IA
Jev a passé 6 000 affirmations de mémoire d'agent en sept minutes pour 0,37 $. L'empoisonnement du contexte, et la passe sur une base de connaissances SpineOS.
Quiconque fait tourner un agent IA plus d'une semaine finit avec une forme de second cerveau : un dossier de notes que l'agent lit avant de travailler et complète quand il apprend quelque chose. Le dossier se dégrade vite. Des décisions sont annulées, des faits expirent, la même leçon est écrite trois fois. Personne ne fait le ménage, parce que relire chaque note à la lumière de toutes celles qui ont suivi est un travail que personne n'a le temps de faire.
Un développeur a publié cette semaine une démonstration qui confie ce ménage à Jev, le nouveau modèle de décision de TypeSafe AI. Sur un jeu de plus de 6 000 affirmations, la passe a rendu environ 41 000 jugements en sept minutes pour 0,37 $ environ. Elle a aussi signalé, dans le propre fichier de mémoire du développeur, une décision ferme qu'il avait annulée quelques mois plus tard et que l'agent lisait depuis comme toujours valable.
Chaque espace de travail SpineOS dispose d'une base de connaissances partagée, et elle a exactement le même problème. Cet article explique ce que fait la passe, d'où viennent les chiffres, et à quoi ressemblerait une version de cette passe sur la base de connaissances d'un espace de travail. Cette dernière partie est une esquisse et une invitation. Ce n'est pas une fonctionnalité livrée.
Qu'est-ce que Jev
Jev est un modèle qui répond à des questions typées sur un contenu et renvoie des probabilités plutôt que du texte. TypeSafe AI l'a publié le 15 septembre 2026 et le qualifie de modèle « System One » : une classification rapide plutôt qu'un raisonnement pas à pas.
Une requête contient un état (le texte à juger) et un ensemble de questions. Chaque question appartient à l'un des trois types décrits dans la documentation de TypeSafe :
| Type de question | Ce que vous fournissez | Ce qui revient |
|---|---|---|
| Choice | Une liste d'options, jusqu'à 255 | L'option retenue, une probabilité par option et un niveau de confiance |
| Score | Une grille ordonnée de 2 à 10 niveaux | Un niveau, une probabilité par niveau et un niveau de confiance |
| Noul | Une proposition oui/non | Une seule valeur entre 0 et 1 |
L'article de lancement facture l'entrée 0,042 $ par million de tokens, ne facture rien en sortie, et annonce un temps de réponse de bout en bout de 70 à 500 millisecondes. Source : l'introduction aux modèles System One et à Jev publiée par TypeSafe, consultée le 21 septembre 2026.
Jev ne sait pas écrire de texte. Il ne peut donc ni réécrire une note ni expliquer sa réponse. Cette limite explique la forme que prend la passe.
Qu'est-ce que l'empoisonnement du contexte d'un agent IA
L'empoisonnement du contexte se produit quand un agent ramène dans son contexte de travail un fait qui n'est plus vrai, puis construit dessus pendant tout le reste de la session. L'agent ne sait pas que le fait est périmé. Il a trouvé la note avec un outil de recherche, la note a l'air fiable, et chaque étape suivante hérite de l'erreur.
Le symptôme que décrivent les utilisateurs, c'est que le modèle « est devenu bête ». Le modèle n'a pas changé. Ce sont ses entrées qui ont changé.
Un dossier de notes est le cas le plus simple d'une panne qui se retrouve dans toutes les architectures de mémoire. Un système de recherche qui réindexe ses documents à intervalle fixe continue de servir l'ancienne version jusqu'au prochain passage. Un graphe qui fait remonter des résumés propage une décision annulée dans chaque synthèse au-dessus d'elle. Dans tous les cas, le corpus contient deux affirmations qui ne peuvent pas être vraies en même temps, et rien n'indique laquelle l'a emporté.
Pourquoi personne ne nettoie la mémoire d'un agent
Le nettoyage coûte cher parce qu'il se fait par paires. Pour savoir si une affirmation est périmée, il faut la relire face à celles qui sont venues après et décider si l'une d'elles la remplace, la duplique ou la contredit. Pour des milliers d'affirmations, cela représente des milliers de lectures par affirmation.
Le développeur à l'origine de la démonstration estime que passer le même jeu dans Claude Sonnet prendrait environ douze heures et une soixantaine de dollars. C'est une estimation, pas une mesure, mais l'ordre de grandeur correspond à ce qu'attendrait quiconque a essayé à la main. Une tâche qui coûte une journée de travail et une facture notable s'exécute une fois, au mieux, et toujours en arrière-plan, quand quelqu'un pense à la lancer.
Le corpus reste donc sale, et l'agent continue de le lire.
Comment la passe de nettoyage répartit le travail entre le code et Jev
La passe confie la moitié mécanique au code et la moitié jugement à Jev. Le code sait extraire chaque affirmation avec sa date, les ordonner, et apparier chaque affirmation avec celles écrites après elle. Ce que le code ne sait pas faire, c'est lire deux phrases et dire si la plus récente annule la plus ancienne. C'est la seule partie que fait le modèle.
Une paire ressemble à ceci. L'état contient les deux affirmations, et deux questions portent sur leur relation :
{
"model": "jev-latest",
"state": {
"older": {
"date": "2026-03-04",
"text": "Les factures du client partent le 1er du mois."
},
"newer": {
"date": "2026-08-19",
"text": "Convenu avec le client en août : les factures partent désormais le 15."
}
},
"questions": {
"relation": {
"type": "choice",
"instructions": "Quelle est la relation entre l'affirmation récente et l'ancienne ?",
"criteria": {
"supersedes": "La récente remplace l'ancienne. L'ancienne n'est plus vraie.",
"duplicate": "Les deux disent la même chose.",
"contradicts": "Elles se contredisent et le texte ne dit pas laquelle est en vigueur.",
"unrelated": "Elles parlent de choses différentes."
}
},
"still_true": {
"type": "noul",
"instructions": "L'ancienne affirmation est-elle encore vraie après lecture de la récente ?"
}
}
}
La réponse revient sous forme de probabilités, pas de phrase. Pour cette paire, on attendrait quelque chose comme supersedes à 0,9 et still_true autour de 0,05. Les chiffres exacts sont donnés à titre d'illustration ; ce qui compte, c'est que chaque paire reçoit un nombre, et que les nombres se trient.
Ce tri est le produit. On lance la passe, on obtient la liste classée des paires les plus susceptibles d'empoisonner le corpus, et on confie cette liste à un agent ou à une personne pour correction. La passe trouve les problèmes. Elle ne modifie rien.
Ce que la passe a trouvé, et ce qu'elle a raté
Sur le jeu de la démonstration, la passe a couvert plus de 8 000 comparaisons, soit environ 41 000 jugements au total, en sept minutes environ pour 0,37 $ environ. Un modèle de pointe lancé sur les mêmes paires pendant les mêmes sept minutes en a traité environ 180. Tous ces chiffres viennent du compte rendu du développeur sur une seule exécution, pas d'un banc d'essai que nous aurions reproduit.
L'affirmation sur la précision est la plus intéressante, et elle est anecdotique au bon sens du terme : la passe a fait remonter une note où le développeur avait consigné une décision ferme, et une note postérieure où il l'avait annulée après qu'elle lui eut causé des problèmes. L'agent lisait la première note comme valable depuis des mois.
Le test de Mike Taylor pour Every sert de contrepoids. Sur un contrôle avec sept défauts d'écriture volontairement introduits, Jev en a trouvé six et Claude Fable 5.1 les a tous trouvés, Jev étant environ 25 fois plus rapide pour un coût estimé 580 fois moindre. Lus ensemble, les deux résultats dictent la règle de conception : la sortie de Jev est un classement, et une personne ou un agent décide quoi faire de chaque ligne.
À quoi ressemblerait une passe Jev sur la base de connaissances d'un espace de travail SpineOS
Chaque espace de travail SpineOS dispose d'une base de connaissances partagée : un dossier de notes markdown que chaque bureau cloud de l'espace peut lire et écrire, avec des dossiers pour les mémoires, les leçons apprises, les problèmes et les corrections. Les agents y écrivent en travaillant. Vous pouvez l'ouvrir dans Obsidian. En quelques mois, elle accumule exactement le genre d'affirmations dépassées que la démonstration est allée chercher.
Voici la passe que nous construirions dessus. Rien de tout cela n'existe aujourd'hui.
- Une tâche planifiée dans Mission Control exécute la moitié code : parcourir la base, extraire chaque affirmation datée, et apparier chacune avec les notes postérieures qui partagent un dossier ou un tag. La plupart des paires sont sans rapport à première vue et ne quittent jamais la machine.
- Les paires retenues partent vers Jev avec les deux questions ci-dessus.
- Les résultats reviennent dans la base sous forme de note de rapport : la date de la passe, les paires classées par probabilité, et un décompte par catégorie. Rien d'autre n'est écrit.
- Un agent prend le rapport comme tâche. Pour les remplacements à forte probabilité, il ajoute un lien
superseded_bysur l'ancienne note. Pour les doublons, il propose une fusion. Pour les contradictions, il laisse un commentaire et demande à un humain.
Si le rapport est une note et pas un tableau de bord, c'est parce que les agents lisent déjà la base. Un rapport dans la base, le prochain agent qui cherche « factures » le trouvera avant de tomber sur l'affirmation périmée.
Deux conditions avant d'activer cela sur l'espace de travail d'un client. Les paires quittent l'espace de travail pour un tiers, donc ce serait activé par espace de travail, sur demande, et nous voudrions une réponse claire de TypeSafe sur la conservation de ces données. Et nous voudrions d'abord le faire tourner sur notre propre base, parce que le taux d'erreur de la démonstration est une anecdote et que la base d'un espace de travail, c'est l'activité de quelqu'un.
Si vous êtes chez TypeSafe et que vous lisez ceci, nous aimerions l'essayer. Si vous gérez un espace de travail dont la base est assez ancienne pour s'être dégradée, nous aimerions la passer sur la vôtre, avec votre accord, avant toute autre.
Les règles d'un nettoyage qui ne détruit pas l'historique
Une passe n'est sûre que si elle a le droit de se tromper. Quatre règles en découlent.
- Les probabilités classent, un seuil filtre, une personne ou un agent décide. Le modèle ne supprime jamais.
- Un remplacement est un lien, pas une suppression. L'ancienne note était vraie le jour où elle a été écrite, et l'agent qui demandera plus tard « pourquoi avait-on fait comme ça » doit pouvoir la retrouver.
- Relancer à intervalle régulier. Une note valable aujourd'hui sera remplacée par quelque chose d'écrit le mois prochain, et le dernier résultat de la passe ne peut pas le voir.
- Le rapport dit ce qu'il a lu et quand. Un constat daté se vérifie. Un constat sans date devient la prochaine affirmation périmée.
L'exemple du développeur plaide pour la deuxième règle. La décision annulée n'était pas fausse en mars. Ce qui était faux, c'était de la présenter encore comme en vigueur en septembre. La correction, c'est un pointeur de l'ancienne note vers la nouvelle. Un fichier vide à la place de la décision effacerait la raison en même temps que l'erreur.
Questions fréquentes
Qu'est-ce que Jev ?
Jev est un modèle de décision de TypeSafe AI, publié le 15 septembre 2026. Il prend un contenu et un ensemble de questions typées, et renvoie une probabilité par option plutôt que du texte rédigé. Il est facturé 0,042 $ par million de tokens en entrée, sans frais en sortie.
Qu'est-ce que l'empoisonnement du contexte ?
C'est le moment où un agent récupère un fait qui n'est plus vrai, puis raisonne dessus pendant le reste de la session. La cause habituelle est une mémoire qui contient à la fois l'ancienne affirmation et la nouvelle qui l'a remplacée, sans rien qui indique laquelle est en vigueur.
SpineOS utilise-t-il Jev aujourd'hui ?
Non. La base de connaissances existe et chaque bureau cloud d'un espace de travail la partage. La passe Jev décrite ici est une conception que nous aimerions construire, et nous ne l'avons pas construite.
Puis-je lancer une passe de ce type sur mes propres notes dès aujourd'hui ?
Oui. Un outil open source, jev-second-brain, indexe un coffre Obsidian en local et, sur option, demande à Jev de classer les paires de notes en doublon, lié, révise, contredit, aucun ou incertain. Il fonctionne d'abord en local et n'envoie au modèle que les paires retenues.
Une passe va-t-elle supprimer mes notes ?
Pas dans la conception décrite ici. La passe écrit un rapport. Toute modification d'une note est faite par un agent ou une personne à partir de ce rapport, et un remplacement est enregistré comme un lien, pas comme une suppression.
Ouvrez un espace de travail sur www.spinestudio.dev et donnez à vos agents une base de connaissances à partager. Si vous construisez sur Jev et voulez essayer une passe de nettoyage sur la base d'un vrai espace de travail, écrivez à contact@spinestudio.dev.
À lire aussi
Prêt à donner un vrai bureau à votre agent IA ?
Voir les plansNewsletter mensuelle
Une fois par mois. Pas une de plus.
Les meilleurs articles, les nouveautés produit, et une recommandation de lecture. 5 minutes, début du mois.