SFEIR
Terminal Bench Concept

Terminal Bench

Benchmark d'agents IA sur des tâches de terminal réalistes, vérifiées par des tests. Projet conjoint de Stanford et du Laude Institute.

SFEIR AI · Publié le 16 juillet 2026 · Mis à jour le 17 septembre 2026

Mesurer un agent sur l'état final, pas sur son texte

Terminal-Bench évalue des agents IA sur des tâches réalistes et de bout en bout exécutées dans un terminal en ligne de commande. Chaque tâche s'exécute en environnement sandbox et livre une suite de tests que l'agent doit satisfaire en interagissant avec un vrai terminal : l'évaluation est programmatique et porte sur l'état final obtenu, non sur la réponse produite. C'est ce qui le distingue des benchmarks de génération de texte, et ce qui le rapproche d'une charge de travail d'exploitation.

Le projet est mené conjointement par Stanford University et le Laude Institute, avec une large communauté de contributeurs. Son article fondateur, arXiv:2601.11868, soumis le 17 janvier 2026, compte 85 auteurs et a pour auteur de contact Mike A. Merrill. Il est introduit publiquement en mai 2025, avec Terminus, un agent servant de harnais neutre pour évaluer les modèles.

Un benchmark continu, versionné et durci à chaque itération

Terminal-Bench n'est pas figé, et sa version ne se lit pas comme un détail. La version originale comptait environ 80 tâches ; la 2.0 en retient 89, curées, plus difficiles et mieux vérifiées, couvrant ingénierie logicielle, administration système, sécurité et calcul scientifique ; la 2.1 en est un rafraîchissement vérifié, à tâches identiques, corrigeant des environnements et des instructions. L'abstract de l'article relève que les modèles de pointe passent sous 65 % sur la 2.0.

Terminal-Bench 3 a suivi : l'appel à contributions du 5 mars 2026 vise « 100 diverse tasks » calibrées pour que les meilleurs modèles n'en résolvent au plus que 30 % au moment de la sortie. Une déclinaison terminal-bench-science étend le principe aux workflows scientifiques. Comparer deux scores suppose donc de vérifier qu'ils portent sur la même version.

Qui publie quoi : classement officiel et mesures tierces

Le classement officiel est hébergé sur tbench.ai, avec des releases taguées sur le Harbor Hub ; le dépôt est sous licence Apache 2.0. Des tiers publient leurs propres mesures avec leur propre protocole : Artificial Analysis exécute la 2.1 avec le harnais Terminus 2 en sandbox e2b, en pass@1 moyenné sur trois répétitions par tâche. Un score Terminal-Bench mesure toujours un couple modèle-harnais, jamais un modèle seul — c'est la lecture qui évite de transformer un résultat d'évaluation en classement absolu.

Questions fréquentes

Qu'est-ce que Terminal-Bench ?

Un benchmark qui évalue des agents IA sur des tâches réalistes exécutées dans un terminal, en environnement sandbox. Chaque tâche livre une suite de tests vérifiés par programme : l'évaluation porte sur l'état final obtenu, pas sur le texte produit par l'agent.

Qui a créé Terminal-Bench ?

Un projet conjoint de Stanford University et du Laude Institute, avec une large communauté de contributeurs. L'article fondateur, arXiv:2601.11868, soumis en janvier 2026, compte 85 auteurs, Mike A. Merrill étant auteur de contact.

Quelle est la différence entre les versions ?

La version originale comptait environ 80 tâches ; la 2.0 en retient 89, plus difficiles et mieux vérifiées ; la 2.1 en est un rafraîchissement vérifié à tâches identiques. Terminal-Bench 3 vise 100 tâches calibrées pour un taux de résolution d'au plus 30 %.

Qui publie le classement et peut-on s'y fier ?

Le classement officiel est hébergé sur tbench.ai, avec des releases taguées sur le Harbor Hub. Artificial Analysis publie des mesures indépendantes avec son propre harnais. Un score mesure un couple modèle-harnais : deux chiffres ne se comparent que sur une même version et un même protocole.

Le Laude Institute a-t-il un lien avec Anthropic ?

Non. Le Laude Institute est un organisme à but non lucratif distinct, sans rapport avec Anthropic ni avec Claude. La proximité de nom induit régulièrement en erreur, y compris des outils de résumé automatique.

Sources

Terminal Bench dans vos projets

Échanger avec SFEIR

Articles liés

Google ouvre Claude Opus 5 à ses ingénieurs, et garde le harnais

Google ouvre Claude Opus 5 à ses ingénieurs, et garde le harnais

Le 14 septembre 2026, Business Insider révèle que Google autorise tous ses ingénieurs à utiliser Claude Opus 5, sous quota et seulement dans Antigravity, sa plateforme agentique. Le modèle change de camp, le point de contrôle reste chez Google : où une DSI doit loger le sien.

Terminal-Bench et Coding Agent Index : pourquoi GPT-5.6 prend l'avantage sur les agents de coding en production

Terminal-Bench et Coding Agent Index : pourquoi GPT-5.6 prend l'avantage sur les agents de coding en production

En production, un agent de coding ne se juge pas à un score mais à sa capacité à terminer le travail : en un minimum d'étapes, d'appels d'outils et de tokens. Sur ce terrain, Terminal-Bench 2.1 et Coding Agent Index, GPT-5.6 prend l'avantage. Voici pourquoi, et où passe la limite.

Claude Sonnet 5 : le modèle le plus agentique d'Anthropic, et pourquoi il divise

Claude Sonnet 5 : le modèle le plus agentique d'Anthropic, et pourquoi il divise

Sorti le 30 juin 2026, Claude Sonnet 5 est le modèle le plus agentique d'Anthropic : bonds nets en codage et tool use face à Sonnet 4.6, mais un accueil très polarisé. Benchmarks, prix, retours d'usage, et notre lecture : un instrument spécialisé, pas universel.

L'ontologie n'est pas louable : le vrai fossé concurrentiel des agents IA

L'ontologie n'est pas louable : le vrai fossé concurrentiel des agents IA

Tony Seale vient de nommer l'évidence : la moitié qui manque aux agents IA n'est pas un framework supplémentaire, c'est l'ontologie de votre domaine. Pour la première fois, le fossé concurrentiel est clairement délimité — et il n'est pas technique.

Union Alpha : le modèle anonyme et gratuit qui sature OpenRouter

Union Alpha : le modèle anonyme et gratuit qui sature OpenRouter

Union Alpha est apparu sur OpenRouter le 16 septembre 2026 : multimodal, 262 144 tokens de contexte, gratuit, opéré par un prestataire anonyme qui peut conserver les prompts. État des lieux au 17 septembre, avec ce qui est vérifié, ce qui ne l'est pas, et ce qui aura changé dans une semaine.