TechOn a lu la doc

Classement des agents IA : pourquoi le premier n'est pas forcément ton cheval

Le classement Agent Arena de septembre a déclenché les pronostics. Petite visite des coulisses de l'hippodrome, pour comprendre ce qu'on mesure vraiment.

Et ils sont partis ! Mi-septembre, le classement Agent Arena tombe, et c'est le grand frisson des tribunes. Claude Fable 5.1 prend la tête à la corde, GPT-6 Astra colle au train, et l'écurie Anthropic place six chevaux dans les dix premiers. Les captures d'écran circulent plus vite que les résultats du tiercé, et la conclusion générale tient en une ligne : « bon ben, on joue le premier ».

Pose ton ticket deux secondes. Avant de parier ta roadmap, on va faire un tour dans les écuries.

Ce qu'on fait courir, exactement

Un benchmark classique, c'est une épreuve de saut : une question, une réponse, une note. Un benchmark d'agents, c'est un steeple-chase. Le modèle reçoit un objectif, une caisse à outils, et il enchaîne les obstacles jusqu'à franchir la ligne… ou finir dans la haie. On ne note plus une réponse, on note une course entière.

Et un steeple, ça change tout :

  • Les chutes sont imprévisibles. Une trajectoire de vingt étapes peut foirer de vingt façons différentes. Fais courir deux fois le même cheval sur le même parcours : tu n'auras pas forcément le même temps.
  • Le jockey compte autant que le cheval. Le même modèle, avec des outils mieux décrits, change de catégorie. En réalité, on mesure un duo modèle + harnais, rarement le modèle seul.
  • Le commissaire de course est souvent… un autre modèle. Oui, c'est l'IA qui vérifie la photo-finish de l'IA. Rien de scandaleux, mais c'est un maillon fragile.

La photo-finish qui ne dit rien

Quand le trio de tête se tient en quelques points, la vraie question n'est pas « qui a gagné ? » mais « quelle est la marge d'erreur ? ». Si personne ne la publie, l'ordre entre les trois premiers, c'est une photo-finish floue qu'on encadre quand même au-dessus de la cheminée.

Ce qui reste passionnant, par contre, c'est de regarder quelles écuries squattent le haut du tableau. Ça raconte l'état du marché. Pas ce que toi, tu devrais choisir.

Mon entraînement maison (pas glamour, mais imbattable)

  1. Prends dix tâches réelles de ton produit. Pas des obstacles de concours, les tiens.
  2. Écris le critère de réussite de chacune, à la main, avant de lancer quoi que ce soit. Sinon, tu vas trouver des excuses à ton favori.
  3. Fais courir deux ou trois candidats, cinq fois chacun, et compte.
  4. Regarde le coût et la latence en même temps que le taux de réussite. Un cheval qui gagne en mangeant tout le foin de l'écurie n'est pas une bonne affaire.

Deux jours de boulot. Bien moins sexy qu'un classement partagé sur les réseaux. Mais c'est la seule course dont le résultat te concerne vraiment.

✍️ À toi : si tu as déjà comparé des modèles sur un vrai projet, c'est l'endroit parfait pour raconter ce que ça a donné (et ce qui t'a surpris).

Le vrai résultat de la course

Il n'est pas sur le tableau d'affichage. Il est dans les tribunes : pour qu'un classement d'agents fasse autant parler, c'est que les agents ont quitté le salon des démos pour entrer dans le catalogue des briques qu'on achète.

Le cheval gagnant, au fond, c'est la catégorie entière. Pour le reste, garde ton ticket en poche et fais tes propres essais.