Arrêtons de comparer les IA sans préciser l'effort de raisonnement

Quand j’entends que « le modèle X est meilleur que le modèle Y », la première question qui me vient à l’esprit est : avec quel effort de raisonnement ?

Imaginez qu’on vous dise : « Sur DeepSWE, GPT-5.6 Luna obtient 67 % et GPT-5.6 Sol, 61 %. » Vous concluez naturellement que Luna est meilleur.

Pourtant, le classement DeepSWE du 22 septembre 2026 précise le niveau d’effort : Luna tournait en Max, tandis que Sol était en Medium. C’est une information capitale, souvent oubliée lorsqu’on cite ces chiffres. Or, en Medium, Luna tombe à 11 %.

Même modèle, 56 points d’écart. Selon qu’on précise ou non le niveau d’effort, on peut tirer exactement la conclusion inverse.

Qu’est-ce que l’effort de raisonnement ?

L’effort de raisonnement est un réglage qui détermine le temps que le modèle « réfléchit » avant de répondre. En général, plus il est élevé, plus le modèle produit de tokens de réflexion, plus la réponse est lente et plus elle coûte cher.

La plupart des modèles de raisonnement récents proposent ce réglage, souvent sous forme de niveaux (low, medium, high, xhigh, max, etc.). En pratique, chaque niveau se comporte presque comme un modèle différent. Comparer deux modèles sans préciser le niveau, c’est ignorer une variable qui peut à elle seule changer le résultat.

L’effort change les résultats… dans les deux sens

Luna passe de 11 % à 67 % entre Medium et Max. L’effort peut donc transformer un modèle médiocre en leader d’un classement. On pourrait croire qu’il suffit de pousser le réglage au maximum pour obtenir le meilleur d’un modèle. Ce n’est pas toujours le cas.

Sur le benchmark FrontierCode 1.1 de Cognition, qui évalue si les modifications de code proposées par un agent seraient acceptées en production, Opus 5.5 obtient 54,6 % avec un effort medium. Il descend à 51,4 % en xhigh, puis remonte à 54,4 % en max. La courbe n’est pas monotone : au-delà de medium, réfléchir davantage n’apporte rien, et un niveau intermédiaire fait même moins bien. Il faut rester prudent, car une partie de ces écarts peut s’expliquer par la variance entre les exécutions. Mais une chose est claire : sur ce benchmark, payer davantage pour la réflexion ne rapporte pas plus de points.

Ce constat vaut aussi en pratique. Un modèle qui réfléchit trop peut remettre en question une bonne réponse, compliquer une solution simple ou se perdre dans des pistes inutiles.

L’effet de l’effort varie donc selon le modèle et la tâche. Il est donc important de toujours le préciser.

L’effort change toujours la facture

Pour un même modèle, plus d’effort coûte presque toujours plus cher : davantage de tokens générés, donc plus d’argent et plus de temps.

D’un modèle à l’autre, c’est moins simple. Voici Luna Max et Sol Medium sur DeepSWE :

ConfigurationScoreCoût moyen par tâcheTokens de sortie
GPT-5.6 Luna (Max)67 %0,61 $73k
GPT-5.6 Sol (Medium)61 %1,42 $18k

Luna Max obtient de meilleurs résultats que Sol Medium. Bien qu’il génère quatre fois plus de tokens, il coûte 2,3 fois moins cher par tâche, car le prix du token de Luna est extrêmement bas : 1,20 $ le million de tokens de sortie, contre 20 $ pour Sol.

Mais ces 73k tokens doivent tout de même être générés. Quatre fois plus de tokens se traduit généralement par un temps de réponse plus long.

Plus d’effort se paie toujours, en argent et en temps.

Un score sans effort est une comparaison sans raison

Reprenons Luna et Sol. Selon l’angle de comparaison, le gagnant change :

Angle de comparaisonGagnant
Sans préciser l’effortLuna (67 % contre 61 %)
À effort égal (Medium)Sol (61 % contre 11 %)
En tenant compte du coûtLuna Max (meilleur score, 2,3 fois moins cher)
En temps de réponseProbablement Sol (4 fois moins de tokens)

Aucune de ces comparaisons n’est pertinente sans connaître l’effort. Le bon choix dépend de ce que vous cherchez à optimiser : la qualité, le budget ou la vitesse.

Conclusion

Un nom de modèle sans niveau d’effort n’est pas une information complète. L’effort peut faire varier un score de plusieurs dizaines de points, sans qu’on puisse prévoir dans quel sens. Il modifie aussi toujours le coût.

Lorsque vous citez un score, indiquez le niveau d’effort à côté du modèle : « GPT-5.6 Luna (Max) : 67 % ». Si possible, ajoutez également le coût et le temps.

Lorsque vous lisez un score, posez-vous deux questions : avec quel effort, et à quel coût ?

La prochaine fois qu’on vous dira que « le modèle X est meilleur que le modèle Y », vous saurez quoi demander.


Vous aimez ce blog ?
Suivez-moi sur Twitter pour plus de contenu !

Rejoignez la newsletter pour du contenu de grande qualité dans votre boite mail

Pas de spam. Que du contenu de qualité.