iatrust
📊 Classement vérifié

Quel est le meilleur LLM pour les mathématiques en 2026 ?

Classement indépendant des LLM en résolution de problèmes mathématiques (release 2026) : arithmétique avancée, compétition, raisonnement quantitatif.

Les mathématiques sont le test le plus honnête d’un langage naturel « qui comprend » : une réponse est juste ou fausse, sans partialité possible. La catégorie Mathematics de notre benchmark indépendant regroupe des problèmes de compétition, d’arithmétique avancée et de raisonnement quantitatif — tous vérifiés automatiquement. Les scores élevés de cette catégorie ne signifient pas que les modèles « font des maths » comme un humain : ils signifient qu’ils tiennent une chaîne de calculs correcte jusqu’au bout, ce qui est déjà la compétence que vous attendez d’eux.

Le podium : les 3 meilleurs modèles en les mathématiques

🥇 1er

claude-fable-5-1-max-effort
Anthropic
97,0/100
$1.212/tâche réussie

Leader incontesté de la catégorie, Anthropic doit sa place à une régularité sur toutes les sous-tâches avec un sommet à AMPS Hard (99/100). Coût : $1.212/tâche réussie, dans la fourchette des leaders.

🥈 2e

gpt-6-astra-max
OpenAI
96,8/100
$0.736/tâche réussie

96,8 de OpenAI — à 0,2 points du leader, fort en integrals with game (100/100). Coût : $0.736/tâche réussie, dans la fourchette des leaders.

🥉 3e

gpt-5.6-sol-max
OpenAI
96,2/100
$0.507/tâche réussie

96,2 de OpenAI — à 0,8 points du leader, fort en integrals with game (100/100). Coût : $0.507/tâche réussie, dans la fourchette des leaders.

Classement Mathematics complet — top 15

# Modèle Org Score Coût/tâche
1 claude-fable-5-1-max-effort Anthropic 97,0 $1.212
2 gpt-6-astra-max OpenAI 96,8 $0.736
3 gpt-5.6-sol-max OpenAI 96,2 $0.507
4 claude-fable-5-max-effort Anthropic 96,0 $1.478
5 muse-spark-1.3-xhigh Other 96,0 $0.219
6 gpt-5.5-xhigh OpenAI 95,9 $0.436
7 claude-opus-5-max-effort Anthropic 95,7 $0.707
8 deepseek-v4-pro-0813open DeepSeek 95,1 $0.044
9 gpt-5.6-terra-max OpenAI 94,9 $0.344
10 claude-opus-4-8-max-effort Anthropic 94,3 $0.986
11 gpt-5.4-xhigh OpenAI 94,1 $0.387
12 gemini-3.7-flash-high Google 93,5 $0.157
13 deepseek-v4.1-flash-maxopen DeepSeek 93,3 $0.029
14 gpt-5.2-2025-12-11-high OpenAI 93,2 $0.234
15 claude-sonnet-5-xhigh-effort Anthropic 92,9 $0.513

Scores sur 100, release du 2026-06-25. Coût = dollars par tâche réussie (plus bas est mieux). 57 modèles classés dans cette catégorie. Voir le benchmark complet →

💚 Le choix qualité/prix : smaug-flash (Other)

À $0.014 la tâche réussie, smaug-flash atteint 90,1 de score — soit 93 % de la performance du leader pour 1 % de son prix.

Comment nous mesurons cette catégorie

Chaque problème a une réponse numérique ou symbolique exacte, corrigée automatiquement. Un modèle qui « hallucine » un intermédiaire de calcul obtient zéro, même si sa démarche était juste. Cette sévérité fait de Mathematics l’un des meilleurs détecteurs de fiabilité réelle : les écarts entre modèles y sont significatifs et stables d’une release à l’autre.

AMPS Hard
integrals with game
math comp
olympiad

Analyse financière, science, ingénierie, éducation : dès qu’un chiffre doit être juste, cette catégorie prime sur le score général. Bonne nouvelle pour les budgets : les modèles les moins chers du classement y sont souvent excellents — la matière se prête bien aux architectures spécialisées.

Comment lire ce classement

Ce classement porte sur 57 modèles évalués sur la même release, et l’écart entre le premier et le dernier atteint 23,3 points — de quoi séparer fortement les usages professionnels des usages occasionnels. La médiane de la catégorie s’établit à 89,3 : tout modèle sous ce seuil devra prouver qu’il compense par le prix ou la spécialisation. On note aussi une domination de OpenAI dans le haut du tableau (10 modèles dans le top 11), signe que cette compétence récompense des choix d’architecture précis plutôt qu’un simple agrandissement du modèle. Enfin, rappelez-vous qu’un score de catégorie n’est jamais une moyenne de tout : un modèle excellent ici peut rester moyen ailleurs — les six autres classements sont là pour ça.

Ce qui a bougé depuis la release précédente

Le leader actuel (claude-fable-5-1-max-effort, Anthropic) est une nouvelle entrée dans le classement : il n’était pas évalué sur la release 2026-01-08. C’est le signe d’une catégorie en pleine recomposition.

Notre recommandation

En résumé : pour la performance pure, claude-fable-5-1-max-effort (Anthropic) domine la catégorie avec 97,0/100 — soit 1,1 points de marge sur le 5ᵉ (muse-spark-1.3-xhigh), un écart qui se retrouve dans la qualité réelle des livrables sur les tâches longues. Pour un budget serré, deepseek-v4-pro-0813 ($0.044) est le meilleur score sous 0,10 $/tâche (95,1/100). Enfin, 16 modèles sur 57 sont en poids ouverts : si la confidentialité de vos données est un impératif, l’auto-hébergement est une voie réaliste dans cette catégorie. Comparez toujours deux axes — le score et le coût par tâche réussie — c’est là que se joue votre choix.

Questions fréquentes

Quel est le meilleur LLM pour les mathématiques en 2026 ?

Selon notre benchmark (release 2026-06-25), c’est claude-fable-5-1-max-effort (Anthropic) avec un score de 97,0/100, devant gpt-6-astra-max (96,8)..

Quelle option gratuite ou économique pour les mathématiques ?

À $0.014 la tâche réussie, smaug-flash (Other) reste à 90,1 de score — la meilleure performance par euro dépensé de la catégorie.

L’écart entre le premier et le dixième est-il sensible en pratique ?

Il est de 2,7 points entre claude-fable-5-1-max-effort (97,0) et le 10ᵉ claude-opus-4-8-max-effort (94,3). Sur une tâche isolée, la différence passe souvent inaperçue ; sur un volume de milliers d’appels ou des enchaînements longs, ces points deviennent des taux de réussite différents — et un budget différent.

Comment ce classement est-il produit ?

iatrust publie des scores de benchmark indépendants dont les questions sont renouvelées pour éviter la contamination des données d’entraînement, avec une correction automatique. Nous n’ajoutons aucun jugement subjectif dans les scores ; les verdicts sont calculés à partir des sous-tâches et des coûts mesurés. La page est régénérée automatiquement à chaque nouvelle release.

Comparez les 57 modèles sur 23 tâches

Classement complet, sous-tâches dépliables, coût par tâche, historique des releases.

Voir le benchmark →