MiniMax M2.5 : benchmarks de code, tarification et guide
MiniMax M2.5 atteint 80,2 % sur SWE-Bench Verified pour environ un dixième du coût des concurrents. Benchmarks, prix Lightning/Standard, Forge RL et comparatif avec Opus 4.6, GPT-5.2 et Gemini 3 Pro.
· iatrust
- 80,2 % — SWE-Bench Verified
- 1/10 — coût approximatif face aux concurrents frontaux
- 37 % — plus rapide que M2.1
- 200 000+ — environnements d’entraînement
Points clés
- 80,2 % SWE-Bench Verified : niveau frontal en coding, avec 51,3 % Multi-SWE-Bench et 55,4 % SWE-Bench Pro
- Environ 1/10 du prix : 0,30 $ / M en entrée et 2,40 $ / M en sortie pour Lightning — près de 1 $ par heure à 100 tokens/s
- 37 % plus rapide que M2.1 : débit Lightning à 100 tokens/s, au niveau d’Opus 4.6 sur les bancs standards
- IA agentique full-stack : code, recherche web, appels d’outils, et bureau (Word, PowerPoint, Excel)
- Cadre Forge RL : apprentissage par renforcement natif agent, algorithme CISPO, accélération ×40 sur plus de 200 000 environnements
M2.5 existe en deux variantes : standard à 50 tokens par seconde, et Lightning à 100 tokens par seconde. Les deux sont entraînées avec Forge, qui déploie l’apprentissage sur des dépôts de code, navigateurs et applications de bureau. Ce guide détaille les scores, la tarification, l’architecture et la comparaison avec Claude Opus 4.6, GPT-5.2 et Gemini 3 Pro.
Qu’est-ce que MiniMax M2.5 ?
M2.5 est un modèle frontal conçu pour les flux agentiques : utiliser des outils, écrire du code, chercher sur le web et enchaîner des processus multi-étapes de façon autonome. MiniMax le présente comme un « employé numérique » capable de travail prolongé, plutôt qu’un modèle optimisé uniquement pour le chat ou la génération en un tour.
M2.5-Lightning — variante vitesse
- 100 tokens par seconde en sortie
- 0,30 $ / M tokens en entrée, 2,40 $ / M en sortie
- Coût opérationnel d’environ 1 $ / heure
- Pensée pour les workflows à fort débit
M2.5 Standard — variante coût
- 50 tokens par seconde en sortie
- 0,15 $ / M tokens en entrée, 1,20 $ / M en sortie
- Coût opérationnel d’environ 0,30 $ / heure
- Mêmes scores de benchmark que Lightning
Les deux variantes proposent un « mode architecte » où M2.5 planifie, découpe les tâches complexes et délègue l’exécution. Ce mode convient aux refactors multi-fichiers et aux projets où les appels d’outils doivent s’enchaîner dans un ordre précis.
MiniMax, société basée à Pékin, avait publié M2.1 en janvier 2026. M2.5 marque un saut de génération : 80,2 % contre 74 % sur SWE-Bench, +37 % en vitesse d’inférence, et des capacités étendues en recherche, appels d’outils et bureautique.
Performances en coding
Le chiffre phare reste 80,2 % sur SWE-Bench Verified, un banc d’essai qui confronte les modèles à de vrais pull requests GitHub — corrections de bugs et ajouts de fonctionnalités dans des bases de production. M2.5 se situe à 0,6 point d’Opus 4.6 (80,8 %), devant GPT-5.2 (80 %) et Gemini 3 Pro (78 %).
SWE-Bench Verified — 80,2 %
Résolution d’issues GitHub réelles sur des dépôts de production. Évalué avec les harnais agentiques Droid et OpenCode pour l’usage d’outils.
Multi-SWE-Bench — 51,3 %
Tâches multi-dépôts exigeant une compréhension transversale. Devant Opus 4.6 (50,3 %) et Gemini 3 Pro (42,7 %).
SWE-Bench Pro — 55,4 %
Sous-ensemble plus dur, où décisions d’architecture et implémentation se mêlent.
Harnais agentiques
Les évaluations coding de M2.5 passent par Droid et OpenCode : accès au terminal, édition de fichiers, navigation dans le dépôt. Cela colle à l’usage réel, où le modèle agit via des outils plutôt que de produire des extraits isolés.
Le modèle couvre Python, JavaScript, TypeScript, Java, C++, Go et Rust. Les dépôts SWE-Bench traversent plusieurs langages et frameworks ; la régularité des scores suggère une compréhension solide d’un langage à l’autre.
Recherche web et appels d’outils
Au-delà du code, M2.5 affiche des résultats compétitifs sur la recherche web et les appels d’outils — indispensables dès qu’un agent doit collecter de l’information et dialoguer avec des systèmes externes.
Recherche
- BrowseComp (avec contexte) : 76,3 % — navigation multi-pages complexe
- Wide Search : 70,3 % — retrieval large sur des domaines variés
Appels d’outils
- BFCL multi-tour : 76,8 % — nettement devant Opus 4.6 (63,3 %) et Gemini 3 Pro (61 %)
- Environ 20 % de tours en moins pour achever des tâches multi-étapes
Le score BFCL (Berkeley Function Calling Leaderboard) à 76,8 % dépasse Opus 4.6 de plus de 13 points en multi-tour. L’entraînement RL sur des environnements d’outils réels se traduit par une orchestration de fonctions plus efficace. Moins de tours, c’est aussi moins de latence et de coût en production.
Capacités bureautiques
M2.5 s’aventure aussi sur la productivité bureau — un terrain que peu de modèles frontaux ciblent explicitement. MiniMax l’a entraîné à manipuler documents, tableurs et présentations.
GDPval-MM — 59 %
Traitement et compréhension de documents multi-modalités.
MEWC — 74,4 %
Achèvement de tâches multi-environnements couvrant plusieurs applications de bureau.
Tâches prises en charge
- Word : création, édition, mise en forme, restructuration, tableaux complexes et styles
- PowerPoint : decks à partir de spécifications, graphiques, mises en page, édition de présentations existantes
- Excel : formules, analyse de données, tableaux croisés dynamiques, modélisation financière
- Modélisation financière : projections budgétaires, scénarios, rapports à partir de données brutes
Efficacité et vitesse
M2.5 gagne 37 % en vitesse par rapport à M2.1 tout en élargissant le périmètre. Lightning tourne à 100 tokens/s — au niveau d’Opus 4.6 — pour une fraction du prix.
Vitesse
- 37 % plus rapide que M2.1
- Lightning : 100 TPS en sortie
- Standard : 50 TPS en sortie
- Débit comparable à Opus 4.6
Efficacité de tâche
- 3,52 M tokens en moyenne par tâche SWE-Bench
- 20 % de tours d’outils en moins
- Optimisé pour le travail agentique prolongé
- Mode architecte pour l’orchestration complexe
Le volume moyen de 3,52 millions de tokens par tâche SWE-Bench pèse sur le budget. Au tarif Lightning (2,40 $ / M en sortie), une tâche coding complexe coûte environ 8,45 $ en tokens de sortie. Sur Opus 4.6, à ~75 $ / M, le même ordre de magnitude tourne autour de 264 $ — un écart d’environ 30× pour des scores proches.
Tarification et analyse de coûts
MiniMax positionne M2.5 comme une rupture tarifaire. Les deux variantes sont 10 à 20 fois moins chères que les modèles frontaux comparables, ce qui rend l’usage agentique soutenu économiquement tenable là où les alternatives deviennent prohibitives.
| Modèle | Entrée ($/M) | Sortie ($/M) | Vitesse (TPS) | Coût horaire |
|---|---|---|---|---|
| M2.5-Lightning | 0,30 $ | 2,40 $ | 100 | ~1,00 $ |
| M2.5 Standard | 0,15 $ | 1,20 $ | 50 | ~0,30 $ |
À 100 TPS, Lightning génère 360 000 tokens de sortie par heure. À 2,40 $ / M, cela représente environ 0,86 $ en sortie, plus l’entrée — soit près de 1 $ par heure de génération continue. Un agent en 24/7 devient ainsi financièrement envisageable.
Comment M2.5 se compare
Le tableau ci-dessous place M2.5 face aux trois autres modèles frontaux les plus utilisés pour le code et les agents. Chiffres issus des rapports officiels à février 2026.
| Benchmark | M2.5 | Opus 4.6 | GPT-5.2 | Gemini 3 Pro |
|---|---|---|---|---|
| SWE-Bench Verified | 80,2 % | 80,8 % | 80 % | 78 % |
| Multi-SWE-Bench | 51,3 % | 50,3 % | — | 42,7 % |
| BrowseComp (avec ctx) | 76,3 % | 84 % | 65,8 % | 59,2 % |
| BFCL Multi-Turn | 76,8 % | 63,3 % | — | 61 % |
| Prix sortie ($/M) | 2,40 $ | ~75 $ | ~60 $ | ~20 $ |
Données à février 2026. Les benchmarks évoluent vite : vérifier les spécifications avant un choix de production. Les tirets indiquent des scores non publiés par le fournisseur.
Plongée technique : mise à l’échelle RL
Les performances de M2.5 s’expliquent en grande partie par Forge, le cadre d’apprentissage par renforcement de MiniMax — un système conçu pour entraîner des agents dans des environnements réels variés. L’approche diverge du RLHF (apprentissage par renforcement à partir de retours humains) dominant chez la plupart des concurrents.
Le cadre Forge
Forge est une infrastructure RL « native agent ». Au lieu de s’entraîner sur des jeux de données statiques ou des préférences humaines, le modèle est déployé dans des environnements vivants — dépôts de code, navigateurs, applications de bureau, API — et optimisé selon la réussite des tâches.
- Plus de 200 000 environnements d’entraînement : bases de code, sites web, flux documentaires et API d’outils
- Accélération ×40 : l’architecture distribuée parallélise les interactions et accélère l’entraînement d’un facteur 40 par rapport aux approches RL classiques
- Récompenses basées sur le résultat : le modèle est récompensé pour achever correctement la tâche, pas pour coller à des préférences labellisées
L’algorithme CISPO
CISPO (Clipped Importance Sampling Policy Optimization) est l’algorithme RL maison de MiniMax, pensé pour l’entraînement agentique. Il prolonge l’optimisation de politique classique avec des ajustements pour la décision multi-étapes :
- Importance sampling sur de longues trajectoires — pour gérer l’attribution de crédit sur des tâches à plusieurs tours
- Mises à jour bornées (clipped) pour éviter les bascules de politique catastrophiques
- Façonnage de récompense spécifique à chaque domaine (code, recherche, bureautique)
Là où beaucoup de modèles frontaux s’alignent surtout via le RLHF, Forge entraîne M2.5 à terminer des tâches dans des environnements réels. Cette distinction éclaire les scores élevés sur BFCL et SWE-Bench, où le modèle doit utiliser des outils et naviguer des workflows multi-étapes.
La plateforme MiniMax Agent
M2.5 alimente la plateforme Agent de MiniMax — une offre grand public et entreprise qui emballe les capacités du modèle dans des workflows prêts à l’emploi, au-delà du simple accès API.
- Compétences bureau : flux préconstruits pour documents, tableurs, présentations et tâches cross-applications, pilotés en langage naturel
- Plus de 10 000 Experts : configurations métiers (finance, juridique, santé, ingénierie) combinant M2.5, prompting spécialisé et accès outils
- Construit par M2.5 : MiniMax indique que 80 % du code de la plateforme Agent a été écrit par M2.5 lui-même — démonstration concrète à l’échelle production
En combinant le modèle et des outils intégrés, MiniMax sort de la catégorie « fournisseur d’API seul » et se place face aux assistants entreprise (Copilot, Gemini) et aux startups d’agents de code.
Démarrer avec MiniMax M2.5
M2.5 est accessible via l’API MiniMax et la plateforme Agent. L’API propose des endpoints compatibles OpenAI, ce qui simplifie l’intégration pour les équipes déjà équipées de SDK LLM standards.
1. Accès API
L’inscription sur l’API MiniMax fournit les identifiants. L’API couvre chat completions, appels d’outils et streaming, au format compatible OpenAI SDK. M2.5 et M2.5-Lightning sont exposés comme endpoints distincts.
2. Choisir sa variante
- M2.5-Lightning : applications temps réel, assistants de code interactifs, workflows sensibles à la latence
- M2.5 Standard : traitements par lots, agents en arrière-plan, volumes élevés sensibles au coût
3. Plateforme Agent
Pour les non-développeurs ou les équipes qui veulent des workflows prêts à l’emploi, la plateforme Agent MiniMax propose compétences bureau, experts métiers et interface conversationnelle.
En conclusion
MiniMax M2.5 livre un niveau de coding frontal pour une fraction du prix des concurrents. Les 80,2 % sur SWE-Bench Verified le placent aux côtés de Claude Opus 4.6 et GPT-5.2, tandis que les 2,40 $ / M en sortie (Lightning) rendent l’opération agentique soutenue viable — là où 60 à 75 $ / M freinent l’usage intensif.
Forge et CISPO marquent une différenciation technique réelle : entraîner des agents sur plus de 200 000 environnements réels, plutôt que de s’appuyer uniquement sur le retour humain, se traduit par de meilleurs appels d’outils (76,8 % contre 63,3 % sur BFCL) et des tâches multi-étapes plus efficaces.
Pour les équipes qui évaluent des modèles de coding, M2.5 mérite un essai sérieux. La parité de benchmark avec des modèles dix à trente fois plus chers en fait un candidat évident pour les déploiements sensibles au coût, tandis que la recherche et la bureautique élargissent le profil au-delà d’un outil « code only ».



