Évaluer Raven Max : n°1 sur Terminal Bench 4.0 et Agent's Last Exam
L'évaluation technique complète de Raven Max : n°1 sur Terminal Bench 4.0 (42,8), Agent's Last Exam (39,5) et GDPVal-AA (1 771), avec l'effort de raisonnement maximal activé.
Raven Max est notre modèle de raisonnement phare, conçu pour l'ingénierie complexe, la planification à long horizon et les décisions où les erreurs coûtent cher. Voici son évaluation empirique complète face à la pointe actuelle : Fable 5, GPT-5.6 Sol, Gemini 3.8 Flash, Muse Spark 1.3 et Kimi K3. Toutes les évaluations sont menées avec l'effort de raisonnement maximal activé.
n°1 sur Terminal Bench 4.0
Terminal Bench 4.0 mesure l'ingénierie logicielle autonome dans un terminal réel. Raven Max obtient 42,8, premier au monde parmi les modèles comparés :
n°1 sur Agent's Last Exam
Sur Agent's Last Exam, un banc d'essai de raisonnement agentique à long horizon, Raven Max obtient 39,5, devançant le pair le plus proche, Fable 5, de près de 8 points. Kimi K3 se classe quatrième parmi les pairs à 27,6 :
Résultats marquants
| Banc d'essai | Raven Max | Meilleur pair | Résultat |
|---|---|---|---|
| Terminal Bench 4.0 | 42,8 | Fable 5 · 42,4 | n°1 |
| Agent's Last Exam | 39,5 | Fable 5 · 31,6 | n°1, +7,9 |
| GDPVal-AA | 1 771 | Fable 5 · 1 760 | n°1 |
| DeepSWE v1.1 | 68,7 | GPT-5.6 Sol · 70,2 | compétitif |
Pourquoi Max mène sur le travail multi-étapes
Le motif qui traverse ces bancs d'essai est la résolution de dépendances multi-étapes : Raven Max planifie sur de longues chaînes d'appels d'outils, garde un état intermédiaire cohérent et diffuse son raisonnement avant d'agir. Sur Terminal Bench et Agent's Last Exam, ce choix architectural se traduit par les marges les plus larges de la suite. Sur GDPVal-AA, qui mesure l'accomplissement de tâches économiques réelles, Raven Max mène à 1 771.
Évaluez-le vous-même
Les bancs d'essai sont un plancher, pas un plafond. Mesurez Raven Max sur vos propres tâches les plus difficiles dans le Playground, ou par l'API à 1,25 $ US / 1 M en entrée et 6,25 $ US / 1 M en sortie.
Toutes les évaluations sont menées avec l'effort de raisonnement maximal activé. La méthodologie complète et les autres bancs d'essai figurent sur la fiche du modèle Raven Max et sur la page des modèles.
Pour commencer
Essayez ce que nous venons de lancer.
Les vrais modèles, gratuitement dans votre navigateur, ou téléchargez DCode et mettez-les au travail.
Articles connexes
Présentation de la cohorte des membres fondateurs : accélérer l'intelligence autonome
La cohorte de lancement limitée pour les membres fondateurs est ouverte : des prix annuels de première année verrouillés sur Pro, Ultra et DCode, plus un badge doré permanent.
Raisonnement inspectable et confidentialité sans rétention : au coeur du système Raven
Une plongée technique dans le système qui entoure la famille de modèles Raven : flux de raisonnement transparents, rétention de données nulle, chiffrement DEK côté client et défense contre l'injection de requête.
La passerelle API de Dipole ML : double compatibilité native pour les SDK OpenAI et Anthropic
L'API DipoleML sur api.dipoleml.com parle nativement les deux formats de SDK, OpenAI et Anthropic : migrer se résume à changer une ligne d'URL de base, sans réécrire de code.