← Toute la recherche
Recherche Par Dipole ML Public Relations Publié le Mis à jour le

Évaluer Raven Max : n°1 sur Terminal Bench 4.0 et Agent's Last Exam

L'évaluation technique complète de Raven Max : n°1 sur Terminal Bench 4.0 (42,8), Agent's Last Exam (39,5) et GDPVal-AA (1 771), avec l'effort de raisonnement maximal activé.

Raven Max est notre modèle de raisonnement phare, conçu pour l'ingénierie complexe, la planification à long horizon et les décisions où les erreurs coûtent cher. Voici son évaluation empirique complète face à la pointe actuelle : Fable 5, GPT-5.6 Sol, Gemini 3.8 Flash, Muse Spark 1.3 et Kimi K3. Toutes les évaluations sont menées avec l'effort de raisonnement maximal activé.

n°1 sur Terminal Bench 4.0

Terminal Bench 4.0 mesure l'ingénierie logicielle autonome dans un terminal réel. Raven Max obtient 42,8, premier au monde parmi les modèles comparés :

Raven Max
42.8
Fable 5
42.4
GPT-5.6 Sol
37.9
Muse Spark 1.3
33.3
Gemini 3.8 Flash
19.7

n°1 sur Agent's Last Exam

Sur Agent's Last Exam, un banc d'essai de raisonnement agentique à long horizon, Raven Max obtient 39,5, devançant le pair le plus proche, Fable 5, de près de 8 points. Kimi K3 se classe quatrième parmi les pairs à 27,6 :

Raven Max
39.5
Fable 5
31.6
GPT-5.6 Sol
29.8
Kimi K3
27.6
Gemini 3.8 Flash
24.7

Résultats marquants

Banc d'essaiRaven MaxMeilleur pairRésultat
Terminal Bench 4.042,8Fable 5 · 42,4n°1
Agent's Last Exam39,5Fable 5 · 31,6n°1, +7,9
GDPVal-AA1 771Fable 5 · 1 760n°1
DeepSWE v1.168,7GPT-5.6 Sol · 70,2compétitif

Pourquoi Max mène sur le travail multi-étapes

Le motif qui traverse ces bancs d'essai est la résolution de dépendances multi-étapes : Raven Max planifie sur de longues chaînes d'appels d'outils, garde un état intermédiaire cohérent et diffuse son raisonnement avant d'agir. Sur Terminal Bench et Agent's Last Exam, ce choix architectural se traduit par les marges les plus larges de la suite. Sur GDPVal-AA, qui mesure l'accomplissement de tâches économiques réelles, Raven Max mène à 1 771.

Évaluez-le vous-même

Les bancs d'essai sont un plancher, pas un plafond. Mesurez Raven Max sur vos propres tâches les plus difficiles dans le Playground, ou par l'API à 1,25 $ US / 1 M en entrée et 6,25 $ US / 1 M en sortie.

Toutes les évaluations sont menées avec l'effort de raisonnement maximal activé. La méthodologie complète et les autres bancs d'essai figurent sur la fiche du modèle Raven Max et sur la page des modèles.

Pour commencer

Essayez ce que nous venons de lancer.

Les vrais modèles, gratuitement dans votre navigateur, ou téléchargez DCode et mettez-les au travail.

Articles connexes