Maison
Mistral AI met « Leanstral 1.5 » en open source afin de faciliter l'accès à la recherche mathématique
Mistral AI a récemment publié un modèle open source baptisé Leanstral1.5, spécialement conçu pour le langage de démonstration mathématique formelle Lean4. Disponible sous licence Apache-2.0, ce modèle compte au total 119 milliards de paramètres, dont seulement 6 milliards sont activés, ce qui permet de maintenir des performances élevées tout en réduisant considérablement les coûts.
En tant qu’outil spécialisé dans le raisonnement mathématique, Leanstral1.5 offre des résultats impressionnants. Lors du célèbre benchmark de mathématiques formelles miniF2F, il a atteint un taux de réussite de 100 % tant sur l’ensemble de validation que sur l’ensemble de test. Face aux problèmes complexes du concours PutnamBench, le modèle a résolu avec succès 587 des 672 questions en Lean4. Il s’est également illustré dans la série de benchmarks FATE consacrée à l’algèbre abstraite, affichant un taux de réussite de 87 % au test FATE-H de niveau master et de 34 % au test FATE-X de niveau doctorat — établissant ainsi un nouveau record pour les modèles de ce type.

La rentabilité constitue un autre avantage clé de cette version. Mistral AI souligne que, par rapport aux alternatives existantes, Leanstral1.5 réduit considérablement le coût des essais et erreurs scientifiques. Par exemple, résoudre un problème issu de PutnamBench avec Leanstral1.5 ne coûte en moyenne que 4 dollars, alors que le modèle comparatif Seed-Prover1.5 coûte plus de 300 dollars et qu’Aleph Prover coûte entre 54 et 68 dollars. Cette forte réduction des coûts devrait permettre à l’assistance à la démonstration mathématique de haute précision de sortir des laboratoires pour être utilisée à plus grande échelle dans la recherche.
Dans des scénarios concrets de développement de code, Leanstral1.5 fait également preuve d’une grande capacité à détecter les bogues. Testé sur 57 dépôts de code, il a identifié 47 violations, dont 11 ont été confirmées comme étant de véritables défauts. Il est à noter que cinq de ces vulnérabilités n’avaient jamais été signalées auparavant sur GitHub, ce qui souligne le potentiel du modèle pour faciliter la vérification des programmes et les audits de sécurité.
Avec la publication en open source de Leanstral1.5, les domaines des mathématiques et de l’informatique bénéficient d’un accès plus facile à un puissant outil d’aide à la démonstration. En réduisant à la fois les coûts de calcul et les coûts financiers, ce modèle est en passe d’accélérer l’adoption des démonstrations mathématiques formelles, aidant ainsi les chercheurs à dépasser les calculs et les vérifications fastidieux pour se concentrer sur des avancées scientifiques fondamentales.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Mistral AI a récemment publié un modèle open source baptisé Leanstral1.5, spécialement conçu pour le langage de démonstration mathématique formelle Lean4. Disponible sous licence Apache-2.0, ce modèle compte au total 119 milliards de paramètres, dont seulement 6 milliards sont activés, ce qui permet de maintenir des performances élevées tout en réduisant considérablement les coûts.
En tant qu’outil spécialisé dans le raisonnement mathématique, Leanstral1.5 offre des résultats impressionnants. Lors du célèbre benchmark de mathématiques formelles miniF2F, il a atteint un taux de réussite de 100 % tant sur l’ensemble de validation que sur l’ensemble de test. Face aux problèmes complexes du concours PutnamBench, le modèle a résolu avec succès 587 des 672 questions en Lean4. Il s’est également illustré dans la série de benchmarks FATE consacrée à l’algèbre abstraite, affichant un taux de réussite de 87 % au test FATE-H de niveau master et de 34 % au test FATE-X de niveau doctorat — établissant ainsi un nouveau record pour les modèles de ce type.

La rentabilité constitue un autre avantage clé de cette version. Mistral AI souligne que, par rapport aux alternatives existantes, Leanstral1.5 réduit considérablement le coût des essais et erreurs scientifiques. Par exemple, résoudre un problème issu de PutnamBench avec Leanstral1.5 ne coûte en moyenne que 4 dollars, alors que le modèle comparatif Seed-Prover1.5 coûte plus de 300 dollars et qu’Aleph Prover coûte entre 54 et 68 dollars. Cette forte réduction des coûts devrait permettre à l’assistance à la démonstration mathématique de haute précision de sortir des laboratoires pour être utilisée à plus grande échelle dans la recherche.
Dans des scénarios concrets de développement de code, Leanstral1.5 fait également preuve d’une grande capacité à détecter les bogues. Testé sur 57 dépôts de code, il a identifié 47 violations, dont 11 ont été confirmées comme étant de véritables défauts. Il est à noter que cinq de ces vulnérabilités n’avaient jamais été signalées auparavant sur GitHub, ce qui souligne le potentiel du modèle pour faciliter la vérification des programmes et les audits de sécurité.
Avec la publication en open source de Leanstral1.5, les domaines des mathématiques et de l’informatique bénéficient d’un accès plus facile à un puissant outil d’aide à la démonstration. En réduisant à la fois les coûts de calcul et les coûts financiers, ce modèle est en passe d’accélérer l’adoption des démonstrations mathématiques formelles, aidant ainsi les chercheurs à dépasser les calculs et les vérifications fastidieux pour se concentrer sur des avancées scientifiques fondamentales.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











