Hogar
Mistral AI publica Leanstral 1.5 como software de código abierto para reducir las barreras en la investigación matemática
Mistral AI ha lanzado recientemente un modelo de código abierto denominado Leanstral1.5, diseñado específicamente para el lenguaje de demostración matemática formal Lean4. Con licencia Apache-2.0, este modelo cuenta con un total de 119 mil millones de parámetros, de los cuales solo 6 mil millones están activados, lo que permite mantener un alto rendimiento al tiempo que se reducen significativamente los costes.
Como herramienta especializada en el razonamiento matemático, Leanstral1.5 ofrece resultados impresionantes. En el prestigioso banco de pruebas de matemáticas formales miniF2F, alcanzó una tasa de finalización del 100 % tanto en el conjunto de validación como en el de prueba. Al abordar los exigentes problemas del concurso PutnamBench, el modelo resolvió con éxito 587 de las 672 preguntas en Lean4. También destacó en la serie de pruebas de referencia FATE para álgebra abstracta, registrando una tasa de éxito del 87 % en la prueba FATE-H de nivel de máster y del 34 % en la prueba FATE-X de nivel de doctorado, lo que supone un nuevo récord para los modelos de este tipo.

La rentabilidad destaca como otra ventaja clave de esta versión. Mistral AI destaca que, en comparación con las alternativas existentes, Leanstral1.5 reduce drásticamente el coste del proceso científico de ensayo y error. Por ejemplo, resolver un problema de PutnamBench con Leanstral1.5 cuesta una media de tan solo 4 dólares, mientras que el modelo comparativo Seed-Prover1.5 cuesta más de 300 dólares, y Aleph Prover oscila entre 54 y 68 dólares. Se espera que esta drástica reducción de costes permita que la asistencia en demostraciones matemáticas de alta precisión salga del laboratorio y se generalice en el ámbito de la investigación.
En escenarios prácticos de desarrollo de código, Leanstral1.5 también demuestra una gran capacidad para detectar errores. Al someterlo a pruebas en 57 repositorios de código, identificó 47 infracciones, 11 de las cuales se confirmaron como defectos reales. Cabe destacar que cinco de esas vulnerabilidades nunca se habían notificado antes en GitHub, lo que subraya el potencial del modelo para ayudar en la verificación de programas y las auditorías de seguridad.
Con el lanzamiento de código abierto de Leanstral1.5, los campos de las matemáticas y la informática obtienen un acceso más sencillo a una potente herramienta de asistencia en la demostración. Al reducir tanto los costes computacionales como los financieros, este modelo está llamado a acelerar la adopción de demostraciones matemáticas formales, ayudando a los investigadores a ir más allá de los tediosos cálculos y la verificación para centrarse en avances científicos fundamentales.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Mistral AI ha lanzado recientemente un modelo de código abierto denominado Leanstral1.5, diseñado específicamente para el lenguaje de demostración matemática formal Lean4. Con licencia Apache-2.0, este modelo cuenta con un total de 119 mil millones de parámetros, de los cuales solo 6 mil millones están activados, lo que permite mantener un alto rendimiento al tiempo que se reducen significativamente los costes.
Como herramienta especializada en el razonamiento matemático, Leanstral1.5 ofrece resultados impresionantes. En el prestigioso banco de pruebas de matemáticas formales miniF2F, alcanzó una tasa de finalización del 100 % tanto en el conjunto de validación como en el de prueba. Al abordar los exigentes problemas del concurso PutnamBench, el modelo resolvió con éxito 587 de las 672 preguntas en Lean4. También destacó en la serie de pruebas de referencia FATE para álgebra abstracta, registrando una tasa de éxito del 87 % en la prueba FATE-H de nivel de máster y del 34 % en la prueba FATE-X de nivel de doctorado, lo que supone un nuevo récord para los modelos de este tipo.

La rentabilidad destaca como otra ventaja clave de esta versión. Mistral AI destaca que, en comparación con las alternativas existentes, Leanstral1.5 reduce drásticamente el coste del proceso científico de ensayo y error. Por ejemplo, resolver un problema de PutnamBench con Leanstral1.5 cuesta una media de tan solo 4 dólares, mientras que el modelo comparativo Seed-Prover1.5 cuesta más de 300 dólares, y Aleph Prover oscila entre 54 y 68 dólares. Se espera que esta drástica reducción de costes permita que la asistencia en demostraciones matemáticas de alta precisión salga del laboratorio y se generalice en el ámbito de la investigación.
En escenarios prácticos de desarrollo de código, Leanstral1.5 también demuestra una gran capacidad para detectar errores. Al someterlo a pruebas en 57 repositorios de código, identificó 47 infracciones, 11 de las cuales se confirmaron como defectos reales. Cabe destacar que cinco de esas vulnerabilidades nunca se habían notificado antes en GitHub, lo que subraya el potencial del modelo para ayudar en la verificación de programas y las auditorías de seguridad.
Con el lanzamiento de código abierto de Leanstral1.5, los campos de las matemáticas y la informática obtienen un acceso más sencillo a una potente herramienta de asistencia en la demostración. Al reducir tanto los costes computacionales como los financieros, este modelo está llamado a acelerar la adopción de demostraciones matemáticas formales, ayudando a los investigadores a ir más allá de los tediosos cálculos y la verificación para centrarse en avances científicos fundamentales.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











