Lar
A Mistral AI torna o Leanstral 1.5 de código aberto para reduzir as barreiras na pesquisa matemática
A Mistral AI lançou recentemente um modelo de código aberto chamado Leanstral1.5, desenvolvido especificamente para a linguagem de prova formal matemática Lean4. Licenciado sob a licença Apache-2.0, esse modelo conta com 119 bilhões de parâmetros no total, dos quais apenas 6 bilhões estão ativados, mantendo o alto desempenho e reduzindo significativamente os custos.
Como ferramenta especializada para raciocínio matemático, o Leanstral1.5 apresenta resultados impressionantes. No respeitado benchmark de matemática formal miniF2F, ele alcançou uma taxa de conclusão de 100% tanto no conjunto de validação quanto no de teste. Ao enfrentar os desafiadores problemas da competição PutnamBench, o modelo resolveu com sucesso 587 das 672 questões em Lean4. Ele também se destacou na série de benchmarks FATE para álgebra abstrata, registrando uma taxa de sucesso de 87% no teste FATE-H de nível de mestrado e uma taxa de sucesso de 34% no teste FATE-X de nível de doutorado — estabelecendo um novo recorde para modelos desse tipo.

A eficiência de custo se destaca como outra vantagem fundamental desta versão. A Mistral AI destaca que, em comparação com as alternativas existentes, o Leanstral1.5 reduz drasticamente os custos do processo científico de tentativa e erro. Por exemplo, resolver uma questão do PutnamBench com o Leanstral1.5 custa, em média, apenas US$ 4, enquanto o modelo comparativo Seed-Prover1.5 custa mais de US$ 300, e o Aleph Prover varia de US$ 54 a US$ 68. Espera-se que essa redução acentuada no custo leve a assistência em provas matemáticas de alta precisão para fora do laboratório e para um uso mais amplo na pesquisa.
Em cenários práticos de desenvolvimento de código, o Leanstral1.5 também demonstra forte capacidade de detecção de bugs. Quando testado em 57 repositórios de código, ele identificou 47 violações, das quais 11 foram confirmadas como defeitos reais. Notavelmente, cinco dessas vulnerabilidades nunca haviam sido relatadas no GitHub antes, o que ressalta o potencial do modelo para auxiliar na verificação de programas e em auditorias de segurança.
Com o lançamento do Leanstral1.5 como código aberto, as áreas de matemática e ciência da computação ganham acesso mais fácil a uma poderosa ferramenta de assistência à demonstração. Ao reduzir tanto os custos computacionais quanto os financeiros, esse modelo está pronto para acelerar a adoção de demonstrações matemáticas formais, ajudando os pesquisadores a ir além de cálculos e verificações tediosas para se concentrarem em avanços científicos fundamentais.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
A Mistral AI lançou recentemente um modelo de código aberto chamado Leanstral1.5, desenvolvido especificamente para a linguagem de prova formal matemática Lean4. Licenciado sob a licença Apache-2.0, esse modelo conta com 119 bilhões de parâmetros no total, dos quais apenas 6 bilhões estão ativados, mantendo o alto desempenho e reduzindo significativamente os custos.
Como ferramenta especializada para raciocínio matemático, o Leanstral1.5 apresenta resultados impressionantes. No respeitado benchmark de matemática formal miniF2F, ele alcançou uma taxa de conclusão de 100% tanto no conjunto de validação quanto no de teste. Ao enfrentar os desafiadores problemas da competição PutnamBench, o modelo resolveu com sucesso 587 das 672 questões em Lean4. Ele também se destacou na série de benchmarks FATE para álgebra abstrata, registrando uma taxa de sucesso de 87% no teste FATE-H de nível de mestrado e uma taxa de sucesso de 34% no teste FATE-X de nível de doutorado — estabelecendo um novo recorde para modelos desse tipo.

A eficiência de custo se destaca como outra vantagem fundamental desta versão. A Mistral AI destaca que, em comparação com as alternativas existentes, o Leanstral1.5 reduz drasticamente os custos do processo científico de tentativa e erro. Por exemplo, resolver uma questão do PutnamBench com o Leanstral1.5 custa, em média, apenas US$ 4, enquanto o modelo comparativo Seed-Prover1.5 custa mais de US$ 300, e o Aleph Prover varia de US$ 54 a US$ 68. Espera-se que essa redução acentuada no custo leve a assistência em provas matemáticas de alta precisão para fora do laboratório e para um uso mais amplo na pesquisa.
Em cenários práticos de desenvolvimento de código, o Leanstral1.5 também demonstra forte capacidade de detecção de bugs. Quando testado em 57 repositórios de código, ele identificou 47 violações, das quais 11 foram confirmadas como defeitos reais. Notavelmente, cinco dessas vulnerabilidades nunca haviam sido relatadas no GitHub antes, o que ressalta o potencial do modelo para auxiliar na verificação de programas e em auditorias de segurança.
Com o lançamento do Leanstral1.5 como código aberto, as áreas de matemática e ciência da computação ganham acesso mais fácil a uma poderosa ferramenta de assistência à demonstração. Ao reduzir tanto os custos computacionais quanto os financeiros, esse modelo está pronto para acelerar a adoção de demonstrações matemáticas formais, ajudando os pesquisadores a ir além de cálculos e verificações tediosas para se concentrarem em avanços científicos fundamentais.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











