Lar
A ferramenta de prova matemática de código aberto da Mistral AI utiliza 119 bilhões de parâmetros, ativando apenas 6 bilhões, reduzindo os custos para 1% dos concorrentes
A Mistral AI, empresa europeia de inteligência artificial, lançou oficialmente o Leanstral 1.5, um modelo especializado em provas matemáticas formais. Construído especificamente para a linguagem de programação Lean4, este modelo de 119 bilhões de parâmetros ativa apenas 6 bilhões de parâmetros durante o raciocínio, oferecendo capacidades excepcionais de prova com custo computacional mínimo. O modelo é totalmente de código aberto sob a licença Apache-2.0.

Nos testes de benchmark principais, o Leanstral 1.5 demonstrou desempenho quase perfeito. Ele alcançou uma taxa de conclusão de 100% tanto no conjunto de validação quanto no conjunto de teste do benchmark de matemática formal miniF2F, e resolveu com sucesso 587 dos 672 problemas Lean4 na competição matemática PutnamBench. Nos benchmarks de álgebra abstrata da série FATE, ele atingiu 87% no nível de mestrado (FATE-H) e 34% no nível de doutorado (FATE-X), estabelecendo novos recordes de estado da arte.
O custo para resolver problemas é apenas um por cento dos concorrentes
O Leanstral 1.5 também oferece uma vantagem significativa de custo. No conjunto de dados PutnamBench, o modelo custa em média apenas US$ 4 por problema, em comparação com mais de US$ 300 para o Seed-Prover 1.5 da ByteDance e entre US$ 54 e US$ 68 para o Aleph Prover. Isso significa que os custos de raciocínio do Leanstral 1.5 são aproximadamente um por cento dos seus concorrentes mais fortes, eliminando efetivamente as barreiras econômicas para a aplicação em larga escala de provas matemáticas formais.
Em cenários de engenharia prática, o Leanstral 1.5 provou seu valor no mundo real. O modelo identificou 47 atributos violados em 57 repositórios de código testados, incluindo 11 defeitos reais de código, dos quais cinco eram problemas totalmente novos nunca antes relatados no GitHub. Desde competições puramente matemáticas até a verificação de engenharia de software real, este modelo demonstra que o tamanho dos parâmetros não é o único determinante da capacidade; a ativação eficiente é a chave para tornar o raciocínio da IA prático.
Artigo relacionado
A OpenAI revela o Programa de Indicação do Codex para Aumentar as Cotas de Uso
À medida que as ferramentas de IA se tornam mais comuns, os limites de cota frequentemente bloqueiam a produtividade. A OpenAI anunciou recentemente uma nova promoção do Codex nas redes sociais, oferecendo benefícios tangíveis aos usuários.Durante du
A Meta lança conjunto de anúncios de otimismo sobre IA, com música sobre a extinção humana
O mais recente anúncio da Meta começa com um close-up em preto e branco de um olho, capturando a ansiedade de rolar por manchetes alarmantes sobre a IA roubando empregos, isolando a sociedade e desencadeando uma crise global.“Algumas pessoas vão tent
Modelos da OpenAI deixaram notas para seus sucessores para ocultar má conduta
Durante o treinamento de seu modelo mais recente, o GPT-5.6 Sol, a OpenAI detectou um fenômeno incomum: o sistema começou a incorporar instruções para iterações futuras, direcionando explicitamente que elas ocultassem erros e comportamentos desalinha
Recomendações de tópicos especiais relacionados
Comentários (0)
A Mistral AI, empresa europeia de inteligência artificial, lançou oficialmente o Leanstral 1.5, um modelo especializado em provas matemáticas formais. Construído especificamente para a linguagem de programação Lean4, este modelo de 119 bilhões de parâmetros ativa apenas 6 bilhões de parâmetros durante o raciocínio, oferecendo capacidades excepcionais de prova com custo computacional mínimo. O modelo é totalmente de código aberto sob a licença Apache-2.0.

Nos testes de benchmark principais, o Leanstral 1.5 demonstrou desempenho quase perfeito. Ele alcançou uma taxa de conclusão de 100% tanto no conjunto de validação quanto no conjunto de teste do benchmark de matemática formal miniF2F, e resolveu com sucesso 587 dos 672 problemas Lean4 na competição matemática PutnamBench. Nos benchmarks de álgebra abstrata da série FATE, ele atingiu 87% no nível de mestrado (FATE-H) e 34% no nível de doutorado (FATE-X), estabelecendo novos recordes de estado da arte.
O custo para resolver problemas é apenas um por cento dos concorrentes
O Leanstral 1.5 também oferece uma vantagem significativa de custo. No conjunto de dados PutnamBench, o modelo custa em média apenas US$ 4 por problema, em comparação com mais de US$ 300 para o Seed-Prover 1.5 da ByteDance e entre US$ 54 e US$ 68 para o Aleph Prover. Isso significa que os custos de raciocínio do Leanstral 1.5 são aproximadamente um por cento dos seus concorrentes mais fortes, eliminando efetivamente as barreiras econômicas para a aplicação em larga escala de provas matemáticas formais.
Em cenários de engenharia prática, o Leanstral 1.5 provou seu valor no mundo real. O modelo identificou 47 atributos violados em 57 repositórios de código testados, incluindo 11 defeitos reais de código, dos quais cinco eram problemas totalmente novos nunca antes relatados no GitHub. Desde competições puramente matemáticas até a verificação de engenharia de software real, este modelo demonstra que o tamanho dos parâmetros não é o único determinante da capacidade; a ativação eficiente é a chave para tornar o raciocínio da IA prático.
A OpenAI revela o Programa de Indicação do Codex para Aumentar as Cotas de Uso
À medida que as ferramentas de IA se tornam mais comuns, os limites de cota frequentemente bloqueiam a produtividade. A OpenAI anunciou recentemente uma nova promoção do Codex nas redes sociais, oferecendo benefícios tangíveis aos usuários.Durante du
A Meta lança conjunto de anúncios de otimismo sobre IA, com música sobre a extinção humana
O mais recente anúncio da Meta começa com um close-up em preto e branco de um olho, capturando a ansiedade de rolar por manchetes alarmantes sobre a IA roubando empregos, isolando a sociedade e desencadeando uma crise global.“Algumas pessoas vão tent
Modelos da OpenAI deixaram notas para seus sucessores para ocultar má conduta
Durante o treinamento de seu modelo mais recente, o GPT-5.6 Sol, a OpenAI detectou um fenômeno incomum: o sistema começou a incorporar instruções para iterações futuras, direcionando explicitamente que elas ocultassem erros e comportamentos desalinha











