ミストラルAI、数学研究の参入障壁を下げるため「Leanstral 1.5」をオープンソース化
Mistral AIは最近、数学的形式証明言語「Lean4」専用に構築された「Leanstral1.5」というオープンソースモデルを公開しました。Apache-2.0ライセンスの下で提供されるこのモデルは、パラメータ総数が119Bでありながら、アクティブ化されているのはわずか6Bに留まっており、高いパフォーマンスを維持しつつコストを大幅に削減しています。
数学的推論に特化したツールとして、Leanstral1.5は目覚ましい成果を上げています。 権威ある形式数学ベンチマーク「miniF2F」において、検証セットとテストセットの両方で100%の完了率を達成しました。また、難易度の高いPutnamBenchコンテストの問題に取り組んだ際、このモデルは672問のLean4問題のうち587問を正しく解きました。 また、抽象代数学のFATEベンチマークシリーズでも優れた成績を収め、修士レベルのFATE-Hテストで87%の成功率、博士レベルのFATE-Xテストで34%の成功率を記録し、この種のモデルとしては新記録を樹立しました。

コスト効率の良さも、今回のリリースのもう一つの大きな利点として際立っている。Mistral AIは、既存の代替手段と比較して、Leanstral1.5が科学的試行錯誤にかかるコストを劇的に削減することを強調している。 例えば、PutnamBenchの問題をLeanstral1.5で解く場合の平均コストはわずか4ドルであるのに対し、比較対象となるモデルであるSeed-Prover1.5は300ドル以上、Aleph Proverは54ドルから68ドルの範囲に及ぶ。 この大幅なコスト削減により、高精度な数学的証明支援が研究室の枠を超えて、より広範な研究用途に活用されることが期待されます。
実際のコード開発のシナリオにおいても、Leanstral1.5は強力なバグ検出能力を発揮しています。 57のコードリポジトリでテストを行った結果、47件の違反を特定し、そのうち11件が真の欠陥であることが確認されました。特に、これらの脆弱性のうち5件はGitHub上でこれまで報告されたことのないものであり、プログラムの検証やセキュリティ監査を支援するこのモデルの可能性を浮き彫りにしています。
Leanstral1.5のオープンソース化により、数学およびコンピュータサイエンスの分野は、強力な証明支援ツールに容易にアクセスできるようになります。計算コストと財政的コストの両方を削減することで、このモデルは形式的な数学的証明の普及を加速させ、研究者が煩雑な計算や検証作業から解放され、根本的な科学的ブレークスルーに注力できるよう支援するものと期待されています。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
Mistral AIは最近、数学的形式証明言語「Lean4」専用に構築された「Leanstral1.5」というオープンソースモデルを公開しました。Apache-2.0ライセンスの下で提供されるこのモデルは、パラメータ総数が119Bでありながら、アクティブ化されているのはわずか6Bに留まっており、高いパフォーマンスを維持しつつコストを大幅に削減しています。
数学的推論に特化したツールとして、Leanstral1.5は目覚ましい成果を上げています。 権威ある形式数学ベンチマーク「miniF2F」において、検証セットとテストセットの両方で100%の完了率を達成しました。また、難易度の高いPutnamBenchコンテストの問題に取り組んだ際、このモデルは672問のLean4問題のうち587問を正しく解きました。 また、抽象代数学のFATEベンチマークシリーズでも優れた成績を収め、修士レベルのFATE-Hテストで87%の成功率、博士レベルのFATE-Xテストで34%の成功率を記録し、この種のモデルとしては新記録を樹立しました。

コスト効率の良さも、今回のリリースのもう一つの大きな利点として際立っている。Mistral AIは、既存の代替手段と比較して、Leanstral1.5が科学的試行錯誤にかかるコストを劇的に削減することを強調している。 例えば、PutnamBenchの問題をLeanstral1.5で解く場合の平均コストはわずか4ドルであるのに対し、比較対象となるモデルであるSeed-Prover1.5は300ドル以上、Aleph Proverは54ドルから68ドルの範囲に及ぶ。 この大幅なコスト削減により、高精度な数学的証明支援が研究室の枠を超えて、より広範な研究用途に活用されることが期待されます。
実際のコード開発のシナリオにおいても、Leanstral1.5は強力なバグ検出能力を発揮しています。 57のコードリポジトリでテストを行った結果、47件の違反を特定し、そのうち11件が真の欠陥であることが確認されました。特に、これらの脆弱性のうち5件はGitHub上でこれまで報告されたことのないものであり、プログラムの検証やセキュリティ監査を支援するこのモデルの可能性を浮き彫りにしています。
Leanstral1.5のオープンソース化により、数学およびコンピュータサイエンスの分野は、強力な証明支援ツールに容易にアクセスできるようになります。計算コストと財政的コストの両方を削減することで、このモデルは形式的な数学的証明の普及を加速させ、研究者が煩雑な計算や検証作業から解放され、根本的な科学的ブレークスルーに注力できるよう支援するものと期待されています。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






