ElevenLabsは、新しいスピーチツーテキストモデルを発表します
ElevenLabsは、最近1億8000万ドルの資金調達に成功したAIスタートアップで、オーディオ生成技術で知られています。しかし今回、彼らは大胆にも新しい領域に踏み出し、初の独立した音声認識モデル「Scribe」をリリースしました。
33億ドルの評価額を持つElevenLabsは、豊富なボイスコレクションのおかげで、テキスト読み上げサービスを必要とする多くの企業にとって頼りになる存在でした。今、彼らは音声認識に照準を合わせ、Gladia、Speechmatics、AssemblyAI、Deepgram、OpenAIのWhisperモデルといったビッグネームに挑戦しようとしています。
Scribeは本気です。初めから99以上の言語をサポートしています。ElevenLabsによると、25以上の言語で優れた精度を誇り、単語エラー率は5%未満です。具体的には、英語(97%の精度を主張)、フランス語、ドイツ語、ヒンディー語、インドネシア語、日本語、カンナダ語、マラヤーラム語、ポーランド語、ポルトガル語、スペイン語、ベトナム語などが含まれます。その他の言語は、精度のカテゴリーに分けられます:高(単語エラー率5%~10%)、良好(10%~20%)、中程度(25%~50%)。
同社は、ScribeがFLEURSおよびCommon Voiceのベンチマークテストによると、Google Gemini 2.0 FlashやWhisper Large V3を複数の言語で上回っていると主張しています。

画像提供:ElevenLabs ElevenLabsは昨年、AI対話エージェントプラットフォーム用に音声認識部分を構築しましたが、Scribeは独立した音声認識モデルとして初めての試みです。先月TechCrunchとの対談で、CEOのMati Staniszewskiは音声認識技術を強化する計画について明かしました。
「私たちは、会話であなたが何を言っているかをよりよく理解したいと考えています。もうコンテンツ生成だけではありません。音声の理解と書き起こしに進出しているのです」とStaniszewskiは述べました。「音声認識は古い技術だと思う人も多いですが、多くの言語ではまだかなり粗いものです。私たちは、社内にデータラベリングチームがあり、迅速なフィードバックを得られるので、もっと良いものができると考えています。」
Scribeには、話者を識別するスマートスピーカーダイアライゼーション、正確な字幕のための単語レベルのタイムスタンプ、観客の笑い声などの音声イベントの自動タグ付けといったクールな機能もあります。さらに、ElevenLabsは顧客がスタジオでビデオコンテンツを直接書き起こして字幕やキャプションを追加できるようにしています。
現時点では、Scribeは録音済みのオーディオにのみ対応しています。ただし、同社は低遅延のリアルタイムバージョンを近日中に開発中だとしています。そのため、会議の書き起こしやボイスメモの作成にはまだ準備ができていません。
ElevenLabsは、Scribeの書き起こしオーディオ1時間あたり0.40ドルの料金を設定しています。これは競争力のある価格ですが、一部のライバルはオーディオ書き起こしをより安価な料金で提供しており、いくつかの異なる機能も含まれています。
関連記事
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
関連特集おすすめ
コメント (29)
0/500
스타트업이 이렇게 빠르게 성장하는 걸 보면 놀랍네요 ㅎㅎ 음성 분야는 경쟁이 심한데, ElevenLabs가 STT 시장에서도 성공할 수 있을까요? 투자금 1억 8천만 달러로 뭔가 특별한 기술을 만들겠죠? 🤔
A ElevenLabs não para de inovar! Esse novo modelo de speech-to-text parece promissor, mas fico pensando... será que vai conseguir competir com gigantes como Google e OpenAI no mercado de transcrição? 🤔 Espero que ofereça algo único pra justificar o hype!
Scribe sounds like a game-changer! I'm curious if it'll handle my thick accent as well as it claims. Excited to try it for podcast transcriptions! 😎
Just saw ElevenLabs' Scribe model news—97% accuracy in English is wild! 😮 I'm curious how it'll handle my thick accent in meetings. Hope they drop that real-time version soon!
¡El Scribe de ElevenLabs es genial! Es increíble cómo han entrado en el mercado de voz a texto con un modelo tan sólido. Mi única queja es que a veces tiene problemas con acentos fuertes. Pero, para ser el primer intento, es bastante impresionante. ¡Sigan así, ElevenLabs! 🚀
ElevenLabsは、最近1億8000万ドルの資金調達に成功したAIスタートアップで、オーディオ生成技術で知られています。しかし今回、彼らは大胆にも新しい領域に踏み出し、初の独立した音声認識モデル「Scribe」をリリースしました。
33億ドルの評価額を持つElevenLabsは、豊富なボイスコレクションのおかげで、テキスト読み上げサービスを必要とする多くの企業にとって頼りになる存在でした。今、彼らは音声認識に照準を合わせ、Gladia、Speechmatics、AssemblyAI、Deepgram、OpenAIのWhisperモデルといったビッグネームに挑戦しようとしています。
Scribeは本気です。初めから99以上の言語をサポートしています。ElevenLabsによると、25以上の言語で優れた精度を誇り、単語エラー率は5%未満です。具体的には、英語(97%の精度を主張)、フランス語、ドイツ語、ヒンディー語、インドネシア語、日本語、カンナダ語、マラヤーラム語、ポーランド語、ポルトガル語、スペイン語、ベトナム語などが含まれます。その他の言語は、精度のカテゴリーに分けられます:高(単語エラー率5%~10%)、良好(10%~20%)、中程度(25%~50%)。
同社は、ScribeがFLEURSおよびCommon Voiceのベンチマークテストによると、Google Gemini 2.0 FlashやWhisper Large V3を複数の言語で上回っていると主張しています。

ElevenLabsは昨年、AI対話エージェントプラットフォーム用に音声認識部分を構築しましたが、Scribeは独立した音声認識モデルとして初めての試みです。先月TechCrunchとの対談で、CEOのMati Staniszewskiは音声認識技術を強化する計画について明かしました。
「私たちは、会話であなたが何を言っているかをよりよく理解したいと考えています。もうコンテンツ生成だけではありません。音声の理解と書き起こしに進出しているのです」とStaniszewskiは述べました。「音声認識は古い技術だと思う人も多いですが、多くの言語ではまだかなり粗いものです。私たちは、社内にデータラベリングチームがあり、迅速なフィードバックを得られるので、もっと良いものができると考えています。」
Scribeには、話者を識別するスマートスピーカーダイアライゼーション、正確な字幕のための単語レベルのタイムスタンプ、観客の笑い声などの音声イベントの自動タグ付けといったクールな機能もあります。さらに、ElevenLabsは顧客がスタジオでビデオコンテンツを直接書き起こして字幕やキャプションを追加できるようにしています。
現時点では、Scribeは録音済みのオーディオにのみ対応しています。ただし、同社は低遅延のリアルタイムバージョンを近日中に開発中だとしています。そのため、会議の書き起こしやボイスメモの作成にはまだ準備ができていません。
ElevenLabsは、Scribeの書き起こしオーディオ1時間あたり0.40ドルの料金を設定しています。これは競争力のある価格ですが、一部のライバルはオーディオ書き起こしをより安価な料金で提供しており、いくつかの異なる機能も含まれています。
AppleのスマートグラスはWWDC27でデビューする可能性があり、プライバシー保護を強調している
Bloombergのマーク・ガーマン氏によると、Appleのスマートグラス(コードネームN50)は2027年6月のWWDC27で初公開され、2027年秋に小売店での発売が予定されている。当初は今年後半から2027年初頭にかけての発売が目標だったが、製品のさらなる洗練とプライバシー保護プロトコルの強化を可能にするため、発売時期が延期された。プライバシーはAppleのスマートグラス戦略の中核的な柱である。Metaなどの競合他社をめぐるプライバシー論争から教訓を得て、Appleは堅牢な機能とポリシー
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた
報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明
外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
스타트업이 이렇게 빠르게 성장하는 걸 보면 놀랍네요 ㅎㅎ 음성 분야는 경쟁이 심한데, ElevenLabs가 STT 시장에서도 성공할 수 있을까요? 투자금 1억 8천만 달러로 뭔가 특별한 기술을 만들겠죠? 🤔
A ElevenLabs não para de inovar! Esse novo modelo de speech-to-text parece promissor, mas fico pensando... será que vai conseguir competir com gigantes como Google e OpenAI no mercado de transcrição? 🤔 Espero que ofereça algo único pra justificar o hype!
Scribe sounds like a game-changer! I'm curious if it'll handle my thick accent as well as it claims. Excited to try it for podcast transcriptions! 😎
Just saw ElevenLabs' Scribe model news—97% accuracy in English is wild! 😮 I'm curious how it'll handle my thick accent in meetings. Hope they drop that real-time version soon!
¡El Scribe de ElevenLabs es genial! Es increíble cómo han entrado en el mercado de voz a texto con un modelo tan sólido. Mi única queja es que a veces tiene problemas con acentos fuertes. Pero, para ser el primer intento, es bastante impresionante. ¡Sigan así, ElevenLabs! 🚀





家






