OpenAIは7月29日、2つの新しい文字起こしモデルを公開しました。リアルタイムかつ低遅延での利用を目的とした「GPT-Live-Transcribe」(1分あたり0.017ドル)と、非同期のバッチ処理向けの「GPT-Transcribe」(1分あたり0.0045ドル)です。 どちらのモデルも、アクセント、専門用語、数字、背景ノイズを含む文脈を理解します。「Context Aware ASR」ベンチマークにおいて、GPT-Transcribeは文脈情報を活用することで、意味的精度を41.6%から45.2%へと向上させました。 Whisperと比較すると、GPT-TranscribeはCommon Voiceデータセットにおいて誤り率を40.37%から19.27%に、実世界の録音データセットにおいては15.21%から8.98%に低減しました。