微軟釋出 MAI-Transcribe-2,其迄今為止最精準的轉錄模型,支援 60 種語言,每小時僅需 0.67 元
微軟推出了 MAI-Transcribe-2,將其定位為業界速度最快、精度最高且最具成本效益的 AI 語音轉文字解決方案。該方案以每小時 0.10 美元(約合 0.67 人民幣)的促銷價格提供,此優惠有效期至 2026 年底。

無與倫比的精度與速度:比 GPT-Transcribe 快 10 倍
在 FLEURS 資料集的效能基準測試中,MAI-Transcribe-2 在強制語言模式和自動檢測模式下的平均詞錯誤率(WER)均為 5.2%。相比之下,Gemini 3.1 Pro 的得分分別為 5.3% 和 5.8%,GPT-Transcribe 分別為 10.4% 和 10.6%,而 Whisper v3-Large 則分別為 22.8% 和 23.5%。
關於處理速度,微軟引用了 Artificial Analysis 的資料,指出 MAI-Transcribe-2 的執行速度比 GPT-Transcribe 快 10 倍,比 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍。
高階功能:說話人分離、時間戳及支援 60 種語言
主要功能包括說話人分離,該功能可識別錄音中的不同聲音,並將文字分配給正確的說話人。詞級時間戳實現了精確的音訊導航、編輯和字幕同步。
使用者可以自定義轉錄風格:逐字模式保留填充詞和錯誤,以確保法律或分析準確性;而清理模式則去除這些內容,以便生成易讀的筆記和字幕。該模型還支援關鍵詞偏向、自動語言檢測、動態語言切換以及在嘈雜環境中的穩健效能。它覆蓋 60 種語言,能夠無縫處理多語言對話,無需預先指定語言設定。
開發者可以透過 Microsoft Foundry、MAI Playground 和 OpenRouter 訪問或測試該模型。
相關文章
美圖Hub 公佈 AI 影象生產線,定於 8 月 5 日正式上線
2026美圖影像節正式揭曉“AI影象生產線”MeituHub,標誌著美圖從單一場景AI工具提供商向全面定製化影象工作流服務提供商的轉型。作為本屆影像節的旗艦產品,MeituHub將於8月5日正式上線。此外,美圖在活動中還推出了七款針對特定垂直場景的專用產品:站酷、Picchi、美圖設計室、開麥、Artflo、MVLAND和RoboNeo。與這些專用工具不同,MeituHub旨在系統整合美圖的核心影象能力,圍繞不同的業務需求重構AI工作流。該平臺具備AI Agent機制,可與使用者協作定義需求,
騰訊加速AI佈局,推出規模翻倍的混元Hy4模型,摩根士丹利將目標價上調至550港元
騰訊正式公佈了混元Hy4的預覽版,將其釋出時間表提前至摩根士丹利9月預測之前,並兌現了公司在第二季度財報中承諾於年內釋出該模型的目標。自2025年第四季度任命姚純宇為首席AI科學家以來,騰訊顯著加快了模型迭代速度。繼4月釋出Hy3預覽版和7月正式推出Hy3之後,Hy4預覽版的提前到來表明,原定於第四季度釋出的正式版可能會比預期更早面世。在技術層面,混元Hy4預覽版採用了混合專家(MoE)架構,在規模擴充套件和長上下文處理能力方面實現了重大飛躍。該模型擁有7700億總引數量,是Hy3的2950億的2倍
皮爾森(Pearson)的戴夫·特里特(Dave Treat):人工智慧應引導學習,而非作弊
培生集團首席技術官戴夫·特里特談學術誠信、人工智慧的應用,以及在自主型人工智慧重塑教育之際至關重要的關鍵技能戴夫·特里特於近兩年前加入培生擔任首席技術官,其後轉任首席資訊官,從而統籌公司整體的技術佈局。這項職務變動標誌著他重返自己成長的領域。「這份工作中我最喜歡的部分,就是重返教育領域,」他說。「教育是我最初的職業道路。我家族中的其他人,或多或少都從事教職。如今,我知道自己也在透過學習幫助人們實現
相關專題推薦
評論 (0)
0/500
微軟推出了 MAI-Transcribe-2,將其定位為業界速度最快、精度最高且最具成本效益的 AI 語音轉文字解決方案。該方案以每小時 0.10 美元(約合 0.67 人民幣)的促銷價格提供,此優惠有效期至 2026 年底。

無與倫比的精度與速度:比 GPT-Transcribe 快 10 倍
在 FLEURS 資料集的效能基準測試中,MAI-Transcribe-2 在強制語言模式和自動檢測模式下的平均詞錯誤率(WER)均為 5.2%。相比之下,Gemini 3.1 Pro 的得分分別為 5.3% 和 5.8%,GPT-Transcribe 分別為 10.4% 和 10.6%,而 Whisper v3-Large 則分別為 22.8% 和 23.5%。
關於處理速度,微軟引用了 Artificial Analysis 的資料,指出 MAI-Transcribe-2 的執行速度比 GPT-Transcribe 快 10 倍,比 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍。
高階功能:說話人分離、時間戳及支援 60 種語言
主要功能包括說話人分離,該功能可識別錄音中的不同聲音,並將文字分配給正確的說話人。詞級時間戳實現了精確的音訊導航、編輯和字幕同步。
使用者可以自定義轉錄風格:逐字模式保留填充詞和錯誤,以確保法律或分析準確性;而清理模式則去除這些內容,以便生成易讀的筆記和字幕。該模型還支援關鍵詞偏向、自動語言檢測、動態語言切換以及在嘈雜環境中的穩健效能。它覆蓋 60 種語言,能夠無縫處理多語言對話,無需預先指定語言設定。
開發者可以透過 Microsoft Foundry、MAI Playground 和 OpenRouter 訪問或測試該模型。
美圖Hub 公佈 AI 影象生產線,定於 8 月 5 日正式上線
2026美圖影像節正式揭曉“AI影象生產線”MeituHub,標誌著美圖從單一場景AI工具提供商向全面定製化影象工作流服務提供商的轉型。作為本屆影像節的旗艦產品,MeituHub將於8月5日正式上線。此外,美圖在活動中還推出了七款針對特定垂直場景的專用產品:站酷、Picchi、美圖設計室、開麥、Artflo、MVLAND和RoboNeo。與這些專用工具不同,MeituHub旨在系統整合美圖的核心影象能力,圍繞不同的業務需求重構AI工作流。該平臺具備AI Agent機制,可與使用者協作定義需求,
騰訊加速AI佈局,推出規模翻倍的混元Hy4模型,摩根士丹利將目標價上調至550港元
騰訊正式公佈了混元Hy4的預覽版,將其釋出時間表提前至摩根士丹利9月預測之前,並兌現了公司在第二季度財報中承諾於年內釋出該模型的目標。自2025年第四季度任命姚純宇為首席AI科學家以來,騰訊顯著加快了模型迭代速度。繼4月釋出Hy3預覽版和7月正式推出Hy3之後,Hy4預覽版的提前到來表明,原定於第四季度釋出的正式版可能會比預期更早面世。在技術層面,混元Hy4預覽版採用了混合專家(MoE)架構,在規模擴充套件和長上下文處理能力方面實現了重大飛躍。該模型擁有7700億總引數量,是Hy3的2950億的2倍
皮爾森(Pearson)的戴夫·特里特(Dave Treat):人工智慧應引導學習,而非作弊
培生集團首席技術官戴夫·特里特談學術誠信、人工智慧的應用,以及在自主型人工智慧重塑教育之際至關重要的關鍵技能戴夫·特里特於近兩年前加入培生擔任首席技術官,其後轉任首席資訊官,從而統籌公司整體的技術佈局。這項職務變動標誌著他重返自己成長的領域。「這份工作中我最喜歡的部分,就是重返教育領域,」他說。「教育是我最初的職業道路。我家族中的其他人,或多或少都從事教職。如今,我知道自己也在透過學習幫助人們實現





首頁






