OpenAI在其API中推出了語音智慧功能

OpenAI在週四宣佈,其API現已新增多項語音智慧功能,這些功能旨在幫助開發者構建能夠進行對話、轉錄和翻譯的應用程式。
該公司新推出的GPT-Realtime-2是一款語音模型,它能夠生成逼真的聲音模擬效果,從而與使用者進行交流。不過,與前代產品GPT-Realtime-1.5不同,這一版本融入了GPT-5級別的推理能力,OpenAI表示,這種能力使該模型能夠處理更復雜的使用者請求。
此外,OpenAI還推出了GPT-Realtime-Translate功能,顧名思義,它能夠提供實時翻譯服務,在使用者對話過程中實時進行語言轉換。這一功能支援超過70種輸入語言和13種輸出語言。
最後,OpenAI還引入了GPT-Realtime-Whisper這一轉錄工具,它可以實時將語音轉換為文字,從而在對話進行的過程中捕捉文字內容。
該公司表示:“我們推出的這些模型共同將實時的音訊技術從簡單的問答模式提升到了真正能夠完成實際任務的語音互動層面——它們可以傾聽、推理、翻譯、轉錄,並在對話過程中採取相應行動。”
那麼,誰會從這些更新中受益呢?顯然,那些希望提升客戶服務能力的企業會是主要受益者。不過,OpenAI也指出,這些新功能還能應用於教育、媒體、活動以及創作者平臺等多個領域。
雖然從企業的角度來看,這些工具非常有用,但它們也存在被濫用的風險。OpenAI表示,他們已經設定了相應的防護機制,以防止這些新功能被用於傳送垃圾資訊、進行欺詐或其他形式的網路濫用行為。系統中嵌入了特定的檢測機制,一旦發現某些對話違反了他們的內容規範,就會立即停止相關操作。
所有這些新的語音模型都包含在OpenAI的Realtime API中。Translate和Whisper功能是按分鐘計費的,而GPT-Realtime-2則根據所消耗的令牌數量來收費。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (0)
0/500

OpenAI在週四宣佈,其API現已新增多項語音智慧功能,這些功能旨在幫助開發者構建能夠進行對話、轉錄和翻譯的應用程式。
該公司新推出的GPT-Realtime-2是一款語音模型,它能夠生成逼真的聲音模擬效果,從而與使用者進行交流。不過,與前代產品GPT-Realtime-1.5不同,這一版本融入了GPT-5級別的推理能力,OpenAI表示,這種能力使該模型能夠處理更復雜的使用者請求。
此外,OpenAI還推出了GPT-Realtime-Translate功能,顧名思義,它能夠提供實時翻譯服務,在使用者對話過程中實時進行語言轉換。這一功能支援超過70種輸入語言和13種輸出語言。
最後,OpenAI還引入了GPT-Realtime-Whisper這一轉錄工具,它可以實時將語音轉換為文字,從而在對話進行的過程中捕捉文字內容。
該公司表示:“我們推出的這些模型共同將實時的音訊技術從簡單的問答模式提升到了真正能夠完成實際任務的語音互動層面——它們可以傾聽、推理、翻譯、轉錄,並在對話過程中採取相應行動。”
那麼,誰會從這些更新中受益呢?顯然,那些希望提升客戶服務能力的企業會是主要受益者。不過,OpenAI也指出,這些新功能還能應用於教育、媒體、活動以及創作者平臺等多個領域。
雖然從企業的角度來看,這些工具非常有用,但它們也存在被濫用的風險。OpenAI表示,他們已經設定了相應的防護機制,以防止這些新功能被用於傳送垃圾資訊、進行欺詐或其他形式的網路濫用行為。系統中嵌入了特定的檢測機制,一旦發現某些對話違反了他們的內容規範,就會立即停止相關操作。
所有這些新的語音模型都包含在OpenAI的Realtime API中。Translate和Whisper功能是按分鐘計費的,而GPT-Realtime-2則根據所消耗的令牌數量來收費。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。





首頁






