OpenAI在其API中推出了语音智能功能

OpenAI在周四宣布,其API现已新增多项语音智能功能,这些功能旨在帮助开发者构建能够进行对话、转录和翻译的应用程序。
该公司新推出的GPT-Realtime-2是一款语音模型,它能够生成逼真的声音模拟效果,从而与用户进行交流。不过,与前代产品GPT-Realtime-1.5不同,这一版本融入了GPT-5级别的推理能力,OpenAI表示,这种能力使该模型能够处理更复杂的用户请求。
此外,OpenAI还推出了GPT-Realtime-Translate功能,顾名思义,它能够提供实时翻译服务,在用户对话过程中实时进行语言转换。这一功能支持超过70种输入语言和13种输出语言。
最后,OpenAI还引入了GPT-Realtime-Whisper这一转录工具,它可以实时将语音转换为文本,从而在对话进行的过程中捕捉文字内容。
该公司表示:“我们推出的这些模型共同将实时的音频技术从简单的问答模式提升到了真正能够完成实际任务的语音交互层面——它们可以倾听、推理、翻译、转录,并在对话过程中采取相应行动。”
那么,谁会从这些更新中受益呢?显然,那些希望提升客户服务能力的企业会是主要受益者。不过,OpenAI也指出,这些新功能还能应用于教育、媒体、活动以及创作者平台等多个领域。
虽然从企业的角度来看,这些工具非常有用,但它们也存在被滥用的风险。OpenAI表示,他们已经设置了相应的防护机制,以防止这些新功能被用于发送垃圾信息、进行欺诈或其他形式的网络滥用行为。系统中嵌入了特定的检测机制,一旦发现某些对话违反了他们的内容规范,就会立即停止相关操作。
所有这些新的语音模型都包含在OpenAI的Realtime API中。Translate和Whisper功能是按分钟计费的,而GPT-Realtime-2则根据所消耗的令牌数量来收费。
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (0)
0/500

OpenAI在周四宣布,其API现已新增多项语音智能功能,这些功能旨在帮助开发者构建能够进行对话、转录和翻译的应用程序。
该公司新推出的GPT-Realtime-2是一款语音模型,它能够生成逼真的声音模拟效果,从而与用户进行交流。不过,与前代产品GPT-Realtime-1.5不同,这一版本融入了GPT-5级别的推理能力,OpenAI表示,这种能力使该模型能够处理更复杂的用户请求。
此外,OpenAI还推出了GPT-Realtime-Translate功能,顾名思义,它能够提供实时翻译服务,在用户对话过程中实时进行语言转换。这一功能支持超过70种输入语言和13种输出语言。
最后,OpenAI还引入了GPT-Realtime-Whisper这一转录工具,它可以实时将语音转换为文本,从而在对话进行的过程中捕捉文字内容。
该公司表示:“我们推出的这些模型共同将实时的音频技术从简单的问答模式提升到了真正能够完成实际任务的语音交互层面——它们可以倾听、推理、翻译、转录,并在对话过程中采取相应行动。”
那么,谁会从这些更新中受益呢?显然,那些希望提升客户服务能力的企业会是主要受益者。不过,OpenAI也指出,这些新功能还能应用于教育、媒体、活动以及创作者平台等多个领域。
虽然从企业的角度来看,这些工具非常有用,但它们也存在被滥用的风险。OpenAI表示,他们已经设置了相应的防护机制,以防止这些新功能被用于发送垃圾信息、进行欺诈或其他形式的网络滥用行为。系统中嵌入了特定的检测机制,一旦发现某些对话违反了他们的内容规范,就会立即停止相关操作。
所有这些新的语音模型都包含在OpenAI的Realtime API中。Translate和Whisper功能是按分钟计费的,而GPT-Realtime-2则根据所消耗的令牌数量来收费。
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。





首页






