오픈AI, 자사 API를 통해 음성 인텔리전스 기능을 공개하다

오픈AI는 목요일에 자사의 API에 새로운 음성 인텔리전스 기능들이 추가되었다고 발표했습니다. 이러한 기능들은 개발자들이 대화를 할 수 있고, 텍스트를 전사하며, 번역할 수 있는 앱을 구축하는 데 도움을 주도록 설계되었습니다.
회사의 새로운 GPT-Realtime-2는 사용자와 대화를 나눌 수 있는 현실적인 음성 시뮬레이션을 제공하는 또 다른 음성 모델입니다. 하지만 이전 버전(GPT-Realtime-1.5)과 달리, 이번 버전에는 GPT-5 수준의 추론 기능이 탑재되어 있어, 오픈AI에 따르면 더 복잡한 사용자 요청을 처리할 수 있게 되었습니다.
또한 오픈AI는 GPT-Realtime-Translate도 출시했는데, 이름에서 알 수 있듯이 이 기능은 대화가 진행되는 동안 실시간으로 번역 서비스를 제공합니다. 이 기능은 70개 이상의 입력 언어와 13개의 출력 언어를 지원합니다.
마지막으로, 오픈AI는 GPT-Realtime-Whisper라는 새로운 텍스트 전사 기능도 도입했습니다. 이 기능은 대화가 진행되는 동안 실시간으로 음성을 텍스트로 변환해 줍니다.
회사는 “우리가 출시하는 이러한 모델들을 통해 실시간 오디오 기술이 단순한 호출 및 응답 방식에서 벗어나, 실제로 작업을 수행할 수 있는 음성 인터페이스로 발전하게 될 것”이라고 말했습니다.
이러한 업데이트로 누가 혜택을 받을까요? 고객 서비스 기능을 확장하고자 하는 기업들이 분명한 대상입니다. 하지만 오픈AI는 새로운 기능들이 교육, 미디어, 이벤트, 크리에이터 플랫폼 등 다양한 분야에서도 활용될 수 있을 것이라고 밝혔습니다.
이러한 도구들이 기업 입장에서 매우 유용할 수는 있지만, 잘못 사용될 가능성도 있습니다. 오픈AI는 새로운 기능들이 스팸, 사기 또는 기타 온라인 악용 행위에 사용되지 않도록 방지 조치를 마련했다고 말합니다. 시스템에는 특정 규칙들이 내장되어 있어, “유해한 콘텐츠 가이드라인을 위반하는 대화가 감지되면 즉시 중단될 수 있다”고 오픈AI는 설명했습니다.
모든 새로운 음성 모델들은 오픈AI의 Realtime API에 포함되어 있습니다. Translate와 Whisper는 분당 사용량에 따라 요금이 부과되며, GPT-Realtime-2는 토큰 소모량을 기준으로 요금이 계산됩니다.
관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L
관련 특별 주제 추천
의견 (0)
0/500

오픈AI는 목요일에 자사의 API에 새로운 음성 인텔리전스 기능들이 추가되었다고 발표했습니다. 이러한 기능들은 개발자들이 대화를 할 수 있고, 텍스트를 전사하며, 번역할 수 있는 앱을 구축하는 데 도움을 주도록 설계되었습니다.
회사의 새로운 GPT-Realtime-2는 사용자와 대화를 나눌 수 있는 현실적인 음성 시뮬레이션을 제공하는 또 다른 음성 모델입니다. 하지만 이전 버전(GPT-Realtime-1.5)과 달리, 이번 버전에는 GPT-5 수준의 추론 기능이 탑재되어 있어, 오픈AI에 따르면 더 복잡한 사용자 요청을 처리할 수 있게 되었습니다.
또한 오픈AI는 GPT-Realtime-Translate도 출시했는데, 이름에서 알 수 있듯이 이 기능은 대화가 진행되는 동안 실시간으로 번역 서비스를 제공합니다. 이 기능은 70개 이상의 입력 언어와 13개의 출력 언어를 지원합니다.
마지막으로, 오픈AI는 GPT-Realtime-Whisper라는 새로운 텍스트 전사 기능도 도입했습니다. 이 기능은 대화가 진행되는 동안 실시간으로 음성을 텍스트로 변환해 줍니다.
회사는 “우리가 출시하는 이러한 모델들을 통해 실시간 오디오 기술이 단순한 호출 및 응답 방식에서 벗어나, 실제로 작업을 수행할 수 있는 음성 인터페이스로 발전하게 될 것”이라고 말했습니다.
이러한 업데이트로 누가 혜택을 받을까요? 고객 서비스 기능을 확장하고자 하는 기업들이 분명한 대상입니다. 하지만 오픈AI는 새로운 기능들이 교육, 미디어, 이벤트, 크리에이터 플랫폼 등 다양한 분야에서도 활용될 수 있을 것이라고 밝혔습니다.
이러한 도구들이 기업 입장에서 매우 유용할 수는 있지만, 잘못 사용될 가능성도 있습니다. 오픈AI는 새로운 기능들이 스팸, 사기 또는 기타 온라인 악용 행위에 사용되지 않도록 방지 조치를 마련했다고 말합니다. 시스템에는 특정 규칙들이 내장되어 있어, “유해한 콘텐츠 가이드라인을 위반하는 대화가 감지되면 즉시 중단될 수 있다”고 오픈AI는 설명했습니다.
모든 새로운 음성 모델들은 오픈AI의 Realtime API에 포함되어 있습니다. Translate와 Whisper는 분당 사용량에 따라 요금이 부과되며, GPT-Realtime-2는 토큰 소모량을 기준으로 요금이 계산됩니다.
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L





집






