OpenAI, 더욱 자연스러운 실시간 대화를 위한 첨단 음성 모델 공개

OpenAI는 더 자연스러운 음성을 제공하고 대화 순서를 보다 효과적으로 관리하도록 설계된 새로운 대화형 모델인 GPT-Live-1과 GPT-Live-1 mini를 출시했습니다. 이 전이중(full-duplex) 모델은 말하고 듣는 작업을 동시에 수행할 수 있어, 사용자가 자연스럽게 말을 끊을 수 있을 뿐만 아니라 실시간 번역과 같은 기능도 지원합니다.
또한 이 회사는 ChatGPT의 기존 ‘고급 음성 모드(Advanced Voice Mode)’를 대체하는 기본 모델로 GPT-Live-1 mini를 도입하고 있습니다. 유료 요금제 사용자는 더 큰 규모의 GPT-Live-1 모델을 이용할 수 있습니다. 이전에는 시스템이 음성-텍스트 변환 모델, 응답 생성을 위한 대규모 언어 모델, 텍스트-음성 변환 모델을 조합하여 최종 출력을 생성했습니다.
오픈AI는 기자 간담회에서 새로운 모델이 사용자가 말하는 도중에 말을 끊는 문제나 질문에 답할 충분한 지능이 부족한 문제 등을 해결한다고 밝혔습니다. 업데이트된 모델은 대화 흐름을 유지하면서 검색, 추론 또는 에이전트 작업 등을 위해 GPT-5.5와 같은 최신 텍스트 모델로 쿼리를 전달할 것입니다.
또한 OpenAI는 이 모델이 말을 걸기 전까지 오랫동안 침묵을 지키며 대화 맥락을 파악할 수 있음을 시연했다. 게다가 새로운 음성 모드는 최신 GPT 모델과 통합되어 정보를 시각적으로 제시할 수 있습니다. DST와 Lux Capital으로부터 4,000만 달러의 시드 자금을 조달한 Monogram과 같은 다른 스타트업들도 어시스턴트의 상호작용성을 높이기 위해 시각적 응답에 주력하고 있습니다.
이 회사는 ChatGPT의 새로운 음성 모드가 더 긴 대화를 위해 설계되었다고 밝혔다. 브리핑에서 ChatGPT Voice의 제품 책임자인 Atty Eleti는 산책 중에 음성 기능을 이용해 30~40분 동안 대화를 나눈 적이 있다고 언급했다.
오픈AI는 음성이 복잡한 컴퓨팅 작업을 위한 주요 인터페이스가 될 수 있다고 믿습니다. 보도에 따르면 이 회사는 올해 AI 기능을 탑재한 이어버드를 출시할 수도 있는 것으로 보이지만, 하드웨어 제품에 대한 구체적인 내용은 공개되지 않았습니다.
“시간이 지남에 따라, 우리는 이것이 음성을 컴퓨팅을 위한 일종의 주요 인터페이스로 활용하고, 점점 더 복잡해지는 장기적인 에이전트 작업을 관리할 수 있는 능력을 열어줄 것이라고 생각합니다. 사람들이 코덱스(Codex)와 ChatGPT를 사용하여 달성하는 놀라운 활용 사례들을 볼 때, 음성이 모든 종류의 작업을 위한 미래의 인터페이스가 될 수 있다고 생각합니다,”라고 엘레티는 말했습니다.
오픈AI는 지난 몇 년간 ChatGPT의 음성 모드가 더 자연스럽게 들리도록 음성 기반 기능을 지속적으로 개선해 왔다. 이 회사에 따르면 1억 5천만 명 이상의 사용자가 음성 및 받아쓰기 기능을 통해 ChatGPT와 대화하고 있다.
경쟁사들도 자사 어시스턴트의 표현력을 높이기 위해 노력하고 있다.
애플과 아마존 모두 맥락 처리 능력을 개선하여 어시스턴트가 더 대화형으로 작동하도록 업데이트했습니다. 오큘러스(Oculus) 공동 창업자 브렌던 이리베(Brendan Iribe)와 안킷 쿠마르(Ankit Kumar)가 공동 설립한 세사메(Sesame)와 같은 스타트업들은 백그라운드 작업을 수행하는 동시에 더 자연스러운 대화를 나눌 수 있는 AI 어시스턴트를 출시했습니다.
오픈AI도 비슷한 길을 걷고 있으며, 사용자가 더 오랜 시간 동안 손을 쓰지 않고도 어시스턴트와 상호작용할 수 있도록 하는 것을 목표로 하고 있다. 새로운 음성 모드의 음성이 더 자연스럽다고 주장하면서도, 회사는 이 기능이 AI 동반자로 설계된 것은 아니라고 강조했다. 또한 새로운 모델에는 청소년에게 연령에 적합한 응답을 제공하고, 대화가 자해와 같은 주제를 다룰 경우 관련 자료를 제시할 수 있는 안전 장치가 포함되어 있다고 밝혔다.
새로운 음성 모드에는 여전히 개선의 여지가 있다. 힌디어 실시간 번역 기능 시연 중, 어시스턴트는 강한 미국식 억양으로 말했으며 부자연스럽고 다소 서적에서나 나올 법한 힌디어를 사용했다. 회사는 이 모드가 “가장 널리 사용되는 언어”에 최적화되어 있다고 밝혔으나, 구체적으로 어떤 언어인지는 명시하지 않았다.
관련 기사
아마존, 프라임 회원 없이도 파이어 TV에서 무료 알렉사+ 출시
AI는 당신이 준비되었는지 여부와 상관없이 텔레비전으로 들어오고 있습니다.수요일, 아마존은 Prime 구독 여부와 무관하게 미국 내 모든 호환 Fire TV 기기에서 AI 어시스턴트 Alexa+가 무료로 이용 가능하다고 발표했습니다. 이 업데이트는 대화형 검색, 스마트 홈 관리 및 AI 기반 추천 기능을 도입한 것으로, 회사 측은 설명했습니다.이전에는 Alexa+가 비Prime 회원에게 월 $19.99의 가격으로 제공되었으며, 작년 가을에
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
관련 특별 주제 추천
의견 (0)
0/500

OpenAI는 더 자연스러운 음성을 제공하고 대화 순서를 보다 효과적으로 관리하도록 설계된 새로운 대화형 모델인 GPT-Live-1과 GPT-Live-1 mini를 출시했습니다. 이 전이중(full-duplex) 모델은 말하고 듣는 작업을 동시에 수행할 수 있어, 사용자가 자연스럽게 말을 끊을 수 있을 뿐만 아니라 실시간 번역과 같은 기능도 지원합니다.
또한 이 회사는 ChatGPT의 기존 ‘고급 음성 모드(Advanced Voice Mode)’를 대체하는 기본 모델로 GPT-Live-1 mini를 도입하고 있습니다. 유료 요금제 사용자는 더 큰 규모의 GPT-Live-1 모델을 이용할 수 있습니다. 이전에는 시스템이 음성-텍스트 변환 모델, 응답 생성을 위한 대규모 언어 모델, 텍스트-음성 변환 모델을 조합하여 최종 출력을 생성했습니다.
오픈AI는 기자 간담회에서 새로운 모델이 사용자가 말하는 도중에 말을 끊는 문제나 질문에 답할 충분한 지능이 부족한 문제 등을 해결한다고 밝혔습니다. 업데이트된 모델은 대화 흐름을 유지하면서 검색, 추론 또는 에이전트 작업 등을 위해 GPT-5.5와 같은 최신 텍스트 모델로 쿼리를 전달할 것입니다.
또한 OpenAI는 이 모델이 말을 걸기 전까지 오랫동안 침묵을 지키며 대화 맥락을 파악할 수 있음을 시연했다. 게다가 새로운 음성 모드는 최신 GPT 모델과 통합되어 정보를 시각적으로 제시할 수 있습니다. DST와 Lux Capital으로부터 4,000만 달러의 시드 자금을 조달한 Monogram과 같은 다른 스타트업들도 어시스턴트의 상호작용성을 높이기 위해 시각적 응답에 주력하고 있습니다.
이 회사는 ChatGPT의 새로운 음성 모드가 더 긴 대화를 위해 설계되었다고 밝혔다. 브리핑에서 ChatGPT Voice의 제품 책임자인 Atty Eleti는 산책 중에 음성 기능을 이용해 30~40분 동안 대화를 나눈 적이 있다고 언급했다.
오픈AI는 음성이 복잡한 컴퓨팅 작업을 위한 주요 인터페이스가 될 수 있다고 믿습니다. 보도에 따르면 이 회사는 올해 AI 기능을 탑재한 이어버드를 출시할 수도 있는 것으로 보이지만, 하드웨어 제품에 대한 구체적인 내용은 공개되지 않았습니다.
“시간이 지남에 따라, 우리는 이것이 음성을 컴퓨팅을 위한 일종의 주요 인터페이스로 활용하고, 점점 더 복잡해지는 장기적인 에이전트 작업을 관리할 수 있는 능력을 열어줄 것이라고 생각합니다. 사람들이 코덱스(Codex)와 ChatGPT를 사용하여 달성하는 놀라운 활용 사례들을 볼 때, 음성이 모든 종류의 작업을 위한 미래의 인터페이스가 될 수 있다고 생각합니다,”라고 엘레티는 말했습니다.
오픈AI는 지난 몇 년간 ChatGPT의 음성 모드가 더 자연스럽게 들리도록 음성 기반 기능을 지속적으로 개선해 왔다. 이 회사에 따르면 1억 5천만 명 이상의 사용자가 음성 및 받아쓰기 기능을 통해 ChatGPT와 대화하고 있다.
경쟁사들도 자사 어시스턴트의 표현력을 높이기 위해 노력하고 있다.
애플과 아마존 모두 맥락 처리 능력을 개선하여 어시스턴트가 더 대화형으로 작동하도록 업데이트했습니다. 오큘러스(Oculus) 공동 창업자 브렌던 이리베(Brendan Iribe)와 안킷 쿠마르(Ankit Kumar)가 공동 설립한 세사메(Sesame)와 같은 스타트업들은 백그라운드 작업을 수행하는 동시에 더 자연스러운 대화를 나눌 수 있는 AI 어시스턴트를 출시했습니다.
오픈AI도 비슷한 길을 걷고 있으며, 사용자가 더 오랜 시간 동안 손을 쓰지 않고도 어시스턴트와 상호작용할 수 있도록 하는 것을 목표로 하고 있다. 새로운 음성 모드의 음성이 더 자연스럽다고 주장하면서도, 회사는 이 기능이 AI 동반자로 설계된 것은 아니라고 강조했다. 또한 새로운 모델에는 청소년에게 연령에 적합한 응답을 제공하고, 대화가 자해와 같은 주제를 다룰 경우 관련 자료를 제시할 수 있는 안전 장치가 포함되어 있다고 밝혔다.
새로운 음성 모드에는 여전히 개선의 여지가 있다. 힌디어 실시간 번역 기능 시연 중, 어시스턴트는 강한 미국식 억양으로 말했으며 부자연스럽고 다소 서적에서나 나올 법한 힌디어를 사용했다. 회사는 이 모드가 “가장 널리 사용되는 언어”에 최적화되어 있다고 밝혔으나, 구체적으로 어떤 언어인지는 명시하지 않았다.
아마존, 프라임 회원 없이도 파이어 TV에서 무료 알렉사+ 출시
AI는 당신이 준비되었는지 여부와 상관없이 텔레비전으로 들어오고 있습니다.수요일, 아마존은 Prime 구독 여부와 무관하게 미국 내 모든 호환 Fire TV 기기에서 AI 어시스턴트 Alexa+가 무료로 이용 가능하다고 발표했습니다. 이 업데이트는 대화형 검색, 스마트 홈 관리 및 AI 기반 추천 기능을 도입한 것으로, 회사 측은 설명했습니다.이전에는 Alexa+가 비Prime 회원에게 월 $19.99의 가격으로 제공되었으며, 작년 가을에
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에





집






