마이크로소프트, 16개 언어에서 동시에 듣고 말할 수 있는 자체 개발한 최초의 전이중 AI 음성 모델 공개
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는 AI가 말을 끝낼 때까지 기다릴 필요 없이 바로 응답할 수 있어, 자연스러운 인간 상호작용을 그대로 재현한 대화 경험을 제공합니다.

‘MAI Realtime’은 양방향 전이중(full-duplex) 상호작용 방식을 채택하여, 사용자가 말하고 모델이 순차적으로 응답하는 기존의 음성 비서 패턴을 효과적으로 탈피했습니다. 엔드포인트 감지 기술을 활용해 말의 시작, 일시 정지, 끝을 식별함으로써, 사용자가 말을 끼어들 때 시스템이 즉시 출력을 조정하여 듣기와 응답을 동기화할 수 있습니다. 이는 마이크로소프트의 MAI 음성 모델 제품군이 단방향 통신에서 양방향 통신으로 전환되는 중요한 이정표입니다. MAI-Voice-2 및 MAI-Transcribe-1.5와 같은 기존 모델들은 음성 합성이나 인식과 같은 단방향 작업으로만 제한되어 있었습니다.
두 가지 음성 스타일이 더 자연스러운 발화를 제공하지만, 노래 기능은 아직 포함되지 않았습니다.
언어 지원 측면에서 MAI Realtime은 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 아랍어를 포함한 16개 언어를 지원합니다. 사용자는 대화 언어를 수동으로 지정하거나 자동 감지 기능을 활성화하여, 모델이 대화 중에 언어를 자동으로 식별하고 전환하도록 할 수 있습니다. 음성 옵션 측면에서, 테스트 버전은 ‘빅토리아(Victoria)’와 ‘그랜트(Grant)’라는 두 가지 음성을 제공하며, 이 음성은 코파일럿(Copilot)의 현재 음성 모드보다 더 자연스럽게 들린다고 보고되고 있습니다.
관련 기사
애플, 지역 기반 AI와 구글과의 제휴를 통해 시리 기능을 강화한 iOS 27 공개
최근 ‘더 인포메이션’은 애플이 곧 출시될 OS 27에 인공지능을 통합하기 위한 전략적 접근 방식을 집중 조명했다. 애플은 구글의 제미니(Gemini) 모델을 활용해 더 효율적이고 경량화된 AI를 훈련시킴으로써, 사용자 개인정보를 침해하지 않으면서도 강력한 로컬 엣지 AI 기능을 제공하고자 한다. 이러한 모델 정제 과정을 통해 더 작은 기기 기반 모델이 더
퍼플렉시티 컴퓨터, 개인정보 보호와 효율성의 균형을 맞추는 하이브리드 추론 기술 공개
인공지능 기업 퍼플렉시티(Perplexity)는 올여름 자사의 ‘퍼플렉시티 컴퓨터(Perplexity Computer)’ 에이전트에 대한 대대적인 개선 기능을 출시할 계획을 밝혔다. 이번 업데이트에서는 로컬 소형 모델과 첨단 클라우드 기반 시스템 간에 워크로드를 동적으로 할당하여, 작업의 복잡성과 데이터 민감도에 따라 성능을 최적화하는 ‘하이브리드 에이전트
NexCOBOT, AI 시장의 물리적 장벽과 성장 과제 해결에 나선다
로보틱스 서밋 & 엑스포(Robotics Summit & Expo)에서 선보인 넥스코봇(NexCOBOT)은 다양한 종류의 컨트롤러를 제공합니다. 출처: 넥스코봇휴머노이드 로봇 및 물리적 AI 기업들은 수십억 규모의 자금을 확보하고 있을 뿐만 아니라, 주요 기술 기업들에 인수되기도 하고 있습니다. NexCOBOT의 제니 셔른(Jenny Shern) 총괄 매니
관련 특별 주제 추천
의견 (0)
0/500
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는 AI가 말을 끝낼 때까지 기다릴 필요 없이 바로 응답할 수 있어, 자연스러운 인간 상호작용을 그대로 재현한 대화 경험을 제공합니다.

‘MAI Realtime’은 양방향 전이중(full-duplex) 상호작용 방식을 채택하여, 사용자가 말하고 모델이 순차적으로 응답하는 기존의 음성 비서 패턴을 효과적으로 탈피했습니다. 엔드포인트 감지 기술을 활용해 말의 시작, 일시 정지, 끝을 식별함으로써, 사용자가 말을 끼어들 때 시스템이 즉시 출력을 조정하여 듣기와 응답을 동기화할 수 있습니다. 이는 마이크로소프트의 MAI 음성 모델 제품군이 단방향 통신에서 양방향 통신으로 전환되는 중요한 이정표입니다. MAI-Voice-2 및 MAI-Transcribe-1.5와 같은 기존 모델들은 음성 합성이나 인식과 같은 단방향 작업으로만 제한되어 있었습니다.
두 가지 음성 스타일이 더 자연스러운 발화를 제공하지만, 노래 기능은 아직 포함되지 않았습니다.
언어 지원 측면에서 MAI Realtime은 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 아랍어를 포함한 16개 언어를 지원합니다. 사용자는 대화 언어를 수동으로 지정하거나 자동 감지 기능을 활성화하여, 모델이 대화 중에 언어를 자동으로 식별하고 전환하도록 할 수 있습니다. 음성 옵션 측면에서, 테스트 버전은 ‘빅토리아(Victoria)’와 ‘그랜트(Grant)’라는 두 가지 음성을 제공하며, 이 음성은 코파일럿(Copilot)의 현재 음성 모드보다 더 자연스럽게 들린다고 보고되고 있습니다.
애플, 지역 기반 AI와 구글과의 제휴를 통해 시리 기능을 강화한 iOS 27 공개
최근 ‘더 인포메이션’은 애플이 곧 출시될 OS 27에 인공지능을 통합하기 위한 전략적 접근 방식을 집중 조명했다. 애플은 구글의 제미니(Gemini) 모델을 활용해 더 효율적이고 경량화된 AI를 훈련시킴으로써, 사용자 개인정보를 침해하지 않으면서도 강력한 로컬 엣지 AI 기능을 제공하고자 한다. 이러한 모델 정제 과정을 통해 더 작은 기기 기반 모델이 더
퍼플렉시티 컴퓨터, 개인정보 보호와 효율성의 균형을 맞추는 하이브리드 추론 기술 공개
인공지능 기업 퍼플렉시티(Perplexity)는 올여름 자사의 ‘퍼플렉시티 컴퓨터(Perplexity Computer)’ 에이전트에 대한 대대적인 개선 기능을 출시할 계획을 밝혔다. 이번 업데이트에서는 로컬 소형 모델과 첨단 클라우드 기반 시스템 간에 워크로드를 동적으로 할당하여, 작업의 복잡성과 데이터 민감도에 따라 성능을 최적화하는 ‘하이브리드 에이전트
NexCOBOT, AI 시장의 물리적 장벽과 성장 과제 해결에 나선다
로보틱스 서밋 & 엑스포(Robotics Summit & Expo)에서 선보인 넥스코봇(NexCOBOT)은 다양한 종류의 컨트롤러를 제공합니다. 출처: 넥스코봇휴머노이드 로봇 및 물리적 AI 기업들은 수십억 규모의 자금을 확보하고 있을 뿐만 아니라, 주요 기술 기업들에 인수되기도 하고 있습니다. NexCOBOT의 제니 셔른(Jenny Shern) 총괄 매니





집






