미스트랄, 오픈소스 음성 생성 모델 공개
프랑스의 AI 기업 미스트랄(Mistral)은 목요일, 음성 AI 비서 및 고객 지원과 같은 기업용 애플리케이션을 위해 설계된 새로운 오픈소스 텍스트-투-스피치(TTS) 모델을 공개했다. 이 모델을 통해 기업들은 영업 및 고객 소통을 위한 음성 에이전트를 구축할 수 있게 되었으며, 미스트랄은 이를 통해 일레븐랩스(ElevenLabs), 딥그램(Deepgram), 오픈AI(OpenAI)의 직접적인 경쟁자로 자리매김했다.
'복스트랄 TTS(Voxtral TTS)'로 명명된 이 모델은 영어, 프랑스어, 독일어, 스페인어, 네덜란드어, 포르투갈어, 이탈리아어, 힌디어, 아랍어 등 9개 언어를 지원한다.
미스트랄 AI의 과학 운영 부사장 피에르 스톡(Pierre Stock)은 테크크런치(TechCrunch)와의 전화 인터뷰에서 "고객들이 음성 모델을 요청해 왔습니다. 그래서 우리는 스마트워치, 스마트폰, 노트북 또는 기타 엣지 기기에 탑재할 수 있는 소형 음성 모델을 개발했습니다. 비용은 시중의 다른 제품들에 비해 극히 일부에 불과하지만, 최첨단 성능을 제공합니다"라고 말했다.

이미지 출처: 미스트랄
미스트랄은 이 새로운 모델이 5초 미만의 샘플만으로도 사용자 맞춤형 음성에 적응할 수 있으며, 미묘한 억양, 어조, 강세, 그리고 말의 흐름에서 나타나는 불규칙성까지 포착할 수 있다고 설명합니다. 미스트랄 3B를 기반으로 구축된 이 모델은 음성 특성을 유지한 채 언어를 매끄럽게 전환할 수 있어 더빙이나 실시간 번역에 이상적입니다. 스톡 부사장은 회사가 로봇 같은 소리가 아닌, 인간과 같은 목소리를 내는 모델을 만드는 것을 목표로 했다고 언급했습니다.
회사에 따르면, 이 모델은 실시간 성능을 위해 설계되었다. 입력 수신부터 '말하기' 시작까지의 시간인 '첫 음성 출력까지 소요 시간(TTFA)'은 500자 분량의 10초 샘플 기준 90ms이다. 또한 이 모델은 6배의 실시간 처리율(RTF)을 달성하여, 약 1.6초 만에 10초 분량의 클립을 생성할 수 있습니다.

이미지 출처: 미스트랄 AI
올해 초, 미스트랄은 대규모 일괄 처리를 위한 모델과 저지연 실시간 사용 사례를 위한 모델 등 두 가지 트랜스크립션 모델을 출시했습니다. 새로운 음성 모델을 통해 이 회사는 기업을 위한 포괄적인 음성 제품군을 구축하고 있는 것으로 보입니다.
스톡은 "우리는 오디오, 텍스트, 이미지 등 다중 모달 입력 스트림은 물론 출력까지 처리할 수 있는 엔드투엔드 플랫폼을 구축할 계획입니다. 핵심적인 장점은 오디오 입력 및 출력을 지원하는 엔드투엔드 에이전트 시스템이 훨씬 더 풍부한 정보를 제공한다는 점입니다"라고 덧붙였습니다.
미스트랄은 오픈소스 특성과 사용자 정의 기능을 핵심 차별화 요소로 내세우며, 기업들이 특정 요구 사항에 맞춰 모델을 조정할 수 있게 함으로써 경쟁사 솔루션보다 우위를 점하고 있습니다.
관련 기사
ElevenLabs, 곡의 중간에 장르를 바꿔주는 음악 AI를 공개하다
음성 AI 기업인 ElevenLabs는 곡의 중간에 장르를 변경할 수 있는 최신 음악 생성 모델인 Music v2를 출시했습니다. 이 모델은 복잡한 보컬과 작곡을 처리하도록 설계되었으며, 해당 회사가 첫 번째 음악 생성 모델을 선보인 지 거의 10개월 만에 공개된 것입니다.ElevenLabs에 따르면 이 모델은 오페라에서 헤비메탈로, 또 다시 그 반대로 전환할 수 있으며, 일관성을 잃지 않으면서 빠른 템포의 랩을 제공하고 곡에 비음악적인 사운
구글, ‘도큐먼트’와 ‘킵’에 음성 기반 안내 기능 도입
구글은 ‘구글 I/O’ 개발자 컨퍼런스에서 ‘문서’, ‘킵’, ‘지메일’과 같은 워크스페이스 앱에 음성 기반 프롬프트 기능을 도입한다고 발표했습니다. 이 기능을 통해 사용자는 음성으로 문서 초안을 작성하고, 메모를 남기며, 이메일을 검색할 수 있습니다.Docs에서는 음성만으로 문서 초안을 작성할 수 있습니다. TechCrunch가 시연한 데모에서 한 사용자
골드만삭스 출신과 메타 공동 창업자들이 소외된 시장을 겨냥한 음성 AI를 개발 중
고객 지원 및 서비스는 오늘날 음성 AI 분야에서 가장 주목받는 분야 중 하나입니다. 하지만 사람처럼 자연스러운 음성을 내고 지연 시간을 최소화하며 응답하는 제품을 개발하는 일은 일부 시장에서 다른 시장보다 훨씬 더 어려운 과제이며, 대부분의 주요 기업들은 아프리카와 중동 시장을 염두에 두고 제품을 설계하지 않았습니다.이러한 격차를 해소하기 위해 작년에 설
관련 특별 주제 추천
의견 (1)
0/500
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
프랑스의 AI 기업 미스트랄(Mistral)은 목요일, 음성 AI 비서 및 고객 지원과 같은 기업용 애플리케이션을 위해 설계된 새로운 오픈소스 텍스트-투-스피치(TTS) 모델을 공개했다. 이 모델을 통해 기업들은 영업 및 고객 소통을 위한 음성 에이전트를 구축할 수 있게 되었으며, 미스트랄은 이를 통해 일레븐랩스(ElevenLabs), 딥그램(Deepgram), 오픈AI(OpenAI)의 직접적인 경쟁자로 자리매김했다.
'복스트랄 TTS(Voxtral TTS)'로 명명된 이 모델은 영어, 프랑스어, 독일어, 스페인어, 네덜란드어, 포르투갈어, 이탈리아어, 힌디어, 아랍어 등 9개 언어를 지원한다.
미스트랄 AI의 과학 운영 부사장 피에르 스톡(Pierre Stock)은 테크크런치(TechCrunch)와의 전화 인터뷰에서 "고객들이 음성 모델을 요청해 왔습니다. 그래서 우리는 스마트워치, 스마트폰, 노트북 또는 기타 엣지 기기에 탑재할 수 있는 소형 음성 모델을 개발했습니다. 비용은 시중의 다른 제품들에 비해 극히 일부에 불과하지만, 최첨단 성능을 제공합니다"라고 말했다.

이미지 출처: 미스트랄
미스트랄은 이 새로운 모델이 5초 미만의 샘플만으로도 사용자 맞춤형 음성에 적응할 수 있으며, 미묘한 억양, 어조, 강세, 그리고 말의 흐름에서 나타나는 불규칙성까지 포착할 수 있다고 설명합니다. 미스트랄 3B를 기반으로 구축된 이 모델은 음성 특성을 유지한 채 언어를 매끄럽게 전환할 수 있어 더빙이나 실시간 번역에 이상적입니다. 스톡 부사장은 회사가 로봇 같은 소리가 아닌, 인간과 같은 목소리를 내는 모델을 만드는 것을 목표로 했다고 언급했습니다.
회사에 따르면, 이 모델은 실시간 성능을 위해 설계되었다. 입력 수신부터 '말하기' 시작까지의 시간인 '첫 음성 출력까지 소요 시간(TTFA)'은 500자 분량의 10초 샘플 기준 90ms이다. 또한 이 모델은 6배의 실시간 처리율(RTF)을 달성하여, 약 1.6초 만에 10초 분량의 클립을 생성할 수 있습니다.

이미지 출처: 미스트랄 AI
올해 초, 미스트랄은 대규모 일괄 처리를 위한 모델과 저지연 실시간 사용 사례를 위한 모델 등 두 가지 트랜스크립션 모델을 출시했습니다. 새로운 음성 모델을 통해 이 회사는 기업을 위한 포괄적인 음성 제품군을 구축하고 있는 것으로 보입니다.
스톡은 "우리는 오디오, 텍스트, 이미지 등 다중 모달 입력 스트림은 물론 출력까지 처리할 수 있는 엔드투엔드 플랫폼을 구축할 계획입니다. 핵심적인 장점은 오디오 입력 및 출력을 지원하는 엔드투엔드 에이전트 시스템이 훨씬 더 풍부한 정보를 제공한다는 점입니다"라고 덧붙였습니다.
미스트랄은 오픈소스 특성과 사용자 정의 기능을 핵심 차별화 요소로 내세우며, 기업들이 특정 요구 사항에 맞춰 모델을 조정할 수 있게 함으로써 경쟁사 솔루션보다 우위를 점하고 있습니다.
ElevenLabs, 곡의 중간에 장르를 바꿔주는 음악 AI를 공개하다
음성 AI 기업인 ElevenLabs는 곡의 중간에 장르를 변경할 수 있는 최신 음악 생성 모델인 Music v2를 출시했습니다. 이 모델은 복잡한 보컬과 작곡을 처리하도록 설계되었으며, 해당 회사가 첫 번째 음악 생성 모델을 선보인 지 거의 10개월 만에 공개된 것입니다.ElevenLabs에 따르면 이 모델은 오페라에서 헤비메탈로, 또 다시 그 반대로 전환할 수 있으며, 일관성을 잃지 않으면서 빠른 템포의 랩을 제공하고 곡에 비음악적인 사운
구글, ‘도큐먼트’와 ‘킵’에 음성 기반 안내 기능 도입
구글은 ‘구글 I/O’ 개발자 컨퍼런스에서 ‘문서’, ‘킵’, ‘지메일’과 같은 워크스페이스 앱에 음성 기반 프롬프트 기능을 도입한다고 발표했습니다. 이 기능을 통해 사용자는 음성으로 문서 초안을 작성하고, 메모를 남기며, 이메일을 검색할 수 있습니다.Docs에서는 음성만으로 문서 초안을 작성할 수 있습니다. TechCrunch가 시연한 데모에서 한 사용자
골드만삭스 출신과 메타 공동 창업자들이 소외된 시장을 겨냥한 음성 AI를 개발 중
고객 지원 및 서비스는 오늘날 음성 AI 분야에서 가장 주목받는 분야 중 하나입니다. 하지만 사람처럼 자연스러운 음성을 내고 지연 시간을 최소화하며 응답하는 제품을 개발하는 일은 일부 시장에서 다른 시장보다 훨씬 더 어려운 과제이며, 대부분의 주요 기업들은 아프리카와 중동 시장을 염두에 두고 제품을 설계하지 않았습니다.이러한 격차를 해소하기 위해 작년에 설
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





집






