Mistral представляет модель генерации речи с открытым исходным кодом
Французская компания Mistral, специализирующаяся на искусственном интеллекте, представила в четверг новую модель преобразования текста в речь с открытым исходным кодом, предназначенную для голосовых ИИ-помощников и корпоративных приложений, таких как служба поддержки клиентов. Модель позволяет компаниям создавать голосовых агентов для продаж и взаимодействия с клиентами, что делает Mistral прямым конкурентом ElevenLabs, Deepgram и OpenAI.
Модель, получившая название Voxtral TTS, поддерживает девять языков, включая английский, французский, немецкий, испанский, голландский, португальский, итальянский, хинди и арабский.
«Наши клиенты просили нас создать модель речи. Поэтому мы разработали компактную модель речи, которая может работать на смарт-часах, смартфонах, ноутбуках и других периферийных устройствах. Ее стоимость составляет лишь небольшую часть от стоимости других решений на рынке, но при этом она обеспечивает передовую производительность», — сказал Пьер Сток, вице-президент по научным операциям в Mistral AI, в телефонном интервью TechCrunch.

Источник изображения: Mistral
Mistral заявляет, что новая модель может адаптироваться к индивидуальному голосу с помощью образца длиной менее пяти секунд, улавливая тонкие акценты, интонации и неровности в потоке речи. Построенная на базе Ministral 3B, она может плавно переключаться между языками, сохраняя при этом характеристики голоса, что делает ее идеальной для дубляжа или перевода в реальном времени. Сток отметил, что компания стремилась сделать так, чтобы модель звучала по-человечески, а не по-роботически.
По данным компании, модель создана для работы в режиме реального времени. Ее время до первого звука (TTFA) — время между получением входных данных и началом «речи» — составляет 90 мс для 10-секундного образца из 500 символов. Модель также достигает коэффициента реального времени (RTF) 6x, что означает, что она может сгенерировать 10-секундный клип примерно за 1,6 секунды.

Изображение предоставлено: Mistral AI
Ранее в этом году Mistral запустила две модели транскрипции — одну для крупномасштабной пакетной обработки, другую — для сценариев использования в режиме реального времени с низкой задержкой. С новой речевой моделью компания, по-видимому, создает комплексный набор голосовых продуктов для предприятий.
Сток добавил: «Мы планируем создать сквозную платформу, способную обрабатывать мультимодальные входные потоки — аудио, текст и изображения — а также выходные данные. Ключевым преимуществом является то, что сквозная агентная система, поддерживающая аудиовход и аудиовыход, предоставляет гораздо более богатую информацию».
Mistral позиционирует свой открытый исходный код и возможности настройки как ключевые отличительные черты, позволяющие предприятиям адаптировать модель к своим конкретным потребностям, что делает ее более привлекательной по сравнению с решениями конкурентов.
Связанная статья
ElevenLabs представляет ИИ для музыки, способный менять жанры прямо в процессе исполнения песни
Компания ElevenLabs, специализирующаяся на технологиях голосового ИИ, выпустила версию Music v2 — самую новую редакцию своей модели генерации музыки, которая позволяет менять жанр в процессе исполнения трека. Эта модель разработана для обработки слож
Google внедряет голосовые подсказки в Docs и Keep
На конференции разработчиков Google I/O компания объявила о внедрении голосовых подсказок в приложения Workspace, такие как Docs, Keep и Gmail. Эти функции позволяют пользователям создавать черновики,
Бывший сотрудник Goldman Sachs и основатели Meta разрабатывают голосовой ИИ для рынков, которым уделяется мало внимания
Поддержка клиентов и обслуживание сегодня являются одними из самых востребованных направлений в сфере голосового ИИ. Однако создание продукта, который звучит как человек и отвечает с минимальной задер
Рекомендации по связанным специальным темам
Комментарии (1)
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
Французская компания Mistral, специализирующаяся на искусственном интеллекте, представила в четверг новую модель преобразования текста в речь с открытым исходным кодом, предназначенную для голосовых ИИ-помощников и корпоративных приложений, таких как служба поддержки клиентов. Модель позволяет компаниям создавать голосовых агентов для продаж и взаимодействия с клиентами, что делает Mistral прямым конкурентом ElevenLabs, Deepgram и OpenAI.
Модель, получившая название Voxtral TTS, поддерживает девять языков, включая английский, французский, немецкий, испанский, голландский, португальский, итальянский, хинди и арабский.
«Наши клиенты просили нас создать модель речи. Поэтому мы разработали компактную модель речи, которая может работать на смарт-часах, смартфонах, ноутбуках и других периферийных устройствах. Ее стоимость составляет лишь небольшую часть от стоимости других решений на рынке, но при этом она обеспечивает передовую производительность», — сказал Пьер Сток, вице-президент по научным операциям в Mistral AI, в телефонном интервью TechCrunch.

Источник изображения: Mistral
Mistral заявляет, что новая модель может адаптироваться к индивидуальному голосу с помощью образца длиной менее пяти секунд, улавливая тонкие акценты, интонации и неровности в потоке речи. Построенная на базе Ministral 3B, она может плавно переключаться между языками, сохраняя при этом характеристики голоса, что делает ее идеальной для дубляжа или перевода в реальном времени. Сток отметил, что компания стремилась сделать так, чтобы модель звучала по-человечески, а не по-роботически.
По данным компании, модель создана для работы в режиме реального времени. Ее время до первого звука (TTFA) — время между получением входных данных и началом «речи» — составляет 90 мс для 10-секундного образца из 500 символов. Модель также достигает коэффициента реального времени (RTF) 6x, что означает, что она может сгенерировать 10-секундный клип примерно за 1,6 секунды.

Изображение предоставлено: Mistral AI
Ранее в этом году Mistral запустила две модели транскрипции — одну для крупномасштабной пакетной обработки, другую — для сценариев использования в режиме реального времени с низкой задержкой. С новой речевой моделью компания, по-видимому, создает комплексный набор голосовых продуктов для предприятий.
Сток добавил: «Мы планируем создать сквозную платформу, способную обрабатывать мультимодальные входные потоки — аудио, текст и изображения — а также выходные данные. Ключевым преимуществом является то, что сквозная агентная система, поддерживающая аудиовход и аудиовыход, предоставляет гораздо более богатую информацию».
Mistral позиционирует свой открытый исходный код и возможности настройки как ключевые отличительные черты, позволяющие предприятиям адаптировать модель к своим конкретным потребностям, что делает ее более привлекательной по сравнению с решениями конкурентов.
ElevenLabs представляет ИИ для музыки, способный менять жанры прямо в процессе исполнения песни
Компания ElevenLabs, специализирующаяся на технологиях голосового ИИ, выпустила версию Music v2 — самую новую редакцию своей модели генерации музыки, которая позволяет менять жанр в процессе исполнения трека. Эта модель разработана для обработки слож
Google внедряет голосовые подсказки в Docs и Keep
На конференции разработчиков Google I/O компания объявила о внедрении голосовых подсказок в приложения Workspace, такие как Docs, Keep и Gmail. Эти функции позволяют пользователям создавать черновики,
Бывший сотрудник Goldman Sachs и основатели Meta разрабатывают голосовой ИИ для рынков, которым уделяется мало внимания
Поддержка клиентов и обслуживание сегодня являются одними из самых востребованных направлений в сфере голосового ИИ. Однако создание продукта, который звучит как человек и отвечает с минимальной задер
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





Дом






