Дом
iFlytek Xinghuo представляет 0.65B энкодерную модель речи с 30B MoE, построенную на полностью отечественных вычислительных мощностях
iFLYTEK представила Spark-Audio-1.0-Preview, базовую языковую модель для обработки речи, полностью созданную на отечественной вычислительной инфраструктуре.
Ранее обработка аудио с помощью больших моделей опиралась на каскадный метод: сначала речь преобразовывалась в текст, а затем передавалась модели для анализа. Этот подход имеет два основных недостатка: потеря информации, поскольку текст не передает тон, эмоции и фоновые звуки, что приводит к неполному контексту; и фрагментированные рабочие процессы, при которых независимые модули для транскрипции, идентификации говорящего и перевода работают последовательно, вызывая накопление ошибок, задержки и низкое качество пользовательского опыта.

Выход за пределы транскрипции: прямое понимание речи
Эта базовая модель для обработки речи выходит за рамки простой транскрипции и напрямую интерпретирует аудио. Она способна различать человеческие голоса, фоновый шум и музыку, а также понимать семантику, эмоции и контекстные подсказки внутри звука.
Первоначальный выпуск Spark-Audio-1.0-Preview включает 0,65B аудиоэнкодер (плотная структура) и большую языковую модель 30B-A3B (структура MoE). Обученная на 13 миллионах часов аудио и обширных текстовых данных с использованием полностью отечественного вычислительного кластера, модель принимает как текстовые, так и аудио входные данные. Она поддерживает задачи, включая транскрипцию речи, многоязычный перевод, распознавание нескольких диалектов, идентификацию фоновых звуков, распознавание говорящего, анализ тональности и сложные вопросы и ответы по аудио, позволяя машинам перейти от «четкого слышания» к «пониманию». Аналогично системе «1+N» больших моделей iFLYTEK Spark, пользователи могут дообучить эту базовую модель для речи, чтобы создать специализированные системы для распознавания речи, перевода в реальном времени и интерактивных приложений для речи.
Поддержка 99 языков и 202 диалектов, превосходные результаты в сложных сценариях
Согласно официальным данным, Spark-Audio-1.0-Preview демонстрирует результаты, сопоставимые или лучшие по сравнению с конкурентами в различных задачах оценки речи, особенно в сложных реальных сценариях, таких как высокий уровень шума и тихая речь. Ее результаты также тесно соответствуют более крупным закрытым базовым моделям для обработки речи.
Модель поддерживает распознавание 99 языков и 202 диалектов. Она демонстрирует превосходные средние результаты в многоязычном и многодиалектном распознавании речи по сравнению с аналогичной по размеру Qwen3.5-omni-flash (35B-A3B) и соответствует результатам значительно более крупной Qwen3.5-omni-plus. В таких оценках, как Fleurs, Kespeech и LibriSpeech для китайско-английского, многоязычного и многодиалектного распознавания речи, она превосходит Gemini-3.1 Pro и достигает SOTA на тестовом наборе Fleurs на китайском языке.
iFLYTEK признает, что хотя эта версия сохраняет высокие показатели в задачах общих знаний, математики и программирования, есть возможности для улучшения в следовании инструкциям, диалогах и понимании аудио. Будущие обновления будут сосредоточены на усилении этих областей. Spark-Audio-1.0-Preview теперь доступна для публичного тестирования, доступ к API будет выпущен на платформе iFLYTEK Open Platform в ближайшее время.
Связанная статья
Zoho помогает компаниям внедрять ИИ-агентов
Рынок стремительно развивается в направлении агентов на базе искусственного интеллектаZoho подчеркивает, что ИИ развивается в геометрической прогрессии, поэтому предприятиям крайне важно адаптироватьс
Suno представляет масштабное обновление с расширенным разделением треков и поддержкой автомобилей
Suno выпустила значительные обновления своей платформы для генерации музыки на основе искусственного интеллекта, улучшив как веб-версию, так и мобильный опыт для упрощения процесса создания контента и повышения удобства использования. Платформа движе
Жоэль Пино из компании Cohere о суверенном ИИ и корпоративной безопасности
В исследовании IDC, проведенном по заказу компании Cohere, рассматривается тема «суверенного ИИ», а директор по ИИ Жоэль Пино излагает основные стратегии обеспечения безопасности корпоративных облачны
Рекомендации по связанным специальным темам
Комментарии (0)
iFLYTEK представила Spark-Audio-1.0-Preview, базовую языковую модель для обработки речи, полностью созданную на отечественной вычислительной инфраструктуре.
Ранее обработка аудио с помощью больших моделей опиралась на каскадный метод: сначала речь преобразовывалась в текст, а затем передавалась модели для анализа. Этот подход имеет два основных недостатка: потеря информации, поскольку текст не передает тон, эмоции и фоновые звуки, что приводит к неполному контексту; и фрагментированные рабочие процессы, при которых независимые модули для транскрипции, идентификации говорящего и перевода работают последовательно, вызывая накопление ошибок, задержки и низкое качество пользовательского опыта.

Выход за пределы транскрипции: прямое понимание речи
Эта базовая модель для обработки речи выходит за рамки простой транскрипции и напрямую интерпретирует аудио. Она способна различать человеческие голоса, фоновый шум и музыку, а также понимать семантику, эмоции и контекстные подсказки внутри звука.
Первоначальный выпуск Spark-Audio-1.0-Preview включает 0,65B аудиоэнкодер (плотная структура) и большую языковую модель 30B-A3B (структура MoE). Обученная на 13 миллионах часов аудио и обширных текстовых данных с использованием полностью отечественного вычислительного кластера, модель принимает как текстовые, так и аудио входные данные. Она поддерживает задачи, включая транскрипцию речи, многоязычный перевод, распознавание нескольких диалектов, идентификацию фоновых звуков, распознавание говорящего, анализ тональности и сложные вопросы и ответы по аудио, позволяя машинам перейти от «четкого слышания» к «пониманию». Аналогично системе «1+N» больших моделей iFLYTEK Spark, пользователи могут дообучить эту базовую модель для речи, чтобы создать специализированные системы для распознавания речи, перевода в реальном времени и интерактивных приложений для речи.
Поддержка 99 языков и 202 диалектов, превосходные результаты в сложных сценариях
Согласно официальным данным, Spark-Audio-1.0-Preview демонстрирует результаты, сопоставимые или лучшие по сравнению с конкурентами в различных задачах оценки речи, особенно в сложных реальных сценариях, таких как высокий уровень шума и тихая речь. Ее результаты также тесно соответствуют более крупным закрытым базовым моделям для обработки речи.
Модель поддерживает распознавание 99 языков и 202 диалектов. Она демонстрирует превосходные средние результаты в многоязычном и многодиалектном распознавании речи по сравнению с аналогичной по размеру Qwen3.5-omni-flash (35B-A3B) и соответствует результатам значительно более крупной Qwen3.5-omni-plus. В таких оценках, как Fleurs, Kespeech и LibriSpeech для китайско-английского, многоязычного и многодиалектного распознавания речи, она превосходит Gemini-3.1 Pro и достигает SOTA на тестовом наборе Fleurs на китайском языке.
iFLYTEK признает, что хотя эта версия сохраняет высокие показатели в задачах общих знаний, математики и программирования, есть возможности для улучшения в следовании инструкциям, диалогах и понимании аудио. Будущие обновления будут сосредоточены на усилении этих областей. Spark-Audio-1.0-Preview теперь доступна для публичного тестирования, доступ к API будет выпущен на платформе iFLYTEK Open Platform в ближайшее время.
Zoho помогает компаниям внедрять ИИ-агентов
Рынок стремительно развивается в направлении агентов на базе искусственного интеллектаZoho подчеркивает, что ИИ развивается в геометрической прогрессии, поэтому предприятиям крайне важно адаптироватьс
Suno представляет масштабное обновление с расширенным разделением треков и поддержкой автомобилей
Suno выпустила значительные обновления своей платформы для генерации музыки на основе искусственного интеллекта, улучшив как веб-версию, так и мобильный опыт для упрощения процесса создания контента и повышения удобства использования. Платформа движе
Жоэль Пино из компании Cohere о суверенном ИИ и корпоративной безопасности
В исследовании IDC, проведенном по заказу компании Cohere, рассматривается тема «суверенного ИИ», а директор по ИИ Жоэль Пино излагает основные стратегии обеспечения безопасности корпоративных облачны











