옵션
속보
콘텐츠
GaryPerez
GaryPerez
2026년 9월 16일

iFLYTEK은 완전한 국내 컴퓨팅 파워로 학습된 음성 기반 모델인 Spark-Audio-1.0-Preview를 출시했습니다. 음성을 텍스트로 변환하는 전통적인 연쇄 시스템과 달리, 이 모델은 오디오를 직접 이해하며 의미, 감정 및 환경 소음을 포착합니다. 0.65B 오디오 인코더와 30B-A3B LLM으로 구축된 이 모델은 99개 언어와 202개 방언을 지원합니다. 시끄러운 환경에서 경쟁사보다 우수한 성능을 보이며 중국어-영어 인식 분야에서 SOTA를 달성했습니다. 이 모델은 감정 분석 및 복잡한 Q&A와 같은 작업을 가능하게 하며, 단순한 전사에서 진정한 오디오 이해로의 전환을 의미합니다. API 접근은 iFLYTEK 오픈 플랫폼을 통해 제공될 예정입니다.

iFLYTEK은 완전한 국내 컴퓨팅 파워로 학습된 음성 기반 모델인 Spark-Audio-1.0-Preview를 출시했습니다. 음성을 텍스트로 변환하는 전통적인 연쇄 시스템과 달리, 이 모델은 오디오를 직접 이해하며 의미, 감정 및 환경 소음을 포착합니다. 0.65B 오디오 인코더와 30B-A3B LLM으로 구축된 이 모델은 99개 언어와 202개 방언을 지원합니다. 시끄러운 환경에서 경쟁사보다 우수한 성능을 보이며 중국어-영어 인식 분야에서 SOTA를 달성했습니다. 이 모델은 감정 분석 및 복잡한 Q&A와 같은 작업을 가능하게 하며, 단순한 전사에서 진정한 오디오 이해로의 전환을 의미합니다. API 접근은 iFLYTEK 오픈 플랫폼을 통해 제공될 예정입니다.
의견 (0)
0/300
OR