StepZen이 StepAudio 3 시리즈 음성 모델을 공개하며 여러 글로벌 첫 사례를 확보하다

9월 15일, StepXingchen은 새로운 StepAudio3 시리즈 음성 대형 모델을 공식적으로 출시했습니다. 이번 출시에는 StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen, StepAudio3Music 등 다섯 가지 서로 다른 제품이 포함됩니다. 이 중 여러 모델은 권위 있는 Artificial Analysis 평가 목록에서 글로벌 1위를 차지했습니다. 이 다섯 가지 모델은 이제 StepXingchen 오픈 플랫폼에서 완전히 이용 가능하며, 사실적인 음성 생성, 포괄적인 오디오 콘텐츠 제작, 실시간 음성 상호작용, 복잡한 시나리오 음성 이해, 음악 제작이라는 다섯 가지 핵심 응용 시나리오를 해결합니다.
실시간 상호작용을 위해 StepAudio3Realtime는 풀듀플렉스 네이티브 대화를 제공하도록 설계되었습니다. 이 모델은 Artificial Analysis 대화 역동성 순위에서 종합 점수 98.9%로 글로벌 1위를 차지했으며, Artificial Analysis 음성 추론 순위에서도 정확도 99.7%로 1위를 기록했습니다. 이 모델은 대화 리듬을 정확하게 포착하고, 사용자의 방해와 지속적인 피드백을 처리하며, 의미, 어조, 감정, 부언어적 표현, 환경 소음을 이해할 수 있습니다. 또한 병렬 추론과 음성 생성, 비동기 도구 호출(Tool Call) 및 긴 작업을 지원하여 끊김 없는 음성 대화를 보장합니다.
음성 인식과 관련하여 StepAudio3ASR은 고정밀 전사 능력과 대형 언어 모델의 지식 추론 능력을 결합하여 기존 오디오 전용 전사 방식을 능가합니다. 이 모델은 중국어, 영어, 방언, 혼합 언어, 긴 오디오, 전문 분야를 포함한 다양한 시나리오를 지원합니다. 이 모델은 의료, 법률, 금융, 자동차, 프로그래밍 컨텍스트에서 뛰어나며, 낮은 볼륨, 빠른 발화 속도, 불분명한 발음, 노래, 배경 음악과 같은 복잡한 입력 환경을 효과적으로 관리합니다. 그 스트리밍이 아닌 음성 인식의 단어 오류율(WER)은 단 1.7%로 글로벌 1위를 기록했습니다.
음성 생성 분야에서 StepAudio3TTS는 실시간 상호작용을 위해 설계된 사실적인 모델입니다. 이 모델은 음성 기본, 억양, 리듬, 정지에서 자연스러운 인간 발화 패턴과 완벽하게 일치합니다. 이 모델은 웃음, 망설임, 더듬거림, 반복, 교정과 같은 부언어적 표현을 재현하며, 의미적 내용에 기반하여 감정적 어조를 자율적으로 조정할 수 있습니다. 스트리밍 생성 아키텍처를 활용하여 이 모델은 생성과 재생을 동기화합니다.
포괄적인 오디오 콘텐츠 생성을 위해 StepAudio3Gen은 기존의 긴 제작, 편집, 믹싱 프로세스를 간소화합니다. 사용자는 자연어 설명과 참조 오디오를 사용하여 보컬, 효과음, 환경음, 배경 음악을 동시에 생성할 수 있습니다. 이 모델은 캐릭터 음성, 말투, 감정, 방언, 웃음과 같은 부언어적 기능에 대한 세밀한 제어를 허용합니다. 또한 사용자는 대화, 효과음, 배경 음악의 타이밍과 순서를 명시할 수 있으며, 이는 전체 콘텐츠의 사운드 디자인과 시간 순서에 직접적인 영향을 미칩니다.
음악 창작 분야에서 StepAudio3Music은 제로샷 생성과 ABC 표기법을 기반으로 한 다중 라운드 상호작용 생성을 지원합니다. 사용자는 가사, 무반주, 참조 곡, 표기를 입력하고 자연어를 사용하여 장르, 보컬, 멜로디, 리듬, 악기, 감정을 제어할 수 있습니다. 이 모델은 곡 구조, 단락 간 멜로디 발전, 에너지 변화에 대해 깊이 이해합니다. 특히 무반주 반주 시나리오에서 단일 무반주 트랙은 화성, 리듬, 악기, 완전한 편곡을 자동으로 생성하여 진정한 음악 제작을 용이하게 합니다.
관련 기사
이번 달 출시 예정인 2.5조 파라미터의 Kimi K3 세트
2026년 하반기 대형 모델 경쟁 구도가 더욱 치열해지고 있습니다. DeepSeek V4와 함께 Moonshot AI의 Kimi K3도 이번 달 출시가 확정되었습니다.구체적인 날짜는 아직 공개되지 않았으나, 내부 소식통에 따르면 Kimi K3은 최대 2.5조 개의 파라미터를 보유하고 있어 DeepSeek V4 Pro(1.6T)와 바이두의 WENXIN 5.0(2.4T)을 능가하며, 파라미터 수 기준 국내 최대 규모 모델을 차지하고 있습니다.K
자장커의 등록: 홀몸 어머니가 AI와 사랑에 빠지고 중국을 여행하다
2026년 7월, 국가영화국은 자장커 감독의 차기작 '둔황 마마'의 시놉시스 초안을 승인했다. 줄거리에는 외로운 어머니가 고독을 극복하고 외부 세계와 연결하기 위해 점차 인공지능(AI)에 의존하며 둔황에서 살아가는 현대적 이야기가 담겨 있다. 그녀의 여정은 결국 중국 서부에서 동부로 이어지며 전국을 가로지른다. 자오타오와 리아오판이 주연하는 이 영화는 2027년 개봉을 목표로 한다.이 프로젝트는 AI가 기술 보도를 넘어 엄숙한 작가 영화의 핵
디저(Deezer), 일일 업로드 콘텐츠의 50% 이상이 AI 음악인 것으로 집계… 6개월 후 재생되지 않은 콘텐츠 삭제 예정
주요 음악 스트리밍 서비스인 디저(Deezer)는 최근 놀라운 통계를 공개했다. 현재 AI가 생성한 곡이 일일 업로드 건수의 절반 이상을 차지하고 있다는 것이다. 지난 6월, 이 플랫폼은 AI 음악 제출 건수가 급증하여 하루 평균 약 9만 곡을 기록했다.이러한 AI 콘텐츠의 홍수는 주요 스트리밍 서비스들이 콘텐츠 정책을 재정의하도록 압박하고 있지만, 업계
관련 특별 주제 추천
의견 (0)
0/500

9월 15일, StepXingchen은 새로운 StepAudio3 시리즈 음성 대형 모델을 공식적으로 출시했습니다. 이번 출시에는 StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen, StepAudio3Music 등 다섯 가지 서로 다른 제품이 포함됩니다. 이 중 여러 모델은 권위 있는 Artificial Analysis 평가 목록에서 글로벌 1위를 차지했습니다. 이 다섯 가지 모델은 이제 StepXingchen 오픈 플랫폼에서 완전히 이용 가능하며, 사실적인 음성 생성, 포괄적인 오디오 콘텐츠 제작, 실시간 음성 상호작용, 복잡한 시나리오 음성 이해, 음악 제작이라는 다섯 가지 핵심 응용 시나리오를 해결합니다.
실시간 상호작용을 위해 StepAudio3Realtime는 풀듀플렉스 네이티브 대화를 제공하도록 설계되었습니다. 이 모델은 Artificial Analysis 대화 역동성 순위에서 종합 점수 98.9%로 글로벌 1위를 차지했으며, Artificial Analysis 음성 추론 순위에서도 정확도 99.7%로 1위를 기록했습니다. 이 모델은 대화 리듬을 정확하게 포착하고, 사용자의 방해와 지속적인 피드백을 처리하며, 의미, 어조, 감정, 부언어적 표현, 환경 소음을 이해할 수 있습니다. 또한 병렬 추론과 음성 생성, 비동기 도구 호출(Tool Call) 및 긴 작업을 지원하여 끊김 없는 음성 대화를 보장합니다.
음성 인식과 관련하여 StepAudio3ASR은 고정밀 전사 능력과 대형 언어 모델의 지식 추론 능력을 결합하여 기존 오디오 전용 전사 방식을 능가합니다. 이 모델은 중국어, 영어, 방언, 혼합 언어, 긴 오디오, 전문 분야를 포함한 다양한 시나리오를 지원합니다. 이 모델은 의료, 법률, 금융, 자동차, 프로그래밍 컨텍스트에서 뛰어나며, 낮은 볼륨, 빠른 발화 속도, 불분명한 발음, 노래, 배경 음악과 같은 복잡한 입력 환경을 효과적으로 관리합니다. 그 스트리밍이 아닌 음성 인식의 단어 오류율(WER)은 단 1.7%로 글로벌 1위를 기록했습니다.
음성 생성 분야에서 StepAudio3TTS는 실시간 상호작용을 위해 설계된 사실적인 모델입니다. 이 모델은 음성 기본, 억양, 리듬, 정지에서 자연스러운 인간 발화 패턴과 완벽하게 일치합니다. 이 모델은 웃음, 망설임, 더듬거림, 반복, 교정과 같은 부언어적 표현을 재현하며, 의미적 내용에 기반하여 감정적 어조를 자율적으로 조정할 수 있습니다. 스트리밍 생성 아키텍처를 활용하여 이 모델은 생성과 재생을 동기화합니다.
포괄적인 오디오 콘텐츠 생성을 위해 StepAudio3Gen은 기존의 긴 제작, 편집, 믹싱 프로세스를 간소화합니다. 사용자는 자연어 설명과 참조 오디오를 사용하여 보컬, 효과음, 환경음, 배경 음악을 동시에 생성할 수 있습니다. 이 모델은 캐릭터 음성, 말투, 감정, 방언, 웃음과 같은 부언어적 기능에 대한 세밀한 제어를 허용합니다. 또한 사용자는 대화, 효과음, 배경 음악의 타이밍과 순서를 명시할 수 있으며, 이는 전체 콘텐츠의 사운드 디자인과 시간 순서에 직접적인 영향을 미칩니다.
음악 창작 분야에서 StepAudio3Music은 제로샷 생성과 ABC 표기법을 기반으로 한 다중 라운드 상호작용 생성을 지원합니다. 사용자는 가사, 무반주, 참조 곡, 표기를 입력하고 자연어를 사용하여 장르, 보컬, 멜로디, 리듬, 악기, 감정을 제어할 수 있습니다. 이 모델은 곡 구조, 단락 간 멜로디 발전, 에너지 변화에 대해 깊이 이해합니다. 특히 무반주 반주 시나리오에서 단일 무반주 트랙은 화성, 리듬, 악기, 완전한 편곡을 자동으로 생성하여 진정한 음악 제작을 용이하게 합니다.
이번 달 출시 예정인 2.5조 파라미터의 Kimi K3 세트
2026년 하반기 대형 모델 경쟁 구도가 더욱 치열해지고 있습니다. DeepSeek V4와 함께 Moonshot AI의 Kimi K3도 이번 달 출시가 확정되었습니다.구체적인 날짜는 아직 공개되지 않았으나, 내부 소식통에 따르면 Kimi K3은 최대 2.5조 개의 파라미터를 보유하고 있어 DeepSeek V4 Pro(1.6T)와 바이두의 WENXIN 5.0(2.4T)을 능가하며, 파라미터 수 기준 국내 최대 규모 모델을 차지하고 있습니다.K
자장커의 등록: 홀몸 어머니가 AI와 사랑에 빠지고 중국을 여행하다
2026년 7월, 국가영화국은 자장커 감독의 차기작 '둔황 마마'의 시놉시스 초안을 승인했다. 줄거리에는 외로운 어머니가 고독을 극복하고 외부 세계와 연결하기 위해 점차 인공지능(AI)에 의존하며 둔황에서 살아가는 현대적 이야기가 담겨 있다. 그녀의 여정은 결국 중국 서부에서 동부로 이어지며 전국을 가로지른다. 자오타오와 리아오판이 주연하는 이 영화는 2027년 개봉을 목표로 한다.이 프로젝트는 AI가 기술 보도를 넘어 엄숙한 작가 영화의 핵
디저(Deezer), 일일 업로드 콘텐츠의 50% 이상이 AI 음악인 것으로 집계… 6개월 후 재생되지 않은 콘텐츠 삭제 예정
주요 음악 스트리밍 서비스인 디저(Deezer)는 최근 놀라운 통계를 공개했다. 현재 AI가 생성한 곡이 일일 업로드 건수의 절반 이상을 차지하고 있다는 것이다. 지난 6월, 이 플랫폼은 AI 음악 제출 건수가 급증하여 하루 평균 약 9만 곡을 기록했다.이러한 AI 콘텐츠의 홍수는 주요 스트리밍 서비스들이 콘텐츠 정책을 재정의하도록 압박하고 있지만, 업계





집






