알리바바 통이, '프리스타일' 자연어 제어 기능 탑재 음성 모델 공개
오늘 알리바바 통이 연구소 음성 팀은 두 가지 혁신적인 음성 생성 모델인 Fun-CosyVoice3.5와 Fun-AudioGen-VD를 공개했습니다. 이 모델들의 가장 큰 특징은 '자유형(FreeStyle)' 명령어 지원입니다. 복잡한 매개변수 조정 대신, 사용자는 간단한 자연어 설명만으로 보컬 표현 스타일을 정밀하게 제어하거나 복잡한 오디오 장면을 처음부터 구축할 수 있습니다.

각 모델은 다음과 같은 고유한 목적을 수행합니다:
Fun-CosyVoice3.5: 다국어 복제 및 정밀 제어
CosyVoice의 향상된 버전으로 음성 표현의 미묘한 차이를 이해하는 데 핵심적인 돌파구를 마련했습니다.
명령 기반 생성: "더 자신 있게 말하기" 또는 "감정 변화를 주며 속도를 늦추기"와 같은 지시를 입력하여 실시간 음성 조정 가능
언어 확장: 태국어, 인도네시아어, 포르투갈어, 베트남어 지원이 추가되어 13개 언어에서 업계 최고의 음성 인식 정확도(WER) 및 음성 유사성 성능을 유지합니다.
희귀 문자 최적화: 특수 훈련을 통해 비표준 문자 오류율을 15.2%에서 5.3%로 감소시켰습니다.
성능 향상: 첫 패킷 지연 시간이 35% 감소하여 실시간 상호작용의 유동성이 크게 향상되었습니다.
Fun-AudioGen-VD: 종합 사운드 디자인
이 모델은 "오디오 디렉터" 역할을 수행하며 "캐릭터 + 환경"을 결합한 통합 오디오를 생성합니다.
음성 커스터마이징: 성별, 연령, 억양 및 "쉰 목소리, 깊은 목소리, 낮은 음조"와 같은 세부 특성을 지정할 수 있습니다.
감정 및 역할 연기: 고객 서비스 상담원, 방송인, 어린이 등의 역할을 시뮬레이션하며, "겉으로는 차분하지만 내면은 긴장된" 것과 같은 복잡한 상태도 전달합니다.
몰입형 환경: 배경음(전장의 혼란, 카페의 속삭임)과 공간 효과(대성당의 잔향, 수중 음향)를 추가하여 완전한 공간 시뮬레이션을 구현합니다.
통이 랩은 이 모델들이 고품질 음성 제작을 대중화하여 팟캐스팅, 게임 개발, 영화 후반 작업에 강력한 AI 지원을 제공할 것이라고 밝혔습니다.
관련 기사
딥마인드 CEO 하사비스: 하루 6시간 수면, 보통 오후 1시경에 활력을 느낍니다
Fortune는 최근 Google DeepMind의 CEO인 데미스 하사비스와의 인터뷰를 소개하며, 그의 비전통적인 휴식 및 생산성 접근 방식을 공개했다. 하사비스는 자신이 매우 적게 잠을 자며, 깨어 있는 시간을 두 개의 명확한 업무 블록으로 구조화한다고 밝혔다.그의 수면 습관에 대해 하사비스는 "6시간을 목표로 하지만, 제 습관은 비정형적입니다. 하루 종일 효과적으로 기능할 수 있습니다."라고 언급했다. 그는 6시간 미만의 수면이 뇌 건강
OpenAI와 Anthropic, 매출 부진 속에서도 시장 점유율 확보 경쟁
최근 OpenAI가 매출 목표를 달성하지 못했다는 보도가 나오면서 이번 주 화요일 기술주에 압박이 가해졌음에도 불구하고, 민간 AI 연구소 투자자들은 여전히 탄탄한 모습을 보이고 있다. 노련한 투자자들은 부정적인 언론 보도에도 불구하고 투자 규모를 줄이지 않을 것이라고 밝혔다.분석가들은 현재의 AI 경쟁이 초기 단계에 불과하다고 보고, “승자 독식” 식의
캘리포니아 자율주행차 규정 준수: 과태료, 지오펜스, 100만 마일의 새로운 시대
Guident는 남부 플로리다에서 AuveTech 셔틀을 운영하며, 자사의 원격 모니터링 기술을 활용해 웨스트 팜비치에서 4마일 구간과 보카 라톤에서 1마일 구간의 노선을 관리하고 있다. | 출처: Guident캘리포니아주는 자율주행차에 대한 규제 환경을 재정의하며, 기술 업계의 “빠르게 움직이고 실패를 감수하라(move fast and break thin
관련 특별 주제 추천
의견 (0)
0/500
오늘 알리바바 통이 연구소 음성 팀은 두 가지 혁신적인 음성 생성 모델인 Fun-CosyVoice3.5와 Fun-AudioGen-VD를 공개했습니다. 이 모델들의 가장 큰 특징은 '자유형(FreeStyle)' 명령어 지원입니다. 복잡한 매개변수 조정 대신, 사용자는 간단한 자연어 설명만으로 보컬 표현 스타일을 정밀하게 제어하거나 복잡한 오디오 장면을 처음부터 구축할 수 있습니다.

각 모델은 다음과 같은 고유한 목적을 수행합니다:
Fun-CosyVoice3.5: 다국어 복제 및 정밀 제어
CosyVoice의 향상된 버전으로 음성 표현의 미묘한 차이를 이해하는 데 핵심적인 돌파구를 마련했습니다.
명령 기반 생성: "더 자신 있게 말하기" 또는 "감정 변화를 주며 속도를 늦추기"와 같은 지시를 입력하여 실시간 음성 조정 가능
언어 확장: 태국어, 인도네시아어, 포르투갈어, 베트남어 지원이 추가되어 13개 언어에서 업계 최고의 음성 인식 정확도(WER) 및 음성 유사성 성능을 유지합니다.
희귀 문자 최적화: 특수 훈련을 통해 비표준 문자 오류율을 15.2%에서 5.3%로 감소시켰습니다.
성능 향상: 첫 패킷 지연 시간이 35% 감소하여 실시간 상호작용의 유동성이 크게 향상되었습니다.
Fun-AudioGen-VD: 종합 사운드 디자인
이 모델은 "오디오 디렉터" 역할을 수행하며 "캐릭터 + 환경"을 결합한 통합 오디오를 생성합니다.
음성 커스터마이징: 성별, 연령, 억양 및 "쉰 목소리, 깊은 목소리, 낮은 음조"와 같은 세부 특성을 지정할 수 있습니다.
감정 및 역할 연기: 고객 서비스 상담원, 방송인, 어린이 등의 역할을 시뮬레이션하며, "겉으로는 차분하지만 내면은 긴장된" 것과 같은 복잡한 상태도 전달합니다.
몰입형 환경: 배경음(전장의 혼란, 카페의 속삭임)과 공간 효과(대성당의 잔향, 수중 음향)를 추가하여 완전한 공간 시뮬레이션을 구현합니다.
통이 랩은 이 모델들이 고품질 음성 제작을 대중화하여 팟캐스팅, 게임 개발, 영화 후반 작업에 강력한 AI 지원을 제공할 것이라고 밝혔습니다.
딥마인드 CEO 하사비스: 하루 6시간 수면, 보통 오후 1시경에 활력을 느낍니다
Fortune는 최근 Google DeepMind의 CEO인 데미스 하사비스와의 인터뷰를 소개하며, 그의 비전통적인 휴식 및 생산성 접근 방식을 공개했다. 하사비스는 자신이 매우 적게 잠을 자며, 깨어 있는 시간을 두 개의 명확한 업무 블록으로 구조화한다고 밝혔다.그의 수면 습관에 대해 하사비스는 "6시간을 목표로 하지만, 제 습관은 비정형적입니다. 하루 종일 효과적으로 기능할 수 있습니다."라고 언급했다. 그는 6시간 미만의 수면이 뇌 건강
OpenAI와 Anthropic, 매출 부진 속에서도 시장 점유율 확보 경쟁
최근 OpenAI가 매출 목표를 달성하지 못했다는 보도가 나오면서 이번 주 화요일 기술주에 압박이 가해졌음에도 불구하고, 민간 AI 연구소 투자자들은 여전히 탄탄한 모습을 보이고 있다. 노련한 투자자들은 부정적인 언론 보도에도 불구하고 투자 규모를 줄이지 않을 것이라고 밝혔다.분석가들은 현재의 AI 경쟁이 초기 단계에 불과하다고 보고, “승자 독식” 식의





집






