메이투안의 오픈소스 오디오 모델, 음성 복제 분야의 새로운 기준을 제시하다
오디오 생성 분야는 다단계 캐스케이드 아키텍처에서 엔드투엔드 모델로 근본적인 변화를 겪고 있습니다. TTS 시스템에서 사용되는 기존의 "멜 스펙트로그램" 중간 표현 방식에 내재된 정보 손실과 오류 누적을 극복하기 위해, 메이투안 LongCat 팀은 LongCat-AudioDiT(10억 및 35억 파라미터 버전 제공)를 공식 출시하고 오픈소스로 공개했습니다. 이 모델은 직접적인 파형 잠재 공간 모델링을 수행함으로써 제로샷 음성 복제 분야의 기존 성능 한계를 성공적으로 뛰어넘었습니다.

핵심 아키텍처: 멜 스펙트로그램을 넘어
LongCat-AudioDiT는 기존의 "음향 특징 예측 + 신경 보코더" 다단계 파이프라인을 배제하고, 대신 Wav-VAE(파형 변분 자동 인코더)와 DiT(확산 트랜스포머)를 기반으로 한 간소화된 최소 아키텍처를 구축합니다.
효율적인 Wav-VAE: 완전 컨볼루션 설계를 활용하여 24kHz 파형을 2000배 압축하여 11.7Hz 프레임 레이트로 변환합니다. 비모수적 쇼트컷 분기 및 다중 목표 적대적 훈련을 통해 재구성된 파형이 정밀한 시공간 구조를 유지하면서 탁월한 자연스러운 청취 품질을 제공하도록 보장합니다.
의미 강화형 DiT: 이 모델은 UMT5 텍스트 인코더의 원본 단어 임베딩을 상위 레벨 숨겨진 상태와 혁신적으로 융합합니다. 이를 통해 상위 레벨 의미 표현에서 손실된 음성학적 세부 정보를 보완하여, 생성된 음성의 명료도를 크게 향상시킵니다.
추론 최적화: 음성 드리프트의 정밀한 보정
생성 품질을 더욱 향상시키기 위해 연구팀은 두 가지 핵심적인 기술적 개선 사항을 구현했습니다:
이중 제약 메커니즘: 이 기술은 플로우 매칭 TTS에서 지속적으로 발생하는 "훈련-추론 불일치" 문제를 식별하고 교정합니다. 추론 단계에서 프롬프트 영역의 잠재 변수를 강제 초기화함으로써, 화자의 음성 드리프트 및 불안정성 문제를 완전히 해결합니다.
적응형 투영 가이드(APG): APG는 기존의 분류기 없는 가이드(CFG)를 대체합니다. 이는 가이드 신호 내에서 유익한 구성 요소를 정확하게 필터링하는 동시에 음질 저하를 유발하는 구성 요소를 억제하여, 스펙트럼 "과포화"를 유발하지 않으면서도 음성 자연도를 크게 향상시킵니다.
성능: 최첨단 수준의 복제 정확도
Seed 데이터셋에 대한 벤치마크 테스트에서 LongCat-AudioDiT는 압도적인 성능을 보여주었습니다:
유사도(SIM): 35억 파라미터 모델은 Seed-ZH 테스트 세트에서 0.818, 난이도가 높은 Seed-Hard 문장 세트에서 0.797의 점수를 기록하며, Seed-TTS, CosyVoice3.5, MiniMax-Speech와 같은 주요 모델들을 능가했습니다.
정확도: 영어 WER 1.50%, 중국어 난이도 높은 문장 CER 6.04%를 포함하여 주요 지표 전반에서 업계 최고 수준의 성능을 기록했습니다.
특히 LongCat-AudioDiT는 전처리된 ASR 전사 데이터에 대해 단일 단계 훈련만을 수행했음에도 불구하고, 다단계 훈련을 거친 모델들에 비해 우수한 결과를 달성했습니다. 관련 연구 논문, 소스 코드 및 모델 가중치는 현재 GitHub와 HuggingFace에서 완전히 오픈소스로 공개되어 있습니다.
프로젝트 링크:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
관련 기사
인도 기술 거대기업이 마이크로소프트 오피스의 AI 경쟁사에 3000만 달러 투자
시리즈 창업가 바힌 투라크히아는 3,000만 달러의 자금을 자신의 자본으로 투자하며, 엔터프라이즈 AI 분야에 여전히 신규 진입자에게 기회가 남아 있다고 믿고 있다. 그의 최신 스타트업 ‘Neo’는 핵심 신념을 바탕으로 운영된다: 기존 직장용 소프트웨어는 채팅봇으로 단순히 패치할 수 없으며, 아키텍처의 완전한 재설계가 필요하다는 것이다.46세의 투라크히아는 야심 찬 엔터프라이즈 테크 벤처를 지원해 온 이력이 있다. 지난 20년간 그는 Dire
전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다
AI는 또 다른 주요 이정표를 달성했습니다. 오픈AI를 떠난 전 수석 과학자 일야 수트케버는 세이프 슈퍼인텔리전스 인크.(SSI)를 설립했으며, 이 회사는 최근 첫 번째 모델에 대한 세부 사항을 공개했습니다. 해외 소셜 미디어의 보도에 따르면, 이 팀은 안전한 슈퍼인텔리전스 추구를 위한 중요한 진전인 TTT(테스트 중 학습)를 활용한 컴팩트한 추론 엔진을 개발하고 있습니다.이 새로운 아키텍처는 모델이 '학습 방법을 학습'할 수 있도록 하는 데
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
관련 특별 주제 추천
의견 (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
오디오 생성 분야는 다단계 캐스케이드 아키텍처에서 엔드투엔드 모델로 근본적인 변화를 겪고 있습니다. TTS 시스템에서 사용되는 기존의 "멜 스펙트로그램" 중간 표현 방식에 내재된 정보 손실과 오류 누적을 극복하기 위해, 메이투안 LongCat 팀은 LongCat-AudioDiT(10억 및 35억 파라미터 버전 제공)를 공식 출시하고 오픈소스로 공개했습니다. 이 모델은 직접적인 파형 잠재 공간 모델링을 수행함으로써 제로샷 음성 복제 분야의 기존 성능 한계를 성공적으로 뛰어넘었습니다.

핵심 아키텍처: 멜 스펙트로그램을 넘어
LongCat-AudioDiT는 기존의 "음향 특징 예측 + 신경 보코더" 다단계 파이프라인을 배제하고, 대신 Wav-VAE(파형 변분 자동 인코더)와 DiT(확산 트랜스포머)를 기반으로 한 간소화된 최소 아키텍처를 구축합니다.
효율적인 Wav-VAE: 완전 컨볼루션 설계를 활용하여 24kHz 파형을 2000배 압축하여 11.7Hz 프레임 레이트로 변환합니다. 비모수적 쇼트컷 분기 및 다중 목표 적대적 훈련을 통해 재구성된 파형이 정밀한 시공간 구조를 유지하면서 탁월한 자연스러운 청취 품질을 제공하도록 보장합니다.
의미 강화형 DiT: 이 모델은 UMT5 텍스트 인코더의 원본 단어 임베딩을 상위 레벨 숨겨진 상태와 혁신적으로 융합합니다. 이를 통해 상위 레벨 의미 표현에서 손실된 음성학적 세부 정보를 보완하여, 생성된 음성의 명료도를 크게 향상시킵니다.
추론 최적화: 음성 드리프트의 정밀한 보정
생성 품질을 더욱 향상시키기 위해 연구팀은 두 가지 핵심적인 기술적 개선 사항을 구현했습니다:
이중 제약 메커니즘: 이 기술은 플로우 매칭 TTS에서 지속적으로 발생하는 "훈련-추론 불일치" 문제를 식별하고 교정합니다. 추론 단계에서 프롬프트 영역의 잠재 변수를 강제 초기화함으로써, 화자의 음성 드리프트 및 불안정성 문제를 완전히 해결합니다.
적응형 투영 가이드(APG): APG는 기존의 분류기 없는 가이드(CFG)를 대체합니다. 이는 가이드 신호 내에서 유익한 구성 요소를 정확하게 필터링하는 동시에 음질 저하를 유발하는 구성 요소를 억제하여, 스펙트럼 "과포화"를 유발하지 않으면서도 음성 자연도를 크게 향상시킵니다.
성능: 최첨단 수준의 복제 정확도
Seed 데이터셋에 대한 벤치마크 테스트에서 LongCat-AudioDiT는 압도적인 성능을 보여주었습니다:
유사도(SIM): 35억 파라미터 모델은 Seed-ZH 테스트 세트에서 0.818, 난이도가 높은 Seed-Hard 문장 세트에서 0.797의 점수를 기록하며, Seed-TTS, CosyVoice3.5, MiniMax-Speech와 같은 주요 모델들을 능가했습니다.
정확도: 영어 WER 1.50%, 중국어 난이도 높은 문장 CER 6.04%를 포함하여 주요 지표 전반에서 업계 최고 수준의 성능을 기록했습니다.
특히 LongCat-AudioDiT는 전처리된 ASR 전사 데이터에 대해 단일 단계 훈련만을 수행했음에도 불구하고, 다단계 훈련을 거친 모델들에 비해 우수한 결과를 달성했습니다. 관련 연구 논문, 소스 코드 및 모델 가중치는 현재 GitHub와 HuggingFace에서 완전히 오픈소스로 공개되어 있습니다.
프로젝트 링크:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
인도 기술 거대기업이 마이크로소프트 오피스의 AI 경쟁사에 3000만 달러 투자
시리즈 창업가 바힌 투라크히아는 3,000만 달러의 자금을 자신의 자본으로 투자하며, 엔터프라이즈 AI 분야에 여전히 신규 진입자에게 기회가 남아 있다고 믿고 있다. 그의 최신 스타트업 ‘Neo’는 핵심 신념을 바탕으로 운영된다: 기존 직장용 소프트웨어는 채팅봇으로 단순히 패치할 수 없으며, 아키텍처의 완전한 재설계가 필요하다는 것이다.46세의 투라크히아는 야심 찬 엔터프라이즈 테크 벤처를 지원해 온 이력이 있다. 지난 20년간 그는 Dire
전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다
AI는 또 다른 주요 이정표를 달성했습니다. 오픈AI를 떠난 전 수석 과학자 일야 수트케버는 세이프 슈퍼인텔리전스 인크.(SSI)를 설립했으며, 이 회사는 최근 첫 번째 모델에 대한 세부 사항을 공개했습니다. 해외 소셜 미디어의 보도에 따르면, 이 팀은 안전한 슈퍼인텔리전스 추구를 위한 중요한 진전인 TTT(테스트 중 학습)를 활용한 컴팩트한 추론 엔진을 개발하고 있습니다.이 새로운 아키텍처는 모델이 '학습 방법을 학습'할 수 있도록 하는 데
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





집






