알리바바의 통이(Tongyi), ‘Fun-CineForge’ 공개: 영화급 음성 합성을 구현한 오픈소스 AI 모델
알리바바 통이 랩(Alibaba Tongyi Lab)은 3월 16일, 영화급 품질의 다중 시나리오 음성 합성 다중 모달 모델인 ‘Fun-CineForge’를 공식 출시하고 오픈소스로 공개했다. 이 모델은 입모양 동기화 불일치, 감정 표현 부족, 여러 캐릭터 간 음성 특성 불일치 등 AI 더빙의 핵심 과제를 해결한다. 또한 고품질 데이터셋 구축 방법도 제시한다.

기술적으로 Fun-CineForge는 '시간적 모달리티(temporal modality)' 개념을 최초로 도입했다. 텍스트나 영상 중 하나에만 집중하는 기존 모델과 달리, 이 모델은 정확한 타임스탬프 제어를 통해 음성 합성이 정밀한 시간 간격 내에서 이루어지도록 보장한다. 캐릭터가 가려지거나, 카메라 컷이 잦거나, 얼굴이 흐릿한 복잡한 영화 장면에서도 이 모델은 높은 수준의 영상-음성 동기화와 지시 사항 준수를 유지한다.
함께 공개된 오픈소스 CineDub 데이터셋 구축 파이프라인은 또 다른 핵심 혁신입니다. Tongyi Lab은 대규모 언어 모델의 연쇄적 사고 추론(chain-of-thought reasoning)을 활용하여 원본 영화 영상을 구조화된 데이터로 자동 변환함으로써, 수동 주석 작업의 필요성을 대폭 줄였습니다. 이 프로세스는 약 1%의 단어 오류율과 1.20%에 불과한 화자 식별 오류율을 달성하여, 대규모 모델을 위한 매우 경쟁력 있는 훈련 기반을 제공합니다.

Fun-CineForge는 현재 GitHub, HuggingFace 및 ModelScope 커뮤니티에서 이용 가능하며, 최대 30초 길이의 동영상 클립에 대한 추론을 지원합니다. 이 모델은 단일 화자의 독백뿐만 아니라 듀엣 및 다중 화자 대화 시나리오에 대해서도 전문가 수준의 지원을 제공합니다. 이러한 발전은 AI 음성 기술이 기본적인 고객 서비스 및 비서 역할에서 고품질의 애니메이션 및 영화 후반 제작 분야로 진화하고 있음을 시사합니다.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
관련 기사
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진
미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤
인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음
인공지능이 전통적인 노동집약적 비즈니스 모델을 재편함에 따라, 인도 최고의 소프트웨어 아웃소싱 기업인 타타 컨설팅 서비스스(TCS)는 전략적 대응책을 공개했습니다. 화요일 열린 정기주주총회에서 회장은 인간과 기계의 협력을 비전으로 제시하고, AI 시대의 회사 인력 전략을 명확히 했습니다.해고는 없지만 채용은 느려질 것TCS 회장은 AI 도입으로 인한 직원 해고 계획이 없다고 명시하면서도, 전체 채용 속도는 늦출 것이라고 밝혔습니다. TCS는
관련 특별 주제 추천
의견 (1)
0/500
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
알리바바 통이 랩(Alibaba Tongyi Lab)은 3월 16일, 영화급 품질의 다중 시나리오 음성 합성 다중 모달 모델인 ‘Fun-CineForge’를 공식 출시하고 오픈소스로 공개했다. 이 모델은 입모양 동기화 불일치, 감정 표현 부족, 여러 캐릭터 간 음성 특성 불일치 등 AI 더빙의 핵심 과제를 해결한다. 또한 고품질 데이터셋 구축 방법도 제시한다.

기술적으로 Fun-CineForge는 '시간적 모달리티(temporal modality)' 개념을 최초로 도입했다. 텍스트나 영상 중 하나에만 집중하는 기존 모델과 달리, 이 모델은 정확한 타임스탬프 제어를 통해 음성 합성이 정밀한 시간 간격 내에서 이루어지도록 보장한다. 캐릭터가 가려지거나, 카메라 컷이 잦거나, 얼굴이 흐릿한 복잡한 영화 장면에서도 이 모델은 높은 수준의 영상-음성 동기화와 지시 사항 준수를 유지한다.
함께 공개된 오픈소스 CineDub 데이터셋 구축 파이프라인은 또 다른 핵심 혁신입니다. Tongyi Lab은 대규모 언어 모델의 연쇄적 사고 추론(chain-of-thought reasoning)을 활용하여 원본 영화 영상을 구조화된 데이터로 자동 변환함으로써, 수동 주석 작업의 필요성을 대폭 줄였습니다. 이 프로세스는 약 1%의 단어 오류율과 1.20%에 불과한 화자 식별 오류율을 달성하여, 대규모 모델을 위한 매우 경쟁력 있는 훈련 기반을 제공합니다.

Fun-CineForge는 현재 GitHub, HuggingFace 및 ModelScope 커뮤니티에서 이용 가능하며, 최대 30초 길이의 동영상 클립에 대한 추론을 지원합니다. 이 모델은 단일 화자의 독백뿐만 아니라 듀엣 및 다중 화자 대화 시나리오에 대해서도 전문가 수준의 지원을 제공합니다. 이러한 발전은 AI 음성 기술이 기본적인 고객 서비스 및 비서 역할에서 고품질의 애니메이션 및 영화 후반 제작 분야로 진화하고 있음을 시사합니다.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진
미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤
인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음
인공지능이 전통적인 노동집약적 비즈니스 모델을 재편함에 따라, 인도 최고의 소프트웨어 아웃소싱 기업인 타타 컨설팅 서비스스(TCS)는 전략적 대응책을 공개했습니다. 화요일 열린 정기주주총회에서 회장은 인간과 기계의 협력을 비전으로 제시하고, AI 시대의 회사 인력 전략을 명확히 했습니다.해고는 없지만 채용은 느려질 것TCS 회장은 AI 도입으로 인한 직원 해고 계획이 없다고 명시하면서도, 전체 채용 속도는 늦출 것이라고 밝혔습니다. TCS는
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.





집






