통이 랩, 양방향 오디오-비주얼 분리를 위한 ‘PrismAudio’ 공개
AI 영상 생성이 급속히 확산되고 있는 오늘날, 시각적 요소와 오디오 간의 불일치—주로 침묵이나 소리의 불일치 형태로 나타나는—는 시청자의 몰입을 방해하는 주요 장애물로 남아 있습니다. 이러한 과제를 해결하기 위해 알리바바의 통이 랩(Tongyi Lab)은 혁신적인 영상-오디오 변환 프레임워크인 ‘프리즘오디오(PrismAudio)’를 공개했다. AI 분야 최고 권위의 학술대회인 ICLR 2026에 채택된 이 연구는 영상 콘텐츠와 정밀한 배경 음향 효과를 자동으로 동기화하는 데 중점을 두고 있다.

생성 전 추론: “사고의 사슬(Chain of Thought)”을 통한 오디오 마스터링
기존의 오디오 생성 모델은 대개 “직관적”인 방식으로 작동하여, 말의 발굽 소리가 새 지저귐처럼 들리거나 오디오가 영상 속 동작보다 뒤처지는 등 일관성 없는 결과를 자주 만들어 냅니다. PrismAudio는 “먼저 계획을 세우고, 그다음 생성한다”는 접근 방식을 채택함으로써 차별화를 꾀합니다.
사고의 사슬 분해: 오디오를 생성하기 전에 모델은 영상을 프레임 단위로 분석합니다. 즉, 장면 요소를 식별하고, 소리 발생 시점을 결정하며, 오디오 특성(예: 선명도 또는 깊이)을 평가하고, 공간적으로 음원을 파악합니다.
다차원적 평가: 고품질 출력을 보장하기 위해 개발팀은 강화 학습을 통합하여, 네 명의 “가상 평가자”를 활용해 의미적 일관성, 시간적 동기화, 미적 품질, 공간적 정확도 측면에서 결과를 평가합니다. 이러한 다각적인 피드백 루프는 기존 모델들이 한 가지 측면을 최적화하는 데 집중하다가 다른 측면을 소홀히 했던 일반적인 문제를 해결합니다.
경량화 및 고효율: 9초 분량의 동영상을 0.6초 만에 처리
정확도뿐만 아니라 PrismAudio는 탁월한 속도를 자랑합니다. 독자적인 Fast-GRPO 훈련 알고리즘을 활용하여, 이 모델은 운영 효율성을 유지하면서도 성능을 획기적으로 향상시켰습니다:
간결한 아키텍처, 강력한 영향력: 단 5억 1,800만 개의 매개변수만을 사용하는 이 모델은 수십억 개의 매개변수가 필요한 동급 시스템에 비해 훨씬 더 작습니다.
신속한 응답: 9초 분량의 동영상 클립에 대한 고품질 오디오 생성에 단 0.63초밖에 걸리지 않아, 실시간 성능에 근접합니다.
업계 전망: 사실적인 주변 음향의 부상
PrismAudio의 출시는 영화 후반 작업 및 단편 영상 제작을 위한 강력한 자동화 도구를 제공할 뿐만 아니라, 다중 객체 생성에 대한 새로운 접근 방식을 제시합니다. AI가 오디오 텍스처와 공간적 위치의 균형을 맞추는 능력을 향상함에 따라, 향후 영상 제작은 점점 더 진정한 “보이는 대로 들리는(what you see is what you hear)” 수준의 충실도를 달성하게 될 것입니다.
논문 링크: arXiv:2511.18833
오픈 소스 링크: https://prismaudio-project.github.io/
관련 기사
네로스 테크놀로지스, 2026년까지 방위용 드론 배치에 2억 5천만 달러 확보
Neros Archer: 모듈식 화물과 견고한 통신 링크를 위해 설계된 FPV 드론. | 출처: NerosNeros Inc.은 2억 5천만 달러 규모의 시리즈 C 자금 조달을 완료하며, 이 방산 드론 계약 업체의 기업 가치를 25억 달러로 끌어올렸습니다.“이번 최신 자본 투입은 Neros가 다기능 드론 제조사로 전환되는 과정을 가속화합니다,”라고 공동 창립자이자 CEO인 소렌 몬로-앤더슨은 말했습니다. “연간 100만 대의 드론을 생산한다는 우
유수 기술, A주식 시장 최초의 휴머노이드 로봇 주식, 8월 19일 상장 예정, 약 610억 위안 가치 평가
8월 19일 과학기술혁신보드(Sci-Tech Innovation Board)에 상장될 예정인 위에슈 기술(Yue Shu Technology)은 주당 150.80위안으로 상장 첫 거래를 시작하며, 발행 후 시가총액은 약 609억 9,300만 위안으로 추정된다. 219.23의 주가수익비율(P/E Ratio)을 기록한 이 회사의 가치는 업계 평균을 크게 상회한다.회사는 총 발행 후 주식 자본의 10%에 해당하는 4,044만 6,400주의 신주를 발
Ali Zhenwu M890 Ultra 노드가 이제 Qwen3.8과 호환되며, 추론을 위해 BaiLian 플랫폼에서 사용 가능합니다.
알리바바 클라우드는 7월 23일 진우 M890 슈퍼노드가 최신 플래그십 대규모 모델인 Qwen3.8과 성공적으로 통합되어 알리바바 클라우드 바이롄 플랫폼에서 모델 추론 서비스를 제공 가능해졌다고 확인했습니다. 이번 성과는 2조 파라미터를 초과하는 대규모 모델의 안정적인 운영을 지원하는 중국 최초의 슈퍼노드 시스템으로 진우 M890을 자리매김하게 했으며, 대규모 모델 컴퓨팅 스케줄링 분야에서 국내 소프트웨어-하드웨어 협력의 중요한 돌파구를 마련했
관련 특별 주제 추천
의견 (0)
0/500
AI 영상 생성이 급속히 확산되고 있는 오늘날, 시각적 요소와 오디오 간의 불일치—주로 침묵이나 소리의 불일치 형태로 나타나는—는 시청자의 몰입을 방해하는 주요 장애물로 남아 있습니다. 이러한 과제를 해결하기 위해 알리바바의 통이 랩(Tongyi Lab)은 혁신적인 영상-오디오 변환 프레임워크인 ‘프리즘오디오(PrismAudio)’를 공개했다. AI 분야 최고 권위의 학술대회인 ICLR 2026에 채택된 이 연구는 영상 콘텐츠와 정밀한 배경 음향 효과를 자동으로 동기화하는 데 중점을 두고 있다.

생성 전 추론: “사고의 사슬(Chain of Thought)”을 통한 오디오 마스터링
기존의 오디오 생성 모델은 대개 “직관적”인 방식으로 작동하여, 말의 발굽 소리가 새 지저귐처럼 들리거나 오디오가 영상 속 동작보다 뒤처지는 등 일관성 없는 결과를 자주 만들어 냅니다. PrismAudio는 “먼저 계획을 세우고, 그다음 생성한다”는 접근 방식을 채택함으로써 차별화를 꾀합니다.
사고의 사슬 분해: 오디오를 생성하기 전에 모델은 영상을 프레임 단위로 분석합니다. 즉, 장면 요소를 식별하고, 소리 발생 시점을 결정하며, 오디오 특성(예: 선명도 또는 깊이)을 평가하고, 공간적으로 음원을 파악합니다.
다차원적 평가: 고품질 출력을 보장하기 위해 개발팀은 강화 학습을 통합하여, 네 명의 “가상 평가자”를 활용해 의미적 일관성, 시간적 동기화, 미적 품질, 공간적 정확도 측면에서 결과를 평가합니다. 이러한 다각적인 피드백 루프는 기존 모델들이 한 가지 측면을 최적화하는 데 집중하다가 다른 측면을 소홀히 했던 일반적인 문제를 해결합니다.
경량화 및 고효율: 9초 분량의 동영상을 0.6초 만에 처리
정확도뿐만 아니라 PrismAudio는 탁월한 속도를 자랑합니다. 독자적인 Fast-GRPO 훈련 알고리즘을 활용하여, 이 모델은 운영 효율성을 유지하면서도 성능을 획기적으로 향상시켰습니다:
간결한 아키텍처, 강력한 영향력: 단 5억 1,800만 개의 매개변수만을 사용하는 이 모델은 수십억 개의 매개변수가 필요한 동급 시스템에 비해 훨씬 더 작습니다.
신속한 응답: 9초 분량의 동영상 클립에 대한 고품질 오디오 생성에 단 0.63초밖에 걸리지 않아, 실시간 성능에 근접합니다.
업계 전망: 사실적인 주변 음향의 부상
PrismAudio의 출시는 영화 후반 작업 및 단편 영상 제작을 위한 강력한 자동화 도구를 제공할 뿐만 아니라, 다중 객체 생성에 대한 새로운 접근 방식을 제시합니다. AI가 오디오 텍스처와 공간적 위치의 균형을 맞추는 능력을 향상함에 따라, 향후 영상 제작은 점점 더 진정한 “보이는 대로 들리는(what you see is what you hear)” 수준의 충실도를 달성하게 될 것입니다.
논문 링크: arXiv:2511.18833
오픈 소스 링크: https://prismaudio-project.github.io/
유수 기술, A주식 시장 최초의 휴머노이드 로봇 주식, 8월 19일 상장 예정, 약 610억 위안 가치 평가
8월 19일 과학기술혁신보드(Sci-Tech Innovation Board)에 상장될 예정인 위에슈 기술(Yue Shu Technology)은 주당 150.80위안으로 상장 첫 거래를 시작하며, 발행 후 시가총액은 약 609억 9,300만 위안으로 추정된다. 219.23의 주가수익비율(P/E Ratio)을 기록한 이 회사의 가치는 업계 평균을 크게 상회한다.회사는 총 발행 후 주식 자본의 10%에 해당하는 4,044만 6,400주의 신주를 발
Ali Zhenwu M890 Ultra 노드가 이제 Qwen3.8과 호환되며, 추론을 위해 BaiLian 플랫폼에서 사용 가능합니다.
알리바바 클라우드는 7월 23일 진우 M890 슈퍼노드가 최신 플래그십 대규모 모델인 Qwen3.8과 성공적으로 통합되어 알리바바 클라우드 바이롄 플랫폼에서 모델 추론 서비스를 제공 가능해졌다고 확인했습니다. 이번 성과는 2조 파라미터를 초과하는 대규모 모델의 안정적인 운영을 지원하는 중국 최초의 슈퍼노드 시스템으로 진우 M890을 자리매김하게 했으며, 대규모 모델 컴퓨팅 스케줄링 분야에서 국내 소프트웨어-하드웨어 협력의 중요한 돌파구를 마련했





집






