블랙 포레스트 랩스, 20초 분량의 오디오-비주얼 생성을 위한 최초의 네이티브 멀티모달 모델 ‘Flux3’ 공개
독일의 AI 스타트업인 블랙 포레스트 랩스(Black Forest Labs)가 Self-Flow 아키텍처를 기반으로 한 멀티모달 파운데이션 모델 ‘Flux3’를 출시했습니다. 이 모델은 이미지, 비디오, 오디오, 모션 전용 코덱을 통합하여 물리적 환경과 디지털 환경 모두에 대한 통합적인 이해와 생성을 가능하게 합니다.
Flux3의 가장 두드러진 특징은 네이티브 오디오-비디오 동기화 기능입니다. 직접 오디오 생성을 지원하는 최초의 다중 모달 모델로서, 최대 20초 길이의 동기화된 클립을 생성합니다. 이 모델은 텍스트-이미지 변환, 이미지-동영상 변환, 키프레임 기반 전환, 다중 등장인물 대화 등을 처리하며, 시각적 및 청각적 기능을 단일 기반에 통합합니다.

초기 벤치마크 결과, Flux3는 경쟁 모델들을 능가하는 것으로 나타났습니다. 720p 해상도의 10초 분량 클립에서 Luma Ray3.2 대비 93%의 승률을 기록했으며, Runway Gen-4.5보다 77% 더 우수한 성과를 보였을 뿐만 아니라, Seedance2.0 및 Gemini Omni Flash와 같은 최상위 모델들보다도 소폭 우위를 유지했습니다.
Black Forest Labs는 또한 Mimic Robotics와 협력하여 개발한 Flux-mimic를 통해 이러한 기능을 로봇 공학 분야로 확장했습니다. 현재 아우디 공장에서 생산 테스트를 진행 중인 이 모델은 다중 모달 AI가 화면에서 산업용 애플리케이션으로 전환되고 있음을 보여줍니다. 출시 일정에 관해, Flux3Video는 이미 서비스 중이며, Flux3Image와 오픈소스 “Flux3Dev” 가중치 모델은 조만간 출시될 예정입니다.
관련 기사
위챗, 10억 토큰 규모의 AI 이미지 생성 할당량 공개…사용자에게 무료 제공
텐센트 클라우드 개발팀은 오늘 ‘위챗 AI 미니 프로그램 성장 계획’을 대폭 가속화하는 대규모 업데이트를 발표했습니다. 개발자들의 혁신적인 아이디어가 컴퓨팅 성능의 한계로 인해 제약을 받지 않도록 하기 위해, 텐센트는 모든 업계 개발자에게 최대 10억 개의 모델 할당량 토큰을 무료로 제공합니다.또한, AI 생성 이미지에 대한 무료 할당량이 1만 장에서 10
마이크로소프트, 윈도우 11 2026년 업데이트 확정: 작업 표시줄 복귀, AI를 통한 ‘디지털 디톡스’ 기능 활성화
수년간 시스템이 부풀어 오르고 논란이 되는 평판을 겪은 끝에, 마이크로소프트는 마침내 윈도우 11에 대한 “대대적인 개편”을 단행하기로 결정했습니다. 마이크로소프트 윈도우 부문 책임자인 파반 다불루리(Pavan Davuluri)는 최근, 속도와 사용 편의성을 높이기 위한 일련의 핵심 개선 사항이 이번 달부터 4월까지 순차적으로 적용될 것이라고 밝혔습니다.이
구글, 로펌을 위한 ‘제미니 엔터프라이즈’ 법률 도구 출시
화요일, 구글은 변호사 및 로펌을 위한 전용 솔루션인 ‘Gemini Enterprise for Legal’을 출시하며 Gemini Enterprise 플랫폼을 확대했는데, 이는 법률 분야 내 AI 주도 수요를 선점하기 위한 주요 기술 기업들 간의 경쟁이 한층 더 격화되었음을 보여준다. 이 새로운 서비스는 기존 법률 소프트웨어 및 데이터 플랫폼과 호환되는 플
관련 특별 주제 추천
의견 (0)
0/500
독일의 AI 스타트업인 블랙 포레스트 랩스(Black Forest Labs)가 Self-Flow 아키텍처를 기반으로 한 멀티모달 파운데이션 모델 ‘Flux3’를 출시했습니다. 이 모델은 이미지, 비디오, 오디오, 모션 전용 코덱을 통합하여 물리적 환경과 디지털 환경 모두에 대한 통합적인 이해와 생성을 가능하게 합니다.
Flux3의 가장 두드러진 특징은 네이티브 오디오-비디오 동기화 기능입니다. 직접 오디오 생성을 지원하는 최초의 다중 모달 모델로서, 최대 20초 길이의 동기화된 클립을 생성합니다. 이 모델은 텍스트-이미지 변환, 이미지-동영상 변환, 키프레임 기반 전환, 다중 등장인물 대화 등을 처리하며, 시각적 및 청각적 기능을 단일 기반에 통합합니다.

초기 벤치마크 결과, Flux3는 경쟁 모델들을 능가하는 것으로 나타났습니다. 720p 해상도의 10초 분량 클립에서 Luma Ray3.2 대비 93%의 승률을 기록했으며, Runway Gen-4.5보다 77% 더 우수한 성과를 보였을 뿐만 아니라, Seedance2.0 및 Gemini Omni Flash와 같은 최상위 모델들보다도 소폭 우위를 유지했습니다.
Black Forest Labs는 또한 Mimic Robotics와 협력하여 개발한 Flux-mimic를 통해 이러한 기능을 로봇 공학 분야로 확장했습니다. 현재 아우디 공장에서 생산 테스트를 진행 중인 이 모델은 다중 모달 AI가 화면에서 산업용 애플리케이션으로 전환되고 있음을 보여줍니다. 출시 일정에 관해, Flux3Video는 이미 서비스 중이며, Flux3Image와 오픈소스 “Flux3Dev” 가중치 모델은 조만간 출시될 예정입니다.
위챗, 10억 토큰 규모의 AI 이미지 생성 할당량 공개…사용자에게 무료 제공
텐센트 클라우드 개발팀은 오늘 ‘위챗 AI 미니 프로그램 성장 계획’을 대폭 가속화하는 대규모 업데이트를 발표했습니다. 개발자들의 혁신적인 아이디어가 컴퓨팅 성능의 한계로 인해 제약을 받지 않도록 하기 위해, 텐센트는 모든 업계 개발자에게 최대 10억 개의 모델 할당량 토큰을 무료로 제공합니다.또한, AI 생성 이미지에 대한 무료 할당량이 1만 장에서 10
마이크로소프트, 윈도우 11 2026년 업데이트 확정: 작업 표시줄 복귀, AI를 통한 ‘디지털 디톡스’ 기능 활성화
수년간 시스템이 부풀어 오르고 논란이 되는 평판을 겪은 끝에, 마이크로소프트는 마침내 윈도우 11에 대한 “대대적인 개편”을 단행하기로 결정했습니다. 마이크로소프트 윈도우 부문 책임자인 파반 다불루리(Pavan Davuluri)는 최근, 속도와 사용 편의성을 높이기 위한 일련의 핵심 개선 사항이 이번 달부터 4월까지 순차적으로 적용될 것이라고 밝혔습니다.이
구글, 로펌을 위한 ‘제미니 엔터프라이즈’ 법률 도구 출시
화요일, 구글은 변호사 및 로펌을 위한 전용 솔루션인 ‘Gemini Enterprise for Legal’을 출시하며 Gemini Enterprise 플랫폼을 확대했는데, 이는 법률 분야 내 AI 주도 수요를 선점하기 위한 주요 기술 기업들 간의 경쟁이 한층 더 격화되었음을 보여준다. 이 새로운 서비스는 기존 법률 소프트웨어 및 데이터 플랫폼과 호환되는 플





집






