바이트댄스, 통합 영상 생성 및 편집을 위한 ‘베르니니(Bernini)’ 프레임워크를 오픈소스로 공개
바이트댄스의 상용화 기술 팀이 ‘베르니니(Bernini)’라는 이름의 오픈소스 영상 생성 및 편집 프레임워크를 공식 출시했다. 이 프레임워크는 핵심적으로 “먼저 이해하고, 그다음 생성한다”는 협업 메커니즘을 채택하고 있으며, 기존 모델이 복잡한 지시를 정확하게 해석하지 못해 발생하는 이미지 불안정성이나 프레임 깜빡임과 같은 업계의 일반적인 과제를 해결하기 위해 설계되었다.
바이트댄스의 내부 평가에서 베르니니는 최상위 수준의 성과를 거두었습니다. 현재 추론 코드와 2단계 모델인 '베르니니-R(Bernini-R)'이 공개되었으며, 모든 기능을 갖춘 버전은 조만간 완전한 오픈소스로 공개될 예정입니다.

의미론과 렌더링의 분리
베르니니의 워크플로는 "의미론적 계획(semantic planning)"과 "시각적 렌더링(visual rendering)"을 혁신적으로 분리합니다. 이 과정은 입력 자료를 철저히 분석하여 "의미론적 스케치(semantic sketch)"를 생성하는 다중 모달 대형 모델 플래너로 시작되며, 이 스케치는 렌더러에 의해 안정적이고 일관된 비디오 프레임으로 변환됩니다.
이러한 명확한 역할 분담 덕분에 이 프레임워크는 제어 가능한 편집 작업에 특히 유용합니다. 사용자는 간단한 명령을 통해 날씨, 계절, 시각적 스타일과 같은 장면 속성을 조정할 수 있을 뿐만 아니라, 카메라 앵글, 초점, 피사체 움직임에 대해서도 정밀한 제어가 가능합니다.
풍부한 시각적 참조 기능
기존의 텍스트 기반 제어 방식을 넘어, Bernini는 이미지와 동영상을 시각적 참조 자료로 사용할 수 있도록 지원하여 창작의 일관성을 크게 향상시킵니다. 동영상 편집 시, 경계 아티팩트나 원근 왜곡 없이 특정 소품이나 포스터를 대상 영역에 정확하게 배치할 수 있습니다.
새로운 영상 생성을 위해 이 모델은 단일 이미지 및 다중 앵글 참조 입력을 처리하며, 키프레임을 연속적인 시퀀스로 발전시킬 수 있습니다. 여러 시각적 세그먼트를 연결할 때 발생하는 혼란을 방지하기 위해, 개발팀은 참조 자료와 출력 대상을 명확히 구분하는 전용 위치 인코딩 메커니즘을 도입했습니다.
프로젝트 페이지: https://bernini-ai.github.io/
관련 기사
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
관련 특별 주제 추천
의견 (0)
0/500
바이트댄스의 상용화 기술 팀이 ‘베르니니(Bernini)’라는 이름의 오픈소스 영상 생성 및 편집 프레임워크를 공식 출시했다. 이 프레임워크는 핵심적으로 “먼저 이해하고, 그다음 생성한다”는 협업 메커니즘을 채택하고 있으며, 기존 모델이 복잡한 지시를 정확하게 해석하지 못해 발생하는 이미지 불안정성이나 프레임 깜빡임과 같은 업계의 일반적인 과제를 해결하기 위해 설계되었다.
바이트댄스의 내부 평가에서 베르니니는 최상위 수준의 성과를 거두었습니다. 현재 추론 코드와 2단계 모델인 '베르니니-R(Bernini-R)'이 공개되었으며, 모든 기능을 갖춘 버전은 조만간 완전한 오픈소스로 공개될 예정입니다.

의미론과 렌더링의 분리
베르니니의 워크플로는 "의미론적 계획(semantic planning)"과 "시각적 렌더링(visual rendering)"을 혁신적으로 분리합니다. 이 과정은 입력 자료를 철저히 분석하여 "의미론적 스케치(semantic sketch)"를 생성하는 다중 모달 대형 모델 플래너로 시작되며, 이 스케치는 렌더러에 의해 안정적이고 일관된 비디오 프레임으로 변환됩니다.
이러한 명확한 역할 분담 덕분에 이 프레임워크는 제어 가능한 편집 작업에 특히 유용합니다. 사용자는 간단한 명령을 통해 날씨, 계절, 시각적 스타일과 같은 장면 속성을 조정할 수 있을 뿐만 아니라, 카메라 앵글, 초점, 피사체 움직임에 대해서도 정밀한 제어가 가능합니다.
풍부한 시각적 참조 기능
기존의 텍스트 기반 제어 방식을 넘어, Bernini는 이미지와 동영상을 시각적 참조 자료로 사용할 수 있도록 지원하여 창작의 일관성을 크게 향상시킵니다. 동영상 편집 시, 경계 아티팩트나 원근 왜곡 없이 특정 소품이나 포스터를 대상 영역에 정확하게 배치할 수 있습니다.
새로운 영상 생성을 위해 이 모델은 단일 이미지 및 다중 앵글 참조 입력을 처리하며, 키프레임을 연속적인 시퀀스로 발전시킬 수 있습니다. 여러 시각적 세그먼트를 연결할 때 발생하는 혼란을 방지하기 위해, 개발팀은 참조 자료와 출력 대상을 명확히 구분하는 전용 위치 인코딩 메커니즘을 도입했습니다.
프로젝트 페이지: https://bernini-ai.github.io/
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이





집






