Hogar
ByteDance publica el código fuente del marco Bernini para la generación y edición unificadas de vídeo
El equipo de tecnología de comercialización de ByteDance ha lanzado oficialmente un marco de código abierto para la generación y edición de vídeos denominado Bernini. En esencia, el marco adopta un mecanismo colaborativo basado en el principio de «primero comprender, luego generar», diseñado para abordar retos habituales del sector, como la inestabilidad de la imagen y el parpadeo de los fotogramas, que surgen cuando los modelos tradicionales no logran interpretar con precisión instrucciones complejas.
En las evaluaciones internas de ByteDance, Bernini ha obtenido resultados de primer nivel. Su código de inferencia y el modelo de segunda fase, Bernini-R, ya están disponibles públicamente, y está previsto que la versión con todas las funciones se publique íntegramente en código abierto en un futuro próximo.

Separación de la semántica del renderizado
El flujo de trabajo de Bernini introduce una novedosa separación entre la «planificación semántica» y el «renderizado visual». El proceso comienza con un planificador multimodal de gran modelo que analiza a fondo los materiales de entrada para producir un «bosquejo semántico», que luego es traducido en fotogramas de vídeo estables y coherentes por el renderizador.
Esta clara división de responsabilidades hace que el marco sea especialmente útil para la edición controlable. Los usuarios pueden ajustar atributos de la escena como el tiempo, la estación del año o el estilo visual mediante comandos sencillos, y también obtienen un control preciso sobre los ángulos de cámara, el enfoque y los movimientos de los sujetos.
Amplias capacidades de referencia visual
Más allá del control tradicional basado en texto, Bernini admite el uso de imágenes y vídeos como referencias visuales, lo que mejora significativamente la coherencia creativa. En la edición de vídeo, puede colocar con precisión materiales específicos o carteles en regiones objetivo sin artefactos de bordes ni distorsión de la perspectiva.
Para generar nuevos vídeos, el modelo gestiona entradas de referencia de una sola imagen y de múltiples ángulos, y puede convertir fotogramas clave en secuencias continuas. Para evitar confusiones al conectar múltiples segmentos visuales, el equipo introdujo un mecanismo de codificación posicional específico que distingue claramente los materiales de referencia de los objetivos de salida.
Página del proyecto: https://bernini-ai.github.io/
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El equipo de tecnología de comercialización de ByteDance ha lanzado oficialmente un marco de código abierto para la generación y edición de vídeos denominado Bernini. En esencia, el marco adopta un mecanismo colaborativo basado en el principio de «primero comprender, luego generar», diseñado para abordar retos habituales del sector, como la inestabilidad de la imagen y el parpadeo de los fotogramas, que surgen cuando los modelos tradicionales no logran interpretar con precisión instrucciones complejas.
En las evaluaciones internas de ByteDance, Bernini ha obtenido resultados de primer nivel. Su código de inferencia y el modelo de segunda fase, Bernini-R, ya están disponibles públicamente, y está previsto que la versión con todas las funciones se publique íntegramente en código abierto en un futuro próximo.

Separación de la semántica del renderizado
El flujo de trabajo de Bernini introduce una novedosa separación entre la «planificación semántica» y el «renderizado visual». El proceso comienza con un planificador multimodal de gran modelo que analiza a fondo los materiales de entrada para producir un «bosquejo semántico», que luego es traducido en fotogramas de vídeo estables y coherentes por el renderizador.
Esta clara división de responsabilidades hace que el marco sea especialmente útil para la edición controlable. Los usuarios pueden ajustar atributos de la escena como el tiempo, la estación del año o el estilo visual mediante comandos sencillos, y también obtienen un control preciso sobre los ángulos de cámara, el enfoque y los movimientos de los sujetos.
Amplias capacidades de referencia visual
Más allá del control tradicional basado en texto, Bernini admite el uso de imágenes y vídeos como referencias visuales, lo que mejora significativamente la coherencia creativa. En la edición de vídeo, puede colocar con precisión materiales específicos o carteles en regiones objetivo sin artefactos de bordes ni distorsión de la perspectiva.
Para generar nuevos vídeos, el modelo gestiona entradas de referencia de una sola imagen y de múltiples ángulos, y puede convertir fotogramas clave en secuencias continuas. Para evitar confusiones al conectar múltiples segmentos visuales, el equipo introdujo un mecanismo de codificación posicional específico que distingue claramente los materiales de referencia de los objetivos de salida.
Página del proyecto: https://bernini-ai.github.io/
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











