Дом
ByteDance открыла исходный код фреймворка Bernini для унифицированного создания и редактирования видео
Команда ByteDance, занимающаяся коммерциализацией технологий, официально выпустила платформу с открытым исходным кодом для генерации и редактирования видео под названием Bernini. В основе платформы лежит механизм совместной работы по принципу «сначала понять, потом сгенерировать», призванный решать типичные для отрасли проблемы, такие как нестабильность изображения и мерцание кадров, возникающие из-за неспособности традиционных моделей точно интерпретировать сложные инструкции.
В ходе внутренних оценок в ByteDance Bernini продемонстрировала результаты высшего уровня. Ее код инференса и модель второго этапа, Bernini-R, теперь доступны для общественности, а полнофункциональная версия планируется к полному выпуску с открытым исходным кодом в ближайшем будущем.

Разделение семантики и рендеринга
Рабочий процесс Bernini вводит новое разделение между «семантическим планированием» и «визуальным рендерингом». Процесс начинается с мультимодального планировщика на основе большой модели, который тщательно анализирует входные материалы для создания «семантического эскиза», который затем преобразуется рендерером в стабильные, связные видеокадры.
Такое четкое разделение обязанностей делает эту платформу особенно полезной для управляемого редактирования. Пользователи могут настраивать атрибуты сцены, такие как погода, время года или визуальный стиль, с помощью простых команд, а также получать точный контроль над углами камеры, фокусом и движениями объектов.
Расширенные возможности визуального референсирования
Помимо традиционного текстового управления, Bernini поддерживает использование изображений и видео в качестве визуальных ориентиров, что значительно повышает творческую согласованность. При редактировании видео он может точно размещать определенные материалы или плакаты в целевых областях без артефактов границ или искажения перспективы.
Для генерации новых видео модель обрабатывает одноизобразительные и многоугольные входные данные и может преобразовывать ключевые кадры в непрерывные последовательности. Чтобы избежать путаницы при соединении нескольких визуальных сегментов, команда внедрила специальный механизм позиционного кодирования, который четко отличает исходные материалы от выходных целей.
Страница проекта: https://bernini-ai.github.io/
Связанная статья
Умные очки Apple могут быть представлены на WWDC27 с акцентом на защиту конфиденциальности
Журналист Bloomberg Марк Гурман сообщает, что умные очки Apple под кодовым названием N50 должны дебютировать на WWDC27 в июне 2027 года, а их розничные продажи ожидаются осенью 2027 года. Изначально выпуск устройства планировался на конец этого года
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт
Рекомендации по связанным специальным темам
Комментарии (0)
Команда ByteDance, занимающаяся коммерциализацией технологий, официально выпустила платформу с открытым исходным кодом для генерации и редактирования видео под названием Bernini. В основе платформы лежит механизм совместной работы по принципу «сначала понять, потом сгенерировать», призванный решать типичные для отрасли проблемы, такие как нестабильность изображения и мерцание кадров, возникающие из-за неспособности традиционных моделей точно интерпретировать сложные инструкции.
В ходе внутренних оценок в ByteDance Bernini продемонстрировала результаты высшего уровня. Ее код инференса и модель второго этапа, Bernini-R, теперь доступны для общественности, а полнофункциональная версия планируется к полному выпуску с открытым исходным кодом в ближайшем будущем.

Разделение семантики и рендеринга
Рабочий процесс Bernini вводит новое разделение между «семантическим планированием» и «визуальным рендерингом». Процесс начинается с мультимодального планировщика на основе большой модели, который тщательно анализирует входные материалы для создания «семантического эскиза», который затем преобразуется рендерером в стабильные, связные видеокадры.
Такое четкое разделение обязанностей делает эту платформу особенно полезной для управляемого редактирования. Пользователи могут настраивать атрибуты сцены, такие как погода, время года или визуальный стиль, с помощью простых команд, а также получать точный контроль над углами камеры, фокусом и движениями объектов.
Расширенные возможности визуального референсирования
Помимо традиционного текстового управления, Bernini поддерживает использование изображений и видео в качестве визуальных ориентиров, что значительно повышает творческую согласованность. При редактировании видео он может точно размещать определенные материалы или плакаты в целевых областях без артефактов границ или искажения перспективы.
Для генерации новых видео модель обрабатывает одноизобразительные и многоугольные входные данные и может преобразовывать ключевые кадры в непрерывные последовательности. Чтобы избежать путаницы при соединении нескольких визуальных сегментов, команда внедрила специальный механизм позиционного кодирования, который четко отличает исходные материалы от выходных целей.
Страница проекта: https://bernini-ai.github.io/
Умные очки Apple могут быть представлены на WWDC27 с акцентом на защиту конфиденциальности
Журналист Bloomberg Марк Гурман сообщает, что умные очки Apple под кодовым названием N50 должны дебютировать на WWDC27 в июне 2027 года, а их розничные продажи ожидаются осенью 2027 года. Изначально выпуск устройства планировался на конец этого года
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт











