Дом
Генеральный директор DeepMind Демис Хассабис объявляет о будущей интеграции моделей Google Gemini и Veo AI

В недавнем эпизоде подкаста Possible, ведущим которого является сооснователь LinkedIn Рид Хоффман, генеральный директор Google DeepMind Демис Хассабис поделился захватывающими новостями о планах Google. Он рассказал, что Google планирует объединить свои модели ИИ Gemini с моделями генерации видео Veo. Это слияние направлено на улучшение понимания Gemini физического мира, делая его более способным к восприятию реальных динамик.
Хассабис подчеркнул, что с самого начала Gemini создавался как мультимодальная модель. «Мы всегда разрабатывали Gemini, нашу базовую модель, как мультимодальную с самого начала», — пояснил он. Мотивация этого подхода? Видение универсального цифрового помощника, который действительно может помогать в повседневной жизни. «Помощник, который … реально помогает в реальном мире», — уточнил Хассабис.
Индустрия ИИ неуклонно движется к тому, что можно назвать «omni» моделями — способными обрабатывать и синтезировать различные типы медиа. Например, последние итерации Gemini от Google могут создавать не только текст, но также аудио и изображения. Тем временем стандартная модель ChatGPT от OpenAI может мгновенно генерировать изображения, включая очаровательные арты в стиле Studio Ghibli. Amazon не отстает, планируя выпустить модель «из любого в любой» позже в этом году.
Эти omni-модели требуют огромного объема обучающих данных — подумайте об изображениях, видео, аудио и тексте. Хассабис намекнул, что видеоданные для Veo в основном поступают с YouTube, настоящего сокровища, принадлежащего Google. «По сути, просматривая видео на YouTube — множество видео на YouTube — [Veo 2] может разобраться, знаете, в физике мира», — отметил он.
Google ранее упоминал TechCrunch, что их модели «могут быть» обучены на «некотором» контенте YouTube, в соответствии с соглашениями, заключенными с создателями YouTube. Стоит отметить, что в прошлом году Google расширил свои условия обслуживания, частично для получения большего объема данных для обучения своих моделей ИИ.
Связанная статья
Gemini предлагает пользователям из США бесплатную персонализированную генерацию изображений с помощью искусственного интеллекта
В понедельник компания Google объявила, что приложение Gemini расширяет доступ к своим персонализированным функциям генерации изображений, работающим на базе технологии Nano Banana, для более широкой
Новые функции Gemini в скором времени будут интегрированы в Google TV
В среду компания Google представила ряд новых функций на базе искусственного интеллекта, которые появятся в Google TV, в том числе специальный раздел для коротких видеороликов, благодаря которому YouT
На мероприятии Made by Google ’26 представлены новые продукты: Pixel 11, Pixel Watch 5, Pixel Tag и расширенные возможности Gemini
В ходе мероприятия «Made by Google 2026», состоявшегося в среду, компания Google представила ряд новых продуктов, в том числе серию Pixel 11, Pixel Watch 5 и устройство слежения, призванное составить
Рекомендации по связанным специальным темам
Комментарии (2)
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.

В недавнем эпизоде подкаста Possible, ведущим которого является сооснователь LinkedIn Рид Хоффман, генеральный директор Google DeepMind Демис Хассабис поделился захватывающими новостями о планах Google. Он рассказал, что Google планирует объединить свои модели ИИ Gemini с моделями генерации видео Veo. Это слияние направлено на улучшение понимания Gemini физического мира, делая его более способным к восприятию реальных динамик.
Хассабис подчеркнул, что с самого начала Gemini создавался как мультимодальная модель. «Мы всегда разрабатывали Gemini, нашу базовую модель, как мультимодальную с самого начала», — пояснил он. Мотивация этого подхода? Видение универсального цифрового помощника, который действительно может помогать в повседневной жизни. «Помощник, который … реально помогает в реальном мире», — уточнил Хассабис.
Индустрия ИИ неуклонно движется к тому, что можно назвать «omni» моделями — способными обрабатывать и синтезировать различные типы медиа. Например, последние итерации Gemini от Google могут создавать не только текст, но также аудио и изображения. Тем временем стандартная модель ChatGPT от OpenAI может мгновенно генерировать изображения, включая очаровательные арты в стиле Studio Ghibli. Amazon не отстает, планируя выпустить модель «из любого в любой» позже в этом году.
Эти omni-модели требуют огромного объема обучающих данных — подумайте об изображениях, видео, аудио и тексте. Хассабис намекнул, что видеоданные для Veo в основном поступают с YouTube, настоящего сокровища, принадлежащего Google. «По сути, просматривая видео на YouTube — множество видео на YouTube — [Veo 2] может разобраться, знаете, в физике мира», — отметил он.
Google ранее упоминал TechCrunch, что их модели «могут быть» обучены на «некотором» контенте YouTube, в соответствии с соглашениями, заключенными с создателями YouTube. Стоит отметить, что в прошлом году Google расширил свои условия обслуживания, частично для получения большего объема данных для обучения своих моделей ИИ.
Gemini предлагает пользователям из США бесплатную персонализированную генерацию изображений с помощью искусственного интеллекта
В понедельник компания Google объявила, что приложение Gemini расширяет доступ к своим персонализированным функциям генерации изображений, работающим на базе технологии Nano Banana, для более широкой
Новые функции Gemini в скором времени будут интегрированы в Google TV
В среду компания Google представила ряд новых функций на базе искусственного интеллекта, которые появятся в Google TV, в том числе специальный раздел для коротких видеороликов, благодаря которому YouT
На мероприятии Made by Google ’26 представлены новые продукты: Pixel 11, Pixel Watch 5, Pixel Tag и расширенные возможности Gemini
В ходе мероприятия «Made by Google 2026», состоявшегося в среду, компания Google представила ряд новых продуктов, в том числе серию Pixel 11, Pixel Watch 5 и устройство слежения, призванное составить
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.











