Google Gemini Embedding 2 дебютирует как первая полностью мультимодальная модель
Около 10 марта 2026 года компания Google официально запустила Gemini Embedding 2. Это первая полностью мультимодальная модель встраивания, созданная на базе архитектуры Gemini. В настоящее время она доступна в режиме публичной предварительной версии через API Gemini и Vertex AI, что позволяет разработчикам сразу же приступить к ее использованию и тестированию.
Единое пространство вложений, разрушающее модальные барьеры
Основная инновация Gemini Embedding 2 заключается в его способности отображать различные типы данных — включая текст, изображения, видео, аудио и документы, такие как PDF — в единое векторное пространство вложений. Такая конструкция полностью обеспечивает кросс-модальный поиск и классификацию, поддерживает более 100 языков и позволяет разным типам данных по-настоящему «говорить на одном языке».

Возможности смешанного ввода для точного семантического понимания
Модель изначально поддерживает смешанные входные данные, такие как изображения в паре с текстом или видео в сочетании с аудио. Она способна глубоко понимать семантические связи между различными типами медиа, а не просто обрабатывать их параллельно, что приводит к качественному скачку в понимании мультимедийного контента.
Встроенная обработка аудио без транскрипции ASR
Еще одним важным прорывом является функция прямого встраивания аудио. Пользователи могут напрямую вводить необработанные аудиофайлы, и модель выдает высококачественные векторы встраивания без необходимости предварительного преобразования речи в текст (ASR). Это значительно оптимизирует рабочие процессы с мультимодальными данными, одновременно сокращая задержки и вычислительные затраты.
Широкие сценарии применения открывают новую эру для RAG
Связанная статья
Доход Baidu за второй квартал достиг 31,3 млрд юаней, при этом доля бизнеса в области искусственного интеллекта превысила половину во втором квартале подряд
Финансовые результаты Baidu за второй квартал 2026 года показывают общую выручку в размере 31,3 млрд юаней, при этом выручка от основного бизнеса составила 25,2 млрд юаней. Доход, генерируемый за счет искусственного интеллекта, теперь составляет 50%
OpenAI обогнала Anthropic по доле рынка среди корпоративных клиентов на фоне роста расходов на ИИ
Последние данные платформы управления корпоративными кредитными картами и расходами Ramp показывают, что OpenAI вернула более 40% рынка корпоративного искусственного интеллекта в США, обогнав Anthropic. В мае доля Anthropic составляла 41% против 39%
Epson представляет коллаборативного робота AX6 с компактным дизайном и программированием без кода
The AX6 force- and power-limited robot arm is designed to be lightweight and easy to use. Source: EpsonКомпания Epson Robots на этой неделе расширила линейку своих шестиосевых роботов, представив коллаборативного робота AX6. По заявлению компании, но
Рекомендации по связанным специальным темам
Комментарии (0)
Около 10 марта 2026 года компания Google официально запустила Gemini Embedding 2. Это первая полностью мультимодальная модель встраивания, созданная на базе архитектуры Gemini. В настоящее время она доступна в режиме публичной предварительной версии через API Gemini и Vertex AI, что позволяет разработчикам сразу же приступить к ее использованию и тестированию.
Единое пространство вложений, разрушающее модальные барьеры
Основная инновация Gemini Embedding 2 заключается в его способности отображать различные типы данных — включая текст, изображения, видео, аудио и документы, такие как PDF — в единое векторное пространство вложений. Такая конструкция полностью обеспечивает кросс-модальный поиск и классификацию, поддерживает более 100 языков и позволяет разным типам данных по-настоящему «говорить на одном языке».

Возможности смешанного ввода для точного семантического понимания
Модель изначально поддерживает смешанные входные данные, такие как изображения в паре с текстом или видео в сочетании с аудио. Она способна глубоко понимать семантические связи между различными типами медиа, а не просто обрабатывать их параллельно, что приводит к качественному скачку в понимании мультимедийного контента.
Встроенная обработка аудио без транскрипции ASR
Еще одним важным прорывом является функция прямого встраивания аудио. Пользователи могут напрямую вводить необработанные аудиофайлы, и модель выдает высококачественные векторы встраивания без необходимости предварительного преобразования речи в текст (ASR). Это значительно оптимизирует рабочие процессы с мультимодальными данными, одновременно сокращая задержки и вычислительные затраты.
Широкие сценарии применения открывают новую эру для RAG
Доход Baidu за второй квартал достиг 31,3 млрд юаней, при этом доля бизнеса в области искусственного интеллекта превысила половину во втором квартале подряд
Финансовые результаты Baidu за второй квартал 2026 года показывают общую выручку в размере 31,3 млрд юаней, при этом выручка от основного бизнеса составила 25,2 млрд юаней. Доход, генерируемый за счет искусственного интеллекта, теперь составляет 50%
OpenAI обогнала Anthropic по доле рынка среди корпоративных клиентов на фоне роста расходов на ИИ
Последние данные платформы управления корпоративными кредитными картами и расходами Ramp показывают, что OpenAI вернула более 40% рынка корпоративного искусственного интеллекта в США, обогнав Anthropic. В мае доля Anthropic составляла 41% против 39%
Epson представляет коллаборативного робота AX6 с компактным дизайном и программированием без кода
The AX6 force- and power-limited robot arm is designed to be lightweight and easy to use. Source: EpsonКомпания Epson Robots на этой неделе расширила линейку своих шестиосевых роботов, представив коллаборативного робота AX6. По заявлению компании, но





Дом






