Дом
Google расширяет возможности API Gemini по поиску файлов за счет внедрения передовых мультимодальных функций RAG
Компания Google внедрила значительное обновление функции поиска файлов в своем API Gemini, предоставив разработчикам расширенные возможности мультимодального генерации с использованием результатов поиска (RAG). Это обновление выходит за рамки традиционного поиска, ограниченного только текстом, позволяя ИИ интерпретировать изображения и глубоко интегрироваться со сложными документами — это ключевой шаг вперед в обеспечении точности ИИ корпоративного уровня при поиске информации.
С технической точки зрения новая функция поиска файлов использует модель Gemini Embedding2. В отличие от предыдущих систем, ограниченных векторным поиском по тексту, обновленная система отличается унифицированным мультимодальным встраиванием, что позволяет ей распознавать и обрабатывать визуальный контент в PDF-файлах, документах и различных типах изображений. Это означает, что разработчикам больше не нужно создавать сложные векторные базы данных или системы сегментации документов; они могут реализовать полный рабочий процесс RAG — от загрузки данных до поиска информации — непосредственно в рамках API Gemini.

На практике это усовершенствование решает распространенную проблему: традиционные системы RAG часто не справляются с обработкой нетекстового контента. Раньше графики, проектные схемы или скриншоты продуктов в документах были «слепыми зонами» для ИИ, из-за чего упускался важный контекст. Теперь API Gemini изначально распознает эти визуальные элементы. Например, когда компания загружает PDF-файл с техническими архитектурными схемами или графиками тенденций продаж, ИИ может объединять данные графиков с текстовыми описаниями для предоставления точных аналитических выводов, что значительно повышает полезность ботов службы поддержки клиентов и систем анализа документов.
Для улучшения управления обширными базами знаний Google добавил возможность фильтрации по настраиваемым метаданным. Разработчики могут маркировать файлы по отделу, времени или категории, а при поиске отфильтровывать нерелевантную информацию с помощью заранее заданных условий, что гарантирует более целенаправленные ответы, сгенерированные ИИ.
Кроме того, чтобы учесть опасения относительно отслеживаемости информации, API Gemini теперь поддерживает цитирование на уровне страниц. При генерации ответов ИИ четко указывает конкретный номер страницы для каждого фрагмента информации, а не просто ссылается на весь файл. Такая прозрачность помогает пользователям быстро проверять точность и способствует более глубокому изучению материала.
Улучшенная функция поиска по файлам теперь доступна разработчикам по всему миру. Пользователи могут получить к ней доступ через Google AI Studio или платформу Google Cloud, чтобы оценить удобство разработки и повышение эффективности, которые обеспечивает мультимодальная технология RAG.
Связанная статья
Умные очки Apple могут быть представлены на WWDC27 с акцентом на защиту конфиденциальности
Журналист Bloomberg Марк Гурман сообщает, что умные очки Apple под кодовым названием N50 должны дебютировать на WWDC27 в июне 2027 года, а их розничные продажи ожидаются осенью 2027 года. Изначально выпуск устройства планировался на конец этого года
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт
Рекомендации по связанным специальным темам
Комментарии (0)
Компания Google внедрила значительное обновление функции поиска файлов в своем API Gemini, предоставив разработчикам расширенные возможности мультимодального генерации с использованием результатов поиска (RAG). Это обновление выходит за рамки традиционного поиска, ограниченного только текстом, позволяя ИИ интерпретировать изображения и глубоко интегрироваться со сложными документами — это ключевой шаг вперед в обеспечении точности ИИ корпоративного уровня при поиске информации.
С технической точки зрения новая функция поиска файлов использует модель Gemini Embedding2. В отличие от предыдущих систем, ограниченных векторным поиском по тексту, обновленная система отличается унифицированным мультимодальным встраиванием, что позволяет ей распознавать и обрабатывать визуальный контент в PDF-файлах, документах и различных типах изображений. Это означает, что разработчикам больше не нужно создавать сложные векторные базы данных или системы сегментации документов; они могут реализовать полный рабочий процесс RAG — от загрузки данных до поиска информации — непосредственно в рамках API Gemini.

На практике это усовершенствование решает распространенную проблему: традиционные системы RAG часто не справляются с обработкой нетекстового контента. Раньше графики, проектные схемы или скриншоты продуктов в документах были «слепыми зонами» для ИИ, из-за чего упускался важный контекст. Теперь API Gemini изначально распознает эти визуальные элементы. Например, когда компания загружает PDF-файл с техническими архитектурными схемами или графиками тенденций продаж, ИИ может объединять данные графиков с текстовыми описаниями для предоставления точных аналитических выводов, что значительно повышает полезность ботов службы поддержки клиентов и систем анализа документов.
Для улучшения управления обширными базами знаний Google добавил возможность фильтрации по настраиваемым метаданным. Разработчики могут маркировать файлы по отделу, времени или категории, а при поиске отфильтровывать нерелевантную информацию с помощью заранее заданных условий, что гарантирует более целенаправленные ответы, сгенерированные ИИ.
Кроме того, чтобы учесть опасения относительно отслеживаемости информации, API Gemini теперь поддерживает цитирование на уровне страниц. При генерации ответов ИИ четко указывает конкретный номер страницы для каждого фрагмента информации, а не просто ссылается на весь файл. Такая прозрачность помогает пользователям быстро проверять точность и способствует более глубокому изучению материала.
Улучшенная функция поиска по файлам теперь доступна разработчикам по всему миру. Пользователи могут получить к ней доступ через Google AI Studio или платформу Google Cloud, чтобы оценить удобство разработки и повышение эффективности, которые обеспечивает мультимодальная технология RAG.
Умные очки Apple могут быть представлены на WWDC27 с акцентом на защиту конфиденциальности
Журналист Bloomberg Марк Гурман сообщает, что умные очки Apple под кодовым названием N50 должны дебютировать на WWDC27 в июне 2027 года, а их розничные продажи ожидаются осенью 2027 года. Изначально выпуск устройства планировался на конец этого года
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт











