Hogar
Google mejora la búsqueda de archivos de la API de Gemini con funciones avanzadas de RAG multimodal
Google ha lanzado una importante actualización de la función de búsqueda de archivos de su API Gemini, que ofrece a los desarrolladores capacidades mejoradas de generación aumentada por recuperación multimodal (RAG). Esta actualización va más allá de la recuperación tradicional basada únicamente en texto, ya que permite a la IA interpretar imágenes e integrarse en profundidad con documentos complejos, lo que supone un avance clave para la precisión de la IA a nivel empresarial en la recuperación de información.
Técnicamente, la nueva función de búsqueda de archivos aprovecha el modelo Gemini Embedding2. A diferencia de los sistemas anteriores, que se limitaban a la búsqueda de vectores de texto, el sistema actualizado cuenta con una incrustación multimodal unificada, lo que le permite reconocer y procesar contenido visual dentro de archivos PDF, documentos y diversos tipos de imágenes. Esto significa que los desarrolladores ya no necesitan crear complejas bases de datos vectoriales ni sistemas de segmentación de documentos; pueden lograr un flujo de trabajo RAG completo —desde la carga de datos hasta la recuperación de información— directamente dentro de la API de Gemini.

En la práctica, este avance resuelve un problema habitual: los sistemas RAG tradicionales a menudo no logran procesar contenido no textual. Anteriormente, los gráficos, los diagramas de diseño o las capturas de pantalla de productos en los documentos eran puntos ciegos para la IA, lo que provocaba que se pasara por alto contexto clave. Ahora, la API de Gemini comprende de forma nativa estos elementos visuales. Por ejemplo, cuando una empresa sube un PDF con diagramas de arquitectura técnica o gráficos de tendencias de ventas, la IA puede combinar los datos de los gráficos con las descripciones de texto para ofrecer información precisa, lo que mejora enormemente la utilidad de los bots de atención al cliente y los sistemas de análisis de documentos.
Para mejorar la gestión de grandes bases de conocimientos, Google ha añadido el filtrado personalizado de metadatos. Los desarrolladores pueden etiquetar los archivos por departamento, fecha o categoría y, durante la recuperación, filtrar la información irrelevante mediante condiciones predefinidas, lo que garantiza que las respuestas generadas por la IA sean más específicas.
Además, para dar respuesta a las preocupaciones sobre la trazabilidad de la información, la API de Gemini admite ahora citas a nivel de página. Al generar respuestas, la IA indica claramente el número de página específico de cada dato, en lugar de limitarse a hacer referencia al archivo completo. Esta transparencia ayuda a los usuarios a verificar rápidamente la exactitud y facilita una lectura más profunda.
La función mejorada de búsqueda de archivos ya está disponible para los desarrolladores de todo el mundo. Los usuarios pueden acceder a ella a través de Google AI Studio o de la plataforma Google Cloud para disfrutar de la comodidad en el desarrollo y las mejoras en la eficiencia que ofrece el RAG multimodal.
Artículo relacionado
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Google ha lanzado una importante actualización de la función de búsqueda de archivos de su API Gemini, que ofrece a los desarrolladores capacidades mejoradas de generación aumentada por recuperación multimodal (RAG). Esta actualización va más allá de la recuperación tradicional basada únicamente en texto, ya que permite a la IA interpretar imágenes e integrarse en profundidad con documentos complejos, lo que supone un avance clave para la precisión de la IA a nivel empresarial en la recuperación de información.
Técnicamente, la nueva función de búsqueda de archivos aprovecha el modelo Gemini Embedding2. A diferencia de los sistemas anteriores, que se limitaban a la búsqueda de vectores de texto, el sistema actualizado cuenta con una incrustación multimodal unificada, lo que le permite reconocer y procesar contenido visual dentro de archivos PDF, documentos y diversos tipos de imágenes. Esto significa que los desarrolladores ya no necesitan crear complejas bases de datos vectoriales ni sistemas de segmentación de documentos; pueden lograr un flujo de trabajo RAG completo —desde la carga de datos hasta la recuperación de información— directamente dentro de la API de Gemini.

En la práctica, este avance resuelve un problema habitual: los sistemas RAG tradicionales a menudo no logran procesar contenido no textual. Anteriormente, los gráficos, los diagramas de diseño o las capturas de pantalla de productos en los documentos eran puntos ciegos para la IA, lo que provocaba que se pasara por alto contexto clave. Ahora, la API de Gemini comprende de forma nativa estos elementos visuales. Por ejemplo, cuando una empresa sube un PDF con diagramas de arquitectura técnica o gráficos de tendencias de ventas, la IA puede combinar los datos de los gráficos con las descripciones de texto para ofrecer información precisa, lo que mejora enormemente la utilidad de los bots de atención al cliente y los sistemas de análisis de documentos.
Para mejorar la gestión de grandes bases de conocimientos, Google ha añadido el filtrado personalizado de metadatos. Los desarrolladores pueden etiquetar los archivos por departamento, fecha o categoría y, durante la recuperación, filtrar la información irrelevante mediante condiciones predefinidas, lo que garantiza que las respuestas generadas por la IA sean más específicas.
Además, para dar respuesta a las preocupaciones sobre la trazabilidad de la información, la API de Gemini admite ahora citas a nivel de página. Al generar respuestas, la IA indica claramente el número de página específico de cada dato, en lugar de limitarse a hacer referencia al archivo completo. Esta transparencia ayuda a los usuarios a verificar rápidamente la exactitud y facilita una lectura más profunda.
La función mejorada de búsqueda de archivos ya está disponible para los desarrolladores de todo el mundo. Los usuarios pueden acceder a ella a través de Google AI Studio o de la plataforma Google Cloud para disfrutar de la comodidad en el desarrollo y las mejoras en la eficiencia que ofrece el RAG multimodal.
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi











