Hogar
Simplificación de la evaluación comparativa de la IA empresarial: El marco RAG de código abierto ofrece métricas de rendimiento científico

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











