Hogar
Simplificación de la evaluación comparativa de la IA empresarial: El marco RAG de código abierto ofrece métricas de rendimiento científico

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
Artículo relacionado
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Copa Super de Alibaba: Qwen3.8-Max hace su debut con herramientas de codificación y oficina mejoradas
Alibaba ha presentado oficialmente Qwen3.8-Max, un modelo base de última generación con 2,4 billones de parámetros. Este importante avance en inteligencia artificial ofrece mejoras sustanciales en áreas clave como la programación y las tareas profesi











