Lar
Benchmarking de IA empresarial simplificado: A estrutura RAG de código aberto oferece métricas de desempenho científico

As empresas estão investindo recursos significativos no desenvolvimento de sistemas Retrieval-Augmented Generation (RAG), com o objetivo de criar soluções precisas de IA empresarial. Mas qual é a eficácia desses sistemas na realidade?
Um grande obstáculo tem sido a falta de padrões de medição objetivos para a eficácia do RAG. Esse desafio encontra uma possível solução com o lançamento de hoje do Open RAG Eval, uma estrutura de código aberto desenvolvida de forma colaborativa pela Vectara e pela equipe de pesquisa do professor Jimmy Lin na Universidade de Waterloo.
O Open RAG Eval substitui as comparações subjetivas por uma metodologia rigorosa e mensurável para avaliar a precisão da recuperação, a qualidade da geração e as taxas de alucinação nas implementações do RAG corporativo.
A estrutura avalia o desempenho do sistema por meio de duas categorias de métricas principais: métricas de recuperação e geração. Ela funciona tanto com a plataforma da Vectara quanto com as soluções RAG personalizadas, fornecendo às equipes técnicas dados sistemáticos para identificar oportunidades de otimização.
"A medição precede o aprimoramento", explicou o professor Jimmy Lin em uma entrevista exclusiva. "Embora pudéssemos medir as métricas de recuperação de informações, como NDCG, precisão e recuperação, a avaliação da exatidão dos fatos continuava difícil, por isso embarcamos nesse projeto."
Por que a avaliação RAG continua sendo o obstáculo crítico para a IA empresarial
A Vectara foi pioneira na tecnologia RAG antes que ela se tornasse popular - lançando-a em outubro de 2022 e introduzindo conceitos de "IA fundamentada" em maio de 2023 para combater alucinações.
À medida que as implementações de RAG se tornam mais complexas - evoluindo de simples P&R para sistemas multiagentes - os desafios de avaliação se intensificam.
"Em ambientes agênticos, a avaliação torna-se duplamente crucial", observou o CEO da Vectara, Am Awadallah. "As alucinações no estágio inicial se agravam nas etapas de processamento, podendo levar a resultados finais incorretos."
Metodologia aberta de avaliação RAG: Quantificação dos componentes do sistema
A estrutura emprega uma abordagem de avaliação baseada em nuggets que desconstrói as respostas em elementos factuais essenciais.
Lin descreve como esse método analisa a capacidade dos sistemas de capturar e apresentar essas informações essenciais.
Quatro métricas específicas orientam as avaliações:
- Detecção de alucinação - Identifica informações sem suporte no conteúdo gerado
- Precisão das citações - Avalia a qualidade da documentação da fonte
- Auto nugget - Mede a inclusão de informações essenciais
- UMBRELA - Fornece uma avaliação abrangente do desempenho do retriever
A estrutura examina todos os fluxos de trabalho do RAG, revelando como os modelos de incorporação, os sistemas de recuperação, as estratégias de fragmentação e os LLMs produzem resultados coletivamente.
Principal inovação: Automação com base em LLMs
A inovação do Open RAG Eval está na automação de processos anteriormente manuais por meio de uma sofisticada integração de LLM.
"A avaliação tradicional se baseava em comparações binárias", explicou Lin. "Nossa abordagem automatizada revoluciona as metodologias de avaliação."
Embora a avaliação baseada em nuggets não seja nova, a estrutura a implementa por meio de LLMs baseados em Python, capazes de identificar fatos e detectar alucinações em pipelines de avaliação estruturados.
Posicionamento do ecossistema de avaliação
Em meio a estruturas de avaliação de IA em crescimento, como o Yourbench da Hugging Face e o Agentic Evaluations da Galileo, o Open RAG Eval se concentra especificamente em pipelines RAG em vez de resultados genéricos de LLM.
Criada com base na ciência de recuperação de informações estabelecida, em vez de métodos ad-hoc, a estrutura amplia as contribuições de código aberto da Vectara, incluindo o Hughes Hallucination Evaluation Model, amplamente adotado.
"Nós o chamamos deliberadamente de Open RAG Eval para incentivar a colaboração em todo o setor", enfatizou Awadallah. "Essa estrutura atende a uma necessidade crítica do mercado de avaliação padronizada do RAG."
Implementação prática
Entre os primeiros usuários está Jeff Hummel, da Anywhere.re, que prevê processos de avaliação simplificados por meio da colaboração da Vectara.
Hummel observou os desafios de dimensionamento que envolvem a complexidade da infraestrutura e o gerenciamento de custos, enfatizando os recursos de benchmarking preditivo da estrutura.
"Sem estruturas padronizadas, dependíamos muito do feedback subjetivo dos usuários", reconheceu Hummel. "As métricas objetivas transformarão nossa abordagem de dimensionamento."
Otimização das implementações do RAG
O Open RAG Eval ajuda os tomadores de decisão a abordar questões críticas de configuração:
- Abordagens de fragmentação de tokens versus fragmentação semântica
- Considerações sobre implementação de pesquisa híbrida
- Seleção de LLMs e otimização de prompts
- Limites de detecção de alucinação
A estrutura permite a otimização iterativa e orientada por dados - estabelecendo linhas de base, testando configurações e medindo melhorias. As versões futuras poderão incluir sugestões de otimização automatizadas e ferramentas de balanceamento de custo-desempenho.
Para empresas em vários níveis de maturidade de IA, o Open RAG Eval oferece padrões de avaliação científica que substituem a adivinhação e as avaliações subjetivas, ajudando a evitar erros de implementação dispendiosos e, ao mesmo tempo, avançando a tecnologia RAG.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)

As empresas estão investindo recursos significativos no desenvolvimento de sistemas Retrieval-Augmented Generation (RAG), com o objetivo de criar soluções precisas de IA empresarial. Mas qual é a eficácia desses sistemas na realidade?
Um grande obstáculo tem sido a falta de padrões de medição objetivos para a eficácia do RAG. Esse desafio encontra uma possível solução com o lançamento de hoje do Open RAG Eval, uma estrutura de código aberto desenvolvida de forma colaborativa pela Vectara e pela equipe de pesquisa do professor Jimmy Lin na Universidade de Waterloo.
O Open RAG Eval substitui as comparações subjetivas por uma metodologia rigorosa e mensurável para avaliar a precisão da recuperação, a qualidade da geração e as taxas de alucinação nas implementações do RAG corporativo.
A estrutura avalia o desempenho do sistema por meio de duas categorias de métricas principais: métricas de recuperação e geração. Ela funciona tanto com a plataforma da Vectara quanto com as soluções RAG personalizadas, fornecendo às equipes técnicas dados sistemáticos para identificar oportunidades de otimização.
"A medição precede o aprimoramento", explicou o professor Jimmy Lin em uma entrevista exclusiva. "Embora pudéssemos medir as métricas de recuperação de informações, como NDCG, precisão e recuperação, a avaliação da exatidão dos fatos continuava difícil, por isso embarcamos nesse projeto."
Por que a avaliação RAG continua sendo o obstáculo crítico para a IA empresarial
A Vectara foi pioneira na tecnologia RAG antes que ela se tornasse popular - lançando-a em outubro de 2022 e introduzindo conceitos de "IA fundamentada" em maio de 2023 para combater alucinações.
À medida que as implementações de RAG se tornam mais complexas - evoluindo de simples P&R para sistemas multiagentes - os desafios de avaliação se intensificam.
"Em ambientes agênticos, a avaliação torna-se duplamente crucial", observou o CEO da Vectara, Am Awadallah. "As alucinações no estágio inicial se agravam nas etapas de processamento, podendo levar a resultados finais incorretos."
Metodologia aberta de avaliação RAG: Quantificação dos componentes do sistema
A estrutura emprega uma abordagem de avaliação baseada em nuggets que desconstrói as respostas em elementos factuais essenciais.
Lin descreve como esse método analisa a capacidade dos sistemas de capturar e apresentar essas informações essenciais.
Quatro métricas específicas orientam as avaliações:
- Detecção de alucinação - Identifica informações sem suporte no conteúdo gerado
- Precisão das citações - Avalia a qualidade da documentação da fonte
- Auto nugget - Mede a inclusão de informações essenciais
- UMBRELA - Fornece uma avaliação abrangente do desempenho do retriever
A estrutura examina todos os fluxos de trabalho do RAG, revelando como os modelos de incorporação, os sistemas de recuperação, as estratégias de fragmentação e os LLMs produzem resultados coletivamente.
Principal inovação: Automação com base em LLMs
A inovação do Open RAG Eval está na automação de processos anteriormente manuais por meio de uma sofisticada integração de LLM.
"A avaliação tradicional se baseava em comparações binárias", explicou Lin. "Nossa abordagem automatizada revoluciona as metodologias de avaliação."
Embora a avaliação baseada em nuggets não seja nova, a estrutura a implementa por meio de LLMs baseados em Python, capazes de identificar fatos e detectar alucinações em pipelines de avaliação estruturados.
Posicionamento do ecossistema de avaliação
Em meio a estruturas de avaliação de IA em crescimento, como o Yourbench da Hugging Face e o Agentic Evaluations da Galileo, o Open RAG Eval se concentra especificamente em pipelines RAG em vez de resultados genéricos de LLM.
Criada com base na ciência de recuperação de informações estabelecida, em vez de métodos ad-hoc, a estrutura amplia as contribuições de código aberto da Vectara, incluindo o Hughes Hallucination Evaluation Model, amplamente adotado.
"Nós o chamamos deliberadamente de Open RAG Eval para incentivar a colaboração em todo o setor", enfatizou Awadallah. "Essa estrutura atende a uma necessidade crítica do mercado de avaliação padronizada do RAG."
Implementação prática
Entre os primeiros usuários está Jeff Hummel, da Anywhere.re, que prevê processos de avaliação simplificados por meio da colaboração da Vectara.
Hummel observou os desafios de dimensionamento que envolvem a complexidade da infraestrutura e o gerenciamento de custos, enfatizando os recursos de benchmarking preditivo da estrutura.
"Sem estruturas padronizadas, dependíamos muito do feedback subjetivo dos usuários", reconheceu Hummel. "As métricas objetivas transformarão nossa abordagem de dimensionamento."
Otimização das implementações do RAG
O Open RAG Eval ajuda os tomadores de decisão a abordar questões críticas de configuração:
- Abordagens de fragmentação de tokens versus fragmentação semântica
- Considerações sobre implementação de pesquisa híbrida
- Seleção de LLMs e otimização de prompts
- Limites de detecção de alucinação
A estrutura permite a otimização iterativa e orientada por dados - estabelecendo linhas de base, testando configurações e medindo melhorias. As versões futuras poderão incluir sugestões de otimização automatizadas e ferramentas de balanceamento de custo-desempenho.
Para empresas em vários níveis de maturidade de IA, o Open RAG Eval oferece padrões de avaliação científica que substituem a adivinhação e as avaliações subjetivas, ajudando a evitar erros de implementação dispendiosos e, ao mesmo tempo, avançando a tecnologia RAG.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











