Lar
A Apple apresenta o RubiCap AI para descrições de imagens em meio a preocupações com o desempenho
Na visão computacional, permitir que a IA observe e descreva cada detalhe de uma imagem com precisão semelhante à humana tem sido, há muito tempo, um dos principais desafios. Recentemente, a Apple, em colaboração com a Universidade de Wisconsin-Madison, lançou oficialmente uma nova estrutura de treinamento de IA chamada RubiCap .
Essa estrutura foi projetada especificamente para “legendagem densa de imagens”, com o objetivo de capacitar a IA a capturar e articular com precisão detalhes minuciosos — como “uma maçã vermelha sobre a mesa de madeira” ou “um pedestre à distância” — em vez de oferecer apenas resumos genéricos.

Aprendizado por reforço com grande impacto: Qwen2.5 atua como o “árbitro”
A legenda de imagens tradicional geralmente depende de anotações humanas dispendiosas ou de grandes modelos propensos a alucinações, resultando em qualidade de dados inconsistente. A equipe de pesquisa da Apple abordou isso com uma abordagem inovadora de aprendizado por reforço. O sistema primeiro usa o GPT-4 e o Gemini 1.5 Pro para gerar descrições candidatas. O Gemini 1.5 Pro então refina os critérios de pontuação, enquanto o modelo Qwen2.5 atua como um árbitro, fornecendo pontuações e feedback.
Esse feedback estruturado e preciso permite que o modelo de treinamento identifique e corrija erros com clareza, alcançando maior precisão descritiva mesmo com um número menor de parâmetros.
A vantagem do modelo compacto: taxas de alucinação mais baixas superam modelos com trilhões de parâmetros
Os modelos da série RubiCap (variando de 2 bilhões a 7 bilhões de parâmetros) treinados nessa estrutura demonstraram eficiência excepcional nas avaliações. Dados experimentais revelam que o modelo RubiCap de 7 bilhões de parâmetros alcançou as melhores pontuações em testes cegos, com uma taxa de erro de alucinação inferior à de um modelo grande líder de 720 bilhões de parâmetros. Notavelmente, a versão mini de 3 bilhões de parâmetros chegou a superar sua contraparte de 7 bilhões de parâmetros em certas métricas.
Artigo relacionado
Meta Remove Funcionalidade de Edição de Fotos por IA Após Reação Negativa dos Usuários
A Meta, gigante das redes sociais, está novamente envolvida em um debate público sobre o delicado equilíbrio entre inteligência artificial e privacidade dos usuários. De acordo com a TechCrunch, o Superintelligence Labs da Meta apresentou um novo ger
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Recomendações de tópicos especiais relacionados
Comentários (0)
Na visão computacional, permitir que a IA observe e descreva cada detalhe de uma imagem com precisão semelhante à humana tem sido, há muito tempo, um dos principais desafios. Recentemente, a Apple, em colaboração com a Universidade de Wisconsin-Madison, lançou oficialmente uma nova estrutura de treinamento de IA chamada
Essa estrutura foi projetada especificamente para “legendagem densa de imagens”, com o objetivo de capacitar a IA a capturar e articular com precisão detalhes minuciosos — como “uma maçã vermelha sobre a mesa de madeira” ou “um pedestre à distância” — em vez de oferecer apenas resumos genéricos.

Aprendizado por reforço com grande impacto: Qwen2.5 atua como o “árbitro”
A legenda de imagens tradicional geralmente depende de anotações humanas dispendiosas ou de grandes modelos propensos a alucinações, resultando em qualidade de dados inconsistente. A equipe de pesquisa da Apple abordou isso com uma abordagem inovadora de aprendizado por reforço. O sistema primeiro usa o GPT-4 e o Gemini 1.5 Pro para gerar descrições candidatas. O Gemini 1.5 Pro então refina os critérios de pontuação, enquanto o modelo Qwen2.5 atua como um árbitro, fornecendo pontuações e feedback.
Esse feedback estruturado e preciso permite que o modelo de treinamento identifique e corrija erros com clareza, alcançando maior precisão descritiva mesmo com um número menor de parâmetros.
A vantagem do modelo compacto: taxas de alucinação mais baixas superam modelos com trilhões de parâmetros
Os modelos da série RubiCap (variando de 2 bilhões a 7 bilhões de parâmetros) treinados nessa estrutura demonstraram eficiência excepcional nas avaliações. Dados experimentais revelam que o modelo RubiCap de 7 bilhões de parâmetros alcançou as melhores pontuações em testes cegos, com uma taxa de erro de alucinação inferior à de um modelo grande líder de 720 bilhões de parâmetros. Notavelmente, a versão mini de 3 bilhões de parâmetros chegou a superar sua contraparte de 7 bilhões de parâmetros em certas métricas.
Meta Remove Funcionalidade de Edição de Fotos por IA Após Reação Negativa dos Usuários
A Meta, gigante das redes sociais, está novamente envolvida em um debate público sobre o delicado equilíbrio entre inteligência artificial e privacidade dos usuários. De acordo com a TechCrunch, o Superintelligence Labs da Meta apresentou um novo ger
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











