Benchmarks de modelo de AI da Meta: enganosos?

Então, a Meta lançou seu novo modelo de IA, Maverick, no fim de semana, e ele já está causando impacto ao conquistar o segundo lugar no LM Arena. Sabe, aquele é o lugar onde humanos podem atuar como juiz e júri, comparando diferentes modelos de IA e escolhendo seus favoritos. Mas, espera aí, tem uma reviravolta! Acontece que a versão do Maverick que está se exibindo no LM Arena não é exatamente a mesma que você pode baixar e experimentar como desenvolvedor.
Alguns pesquisadores de IA com olhos de águia no X (sim, a plataforma anteriormente conhecida como Twitter) notaram que a Meta chamou a versão do LM Arena de uma "versão experimental de chat". E se você der uma espiada no site do Llama, há um gráfico que revela tudo, dizendo que os testes foram feitos com "Llama 4 Maverick otimizado para conversação". Já falamos sobre isso antes, mas o LM Arena não é exatamente o padrão ouro para medir o desempenho de IA. A maioria das empresas de IA não mexe em seus modelos só para obter uma pontuação melhor nesse teste — ou pelo menos, elas não admitem isso.
O problema é que, quando você ajusta um modelo para arrasar em um benchmark, mas depois lança uma versão "vanilla" diferente para o público, é difícil para os desenvolvedores descobrirem como o modelo realmente se sairá em cenários do mundo real. Além disso, é meio enganador, né? Benchmarks, por mais falhos que sejam, deveriam nos dar uma imagem clara do que um modelo pode ou não fazer em diferentes tarefas.
Pesquisadores no X foram rápidos em notar algumas grandes diferenças entre o Maverick que você pode baixar e o que está no LM Arena. A versão do Arena aparentemente adora emojis e gosta de dar respostas longas e prolongadas.
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 6 de abril de 2025
por algum motivo, o modelo Llama 4 no Arena usa muito mais emojis
no together.ai, parece melhor: pic.twitter.com/f74ODX4zTt
— Tech Dev Notes (@techdevnotes) 6 de abril de 2025
Entramos em contato com a Meta e com as pessoas do Chatbot Arena, que administram o LM Arena, para ver o que eles têm a dizer sobre tudo isso. Fique ligado!
Artigo relacionado
A Frontier AI Labs se recusa a divulgar estratégias de contenção para modelos rebeldes
Pesquisas recentes indicam que muito poucos laboratórios líderes em IA publicaram ou demonstraram planos de resposta para contenção. Um plano de contenção define os procedimentos a serem seguidos quan
O Mark Zuckerberg realmente acredita que a IA é para todos?
Carregando o player…A Meta apresentou o Glimmer esta semana, um modelo de IA de pesos abertos que qualquer pessoa pode baixar e executar em hardware pessoal — um contraste acentuado com o Muse Spark, o modelo mais poderoso da empresa, que permanece
O Facebook lança um aplicativo complementar de IA para criadores de conteúdo
O Facebook revelou nesta quarta-feira que está transformando seu Creator Studio em um aplicativo complementar dedicado à IA, permitindo que os criadores ampliem seu alcance na plataforma.Ao disponibil
Recomendações de tópicos especiais relacionados
Comentários (37)
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔

Então, a Meta lançou seu novo modelo de IA, Maverick, no fim de semana, e ele já está causando impacto ao conquistar o segundo lugar no LM Arena. Sabe, aquele é o lugar onde humanos podem atuar como juiz e júri, comparando diferentes modelos de IA e escolhendo seus favoritos. Mas, espera aí, tem uma reviravolta! Acontece que a versão do Maverick que está se exibindo no LM Arena não é exatamente a mesma que você pode baixar e experimentar como desenvolvedor.
Alguns pesquisadores de IA com olhos de águia no X (sim, a plataforma anteriormente conhecida como Twitter) notaram que a Meta chamou a versão do LM Arena de uma "versão experimental de chat". E se você der uma espiada no site do Llama, há um gráfico que revela tudo, dizendo que os testes foram feitos com "Llama 4 Maverick otimizado para conversação". Já falamos sobre isso antes, mas o LM Arena não é exatamente o padrão ouro para medir o desempenho de IA. A maioria das empresas de IA não mexe em seus modelos só para obter uma pontuação melhor nesse teste — ou pelo menos, elas não admitem isso.
O problema é que, quando você ajusta um modelo para arrasar em um benchmark, mas depois lança uma versão "vanilla" diferente para o público, é difícil para os desenvolvedores descobrirem como o modelo realmente se sairá em cenários do mundo real. Além disso, é meio enganador, né? Benchmarks, por mais falhos que sejam, deveriam nos dar uma imagem clara do que um modelo pode ou não fazer em diferentes tarefas.
Pesquisadores no X foram rápidos em notar algumas grandes diferenças entre o Maverick que você pode baixar e o que está no LM Arena. A versão do Arena aparentemente adora emojis e gosta de dar respostas longas e prolongadas.
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 6 de abril de 2025
por algum motivo, o modelo Llama 4 no Arena usa muito mais emojis
— Tech Dev Notes (@techdevnotes) 6 de abril de 2025
no together.ai, parece melhor: pic.twitter.com/f74ODX4zTt
Entramos em contato com a Meta e com as pessoas do Chatbot Arena, que administram o LM Arena, para ver o que eles têm a dizer sobre tudo isso. Fique ligado!
A Frontier AI Labs se recusa a divulgar estratégias de contenção para modelos rebeldes
Pesquisas recentes indicam que muito poucos laboratórios líderes em IA publicaram ou demonstraram planos de resposta para contenção. Um plano de contenção define os procedimentos a serem seguidos quan
O Mark Zuckerberg realmente acredita que a IA é para todos?
Carregando o player…A Meta apresentou o Glimmer esta semana, um modelo de IA de pesos abertos que qualquer pessoa pode baixar e executar em hardware pessoal — um contraste acentuado com o Muse Spark, o modelo mais poderoso da empresa, que permanece
O Facebook lança um aplicativo complementar de IA para criadores de conteúdo
O Facebook revelou nesta quarta-feira que está transformando seu Creator Studio em um aplicativo complementar dedicado à IA, permitindo que os criadores ampliem seu alcance na plataforma.Ao disponibil
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔





Lar






