Meta de Meta Modelo de referencia de Meta: ¿engañoso?

Entonces, Meta lanzó su nuevo modelo de IA, Maverick, durante el fin de semana, y ya está causando revuelo al obtener el segundo lugar en LM Arena. Sabes, ese es el lugar donde los humanos pueden jugar a ser jueces y jurado, comparando diferentes modelos de IA y eligiendo sus favoritos. Pero, ¡espera, hay un giro! Resulta que la versión de Maverick que está mostrando sus habilidades en LM Arena no es exactamente la misma que puedes descargar y usar como desarrollador.
Algunos investigadores de IA con ojos de águila en X (sí, la plataforma antes conocida como Twitter) notaron que Meta llamó a la versión de LM Arena una "versión de chat experimental". Y si echas un vistazo al sitio web de Llama, hay un gráfico que revela la verdad, diciendo que las pruebas se realizaron con "Llama 4 Maverick optimizado para la conversacionalidad". Ahora, hemos hablado de esto antes, pero LM Arena no es exactamente el estándar de oro para medir el rendimiento de la IA. La mayoría de las empresas de IA no modifican sus modelos solo para obtener mejores resultados en esta prueba, o al menos, no lo admiten.
El problema es que cuando ajustas un modelo para destacar en un benchmark pero luego lanzas una versión "vainilla" diferente al público, es difícil para los desarrolladores entender cómo funcionará realmente el modelo en escenarios del mundo real. Además, es un poco engañoso, ¿verdad? Los benchmarks, imperfectos como son, deberían darnos una imagen clara de lo que un modelo puede y no puede hacer en diferentes tareas.
Los investigadores en X han sido rápidos en notar algunas grandes diferencias entre el Maverick que puedes descargar y el que está en LM Arena. La versión de Arena aparentemente se centra mucho en los emojis y le encanta darte respuestas largas y detalladas.
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) April 6, 2025
por alguna razón, el modelo Llama 4 en Arena usa muchos más emojis
en together.ai, parece mejor: pic.twitter.com/f74ODX4zTt
— Tech Dev Notes (@techdevnotes) April 6, 2025
Hemos contactado a Meta y a los responsables de Chatbot Arena, quienes gestionan LM Arena, para ver qué tienen que decir sobre todo esto. ¡Mantente atento!
Artículo relacionado
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando
¿Cree realmente Mark Zuckerberg que la IA es para todos?
Cargando el reproductor…Meta presentó esta semana Glimmer, un modelo de inteligencia artificial con pesos abiertos que cualquiera puede descargar y ejecutar en hardware personal, un contraste marcado con Muse Spark, el modelo más potente de la empre
Facebook lanza una aplicación complementaria basada en IA para creadores
Facebook reveló el miércoles que va a transformar su Creator Studio en una aplicación complementaria dedicada basada en IA, lo que permitirá a los creadores ampliar su alcance en la plataforma.Al ofre
Recomendaciones de temas especiales relacionados
comentario (37)
0/500
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔

Entonces, Meta lanzó su nuevo modelo de IA, Maverick, durante el fin de semana, y ya está causando revuelo al obtener el segundo lugar en LM Arena. Sabes, ese es el lugar donde los humanos pueden jugar a ser jueces y jurado, comparando diferentes modelos de IA y eligiendo sus favoritos. Pero, ¡espera, hay un giro! Resulta que la versión de Maverick que está mostrando sus habilidades en LM Arena no es exactamente la misma que puedes descargar y usar como desarrollador.
Algunos investigadores de IA con ojos de águila en X (sí, la plataforma antes conocida como Twitter) notaron que Meta llamó a la versión de LM Arena una "versión de chat experimental". Y si echas un vistazo al sitio web de Llama, hay un gráfico que revela la verdad, diciendo que las pruebas se realizaron con "Llama 4 Maverick optimizado para la conversacionalidad". Ahora, hemos hablado de esto antes, pero LM Arena no es exactamente el estándar de oro para medir el rendimiento de la IA. La mayoría de las empresas de IA no modifican sus modelos solo para obtener mejores resultados en esta prueba, o al menos, no lo admiten.
El problema es que cuando ajustas un modelo para destacar en un benchmark pero luego lanzas una versión "vainilla" diferente al público, es difícil para los desarrolladores entender cómo funcionará realmente el modelo en escenarios del mundo real. Además, es un poco engañoso, ¿verdad? Los benchmarks, imperfectos como son, deberían darnos una imagen clara de lo que un modelo puede y no puede hacer en diferentes tareas.
Los investigadores en X han sido rápidos en notar algunas grandes diferencias entre el Maverick que puedes descargar y el que está en LM Arena. La versión de Arena aparentemente se centra mucho en los emojis y le encanta darte respuestas largas y detalladas.
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) April 6, 2025
por alguna razón, el modelo Llama 4 en Arena usa muchos más emojis
— Tech Dev Notes (@techdevnotes) April 6, 2025
en together.ai, parece mejor: pic.twitter.com/f74ODX4zTt
Hemos contactado a Meta y a los responsables de Chatbot Arena, quienes gestionan LM Arena, para ver qué tienen que decir sobre todo esto. ¡Mantente atento!
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando
¿Cree realmente Mark Zuckerberg que la IA es para todos?
Cargando el reproductor…Meta presentó esta semana Glimmer, un modelo de inteligencia artificial con pesos abiertos que cualquiera puede descargar y ejecutar en hardware personal, un contraste marcado con Muse Spark, el modelo más potente de la empre
Facebook lanza una aplicación complementaria basada en IA para creadores
Facebook reveló el miércoles que va a transformar su Creator Studio en una aplicación complementaria dedicada basada en IA, lo que permitirá a los creadores ampliar su alcance en la plataforma.Al ofre
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔





Hogar






