메타의 AI 모델 벤치 마크 : 오도?

그래서, 메타가 주말에 새로운 AI 모델인 Maverick을 공개했는데, 이미 LM Arena에서 2위를 차지하며 파장을 일으키고 있습니다. 아시다시피, 그곳은 사람들이 판사와 배심원 역할을 하며 다양한 AI 모델을 비교하고 마음에 드는 것을 선택하는 곳입니다. 하지만, 잠깐! 여기서 반전이 있습니다! LM Arena에서 멋지게 활약 중인 Maverick 버전은 개발자가 다운로드해서 사용할 수 있는 버전과는 조금 다르다는 것이 밝혀졌습니다.
X(예전 트위터로 알려진 플랫폼)에서 예리한 AI 연구원들이 메타가 LM Arena 버전을 "실험적 대화 버전"이라고 불렀다는 것을 발견했습니다. 그리고 Llama 웹사이트를 살펴보면, 테스트가 "대화에 최적화된 Llama 4 Maverick"으로 이루어졌다고 밝히는 차트가 있습니다. 이전에도 이야기했지만, LM Arena는 AI 성능을 측정하는 데 있어 최고의 기준은 아닙니다. 대부분의 AI 회사들은 이 테스트에서 더 높은 점수를 얻기 위해 모델을 조작하지 않거나, 적어도 그렇게 인정하지 않습니다.
문제는, 벤치마크에서 좋은 성적을 내도록 모델을 조정한 뒤, 일반 사용자에게는 다른 "기본" 버전을 공개하면, 개발자들이 실제 시나리오에서 모델이 얼마나 잘 작동할지 파악하기 어렵다는 점입니다. 게다가, 이건 좀 오해의 소지가 있지 않나요? 벤치마크는, 결함이 있더라도, 모델이 다양한 작업에서 무엇을 할 수 있고 할 수 없는지에 대한 명확한 그림을 제공해야 합니다.
X의 연구원들은 다운로드 가능한 Maverick과 LM Arena의 Maverick 사이에 큰 차이가 있다는 것을 빠르게 알아차렸습니다. Arena 버전은 이모지를 많이 사용하고, 길고 장황한 답변을 제공하는 것을 좋아한다고 합니다.
좋아요, Llama 4는 확실히 좀 과장된 느낌이네요 lol, 이건 뭐 수다 도시인가요 pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 2025년 4월 6일
어떤 이유로, Arena의 Llama 4 모델은 이모지를 훨씬 더 많이 사용합니다
together.ai에서는 더 나아 보입니다: pic.twitter.com/f74ODX4zTt
— Tech Dev Notes (@techdevnotes) 2025년 4월 6일
우리는 메타와 LM Arena를 운영하는 Chatbot Arena 팀에 연락해 이에 대해 어떤 입장인지 알아봤습니다. 계속 지켜봐 주세요!
관련 기사
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
마크 저커버그는 정말로 AI가 모든 사람을 위한 것이라고 믿을까요?
플레이어 로딩 중…메타는 이번 주 글리머(Glimmer)를 공개했습니다. 이는 누구나 다운로드하여 개인용 하드웨어에서 실행할 수 있는 오픈 가중치 AI 모델로, 자체 API를 통해서만 접근 가능한 메타의 더 강력한 모델 ‘뮤즈 스파크(Muse Spark)’와 뚜렷한 대비를 이룹니다. 이번 출시와 함께 마크 주커버그는 AI가 소수의 연구소에 의해 독점되기보다 모든 사람에게 접근 가능해야 한다는 내용의 서한을 발표했습니다. 그러나 이코노미(Equ
페이스북, 크리에이터를 위한 AI 동반자 앱 출시
페이스북은 수요일, 크리에이터 스튜디오를 전용 AI 보조 앱으로 전환해 크리에이터들이 플랫폼 내에서 영향력을 확대할 수 있도록 지원할 것이라고 밝혔다.메타는 이 AI 기반 도구를 제공함으로써 틱톡(TikTok)과 유튜브(YouTube)와의 치열한 경쟁 속에서도 크리에이터들이 페이스북에 계속 머물도록 유도하고자 한다. 또한 이 앱을 통해 콘텐츠 아이디어 구상
관련 특별 주제 추천
의견 (37)
0/500
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔

그래서, 메타가 주말에 새로운 AI 모델인 Maverick을 공개했는데, 이미 LM Arena에서 2위를 차지하며 파장을 일으키고 있습니다. 아시다시피, 그곳은 사람들이 판사와 배심원 역할을 하며 다양한 AI 모델을 비교하고 마음에 드는 것을 선택하는 곳입니다. 하지만, 잠깐! 여기서 반전이 있습니다! LM Arena에서 멋지게 활약 중인 Maverick 버전은 개발자가 다운로드해서 사용할 수 있는 버전과는 조금 다르다는 것이 밝혀졌습니다.
X(예전 트위터로 알려진 플랫폼)에서 예리한 AI 연구원들이 메타가 LM Arena 버전을 "실험적 대화 버전"이라고 불렀다는 것을 발견했습니다. 그리고 Llama 웹사이트를 살펴보면, 테스트가 "대화에 최적화된 Llama 4 Maverick"으로 이루어졌다고 밝히는 차트가 있습니다. 이전에도 이야기했지만, LM Arena는 AI 성능을 측정하는 데 있어 최고의 기준은 아닙니다. 대부분의 AI 회사들은 이 테스트에서 더 높은 점수를 얻기 위해 모델을 조작하지 않거나, 적어도 그렇게 인정하지 않습니다.
문제는, 벤치마크에서 좋은 성적을 내도록 모델을 조정한 뒤, 일반 사용자에게는 다른 "기본" 버전을 공개하면, 개발자들이 실제 시나리오에서 모델이 얼마나 잘 작동할지 파악하기 어렵다는 점입니다. 게다가, 이건 좀 오해의 소지가 있지 않나요? 벤치마크는, 결함이 있더라도, 모델이 다양한 작업에서 무엇을 할 수 있고 할 수 없는지에 대한 명확한 그림을 제공해야 합니다.
X의 연구원들은 다운로드 가능한 Maverick과 LM Arena의 Maverick 사이에 큰 차이가 있다는 것을 빠르게 알아차렸습니다. Arena 버전은 이모지를 많이 사용하고, 길고 장황한 답변을 제공하는 것을 좋아한다고 합니다.
좋아요, Llama 4는 확실히 좀 과장된 느낌이네요 lol, 이건 뭐 수다 도시인가요 pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 2025년 4월 6일
어떤 이유로, Arena의 Llama 4 모델은 이모지를 훨씬 더 많이 사용합니다
— Tech Dev Notes (@techdevnotes) 2025년 4월 6일
together.ai에서는 더 나아 보입니다: pic.twitter.com/f74ODX4zTt
우리는 메타와 LM Arena를 운영하는 Chatbot Arena 팀에 연락해 이에 대해 어떤 입장인지 알아봤습니다. 계속 지켜봐 주세요!
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
마크 저커버그는 정말로 AI가 모든 사람을 위한 것이라고 믿을까요?
플레이어 로딩 중…메타는 이번 주 글리머(Glimmer)를 공개했습니다. 이는 누구나 다운로드하여 개인용 하드웨어에서 실행할 수 있는 오픈 가중치 AI 모델로, 자체 API를 통해서만 접근 가능한 메타의 더 강력한 모델 ‘뮤즈 스파크(Muse Spark)’와 뚜렷한 대비를 이룹니다. 이번 출시와 함께 마크 주커버그는 AI가 소수의 연구소에 의해 독점되기보다 모든 사람에게 접근 가능해야 한다는 내용의 서한을 발표했습니다. 그러나 이코노미(Equ
페이스북, 크리에이터를 위한 AI 동반자 앱 출시
페이스북은 수요일, 크리에이터 스튜디오를 전용 AI 보조 앱으로 전환해 크리에이터들이 플랫폼 내에서 영향력을 확대할 수 있도록 지원할 것이라고 밝혔다.메타는 이 AI 기반 도구를 제공함으로써 틱톡(TikTok)과 유튜브(YouTube)와의 치열한 경쟁 속에서도 크리에이터들이 페이스북에 계속 머물도록 유도하고자 한다. 또한 이 앱을 통해 콘텐츠 아이디어 구상
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔





집






