xAI Grok 4.20, 업계 최저 수준의 환각 발생률을 달성하며 성능보다 무결성을 우선시
AI 거대 기업들이 최고 성능 점수를 달성하기 위해 열광적으로 자원을 쏟아붓는 동안, 엘론 머스크의 xAI는 이 분야에서 가장 고질적인 문제인 ‘정보 조작’에 초점을 맞추며 다른 접근 방식을 취하고 있다. 오늘, xAI는 Grok4.20Beta를 공식 출시했다. 절대적인 지능 점수에서는 여전히 최상위 모델들에 뒤처지지만, 핵심 지표인 ‘진실성’ 부문에서는 업계 신기록을 세웠다.

Artificial Analysis의 최신 평가에 따르면, Grok4.20은 추론 모드에서 지능 지수 48점을 기록했습니다. 와 (둘 다 57점)에는 미치지 못하지만, 사실 신뢰도 성능은 특히 인상적입니다:
낮은 환각 발생률: AA Omniscience 테스트에서 Grok4.20은 78%의 ‘비환각 발생률’을 기록하며 새로운 기록을 세웠습니다.
자신의 한계를 인지: 답할 수 없는 질문에 직면했을 때, 이 모델은 더 이상 허위 사실을 지어내지 않고 대신 “모르겠습니다”라고 더 정확하게 인정합니다. 이러한 정직성은 엄격한 사무 및 연구 환경에서 매우 중요합니다.
기술 아키텍처: 3-in-1 API 매트릭스
다양한 요구를 충족하기 위해 xAI는 세 가지 API 변형을 출시했습니다:
추론 모드: 속도보다 심층적인 논리적 사고를 우선시하며, 이는 이번 환각 기록을 경신하는 데 핵심적인 역할을 했습니다.
표준 모드: 빠른 응답과 일상적인 상호 작용에 최적화되어 있습니다.
다중 에이전트 모드: 복잡한 작업을 처리하기 위해 여러 AI 인스턴스가 협력하도록 지원합니다.
시장 전략: 더 많은 콘텐츠, 추가 비용 없음
독보적인 성능 외에도, Grok 4.20은 다음과 같은 공격적인 상업 전략을 도입합니다:
대용량 컨텍스트: 최대 200만 토큰의 컨텍스트 윈도우를 지원하여, 책 한 권 전체나 대규모 코드베이스를 한 번에 처리할 수 있습니다.
가격 경쟁력: 토큰 100만 개당 2~6달러로 책정되어, 이전 버전인 Grok4보다 저렴할 뿐만 아니라 현재 서구 주류 모델들 사이에서도 매우 경쟁력 있는 가격을 자랑합니다.
Grok4.20의 출시는 xAI의 전략적 전환을 반영합니다. 더 이상 AGI를 향한 총점 경쟁에 집착하지 않고, “기업 수준의 신뢰성”이라는 핵심 과제를 정확히 타겟팅하고 있습니다. 평가 기관이 언급했듯이, 다른 모델들이 “전지전능한 예언자”가 되기 위해 노력한다면, Grok4.20은 “결코 거짓말을 하지 않는 조력자”가 되기 위해 노력하고 있습니다.
데이터 정확도에 대한 요구 사항이 매우 높은 사용자에게 Grok4.20은 OpenAI와 구글에 이어 세 번째 주요 선택지가 될 수 있을 것이다.
관련 기사
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련
전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
마이크로소프트, 16개 언어에서 동시에 듣고 말할 수 있는 자체 개발한 최초의 전이중 AI 음성 모델 공개
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는
애플, 지역 기반 AI와 구글과의 제휴를 통해 시리 기능을 강화한 iOS 27 공개
최근 ‘더 인포메이션’은 애플이 곧 출시될 OS 27에 인공지능을 통합하기 위한 전략적 접근 방식을 집중 조명했다. 애플은 구글의 제미니(Gemini) 모델을 활용해 더 효율적이고 경량화된 AI를 훈련시킴으로써, 사용자 개인정보를 침해하지 않으면서도 강력한 로컬 엣지 AI 기능을 제공하고자 한다. 이러한 모델 정제 과정을 통해 더 작은 기기 기반 모델이 더
관련 특별 주제 추천
의견 (0)
0/500
AI 거대 기업들이 최고 성능 점수를 달성하기 위해 열광적으로 자원을 쏟아붓는 동안, 엘론 머스크의 xAI는 이 분야에서 가장 고질적인 문제인 ‘정보 조작’에 초점을 맞추며 다른 접근 방식을 취하고 있다. 오늘, xAI는 Grok4.20Beta를 공식 출시했다. 절대적인 지능 점수에서는 여전히 최상위 모델들에 뒤처지지만, 핵심 지표인 ‘진실성’ 부문에서는 업계 신기록을 세웠다.

Artificial Analysis의 최신 평가에 따르면, Grok4.20은 추론 모드에서 지능 지수 48점을 기록했습니다.
낮은 환각 발생률: AA Omniscience 테스트에서 Grok4.20은 78%의 ‘비환각 발생률’을 기록하며 새로운 기록을 세웠습니다.
자신의 한계를 인지: 답할 수 없는 질문에 직면했을 때, 이 모델은 더 이상 허위 사실을 지어내지 않고 대신 “모르겠습니다”라고 더 정확하게 인정합니다. 이러한 정직성은 엄격한 사무 및 연구 환경에서 매우 중요합니다.
기술 아키텍처: 3-in-1 API 매트릭스
다양한 요구를 충족하기 위해 xAI는 세 가지 API 변형을 출시했습니다:
추론 모드: 속도보다 심층적인 논리적 사고를 우선시하며, 이는 이번 환각 기록을 경신하는 데 핵심적인 역할을 했습니다.
표준 모드: 빠른 응답과 일상적인 상호 작용에 최적화되어 있습니다.
다중 에이전트 모드: 복잡한 작업을 처리하기 위해 여러 AI 인스턴스가 협력하도록 지원합니다.
시장 전략: 더 많은 콘텐츠, 추가 비용 없음
독보적인 성능 외에도, Grok 4.20은 다음과 같은 공격적인 상업 전략을 도입합니다:
대용량 컨텍스트: 최대 200만 토큰의 컨텍스트 윈도우를 지원하여, 책 한 권 전체나 대규모 코드베이스를 한 번에 처리할 수 있습니다.
가격 경쟁력: 토큰 100만 개당 2~6달러로 책정되어, 이전 버전인 Grok4보다 저렴할 뿐만 아니라 현재 서구 주류 모델들 사이에서도 매우 경쟁력 있는 가격을 자랑합니다.
Grok4.20의 출시는 xAI의 전략적 전환을 반영합니다. 더 이상 AGI를 향한 총점 경쟁에 집착하지 않고, “기업 수준의 신뢰성”이라는 핵심 과제를 정확히 타겟팅하고 있습니다. 평가 기관이 언급했듯이, 다른 모델들이 “전지전능한 예언자”가 되기 위해 노력한다면, Grok4.20은 “결코 거짓말을 하지 않는 조력자”가 되기 위해 노력하고 있습니다.
데이터 정확도에 대한 요구 사항이 매우 높은 사용자에게 Grok4.20은 OpenAI와 구글에 이어 세 번째 주요 선택지가 될 수 있을 것이다.
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련
전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
마이크로소프트, 16개 언어에서 동시에 듣고 말할 수 있는 자체 개발한 최초의 전이중 AI 음성 모델 공개
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는
애플, 지역 기반 AI와 구글과의 제휴를 통해 시리 기능을 강화한 iOS 27 공개
최근 ‘더 인포메이션’은 애플이 곧 출시될 OS 27에 인공지능을 통합하기 위한 전략적 접근 방식을 집중 조명했다. 애플은 구글의 제미니(Gemini) 모델을 활용해 더 효율적이고 경량화된 AI를 훈련시킴으로써, 사용자 개인정보를 침해하지 않으면서도 강력한 로컬 엣지 AI 기능을 제공하고자 한다. 이러한 모델 정제 과정을 통해 더 작은 기기 기반 모델이 더





집






