Meitun LongCat, LoHoSearch 출시…BrowseComp 점수 30% 미만으로 하락
지난 1년 동안 검색 에이전트의 능력은 주로 BrowseComp에 의해 정의되어 왔습니다. 그러나 이 벤치마크는 그 관련성을 잃어가고 있습니다. 이 벤치마크는 단 10개월 만에 모델 성능을 30%에서 90%로 끌어올렸지만, 그 가치는 빠르게 감소하고 있습니다. 7월 17일, 미투안의 LongCat은 검색 에이전트 개발에서 의미 있는 진전을 다시 불러일으키기 위해 설계된 더 엄격한 평가인 LoHoSearch를 출시했습니다.

LoHoSearch의 과제는 수동으로 제작된 것이 아니라 762만 개의 엔티티를 포함하는 위키백과 지식 그래프에서 자동으로 생성됩니다. 기계 생성으로 인해 이러한 작업은 인간 주석이 일관되게 재현할 수 없는 수준의 검색 공간과 구조적 복잡성에 도달합니다. 간단히 말해, 이전 벤치마크가 인간이 설계한 한계에 제한되었던 반면, LoHoSearch는 질문 생성을 지식 그래프에 위임하여 이러한 상한선을 효과적으로 제거합니다.

결과는 극명합니다. 11개 주요 모델 중 최고 점수는 단 34.74%에 불과했으며, 그 다음 세 모델은 15%에서 16% 사이의 점수를 기록했습니다. 반면, 동일한 모델들은 BrowseComp에서 약 90%의 점수를 달성합니다. 이 격차는 현재 검색 에이전트의 진정한 한계를 강조합니다. 주목할 만한 점은 컨텍스트 전략이 체감 수익을 낳는다는 것입니다. LoHoSearch에서 가장 우수한 컨텍스트 접근 방식은 점수를 단 6.8%p 향상시켰지만, BrowseComp에서는 14%p 향상되었습니다. 이는 새로운 벤치마크 하에서 능력 격차를 메우기 위해 프롬프트 및 컨텍스트 엔지니어링에 의존하는 것이 대부분 효과적이지 않음을 시사합니다.
LoHoSearch는 11개 도메인에 걸쳐 544개의 질문을 포함하며, 트리 및 그래프 형식으로 구성되어 오픈소스로 공개되었습니다. 구식 벤치마크가 정체기에 접어들면서 검색 에이전트의 진정한 과제는 이제 시작이며, LoHoSearch는 곧 필수적인 평가 기준이 될 수 있습니다.
관련 기사
MiniMax, GPT-5.5을 능가하는 국내 AI 대형 모델 M3 공개
중국의 AI 산업은 시위 기술(Xiyu Technology)의 최신 대규모 언어 모델인 MiniMax M3의 공식 출시를 통해 주요 기술적 도약을 목격했습니다. 이 고급 시스템은 최첨단의 코딩 숙련도와 최대 100만 토큰의 초장문 컨텍스트 창을 지원합니다. 특히, 이미지 및 비디오 처리를 포함한 멀티모달 입력과 컴퓨터 데스크톱 상호작용을 네이티브로 지원하여, 이 세 가지 핵심 기능을 통합한 중국 최초의 오픈소스 모델이 되었습니다.표준 벤치마크에
인도는 발신자 ID 앱을 통해 스팸 데이터를 통신사와 공유하도록 의무화함
인도는 발신자 ID 및 통화 관리 애플리케이션이 사용자의 스팸 보고를 통신 사업자와 공유하도록 의무화하는 스팸 방지 규정을 확대했으며, 이 조치는 대표적인 스팸 차단 앱 제공업체인 트루콜러(Truecaller)가 해당 정책을 반경쟁적이라고 규정하는 결과를 낳았습니다.금요일, 인도의 통신 규제 기관인 인도 통신 규제 위원회(TRAI)는 상업적 통신을 규율하는 규칙을 업데이트했습니다. 이 업데이트는 사용자가 통화를 스팸이나 잡음으로 표시할 수 있
Qwen AI 플랫폼이 GLM-5.3 및 DeepSeek-V4-Pro의 공식 출시를 통해 모델 행렬을 확장합니다
알리바바 클라우드의 Qwen AI 플랫폼(MaaS)은 최근 모델 서비스 매트릭스를 확장하여 지푸(Zhipu)의 플래그십 대형 모델 GLM-5.3과 딥시크(DeepSeek)-V4-Pro의 공식 출시를 통합했습니다. 해당 API 서비스는 이제 공개되어 개발자들이 이러한 모델 기능을 빠르게 접근하고 활용할 수 있도록 지원합니다.이렇게 새로 출시된 두 가지 모델은 프로그래밍 및 지능형 에이전트의 핵심 응용 시나리오를 위해 특별히 설계되었습니다. 최신
관련 특별 주제 추천
의견 (0)
0/500
지난 1년 동안 검색 에이전트의 능력은 주로 BrowseComp에 의해 정의되어 왔습니다. 그러나 이 벤치마크는 그 관련성을 잃어가고 있습니다. 이 벤치마크는 단 10개월 만에 모델 성능을 30%에서 90%로 끌어올렸지만, 그 가치는 빠르게 감소하고 있습니다. 7월 17일, 미투안의 LongCat은 검색 에이전트 개발에서 의미 있는 진전을 다시 불러일으키기 위해 설계된 더 엄격한 평가인 LoHoSearch를 출시했습니다.

LoHoSearch의 과제는 수동으로 제작된 것이 아니라 762만 개의 엔티티를 포함하는 위키백과 지식 그래프에서 자동으로 생성됩니다. 기계 생성으로 인해 이러한 작업은 인간 주석이 일관되게 재현할 수 없는 수준의 검색 공간과 구조적 복잡성에 도달합니다. 간단히 말해, 이전 벤치마크가 인간이 설계한 한계에 제한되었던 반면, LoHoSearch는 질문 생성을 지식 그래프에 위임하여 이러한 상한선을 효과적으로 제거합니다.

결과는 극명합니다. 11개 주요 모델 중 최고 점수는 단 34.74%에 불과했으며, 그 다음 세 모델은 15%에서 16% 사이의 점수를 기록했습니다. 반면, 동일한 모델들은 BrowseComp에서 약 90%의 점수를 달성합니다. 이 격차는 현재 검색 에이전트의 진정한 한계를 강조합니다. 주목할 만한 점은 컨텍스트 전략이 체감 수익을 낳는다는 것입니다. LoHoSearch에서 가장 우수한 컨텍스트 접근 방식은 점수를 단 6.8%p 향상시켰지만, BrowseComp에서는 14%p 향상되었습니다. 이는 새로운 벤치마크 하에서 능력 격차를 메우기 위해 프롬프트 및 컨텍스트 엔지니어링에 의존하는 것이 대부분 효과적이지 않음을 시사합니다.
LoHoSearch는 11개 도메인에 걸쳐 544개의 질문을 포함하며, 트리 및 그래프 형식으로 구성되어 오픈소스로 공개되었습니다. 구식 벤치마크가 정체기에 접어들면서 검색 에이전트의 진정한 과제는 이제 시작이며, LoHoSearch는 곧 필수적인 평가 기준이 될 수 있습니다.
MiniMax, GPT-5.5을 능가하는 국내 AI 대형 모델 M3 공개
중국의 AI 산업은 시위 기술(Xiyu Technology)의 최신 대규모 언어 모델인 MiniMax M3의 공식 출시를 통해 주요 기술적 도약을 목격했습니다. 이 고급 시스템은 최첨단의 코딩 숙련도와 최대 100만 토큰의 초장문 컨텍스트 창을 지원합니다. 특히, 이미지 및 비디오 처리를 포함한 멀티모달 입력과 컴퓨터 데스크톱 상호작용을 네이티브로 지원하여, 이 세 가지 핵심 기능을 통합한 중국 최초의 오픈소스 모델이 되었습니다.표준 벤치마크에
인도는 발신자 ID 앱을 통해 스팸 데이터를 통신사와 공유하도록 의무화함
인도는 발신자 ID 및 통화 관리 애플리케이션이 사용자의 스팸 보고를 통신 사업자와 공유하도록 의무화하는 스팸 방지 규정을 확대했으며, 이 조치는 대표적인 스팸 차단 앱 제공업체인 트루콜러(Truecaller)가 해당 정책을 반경쟁적이라고 규정하는 결과를 낳았습니다.금요일, 인도의 통신 규제 기관인 인도 통신 규제 위원회(TRAI)는 상업적 통신을 규율하는 규칙을 업데이트했습니다. 이 업데이트는 사용자가 통화를 스팸이나 잡음으로 표시할 수 있
Qwen AI 플랫폼이 GLM-5.3 및 DeepSeek-V4-Pro의 공식 출시를 통해 모델 행렬을 확장합니다
알리바바 클라우드의 Qwen AI 플랫폼(MaaS)은 최근 모델 서비스 매트릭스를 확장하여 지푸(Zhipu)의 플래그십 대형 모델 GLM-5.3과 딥시크(DeepSeek)-V4-Pro의 공식 출시를 통합했습니다. 해당 API 서비스는 이제 공개되어 개발자들이 이러한 모델 기능을 빠르게 접근하고 활용할 수 있도록 지원합니다.이렇게 새로 출시된 두 가지 모델은 프로그래밍 및 지능형 에이전트의 핵심 응용 시나리오를 위해 특별히 설계되었습니다. 최신





집






