Deep Cogito의 LLMS는 IDA를 사용하여 유사한 크기의 모델보다 우수합니다
샌프란시스코에 본사를 둔 Deep Cogito는 최신 오픈 대규모 언어 모델(LLMs) 출시로 AI 커뮤니티에서 큰 반향을 일으키고 있습니다. 30억에서 700억 매개변수에 이르는 다양한 크기의 이 모델들은 단순한 AI 도구가 아니라, 회사가 "일반 초지능"이라고 부르는 대담한 발걸음입니다. Deep Cogito는 각 모델이 LLAMA, DeepSeek, Qwen의 유사한 크기의 선도적인 오픈 모델들을 대부분의 표준 벤치마크에서 능가한다고 주장합니다. 이는 상당한 주장인데, 더 인상적인 것은 그들의 70B 모델이 최근 출시된 Llama 4 109B Mixture-of-Experts (MoE) 모델을 능가했다는 보고입니다.
반복 증류 및 증폭 (IDA)
Deep Cogito의 획기적인 발전의 핵심에는 그들이 반복 증류 및 증폭(IDA)이라고 부르는 새로운 훈련 접근 방식이 있습니다. 이 방법은 "반복적 자기 개선을 통해 일반 초지능을 위한 확장 가능하고 효율적인 정렬 전략"으로 설명됩니다. 이는 전통적인 LLM 훈련의 한계를 넘어, 모델의 지능이 종종 더 큰 "감독자" 모델이나 인간 큐레이터에 의해 정의된 한계에 부딪히는 문제를 해결하도록 설계되었습니다.
IDA 프로세스는 반복적으로 수행되는 두 가지 주요 단계를 중심으로 이루어집니다:
- 증폭: 이 단계에서는 더 많은 컴퓨팅 파워를 사용하여 모델이 더 나은 솔루션이나 능력을 도출하도록 돕습니다. 이는 고급 추론 기술과 유사합니다.
- 증류: 여기서 모델은 이러한 향상된 능력을 내재화하여 매개변수를 정제합니다.
Deep Cogito는 이것이 "긍정적인 피드백 루프"를 만들어, 모델의 지능이 감독자의 지능에 의해 제한되지 않고 컴퓨팅 자원과 IDA 프로세스 자체의 효율성에 따라 더 직접적으로 성장할 수 있다고 주장합니다.
회사는 AlphaGo의 역사적 성공을 예로 들며, "고급 추론과 반복적 자기 개선"이 중요했다고 강조합니다. IDA는 이러한 요소를 LLM 훈련에 도입한다고 주장합니다. 또한 IDA의 효율성을 강조하며, 소규모 팀이 약 75일 만에 이 모델들을 개발했다고 밝혔습니다. 인간 피드백을 통한 강화 학습(RLHF)이나 더 큰 모델로부터의 표준 증류와 같은 다른 방법과 비교했을 때, IDA는 더 나은 확장성을 제공한다고 합니다.
증거로, Deep Cogito는 그들의 70B 모델이 Llama 3.3 70B(405B 모델에서 증류)와 Llama 4 Scout 109B(2T 매개변수 모델에서 증류)를 모두 능가한다고 강조합니다.
Deep Cogito 모델의 능력과 성능
Llama와 Qwen 체크포인트를 기반으로 구축된 새로운 Cogito 모델은 코딩, 함수 호출, 에이전트 애플리케이션에 맞춰져 있습니다. 두드러진 특징은 이중 기능성입니다: "각 모델은 직접 응답(표준 LLM)하거나 응답 전에 자기 성찰(추론 모델과 유사)할 수 있습니다." 이는 Claude 3.5와 같은 모델에서 볼 수 있는 능력을 반영합니다. 그러나 Deep Cogito는 매우 긴 추론 체인에 초점을 맞추지 않고, 더 빠른 응답과 더 짧은 체인의 증류 효율성을 우선시했다고 언급했습니다.
회사는 Cogito 모델을 직접 및 추론 모드에서 크기가 비슷한 최첨단 오픈 모델들과 비교한 광범위한 벤치마크 결과를 공유했습니다. MMLU, MMLU-Pro, ARC, GSM8K, MATH와 같은 다양한 벤치마크와 3B, 8B, 14B, 32B, 70B의 다양한 모델 크기에서 Cogito 모델은 일반적으로 상당한 성능 향상을 보여줍니다. 예를 들어, Cogito 70B 모델은 표준 모드에서 MMLU에서 91.73%를 기록하며 Llama 3.3 70B보다 +6.40% 향상되었고, 사고 모드에서는 91.00%로 Deepseek R1 Distill 70B보다 +4.40% 향상되었습니다. Livebench 점수도 이러한 성과를 반영합니다.
14B 모델의 벤치마크는 중간 크기 비교를 위해 다음과 같습니다:

Deep Cogito는 벤치마크가 실세계 유용성을 완전히 포착하지 않는다고 인정하면서도, 모델의 실제 성능에 자신감을 나타냅니다. 이번 출시는 미리보기 단계로 간주되며, 회사는 "이 스케일링 곡선의 초기 단계에 있다"고 밝혔습니다. 그들은 현재 크기에 대한 개선된 체크포인트를 출시하고, 앞으로 몇 주와 몇 달 안에 더 큰 MoE 모델(109B, 400B, 671B)을 소개할 계획입니다. 모든 미래 모델도 오픈소스로 제공될 것입니다.
관련 기사
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
관련 특별 주제 추천
의견 (29)
0/500
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡
샌프란시스코에 본사를 둔 Deep Cogito는 최신 오픈 대규모 언어 모델(LLMs) 출시로 AI 커뮤니티에서 큰 반향을 일으키고 있습니다. 30억에서 700억 매개변수에 이르는 다양한 크기의 이 모델들은 단순한 AI 도구가 아니라, 회사가 "일반 초지능"이라고 부르는 대담한 발걸음입니다. Deep Cogito는 각 모델이 LLAMA, DeepSeek, Qwen의 유사한 크기의 선도적인 오픈 모델들을 대부분의 표준 벤치마크에서 능가한다고 주장합니다. 이는 상당한 주장인데, 더 인상적인 것은 그들의 70B 모델이 최근 출시된 Llama 4 109B Mixture-of-Experts (MoE) 모델을 능가했다는 보고입니다.
반복 증류 및 증폭 (IDA)
Deep Cogito의 획기적인 발전의 핵심에는 그들이 반복 증류 및 증폭(IDA)이라고 부르는 새로운 훈련 접근 방식이 있습니다. 이 방법은 "반복적 자기 개선을 통해 일반 초지능을 위한 확장 가능하고 효율적인 정렬 전략"으로 설명됩니다. 이는 전통적인 LLM 훈련의 한계를 넘어, 모델의 지능이 종종 더 큰 "감독자" 모델이나 인간 큐레이터에 의해 정의된 한계에 부딪히는 문제를 해결하도록 설계되었습니다.
IDA 프로세스는 반복적으로 수행되는 두 가지 주요 단계를 중심으로 이루어집니다:
- 증폭: 이 단계에서는 더 많은 컴퓨팅 파워를 사용하여 모델이 더 나은 솔루션이나 능력을 도출하도록 돕습니다. 이는 고급 추론 기술과 유사합니다.
- 증류: 여기서 모델은 이러한 향상된 능력을 내재화하여 매개변수를 정제합니다.
Deep Cogito는 이것이 "긍정적인 피드백 루프"를 만들어, 모델의 지능이 감독자의 지능에 의해 제한되지 않고 컴퓨팅 자원과 IDA 프로세스 자체의 효율성에 따라 더 직접적으로 성장할 수 있다고 주장합니다.
회사는 AlphaGo의 역사적 성공을 예로 들며, "고급 추론과 반복적 자기 개선"이 중요했다고 강조합니다. IDA는 이러한 요소를 LLM 훈련에 도입한다고 주장합니다. 또한 IDA의 효율성을 강조하며, 소규모 팀이 약 75일 만에 이 모델들을 개발했다고 밝혔습니다. 인간 피드백을 통한 강화 학습(RLHF)이나 더 큰 모델로부터의 표준 증류와 같은 다른 방법과 비교했을 때, IDA는 더 나은 확장성을 제공한다고 합니다.
증거로, Deep Cogito는 그들의 70B 모델이 Llama 3.3 70B(405B 모델에서 증류)와 Llama 4 Scout 109B(2T 매개변수 모델에서 증류)를 모두 능가한다고 강조합니다.
Deep Cogito 모델의 능력과 성능
Llama와 Qwen 체크포인트를 기반으로 구축된 새로운 Cogito 모델은 코딩, 함수 호출, 에이전트 애플리케이션에 맞춰져 있습니다. 두드러진 특징은 이중 기능성입니다: "각 모델은 직접 응답(표준 LLM)하거나 응답 전에 자기 성찰(추론 모델과 유사)할 수 있습니다." 이는 Claude 3.5와 같은 모델에서 볼 수 있는 능력을 반영합니다. 그러나 Deep Cogito는 매우 긴 추론 체인에 초점을 맞추지 않고, 더 빠른 응답과 더 짧은 체인의 증류 효율성을 우선시했다고 언급했습니다.
회사는 Cogito 모델을 직접 및 추론 모드에서 크기가 비슷한 최첨단 오픈 모델들과 비교한 광범위한 벤치마크 결과를 공유했습니다. MMLU, MMLU-Pro, ARC, GSM8K, MATH와 같은 다양한 벤치마크와 3B, 8B, 14B, 32B, 70B의 다양한 모델 크기에서 Cogito 모델은 일반적으로 상당한 성능 향상을 보여줍니다. 예를 들어, Cogito 70B 모델은 표준 모드에서 MMLU에서 91.73%를 기록하며 Llama 3.3 70B보다 +6.40% 향상되었고, 사고 모드에서는 91.00%로 Deepseek R1 Distill 70B보다 +4.40% 향상되었습니다. Livebench 점수도 이러한 성과를 반영합니다.
14B 모델의 벤치마크는 중간 크기 비교를 위해 다음과 같습니다:

Deep Cogito는 벤치마크가 실세계 유용성을 완전히 포착하지 않는다고 인정하면서도, 모델의 실제 성능에 자신감을 나타냅니다. 이번 출시는 미리보기 단계로 간주되며, 회사는 "이 스케일링 곡선의 초기 단계에 있다"고 밝혔습니다. 그들은 현재 크기에 대한 개선된 체크포인트를 출시하고, 앞으로 몇 주와 몇 달 안에 더 큰 MoE 모델(109B, 400B, 671B)을 소개할 계획입니다. 모든 미래 모델도 오픈소스로 제공될 것입니다.
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡





집






