옵션
뉴스
ByteDance, Seed-Thinking-v1.5 AI 모델 공개로 추론 능력 강화

ByteDance, Seed-Thinking-v1.5 AI 모델 공개로 추론 능력 강화

2025년 8월 23일
178

고급 추론 AI를 위한 경쟁은 2024년 9월 OpenAI의 o1 모델로 시작되었으며, 2025년 1월 DeepSeek의 R1 출시로 더욱 가속화되었습니다.

주요 AI 개발자들은 이제 체인 오브 쏘트 프로세스를 통해 정확하고 신중한 응답을 제공하는 더 빠르고 비용 효율적인 추론 AI 모델을 만들기 위해 경쟁하고 있습니다.

TikTok의 모회사인 ByteDance는 기술 논문에서 소개된 새로운 대형 언어 모델(LLM)인 Seed-Thinking-v1.5를 공개하며 이 경쟁에 뛰어들었습니다. 이 모델은 STEM 및 일반 도메인에서 추론 능력을 강화하는 데 목표를 두고 있습니다.

이 모델은 아직 사용 가능하지 않으며, 라이선스가 독점, 오픈소스, 또는 하이브리드인지 여부는 공개되지 않았습니다. 하지만 논문은 출시 전에 탐구할 만한 주요 통찰을 제공합니다.

Meta의 Llama 4와 Mistral의 Mixtral을 따라, Seed-Thinking-v1.5는 전문가 혼합(MoE) 아키텍처를 채택했습니다.

이 접근법은 여러 전문화된 모델을 하나로 통합하여 각기 다른 도메인에 초점을 맞춤으로써 효율성을 높입니다.

Seed-Thinking-v1.5는 2000억 개 파라미터 중 단 200억 개만을 사용하여 성능을 최적화합니다.

ByteDance의 GitHub에 공개된 논문은 모델이 구조화된 추론과 의도적인 응답 생성에 중점을 둔 점을 강조합니다.

이 모델은 DeepSeek R1을 능가하며, Google의 Gemini 2.5 Pro와 OpenAI의 o3-mini-high를 타사 벤치마크에서 경쟁하며, ARC-AGI 벤치마크에서 인간의 성능을 초월하는 경제적으로 가치 있는 작업에서 OpenAI 기준을 넘어섭니다.

더 큰 모델에 대한 컴팩트하면서 강력한 대안으로 자리 잡은 Seed-Thinking-v1.5는 혁신적인 강화 학습, 엄선된 훈련 데이터, 고급 AI 인프라를 통해 강력한 벤치마크 결과를 제공합니다.

벤치마크 성능 및 핵심 강점

Seed-Thinking-v1.5는 어려운 작업에서 탁월하며, AIME 2024에서 86.7%, Codeforces에서 pass@8로 55.0%, GPQA 과학 벤치마크에서 77.3%를 기록하며 OpenAI의 o3-mini-high 및 Google의 Gemini 2.5 Pro와 비슷하거나 이를 초월하는 추론 메트릭을 보여줍니다.

비추론 작업에서는 DeepSeek R1보다 8.0% 높은 인간 선호도 승률을 달성하여 논리와 수학을 넘어선 다재다능함을 보여줍니다.

벤치마크 포화를 방지하기 위해 ByteDance는 암기를 방지하고 모델 성능을 더 잘 평가하기 위해 더 어려운 수학 벤치마크인 BeyondAIME을 만들었습니다. 이와 함께 Codeforces 세트는 향후 연구를 돕기 위해 공개될 예정입니다.

훈련 데이터 접근법

Seed-Thinking-v1.5 개발에서 데이터 품질은 핵심이었습니다. 지도 미세 조정을 위해 40만 개 샘플이 엄선되었습니다: 30만 개의 검증 가능한 STEM, 논리, 코딩 작업과 10만 개의 창의적 글쓰기와 같은 비검증 작업.

강화 학습을 위해 데이터는 다음과 같이 나뉘었습니다:

  • 검증 가능한 문제: 엘리트 대회에서 전문가가 검증한 10만 개의 엄선된 STEM 질문과 논리 퍼즐.
  • 비검증 작업: 쌍대 보상 모델을 통해 평가된 개방형 프롬프트에 대한 인간 선호도 데이터셋.

STEM 데이터의 80% 이상은 고급 수학에 초점을 맞췄으며, 스도쿠 및 24포인트 퍼즐과 같은 논리 작업은 모델 진행 상황에 맞춰 조정되었습니다.

강화 학습 혁신

Seed-Thinking-v1.5는 긴 체인 오브 쏘트 시나리오에서 문제를 해결하기 위해 사용자 정의 액터-크리틱(VAPO) 및 정책-그라디언트(DAPO) 프레임워크를 사용하여 강화 학습을 안정화합니다.

두 가지 보상 모델이 RL 감독을 강화합니다:

  • Seed-Verifier: 생성된 답변과 참조 답변 간의 수학적 동등성을 보장하는 규칙 기반 LLM.
  • Seed-Thinking-Verifier: 보상 조작에 강한 일관된 평가를 위한 추론 기반 판단자.

이 듀얼 시스템은 간단하고 복잡한 작업 전반에 걸쳐 정밀한 평가를 지원합니다.

확장 가능한 인프라 설계

ByteDance의 HybridFlow 프레임워크는 Ray 클러스터로 구동되며, GPU 유휴 시간을 최소화하기 위해 훈련과 추론을 공동 배치하여 효율적인 대규모 훈련을 지원합니다.

스트리밍 롤아웃 시스템(SRS)은 모델 진화와 런타임을 분리하여 부분 생성의 비동기 관리를 통해 반복 속도를 최대 3배까지 가속화합니다.

추가 기술에는 다음이 포함됩니다:

  • 메모리 효율성을 위한 혼합 정밀도(FP8)
  • MoE 최적화를 위한 전문가 병렬 처리 및 커널 자동 튜닝
  • 견고한 체크포인팅을 위한 ByteCheckpoint
  • 최적화된 병렬 처리 및 메모리 설정을 위한 AutoTuner

인간 중심 평가 및 응용

창의적 글쓰기, 인문학, 일반 대화에 걸친 인간 테스트에서 Seed-Thinking-v1.5는 DeepSeek R1을 능가하며 실세계 관련성을 입증했습니다.

팀은 검증 가능한 작업에 대한 훈련이 엄격한 수학적 워크플로우를 통해 창의적 도메인으로의 일반화를 강화했다고 밝혔습니다.

기술 팀 및 기업에 대한 시사점

LLM 수명 주기를 감독하는 기술 리더들에게 Seed-Thinking-v1.5는 고급 추론을 기업 AI 시스템에 통합하는 모델을 제공합니다.

검증 가능한 데이터셋과 다단계 강화 학습을 통한 모듈식 훈련은 정밀한 제어로 LLM 개발을 확장하는 팀에 적합합니다.

Seed-Verifier와 Seed-Thinking-Verifier는 고객 대면 또는 규제 환경에서 필수적인 신뢰할 수 있는 보상 모델링을 강화합니다.

촉박한 일정의 팀을 위해 VAPO와 동적 샘플링은 반복 주기를 줄여 작업별 미세 조정을 간소화합니다.

SRS 및 FP8 최적화를 포함한 하이브리드 인프라는 훈련 처리량과 하드웨어 효율성을 높여 클라우드 및 온프레미스 시스템에 이상적입니다.

모델의 적응형 보상 피드백은 다양한 데이터 파이프라인 관리의 문제를 해결하여 도메인 전반의 일관성을 보장합니다.

데이터 엔지니어들에게는 엄격한 데이터 필터링과 전문가 검증에 대한 초점이 고품질 데이터셋이 모델 성능을 높이는 데 중요한 가치를 강조합니다.

미래 전망

Yonghui Wu가 이끌고 Haibin Lin이 공개적으로 대표하는 ByteDance의 Seed LLM Systems 팀이 개발한 Seed-Thinking-v1.5는 Doubao 1.5 Pro와 같은 노력에 기반을 두며, 공유 RLHF 및 데이터 큐레이션 기술을 사용합니다.

팀은 훈련 효율성과 비검증 작업에 대한 보상 모델링에 초점을 맞춰 강화 학습을 개선하는 것을 목표로 합니다. BeyondAIME과 같은 벤치마크 공개는 추론 중심 AI 연구의 추가 발전을 촉진할 것입니다.

관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다 OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다 AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
구글, AI 딥페이크를 이용한 사칭 사기 방지를 위해 가짜 전화 감지 기능을 도입했다 구글, AI 딥페이크를 이용한 사칭 사기 방지를 위해 가짜 전화 감지 기능을 도입했다 구글은 화요일, AI 딥페이크를 이용한 사칭 사기로부터 사용자를 보호하기 위해 안드로이드에 ‘가짜 전화 감지’ 기능을 도입한다고 발표했다. 이 기능은 이번 달부터 픽셀 기기를 시작으로, 안드로이드 12 이상 기기의 ‘Phone by Google’ 앱에 전 세계적으로 순차적으로 적용될 예정이다.사람들이 낯선 번호의 전화를 점점 더 받지 않으려 함에 따라, 사
XPeng Motors의 자회사 Dogotix, 9억 달러 투자 유치 XPeng Motors의 자회사 Dogotix, 9억 달러 투자 유치 XPeng의 자회사 Dogotix는 ‘IRON’ 휴머노이드 로봇을 개발 중이다. 출처: XPeng세계 주요 자동차 제조사들의 선례를 따라 XPeng Motors도 휴머노이드 로봇 분야로 사업 영역을 확장하고 있다. 이 전기차 제조사는 오늘 자사의 로봇 자회사인 Dogotix가 첫 투자 라운드에서 9억 달러 이상의 자금을 확보했으며, 이를 통해 투자 전 기업
관련 특별 주제 추천
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
디자인과 예술 아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라
아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라

2026년 최신 최고 인기 AI 창의적 아이디어 도구들은 XIX.AI가 선별한 것으로, 창작자들이 시각적 장벽을 돌파하고 즉각적으로 창의성을 높일 수 있도록 지원합니다. 이러한 강력한 혁신적 도구들은 실제 테스트 결과, 무료와 유료 버전의 상세 비교, 그리고 매주 업데이트되는 순위표를 제공합니다. 콘텐츠 제작을 가속화하고 AI 경쟁력을 발휘할 수 있는 완벽한 도구를 발견하세요. 지금 바로 탐색하세요!

14 도구
xix.ai
음악 작곡 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커
틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커

2026년 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 최신 최고의 AI 비트 메이커! XIX.AI는 모든 콘텐츠 요구 사항에 맞는 완벽한 음악을 제공하기 위해 실제 테스트를 거친, 업계에 혁신을 일으킬 만한 강력한 도구들의 최고 평점 목록을 엄선했습니다. 창의성과 생산성을 높이는 데 도움이 될 상세한 무료 vs 유료 비교 자료, 매주 업데이트되는 순위, 그리고 꼭 시도해 봐야 할 추천 옵션을 확인하실 수 있습니다. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 찾아보세요!

11 도구
xix.ai
의견 (1)
0/500
ChristopherDavis
ChristopherDavis 2026년 1월 19일 오전 9시 30분 41초 GMT+09:00

Cette accélération dans la course au raisonnement avancé me donne un peu le vertige 😅. D'un côté c'est fascinant de voir comment les modèles deviennent de plus en plus 'intelligents', mais d'un autre... on est certains que tout ce développement est sous contrôle ? Pas sûr que les entreprises pensent beaucoup aux implications éthiques quand elles sont lancées dans cette bataille commerciale ultra-compétitive.

OR