옵션
속보
콘텐츠
JerryGonzalez
JerryGonzalez
2026년 7월 27일

Ant Bailing은 총 124B개의 파라미터를 가지며 그중 5.1B개가 활성화된 하이브리드 추론 모델인 Ling-3.0-Flash를 출시했습니다. 이 모델은 추론 및 장문 처리 작업에서 2~3배 규모의 모델들과 동등한 성능을 보이거나 그보다 더 우수한 성능을 자랑합니다. 또한 더 높은 효율성을 위해 5:1 비율의 하이브리드 어텐션 아키텍처(KDA 선형 계층 및 MLA 계층)와 1/64의 전문가 활성화 비율을 채택하고 있습니다. 10,000개 이상의 훈련 시나리오를 바탕으로 에이전트 애플리케이션에 최적화되어 있으며, 계층형 캐싱 기술을 통해 첫 번째 토큰 처리까지의 지연 시간을 60~80% 줄여줍니다. 현재 OpenRouter에서 1주일간 무료로 제공되고 있으며, 그 후에는 오픈소스로 공개될 예정입니다.

Ant Bailing은 총 124B개의 파라미터를 가지며 그중 5.1B개가 활성화된 하이브리드 추론 모델인 Ling-3.0-Flash를 출시했습니다. 이 모델은 추론 및 장문 처리 작업에서 2~3배 규모의 모델들과 동등한 성능을 보이거나 그보다 더 우수한 성능을 자랑합니다. 또한 더 높은 효율성을 위해 5:1 비율의 하이브리드 어텐션 아키텍처(KDA 선형 계층 및 MLA 계층)와 1/64의 전문가 활성화 비율을 채택하고 있습니다. 10,000개 이상의 훈련 시나리오를 바탕으로 에이전트 애플리케이션에 최적화되어 있으며, 계층형 캐싱 기술을 통해 첫 번째 토큰 처리까지의 지연 시간을 60~80% 줄여줍니다. 현재 OpenRouter에서 1주일간 무료로 제공되고 있으며, 그 후에는 오픈소스로 공개될 예정입니다. Ant Bailing은 총 124B개의 파라미터를 가지며 그중 5.1B개가 활성화된 하이브리드 추론 모델인 Ling-3.0-Flash를 출시했습니다. 이 모델은 추론 및 장문 처리 작업에서 2~3배 규모의 모델들과 동등한 성능을 보이거나 그보다 더 우수한 성능을 자랑합니다. 또한 더 높은 효율성을 위해 5:1 비율의 하이브리드 어텐션 아키텍처(KDA 선형 계층 및 MLA 계층)와 1/64의 전문가 활성화 비율을 채택하고 있습니다. 10,000개 이상의 훈련 시나리오를 바탕으로 에이전트 애플리케이션에 최적화되어 있으며, 계층형 캐싱 기술을 통해 첫 번째 토큰 처리까지의 지연 시간을 60~80% 줄여줍니다. 현재 OpenRouter에서 1주일간 무료로 제공되고 있으며, 그 후에는 오픈소스로 공개될 예정입니다.
의견 (0)
0/300
OR