LFM2.5 DSpark 초안 모델 공개: 추론 속도 3.18배 향상
Liquid AI와 Hugging Face는 LFM2.5 시리즈용 DSpark 초안 모델 체크포인트를 공식 출시했으며, 여기에는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B가 포함됩니다. 이번 혁신을 통해 출력 품질을 유지하면서도 추론 처리량을 대폭 향상시키는 새로운 추측적 디코딩 경로가 도입되었습니다.
주요 성능 향상 및 실제 적용 사례
실제 테스트 결과, DSpark의 놀라운 가속 효과가 입증되었습니다. GPU에서는 처리량이 최대 3.18배 증가했으며, 엣지 디바이스에서는 최대 2.87배의 성능 향상을 보였습니다.
엣지 에이전트 추론에서 LFM2.5-2.6B는 함수 호출 지연 시간을 평균 57% 줄여줍니다. M4 Max MacBook Pro에서 테스트한 결과, 초당 최대 139 토큰의 속도를 달성하여 로컬 에이전트 배포의 장벽을 낮추고, 독점적인 클라우드 모델에 필적하는 사용자 경험을 제공합니다.

DSpark의 아키텍처와 작동 원리 이해
기존 LLM 추론은 대부분의 시간이 DRAM에서 SRAM으로 가중치를 스트리밍하는 데 소요되기 때문에 메모리 대역폭에 의해 병목 현상이 발생합니다. 추측적 디코딩(Speculative decoding)은 경량 드래프트 모델을 사용하여 후보 토큰을 생성하고, 이를 대상 모델의 단일 포워드 패스에서 검증함으로써 이 문제를 해결하며, 가중치 로딩 비용을 효과적으로 분산시킵니다.
DSpark는 다음 세 가지 핵심 구성 요소를 통해 기존 기법들을 통합합니다:
병렬 백본 네트워크: DFlash와 유사하게, 대상 모델의 컨텍스트 특징을 기반으로 단일 전진 통과(forward pass)에서 모든 초안 토큰에 대한 숨겨진 상태를 생성합니다.순차적 헤드(마르코프 헤드): 인접한 토큰 간의 마르코프 연쇄를 시뮬레이션하여 의존성을 강화하고 후속 위치에 대한 수용률을 향상시킵니다.신뢰도 스케줄링 검증기: 각 토큰의 생존 확률을 예측하며, 검증 비용이 절감 효과를 상회할 경우 신뢰도가 낮은 접미사를 자동으로 제거합니다.훈련을 위해 초안 모델은 SFT, 채팅, 코드, 함수 호출 등을 포함한 다양한 데이터셋 조합을 활용합니다. 철저한 제거 실험을 거친 후, 초기 버전은 5개의 레이어와 9개의 블록으로 구성된 어텐션 전용 아키텍처를 채택하여 매개변수를 약 3억 개 수준으로 유지합니다.

품질 보증 및 생태계 통합
추측적 디코딩으로 인해, 탐욕적 디코딩은 대상 모델의 분포와 완벽하게 일치하는 초안 토큰만 수용합니다. 거부된 토큰은 대상 모델의 출력으로 대체되어, 생성된 시퀀스가 벤치마크에서 정확도 손실 없이 기준 탐욕적 디코딩 구조와 일치하도록 보장합니다.
출시 당시, DSpark는 주요 추론 프레임워크와의 호환성을 확보했습니다:
SGLang: 전용 통합 및 시작 구성을 통해 가속기 상에서 실행을 지원합니다.llama.cpp: 공식 빌드 지원을 제공하여, 사용자가 명령줄을 통해 해당 GGUF 가중치 및 초안 모델 파일을 불러올 수 있도록 합니다.
관련 기사
왜 Abnormal AI가 ‘Daybreak’에서 OpenAI와 파트너십을 맺었는가
OpenAI 사이버 부문 제품 책임자 마이클 아이엘로 | 출처: 마이클 아이엘로/LinkedIn애브노멀 AI, 오픈AI의 ‘데이브레이크(Daybreak)’ 프로그램에 합류… 마이크 아이엘로, 이번 파트너십이 기업의 실용적인 방어 체계 도입을 가속화할 것이라고 밝혀선도적인 최첨단 AI 기업인 오픈AI(OpenAI)는 기업들이 비즈니스 및 제품 개발 전반에 걸
AI 에이전트 ‘엘리먼츠 클로’, 초전도체 소재 개발 완료
인공지능이 과학 탐구의 경계를 넓혀가는 가운데, 중요한 이정표가 달성되었습니다. 7월 3일, 알리바바 DAMO 아카데미는 중국 인민대학교 및 중국과학원 대학과 협력하여 초전도 물질 발견에 특화된 세계 최초의 AI 에이전트인 ‘Elements Claw’를 공개했습니다. 이번 획기적인 성과는 과학적 발견의 패러다임 전환을 의미하며, AI를 보조적인 역할에서 독
일본 구글과 야후에서 SEO 랭킹을 효과적으로 확인하는 방법
초상화 사진을 해리 포터 스케치로 변환하기목차:소개사진을 스케치로 변환하기최소 필터 사용초상화 변환을 위한 다른 기법시작하기필요한 이미지 다운로드레이어 준비이미지 채도 제거채도 제거된 레이어 생성레이어 조정반전 효과 적용레이어 반전컬러 도지 효과 추가이미지 흐림 처리가우시안 블러 필터 적용흐림 설정 조정스케치 다듬기페인트 브러시 도구 사용세부 사항 강화 및 결점 제거레이어 병합반전 레이어와 배경 복사 레이어
관련 특별 주제 추천
의견 (0)
0/500
Liquid AI와 Hugging Face는 LFM2.5 시리즈용 DSpark 초안 모델 체크포인트를 공식 출시했으며, 여기에는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B가 포함됩니다. 이번 혁신을 통해 출력 품질을 유지하면서도 추론 처리량을 대폭 향상시키는 새로운 추측적 디코딩 경로가 도입되었습니다.
주요 성능 향상 및 실제 적용 사례
실제 테스트 결과, DSpark의 놀라운 가속 효과가 입증되었습니다. GPU에서는 처리량이 최대 3.18배 증가했으며, 엣지 디바이스에서는 최대 2.87배의 성능 향상을 보였습니다.
엣지 에이전트 추론에서 LFM2.5-2.6B는 함수 호출 지연 시간을 평균 57% 줄여줍니다. M4 Max MacBook Pro에서 테스트한 결과, 초당 최대 139 토큰의 속도를 달성하여 로컬 에이전트 배포의 장벽을 낮추고, 독점적인 클라우드 모델에 필적하는 사용자 경험을 제공합니다.

DSpark의 아키텍처와 작동 원리 이해
기존 LLM 추론은 대부분의 시간이 DRAM에서 SRAM으로 가중치를 스트리밍하는 데 소요되기 때문에 메모리 대역폭에 의해 병목 현상이 발생합니다. 추측적 디코딩(Speculative decoding)은 경량 드래프트 모델을 사용하여 후보 토큰을 생성하고, 이를 대상 모델의 단일 포워드 패스에서 검증함으로써 이 문제를 해결하며, 가중치 로딩 비용을 효과적으로 분산시킵니다.
DSpark는 다음 세 가지 핵심 구성 요소를 통해 기존 기법들을 통합합니다:
병렬 백본 네트워크: DFlash와 유사하게, 대상 모델의 컨텍스트 특징을 기반으로 단일 전진 통과(forward pass)에서 모든 초안 토큰에 대한 숨겨진 상태를 생성합니다.순차적 헤드(마르코프 헤드): 인접한 토큰 간의 마르코프 연쇄를 시뮬레이션하여 의존성을 강화하고 후속 위치에 대한 수용률을 향상시킵니다.신뢰도 스케줄링 검증기: 각 토큰의 생존 확률을 예측하며, 검증 비용이 절감 효과를 상회할 경우 신뢰도가 낮은 접미사를 자동으로 제거합니다.훈련을 위해 초안 모델은 SFT, 채팅, 코드, 함수 호출 등을 포함한 다양한 데이터셋 조합을 활용합니다. 철저한 제거 실험을 거친 후, 초기 버전은 5개의 레이어와 9개의 블록으로 구성된 어텐션 전용 아키텍처를 채택하여 매개변수를 약 3억 개 수준으로 유지합니다.

품질 보증 및 생태계 통합
추측적 디코딩으로 인해, 탐욕적 디코딩은 대상 모델의 분포와 완벽하게 일치하는 초안 토큰만 수용합니다. 거부된 토큰은 대상 모델의 출력으로 대체되어, 생성된 시퀀스가 벤치마크에서 정확도 손실 없이 기준 탐욕적 디코딩 구조와 일치하도록 보장합니다.
출시 당시, DSpark는 주요 추론 프레임워크와의 호환성을 확보했습니다:
SGLang: 전용 통합 및 시작 구성을 통해 가속기 상에서 실행을 지원합니다.llama.cpp: 공식 빌드 지원을 제공하여, 사용자가 명령줄을 통해 해당 GGUF 가중치 및 초안 모델 파일을 불러올 수 있도록 합니다.
왜 Abnormal AI가 ‘Daybreak’에서 OpenAI와 파트너십을 맺었는가
OpenAI 사이버 부문 제품 책임자 마이클 아이엘로 | 출처: 마이클 아이엘로/LinkedIn애브노멀 AI, 오픈AI의 ‘데이브레이크(Daybreak)’ 프로그램에 합류… 마이크 아이엘로, 이번 파트너십이 기업의 실용적인 방어 체계 도입을 가속화할 것이라고 밝혀선도적인 최첨단 AI 기업인 오픈AI(OpenAI)는 기업들이 비즈니스 및 제품 개발 전반에 걸
AI 에이전트 ‘엘리먼츠 클로’, 초전도체 소재 개발 완료
인공지능이 과학 탐구의 경계를 넓혀가는 가운데, 중요한 이정표가 달성되었습니다. 7월 3일, 알리바바 DAMO 아카데미는 중국 인민대학교 및 중국과학원 대학과 협력하여 초전도 물질 발견에 특화된 세계 최초의 AI 에이전트인 ‘Elements Claw’를 공개했습니다. 이번 획기적인 성과는 과학적 발견의 패러다임 전환을 의미하며, AI를 보조적인 역할에서 독
일본 구글과 야후에서 SEO 랭킹을 효과적으로 확인하는 방법
초상화 사진을 해리 포터 스케치로 변환하기목차:소개사진을 스케치로 변환하기최소 필터 사용초상화 변환을 위한 다른 기법시작하기필요한 이미지 다운로드레이어 준비이미지 채도 제거채도 제거된 레이어 생성레이어 조정반전 효과 적용레이어 반전컬러 도지 효과 추가이미지 흐림 처리가우시안 블러 필터 적용흐림 설정 조정스케치 다듬기페인트 브러시 도구 사용세부 사항 강화 및 결점 제거레이어 병합반전 레이어와 배경 복사 레이어





집






