본문으로 건너뛰기
Liquid AIDSparkLFM2.5추측 디코딩

Liquid AI, LFM2.5용 추측 디코딩 드래프트 모델 DSpark 공개

Liquid AI가 경량 파운데이션 모델 LFM2.5 세 종에 대응하는 추측 디코딩용 드래프트 모델 DSpark를 공개했다. 출력 품질은 유지한 채 GPU에서 최대 3.18배, 온디바이스에서 최대 2.87배 처리량 향상을 확인했다고 밝혔으며, 통합 코드는 llama.cpp와 SGLang에 오픈소스로 풀렸다. Liquid Foundation Models 계열에 추측 디코딩이 적용된 첫 사례라는 점에서 온디바이스·인프라 비용에 민감한 개발팀이 참고할 만하다.

확인 출처 1발행 주체 빅시프트

무엇이 바뀌었나

Liquid AI가 자사 경량 파운데이션 모델 LFM2.5 계열을 위한 추측 디코딩(speculative decoding)용 드래프트 모델 체크포인트 'DSpark'를 공개했다. 이번 릴리스는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B 세 모델에 각각 대응하는 드래프트 모델로 구성되며, Liquid Foundation Models 계열에 추측 디코딩이 적용된 것은 이번이 처음이다[1]. 회사는 메모리 사용량을 소폭 늘리는 대신 출력 품질을 그대로 유지하면서 디코딩 속도를 크게 끌어올리는 방식이라고 설명했으며, GPU에서 최대 3.18배, 온디바이스 환경에서 최대 2.87배의 처리량 향상을 확인했다고 밝혔다[1]. 통합 코드는 llama.cpp와 SGLang에 오픈소스로 공개돼 있고, 모델 체크포인트는 Hugging Face에서 받을 수 있다[1].

DSpark 드래프트 모델은 5개 디코더 레이어와 블록 크기 9로 구성된 약 3억 파라미터 규모이며, 각 모델당 15 epoch 학습을 거쳤다[1]. 추측 디코딩은 작은 드래프트 모델이 먼저 다음 토큰들을 예측하고 본 모델이 이를 검증·확정하는 방식으로, 출력 결과 자체는 그대로 유지하면서 생성 속도만 높이는 기법이다. Liquid AI는 EAGLE-3, DFlash 등 기존 추측 디코딩 기법과는 별도의 구현으로 이번 DSpark를 개발했다고 밝혔다[1].

모델별 성능 차이와 실무 영향

성능 향상 폭은 모델과 작업 종류에 따라 차이가 뚜렷하다. LFM2.5-2.6B는 BFCL(Berkeley Function Calling Leaderboard) 기준 함수 호출 지연 시간이 평균 57% 줄어든 것으로 나타났다[1]. LFM2.5-1.2B-Instruct는 작업에 따라 속도 향상 폭이 최대 52%까지 편차를 보였다[1]. LFM2.5-8B-A1B는 GPU 환경에서 평균 2.54배 처리량 향상을 기록했지만, 온디바이스(엣지) 환경에서는 18% 개선에 그쳐 다른 두 모델보다 체감 효과가 낮았다[1].

이런 편차는 함수 호출이나 에이전트형 워크플로처럼 반복적이고 예측 가능한 출력 패턴이 많은 작업에서 추측 디코딩 효과가 크게 나타나는 반면, 더 큰 모델이나 다양성이 높은 출력을 요구하는 작업에서는 상대적으로 이득이 줄어들 수 있음을 시사한다. 서버 인프라 비용을 줄이려는 백엔드 개발팀이라면 GPU 환경에서의 3배 안팎 처리량 향상을 활용해 동일 하드웨어로 더 많은 요청을 처리하는 방향을 검토할 수 있고, 온디바이스 배포를 다루는 팀이라면 모델 규모별로 실제 이득 차이가 크다는 점을 사전에 확인해야 도입 효과를 가늠할 수 있다. 다만 이 수치들은 회사가 자체 공개한 벤치마크 결과이며, 실제 프로덕션 트래픽 패턴에서는 편차가 달라질 수 있다.

확인할 조건

공개된 벤치마크는 NVIDIA H100(80GB 메모리)과 M4 Max 맥북 프로를 기준으로 측정됐으며, 온디바이스 테스트는 최대 출력 토큰 256개로 제한된 조건에서 진행됐다[1]. 실제 도입을 검토하는 조직이라면 자사가 사용할 하드웨어 사양과 평균 출력 길이가 이 조건과 얼마나 다른지에 따라 발표된 배율이 그대로 재현되지 않을 수 있다는 점을 감안해야 한다. 또한 회사가 비교 기준으로 제시한 약 140 tok/s의 독점 클라우드 모델 처리량도[1] 어떤 모델·설정을 기준으로 삼았는지 확인한 뒤 자사 벤치마크와 비교하는 편이 안전하다. 품질 지표로는 MATH500, GSM8K, HumanEval, MBPP, MT-Bench 등 표준 벤치마크가 함께 언급됐으나[1], 이들 지표에서 드래프트 모델 적용 전후 점수 차이가 실제로 어느 정도인지는 별도로 검증해볼 필요가 있다.

확인한 출처

관련 AI 뉴스

AI BRIEFING/

LLM 지능 비용, 반년 새 56배 하락한 이유

CatalystNeuro 창립자 Ben Dichter가 Artificial Analysis 벤치마크 데이터를 분석해, 특정 지능 수준을 구현하는 비용이 2026년 2월 작업당 1.22달러에서 8월 0.022달러로 6개월 만에 56배 떨어졌다고 밝혔다. 그는 이 하락 속도가 오히려 가속화되고 있으며, 저비용 모델의 성능 향상이 대규모 스캔 작업을 가능케 하고 총 AI 지출은 늘리는 제번스 역설 현상도 함께 나타난다고 분석했다.

LLM 비용Artificial AnalysisIntelligence Index
읽기
AI BRIEFING/

AI 코드 리뷰 기업 Ito, "다음 LLM보다 인프라 투자가 더 중요하다" 주장

주당 약 1000억 토큰을 처리하는 AI 코드 리뷰 회사 Ito가 자사 블로그에서 모델 품질 향상이 정체기에 접어들었고, 이제는 모델 선택보다 라우팅·캐싱·평가 파이프라인 같은 인프라 투자가 더 중요한 차별화 요소라고 주장했다. Ito는 14개 모델을 코딩 작업에 각 6회씩 돌린 자체 실험을 근거로 벤치마크 순위와 실제 프로덕션 성능이 어긋난다는 데이터를 제시했다.

ItoAI 인프라LLM 벤치마크
읽기
AI BRIEFING/

AI 플랫폼 Modular의 오픈소스 저장소, GitHub 트렌딩에 등재

MAX Framework와 Mojo Language를 포함한 Modular Platform의 오픈소스 저장소 modular/modular가 GitHub Trending에 올랐다. 2023년 생성된 저장소지만 스타 2만8641개, 포크 3049개로 누적됐고 최근까지 커밋이 이어지고 있어 커뮤니티 관심이 꾸준히 유지되고 있음을 보여준다. 다만 이번 트렌딩 노출이 특정 신규 발표에 따른 것인지는 공개된 정보만으로는 확인되지 않는다.

ModularMAXMojo
읽기