AI 모델 및 플랫폼

Liquid AI, LFM2.5-DSpark을 출시해 최대 3.2배 빠른 추론 제공

mm
Unite.AI를 Google의 선호 소스에 추가

Liquid AI는 2026년 8월 20일에 LFM2.5 제품군의 세 모델에 대한 speculative‑decoding 초안 체크포인트를 공개했으며, 단일 H100 GPU에서 최대 3.18배, Apple‑silicon MacBook에서 최대 2.87배의 처리량 향상을 보고했으며 모델 출력은 변하지 않았다고 밝혔습니다. LFM2.5-DSpark 릴리스는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, 그리고 mixture‑of‑experts 형태인 LFM2.5-8B-A1B용 초안 모델을 포함하며, 각각 대상 모델에 약 3억 개의 파라미터를 추가합니다.

이 체크포인트는 Safetensors와 GGUF 형식으로 제공되며, llama.cpp와 SGLang에서 첫날부터 지원됩니다. 두 통합 모두 공식 코드베이스에 upstream으로 기여되었습니다. speculative decoding은 대상 모델이 검증한 토큰만을 출력하기 때문에, 회사는 생성된 텍스트가 greedy decoding으로 단독 실행했을 때와 동일하다고 주장하며 벤치마크 정확도는 변함이 없다고 설명합니다.

Liquid AI가 5개 데이터셋에 대해 배치 크기 1, 온도 0으로 측정한 결과, LFM2.5-2.6B의 평균 가속률은 H100에서 2.67배(초당 323→864 토큰), M4 Max MacBook Pro에서는 2.27배(초당 61→139 토큰)였습니다. 가장 큰 단일 결과는 H100에서 MATH500을 대상으로 한 LFM2.5-8B-A1B에서 나타났으며, 처리량이 3.18배 상승해 428→1,362 토큰/초가 되었습니다. 또한 회사는 DSpark가 다중 도구 시나리오에서 LFM2.5-2.6B의 함수 호출 지연 시간을 평균 57% 감소시켰다고 보고했으며, 이는 LFM2.5 라인이 목표로 하는 온‑디바이스 에이전시 워크로드에 대한 핵심 성과입니다.

How DSpark Speeds Up Decoding

LLM 추론의 디코드 단계는 메모리 한계에 묶여 있습니다. 대부분의 지연은 연산 자체보다 DRAM에서 온‑칩 메모리로 가중치를 스트리밍하는 데서 발생하기 때문에 추론 비용이 분야의 핵심 엔지니어링 문제로 부상했습니다. speculative decoding은 작은 초안 모델이 후보 토큰 블록을 제안하고, 대상 모델이 한 번의 포워드 패스로 전체 블록을 검증함으로써 가중치 로드 비용을 검사되는 각 토큰에 분산시켜 이 문제를 해결합니다.

DSpark는 2026년 7월 논문에서 DeepSeek 연구원들이 소개하고 해당 회사의 DeepSeek‑V4 서빙 시스템에 적용한 기술로, 세 가지 구성 요소를 결합합니다: 모든 초안 토큰에 대한 은닉 상태를 한 번에 생성하는 병렬 백본, 블록 후반부에서 수용률이 감소하는 것을 방지하기 위해 인접 토큰 간 의존성을 모델링하는 경량 순차 헤드, 그리고 검증 비용이 절감 효과보다 클 때 낮은 신뢰도의 접미사를 잘라내는 신뢰도‑스케줄 검증기. DeepSeek의 실제 배포에서는 논문이 기존 MTP‑1 기준 대비 사용자당 60~85%의 생성 속도 향상을 보고했습니다.

Liquid AI의 초안 모델은 이 방식을 단순화된 attention‑only 설계로 구현했으며, 5개의 레이어와 단계당 9개의 초안 토큰 블록 크기, 128,000 토큰 어휘를 갖는 Markov 헤드를 사용합니다(LFM2.5-2.6B-DSpark 모델 카드 참조). 각 초안 모델은 감독형 파인튜닝, 채팅, 코드, 함수 호출 데이터가 혼합된 데이터셋으로 15 epoch 학습했으며, 체크포인트는 손실이 최소인 것이 아니라 수용률이 가장 높은 것을 기준으로 선택했습니다. 정확성 보장은 품질을 보장합니다: “Speculative decoding은 정확합니다; 대상 모델이 제안된 모든 토큰을 검증하므로 greedy 출력은 대상 모델만 사용할 때와 동일합니다,” 라고 GGUF 모델 카드에 명시되어 있으며, 응답당 타이밍을 통해 제안·수용된 초안 토큰 수를 확인할 수 있습니다.

LFM2.5-DSpark by the Numbers

  • 3.18배 — 보고된 최고 GPU 속도 향상 (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 토큰/초)
  • 2.87배 — 보고된 최고 온‑디바이스 속도 향상 (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 토큰/초)
  • 2.67배 / 2.27배 — LFM2.5-2.6B에 대한 다섯 데이터셋 평균 H100 / M4 Max 가속률
  • 57%:다중 도구 시나리오에서 LFM2.5-2.6B의 함수 호출 지연 시간 평균 감소
  • 295.7M–327.7M (초안 모델 파라미터, 대상 모델은 1.2B~8B)
  • 4.81/10, 블록 크기 9일 때 LFM2.5-2.6B의 단계당 평균 수용 초안 토큰 수

Where the Reported Speedups Narrow

Liquid AI 자체 표에서는 가속 효과가 고르게 나타나지 않으며, 그 이유를 설명합니다. LFM2.5-8B-A1B의 경우 온‑디바이스 개선 평균이 1.18배에 불과한데, 이는 세 모델 중 가장 높은 수용률에도 불구하고 현재 llama.cpp의 Metal 백엔드에서 구현된 mixture‑of‑experts와 블록 검증 시 전문가 간에 발생하는 추가 가중치 트래픽 때문이라고 회사는 분석합니다. LFM2.5-1.2B-Instruct는 데이터셋별 수용률 차이가 커서 텍스트 분포에 따라 속도 향상이 52%까지 변동하며, H100에서는 MT‑Bench에서 1.66배, MATH500에서는 2.56배까지 차이를 보입니다.

모든 수치는 Liquid AI가 자체적으로 구축한 벤치마크에서 보고된 값이며, GPU 수치는 BF16 모드의 80GB H100 한 대에서 SGLang을 사용했으며, 온‑디바이스 수치는 FP16 GGUF 가중치를 적용한 M4 Max에서 실험적인 Metal 커널을 사용하는 llama.cpp를 사용해 256 토큰 출력으로 제한했습니다. SGLang 경로는 LFM2 대상에 대한 DSpark 지원 빌드를 필요로 하고, llama.cpp 경로도 해당 빌드가 필요하므로, 가속 효과는 이러한 통합 여부에 따라 달라지며 두 엔진의 안정적인 릴리스에 포함되어 있지는 않습니다.

Liquid AI’s On-Device Push So Far

DSpark 릴리스는 일주일 남짓한 기간에 LFM2.5 제품군이 세 번째로 업데이트된 것입니다. 2026년 8월 12일에 회사는 엣지를 위한 비전‑언어 모델 LFM2.5-VL-3B를 출시했으며, 8월 19일에는 양자화 인식 증류 Q4_0 체크포인트를 공개했습니다. 일관된 흐름은 동일합니다: 회사는 2.6B 모델의 DSpark 가속이 MacBook에서 대부분의 독점 클라우드 모델이 제공하는 초당 약 140 토큰이라는 처리량을 넘어서는 대화형성을 제공한다고 말합니다.

세 초안 모델은 현재 Hugging Face에서 모두 이용 가능합니다: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark, 그리고 LFM2.5-8B-A1B-DSpark. llama.cpp 배포를 위해 GGUF 빌드도 함께 제공됩니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.