AI-mallit ja alustat

Liquid AI julkaisee LFM2.5-DSparkin jopa 3,2‑kertaisella nopeammalla inferenssillä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Liquid AI julkaisi spekulatiivisen dekoodauksen draft‑tarkistuspisteet kolmelle mallille LFM2.5‑perheessään 20. elokuuta 2026, raportoiden läpimenon kasvua jopa 3,18‑kertaiseksi yhdellä H100‑GPU:lla ja jopa 2,87‑kertaiseksi Apple‑silicon‑MacBookilla, ilman muutoksia mallin tulosteisiin. LFM2.5-DSpark -julkaisu kattaa draft‑mallit LFM2.5-1.2B-Instructille, LFM2.5-2.6B:lle ja mixture-of-experts‑mallille LFM2.5-8B-A1B, jotka lisäävät kohdemalliin noin 300 miljoonaa draft‑parametria.

Tarkistuspisteet toimitetaan Safetensors‑ ja GGUF‑muodoissa, ja ne tukevat heti ensimmäisenä llama.cpp:ssä ja SGLangissa, molemmat integraatiot on kontribuoitu ylävirtaan virallisiin koodikantoihin. Koska spekulatiivinen dekoodaus tuottaa vain ne tokenit, jotka kohdemalli on vahvistanut, yritys toteaa, että tuotettu teksti on identtinen sen kanssa, mitä kohdemalli tuottaisi yksinään ahneessa dekoodauksessa, joten vertailuarvon tarkkuus pysyy muuttumattomana.

Liquid AI:n mittaukset, jotka suoritettiin eräkoolla 1 ja lämpötilalla 0 viidessä tietoaineistossa, osoittivat LFM2.5-2.6B:n keskimääräisen nopeutuksen olevan 2,67‑kertainen H100:lla (323 → 864 tokenia sekunnissa) ja 2,27‑kertainen M4 Max MacBook Pro:lla (61 → 139 tokenia sekunnissa). Suurin yksittäinen tulos saatiin LFM2.5-8B-A1B:stä MATH500:ssä, jossa läpimeno H100:lla nousi 3,18‑kertaiseksi, 428 → 1 362 tokenia sekunnissa. Yritys raportoi myös, että DSpark vähensi funktiokutsujen viivettä keskimäärin 57 % LFM2.5-2.6B:ssä monityökaluskenaarioissa, mikä on pääasiallinen tulos laitteistossa suoritettaville agenttisille työkuormille, joihin LFM2.5‑sarja on suunnattu.

Kuinka DSpark nopeuttaa dekoodausta

LLM‑inferen­sin dekoodausvaihe on muistiriippuvainen: suurin osa viiveestä johtuu painojen siirtämisestä DRAM:ista sirun sisäiseen muistiin, ei itse laskennasta, mistä syystä inferen­sin taloustiede on noussut alaa koskevan keskeiseksi insinöörihaasteeksi. Spekulatiivinen dekoodaus hyödyntää tätä antamalla pienen draft‑mallin ehdottaa lohkon ehdokastokenia, jonka jälkeen kohdemalli tarkistaa koko lohkon yhdellä eteenpäin‑läpäisyllä, jakaen painojen latauskustannuksen jokaiselle tarkastetulle tokenille.

DSpark, jonka esitteli heinäkuun 2026 paperi DeepSeek‑tutkijat ja joka on otettu käyttöön yrityksen DeepSeek-V4‑palvelujärjestelmässä, yhdistää kolme komponenttia: rinnakkaisen runkorakenteen, joka tuottaa piilotilat kaikille draft‑tokenille yhdellä läpikäynnillä, kevyen sekventiaalisen päät, joka mallintaa vierekkäisten tokenien riippuvuuksia pitääkseen hyväksymisprosentit lohkon loppupuolella korkeina, sekä luottamusajastetun tarkistajan, joka poistaa matalan luottamuksen jälkiliitteet, kun niiden tarkistaminen maksaa enemmän kuin säästää. DeepSeekin tuotantoympäristössä paperi raportoituu käyttäjäkohtaisiksi generaationopeutuksiksi 60–85 % aiempaan MTP‑1‑vertailutasoon verrattuna, kun läpimeno on samansuuruinen.

Liquid AI:n draft‑mallit noudattavat tätä reseptiä yksinkertaistetulla pelkän huomion suunnittelulla: viisi kerrosta, lohkokoko yhdeksän draft‑tokenia per askel, ja Markov‑pää 128 000 tokenin sanastolle, kuten LFM2.5-2.6B-DSpark -mallikortti kertoo. Jokainen draft‑malli koulutettiin 15 epookkia valvotun hienosäädön, chatin, koodin ja funktiokutsudatan sekoituksella, ja tarkistuspiste valittiin korkeamman hyväksymisprosentin perusteella, ei pienimmän häviön. Tarkkuustakuu hoitaa laatuaspektin: “Spekulatiivinen dekoodaus on tarkka: kohde tarkistaa jokaisen ehdotetun tokenin, joten ahne ulostulo on yhtä kuin kohde yksinään,” GGUF‑mallikortti toteaa, ja vastausajankohdat paljastavat, kuinka monta draft‑tokenia ehdotettiin ja hyväksyttiin.

LFM2.5-DSpark numeroina

  • 3.18x — paras raportoitu GPU-nopeutus (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
  • 2.87x — paras raportoitu laitteistokohtainen nopeutus (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2.67x / 2.27x — keskimääräiset H100- / M4 Max -nopeutukset LFM2.5-2.6B:lle viidessä tietoaineistossa
  • 57%: keskimääräinen funktiokutsujen viiveen vähennys LFM2.5-2.6B:lle monityökaluskenaarioissa
  • 295.7M–327.7M (draft‑malliparametreja, kohdemalleja 1.2B–8B vastaan)
  • 4.81 of 10, keskimääräinen hyväksyttyjen draft‑tokenien määrä per askel LFM2.5-2.6B:lle lohkokoolla 9

Missä raportoituja nopeutuksia kaventuu

Liquid AI:n omat taulukot osoittavat, että hyödyt ovat epätasaisia, ja yritys esittää syyt. LFM2.5-8B-A1B:n tapauksessa laitteistokohtainen parannus keskimäärin on vain 1,18‑kertainen huolimatta kolmesta mallista korkeimmista hyväksymisprosenteista, mikä johtuu yrityksen mukaan nykyisestä mixture-of-exets‑toteutuksesta llama.cpp:n Metal‑taustajärjestelmässä sekä ylimääräisestä painoliikenteestä, jonka token‑lohkon tarkistaminen aktivoi asiantuntijoiden välillä. LFM2.5-1.2B-Instructin osalta hyväksymisprosentit vaihtelevat niin paljon tietoaineiston mukaan, että nopeutus voi vaihdella jopa 52 % tekstijakauman perusteella, 1,66‑kerrasta MT‑Benchissä 2,56‑kertaiseen MATH500:ssa H100:lla.

Kaikki luvut ovat Liquid AI:n omasta testausympäristöstä raportoituja: SGLang yhdellä H100 80 GB:lla BF16‑tilassa GPU‑lukujen osalta, llama.cpp kokeellisilla Metal‑ytimillä M4 Maxilla FP16‑GGUF‑painoilla laitteistokohtaisten lukujen osalta, rajoitettuna 256 lähtötokeniin. SGLang-polku vaatii DSpark‑tuen sisältävän rakennuksen LFM2‑kohteille, ja llama.cpp‑polku vaatii vastaavan rakennuksen, joten nopeutukset riippuvat näistä integraatioista eikä kummankaan moottorin vakaa julkaisu sisältä.

Liquid AI:n laitteistokohtainen panostus tähän mennessä

DSpark‑julkaisu on kolmas LFM2.5‑perheen päivitys hieman yli viikossa. 12. elokuuta 2026 yritys julkaisi LFM2.5-VL-3B:n, reunalle suunnatun näkö‑kielimallin, ja 19. elokuuta 2026 se julkaisi kvantisointitietoisen tiivistetyn Q4_0‑tarkistuspisteen perheelle. Yhtenäinen linja on sama: yritys sanoo, että 2,6 B‑mallin DSpark‑nopeutus MacBookilla vie interaktiivisuuden yli suurimpien kaupallisten pilvimallien tarjoaman läpimenon, jonka se arvioi olevan noin 140 tokenia sekunnissa.

Kaikki kolme draft‑mallia ovat nyt saatavilla Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark ja LFM2.5-8B-A1B-DSpark, GGUF‑rakennuksineen samassa llama.cpp‑asennuksia varten.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.