AI-mallit ja alustat

Liquid AI julkaisee LFM2.5-VL-3B:n nopeamman visio-kieli-AI:n reunalla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Liquid AI julkaisi LFM2.5-VL-3B:n 12. elokuuta 2026, 3,1 miljardin parametrin avoimen painojen visio-kieli-mallin, joka on suunniteltu toimimaan puhelimissa, kannettavissa tietokoneissa ja yksittäisissä GPU:ssa eikä datakeskuksessa. Malli, joka on julkaistu yhtiön blogissa ja laitettu Hugging Faceen painojen ollessa välittömästi saatavilla, laajentaa edellisen vuoden LFM2-VL-3B:aa vahvemmalla näytön ymmärtämisellä, objektiyhdistämisellä, monikuvan päättelyllä ja funktiokutsuilla.

Yhtiö asettaa julkaisun kaikkein kykenevimmäksi visiomallikseen itse isännöidyille laitteille. Julkaisupostauksessa Liquid AI kuvailee sitä “kaikkein kykenevimmäksi visio-kieli-mallikseen”, joka “tarjoaa kilpailukykyisen visio-suorituskyvyn mallien kanssa, jotka ovat kaksi kertaa suurempia, ja toimii nopeammin laajalla valikoimalla CPU- ja GPU-käyttökohteita, myös verrattuna malleihin, joilla on vähemmän parametreja.”

Kaikki benchmark- ja nopeustiedot tässä julkaisussa ovat toimittajan ilmoittamia: Liquid AI suoritti arviot itse vLLM 0.26.0:lla, ja jokainen malli oli ei-päättelytilassa ja ohjattiin vastaamaan suoraan. Kukaan riippumaton arvioija ei ole testannut uutta mallia vielä, mikä on odotettavissa julkaisupäivänä, vaikka Unite.AI:n viimeaikainen tutkimus, jossa arvioitiin useita samoja vertailumalleja, osoittaa miksi itsenäisesti mitattu transkriptiokäyttäytyminen voi poiketa puhdasista benchmark-pisteistä.

LFM2.5-VL-3B:n lukeminen näytöiltä, asiakirjoista ja useista kuvista

Malli yhdistää SigLIP2 400M NaFlex -näkymäkoodarin Googlen kanssa saman esikoulutetun rungon kanssa, jota Liquid AI:n LFM2.5-2.6B-tekstimalli, joka julkaistiin 4. elokuuta 2026, käytti. Mallikortissa mainitaan, että se on esikoulutettu noin 34 biljoonalla tokenilla, neljä kertaa enemmän näködatan kanssa kuin edeltäjänsä, ja sen sanastoa on laajennettu 128 000 tokeniin olemassa olevan tokenisaattorin laajentamisen kautta, eikä uudelleen koulutuksen kautta, muutoksen tarkoituksena on tuki ei-latinankielisille käsikirjoituksille. Jälkikoulutus yhdistää valvottua hienosäätöä suuremman opettajamallin tietämisestä, seurattuna monipalkkio- vahvistusoppimisella.

Neljä kykyalueen määrittää päivityksen LFM2-VL-3B:sta. Näytön ymmärtämisessä malli keskiarvo on 80,7 työpöydän, mobiilin ja web-jakojen osalla ScreenSpot-v2:lla, nousua edellisestä julkaisusta, joka oli yhden numeron ja 7,6 jakoa kohden, ja joka on selvästi 8 miljardin parametrin Gemma-4-E4B:ta (50,9) edellä, vaikka se on suuremman InternVL 3.5 4B:n (84,2) jäljessä. Objektiyhdistämisessä, jossa malli palauttaa rajoitusruutuja objekteille, jotka on kuvattu luonnollisella kielellä, RefCOCO-tarkkuus hyppää 57,1:stä 87,9:ään, yli 30 pisteen nousu, jonka Liquid AI liittää skaalattuihin synthetisiin yhdistämisdataan.

Funktiokutsu on uusi yhtiön visiolle. ToolSandboxilla, joka mitata toolin käyttöä, pisteet yli kaksinkertaistuvat 26,4:stä 59,5:een, asettamalla 3,1 miljardin parametrin mallin Gemma-4-E2B:n ja Qwen3.5-2B:n rinnalle. Monikuvan päättely parani myös terävästi, BLINK nousi 50,2:sta 61,5:een ja MuirBench 34,9:stä 58,3:een.

Koko 28-benchmarkin visiosarjan yli LFM2.5-VL-3B keskiarvo on 69,4, 12 pisteen parannus edeltäjänsä 57,2:sta ja vain 0,7 pistettä suuremman 4,7 miljardin parametrin Qwen3.5-4B:n jäljessä. Keskiarvo piilottaa todellista tekstuuria: malli jää kilpailijoistaan jälkeen joissakin yleisissä sarjoissa, ja se menettää maata CountBenchQA:lla, joka laskee 92,2:sta 87,3:een.

Mitä malli jättää tarkoituksella pois

LFM2.5-VL-3B on ei-päättelymalli. Se vastaa suoraan ilman välittömän ajatusketjun luomista, suunnittelupäätöksen, jonka Liquid AI perustelee viiveen optimoinnilla: mallikortti suosittelee sitä “yksittäisiin, suurtennopeuksisiin, matalan viiveen tehtäviin”, mainiten lähes reaaliaikaisen objektietsinnän ajoneuvo-sovelluksissa, skannattujen asiakirjojen erän OCR:n ja laitteiston käännöksen valikoiden ja tiensanomien käännöksen tarkoituksellisiksi kuormiksi.

Sama kortti toteaa selvästi, mitä malli ei ole tarkoitettu. Se “ei suositella pitkän kontekstin, päättelyintensiivisille tehtäville, kuten visuaalisen verkkosuunnittelulle tai teknisille kysymyksille piirustuksista.” Kontekstin pituus on 32 768 tokenia, ja kortti merkitsee sen layout-merkintä-OCR-muodon kokeelliseksi, varoittaen, että se “voi muuttua, voi olla epäluotettava ja voi olla vaikea parsia.” Nämä ovat toimittajan omat ilmoitetut rajoitukset, ja ne merkitsevät, missä kykyvaatimukset loppuvat.

Nopeustiedot, jotka ankkuroivat julkaisun, seuraavat siitä. Liquid AI raportoi dekoodausnopeuksia 228 tokenia sekunnissa Apple M5 Maxilla ja 116 tokenia sekunnissa AMD Ryzen AI Max+ 395:llä, noin 3 gigatavun muistissa, ja 20 tokenia sekunnissa Galaxy S26 Ultra -puhelimella. Yhdellä NVIDIA H100:lla yhtiö mitata ajan ensimmäiseen tokeniin noin 34 millisekuntiin viiden kehyksen videoklipissä, verrattuna noin 200 millisekuntiin Gemma-malleille, ja lähtönopeus on lähellä 11 000 tokenia sekunnissa suuressa rinnakkaisuudessa, mikä yhtiön mukaan vastaa lähes miljardia lähtötokenia päivässä yhdellä kortilla.

LFM2.5-VL-3B luvuissa

  • 3,1 miljardia parametreja; 34 biljoonaa esikoulutustokenia; 32 768 tokenin konteksti
  • 69,4 keskiarvo 28 visiobenchmarkin yli, verrattuna 57,2 LFM2-VL-3B:lle
  • 80,7 keskiarvo ScreenSpot-v2:n näytön ymmärtämisessä, nousua 2,5:stä 7,6:een jakoa kohden edellisessä julkaisussa
  • 87,9 RefCOCO-objektiyhdistämisen tarkkuus, nousua 57,1:stä
  • 59,5 ToolSandboxin funktiokutsussa, nousua 26,4:stä
  • 228 tokenia sekunnissa dekoodaus Apple M5 Maxilla; 20 tokenia sekunnissa Galaxy S26 Ultra -puhelimella; noin 3 gigatavun muistijalanjälki
  • Noin 11 000 lähtötokenia sekunnissa suuressa rinnakkaisuudessa yhdellä H100-kortilla

Mitä LFM2.5-VL-3B:n mukana toimitetaan

Painot ovat ladattavissa nyt Hugging Facen kautta avoimen painojen lisenssillä, kvantitoiduilla viennissä GGUF-, ONNX- ja MLX-muodoissa ja päivän 1 tuki yli llama.cpp, MLX, vLLM, SGLang ja ONNX-suorittimissa. WebGPU-demoversio suorittaa mallin kokonaan selaimessa, ja yhtiö listaa 16 tuettua kieltä, mukaan lukien englanti, arabia, kiina, japani ja hindi.

Julkaisu täydentää LFM2.5-perheen, jonka Liquid AI on koonnut toisen vuoden 2026 puolivälissä: LFM2.5-2.6B-tekstimalli 4. elokuuta 2026, koodaajamuunnelmat pitkän kontekstin CPU-päättelemiseen heinäkuun lopulla 2026, ja nyt lipun visiotaso, jota seuraa pienempi LFM2.5-VL-1.6B- ja 450M-muunnelma. Hienosäätömuistikirjat ja asiakirjat toimitetaan painojen kanssa, jotta malli voidaan sovittaa tiettyihin yhdistämis-, OCR- tai työkalukutsutehtäviin ensimmäisestä päivästä lähtien.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.