Modely a platformy AI

Backboard nastavuje nový globální standard v oblasti paměti AI — Skok směrem k skutečně agentic AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Backboard překročil důležitý práh pro systémy umělé inteligence, když prokázal, že paměť může být považována za základní infrastrukturu, nikoli za křehkou součást. Společnost oznámila, že nyní vede obě hlavní benchmarky paměti AI, LoCoMo a LongMemEval, a stala se tak první platformou, která toho dosáhla pod konzistentními akademickými a nezávislými metodami hodnocení.

V nezávislém hodnocení provedeném NewMathData dosáhl Backboard 93,4 procentní přesnosti na LongMemEval, což je nejvyšší veřejně hlášený skóre do dneška, když se běžel podle původní specifikace benchmarku. Tento výsledek navazuje na jeho dříve publikované 90,1 procentní skóre na LoCoMo, čímž se Backboard zařadil mezi velmi malou skupinu systémů, které jsou schopny udržet jak krátkodobou přesnost, tak dlouhodobou kontextuální souvislost.

Značně se ukázalo, že recenzenti identifikovali několik případů, kdy byly odpovědi Backboardu označeny jako nesprávné, přestože byly kontextuálně přesnější než očekávané odpovědi benchmarku. V těchto případech systém zahrnoval faktické informace, které byly již přítomny v interakci, místo aby se držel užšího výkladu podnětu. V důsledku toho představuje hlášený skóre konzervativní základnu spíše než horní limit výkonu.

Proč se paměť stala omezujícím faktorem v AI

Většina moderních systémů AI se stále chová, jako by neměla skutečnou minulost. Zatímco velké jazykové modely jsou excelente v generování plynulých odpovědí, tendenci zapomínat kontext jednou, když se skončí relace nebo okno podnětu. Tento limit nutí vývojáře opakovaně obnovovat stav prostřednictvím hacků načítání, inženýrství podnětu nebo křehkých řetězců nástrojů, které často selhávají, když systémy rostou v komplexitě.

Paměť není jen o vzpomínání. V praktických nasazeních paměť určuje, zda může systém AI zůstat soudržný over time, koordinovat přes úkoly a budovat důvěru s uživateli. Bez trvalé paměti systémy resetují, halucinují, nebo si protiřečí. Když se AI přesouvá z interakcí na jeden tah k dlouhodobým pracovním postupům, paměť se stala primárním uzlem.

Backboard přistupuje k tomuto problému tak, že paměť považuje za první třídovou infrastrukturu. Místo toho, aby paměť byla přidána k aplikační vrstvě, integruje trvalost, vložené objekty, načítání a orchestraci do jednotné platformy, která je přístupná prostřednictvím jediného API.

Systémový přístup místo ladění benchmarku

Backboard nezkonstruoval svou architekturu, aby honil skóre benchmarku. Hodnocení byla buď iniciována nezávisle nebo použita interně, aby se pochopilo, jak se systém porovnává s akademickým výzkumem. Výsledný výkon odráží systémové chování v realistických podmínkách spíše než úkolem specifické optimalizace.

Tento rozdíl je důležitý, protože většina benchmarků měří chování modelu v izolaci, zatímco skutečné systémy AI se skládají z mnoha pohyblivých částí. Výsledky Backboardu naznačují, že výkon paměti není pouze funkcí velikosti modelu nebo hrubé síly výpočtu, ale toho, jak je paměť strukturována, aktualizována a sdílena over time.

Platforma kombinuje trvalou dlouhodobou paměť, rodící se vložené objekty a vektorizaci, vestavěnou generaci načítání, sdílenou paměť napříč agenty a přístup k více než 17 000 velkým jazykovým modelům, včetně podpory pro přinést si vlastní klíč. Tímto sjednocením Backboard odstraňuje potřebu pro podniky šít spolu otevřené komponenty, které často selhávají pod produkčními omezeními.

Učinění agentic AI praktickým

Zájem o agentic AI pokračuje růst, ale většina implementací zápasí s přechodem za hranice demonstrací. Důvod je jednoduchý. Agenti bez sdílené, trvalé paměti nemohou efektivně koordinovat. Fragmentují, ztrácejí kontext a chovají se nepředvídatelně, když interakce trvají over time.

Backboard umožňuje trvalou, sdílenou paměť napříč agenty, i když tito agenti spoléhají na různé základní modely. Když je paměť spolehlivá, agentic chování se objevuje přirozeně spíše než skriptováním. Systémy si mohou pamatovat předchozí rozhodnutí, udržet kontinuitu přes relace a koordinovat akce bez stálého opětovného podnětu.

Podkladový rámec paměti platformy je navržen tak, aby zachoval časovou koherenci spíše než rekonstruovat stav prostřednictvím statických grafů nebo opakovaného načítání. To umožňuje systémům AI zůstat konzistentními a auditovatelnými, když rostou v komplexitě.

Postavený pro systémy, které si nemohou dovolit zapomenout

Architektura Backboardu je zakořeněna v zkušenosti jeho zakladatele a generálního ředitele, Roba Imbeaulta, který dříve pomáhal budovat Assent z raného startupu do globální podnikové platformy s hodnotou přes 1,4 miliardy dolarů. V Assentu systémy, na kterých Imbeault pracoval, byly hluboce zakotveny uvnitř operací zákazníků, podporovaly soulad s předpisy a komplexní pracovní postupy dodavatelského řetězce, kde kontinuita, správnost a důvěra byly nezbytné.

To utvořilo jasnou přesvědčení. Nejhodnotnější infrastruktura je zřídka okázalá. Je to infrastruktura, která funguje tiše, konzistentně a po dlouhou dobu. V takových prostředích systémy nemohou resetovat, když je ztracen kontext. Pokud stav zmizí nebo důvěra eroduje, systém selže provozně, ne pouze technicky.

Imbeault viděl strukturální nesoulad, který se objevil v moderní AI. Zatímco velké jazykové modely pokročily rychle, zůstaly fundamentalně bezzákladové. Kontext zmizel mezi relacemi, nutí vývojáře rekonstruovat paměť prostřednictvím křehkých řetězců podnětů a ad hoc vrstev načítání. Tyto přístupy mohou fungovat v demonstracích, ale rozpadají se, když se systémy AI očekávají, že budou běžet nepřetržitě, koordinovat přes agenty a vyvíjet se over time.

Backboard byl postaven, aby uzavřel tuto mezeru. Paměť je považována za trvalou infrastrukturu spíše než aplikační logiku, umožňující systémům AI zachovat stav přes interakce, modely a agenty. Zaměření na trvalost, správnost a dlouhodobou spolehlivost odráží víru, která byla vytvořena dlouho předtím, než Backboard existoval: v produkčních prostředích jsou selhání paměti nejsou minoritní defekty. Jsou systémovými riziky.

Tento pohled podkládá designovou filozofii Backboardu. Cílem není demonstrovat inteligenci v izolovaných okamžicích, ale umožnit systémům AI, aby se chovaly jako spolehlivý software, i když komplexita roste a časové horizonty se prodlužují.

Co to znamená pro budoucnost AI

Širší implikace výsledků Backboardu je, že další fáze pokroku AI nebude poháněna pouze většími modely nebo delšími kontextovými okny. Bude poháněna systémy, které mohou pamatovat, rozumět a vyvíjet se over time.

Když podniky nasazují AI napříč zákaznickou podporou, operacemi, výzkumem a souladem, trvalá paměť se stává základem pro důvěru a škálovatelnost. Platformy, které řeší paměť na úrovni infrastruktury, budou definovat, jak se agentic AI přesouvá z experimentů do každodenního použití.

S jeho architekturou paměti nyní ověřenou napříč akademickými i nezávislými benchmarky, Backboard se nyní soustředí na pomoc týmům lépe pochopit a vyhodnotit chování systémů AI pod reálnými omezeními. Nadcházející funkce Switchboard společnosti má za cíl učinit komplexní konfigurace AI více transparentními a předvídatelnými.

Budoucnost AI bude formována méně inteligentními triky podnětu a více systémy, které mohou být důvěryhodné over time. Paměť je základem této změny, a poslední výsledky Backboardu naznačují, že tato základna se konečně začíná formovat.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.