AI-modeller og platforme

Hvorfor Agentic AI stadig fejler i den virkelige verden

mm
Føj Unite.AI til dine foretrukne kilder på Google

I de sidste få år har vi set agentic AI-systemer generere imponerende demonstrationer. De skriver kode, der passerer testcases. De søger på internettet og besvarer komplekse spørgsmål. De navigerer i software-grænseflader med bemærkelsesværdig præcision. Hver konferencepræsentation, hver pressemeddelelse, hver benchmark-rapport fremhæver opkomsten af agentic AI.

Men der er et problem, der gemmer sig under disse imponerende demonstrationer. Når disse systemer flyttes fra kontrollerede miljøer til virkelige anvendelser, fejler de ofte på måder, som benchmarks aldrig havde forudset. Kodegeneratoren, der fungerede perfekt på 100 kuraterede eksempler, begynder at producere fejl på edge-cases, den aldrig havde set før. Søgeagenten, der opnåede 85% nøjagtighed i laboratoriet, henter stadig mere irrelevante resultater, efterhånden som brugeradfærd ændrer sig. Planlægningsystemet, der koordinerede ti API-kald fejlfrit under testning, bryder sammen, når det møder et uventet API-svarformat.

Disse systemer fejler ikke, fordi de mangler intelligens, men fordi de mangler tilpasning. Problemet ligger i, hvordan AI-agenter lærer og tilpasser sig. Mens avancerede systemer er bygget på massive grundmodeller, er ren intelligens alene ikke nok. For at udføre specialiserede opgaver skal en agent kunne tilpasse sig. Nuvarerende agentic AI-systemer kan ikke gøre dette på grund af strukturelle begrænsninger i deres design og træning. I denne artikel udforsker vi disse begrænsninger og hvorfor de består.

Illusionen om evne i demonstrationer

Den farligste fejltype i moderne AI er illusionen om kompetence. Korte demonstrationer kan ofte skjule den virkelige kompleksitet. De opererer på rene datasæt, forudsigelige API’er og snævre opgaveområder. Produktionsmiljøer er det modsatte. Databaser er ufuldstændige, skemaer ændrer sig uden varsel, tjenester går i timeout, tilladelser er i konflikt, og brugere stiller spørgsmål, der krænker systemets underliggende antagelser.

Dette er, hvor produktionskompleksiteten øges betydeligt. En enkelt edge-case, der optræder én gang i en demonstration, kan optræde tusinder af gange om dagen i drift. Små probabilistiske fejl akkumulerer. En agent, der er “næsten rigtig”, bliver hurtigt ureliable i virkelige operationer.

I kerneproblemet ligger afhængigheden af frosne grundmodeller. Disse modeller excellerer i mønstergennemføring, men agentic adfærd er sekventiel og tilstandsbaseret. Hver handling afhænger af udfaldet af den foregående. I sådanne sammenhænge akkumulerer statistisk usikkerhed hurtigt. En mindre fejl tidligt i en opgave kan kaskade til løkker, døde ender eller destruktive handlinger senere. Dette er hvorfor agenter, der ser kompetente ud under evaluering, ofte degraderer hurtigt, når de deployes.

Problemet er ikke et manglende træk. Det er, at generelle modeller bedes om at opføre sig som domæneeksperter uden at blive tilladt at lære fra deres omgivelser.

Fra generel intelligens til lokal kompetence

Grundmodeller er generiske af design. De kodificerer bred viden og fleksible resonemønstre. Produktionsagenter må være situationelle. De skal forstå de specifikke regler, begrænsninger og fejltyper for en bestemt organisation og dets værktøjer. Uden dette ligner de en person, der har læst alle manualer, men aldrig har arbejdet en dag på jobbet.

At brobygge dette gap kræver en omdefinering af tilpasning selv. Nuvarerende metoder falder i to brede, fejlbehæftede lejre: Genoptræning af den centrale AI-agent eller finjustering af de eksterne værktøjer, den bruger. Hver tilgang løser ét problem, mens den skaber andre. Dette efterlader os med systemer, der er enten for stive, for dyre eller for ustabile til produktionsmiljøer, hvor konsistens og omkostninger betyder noget.

Den monolitiske agent-fælde

Den første tilgang, Agent-Tilpasning, forsøger at gøre den centrale LLM smartere i brug af værktøjer. Det lærer AI de specifikke færdigheder, den behøver for at bruge værktøjerne. Forskere kategoriserer dette yderligere i to klasser. Nogle metoder træner agenten ved hjælp af direkte feedback fra værktøjer, som en kodekompilators succes eller en søgemotors resultater. Andre træner det baseret på den endelige outputs korrekthed, som et rigtigt eller forkert svar.

Systemer som DeepSeek-R1 og Search-R1 viser, at agenter kan lære komplekse, multi-trins strategier for værktøjsbrug. However, denne kraft kommer med en betydelig omkostning. Træning af milliard-parameter-modeller er computermæssigt ekstravagant. Mere kritisk skaber det en stiv, skrøbelig intelligens. Ved at kombinere agentens viden og værktøjsregler gør denne tilgang opdateringer langsomme, risikable og uegnet til hurtigt skiftende forretningsbehov. At tilpasse agenten til en ny opgave eller værktøj risikerer “katastrofalt glemsomhed“, hvor den mister tidligere mestrede færdigheder. Det er som at skulle genopbygge en hel fabriksproduktionslinje hver gang, man ønsker at tilføje en ny widget.

Den skrøbelige værktøjsproblematik

At erkende disse begrænsninger, den anden store tilgang, Værktøjs-Tilpasning, lader den centrale agent være frosset og i stedet optimerer værktøjerne i dets økosystem. Dette er mere modulært og omkostningseffektivt. Nogle værktøjer trænes generisk, som en standard søgemodtager, og indsættes. Andre er specifikt afstemt til at supplere en frosset agent, og lærer af dets outputs for at blive bedre hjælpere.

Dette paradigme indeholder store løfter for effektivitet. En bemærkelsesværdig studie af et system kaldet s3 demonstrerede potentialet for denne tilgang. Det trænede et lille, specialiseret “søger”-værktøj til at støtte en frosset LLM, og opnåede en præstation, der var sammenlignelig med en fuldt genoptrænet agent som Search-R1, men brugte 70 gange færre træningsdata. Intuitionen er, at hvorfor genlære en genial fysiker, hvordan man bruger en bibliotekskatalog? I stedet træn en bedre bibliotekar, der forstår fysikeren behov.

Men værktøjsmodellen har sin egen begrænsning. Systemets evner er ultimativt begrænset af den frosne LLM’s indre resonemønstre. Du kan give en skarpere skalpel til en kirurg, men du kan ikke gøre en ikke-kirurg udføre hjertekirurgi. Desuden bliver orkestreringen af en voksende samling af adaptive værktøjer en kompleks integrationsudfordring. Værktøj A kan optimere for en metrik, der krænker Værktøj B’s inputkrav. Systemets præstation afhænger derefter af en skrøbelig balance mellem interne komponenter.

Tilpasningsudfordringen

Dette bringer os til kerneproblemet med tilpasningsdeficit i nuvarerende agentic AI-paradigmer. Vi tilpasser enten agenten eller værktøjerne, men ikke begge på en synkroniseret, stabil måde. Produktionsmiljøer er ikke statiske. Nye data, nye brugerkrav og nye værktøjer opstår konstant. Et AI-system, der ikke kan udvikle sig smidigt og sikkert både sin “hjerne” og sine “hænder”, vil uundgåeligt bryde sammen.

Forskere identificerer dette behov for samtilpasning som den næste front. Men det er en kompleks udfordring. Hvis både agenten og dets værktøjer lærer samtidigt, hvem får kreditten eller skylden for fejl? Hvordan forhindrer man en ustabil feedback-løkke, hvor agenten og værktøjerne jagter hinandens ændringer uden at forbedre den overordnede præstation? Tidlige forsøg herpå, som at behandle agent-værktøjsforholdet som et samarbejdende multi-agent-system, afslører vanskeligheden. Uden robuste løsninger for kredittildeling og stabilitet forbliver selv vores mest avancerede agentic AI en samling imponerende, men ikke forbundne evner.

Hukommelse som et førsteklassesystem

En af de mest synlige tegn på tilpasningsdeficitet er statisk hukommelse. Mange deployerede agenter forbedrer sig ikke over tid. De gentager de samme fejl, fordi de ikke kan internalisere erfaring. Hver interaktion behandles, som om det var den første.

Produktionsmiljøer kræver tilpasningshukommelse. Agenter behøver episodisk genkaldelse for at håndtere lange-horizon-opgaver, strategisk hukommelse for at finpudse planer, og operativ hukommelse for at undgå at gentage fejl. Uden dette føles agenterne skrøbelige og upålidelige.

Hukommelse skal behandles som en justerbar komponent, ikke en passiv log. Systemer, der gennemgår erfaring, lærer af fejl og tilpasser deres adfærd, er langt mere stabile.

Nye risici fra adaptive systemer

Tilpasning introducerer sine egne risici. Agenter kan lære at optimere målinger i stedet for mål, en fænomen kendt som parasitær tilpasning. De kan synes succesfulde, mens de undergraver det underliggende mål. I multi-agent-systemer kan kompromitterede værktøjer manipulere agenter gennem subtile prompt-injektion eller misvisende data. For at mindske disse risici kræver agenter robuste verificeringsmekanismer. Handlinger skal være testbare, omvendelige og auditable. Sikkerhedslag mellem agenter og værktøjer sikrer, at fejl ikke propagereer stille.

Resultatet

For at Agentic AI kan fungere i den virkelige verden, kan det ikke kun være intelligent; det må også kunne tilpasse sig. De fleste agenter fejler i dag, fordi de er “frosne” i tid, mens den virkelige verden er kompleks og konstant ændrer sig. Hvis en AI ikke kan opdatere sin hukommelse og forbedre sig fra fejl, vil den til sidst bryde sammen. Pålidelighed kommer ikke fra en perfekt demonstration; det kommer fra evnen til at tilpasse sig.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.