Tankeledare
Från kod till botemedel: Den nästa AI-revolutionen behöver en hand (och ögon)

Hur agensystem, XR-smartglas och robotik kommer att ge makt åt människor – inte ersätta dem
Vi lever i en paradox i artificiell intelligens.
På skärmar är AI övermänsklig. Stora språkmodeller skriver fungerande Python-kod på sekunder. Generativa system producerar fotorealistiska bilder och videor på minuter. Nobelprisvinnande system som AlphaFold har förutspått strukturerna för nästan alla kända proteiner. De digitala segrarna ackumuleras.
Men i den fysiska världen av biomedicinsk forskning förblir upptäcktsprocessen smärtsamt manuell. Vi känner inte riktigt att AI accelererar vetenskap eller medicin, åtminstone inte ännu. Siffrorna avslöjar djupet av problemet. En banbrytande Nature-undersökning av över 1 500 forskare fann att mer än 70% har försökt och misslyckats med att reproducera en annan forskares experiment. Ännu mer besvärande: mer än hälften kunde inte reproducera sitt eget arbete. I cancerbiologi specifikt fann ett åttaårigt reproducerbarhetsprojekt att endast 40% av högimpaktfynd kunde replikeras och 68% av experimenten saknade tillräcklig dokumentation för att ens försöka replikera.
Detta är den smutsiga hemligheten i modern vetenskap: vi har ett kunskapsfångstproblem, inte bara ett upptäcktsproblem. Kritiska experimentella detaljer lever i forskarnas huvuden, inte i papper. Protokoll glider. Tacit kunskap går ut genom dörren när trainees examineras. AI-system som tränats på publicerad litteratur ärver alla dessa luckor.
Det grundläggande problemet är att medan en AI kan designa ett nytt protein för cancerterapi i en digital simulering, kan den inte plocka upp en pipett för att testa det. Den kan inte navigera den smutsiga, oförutsägbara verkligheten av en våt laboratorium för att validera sin egen hypotes. Den kan inte se en erfaren forskares händer och lära sig de subtila teknikerna som gör att experiment fungerar.
Denna “genomförandegap” är den största flaskhalsen som förhindrar att AI-revolutionen blir en medicinsk revolution. Medan de flesta robotföretag fortfarande är upptagna med att lära maskiner att vika tvätt eller lasta diskmaskiner, ligger de efter på de verkligt transformerande förmågorna i dessa framsteg inom områden som medicin.
För att lösa detta måste vi gå utöver chatbots och mot AI Co-Scientists, agenssystem som broar den digitala och fysiska världen, och drivs bortom planering och kodning och in i verklig världens genomförande. På Stanford utvecklar vi LabOS, ett digitalt-fysiskt AI-ramverk som demonstrerar hur AI-agenter, Extended Reality (XR) smarta glasögon och samarbetsrobotik kan förenas för att stänga denna loop, och omvandla vetenskapliga experiment till en samarbetskonversation mellan människa och maskin, samtidigt som den automatiskt fångar den kunskap som för närvarande går förlorad.
Den stora klyftan: Varför AI behöver “ögon” och “händer”
Många av de mest synliga AI-segrarna har skett där miljön är fullständigt digital: kodarkiv, kuraterade datamängder eller simulerade benchmark (där AI tävlar om att köra ett virtuellt företag eller digitalt investera i aktier).
Våta laboratorier är annorlunda. Biologi, och i allmänhet vetenskaplig upptäckt, är en mycket bullrig process. Instrument glider, operatörer improviserar, och “protokollet” lever ofta delvis i människors huvuden. Skillnaden mellan ett rent resultat och ett misslyckat försök kan vara en pipetteringsvinkel, en vortexmönster, en reagenssubstitution eller en inkubation som varade 10 minuter för länge. Dessa kontextuella detaljer hamnar sällan i en artikel och de är exakt vad en AI-modell behöver om den ska generalisera bortom en datamängd.
Det är därför labbgraderad AI behöver ögon (för att uppfatta vad som händer i kontext), händer (för att standardisera och säkert automatisera högvarianssteg) och minne (för att spela in vad som faktiskt hände). Utan dessa förmågor kan modeller rekommendera vad man ska göra, men de kan inte tillförlitligt översätta rekommendationer till validerad fysisk genomförande eller förklara misslyckanden när verkligheten avviker från plan.
Bortom chatbots: Från copiloter till co-vetenskapsmän
Begreppet “agens AI” används ibland löst. I biomedicinska miljöer bör det betyda något precist: ett system som kan ta ett mål (t.ex. “optimera CRISPR-genteknikens effektivitet samtidigt som man minimerar avvikelser”), bryta ner det i en sekvens av uppgifter, utföra dessa uppgifter över verktyg, utvärdera resultat och anpassa planen under begränsningar och med granskningsbar beslutsfattning.
Detta är viktigt eftersom forskningsarbetsflöden inte är ett enda modellanrop. De är slut-till-slut-pipelines som spänner över hypotesformulering, experimentdesign, datahantering, statistisk testning och tolkning. Nylig tanke i läkemedelsupptäckt har börjat betona agenssystem som kan skala dessa pipelines snarare än att bara accelerera enskilda steg (t.ex. Unite.AIs diskussion om agenter i small-molecule-upptäckt).
I programvaruutveckling har vi redan sett tidiga empiriska bevis för att AI-copiloter kan öka utvecklarens genomströmning. I biomedicin är den analoga möjligheten inte bara att skriva kod, utan att skriva och validera protokoll, strukturera data, övervaka genomförande och stänga looparna mellan förutsägelse och mätning, och ansluta AI till mänskliga forskare i laboratorier.
LabOS: När AI körs på ett operativsystem för morgondagens laboratorier
I vårt arbete på Stanford om AI4Science, som omfattar genredigeringscopiloter som CRISPR-GPT och AI-XR co-execution system som LabOS som hjälper forskare i biomedicinska och materialvetenskapliga laboratorier, har vi undersökt en arkitektonisk förändring:
1. Designa ett slut-till-slut “laboratorieoperativsystem” som kopplar en digital (torr) laboratorium till ett fysiskt (vått) laboratorium.
Premissen är enkel: om en laboratoriebok är vetenskapens minne, bör ett laboratorie-OS vara exekveringslagret, som fångar avsikt, översätter den till åtgärder, observerar resultat och omvandlar varje körning till strukturerad kunskap.

Figur. En konceptuell vy av LabOS som kopplar en självutvecklande digital laboratorieloop (planering, kodning, kritik, verktygsbyggnad) med en mänsklig-AI-våtlaboratorieloop (autodokumentation, kunskapsfångst, XR-vägledning och robotintegration).
2. AI i den digitala laboratoriet – Självutvecklande planering och verktygsbyggnad
I den digitala (torra) laboratoriet kan vi låta AI göra vad den redan gör bra: söka, syntetisera och föreslå. Men vi vill också att den ska vara självförbättrande. Inte genom att “hallucinera ny vetenskap”, utan genom att lära sig bättre verktyg och arbetsflöden från feedback.
En praktisk digital-laboratorieloop kan ramas in som fyra återkommande faser:
- Planering (hypotes + design): föreslå hypoteser, välja experimentella variabler, förutse störningar och specificera mätbara slutpunkter.
- Kodning (implementering): generera eller anpassa analysmanus, simuleringspipeliner och instrumentkontrollmallar där det är lämpligt.
- Kritikagent (resonemang + utvärdering): stressa testa antaganden, kontrollera statistisk kraft, föreslå kontroller och flagga sannolika felmoder.
- Verktygsbyggnad (sök + utveckling): när arbetsflödet saknar en komponent (en parser, en QC-rutin, en instrumentpanel), bygga den och lägga tillbaka den i verktygslådan.
3. AI i den fysiska laboratoriet – AI med “ögon” (XR-glasögon) och “händer” (robotik)
Den fysiska (våta) laboratoriet är där systemet antingen vinner förtroende – eller förlorar det. Målet är inte att ersätta forskaren, utan att minska friktion och fel samtidigt som man ökar observerbarheten.
Vi ser den fysiska laboratorieloop som fyra kompletterande förmågor:
- Autoinspelning och dokumentation: fånga åtgärder, tidsstämplar, instrumentinställningar och avvikelser automatiskt, så att dokumentationen inte är en eftertanke.
- Kunskapsfångst för snabb, reproducerbar genomförande: omvandla körningar till strukturerade, frågebara artefakter (protokollversioner, parameteruppsättningar, QC-utfall) i linje med datastewardskapsprinciper som FAIR.
- Real-tids vision-språklig vägledning via XR-smartglasögon: använda multimodala modeller för att tolka scenen (vad operatören gör, vilket reagens som är i handen) och ge steg-för-steg-vägledning och säkerhetskontroller. AR/XR har redan visat sig vara värdefullt i högriskfysiska arbetsflöden som experimentvägledning (LabOS, Stanford, Princeton, i samarbete med NVIDIA).
- Cobot/robotisk integration för automatisering: standardisera repetitiva steg, möjliggöra säkra överlämningar och minska variabilitet. Plattformar för simulerings-till-verkliga arbetsflöden (t.ex. NVIDIA Isaac) och real-tids AI-bearbetning på kanten som smart glasögon live-streaming och mänsklig-AI-interaktion i LabOS är viktiga möjliggörande lager.
Denna arkitektur ligger i linje med en bredare riktning inom fältet: “självkörande” eller autonoma laboratorier som kombinerar automatisering med maskinlärning för att planera nästa experiment. Vad LabOS lägger till är en tätare mänsklig gränssnittslager, så att autonomi inte kommer på bekostnad av transparens.
Varför labbgraderad AI inte bara är “AI på en datamängd”
AI-system för biomedicinsk/vetenskaplig superintelligens ser ofta imponerande ut i retrospektiv utvärdering eller när de tar examen, och sedan underpresterar i det fysiska laboratoriet. Orsaken är sällan ett enda fel. Det är vanligtvis en mismatch mellan modellens antaganden och laboratoriets verklighet.
Tre luckor dyker upp återkommande:
- Kontextlucka: datamängder utelämnar vanligtvis de kontextuella variablerna som operatörer vet är viktiga (temperaturavvikelser, reagenspartinummer, subtila protokollavvikelser).
- Åtgärdslucka: många AI-system kan rekommendera vad man ska göra, men kan inte tillförlitligt översätta den rekommendationen till validerad fysisk åtgärd.
- Feedback-lucka: utan strukturerad, högkvalitativ feedback från genomförande kan modeller inte lära sig var de misslyckas – och forskare kan inte granska varför.
Att stänga dessa luckor är mindre om att uppfinna en ny neurala nätverksarkitektur, utan mer om att bygga instrument, gränssnitt och dataavtal som gör laboratoriet läsbart för maskiner, och låter AI se och arbeta med människor.
Tillit genom design: Säkerhet och styrning för AI som kan agera
Agens AI i upptäcktsforskning introducerar inte bara bekanta bekymmer om noggrannhet. Det introducerar nya felmoder eftersom det kan agera. I ett laboratorium betyder åtgärd potentialen för avfall, skada eller vilseledande slutsatser, särskilt när experiment matar in i kliniska hypoteser.
En användbar inställning är att behandla ett AI-aktiverat labstack som ett socio-tekniskt system som behöver försäkran. Flera befintliga ramverk hjälper, men de måste översättas till laboratoriets verklighet:
- Riskhantering som en kontinuerlig praxis: NIST:s AI Risk Management Framework (AI RMF 1.0) erbjuder en praktisk vokabulär för att kartlägga, mäta och hantera AI-risk över hela livscykeln.
- Regulatorisk anpassning för medicinskt AI: FDA:s AI/ML-programvara som medicinsk enhet (SaMD), inklusive dess handlingsplan och relaterade riktlinjer, erbjuder en konkret vy över vad “god praxis” ser ut när AI påverkar patientvård.
För genredigering och andra högkonsekvensområden är styrning redan en global diskussion. Rekommendationer diskuteras om mänsklig genredigering, för att betona behovet av lämpliga tillsynsmechanismer och ansvarsfull styrning, som de som föreslagits av American Society for Gene and Cell Therapy, eller ASGCT. System som LabOS bör utformas för att göra regelefterlevnad lättare, inte svårare.
Kontrolllista: Kontroller för säkra AI-co-vetenskapsmän för vetenskaplig upptäckt
Enligt vår uppfattning bör ett säkerhetsmedvetet lab-OS implementera minst följande design:
- Ursprung på standard: varje datamängd, protokollversion och modellutdata ska vara spårbar till ingångar och tidsstämplar.
- Begränsad autonomi: systemet ska ha uttryckliga behörigheter (vad det kan göra utan bekräftelse) och eskalationsregler (när det måste fråga).
- Mänsklig åsidosättning och värdig nedgradering: när sensorer eller dataströmmar misslyckas, eller osäkerhet är hög, ska systemet falla tillbaka till en säkrare, enklare läge.
- Kontinuerlig validering: in-silico-prediktioner ska paras med fysisk-laboratorievalidering; fysisk-laboratoriekörningar ska innehålla QC-grindar innan slutsatser propagerar nedströms tillbaka till AI-modellerna/agenterna i den digitala världen.
- Säkerhet och dubbelanvändningsmedvetenhet: skydda lab-infrastruktur från manipulation.
Ge makt åt människor överallt: Kan AI-co-vetenskapsmän jämna ut spelplanen?
En av de mest övertygande löftena om en AI-XR “co-vetenskapsman” är inte bara hastighet för elitinstitutioner, utan också tillgänglighet för alla. Tänk på vad som för närvarande begränsar mindre laboratorier, startup-företag och avlägsna/landsbygds/kommunala kliniker:
- Begränsad tillgång till specialiserad expertis för guldstandardprotokoll och instrument.
- Högre relativ kostnad för utbildning, misstag och ombyggnad.
- Fragmenterad verktygsutrustning: anteckningsböcker, kalkylblad, instrumentloggar och analysmanus ansluter sällan renligt.
Ett system som kan vägleda genomförande i kontext (via XR-glasögon), fånga vad som hände automatiskt och föreslå nästa bästa steg baserat på tidigare körningar kunde göra avancerade analyser mer reproducerbara över platser. I princip kunde det också stödja distribuerad klinisk forskning där protokoll måste utföras konsekvent, även när resurser varierar.
Tidsplan: När får varje forskare och kliniker en co-vetenskapsman?
Sammanfattningsvis är vi närmare än många tror för vissa högvärdes-, högfrekventa uppgifter (t.ex. producera ett läkemedel tillförlitligt i laboratoriet) och längre bort än vad de flesta demonstrationer antyder för andra (t.ex. AI som helt löser stora problem som cancer eller Alzheimers). En realistisk tidsplan ser ut så här:
- Nära framtiden (inom 1 år): Arbetsflödesco-piloter som minskar administrativ belastning: protokollutkast, litteratursyntes, analysmallar och automatiserade QC-rapporter. Begränsningsfaktorn är integration, inte modellförmåga.
- Mellantiden (1-2 år): Co-execution system i laboratoriet: XR-glasögonvägledning, automatiserad dokumentation och selektiv robotik för högvarianssteg. Förtroende kommer att bero på granskningslogg och tight mänsklig-i-laboratorieloop-design.
- Längre tid (3+ år): Cross-domain co-forskare som kopplar upptäckt till översättning: länkar laboratoriedata till kliniska slutpunkter, övervakar säkerhetssignaler och hjälper till att utforma kliniska prövningar – samtidigt som man följer regulatoriska och etiska förväntningar.
Från kod till botemedel: Vägen framåt till 1000x vetenskaplig upptäckt
LabOS är ett försök att besvara en enkel fråga: vad om ett experiment kunde köras som en konversation, där avsikt, genomförande och bevis är kopplade från början till slut? Om vi bygger dessa system väl, kan de hjälpa till att lösa den översättningsgap som bromsar biomedicin och många fysiska vetenskapsdiscipliner (t.ex. materialvetenskap). Om vi bygger dem dåligt, kommer de att förstärka irreproducibilitet och skapa nya säkerhetsrisker.
Det viktigaste arbetet under de närmaste åren kommer att vara grundläggande: standardiserade data- och enhetsgränssnitt via byggandet av operativsystemet (liksom iOS kör alla typer av appar), byggande av AI-benchmark som inkluderar genomförande och osäkerhet (som LabSuperVision-benchmark i LabOS), och startande på distribution i den verkliga världen som uppmuntrar innovation samtidigt som den skyddar patienter och forskningsintegritet.
För forskare och kliniker är frågan inte om AI kommer att gå in i laboratoriet. Det har redan gjort det. Frågan är om vi kommer att integrera det som en samling frånkopplade verktyg eller som ett pålitligt, granskningsbart system utformat för biomedicinsk vetenskaps realiteter.
Föreslagen läsning och källor
- Reproducerbarhetsundersökning (Nature, 2016): https://www.nature.com/articles/533452a
- CRISPR-GPT peer-granskad artikel (Nature Biomedical Engineering): https://www.nature.com/articles/s41551-025-01463-z
- Stanford Medicine nyheter om CRISPR-GPT (2025): https://med.stanford.edu/news/all-news/2025/09/ai-crispr-gene-therapy.html
- LabOS preprint (arXiv): https://arxiv.org/abs/2510.14861
- LabOS och LabSuperVision-benchmark webbplats: https://ai4lab.stanford.edu
- NIST AI Risk Management Framework (AI RMF 1.0): https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
- FDA översikt av AI/ML-programvara som medicinsk enhet: https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-software-medical-device
- FAIR data-principer (Scientific Data, 2016): https://doi.org/10.1038/sdata.2016.18
- Unite.AI om flaskhalsar i small-molecule läkemedelsupptäckt: https://www.unite.ai/how-ai-is-breaking-down-the-bottlenecks-in-small-molecule-drug-discovery/
- Unite.AI om AI och robotkirurgi: https://www.unite.ai/how-ai-is-ushering-in-a-new-era-of-robotic-surgery/












