AI-modeller och plattformar

Från Evo 1 till Evo 2: Hur NVIDIA omdefinierar genetisk forskning och AI-drivna biologiska innovationer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Tänk dig en värld där vi kunde förutsäga beteendet hos levande organismer genom att bara analysera en sekvens av bokstäver. Detta är inte science fiction eller en magisk värld, utan en verklig värld där forskare har strävat efter att uppnå detta mål i åratal. Dessa sekvenser, som består av fyra nukleotider (A, T, C och G), innehåller de grundläggande instruktionerna för liv på jorden, från de minsta mikroberna till de största däggdjuren. Att avkoda dessa sekvenser har potentialen att låsa upp komplexa biologiska processer, vilket kan förvandla fält som personlig medicin och miljöhållbarhet.

Men trots denna enorma potential är avkodning av till och med de enklaste mikrobiella genomen en mycket komplex uppgift. Dessa genomer består av miljontals DNA-baspar som reglerar interaktionerna mellan DNA, RNA och proteiner – de tre nyckelelementen i den centrala dogmen i molekylärbiologi. Denna komplexitet existerar på flera nivåer, från enskilda molekyler till hela genomer, vilket skapar ett enormt fält av genetisk information som har utvecklats under miljarder av år.

Traditionella beräkningsverktyg har kämpat för att hantera komplexiteten hos biologiska sekvenser. Men med uppkomsten av generativ AI är det nu möjligt att skala över triljoner sekvenser och förstå komplexa relationer mellan sekvenser av token. Genom att bygga på denna utveckling har forskare vid Arc Institute, Stanford University och NVIDIA (NVDA ) arbetat med att bygga ett AI-system som kan förstå biologiska sekvenser som stora språkmodeller förstår mänskligt språk. Nu har de gjort en banbrytande upptäckt genom att skapa en modell som fångar både den centrala dogmens multimodala natur och komplexiteten hos evolution. Denna innovation kan leda till att förutsäga och designa nya biologiska sekvenser, från enskilda molekyler till hela genomer. I den här artikeln kommer vi att utforska hur denna teknologi fungerar, dess potentiella tillämpningar, utmaningarna den möter och framtiden för genetisk modellering.

EVO 1: En banbrytande modell för genetisk modellering

Denna forskning fick uppmärksamhet i slutet av 2024 när NVIDIA och dess samarbetspartner introducerade Evo 1, en banbrytande modell för analys och generering av biologiska sekvenser över DNA, RNA och proteiner. Tränad på 2,7 miljoner prokaryotiska och faggenomer, som totalt innehåller 300 miljarder nukleotidtoken, fokuserade modellen på att integrera den centrala dogmen i molekylärbiologi, modellera flödet av genetisk information från DNA till RNA till proteiner. Dess StripedHyena-arkitektur, en hybridmodell som använder konvolutionsfilter och grindar, hanterade effektivt långa sammanhang på upp till 131 072 token. Denna design tillät Evo 1 att länka små sekvensförändringar till bredare systemomfattande och organismnivåeffekter, vilket brottade gapet mellan molekylärbiologi och evolutionär genetik.

Evo 1 var det första steget i beräkningsmodellering av biologisk evolution. Den förutsåg med framgång molekylära interaktioner och genetiska variationer genom att analysera evolutionära mönster i genetiska sekvenser. Men när forskare försökte tillämpa den på mer komplexa eukaryotiska genomer blev modellens begränsningar tydliga. Evo 1 kämpade med enkel-nukleotidupplösning över långa DNA-sekvenser och var beräkningsmässigt dyrt för större genomer. Dessa utmaningar ledde till behovet av en mer avancerad modell som kunde integrera biologiska data över flera skalor.

EVO 2: En grundläggande modell för genetisk modellering

Genom att bygga på lärdomarna från Evo-1 lanserade forskare Evo 2 i februari 2025, vilket främjade fältet för biologisk sekvensmodellering. Tränad på en imponerande 9,3 biljoner DNA-baspar, har modellen lärt sig att förstå och förutsäga de funktionella konsekvenserna av genetisk variation över alla livets domäner, inklusive bakterier, arkeer, växter, svampar och djur. Med över 40 miljarder parametrar kan Evo-2:s modell hantera en oöverträffad sekvenslängd på upp till 1 miljon baspar, något som tidigare modeller, inklusive Evo-1, inte kunde hantera.

Det som särskiljer Evo 2 från dess föregångare är dess förmåga att modellera inte bara DNA-sekvenser utan också interaktionerna mellan DNA, RNA och proteiner – hela den centrala dogmen i molekylärbiologi. Detta tillåter Evo 2 att med stor noggrannhet förutsäga effekterna av genetiska mutationer, från de minsta nukleotidförändringarna till större strukturförändringar, på sätt som tidigare var omöjliga.

En viktig funktion i Evo 2 är dess starka nollskottsprediktionsförmåga, som möjliggör förutsägelse av de funktionella effekterna av mutationer utan att kräva uppgiftsspecifik finjustering. Till exempel klassificerar den med stor noggrannhet kliniskt signifikanta BRCA1-variationer, en avgörande faktor i bröstcancerforskning, genom att analysera DNA-sekvenser ensamma.

 Potentiella tillämpningar inom biomolekylära vetenskaper

Evo 2:s förmågor öppnar nya fronter inom genetik, molekylärbiologi och bioteknik. Några av de mest lovande tillämpningarna inkluderar:

  • Hälsovård och läkemedelsupptäckt: Evo 2 kan förutsäga vilka genvarianter som är associerade med specifika sjukdomar, vilket underlättar utvecklingen av riktade terapier. Till exempel i tester med varianter av bröstcancerassocierade genen BRCA1 uppnådde Evo 2 över 90% noggrannhet i att förutsäga vilka mutationer som är benigna kontra potentiellt patogena. Sådana insikter kunde påskynda utvecklingen av nya läkemedel och personliga behandlingsformer. ​
  • Syntetisk biologi och genetisk ingenjörskonst: Evo 2:s förmåga att generera hela genomer öppnar nya vägar för design av syntetiska organismer med önskade egenskaper. Forskare kan använda Evo 2 för att konstruera gener med specifika funktioner, vilket främjar utvecklingen av biobränslen, miljövänliga kemikalier och nya terapier.
  • Jordbruksbioteknik: Den kan användas för att designa genetiskt modifierade grödor med förbättrade egenskaper som torktålighet eller insektsresistens, vilket bidrar till global livsmedelssäkerhet och jordbruks hållbarhet.
  • Miljövetenskap: Evo 2 kan appliceras för att designa biobränslen eller konstruera proteiner som bryter ner miljöförorenande ämnen som olja eller plast, vilket bidrar till hållbarhetsinsatser.​

Utmaningar och framtida riktningar

Trots dess imponerande förmågor möter Evo 2 utmaningar. En viktig hinder är den beräkningsmässiga komplexiteten som är involverad i att träna och köra modellen. Med en kontextfönster på 1 miljon baspar och 40 miljarder parametrar kräver Evo 2 betydande beräkningsresurser för att fungera effektivt. Detta gör det svårt för mindre forskargrupper att fullt ut nyttja dess potential utan tillgång till högpresterande beräkningsinfrastruktur.

Dessutom, medan Evo 2 excellerar i att förutsäga effekterna av genetiska mutationer, finns det fortfarande mycket att lära om hur man använder det för att designa nya biologiska system från scratch. Att generera realistiska biologiska sekvenser är bara det första steget; den verkliga utmaningen ligger i att förstå hur man använder denna kraft för att skapa funktionella, hållbara biologiska system.

Tillgänglighet och demokratisering av AI inom genetik

En av de mest spännande aspekterna av Evo 2 är dess öppen källkod. För att demokratisera tillgången till avancerade genetiska modellverktyg har NVIDIA gjort modellparametrar, träningskod och datamängder offentligt tillgängliga. Denna öppna tillgänglighetsansats tillåter forskare från hela världen att utforska och expandera Evo 2:s förmågor, vilket påskyndar innovation inom den vetenskapliga gemenskapen.

Sammanfattning

Evo 2 är en betydande framsteg inom genetisk modellering, som använder AI för att avkoda det komplexa genetiska språket. Dess förmåga att modellera DNA-sekvenser och deras interaktioner med RNA och proteiner öppnar upp nya möjligheter inom hälsovård, läkemedelsupptäckt, syntetisk biologi och miljövetenskap. Evo 2 kan förutsäga genetiska mutationer och designa nya biologiska sekvenser, vilket erbjuder en transformerande potential för personlig medicin och hållbara lösningar. Men dess beräkningsmässiga komplexitet presenterar utmaningar, särskilt för mindre forskargrupper. Genom att göra Evo 2 öppen källkod möjliggör NVIDIA för forskare över hela världen att utforska och expandera dess förmågor, vilket driver innovation inom genetik och bioteknik. Medan tekniken fortsätter att utvecklas, har den potentialen att omforma framtiden för biologiska vetenskaper och miljöhållbarhet. för mindre forskargrupper. Genom att göra Evo 2 öppen källkod möjliggör NVIDIA för forskare över hela världen att utforska och expandera dess förmågor, vilket driver innovation inom genetik och bioteknik. Medan tekniken fortsätter att utvecklas, har den potentialen att omforma framtiden för biologiska vetenskaper och miljöhållbarhet. smaller research teams. By making Evo 2 open-source, NVIDIA is enabling researchers worldwide to explore and expand its capabilities, driving innovation in genomics and biotechnology. As technology continues to evolve, it holds the potential to reshape the future of biological sciences and environmental sustainability.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.