Helse
Ginkgo Datapoints avdekker VCPI: En dristig plan for å fikse AI-legemiddelfunnens dataproblem

I årevis har AI i legemiddelforskning blitt hindret av et deceptivt enkelt problem: dataene er ikke gode nok. Fjell av sekvensering, pølse perturbasjonsstudier og mixed-cell-eksperimenter ga inntrykk av fremgang uten å levere virkelige gjennombrudd. I stedet for klarhet produserte feltet støy. I stedet for reproduserbarhet produserte det drift. Og i stedet for de presise, farmakologisk-spesifikke målinger som er nødvendige for å trene pålitelige virtuelle cellemodeller, produserte det datasett som var optimalisert mer for skala enn vitenskapelig integritet.
Dette er miljøet hvor Ginkgo Datapoints lanserer Virtual Cell Pharmacology Initiative (VCPI) – et prosjekt som ikke bare lover mer data, men som sikter på å levere bedre data, tilpasset AI-modeller som prøver å forutsi hvordan virkelige legemiddel-liknende molekyler forstyrer virkelige biologiske systemer. Selskapets offisielle kunngjøring understreker at VCPI vil generere over 12 milliarder datapunkter og profilere 100 000 forbindelser, og etablere det første standardiserte farmakologidatasettet for virtuell cellemodellering.
Hvorfor “Mer Data” Feilet
I blogginnlegget som introduserer VCPI, bruker Ginkgo en analogi som fanger feltets feilrettede retning perfekt. Forestill deg å kaste en håndfull piller inn i en bur av mus – og så prøve å finne ut hvilken mus spiste hva. Nå skalering til en million mus i én stor bur. Dette er det grunnleggende feilet bak pølsede enkelt-celle farmakologiske eksperimenter. De genererer imponerende mengder data, men den underliggende designen forhindrer ren tilskrivning mellom forbindelse og fenotype.
Problemet er ikke teknologien; det er eksperimentell arkitektur. Antagelsen om at større datasett inneholder bedre modeller har vist seg å være feil. Bloggen kalder denne holdningen en “dataavhengighet”, og argumenterer for at uten godt strukturert, høy-signal innputt, vil selv de mest avanserte AI-modellene lære feil mønster.
VCPI representerer en skarp avvik fra denne logikken. I stedet for å glorifisere størrelse, dobbeltfester det på biologisk sporing, eksperimentell strenghet og den kontrollerte struktur som er nødvendig for at AI faktisk kan lære farmakologi.
Hvordan VCPI Gjenbygger Data-pipeline
I stedet for å bruke pølsede enkelt-celle-undersøkelser, bruker VCPI DRUG-seq, en høy-gjennomstrømming bulk RNA-sekvenseringsmetode hvor hver forbindelse behandles i en isolert bar-kodet brønn. Dette tillater Ginkgo å måle behandlingsspesifikke responser med lang renere signal-til-støy enn pølsede design tilbyr. Ifølge pressemeldingen kan selskapets automatiseringsinfrastruktur kjøre over 100 fullstendige 384-brønn-plater per uke, og generere millioner av høy-fidel RNA-målinger på industriell skala.
Likelynt er introduksjonen av V-Ref293, en nyutviklet, standardisert referanse-cellelinje. I stedet for at hvert laboratorium kjører sin egen muterte, dradd cellelinje, skaper VCPI en universell biologisk baseline – en “organisk tvilling” til den nye klassen av virtuelle celler. Dette eliminerer en av de langvarige kildene til irreproduserbarhet i farmakogenomik og gir den stabile grunn-sannhet som AI-modellene desperat trenger.
Under denne initiativet åpner Ginkgo døren til et community-drevet datasett med flere definerte komponenter:
- Åpen deltakelse for forskere, legemiddelteam og AI-utviklere
- Gratis høy-gjennomstrømming RNA-profilering for innsendte forbindelser
- Valgfri embargo eller permanent proprietær tilgang for bidragsytere
- Månedlige data-utgivelser formet av community-avstemning
- Muligheter for modell-deling, forbindelse-prioritering og tidlig-tilgang “super-bruker”-status
En Community-bygget Modell, Ikke en Data-Dump
En av de mest uvanlige aspektene ved VCPI er beslutningen om å lansere før datasettet eksisterer. I stedet for å laste opp en ferdig ressurs, ber Ginkgo det vitenskapelige samfunnet om å hjelpe å bestemme hvilke forbindelser som betyr mest og å samarbeide i sanntid mens datasettet vokser.
Dette tilnærmingen de-risker også deltakelse. Tidlige biotek-selskaper kan sende inn forbindelser og motta virkelige farmakologiske data uten å brenne verdifull budsjett på høy-gjennomstrømming screening. AI-team kan sikre at datasettet reflekterer perturbasjonene de faktisk trenger for modell-trening. Og akademiske laboratorier kan bidra mens de fortsatt beholder muligheten for en 90-dagers eksklusiv vindu.
Strukturen transformerer data-generering til en delt vitenskapelig prosess – ikke en statisk produkt.
Hva Dette Betyr for Fremtiden av Bio-AI
De bredere implikasjonene av VCPI når ut over Ginkgo eller noen enkelt virtuell celle-initiativ. For virtuelle cellemodeller å bli vitenskapelig troverdige, må de trenes på data som er reproduserbare, behandlingsspesifikke og ankret til en stabil biologisk referanse. Uten denne grunnlaget vil AI fortsette å hallucinere, misforutsi eller overfitte til artefakter.
Initiativer som VCPI signaliserer en skift i hvordan feltet tenker om data selv. Eksperimentell design blir like viktig som modell-arkitektur. Reproduserbarhet returnerer som en sentral krav i stedet for et valgfritt ideal. Og community-drevne, åpne-infrastruktur-prosjekter begynner å overgå lukkede proprietære datasett i deres evne til å akselerere innovasjon.
Hvis virtuelle celler til slutt blir pålitelige prediktive motorer – verktøy som hjelper å rangere forbindelser, flagge toksisiteter eller belyse stier før en menneske noen gang berører en pipette – vil det være fordi prosjekter som VCPI skapte den strukturerte, pålitelige data-miljøet de trengte for å vokse.
Ved å prioritere bedre data enn bare mer data, omdefinierer Ginkgo grunnlaget for AI-aktivert biologi. VCPI reagerer ikke bare på datakrisen i legemiddelforskning; det setter scenen for en ny æra hvor biologiske eksperimenter og AI-trening-pipelines utvikler seg sammen, åpent og med formål.












