Gezondheidszorg
Ginkgo Datapoints onthult VCPI: een moedig plan om het dataprobleem van AI-geneesmiddelenontdekking op te lossen

Al jarenlang wordt AI in geneesmiddelenontdekking gehinderd door een ogenschijnlijk eenvoudig probleem: de data is niet goed genoeg. Bergen van sequentiebepaling, gepoolde perturbatiestudies en gemengde cel-experimenten gaven de indruk van vooruitgang zonder echte doorbraken te leveren. In plaats van duidelijkheid produceerde het veld ruis. In plaats van reproduceerbaarheid produceerde het drift. En in plaats van de precieze, farmacologie-specifieke metingen die nodig zijn om betrouwbare virtuele celmodellen te trainen, produceerde het datasets die meer geoptimaliseerd waren voor schaal dan voor wetenschappelijke integriteit.
Dit is de omgeving waarin Ginkgo Datapoints het Virtual Cell Pharmacology Initiative (VCPI) lanceert – een project dat niet alleen meer data belooft, maar betere data levert, speciaal ontworpen voor AI-modellen die proberen te voorspellen hoe echte geneesmiddelmoleculen werken in echte biologische systemen. Het officiële bericht van het bedrijf benadrukt dat VCPI meer dan 12 miljard datapunten zal genereren en 100.000 verbindingen zal profileren, waarmee het de eerste gestandaardiseerde farmacologiedataset voor virtuele celmodellering wordt.
Waarom “Meer Data” Faalde
In de blogpost waarin VCPI wordt geïntroduceerd, gebruikt Ginkgo een analogie die de verkeerde richting van het veld perfect vastlegt. Stel je voor dat je een handvol pillen in een kooi met muizen gooit – en dan probeert te achterhalen welke muis welke pil heeft gegeten. Nu schaal je dit op tot een miljoen muizen in één grote kooi. Dat is de kernfout achter gepoolde enkele-cel farmacologie-experimenten. Ze genereren indrukwekkende hoeveelheden data, maar het onderliggende ontwerp voorkomt dat er een schone toewijzing is tussen verbinding en fenotype.
Het probleem is niet de technologie; het is de experimentele architectuur. De aanname dat grotere datasets automatisch betere modellen opleveren, is vals gebleken. De blog noemt deze mentaliteit een “data-verslaving” en stelt dat zonder goed gestructureerde, hoge-signaal-inputs, zelfs de meest geavanceerde AI de verkeerde patronen zal leren.
VCPI vertegenwoordigt een scherpe afwijking van deze logica. In plaats van de grootte te verheerlijken, zet het in op biologische traceerbaarheid, experimentele strengheid en de gecontroleerde structuur die nodig is voor AI om daadwerkelijk farmacologie te leren.
Hoe VCPI de Datapipeline Opbouwt
In plaats van te vertrouwen op gepoolde enkele-cel-assays, gebruikt VCPI DRUG-seq, een high-throughput bulk RNA-sequencing-methode waarbij elke verbinding in een geïsoleerde gebarcoded put wordt behandeld. Dit stelt Ginkgo in staat om behandelingsspecifieke reacties te meten met een veel schoner signaal-ruis-verhouding dan gepoolde ontwerpen bieden. Volgens het persbericht kan het automatiseringsinfrastructure van het bedrijf meer dan 100 volledige 384-well-platen per week uitvoeren, waarmee het miljoenen hoge-fideliteit-RNA-metingen op industriële schaal genereert.
Even belangrijk is de introductie van V-Ref293, een nieuw ontworpen, gestandaardiseerde referentiecellijn. In plaats van dat elk lab zijn eigen gemuteerde, gedrifieerde versie van dezelfde cellijn uitvoert, creëert VCPI een universele biologische basislijn – een “organische tweeling” van de opkomende klasse van virtuele cellen. Dit elimineert een van de langdurige bronnen van irreproduceerbaarheid in farmacogenomica en biedt de stabiele grondwaarheid die AI-modellen nodig hebben.
Onder dit initiatief opent Ginkgo de deuren voor een community-gedreven dataset met verschillende kenmerkende componenten:
- Open deelname voor onderzoekers, farmateams en AI-ontwikkelaars
- Gratis high-throughput RNA-profileren voor ingediende verbindingen
- Optionele embargo of permanente propriëtaire toegang voor contribuanten
- Maandelijkse datavrijgave vormgegeven door community-stemming
- Mogelijkheden voor model-delings-, verbindingprioritering- en vroeg-toegang “super-gebruiker”-status
Een Community-Gebouwd Model, Geen Data-Dump
Een van de meest ongebruikelijke aspecten van VCPI is de beslissing om te lanceren voordat de dataset bestaat. In plaats van een voltooide bron te uploaden, vraagt Ginkgo de wetenschappelijke gemeenschap om te helpen bepalen welke verbindingen het meest belangrijk zijn en om in real-time samen te werken terwijl de dataset groeit.
Deze aanpak vermindert ook het risico van deelname. Vroeg-stadia biotechs kunnen verbindingen indienen en ontvangen echte farmacologische gegevens zonder hun schaarse budget te verbranden aan high-throughput-screening. AI-teams kunnen ervoor zorgen dat de dataset de perturbaties weerspiegelt die ze daadwerkelijk nodig hebben voor modeltraining. En academische labs kunnen contribueren terwijl ze nog steeds de mogelijkheid hebben van een 90-dagen exclusieve venster.
De structuur verandert dataproduktie in een participatief wetenschappelijk proces – geen statisch product.
Wat Dit Betekent voor de Toekomst van Bio-AI
De bredere implicaties van VCPI reiken verder dan Ginkgo of enig ander virtueel cel-initiatief. Voor virtuele celmodellen om wetenschappelijk geloofwaardig te worden, moeten ze getraind worden op data die reproduceerbaar, behandelingsspecifiek en verankerd zijn in een stabiele biologische referentie. Zonder deze basis zal AI blijven hallucineren, misvoorspellen of overfitting op artefacten.
Initiatieven zoals VCPI signaleren een verschuiving in hoe het veld over data zelf denkt. Experimentele ontwerp wordt even belangrijk als modelarchitectuur. Reproduceerbaarheid keert terug als een centrale vereiste in plaats van een optioneel ideaal. En community-gedreven, open-infrastructuurprojecten beginnen gesloten propriëtaire datasets in te halen in hun vermogen om innovatie te versnellen.
Als virtuele cellen uiteindelijk betrouwbare voorspellingsmotoren worden – tools die helpen om verbindingen te rangschikken, toxiciteiten te signaleren of pathways te verlichten voordat een mens ooit een pipet aanraakt – zal het zijn omdat projecten zoals VCPI de gestructureerde, betrouwbare dataprotocolen hebben gecreëerd die ze nodig hadden om te groeien.
Door betere data te prioriteren boven meer data, zet Ginkgo de fundamenten van AI-geactiveerde biologie opnieuw in. VCPI reageert niet alleen op de dataproblemen in geneesmiddelenontdekking; het zet de toon voor een nieuwe era waarin biologische experimenten en AI-trainingspijplijnen samen evolueren, open en met doel.












