AI-modellen en platforms
Thinking Machines Lab lanceert Inkling, zijn eerste open-weights multimodale AI-model

Thinking Machines Lab heeft Inkling uitgebracht, zijn eerste algemene kunstmatige intelligentie-model, waardoor ontwikkelaars toegang krijgen tot een systeem met bijna een triljoen parameters dat tekst, afbeeldingen en audio kan verwerken. De lancering op 15 juli 2026 is de belangrijkste product mijlpaal tot nu toe voor het zwaar gefinancierde AI-bedrijf, opgericht door de voormalige Chief Technology Officer van OpenAI, Mira Murati.
In plaats van te claimen dat ze het meest capabele model hebben gebouwd, positioneert Thinking Machines Inkling als een aanpasbare basis voor bedrijven, onderzoekers en ontwikkelaars die meer controle willen over hoe hun AI zich gedraagt. De gewichten kunnen via Hugging Face worden gedownload onder een Apache 2.0-licentie, terwijl het model ook kan worden fijngesteld via Thinking Machines’ Tinker-trainingsplatform.
Deze positionering kan belangrijk blijken te zijn, aangezien de AI-markt zich splitst tussen propriëtaire frontier-systemen die door een klein aantal bedrijven worden gecontroleerd en open-weights-alternatieven die organisaties kunnen aanpassen, hosten en integreren in hun eigen infrastructuur.
Een 975 miljard parameters model dat slechts een fractie tegelijk gebruikt
Inkling bevat 975 miljard parameters in totaal, waardoor het een van de grootste open-weights modellen is dat tot nu toe is uitgebracht. Echter, het gebruikt een sparse Mixture-of-Experts-architectuur, waardoor slechts 41 miljard parameters worden geactiveerd tijdens het verwerken van elk individueel token.
Het model bevat 66 transformer-lagen en 256 geroute experts. Elk token wordt naar zes van die experts gestuurd, samen met twee gedeelde experts die actief blijven over verzoeken heen. Deze aanpak is bedoeld om de kennis capaciteit van een zeer groot model te bieden zonder dat elk parameter tijdens elke inferentie-operatie hoeft te worden gebruikt.
Thinking Machines zegt dat de Mixture-of-Experts-ontwerp grotendeels volgt op ideeën die zijn geïntroduceerd in DeepSeek-V3, inclusief zijn routering- en load-balancing methoden. Inkling gebruikt ook een combinatie van sliding-window- en global attention-lagen, samen met relative positional embeddings in plaats van de Rotary Positional Embeddings die gewoonlijk in moderne taalmodellen worden gebruikt.
Het model ondersteunt een context venster van maximaal één miljoen tokens. Via Tinker hebben ontwikkelaars momenteel toegang tot 64.000-token en 256.000-token configuraties, terwijl de volledige context capaciteit beschikbaar is via compatibele implementaties van de gedownloade gewichten.
Native redenering over tekst, afbeeldingen en audio
Inkling is native multimodaal, waarbij het tekst, afbeeldingen en audio als invoer accepteert en tekst als uitvoer genereert. Afbeeldingen worden verwerkt met een hiërarchische patch-encoder, terwijl audio wordt omgezet in discrete tokens en in dezelfde gedeelde representatie ruimte als tekst en visuele informatie wordt geplaatst.
Thinking Machines heeft het model voorgetraind op 45 biljoen tokens afkomstig uit tekst, afbeeldingen, audio en video. Het bedrijf zegt dat de gegevens openbaar beschikbare materiaal, gelicenceerde of verworven derde partij bronnen en synthetisch gegenereerde of versterkte inhoud bevatten. Echter, de modelkaart biedt geen complete dataset-inventaris, waardoor “open weights” een meer accurate beschrijving is dan volledig open source.
Het bedrijf heeft ook een controleerbaar redeneringssysteem geïntroduceerd dat ontwikkelaars in staat stelt om aan te passen hoeveel berekening Inkling toepast voordat het een antwoord produceert. Lagere redenering instellingen kunnen latentie en token consumptie verminderen, terwijl hogere instellingen kunnen worden gebruikt voor moeilijker codering, wiskundige, wetenschappelijke of tool-gebruik taken.
Naast het hoofdmodel heeft Thinking Machines een voorbeeld van Inkling-Small getoond, een 276 miljard parameters Mixture-of-Experts model met 12 miljard actieve parameters. Het bedrijf zegt dat verbeteringen in zijn gegevens en trainingsrecept het kleinere model in staat stelden om het grotere model te evenaren of te overtreffen op verschillende evaluaties, hoewel Inkling-Small nog niet de volledige release behandeling heeft ontvangen.
Ontworpen om aan te passen via Tinker
Inkling is nauw verbonden met Tinker, het cloud-gebaseerde trainingsplatform dat Thinking Machines in 2025 heeft geïntroduceerd. Tinker stelt ontwikkelaars in staat om trainingsprocedures lokaal te schrijven, terwijl het platform de gedistribueerde GPU-infrastructuur beheert die nodig is om modellen van relatief kleine systemen tot triljoen parameters Mixture-of-Experts-architecturen fijn te stellen.
Het platform ondersteunt begeleide fijne afstelling, versterking leren, Direct Preference Optimization, destillatie en Low-Rank Adaptation. Klanten kunnen de resulterende checkpoints downloaden en Thinking Machines zegt dat klant trainingsgegevens alleen worden gebruikt om de klantmodellen fijn te stellen en niet worden opgenomen in hun eigen basis modellen.
Om dit aanpassingsproces te demonstreren, vroeg het bedrijf Inkling om zichzelf fijn te stellen tot een model dat nooit de letter “e” zou gebruiken. Inkling genereerde zijn eigen trainingsgegevens en evaluatie methode, creëerde en uitvoerde een fijne afstelling taak via Tinker, testte de bijgewerkte checkpoint en laadde vervolgens de gewijzigde gewichten in zijn werk omgeving.
De demonstratie is bewust smal, maar het illustreert de bredere strategie. Thinking Machines wil dat ontwikkelaars basis modellen behandelen als startpunten die kunnen worden aangepast aan een organisatie’s terminologie, workflows, gegevens, beleid en voorkeursgedrag, in plaats van als afgemaakte producten die volledig worden gecontroleerd door de oorspronkelijke model provider.
Concurrerende prestaties zonder de benchmark-kroon te claimen
Thinking Machines erkent openlijk dat Inkling niet het sterkste model is dat beschikbaar is in elke categorie. De benchmark resultaten plaatsen het over het algemeen onder de meest capabele open-weights systemen, terwijl de leidende propriëtaire modellen van bedrijven zoals Anthropic, Google en OpenAI een algemeen voordeel behouden.
Inkling scoorde 97,1% op de 2026 American Invitational Mathematics Examination benchmark en 87,2% op GPQA Diamond, die graduate-niveau wetenschappelijke redenering evalueert. Het scoorde 77,6% op SWE-bench Verified en 54,3% op SWE-bench Pro Public, twee benchmarks die worden gebruikt om te beoordelen of coderingsagenten echte software engineering problemen kunnen oplossen.
Op Humanity’s Last Exam scoorde Inkling 29,7% zonder tools en 46% met tool-toegang. De tool-geactiveerde prestaties waren concurrerend met verschillende open modellen, maar bleven onder de sterkste gesloten systemen die in Thinking Machines’ vergelijking zijn opgenomen.
Inkling kreeg ook een score van 1.257 op Design Arena’s Agentic Web Development leaderboard, waar menselijke evaluatoren applicaties vergelijken die zijn gemaakt door verschillende modellen. Dat plaatste het dicht bij verschillende propriëtaire systemen en voor een aantal gevestigde open-weights concurrenten.
Zoals bij elke door de leverancier gepubliceerde benchmark set, zullen de resultaten onafhankelijke reproductie vereisen. Thinking Machines gebruikte externe scores waar beschikbaar, maar verschillende evaluaties waren afhankelijk van interne harnassen, configuraties of zelf gerapporteerde resultaten van concurrerende model providers.
Lagere kosten komen met significante hardware-eisen
Inklings kost argument is grotendeels gebaseerd op zijn sparse architectuur en controleerbare redenering. Het activeren van 41 miljard parameters in plaats van alle 975 miljard zou de inferentie aanzienlijk efficiënter moeten maken dan het uitvoeren van een soortgelijk groot dicht model, terwijl ontwikkelaars toestaat om verlengde redenering te deactiveren voor verzoeken die dit niet vereisen.
Via Tinker is de 64.000-token versie geprijsd op $1,87 per miljoen prefill tokens, $4,68 per miljoen gesample tokens en $5,61 per miljoen trainings tokens. De 256.000-token configuratie is hoger geprijsd op $3,74 voor prefill, $9,36 voor sampling en $11,23 voor training, met lagere tarieven beschikbaar voor cached input.
Deze cijfers maken grote model experimenten toegankelijker dan het opbouwen van een gewijd trainingscluster, maar Inkling is geen model dat de meeste ontwikkelaars op een gewone workstation zullen uitvoeren. De volledige BF16-checkpoint vereist ten minste twee terabyte geaggregeerde graphics geheugen, equivalent aan acht Nvidia B300 GPUs of 16 H200 GPUs.
Een gequantificeerde NVFP4-checkpoint vermindert de vereiste tot ongeveer 600 gigabyte, maar vereist nog steeds infrastructuur zoals vier B300 GPUs of acht H200 GPUs. In de praktijk zullen veel organisaties Inkling waarschijnlijk toegang geven via Tinker of derde partij inference providers in plaats van het volledige model rechtstreeks te hosten.
Evenwicht tussen weerstand tegen censuur en veiligheidscontroles
Een van de meest ongebruikelijke ontwerpdoelen van Inkling is wat Thinking Machines beschrijft als weerstand tegen censuur. Het bedrijf zegt dat het model specifiek is getraind om vragen over onderwerpen te beantwoorden die mogelijk politiek of institutioneel gevoelig zijn, in plaats van ze automatisch te weigeren.
Cognition heeft Inkling geëvalueerd met zijn Propaganda en Censuur benchmark en Thinking Machines rapporteerde dat het model sterke patronen van “censuur niet-naleving” vertoonde. Het onderliggende idee is dat een open model niet onnodig politieke beperkingen of gestandaardiseerde meningen zou moeten erven die door de oorspronkelijke ontwikkelaar zijn ingebed.
Dat betekent niet dat Inkling is ontworpen om elk verzoek te beantwoorden. Het bedrijf heeft het model afzonderlijk getraind om instructies te weigeren die verband houden met wapens, geweld, cyber misbruik, chemische of biologische bedreigingen, manipulatie en andere gevaarlijke activiteiten.
Inkling scoorde 78% op de adversarial portion van de FORTRESS-veiligheidsbenchmark en beantwoordde correct 95,9% van de benigne vragen die zijn ontworpen om schadelijke verzoeken te lijken. Het behaalde ook 98,6% op StrongREJECT, dat meet of modellen duidelijk schadelijke instructies weigeren. Thinking Machines zegt dat deze combinatie aangeeft dat het model veiligheidscontroles kan handhaven zonder legitieme vragen te veel te blokkeren, hoewel het effect van latere derde partij fijne afstelling een open onderzoeksprobleem blijft.
Van OpenAI-leiderschap naar een $12 miljard startup
Thinking Machines Lab is formeel gelanceerd in februari 2025, enkele maanden nadat Murati OpenAI verliet. Ze had gediend als Chief Technology Officer van OpenAI tijdens de lancering van producten zoals ChatGPT, DALL-E en de vroege voice en multimodale systemen van het bedrijf.
Het oorspronkelijke team bestond uit ongeveer 30 onderzoekers en ingenieurs die zijn geworven bij OpenAI, Meta, Mistral en andere AI-organisaties. Ongeveer twee derde van de medewerkers van het bedrijf bij de lancering had eerder bij OpenAI gewerkt. De oprichtingsgroep omvatte OpenAI-oprichter John Schulman, Barret Zoph, Lilian Weng, Andrew Tulloch en Luke Metz, met ervaring in versterking leren, model alignering, multimodale AI, pretraining en post-training.
Slechts vijf maanden na de lancering heeft Thinking Machines ongeveer $2 miljard opgehaald tegen een waardering van $12 miljard. Andreessen Horowitz leidde de ronde, met deelname van Nvidia (NVDA ), Accel, ServiceNow (NOW ), Cisco, AMD en de kwantitatieve handelsfirma Jane Street.
Nvidia heeft sindsdien de relatie met het bedrijf uitgebreid via een meerjarige strategische samenwerking. Aangekondigd in maart 2026, is de overeenkomst een implementatie van ten minste één gigawatt van de volgende generatie Nvidia Vera Rubin-systemen om de model training en aanpasbare AI-platforms van Thinking Machines te ondersteunen. Nvidia heeft ook een extra investering in het bedrijf gedaan.
Inkling weerspiegelt een bredere inzet op gedecentraliseerde AI
Thinking Machines stelt dat de meeste AI-systemen worden getraind door een klein aantal bedrijven en vervolgens worden verdeeld als grotendeels vaste producten. Hun alternatief is een ecosysteem waarin bedrijven en individuen modellen voortdurend kunnen aanpassen met hun eigen kennis, voorkeuren en oordeel.
Deze filosofie helpt te verklaren waarom Inkling wordt uitgebracht met downloadable gewichten in plaats van alleen via een propriëtaire interface. Het verbindt ook het model met Tinker, dat de trainingsinfrastructuur biedt die nodig is om gedrag aan te passen zonder elke organisatie te dwingen een grote GPU-cluster op te bouwen.
Er is nog steeds spanning tussen deze visie en de praktische realiteiten van de release. Inkling is open genoeg om te downloaden en aan te passen, maar groot genoeg dat alleen goed gefinancierde organisaties het volledige model realistisch kunnen hosten. De trainingsgegevens worden beschreven in brede categorieën in plaats van volledig gedocumenteerd, en aanpassing kan mogelijk de veiligheidscontroles die in de oorspronkelijke checkpoint zijn ingebouwd, verzwakken.
De release geeft Westerse ontwikkelaars echter een andere grote open-weights optie op een moment waarop veel van de meest concurrerende aanpasbare modellen uit Chinese laboratoria zoals DeepSeek, Alibaba, Moonshot AI en Zhipu AI komen. Reuters merkte op dat de Westerse open-weights ontwikkeling aan momentum heeft verloren, aangezien verschillende toonaangevende Amerikaanse bedrijven zijn overgestapt op meer propriëtaire strategieën.
Wat Inkling betekent voor AI
Inklings belangrijkheid kan afhangen van of ontwikkelaars het kunnen omzetten in gespecialiseerde systemen die general-purpose modellen binnen smallere domeinen overtreffen.
Bedrijven in financiën, gezondheidszorg, engineering, cybersecurity, wetenschappelijk onderzoek en software ontwikkeling bezitten vaak waardevolle interne kennis die slecht wordt weergegeven in openbare trainingsgegevens. Een capabel open-weights basis model, in combinatie met toegankelijke versterking leren en fijne afstelling infrastructuur, kan deze organisaties in staat stellen om meer van die expertise rechtstreeks in model gedrag te coderen.
Tegelijkertijd moet het model aantonen dat zijn efficiency claims zich vertalen in lagere totale implementatie kosten, vooral eenmaal infrastructuur, inferentie volume, fijne afstelling, monitoring en veiligheidstesten worden meegerekend. Onafhankelijke onderzoekers zullen ook de benchmark prestaties, meertalige mogelijkheden, politieke neutraliteit, hallucinatie tarieven en weerstand tegen veiligheidsdegradatie na aanpassing moeten onderzoeken.
Thinking Machines trad de markt binnen met een ongebruikelijk ervaren team, aanzienlijke investeerder ondersteuning en infrastructuur toezeggingen die normaal worden geassocieerd met veel oudere AI-laboratoria. Inkling is de eerste kans van het bedrijf om te demonstreren dat deze middelen meer kunnen produceren dan ambitieuze onderzoeksplannen en trainingsplatforms.
Het model verplaatst de leidende propriëtaire systemen niet en Thinking Machines Lab beweert dat het dat niet doet. In plaats daarvan biedt Inkling een ander voorstel: dat de toekomst van geavanceerde AI niet alleen kan worden gevormd door degene die het meest krachtige general-purpose model traint, maar ook door degene die ontwikkelaars de sterkste basis biedt voor het bouwen van modellen van hun eigen.












