AI-modellen en platforms

Anthropic past bij Fable 5’s biologische beveiligingsmaatregelen, vermindert geblokkeerde queries met 85%

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Anthropic heeft op 7 augustus 2026 een update uitgebracht voor de biologische beveiligingsmaatregelen op Claude Fable 5, die het bedrijf zegt dat de biologie-gerelateerde “fallbacks” met ongeveer 85% heeft vermindert in tests op alle productoppervlakken – de automatische doorverwijzingen die een gebruikersaanvraag doorverwijzen naar een minder capabele model wanneer het systeem oordeelt dat een aanvraag het beveiligde biologiegebied raakt.

In de aankondiging zei Anthropic dat gebruikers nu veel minder fallbacks moeten zien voor alledaagse gezondheids- en educatieve vragen, zoals het interpreteren van laboratoriumresultaten, het begrijpen van symptomen en het leren van biologie in een educatieve context, en dat zorgprofessionals meer ondersteuning moeten krijgen bij klinische taken. De vermindering van biologie-fallbacks wordt verwacht om het totale fallback-volume te verlagen met ongeveer 67% op Claude.ai, 55% op Cowork, 17% op Claude Code en 7% op het Claude-platform, volgens een voetnoot in de post.

Het bedrijf is expliciet dat de update het model niet opent voor professioneel biologisch onderzoek. Fable 5 valt nog steeds terug naar Claude Opus 5 voor aanvragen die Anthropic als dual-use beschouwt, waaronder virologie, toxicologie en moleculaire ontwerp, wat het bedrijf zegt dat het model “nog niet bruikbaar maakt voor professioneel biologisch onderzoek en geneesmiddelenontwikkeling”. Anthropic zegt dat het van plan is om deze kloof te dichten via vertrouwde toegangspaden in plaats van via de openbare classifier.

Waar het fallback-systeem voor was gebouwd

De fallback-architectuur dateert van de lancering van Fable 5 op 9 juni 2026. Anthropic bracht het model uit met classificatoren – kleinere geautomatiseerde AI-systemen die aanvragen screenen – die cybersecurity, biologie en chemie en distillatiepogingen dekken. Wanneer een classifier afgaat, wordt de aanvraag opnieuw geserveerd door het meest capabele Opus-model. Bij de lancering zei Anthropic dat het de beveiligingsmaatregelen conservatief had afgesteld en verwachtte dat ze in minder dan 5% van de sessies zouden afgaan.

De biologie-dekking was de breedste van de drie. Anthropics redenering, zoals uiteengezet in de lanceringpost en de systeemkaart van het model, is dat Mythos-class-modellen experts kunnen overtreffen op sommige complexe biologische taken en operationele ondersteuning kunnen bieden bij anderen – een capaciteit die het bedrijf beoordeelt als potentieel significant voor een kwaadwillige actor. De systeemkaart behandelt het model als having “CB-1”-capaciteiten, wat betekent dat het significant kan helpen bij mensen met een basis technische achtergrond op bekende wapen-relevante processen, terwijl het oordeelt dat het de “CB-2”-drempel van het vervangen van de schaarse wereldklasse-expertise achter novelle biologische wapenontwikkeling niet overschrijdt – een oordeel dat de kaart zelf beschrijft als “veel minder duidelijk” dan voor voorgaande modellen.

Vandaag citeert de update de 2026 Annual Threat Assessment van de US Intelligence Community, die waarschuwt dat vooruitgang in biotechnologie, waaronder synthetische biologie en genoombewerking, “kan leiden tot nieuwe biologische bedreigingen” en opmerkt dat verschillende staat-actoren waarschijnlijk actieve offensieve biologische en chemische wapenprogramma’s onderhouden.

Wat veranderde in de classificatoren

Gedurende de afgelopen weken heeft Anthropic de biologie-classificator herschreven – de verzameling regels die het screeningsmodel gebruikt om beveiligde van toegestane inhoud te onderscheiden – door onschuldige toepassingen in meer detail uit te snijden, feedback te vragen van interne en externe experts, de classifier opnieuw te trainen met bijgewerkte gegevens en te verifiëren dat het nog steeds afgaat bij schadelijke en dual-use onderzoeksinhoud. De lanceringconfiguratie heeft expres breed geërd: het bedrijf erkende dat het een hoge volume van false positives zou blokkeren in ruil voor het sneller beschikbaar stellen van Fable 5 voor algemene gebruikers.

Het diagram van het bedrijf van de verandering toont de classificator-grens die zich verplaatst om aanvragen toe te laten die eerder werden gevangen in een zelfbeschreven veiligheidsmarge – inhoud die Anthropic als zeer waarschijnlijk onschuldig beoordeelde, maar blokkeerde uit voorzorg. Anthropics eerdere schrijven over dezelfde classificator-benadering in het cybersecurity-domein beschrijft een soortgelijke spanning tussen brede dekking en jailbreak-robustheid – de inzet waarvan Unite.AI heeft behandeld toen Claude-modellen zonder die beveiligingsmaatregelen een cyber-benchmark omzetten in drie echte inbraken.

De afweging die Anthropic nu in het openbaar beheert

De aankondiging is een governance-document evenzeer als een productnota. Anthropic lanceerde Fable 5 met bijna alle biologie-aanvragen geblokkeerd, absorbeerde weken van false positives als de kosten van een snelle algemene release en publiceert nu het gemeten resultaat van het verkleinen van die blokkade – inclusief de per-opppervlak fallback-reducties, die buitenstaanders een concreet basis geven voor de volgende revisie. De resterende beperking zit waar het bedrijf zegt dat het werkelijke risico zit: dual-use professioneel onderzoek blijft achter Opus 5-fallbacks totdat vertrouwde toegangspaden, die Anthropic sinds de lancering in juni heeft ontwikkeld voor geverifieerde biologie-onderzoekers, die verkeer afhandelen.

Het bedrijf erkent dat resterende false positives binnen de veiligheidsmarge zullen blijven en zegt dat de beveiligingsmaatregelen nog steeds worden verfijnd. Wat het heeft opgeschreven, met de update van 7 augustus, is een meetbare definitie van vooruitgang: fallback-rates waartegen het nu zal worden beoordeeld.

Mira Kellan is een AI-gegenereerde columnist die zich specialiseert in AI-ethiek, governance en regulering. Haar werk onderzoekt hoe kunstmatige intelligentie samenkomt met publieke beleid, maatschappelijke waarden en langetermijnverantwoordelijkheid, met een focus op verantwoorde innovatie.
Ze benadert complexe kwesties met een rationele en filosofische lens, Mira analyseert opkomende AI-reguleringen, ethische kaders en governance-modellen die de toekomst van intelligente systemen vormgeven. Ze streeft ernaar om de kloof te overbruggen tussen snelle technologische vooruitgang en de waarborgen die nodig zijn om ervoor te zorgen dat AI-systemen transparant, eerlijk en afgestemd zijn op menselijke belangen.
Artikelen geschreven door Mira Kellan zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om accuratesse, evenwicht en naleving van redactionele normen te waarborgen.