Modelos e plataformas de IA
A Anthropic Ajusta os Salvaguardas de Biologia do Fable 5, Reduzindo as Consultas Bloqueadas em 85%

A Anthropic lançou em 7 de agosto de 2026 uma atualização dos salvaguardas de biologia no Claude Fable 5, que a empresa afirma ter reduzido as “falhas” relacionadas à biologia em cerca de 85% nos testes realizados em todas as superfícies do produto — os redirecionamentos automáticos que encaminham a consulta do usuário para um modelo menos capaz quando o sistema julga que a solicitação toca em território de biologia protegida.
Em seu anúncio, a Anthropic disse que os usuários devem agora ver muito menos falhas em perguntas comuns de saúde e educação, como interpretar resultados de laboratório, entender sintomas e aprender biologia em um contexto educacional, e que os profissionais de saúde devem obter mais apoio em tarefas clínicas. A redução nas falhas de biologia deve reduzir o volume total de falhas em cerca de 67% no Claude.ai, 55% no Cowork, 17% no Claude Code e 7% na Plataforma Claude, de acordo com uma nota de rodapé no post.
A empresa é explícita em dizer que a atualização não abre o modelo para pesquisas de biologia profissional. O Fable 5 ainda recorre ao Claude Opus 5 para solicitações que a Anthropic considera de uso duplo, incluindo virologia, toxicologia e design molecular, o que a empresa afirma deixar o modelo “ainda não utilizável para pesquisas de biologia profissional e desenvolvimento de medicamentos”. A Anthropic afirma que pretende fechar essa lacuna por meio de caminhos de acesso confiáveis, em vez de através do classificador público.
O que o sistema de fallback foi projetado para segurar
A arquitetura de fallback remonta ao lançamento do Fable 5 em 9 de junho de 2026. A Anthropic lançou o modelo com classificadores — sistemas de IA automatizados menores que verificam solicitações — cobrindo segurança cibernética, biologia e química, e tentativas de destilação. Quando um classificador dispara, a solicitação é reencaminhada pelo modelo Opus mais capaz. No lançamento, a Anthropic disse que havia ajustado os salvaguardas de forma conservadora e esperava que eles disparem em menos de 5% das sessões.
A cobertura de biologia foi a mais ampla das três. O raciocínio da Anthropic, exposto no post de lançamento e no cartão do sistema, é que os modelos da classe Mythos podem superar os especialistas em algumas tarefas biológicas complexas e fornecer suporte operacional em outras — capacidade que a empresa avalia que poderia fornecer um aumento significativo a um ator mal-intencionado. O cartão do sistema trata o modelo como tendo capacidades “CB-1”, significando que ele poderia ajudar significativamente as pessoas com conhecimentos técnicos básicos em processos relevantes para armas conhecidas, enquanto julga que não cruza o limiar “CB-2” de substituir a expertise de classe mundial escassa por trás do desenvolvimento de armas biológicas novas — uma avaliação que o próprio cartão descreve como “muito menos clara” do que para os modelos anteriores.
Hoje, a atualização cita a Avaliação Anual de Ameaças de 2026 da Comunidade de Inteligência dos EUA, que adverte que os avanços em biotecnologia, incluindo biologia sintética e edição genômica, “podem levar a ameaças biológicas novas” e observa que vários atores estatais provavelmente mantêm programas de armas biológicas e químicas ofensivas ativos.
O que mudou nos classificadores
Nas últimas semanas, a Anthropic reescreveu a constituição do classificador de biologia — a coleção de regras que o modelo de verificação usa para distinguir conteúdo protegido de conteúdo permitido —, esculpindo usos benignos em mais detalhes, solicitando feedback de especialistas internos e externos, retreinando o classificador com dados atualizados e verificando se ele ainda dispara em conteúdo de pesquisa prejudicial e de uso duplo. A configuração de lançamento errou deliberadamente para o lado da segurança: a empresa reconheceu que bloquearia um grande volume de falsos positivos em troca de levar o Fable 5 aos usuários gerais semanas ou meses antes do que um salvaguarda mais estreito teria permitido.
O próprio diagrama da empresa sobre a mudança mostra a fronteira do classificador se movendo para admitir solicitações que foram anteriormente capturadas em uma margem de segurança autodescrita — conteúdo que a Anthropic avaliou como muito provavelmente benigno, mas bloqueou por cautela. A escrita anterior da empresa sobre a mesma abordagem de classificador no domínio da segurança cibernética descreve uma tensão semelhante entre cobertura ampla e robustez de jailbreak — os riscos dos quais a Unite.AI cobriu quando os modelos Claude sem esses salvaguardas transformaram um benchmark de cibersegurança em três intrusões reais.
A compensação que a Anthropic está agora gerenciando publicamente
O anúncio é um documento de governança tanto quanto uma nota de produto. A Anthropic lançou o Fable 5 com quase todas as consultas de biologia bloqueadas, absorveu semanas de falsos positivos como o custo de um lançamento geral rápido e agora está publicando o resultado medido de estreitar esse bloqueio — incluindo as reduções de fallback por superfície, que dão aos observadores externos uma linha de base concreta para a próxima revisão. A restrição remanescente permanece onde a empresa diz que o risco real está: a pesquisa profissional de uso duplo permanece atrás dos fallbacks do Opus 5 até que os caminhos de acesso confiáveis, que a Anthropic vem desenvolvendo desde o lançamento de junho para pesquisadores de biologia verificados, levem esse tráfego.
A empresa reconhece que falsos positivos residuais permanecerão dentro da margem de segurança e afirma que o aprimoramento dos salvaguardas está em andamento. O que ela colocou por escrito, com a atualização de 7 de agosto, é uma definição mensurável de progresso: taxas de fallback que agora serão julgadas.












