Anthropic disse na sexta-feira que "desativará abruptamente" seus modelos mais avançados de inteligência artificial (IA), Claude Fable 5 e Mythos 5, para todos os usuários depois que o governo dos EUA ordenou que suspendesse o acesso aos modelos para cidadãos estrangeiros, dentro ou fora dos EUA, citando preocupações de segurança nacional.
A empresa de IA disse que recebeu um pedido às 17h21. ET, instruindo-o a suspender todo o acesso aos modelos por parte de estrangeiros. Disse acreditar que houve um “mal-entendido” e que está trabalhando para restaurar o acesso aos modelos o mais rápido possível. O acesso a outros modelos não será afetado pela diretiva de controle de exportação.
"Nosso entendimento é que o governo acredita ter tomado conhecimento de um método para contornar ou 'desbloquear' o Fable 5", disse a empresa.
"Revisamos uma demonstração desta técnica específica sendo usada para identificar um pequeno número de vulnerabilidades menores previamente conhecidas. Todas essas vulnerabilidades parecem relativamente simples, e descobrimos que outros modelos disponíveis publicamente também são capazes de descobri-las sem a necessidade de um bypass."
A mudança inesperada ocorre dias após o lançamento de Claude Fable 5 e seu equivalente Mythos 5, que usa o mesmo modelo subjacente, mas com as salvaguardas levantadas em algumas áreas, como a segurança cibernética. Este último, descrito como tendo as “capacidades de segurança cibernética mais fortes de qualquer modelo do mundo”, permanece acessível a um grupo avaliado de defensores cibernéticos e operadores de infraestrutura crítica.
A Anthropic enfatizou que implementou barreiras de proteção "fortes" para evitar o uso indevido de seus modelos para tarefas relacionadas à segurança cibernética. Especificamente, isso é sustentado por um conjunto de classificadores de segurança que são usados para detectar possíveis usos indevidos, incluindo tentativas de jailbreak, e proibir a resposta do modelo principal.
O classificador de segurança cibernética foi projetado para bloquear solicitações prejudiciais de turno único relacionadas ao planejamento de um ataque cibernético, desenvolvimento de exploração ou evasão de defesa. A empresa observou que os modelos da classe Mythos são hábeis em encontrar e explorar vulnerabilidades de software, proporcionando assim aos invasores uma vantagem estratégica.
Na semana passada, a Anthropic revelou que seu modelo da classe Mythos pode transformar vulnerabilidades de software recém-divulgadas em explorações funcionais em horas, ou mesmo minutos em alguns casos, em vez de semanas, convertendo N dias em N horas. As descobertas sugerem que os modelos de fronteira podem ser igualmente bons em transformar rapidamente em armas falhas que foram divulgadas publicamente.
"Um operador solitário agora pode transformar patches de um mês em explorações funcionais em uma única tarde - por alguns milhares de dólares e sem conhecimento especializado", disse o Red Team da Anthropic disse. "Isso significa que o típico manual de patches que os desenvolvedores de software usam hoje - com cadências de lançamento mensais, lançamentos escalonados de várias semanas e um atraso entre o pré-lançamento e os canais estáveis - não se aplica mais."
As proteções do Fable 5 significam que consultas sobre tópicos de segurança cibernética receberão uma resposta do Claude Opus 4.8, o próximo modelo capaz da empresa.
Em sua última declaração, a empresa argumentou que nenhum método universal de jailbreak foi desenvolvido contra os modelos mais recentes até o momento, acrescentando que exercícios internos e de terceiros descobriram que suas salvaguardas são "substancialmente mais eficazes do que aquelas de qualquer modelo implantado anteriormente".
Além disso, a Anthropic afirmou que "a resistência perfeita ao jailbreak" não é possível para nenhum fornecedor modelo, já que todas as salvaguardas usadas pela indústria são suscetíveis a jailbreaks não universais que são "eficazes em contextos muito limitados ou exigem esforço adicional para serem adaptados a cada nova situação".
"Até o momento, o governo nos deu apenas evidências verbais de um potencial jailbreak restrito e não universal, que consiste essencialmente em pedir ao modelo para ler uma base de código específica e corrigir quaisquer falhas de software", afirmou.
"Nosso entendimento é que um possível jailbreak foi compartilhado com o governo. Analisamos um relatório que acreditamos ser a base da diretiva do governo e validamos que o nível de capacidade exibido ali está amplamente disponível em outros modelos (incluindo o GPT-5.5 da OpenAI) e é usado todos os dias por defensores e pesquisadores de segurança.