A Anthropic voltou atrás em uma política que gerou forte reação entre desenvolvedores e pesquisadores. O Claude Fable 5 trazia, no seu system card, uma regra que identificava pedidos ligados a "desenvolvimento de LLMs de fronteira" e limitava a eficácia da resposta sem avisar o usuário. Na prática, alguém poderia ter resultados degradados sem saber por quê.
Depois da repercussão, a empresa anunciou que as salvaguardas passam a ser visíveis: pedidos sinalizados agora recaem de forma explícita para o Claude Opus 4.8 — igual ao que já acontecia em cibersegurança e biologia — e, na API, retornam o motivo da recusa. Em comunicado, a Anthropic admitiu: "Fizemos a escolha errada e pedimos desculpas por não termos acertado o equilíbrio."
O impacto no ecossistema
- Auditoria e confiança: salvaguardas invisíveis corrompem resultados sem deixar rastro. Quem usa IA para testar ou auditar sistemas precisa saber quando o modelo está se autolimitando.
- Transparência de fornecedores: o episódio reforça que grandes laboratórios podem mudar o comportamento da ferramenta sem aviso — e que pressão pública por transparência funciona.
Fontes: WIRED (Maxwell Zeff) · Simon Willison