Especialistas em segurança cibernética criticam as salvaguardas do Fable da Anthropic

A Anthropic lançou seu mais recente modelo, Fable, na terça-feira, posicionando-o como uma versão pública e restrita de seu altamente aguardado modelo focado em cibersegurança, Mythos.
No entanto, as limitações provocaram insatisfação entre vários pesquisadores e profissionais de cibersegurança, que expressaram suas preocupações online.
“[Fable] bloqueia qualquer solicitação que possa estar remotamente relacionada à cibersegurança, incluindo tarefas inofensivas, como ler uma postagem de blog”, afirmou Valentina “Chompie” Palmiotti, uma proeminente pesquisadora de segurança da IBM X-Force.
Quando um prompt do usuário ativa esses filtros de segurança, o Fable interrompe a conversa, exibindo uma mensagem de que seus “protocolos de segurança sinalizaram esta entrada para tópicos de cibersegurança ou biológicos”.
Essas restrições visam mitigar o risco de o Fable ser utilizado para criar malware ou explorar software — uma preocupação persistente para a Anthropic. As restrições biológicas decorrem de preocupações semelhantes em relação ao desenvolvimento de armas biológicas.
Ao lançar o Mythos em abril, a Anthropic limitou o acesso a um grupo seleto de empresas e organizações sob o Projeto Glasswing, uma iniciativa projetada para implantar o modelo na proteção de software e infraestrutura críticos. Na semana passada, a Anthropic ampliou o acesso ao Mythos para centenas de organizações em 15 países.
Apesar dessas boas intenções, muitos especialistas em cibersegurança continuam frustrados com a natureza aparentemente arbitrária das restrições. Matt Suiche, um experiente profissional de cibersegurança, disse à TechCrunch que “se você pedir para ele escrever código seguro, ele interpreta isso como trabalho relacionado à cibersegurança, em vez de melhores práticas de engenharia de software, resultando em uma redução”. O Fable está configurado para reverter para o Claude Opus 4.8 quando as barreiras de segurança são acionadas. “Parece depender de palavras-chave, então qualquer termo dentro do léxico de ‘cibersegurança’ ativa os filtros”, observou ele.
Entre em Contato Conosco
Você tem informações adicionais sobre como os hackers estão aproveitando a IA ou como as empresas de cibersegurança estão integrando a IA? Agradecemos sua contribuição. A partir de um dispositivo e rede pessoais, você pode entrar em contato de forma segura com Lorenzo Franceschi-Bicchierai no Signal pelo número +1 917 257 1382, via Telegram e Keybase @lorenzofb, ou por e-mail.
“No entanto, é compreensível, dado que ainda estamos em estágios iniciais e estão refinando suas barreiras de segurança. Tenho confiança de que elas evoluirão à medida que a Anthropic e outros desenvolvedores de modelos de fronteira colaborarem mais estreitamente com a nova geração de empresas de cibersegurança”, disse Suiche, membro da equipe técnica da Tolmo, uma startup de cibersegurança com IA. “É preferível restringir excessivamente inicialmente e relaxar as barreiras de segurança ao longo do tempo.”
Outro pesquisador reclamou no X que “até solicitar uma revisão de código” ativa os filtros de segurança do Fable.
A Anthropic não respondeu imediatamente a um pedido de comentário.
Além das barreiras de segurança em nível de modelo, a Anthropic exige que os profissionais de cibersegurança se inscrevam em seu Programa de Verificação de Cibersegurança. Os candidatos aprovados enfrentam menos restrições ao usar o Claude para tarefas de cibersegurança. A OpenAI oferece um programa comparável conhecido como Acesso Confiável para Ciber.
Artigo relacionado
Casa Branca Abandona Rótulo de IA para “Super Inteligência”
Carregando o player…Esta semana, a Casa Branca reuniu quase todos os principais CEOs de tecnologia em uma única sala — incluindo Zuckerberg, Bezos, Musk e Dario Amodei, da Anthropic — para assinar um compromisso de segurança em IA, que o presidente
A Anthropic apresenta o Sonnet 5.5 como um parceiro de trabalho mais rápido e econômico
Am meio à concorrência contínua entre modelos de IA, a Anthropic lançou a mais recente iteração do Sonnet, sua oferta de gama média, prometendo velocidade substancialmente melhorada e custos reduzidos em comparação com a versão anterior.A Anthropic
O mais recente conflito da Anthropic com a administração Trump pode, na verdade, ajudá-la, sugerem os dados de vendas
A Anthropic está passando por um mês notável.De acordo com a Ramp, a empresa de inteligência artificial superou a OpenAI na participação de mercado de gastos corporativos pela primeira vez, encerrando maio com uma captação de US$ 65 bilhões e uma av
Recomendações de tópicos especiais relacionados
Comentários (0)

A Anthropic lançou seu mais recente modelo, Fable, na terça-feira, posicionando-o como uma versão pública e restrita de seu altamente aguardado modelo focado em cibersegurança, Mythos.
No entanto, as limitações provocaram insatisfação entre vários pesquisadores e profissionais de cibersegurança, que expressaram suas preocupações online.
“[Fable] bloqueia qualquer solicitação que possa estar remotamente relacionada à cibersegurança, incluindo tarefas inofensivas, como ler uma postagem de blog”, afirmou Valentina “Chompie” Palmiotti, uma proeminente pesquisadora de segurança da IBM X-Force.
Quando um prompt do usuário ativa esses filtros de segurança, o Fable interrompe a conversa, exibindo uma mensagem de que seus “protocolos de segurança sinalizaram esta entrada para tópicos de cibersegurança ou biológicos”.
Essas restrições visam mitigar o risco de o Fable ser utilizado para criar malware ou explorar software — uma preocupação persistente para a Anthropic. As restrições biológicas decorrem de preocupações semelhantes em relação ao desenvolvimento de armas biológicas.
Ao lançar o Mythos em abril, a Anthropic limitou o acesso a um grupo seleto de empresas e organizações sob o Projeto Glasswing, uma iniciativa projetada para implantar o modelo na proteção de software e infraestrutura críticos. Na semana passada, a Anthropic ampliou o acesso ao Mythos para centenas de organizações em 15 países.
Apesar dessas boas intenções, muitos especialistas em cibersegurança continuam frustrados com a natureza aparentemente arbitrária das restrições. Matt Suiche, um experiente profissional de cibersegurança, disse à TechCrunch que “se você pedir para ele escrever código seguro, ele interpreta isso como trabalho relacionado à cibersegurança, em vez de melhores práticas de engenharia de software, resultando em uma redução”. O Fable está configurado para reverter para o Claude Opus 4.8 quando as barreiras de segurança são acionadas. “Parece depender de palavras-chave, então qualquer termo dentro do léxico de ‘cibersegurança’ ativa os filtros”, observou ele.
Entre em Contato Conosco
Você tem informações adicionais sobre como os hackers estão aproveitando a IA ou como as empresas de cibersegurança estão integrando a IA? Agradecemos sua contribuição. A partir de um dispositivo e rede pessoais, você pode entrar em contato de forma segura com Lorenzo Franceschi-Bicchierai no Signal pelo número +1 917 257 1382, via Telegram e Keybase @lorenzofb, ou por e-mail.
“No entanto, é compreensível, dado que ainda estamos em estágios iniciais e estão refinando suas barreiras de segurança. Tenho confiança de que elas evoluirão à medida que a Anthropic e outros desenvolvedores de modelos de fronteira colaborarem mais estreitamente com a nova geração de empresas de cibersegurança”, disse Suiche, membro da equipe técnica da Tolmo, uma startup de cibersegurança com IA. “É preferível restringir excessivamente inicialmente e relaxar as barreiras de segurança ao longo do tempo.”
Outro pesquisador reclamou no X que “até solicitar uma revisão de código” ativa os filtros de segurança do Fable.
A Anthropic não respondeu imediatamente a um pedido de comentário.
Além das barreiras de segurança em nível de modelo, a Anthropic exige que os profissionais de cibersegurança se inscrevam em seu Programa de Verificação de Cibersegurança. Os candidatos aprovados enfrentam menos restrições ao usar o Claude para tarefas de cibersegurança. A OpenAI oferece um programa comparável conhecido como Acesso Confiável para Ciber.
Casa Branca Abandona Rótulo de IA para “Super Inteligência”
Carregando o player…Esta semana, a Casa Branca reuniu quase todos os principais CEOs de tecnologia em uma única sala — incluindo Zuckerberg, Bezos, Musk e Dario Amodei, da Anthropic — para assinar um compromisso de segurança em IA, que o presidente
A Anthropic apresenta o Sonnet 5.5 como um parceiro de trabalho mais rápido e econômico
Am meio à concorrência contínua entre modelos de IA, a Anthropic lançou a mais recente iteração do Sonnet, sua oferta de gama média, prometendo velocidade substancialmente melhorada e custos reduzidos em comparação com a versão anterior.A Anthropic
O mais recente conflito da Anthropic com a administração Trump pode, na verdade, ajudá-la, sugerem os dados de vendas
A Anthropic está passando por um mês notável.De acordo com a Ramp, a empresa de inteligência artificial superou a OpenAI na participação de mercado de gastos corporativos pela primeira vez, encerrando maio com uma captação de US$ 65 bilhões e uma av





Lar






