opção
Lar
Notícias
Cofundador da OpenAI pede testes de segurança de IA em todo o setor

Cofundador da OpenAI pede testes de segurança de IA em todo o setor

24 de Dezembro de 2025
135

Cofundador da OpenAI pede testes de segurança de IA em todo o setor

Dois dos principais laboratórios de IA do mundo, o OpenAI e o Anthropic, concederam temporariamente acesso a seus modelos de IA bem guardados para testes de segurança colaborativos - um raro exemplo de cooperação entre empresas em meio à intensa concorrência do setor. A iniciativa foi projetada para revelar pontos cegos nas avaliações internas de cada empresa e ilustrar como as principais empresas de IA podem avançar conjuntamente nos esforços de segurança e alinhamento no futuro.

Em uma entrevista ao TechCrunch, o cofundador da OpenAI, Wojciech Zaremba, explicou que essa colaboração se torna cada vez mais vital à medida que a IA avança para uma fase mais "consequente", com milhões de usuários interagindo com modelos de IA todos os dias.

"Um desafio mais amplo enfrentado pelo setor é como estabelecer padrões de segurança e colaboração, mesmo enquanto bilhões de dólares são investidos e uma batalha feroz por talentos, usuários e produtos de destaque se desenrola", observou Zaremba.

O estudo de segurança conjunto, divulgado na quarta-feira por ambas as empresas, ocorre no momento em que líderes de IA, como a OpenAI e a Anthropic, se envolvem em uma corrida armamentista tecnológica. Com investimentos multibilionários em centros de dados e pacotes de remuneração de mais de US$ 100 milhões para os principais pesquisadores se tornando a norma, alguns analistas advertem que a pressão para fornecer produtos de ponta pode levar a comprometimentos nos protocolos de segurança.

Para possibilitar essa pesquisa, a OpenAI e a Anthropic trocaram acesso especial à API para versões menos restritas de seus modelos (a OpenAI esclareceu que o GPT-5 não foi testado, pois ainda não havia sido lançado). No entanto, logo após a conclusão da pesquisa, a Anthropic revogou o acesso à API de outra equipe da OpenAI. A Anthropic afirmou que a OpenAI havia violado seus termos de serviço, que proíbem o uso do Claude para aprimorar produtos rivais.

Zaremba afirma que os dois eventos não estão relacionados e espera que a concorrência continue forte, mesmo que as equipes de segurança de IA busquem a cooperação. Nicholas Carlini, pesquisador de segurança da Anthropic, disse ao TechCrunch que espera continuar concedendo à equipe de segurança da OpenAI acesso aos modelos do Claude no futuro.

"Nosso objetivo é expandir a colaboração sempre que possível nas fronteiras da segurança, tornando essas parcerias mais rotineiras", declarou Carlini.

Pesos pesados da tecnologia e do capital de risco participam da agenda do Disrupt 2025

Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - esses são apenas alguns dos nomes proeminentes que participam da agenda do Disrupt 2025. Eles estão aqui para compartilhar percepções que impulsionam o crescimento de startups e aumentam sua vantagem competitiva. Não perca o 20º aniversário do TechCrunch Disrupt, uma oportunidade de aprender com as principais vozes da tecnologia - garanta seu ingresso agora e economize mais de US$ 600 antes que os preços aumentem.

Pesos pesados da tecnologia e do capital de risco participam da agenda do Disrupt 2025

Netflix, ElevenLabs, Wayve, Sequoia Capital - apenas alguns dos líderes influentes que aparecerão na agenda do Disrupt 2025. Eles apresentarão perspectivas valiosas que ajudarão as startups a crescer e a refinar suas estratégias. Junte-se a nós no 20º aniversário do TechCrunch Disrupt - reserve seu ingresso hoje e economize até US$ 675 antes que as tarifas subam.

São Francisco | 27 a 29 de outubro de 2025 INSCREVA-SE AGORA

Uma das descobertas mais notáveis do estudo foi o teste de alucinação. Os modelos Claude Opus 4 e Sonnet 4 da Anthropic se recusaram a responder até 70% das perguntas quando não tinham certeza, optando por respostas como "Não tenho informações confiáveis". Por outro lado, os modelos o3 e o4-mini da OpenAI recusaram muito menos perguntas, mas apresentaram taxas de alucinação muito mais altas, tentando responder mesmo com informações insuficientes.

Zaremba acredita que a abordagem ideal está em algum ponto intermediário: Os modelos da OpenAI deveriam recusar consultas mais incertas, enquanto os sistemas da Anthropic poderiam tentar responder com mais frequência.

A bajulação - a tendência dos modelos de IA de reforçar o comportamento prejudicial do usuário para obter aprovação - surgiu como um problema crítico de segurança.

Em seu relatório de pesquisa, a Anthropic citou casos de bajulação "extrema" no GPT-4.1 e no Claude Opus 4, em que os modelos inicialmente resistiram à conduta psicótica ou maníaca, mas depois apoiaram decisões problemáticas. Em outros modelos da OpenAI e da Anthropic, os pesquisadores registraram níveis mais baixos de bajulação.

Na terça-feira, os pais de Adam Raine, de 16 anos, entraram com uma ação contra a OpenAI, alegando que uma versão do ChatGPT com tecnologia GPT-4o incentivou o suicídio de seu filho em vez de desafiar seus pensamentos prejudiciais. A ação judicial levanta a possibilidade de que esse seja outro caso trágico de bajulação da IA.

"É de partir o coração imaginar o que a família está sofrendo", disse Zaremba quando perguntado sobre o incidente. "Seria profundamente preocupante se criássemos uma IA capaz de resolver problemas de nível de doutorado e de fazer avançar a ciência, mas que também contribuísse para crises de saúde mental. Esse é um resultado distópico do qual não quero participar."

Em uma postagem no blog, a OpenAI informou que fez grandes melhorias para reduzir a bajulação com o GPT-5 em comparação com o GPT-4o, afirmando que o modelo mais recente responde de forma mais apropriada em crises de saúde mental.

Olhando para o futuro, Zaremba e Carlini expressaram seu desejo de que a Anthropic e a OpenAI aprofundem a colaboração em testes de segurança - explorando mais tópicos e avaliando modelos futuros - e esperam que outros laboratórios de IA adotem uma abordagem cooperativa semelhante.

Atualizado às 14h (horário de Brasília): Este artigo foi revisado para incluir pesquisas adicionais da Anthropic que não estavam disponíveis para o TechCrunch antes da publicação inicial.


Tem uma dica sensível ou documentos confidenciais? Estamos investigando o funcionamento interno do setor de IA, desde as organizações que moldam sua evolução até os indivíduos afetados por suas escolhas. Entre em contato com Rebecca Bellan pelo e-mail [email protected] e Maxwell Zeff pelo e-mail [email protected]. Para uma comunicação segura, entre em contato conosco via Signal em @rebeccabellan.491 e @mzeff.88.

Artigo relacionado
A Anthropic lança o Opus 4.8, que traz uma nova ferramenta dinâmica de fluxo de trabalho A Anthropic lança o Opus 4.8, que traz uma nova ferramenta dinâmica de fluxo de trabalho A Anthropic lançou o Opus 4.8 nesta quinta-feira, marcando a mais recente versão de seu principal modelo público. Com preço idêntico ao de seu antecessor, esta atualização já está disponível em todas
A OpenAI lança uma versão mais segura do ChatGPT para adolescentes, anos depois de eles terem começado a usá-lo A OpenAI lança uma versão mais segura do ChatGPT para adolescentes, anos depois de eles terem começado a usá-lo Após uma série de processos judiciais relacionados à ausência de protocolos de segurança em chatbots de IA — o que contribuiu para suicídios entre adolescentes e outras crises de saúde mental —, a Ope
A Frontier AI Labs se recusa a divulgar estratégias de contenção para modelos rebeldes A Frontier AI Labs se recusa a divulgar estratégias de contenção para modelos rebeldes Pesquisas recentes indicam que muito poucos laboratórios líderes em IA publicaram ou demonstraram planos de resposta para contenção. Um plano de contenção define os procedimentos a serem seguidos quan
Recomendações de tópicos especiais relacionados
Composição musical Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê
Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê

As melhores e mais bem avaliadas ferramentas de separação de faixas com IA de 2026, selecionadas especialmente para produção de remixes, preparação de samples e masters de karaokê. Essas ferramentas poderosas e revolucionárias passaram por testes práticos para oferecer isolamento de áudio preciso, aumentando significativamente a produtividade. A XIX.AI oferece um guia comparativo entre versões gratuitas e pagas, atualizado semanalmente, para ajudá-lo a encontrar a solução imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Análise de dados Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos
Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos

2026: Os melhores copilotos AI para SQL, atualizados e classificados entre os melhores! A XIX.AI reúne uma coleção poderosa e revolucionária, com testes em ambiente real atualizados semanalmente. Essas ferramentas indispensáveis ajudam a gerar painéis de controle de receita precisos, analisar funis de vendas e rastrear métricas de produtos de forma rápida, aumentando significativamente a produtividade. Explore agora e encontre a ferramenta perfeita para tomada de decisões baseadas em dados! 238 caracteres

9 ferramentas
xix.ai
Composição musical Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas
Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas

2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!

8 ferramentas
xix.ai
chatbot Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas
Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas

As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!

12 ferramentas
xix.ai
Design e Arte As melhores ferramentas de transferência de estilo com IA para experimentos criativos
As melhores ferramentas de transferência de estilo com IA para experimentos criativos

As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!

9 ferramentas
xix.ai
Criação de quadrinhos As melhores ferramentas de balões de diálogo com IA para a narrativa visual
As melhores ferramentas de balões de diálogo com IA para a narrativa visual

As melhores e mais bem avaliadas ferramentas de balões de diálogo com IA para narrativa visual de 2026 já estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e revolucionárias que ajudam os criadores a aumentar a produtividade e superar gargalos criativos. Veja uma comparação entre versões gratuitas e pagas, confira testes reais e verifique os rankings mais recentes para encontrar as soluções imperdíveis, perfeitas para criar narrativas visuais envolventes. Explore agora e descubra sua ferramenta ideal!

10 ferramentas
xix.ai
Comentários (3)
0/500
WillWalker
WillWalker 21 de Julho de 2026 à18 17:00:18 WEST

Interesting to see competitors collaborate on safety. But is it just a PR stunt? 🤔

IsabellaLevis
IsabellaLevis 4 de Março de 2026 à50 02:00:50 WET

AIの安全性テストを業界全体で実施する必要があるって主張、すごく共感します。競争が激しい中でOpenAIとAnthropicが協力したのは意外だけど、こういう連携がもっと増えると良いですね。ただ、本当に効果的なテストができるのか少し不安… 🤔

GeorgeWilliams
GeorgeWilliams 20 de Fevereiro de 2026 à46 00:01:46 WET

So OpenAI and Anthropic are actually sharing their secret sauce for safety checks? That's pretty refreshing to see amidst all the cutthroat AI race. Hope this kind of collaboration becomes the norm, not just a rare exception. The real question is, will this testing be transparent enough for the public to trust the results? 🤔

OR