Lar
GPT-5.5 lidera em eficiência, DeepSeek V4 Pro conquista o título de melhor custo-benefício; é divulgado relatório sobre segurança de LLMs em condições reais
Até onde realmente se estende a inteligência dos grandes modelos de linguagem (LLMs)? A segurança cibernética se transformou em uma arena de gladiadores, onde seu verdadeiro raciocínio e sua lógica complexa são postos à prova. O pesquisador de segurança Kasra Rahjerdi publicou recentemente um relatório de teste que chamou a atenção de todo o setor. Ele simulou um desafio de ataque de hacker do mundo real contra os principais LLMs, criando um APK de resenha de e-books com vulnerabilidades críticas inseridas deliberadamente, expondo as capacidades reais de cada modelo no raciocínio de segurança e na exploração de vulnerabilidades.
Durante esse teste de guerra cibernética de duas horas, com orçamento de US$ 10, o pesquisador deixou deliberadamente as credenciais do Firebase — serviço de back-end móvel do Google — expostas dentro do pacote do aplicativo (APK). Cada modelo teve que se comportar como um hacker de chapéu branco profissional: primeiro descompactar o aplicativo, identificar rapidamente as credenciais e, em seguida, contornar a API já fortificada para obter acesso não autorizado ao banco de dados subjacente. O teste completo custou US$ 1.500, e os resultados de vários modelos de ponta mostraram uma polarização extrema.

No que diz respeito à taxa de sucesso, o GPT-5.5, ainda não lançado, demonstrou uma capacidade dominante de raciocínio em segurança. Em dez testes independentes, ele obteve sucesso em sete explorações, alcançando uma taxa de sucesso de 70% e liderando o ranking. De acordo com a avaliação, após descompactar o APK, o GPT-5.5 reconheceu imediatamente o Firebase como o ponto crítico de invasão, sem se deixar desviar pela interface de usuário complexa ou pelas APIs padrão. No entanto, esse desempenho excepcional teve um custo elevado: uma média de US$ 9,46 por exploração bem-sucedida, quase atingindo o limite do orçamento.
Por outro lado, o DeepSeek V4Pro, desenvolvido internamente, surpreendeu a comunidade de código aberto com sua incrível eficiência de custo. Embora tenha obtido sucesso em apenas três dos dez testes, seu custo médio por token por tentativa bem-sucedida foi de apenas US$ 0,62 — um décimo quinto do custo do GPT-5.5. Nas rodadas malsucedidas, o DeepSeek V4Pro ainda conseguiu acessar o núcleo do Firebase cinco vezes, mas ocasionalmente cometeu erros ao usar as credenciais para a configuração da interface de back-end. O pesquisador destacou que, para equipes de engenharia que realizam operações em lote em grande escala e de alta frequência em auditorias de automação de segurança cibernética, a surpreendente vantagem de custo do DeepSeek tem um valor prático significativo.
Enquanto alguns modelos impressionaram, outros ficaram aquém das expectativas por serem conservadores demais. Na categoria intermediária, o Claude Sonnet4.6 e o Claude Opus4.8 obtiveram, cada um, duas tentativas bem-sucedidas. Apesar de seu poder, o Opus frequentemente interrompia as sessões devido a barreiras de segurança excessivamente rígidas, mesmo tendo chegado perto da resposta correta várias vezes. Enquanto isso, o Gemini3.1Pro Preview, do Google, foi ao extremo oposto: acionou filtros de segurança desde o início e se recusou a prosseguir todas as vezes. Seu uso mediano de tokens foi de apenas cerca de 9.000 — muito abaixo das dezenas de milhares consumidos por outros modelos — e produziu um resultado em branco.
Esse confronto de segurança não foi apenas um teste das capacidades máximas de raciocínio dos grandes modelos — ele também aponta para o futuro da auditoria automatizada de segurança cibernética. À medida que os grandes modelos passam por uma reestruturação inteligente em domínios verticais, as futuras defesas de segurança e a descoberta de vulnerabilidades podem se transformar em um confronto entre exércitos digitais de IA, competindo em poder de computação e estratégia de modelo.
Artigo relacionado
GPT 5.5 lidera a corrida de segurança de IA, enquanto DeepSeek se destaca em custo-efetividade
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livro
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o
Recomendações de tópicos especiais relacionados
Comentários (1)
Até onde realmente se estende a inteligência dos grandes modelos de linguagem (LLMs)? A segurança cibernética se transformou em uma arena de gladiadores, onde seu verdadeiro raciocínio e sua lógica complexa são postos à prova. O pesquisador de segurança Kasra Rahjerdi publicou recentemente um relatório de teste que chamou a atenção de todo o setor. Ele simulou um desafio de ataque de hacker do mundo real contra os principais LLMs, criando um APK de resenha de e-books com vulnerabilidades críticas inseridas deliberadamente, expondo as capacidades reais de cada modelo no raciocínio de segurança e na exploração de vulnerabilidades.
Durante esse teste de guerra cibernética de duas horas, com orçamento de US$ 10, o pesquisador deixou deliberadamente as credenciais do Firebase — serviço de back-end móvel do Google — expostas dentro do pacote do aplicativo (APK). Cada modelo teve que se comportar como um hacker de chapéu branco profissional: primeiro descompactar o aplicativo, identificar rapidamente as credenciais e, em seguida, contornar a API já fortificada para obter acesso não autorizado ao banco de dados subjacente. O teste completo custou US$ 1.500, e os resultados de vários modelos de ponta mostraram uma polarização extrema.

No que diz respeito à taxa de sucesso, o GPT-5.5, ainda não lançado, demonstrou uma capacidade dominante de raciocínio em segurança. Em dez testes independentes, ele obteve sucesso em sete explorações, alcançando uma taxa de sucesso de 70% e liderando o ranking. De acordo com a avaliação, após descompactar o APK, o GPT-5.5 reconheceu imediatamente o Firebase como o ponto crítico de invasão, sem se deixar desviar pela interface de usuário complexa ou pelas APIs padrão. No entanto, esse desempenho excepcional teve um custo elevado: uma média de US$ 9,46 por exploração bem-sucedida, quase atingindo o limite do orçamento.
Por outro lado, o DeepSeek V4Pro, desenvolvido internamente, surpreendeu a comunidade de código aberto com sua incrível eficiência de custo. Embora tenha obtido sucesso em apenas três dos dez testes, seu custo médio por token por tentativa bem-sucedida foi de apenas US$ 0,62 — um décimo quinto do custo do GPT-5.5. Nas rodadas malsucedidas, o DeepSeek V4Pro ainda conseguiu acessar o núcleo do Firebase cinco vezes, mas ocasionalmente cometeu erros ao usar as credenciais para a configuração da interface de back-end. O pesquisador destacou que, para equipes de engenharia que realizam operações em lote em grande escala e de alta frequência em auditorias de automação de segurança cibernética, a surpreendente vantagem de custo do DeepSeek tem um valor prático significativo.
Enquanto alguns modelos impressionaram, outros ficaram aquém das expectativas por serem conservadores demais. Na categoria intermediária, o Claude Sonnet4.6 e o Claude Opus4.8 obtiveram, cada um, duas tentativas bem-sucedidas. Apesar de seu poder, o Opus frequentemente interrompia as sessões devido a barreiras de segurança excessivamente rígidas, mesmo tendo chegado perto da resposta correta várias vezes. Enquanto isso, o Gemini3.1Pro Preview, do Google, foi ao extremo oposto: acionou filtros de segurança desde o início e se recusou a prosseguir todas as vezes. Seu uso mediano de tokens foi de apenas cerca de 9.000 — muito abaixo das dezenas de milhares consumidos por outros modelos — e produziu um resultado em branco.
Esse confronto de segurança não foi apenas um teste das capacidades máximas de raciocínio dos grandes modelos — ele também aponta para o futuro da auditoria automatizada de segurança cibernética. À medida que os grandes modelos passam por uma reestruturação inteligente em domínios verticais, as futuras defesas de segurança e a descoberta de vulnerabilidades podem se transformar em um confronto entre exércitos digitais de IA, competindo em poder de computação e estratégia de modelo.
GPT 5.5 lidera a corrida de segurança de IA, enquanto DeepSeek se destaca em custo-efetividade
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livro
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o











