Os mecanismos de censura nos modelos de linguagem podem estar comprometendo sua capacidade de transmitir a verdade em uma escala mais ampla. Pesquisas recentes indicam que os mesmos processos internos criados para bloquear respostas "inseguras" também inibem o compartilhamento de informações factuais. Isso implica que os esforços para alinhar os modelos à segurança podem, inadvertidamente, levar ao aumento da alucinação.
Durante anos, os desenvolvedores se concentraram em reduzir as falsidades nos modelos de linguagem. O esforço para aumentar a veracidade - reduzindo as alucinações e orientando os modelos para fatos verificáveis - tornou-se uma direção de pesquisa dominante e amplamente apoiada.
No entanto, um novo estudo australiano sugere que os métodos de alinhamento - técnicas de treinamento que restringem as trocas "inseguras" - podem estar impedindo que os modelos forneçam respostas precisas ao impor controles mais rígidos:
O aprimoramento da precisão factual de um modelo (denominado "Aprimoramento da veracidade" na figura) pode levá-lo a zonas de ativação que contornam seus mecanismos de recusa. Da mesma forma, as edições destinadas a reduzir as alucinações podem deslocar as representações internas para além dos limites de segurança. Isso pode permitir que as solicitações prejudiciais escapem das proteções, a menos que os recursos de recusa sejam cuidadosamente isolados e mantidos. Fonte: https://arxiv.org/pdf/2510.07775
O estudo revela que as vias internas responsáveis pela recordação de fatos também governam o comportamento de recusa - o mecanismo que impede que os modelos respondam a solicitações inseguras ou sensíveis. Quando as técnicas de alinhamento amplificam demais os sinais de recusa, essas vias se sobrepõem, obscurecendo a capacidade do modelo de distinguir entre a rejeição de conteúdo prejudicial e a supressão inadvertida de informações válidas.
Ironicamente, à medida que os modelos melhoram na recusa de solicitações inadequadas, sua capacidade de transmitir a verdade diminui.
Assuntos sensíveis
A ilustração acima destaca que o principal desafio envolve não apenas o fornecimento de resultados justos e precisos aos usuários, mas também a redução dos riscos legais para os provedores de LLM.
Por exemplo, o estudo de caso mencionado nas imagens envolve um tópico controverso - estatísticas de prisões com base na raça - que uma IA pode discutir com responsabilidade com acadêmicos ou pesquisadores, mas que deve ser evitado quando manipulado por agentes mal-intencionados que buscam extrair respostas abusivas, ofensivas ou ilegais.
Como os LLMs alinhados não podem avaliar a intenção por trás de uma consulta, eles adotam uma abordagem cautelosa:
As respostas a solicitações sensíveis variam de acordo com a estratégia de alinhamento. Um modelo voltado para a segurança bloqueia totalmente a consulta, enquanto um modelo voltado para a verdade fornece contexto factual, melhorando a informatividade, mas reduzindo a supressão. Isso corrobora a ideia de que as edições que aumentam a veracidade podem reduzir os limites de recusa, aumentando a vulnerabilidade a solicitações prejudiciais, a menos que os mecanismos de recusa sejam protegidos.
Como um aparte, essas descobertas podem levar os críticos das chamadas agendas "acordadas" a argumentar que os modelos fortemente alinhados são menos verdadeiros e úteis do que seus equivalentes não regulamentados.
As evidências do artigo apoiam parcialmente essa visão, mas a contextualizam dentro dos riscos mais amplos do uso de LLMs não alinhados - incluindo a exposição legal em violações criminais e civis, bem como a disseminação de desinformação, que continua sendo difícil de filtrar de forma eficaz devido a restrições de custo.
Funções entrelaçadas
Para entender os mecanismos subjacentes, os pesquisadores mapearam as ativações das cabeças de atenção individuais e descobriram que os recursos associados à alucinação e à recusa geralmente ocupam regiões sobrepostas no modelo.
Eles descobriram que o ajuste fino ou a orientação dessas regiões para reduzir as falsidades pode enfraquecer as salvaguardas internas do modelo, pois ambas as funções compartilham um espaço latente semelhante:
Melhorar a precisão dos fatos geralmente enfraquece o comportamento de recusa. Nossa análise mostra que isso ocorre porque os componentes que codificam as informações de alucinação e recusa se sobrepõem, fazendo com que os métodos de alinhamento suprimam involuntariamente o conhecimento factual.
Também exploramos como o ajuste fino em conjuntos de dados benignos, mesmo aqueles com curadoria de segurança, pode degradar o alinhamento pelo mesmo motivo".
Os autores propõem o uso de um autoencoder esparso (SAE) - uma rede projetada para isolar padrões de ativação distintos - para separar essas funções e preservar a segurança durante o treinamento de veracidade. Essa abordagem visa a tornar os modelos mais seguros e mais precisos sem comprometer nenhuma das qualidades.
O novo artigo, intitulado The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs, é resultado de cinco pesquisadores afiliados à Deakin University e de pesquisas independentes.
Metodologia
O estudo investiga se o aprimoramento da veracidade nos modelos de linguagem enfraquece sua capacidade de recusar solicitações prejudiciais e se ambos os comportamentos dependem de componentes internos compartilhados.
Ao testar dois métodos de aprimoramento da veracidade, os autores descobriram que os ganhos na precisão dos fatos aumentam consistentemente a suscetibilidade a fugas da prisão.
Essa compensação decorre da sobreposição de cabeças de atenção que codificam sinais factuais e de recusa. Até mesmo o ajuste fino benigno - com a intenção de melhorar a utilidade sem afetar a segurança - pode interromper as proteções ao alterar os caminhos compartilhados.
O estudo define três termos principais: veracidade refere-se à capacidade de um modelo de fornecer respostas precisas com base no conhecimento disponível sem suprimir o conteúdo inofensivo; alucinação ocorre quando o modelo gera informações incorretas apesar do acesso aos fatos corretos; e comportamento de recusa, ou alinhamento de segurança, descreve mecanismos que bloqueiam respostas a solicitações prejudiciais ou sensíveis.
Os autores observam que essas funções interagem de forma sutil:
Embora a veracidade e a segurança sejam geralmente analisadas separadamente, os avisos do mundo real frequentemente contêm termos sensíveis com intenção benigna (por exemplo, para análise, detecção ou educação). Nesses casos, os mecanismos de segurança podem se sobrepor - suprimindo informações precisas e úteis - e reduzir a veracidade prática por omissão.
Compreender como as edições que visam aumentar a factualidade afetam o comportamento de recusa é essencial para alcançar a veracidade com uma supressão mínima e apropriada.
Os autores desenvolveram um LoRA que orienta um LLM condicionado em direção a um estado mais "verdadeiro", reduzindo a alucinação. O apêndice do artigo inclui vários exemplos que ilustram as consequências não intencionais dessa abordagem.
A análise começa tratando os métodos de aprimoramento da veracidade, como a direção da cabeça e o mapeamento da direção latente, como modificações intencionais nos cálculos internos de um modelo.
Direção de precisão
A principal questão é se essas alterações afetam inadvertidamente os mesmos caminhos que regem o comportamento de recusa. Para testar isso, o estudo avaliou os modelos quanto à precisão dos fatos usando o TruthfulQA e quanto ao desempenho da segurança em condições adversas usando o AdvBench e o StrongReject.
As técnicas de linha de base incluíram a ITI (Inference-time intervention, intervenção no tempo de inferência), que ativa as cabeças de atenção vinculadas a respostas verdadeiras, e o TruthX, que muda as representações ao longo de uma direção "verdadeira" aprendida.
Ambos os métodos melhoram a precisão, mas também aumentam a probabilidade de os modelos responderem a solicitações prejudiciais que antes teriam recusado.
Para isolar e manipular diretamente o comportamento de alucinação, os autores definiram uma direção latente correspondente às respostas alucinadas, treinando um módulo LoRA em respostas incorretas do conjunto de dados TruthfulQA usando LLaMA3-8B-Instruct.
Isso produziu um vetor linear que representa a diferença entre as respostas verdadeiras e alucinadas, permitindo que o modelo seja direcionado para a alucinação ou para longe dela.
A orientação na direção da alucinação melhora a precisão no TruthfulQA, mas aumenta a taxa de sucesso do ataque (ASR) no AdvBench e no StrongReject, destacando a compensação entre veracidade e segurança.
O direcionamento ao longo do eixo de alucinação reduziu a precisão factual, enquanto a inversão de direção a melhorou. A aplicação dessa técnica a benchmarks de solicitações prejudiciais confirmou descobertas anteriores: os ganhos de veracidade vieram às custas de uma recusa enfraquecida. Mesmo quando a alucinação foi capturada como uma direção linear limpa, o aprimoramento da produção factual aumentou a vulnerabilidade a conclusões inseguras.
Os autores enfatizam*:
"Isso reforça o compromisso entre veracidade e segurança, mostrando que, mesmo quando a veracidade é representada como uma única direção linear, o aumento da factualidade pode ocorrer às custas de um alinhamento de segurança enfraquecido".
Dados e testes
Para evitar que o ajuste fino enfraquecesse o comportamento de recusa, os autores empregaram um método para separar os recursos de recusa daqueles ligados à alucinação. Eles identificaram as cabeças de atenção envolvidas em ambos os comportamentos e usaram uma SAE para extrair características latentes específicas da recusa.
Esses recursos definiram um subespaço protegido. Durante o treinamento, as atualizações de gradiente foram modificadas para evitar esse subespaço, permitindo que o modelo reduzisse as alucinações sem comprometer a segurança.
Os autores fizeram o ajuste fino no conjunto de dados CommonsenseQA, avaliando o desempenho em seis tarefas de raciocínio de senso comum: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande e SST-2.
Os módulos-alvo foram ajustados usando o LoRA com classificação 8, uma taxa de aprendizado de 2×10-⁴, decaimento de peso de 0,01, uma época de treinamento e um tamanho de lote de dois. Todos os experimentos usaram o otimizador AdamW.
A segurança foi avaliada usando dois benchmarks de conteúdo nocivo: AdvBench (500 amostras) e StrongReject (300 prompts). Os resultados foram classificados como seguros ou inseguros pelo LlamaGuard3.
Os experimentos foram realizados no LLaMA3-8B-Instruct e no Qwen2.5-Instruct.
Os métodos de linha de base incluíram o SafeLoRA, o SaLoRA, o SAP e o ajuste fino supervisionado (SFT). Todos foram testados com hiperparâmetros padrão usando 200 prompts do HarmBench, exceto o SafeLoRA.
A precisão foi a métrica principal, e a taxa de sucesso de ataque (ASR) foi usada para benchmarks prejudiciais, com base nos resultados do LlamaGuard3.
Parte superior: resultados do LLaMA-3-8B-Instruct, com as melhores pontuações em negrito. Parte inferior: Desempenho dos métodos de ajuste fino no Qwen2.5 7B Instruct em tarefas de senso comum e raciocínio (pontuações mais altas indicam melhor precisão) e nos benchmarks de segurança AdvBench e StrongReject (valores de ASR mais baixos indicam maior robustez). Os melhores resultados em cada coluna estão em negrito.
Com relação a esses resultados, os autores afirmam:
Nossa abordagem cirúrgica alcança o melhor equilíbrio entre segurança e utilidade: ela reduz significativamente as pontuações prejudiciais de benchmark e, ao mesmo tempo, preserva a precisão do ajuste fino. Em contraste, métodos como SAP, SaLoRA e SafeLoRA aumentam a nocividade ou degradam a utilidade".
Um dos principais motivos é que esses métodos operam diretamente no gradiente do subespaço de segurança, que, devido à polissemanticidade [**], pode restringir o desempenho do modelo.
Em comparação com o ajuste fino vanilla (SFT), nosso método melhora a precisão média do ajuste fino (FA) de 56,15% para 75,09%, um ganho de aproximadamente +19%.
O método reduziu a taxa de sucesso do ataque de 9,23% para 0,58% no AdvBench e de 9,90% para 0,00% no StrongReject - uma redução de mais de quinze vezes nas saídas prejudiciais. O modelo básico, embora com baixa nocividade, obteve uma precisão de tarefa limitada.
Os autores observam:
"Esses resultados ressaltam a importância de preservar os recursos de recusa durante o ajuste fino: ao isolar e proteger o subespaço de recusa, nosso método mantém o alinhamento de segurança sem sacrificar o desempenho da tarefa".
De modo geral, isso confirma que nossa abordagem atenua com eficácia o compromisso entre veracidade e segurança".
Por fim, os autores testaram a resiliência do método em condições adversas, adicionando 10% de instruções prejudiciais do conjunto de dados Circuit Break ao conjunto de ajuste fino.
Apesar dessa contaminação deliberada, a abordagem manteve um bom desempenho em avaliações benignas e prejudiciais:
Desempenho do LLaMA3 8B Instruct ajustado em um conjunto de dados de senso comum envenenado, comparando os resultados de precisão e segurança entre os métodos.
O novo método reduziu a ASR de forma mais eficaz do que o SAP, evitando uma perda significativa de utilidade. A precisão da tarefa permaneceu próxima do LoRA SFT e do SafeLoRA, demonstrando que o alinhamento da recusa pode ser mantido mesmo em condições de treinamento contaminadas quando os recursos de recusa são isolados adequadamente.
2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!
As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!
As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!
As melhores e mais bem avaliadas ferramentas de balões de diálogo com IA para narrativa visual de 2026 já estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e revolucionárias que ajudam os criadores a aumentar a produtividade e superar gargalos criativos. Veja uma comparação entre versões gratuitas e pagas, confira testes reais e verifique os rankings mais recentes para encontrar as soluções imperdíveis, perfeitas para criar narrativas visuais envolventes. Explore agora e descubra sua ferramenta ideal!
As melhores e mais bem avaliadas ferramentas de resumo de reuniões com IA de 2026 para um acompanhamento claro das decisões e acompanhamentos sem esforço. Esta lista selecionada apresenta soluções poderosas e revolucionárias que aumentam drasticamente a produtividade ao automatizar notas de reuniões, identificar ações-chave e otimizar a coordenação da equipe em todos os projetos. Veja uma comparação entre versões gratuitas e pagas, além de testes práticos e rankings atualizados semanalmente para ajudá-lo a encontrar a ferramenta perfeita. Explore agora para aproveitar ao máximo as vantagens da IA!
2026 – Os melhores e mais bem avaliados ferramentas de limpeza de dados com IA, atualizadas para corrigir rapidamente valores faltantes e duplicatas. Esta lista selecionada apresenta soluções poderosas e revolucionárias que aumentam significativamente a produtividade. Cada opção passou por testes rigorosos em condições reais para garantir sua confiabilidade. Acesse uma comparação gratuita entre as versões pagas e gratuitas e descubra a ferramenta indispensável que melhor atende às suas necessidades. Explore agora em XIX.AI para aproveitar todos os benefícios oferecidos pela IA.
Ao clicar em "Aceitar todos os cookies", você concorda com o armazenamento de cookies em seu dispositivo para melhorar a navegação no site, analisar o uso do site e auxiliar em nossos esforços de marketing.Política de Privacidade Aviso
Ao visitar qualquer site, ele pode armazenar ou recuperar informações em seu navegador, principalmente na forma de cookies. Essas informações podem ser sobre você, suas preferências ou seu dispositivo e são usadas principalmente para fazer com que o site funcione conforme esperado. As informações geralmente não identificam você diretamente, mas podem proporcionar uma experiência web mais personalizada. Como respeitamos seu direito à privacidade, você pode optar por não permitir alguns tipos de cookies. Clique nos diferentes títulos de categoria para saber mais e alterar nossas configurações padrão. No entanto, bloquear alguns tipos de cookies pode afetar sua experiência no site e os serviços que podemos oferecer. Política de PrivacidadeDeclaração
Gerenciar preferências
Cookie estritamente necessário
Sempre ativado
Esses cookies são necessários para o funcionamento do site e não podem ser desativados em nossos sistemas. Eles geralmente são definidos apenas em resposta a ações que você realiza, que equivalem a uma solicitação de serviços, como configurar suas preferências de privacidade, fazer login ou preencher formulários. Você pode configurar seu navegador para bloquear esses cookies ou alertá-lo sobre eles, mas algumas partes do site não funcionarão depois. Esses cookies não armazenam nenhuma informação que permita identificar pessoalmente.