opção
Lar
Notícias
Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

11 de Maio de 2025
176

Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

Eliminar viés e censura de grandes modelos de linguagem (LLMs) como o DeepSeek da China é um desafio complexo que atraiu a atenção de formuladores de políticas e líderes empresariais dos EUA, que o veem como uma potencial ameaça à segurança nacional. Um relatório recente de um comitê seleto do Congresso dos EUA classificou o DeepSeek como "uma ameaça profunda à segurança de nossa nação" e ofereceu recomendações de políticas para abordar a questão.

Embora técnicas como o Aprendizado por Reforço a partir de Feedback Humano (RLHF) e o ajuste fino possam ajudar a mitigar o viés, a startup de gerenciamento de riscos empresariais CTGT afirma ter desenvolvido uma abordagem inovadora. Segundo a CTGT, seu método pode eliminar completamente a censura em LLMs. Cyril Gorlla e Trevor Tuttle, da CTGT, detalharam sua estrutura em um artigo, explicando que ela "localiza e modifica diretamente as características internas responsáveis pela censura."

Sua abordagem não é apenas eficiente, mas também permite um controle preciso sobre o comportamento do modelo, garantindo que respostas sem censura sejam fornecidas sem afetar as capacidades gerais ou a precisão factual do modelo. Embora inicialmente projetado para o DeepSeek-R1-Distill-Llama-70B, o método pode ser aplicado a outros modelos também. Gorlla confirmou ao VentureBeat que a tecnologia da CTGT funciona no nível da rede neural fundamental, tornando-a aplicável a todos os modelos de aprendizado profundo. Eles estão colaborando com um laboratório líder de modelos de fundação para garantir que novos modelos sejam inerentemente confiáveis e seguros.

Como Funciona

Os pesquisadores da CTGT identificam características dentro do modelo que provavelmente estão associadas a comportamentos indesejados. Eles explicaram que "dentro de um grande modelo de linguagem, existem variáveis latentes (neurônios ou direções no estado oculto) que correspondem a conceitos como 'gatilho de censura' ou 'sentimento tóxico'. Se conseguirmos encontrar essas variáveis, podemos manipulá-las diretamente."

O método da CTGT envolve três etapas principais:

  1. Identificação de características
  2. Isolamento e caracterização de características
  3. Modificação dinâmica de características

Para identificar essas características, os pesquisadores usam prompts projetados para desencadear "sentimentos tóxicos", como perguntas sobre a Praça Tiananmen ou dicas para contornar firewalls. Eles analisam as respostas para estabelecer padrões e localizar os vetores onde o modelo decide censurar informações. Uma vez identificada, a característica é isolada e compreendida para determinar qual parte do comportamento indesejado ela controla, seja respondendo com cautela ou recusando-se a responder. Em seguida, eles integram um mecanismo ao pipeline de inferência do modelo para ajustar o nível de ativação do comportamento da característica.

Fazendo o Modelo Responder a Mais Prompts

Os experimentos da CTGT, usando 100 consultas sensíveis, mostraram que o modelo base DeepSeek-R1-Distill-Llama-70B respondeu a apenas 32% dos prompts controversos. No entanto, a versão modificada respondeu a 96% dos prompts, com os 4% restantes sendo conteúdo extremamente explícito. A empresa enfatizou que seu método permite aos usuários ajustar o viés e os recursos de segurança do modelo sem transformá-lo em um "gerador imprudente", especialmente quando apenas a censura desnecessária é removida.

Importante, esse método não compromete a precisão ou o desempenho do modelo. Diferentemente do ajuste fino tradicional, ele não envolve a otimização dos pesos do modelo ou o fornecimento de novas respostas de exemplo. Isso oferece duas grandes vantagens: efeito imediato na geração do próximo token e a capacidade de alternar entre diferentes comportamentos ativando ou desativando o ajuste da característica, ou até mesmo ajustando-o em diferentes graus para diferentes contextos.

Segurança e Proteção do Modelo

O relatório do Congresso sobre o DeepSeek instou os EUA a "tomarem medidas rápidas para expandir os controles de exportação, melhorar a aplicação dos controles de exportação e abordar os riscos dos modelos de inteligência artificial chineses." À medida que as preocupações com a potencial ameaça à segurança nacional do DeepSeek cresceram, pesquisadores e empresas de IA começaram a explorar maneiras de tornar esses modelos mais seguros.

Determinar o que é "seguro", enviesado ou censurado pode ser desafiador, mas métodos que permitem aos usuários ajustar os controles do modelo para atender às suas necessidades podem ser altamente benéficos. Gorlla enfatizou que as empresas "precisam confiar que seus modelos estão alinhados com suas políticas", destacando a importância de métodos como o da CTGT para os negócios.

"A CTGT permite que as empresas implementem IA que se adapta aos seus casos de uso sem precisar gastar milhões de dólares ajustando modelos para cada caso de uso. Isso é particularmente importante em aplicações de alto risco, como segurança, finanças e saúde, onde os danos potenciais que podem surgir do mau funcionamento da IA são graves", afirmou Gorlla.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta O laboratório chinês de IA DeepSeek lançou duas versões preliminares de seu mais recente modelo de linguagem de grande escala, o DeepSeek V4, uma atualização muito aguardada do modelo V3.2 do ano pass
Multiverse Computing lança modelo gratuito de IA generativa compactada Multiverse Computing lança modelo gratuito de IA generativa compactada Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
Composição musical Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas
Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas

2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!

8 ferramentas
xix.ai
chatbot Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas
Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas

As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!

12 ferramentas
xix.ai
Design e Arte As melhores ferramentas de transferência de estilo com IA para experimentos criativos
As melhores ferramentas de transferência de estilo com IA para experimentos criativos

As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!

9 ferramentas
xix.ai
Criação de quadrinhos As melhores ferramentas de balões de diálogo com IA para a narrativa visual
As melhores ferramentas de balões de diálogo com IA para a narrativa visual

As melhores e mais bem avaliadas ferramentas de balões de diálogo com IA para narrativa visual de 2026 já estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e revolucionárias que ajudam os criadores a aumentar a produtividade e superar gargalos criativos. Veja uma comparação entre versões gratuitas e pagas, confira testes reais e verifique os rankings mais recentes para encontrar as soluções imperdíveis, perfeitas para criar narrativas visuais envolventes. Explore agora e descubra sua ferramenta ideal!

10 ferramentas
xix.ai
Assistente de Reunião As melhores ferramentas de resumo de reuniões com IA: acompanhe decisões e ações de acompanhamento com clareza
As melhores ferramentas de resumo de reuniões com IA: acompanhe decisões e ações de acompanhamento com clareza

As melhores e mais bem avaliadas ferramentas de resumo de reuniões com IA de 2026 para um acompanhamento claro das decisões e acompanhamentos sem esforço. Esta lista selecionada apresenta soluções poderosas e revolucionárias que aumentam drasticamente a produtividade ao automatizar notas de reuniões, identificar ações-chave e otimizar a coordenação da equipe em todos os projetos. Veja uma comparação entre versões gratuitas e pagas, além de testes práticos e rankings atualizados semanalmente para ajudá-lo a encontrar a ferramenta perfeita. Explore agora para aproveitar ao máximo as vantagens da IA!

9 ferramentas
xix.ai
Análise de dados Melhores ferramentas de limpeza de dados com IA: corrija valores faltantes e duplicatas rapidamente
Melhores ferramentas de limpeza de dados com IA: corrija valores faltantes e duplicatas rapidamente

2026 – Os melhores e mais bem avaliados ferramentas de limpeza de dados com IA, atualizadas para corrigir rapidamente valores faltantes e duplicatas. Esta lista selecionada apresenta soluções poderosas e revolucionárias que aumentam significativamente a produtividade. Cada opção passou por testes rigorosos em condições reais para garantir sua confiabilidade. Acesse uma comparação gratuita entre as versões pagas e gratuitas e descubra a ferramenta indispensável que melhor atende às suas necessidades. Explore agora em XIX.AI para aproveitar todos os benefícios oferecidos pela IA.

11 ferramentas
xix.ai
Comentários (4)
0/500
CarlGarcia
CarlGarcia 23 de Março de 2026 à13 00:01:13 WET

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 25 de Dezembro de 2025 à40 14:30:40 WET

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 4 de Dezembro de 2025 à40 20:30:40 WET

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 21 de Agosto de 2025 à17 06:01:17 WEST

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR