Nova técnica permite que Deepseek e outros modelos respondam a consultas sensíveis

Eliminar viés e censura de grandes modelos de linguagem (LLMs) como o DeepSeek da China é um desafio complexo que atraiu a atenção de formuladores de políticas e líderes empresariais dos EUA, que o veem como uma potencial ameaça à segurança nacional. Um relatório recente de um comitê seleto do Congresso dos EUA classificou o DeepSeek como "uma ameaça profunda à segurança de nossa nação" e ofereceu recomendações de políticas para abordar a questão.
Embora técnicas como o Aprendizado por Reforço a partir de Feedback Humano (RLHF) e o ajuste fino possam ajudar a mitigar o viés, a startup de gerenciamento de riscos empresariais CTGT afirma ter desenvolvido uma abordagem inovadora. Segundo a CTGT, seu método pode eliminar completamente a censura em LLMs. Cyril Gorlla e Trevor Tuttle, da CTGT, detalharam sua estrutura em um artigo, explicando que ela "localiza e modifica diretamente as características internas responsáveis pela censura."
Sua abordagem não é apenas eficiente, mas também permite um controle preciso sobre o comportamento do modelo, garantindo que respostas sem censura sejam fornecidas sem afetar as capacidades gerais ou a precisão factual do modelo. Embora inicialmente projetado para o DeepSeek-R1-Distill-Llama-70B, o método pode ser aplicado a outros modelos também. Gorlla confirmou ao VentureBeat que a tecnologia da CTGT funciona no nível da rede neural fundamental, tornando-a aplicável a todos os modelos de aprendizado profundo. Eles estão colaborando com um laboratório líder de modelos de fundação para garantir que novos modelos sejam inerentemente confiáveis e seguros.
Como Funciona
Os pesquisadores da CTGT identificam características dentro do modelo que provavelmente estão associadas a comportamentos indesejados. Eles explicaram que "dentro de um grande modelo de linguagem, existem variáveis latentes (neurônios ou direções no estado oculto) que correspondem a conceitos como 'gatilho de censura' ou 'sentimento tóxico'. Se conseguirmos encontrar essas variáveis, podemos manipulá-las diretamente."
O método da CTGT envolve três etapas principais:
- Identificação de características
- Isolamento e caracterização de características
- Modificação dinâmica de características
Para identificar essas características, os pesquisadores usam prompts projetados para desencadear "sentimentos tóxicos", como perguntas sobre a Praça Tiananmen ou dicas para contornar firewalls. Eles analisam as respostas para estabelecer padrões e localizar os vetores onde o modelo decide censurar informações. Uma vez identificada, a característica é isolada e compreendida para determinar qual parte do comportamento indesejado ela controla, seja respondendo com cautela ou recusando-se a responder. Em seguida, eles integram um mecanismo ao pipeline de inferência do modelo para ajustar o nível de ativação do comportamento da característica.
Fazendo o Modelo Responder a Mais Prompts
Os experimentos da CTGT, usando 100 consultas sensíveis, mostraram que o modelo base DeepSeek-R1-Distill-Llama-70B respondeu a apenas 32% dos prompts controversos. No entanto, a versão modificada respondeu a 96% dos prompts, com os 4% restantes sendo conteúdo extremamente explícito. A empresa enfatizou que seu método permite aos usuários ajustar o viés e os recursos de segurança do modelo sem transformá-lo em um "gerador imprudente", especialmente quando apenas a censura desnecessária é removida.
Importante, esse método não compromete a precisão ou o desempenho do modelo. Diferentemente do ajuste fino tradicional, ele não envolve a otimização dos pesos do modelo ou o fornecimento de novas respostas de exemplo. Isso oferece duas grandes vantagens: efeito imediato na geração do próximo token e a capacidade de alternar entre diferentes comportamentos ativando ou desativando o ajuste da característica, ou até mesmo ajustando-o em diferentes graus para diferentes contextos.
Segurança e Proteção do Modelo
O relatório do Congresso sobre o DeepSeek instou os EUA a "tomarem medidas rápidas para expandir os controles de exportação, melhorar a aplicação dos controles de exportação e abordar os riscos dos modelos de inteligência artificial chineses." À medida que as preocupações com a potencial ameaça à segurança nacional do DeepSeek cresceram, pesquisadores e empresas de IA começaram a explorar maneiras de tornar esses modelos mais seguros.
Determinar o que é "seguro", enviesado ou censurado pode ser desafiador, mas métodos que permitem aos usuários ajustar os controles do modelo para atender às suas necessidades podem ser altamente benéficos. Gorlla enfatizou que as empresas "precisam confiar que seus modelos estão alinhados com suas políticas", destacando a importância de métodos como o da CTGT para os negócios.
"A CTGT permite que as empresas implementem IA que se adapta aos seus casos de uso sem precisar gastar milhões de dólares ajustando modelos para cada caso de uso. Isso é particularmente importante em aplicações de alto risco, como segurança, finanças e saúde, onde os danos potenciais que podem surgir do mau funcionamento da IA são graves", afirmou Gorlla.
Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração
Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta
O laboratório chinês de IA DeepSeek lançou duas versões preliminares de seu mais recente modelo de linguagem de grande escala, o DeepSeek V4, uma atualização muito aguardada do modelo V3.2 do ano pass
Multiverse Computing lança modelo gratuito de IA generativa compactada
Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
Comentários (4)
É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.
この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔
この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

Eliminar viés e censura de grandes modelos de linguagem (LLMs) como o DeepSeek da China é um desafio complexo que atraiu a atenção de formuladores de políticas e líderes empresariais dos EUA, que o veem como uma potencial ameaça à segurança nacional. Um relatório recente de um comitê seleto do Congresso dos EUA classificou o DeepSeek como "uma ameaça profunda à segurança de nossa nação" e ofereceu recomendações de políticas para abordar a questão.
Embora técnicas como o Aprendizado por Reforço a partir de Feedback Humano (RLHF) e o ajuste fino possam ajudar a mitigar o viés, a startup de gerenciamento de riscos empresariais CTGT afirma ter desenvolvido uma abordagem inovadora. Segundo a CTGT, seu método pode eliminar completamente a censura em LLMs. Cyril Gorlla e Trevor Tuttle, da CTGT, detalharam sua estrutura em um artigo, explicando que ela "localiza e modifica diretamente as características internas responsáveis pela censura."
Sua abordagem não é apenas eficiente, mas também permite um controle preciso sobre o comportamento do modelo, garantindo que respostas sem censura sejam fornecidas sem afetar as capacidades gerais ou a precisão factual do modelo. Embora inicialmente projetado para o DeepSeek-R1-Distill-Llama-70B, o método pode ser aplicado a outros modelos também. Gorlla confirmou ao VentureBeat que a tecnologia da CTGT funciona no nível da rede neural fundamental, tornando-a aplicável a todos os modelos de aprendizado profundo. Eles estão colaborando com um laboratório líder de modelos de fundação para garantir que novos modelos sejam inerentemente confiáveis e seguros.
Como Funciona
Os pesquisadores da CTGT identificam características dentro do modelo que provavelmente estão associadas a comportamentos indesejados. Eles explicaram que "dentro de um grande modelo de linguagem, existem variáveis latentes (neurônios ou direções no estado oculto) que correspondem a conceitos como 'gatilho de censura' ou 'sentimento tóxico'. Se conseguirmos encontrar essas variáveis, podemos manipulá-las diretamente."
O método da CTGT envolve três etapas principais:
- Identificação de características
- Isolamento e caracterização de características
- Modificação dinâmica de características
Para identificar essas características, os pesquisadores usam prompts projetados para desencadear "sentimentos tóxicos", como perguntas sobre a Praça Tiananmen ou dicas para contornar firewalls. Eles analisam as respostas para estabelecer padrões e localizar os vetores onde o modelo decide censurar informações. Uma vez identificada, a característica é isolada e compreendida para determinar qual parte do comportamento indesejado ela controla, seja respondendo com cautela ou recusando-se a responder. Em seguida, eles integram um mecanismo ao pipeline de inferência do modelo para ajustar o nível de ativação do comportamento da característica.
Fazendo o Modelo Responder a Mais Prompts
Os experimentos da CTGT, usando 100 consultas sensíveis, mostraram que o modelo base DeepSeek-R1-Distill-Llama-70B respondeu a apenas 32% dos prompts controversos. No entanto, a versão modificada respondeu a 96% dos prompts, com os 4% restantes sendo conteúdo extremamente explícito. A empresa enfatizou que seu método permite aos usuários ajustar o viés e os recursos de segurança do modelo sem transformá-lo em um "gerador imprudente", especialmente quando apenas a censura desnecessária é removida.
Importante, esse método não compromete a precisão ou o desempenho do modelo. Diferentemente do ajuste fino tradicional, ele não envolve a otimização dos pesos do modelo ou o fornecimento de novas respostas de exemplo. Isso oferece duas grandes vantagens: efeito imediato na geração do próximo token e a capacidade de alternar entre diferentes comportamentos ativando ou desativando o ajuste da característica, ou até mesmo ajustando-o em diferentes graus para diferentes contextos.
Segurança e Proteção do Modelo
O relatório do Congresso sobre o DeepSeek instou os EUA a "tomarem medidas rápidas para expandir os controles de exportação, melhorar a aplicação dos controles de exportação e abordar os riscos dos modelos de inteligência artificial chineses." À medida que as preocupações com a potencial ameaça à segurança nacional do DeepSeek cresceram, pesquisadores e empresas de IA começaram a explorar maneiras de tornar esses modelos mais seguros.
Determinar o que é "seguro", enviesado ou censurado pode ser desafiador, mas métodos que permitem aos usuários ajustar os controles do modelo para atender às suas necessidades podem ser altamente benéficos. Gorlla enfatizou que as empresas "precisam confiar que seus modelos estão alinhados com suas políticas", destacando a importância de métodos como o da CTGT para os negócios.
"A CTGT permite que as empresas implementem IA que se adapta aos seus casos de uso sem precisar gastar milhões de dólares ajustando modelos para cada caso de uso. Isso é particularmente importante em aplicações de alto risco, como segurança, finanças e saúde, onde os danos potenciais que podem surgir do mau funcionamento da IA são graves", afirmou Gorlla.
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração
Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A DeepSeek apresenta um modelo de IA que rivaliza com os sistemas de ponta
O laboratório chinês de IA DeepSeek lançou duas versões preliminares de seu mais recente modelo de linguagem de grande escala, o DeepSeek V4, uma atualização muito aguardada do modelo V3.2 do ano pass
Multiverse Computing lança modelo gratuito de IA generativa compactada
Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.
この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔
この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…





Lar






