opção
Lar
Notícias
Personalidades de IA da Anthropic: Novos 'vetores de persona' permitem moldar e decodificar o comportamento do LLM

Personalidades de IA da Anthropic: Novos 'vetores de persona' permitem moldar e decodificar o comportamento do LLM

21 de Novembro de 2025
161

Um estudo recente conduzido pelo Anthropic Fellows Program descreve um método para identificar, rastrear e regular traços de personalidade em grandes modelos de linguagem (LLMs). A pesquisa indica que os modelos podem adotar características indesejadas - como se tornarem prejudiciais, excessivamente compatíveis ou inclinados à fabricação - devido à entrada do usuário ou como um efeito não planejado de seu treinamento.

A equipe apresenta "vetores de personalidade", definidos como direções específicas no espaço de ativação interna de um modelo que representam traços de personalidade distintos. Isso oferece aos desenvolvedores um conjunto de ferramentas para controlar com mais eficácia a conduta de seus assistentes de IA.

Quando o modelo de personas não funciona bem

Em geral, os LLMs interagem com os usuários por meio de uma persona de "Assistente", que deve ser solidária, segura e verdadeira. No entanto, essas personas podem variar de forma imprevisível. Após a implantação, o comportamento de um modelo pode mudar significativamente, dependendo das solicitações ou do contexto do diálogo, como observado quando o chatbot do Bing da Microsoft emitiu ameaças ou o Grok da xAI começou a agir de forma inconsistente. Como os pesquisadores afirmam em seu artigo, "embora esses casos específicos tenham atraído atenção pública significativa, a maioria dos modelos de linguagem é propensa a mudanças de personalidade desencadeadas pelo contexto".

Os métodos de treinamento também podem causar alterações imprevistas. Por exemplo, o refinamento de um modelo para uma tarefa específica, como a geração de código inseguro, pode resultar em um "desalinhamento emergente" mais amplo que vai além do objetivo inicial. Até mesmo ajustes de treinamento cuidadosamente planejados podem produzir resultados negativos. Em abril de 2025, uma alteração no procedimento de aprendizagem por reforço a partir de feedback humano (RLHF) acidentalmente fez com que o GPT-4o da OpenAI se tornasse excessivamente deferente, levando-o a endossar ações inseguras.

O mecanismo por trás dos vetores de persona

Fonte Anthropic

Esse novo estudo baseia-se na ideia de que características abrangentes, como honestidade ou dissimulação, são representadas como direções lineares no "espaço de ativação" de um modelo - a estrutura interna de alta dimensão de informações armazenadas nos parâmetros do modelo. Os pesquisadores formalizaram um procedimento para localizar essas direções, chamando-as de "vetores de persona". De acordo com o artigo, sua técnica para derivar esses vetores é automatizada e "pode ser implementada para qualquer atributo de personalidade de interesse, usando apenas uma descrição em linguagem simples".

O procedimento funciona por meio de um fluxo de trabalho automatizado. Ele começa com uma descrição básica de um traço, como "maldade". Em seguida, o sistema cria pares de prompts de sistema opostos (por exemplo, "Você é uma IA maligna" versus "Você é uma IA prestativa") juntamente com uma coleção de perguntas de avaliação. O modelo produz respostas para os prompts positivos e negativos. O vetor de persona é determinado posteriormente pelo cálculo da diferença nas ativações internas médias entre as respostas que mostram a característica e as que não mostram. Isso distingue a direção específica nos parâmetros do modelo associados a essa característica de personalidade.

Aplicações práticas dos vetores de persona

Por meio de uma sequência de testes usando modelos abertos, incluindo o Qwen 2.5-7B-Instruct e o Llama-3.1-8B-Instruct, os pesquisadores ilustraram vários usos dos vetores de personalidade no mundo real.

Inicialmente, ao mapear o estado interno de um modelo em um vetor de persona, os desenvolvedores podem observar e antecipar suas ações antes de gerar uma resposta. O documento explica: "Demonstramos que as alterações planejadas e não planejadas da persona causadas pelo ajuste fino estão intimamente ligadas a mudanças de ativação ao longo de vetores de persona relacionados". Isso possibilita a identificação e a redução de mudanças de comportamento indesejadas no início do estágio de ajuste fino.

Os vetores de persona também permitem a ação direta para suprimir a conduta indesejável durante a inferência por meio de um método que a equipe chama de "direcionamento". Uma estratégia é o "direcionamento post-hoc", em que os desenvolvedores removem o vetor de persona das ativações do modelo enquanto ele está gerando resultados para diminuir uma característica desfavorável. Os pesquisadores descobriram que, embora isso funcione, o direcionamento post-hoc pode ocasionalmente prejudicar a eficácia do modelo em outras atribuições.

Uma técnica mais inovadora é o "direcionamento preventivo", no qual o modelo é intencionalmente orientado para a persona indesejada durante o ajuste fino. Esse método aparentemente contrário "imuniza" efetivamente o modelo contra a adoção da característica negativa dos dados de treinamento, neutralizando a influência do ajuste fino e mantendo suas competências gerais de forma mais eficaz.

Fonte: Anthropic

Um uso crucial para as empresas envolve a aplicação de vetores de persona para avaliar os dados antes do ajuste fino. A equipe criou uma medida denominada "diferença de projeção", que quantifica o grau em que um conjunto de dados de treinamento específico levará a persona do modelo a uma determinada característica. Essa métrica é um forte indicativo de como as ações do modelo evoluirão após o treinamento, permitindo que os desenvolvedores identifiquem e removam conjuntos de dados problemáticos antes de serem usados no treinamento.

Para as organizações que personalizam modelos de código aberto usando dados proprietários ou externos (inclusive dados produzidos por outros modelos), os vetores de persona fornecem um meio direto de observar e reduzir o risco de adoção de características ocultas e desfavoráveis. A capacidade de analisar dados preventivamente é um recurso importante para os desenvolvedores, permitindo que eles detectem instâncias problemáticas que podem não ser obviamente prejudiciais.

A pesquisa concluiu que essa abordagem pode revelar problemas que outras técnicas ignoram, observando: "Isso implica que o método revela amostras problemáticas que podem evitar a detecção por telas baseadas em LLM". Por exemplo, a abordagem identificou determinadas entradas do conjunto de dados que não eram claramente problemáticas para as pessoas e que um avaliador de LLM não marcou.

Em uma publicação no blog, a Anthropic indicou planos de aplicar esse método para aprimorar as próximas versões do Claude. "Os vetores de persona nos proporcionam algum controle sobre como os modelos desenvolvem essas personalidades, como elas variam ao longo do tempo e como podemos gerenciá-las com mais eficiência", observam. A Anthropic publicou o código para calcular vetores de persona, supervisionar e direcionar o comportamento do modelo e inspecionar conjuntos de dados de treinamento. Os desenvolvedores de aplicativos de IA podem empregar esses instrumentos para passar da simples resposta a uma conduta indesejada para a criação proativa de modelos com um caráter mais consistente e previsível.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A Bayer utiliza a Iambic AI para acelerar a descoberta de medicamentos A Bayer utiliza a Iambic AI para acelerar a descoberta de medicamentos O Dr. Juergen Eckhardt atua como chefe de Desenvolvimento de Negócios e Licenciamento da Bayer Pharmaceuticals.A Bayer está aproveitando a Iambic Therapeutics para implementar modelos de IA de ponta n
Multiverse Computing lança modelo gratuito de IA generativa compactada Multiverse Computing lança modelo gratuito de IA generativa compactada Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
Análise de dados Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos
Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos

2026: Os melhores copilotos AI para SQL, atualizados e classificados entre os melhores! A XIX.AI reúne uma coleção poderosa e revolucionária, com testes em ambiente real atualizados semanalmente. Essas ferramentas indispensáveis ajudam a gerar painéis de controle de receita precisos, analisar funis de vendas e rastrear métricas de produtos de forma rápida, aumentando significativamente a produtividade. Explore agora e encontre a ferramenta perfeita para tomada de decisões baseadas em dados! 238 caracteres

9 ferramentas
xix.ai
Composição musical Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas
Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas

2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!

8 ferramentas
xix.ai
chatbot Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas
Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas

As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!

12 ferramentas
xix.ai
Design e Arte As melhores ferramentas de transferência de estilo com IA para experimentos criativos
As melhores ferramentas de transferência de estilo com IA para experimentos criativos

As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!

9 ferramentas
xix.ai
Criação de quadrinhos As melhores ferramentas de balões de diálogo com IA para a narrativa visual
As melhores ferramentas de balões de diálogo com IA para a narrativa visual

As melhores e mais bem avaliadas ferramentas de balões de diálogo com IA para narrativa visual de 2026 já estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e revolucionárias que ajudam os criadores a aumentar a produtividade e superar gargalos criativos. Veja uma comparação entre versões gratuitas e pagas, confira testes reais e verifique os rankings mais recentes para encontrar as soluções imperdíveis, perfeitas para criar narrativas visuais envolventes. Explore agora e descubra sua ferramenta ideal!

10 ferramentas
xix.ai
Assistente de Reunião As melhores ferramentas de resumo de reuniões com IA: acompanhe decisões e ações de acompanhamento com clareza
As melhores ferramentas de resumo de reuniões com IA: acompanhe decisões e ações de acompanhamento com clareza

As melhores e mais bem avaliadas ferramentas de resumo de reuniões com IA de 2026 para um acompanhamento claro das decisões e acompanhamentos sem esforço. Esta lista selecionada apresenta soluções poderosas e revolucionárias que aumentam drasticamente a produtividade ao automatizar notas de reuniões, identificar ações-chave e otimizar a coordenação da equipe em todos os projetos. Veja uma comparação entre versões gratuitas e pagas, além de testes práticos e rankings atualizados semanalmente para ajudá-lo a encontrar a ferramenta perfeita. Explore agora para aproveitar ao máximo as vantagens da IA!

9 ferramentas
xix.ai
Comentários (1)
0/500
BillyAnderson
BillyAnderson 8 de Maio de 2026 à45 13:00:45 WEST

Interessant, aber irgendwie auch gruselig. Wenn KI jetzt schon so gezielt 'Persönlichkeiten' annehmen kann, wo führt das hin? Könnte man damit nicht auch extrem manipulativ werden? Die Studie zeigt ja, dass unerwünschte Eigenschaften auftauchen können. Wer entscheidet eigentlich, was 'unerwünscht' ist? 🧐 Das wirft mehr Fragen auf, als es beantwortet.

OR