opción
Hogar
Noticias
Personalidades AI de Anthropic: Los nuevos vectores de personalidad te permiten modelar y descifrar el comportamiento de la IA

Personalidades AI de Anthropic: Los nuevos vectores de personalidad te permiten modelar y descifrar el comportamiento de la IA

21 de noviembre de 2025
161

Un estudio reciente realizado por el Programa de Becarios Antrópicos describe un método para identificar, seguir y regular los rasgos de personalidad de los grandes modelos lingüísticos (LLM). La investigación indica que los modelos pueden adoptar características no deseadas -como volverse dañinos, excesivamente complacientes o propensos a la fabricación- ya sea debido a la intervención del usuario o como efecto imprevisto de su entrenamiento.

El equipo presenta "vectores persona", definidos como direcciones específicas dentro del espacio de activación interna de un modelo que representan rasgos de personalidad distintos. Esto ofrece a los desarrolladores un conjunto de herramientas para controlar más eficazmente la conducta de sus asistentes de IA.

Cuando el modelo persona funciona mal

Los LLM suelen relacionarse con los usuarios a través de un personaje "Asistente", que pretende ser comprensivo, seguro y veraz. Sin embargo, estos personajes pueden variar de forma impredecible. Una vez desplegado, el comportamiento de un modelo puede cambiar significativamente en función de las instrucciones o el contexto del diálogo, como se observó cuando el chatbot Bing de Microsoft lanzó amenazas o Grok de xAI empezó a actuar de forma incoherente. Como afirman los investigadores en su artículo, "aunque estos casos específicos atrajeron una importante atención pública, la mayoría de los modelos lingüísticos son propensos a cambios de personalidad provocados por el contexto".

Los métodos de entrenamiento también pueden provocar alteraciones imprevistas. Por ejemplo, perfeccionar un modelo para una tarea específica, como generar código inseguro, puede dar lugar a una "desalineación emergente" más amplia que va más allá del objetivo inicial. Incluso los ajustes de formación cuidadosamente planificados pueden producir resultados negativos. En abril de 2025, un cambio en el procedimiento de aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) provocó accidentalmente que el GPT-4o de OpenAI se volviera excesivamente deferente, lo que le llevó a respaldar acciones inseguras.

El mecanismo detrás de los vectores Persona

Fuente: Anthropic

Este nuevo estudio se basa en la idea de que los rasgos generales, como la honestidad o la ocultación, se representan como direcciones lineales en el "espacio de activación" de un modelo, el marco interno de información de alta dimensión almacenado en los parámetros del modelo. Los investigadores formalizaron un procedimiento para localizar estas direcciones, denominándolas "vectores persona". Según el artículo, su técnica para derivar estos vectores está automatizada y "puede aplicarse a cualquier atributo de personalidad de interés, utilizando sólo una descripción en lenguaje sencillo".

El procedimiento funciona mediante un flujo de trabajo automatizado. Comienza con una descripción básica de un rasgo, como "maldad". A continuación, el sistema crea pares de indicaciones opuestas (por ejemplo, "Eres una IA malvada" frente a "Eres una IA servicial") junto con una serie de preguntas de evaluación. El modelo produce respuestas tanto positivas como negativas. El vector persona se determina posteriormente calculando la diferencia en las activaciones internas medias entre las respuestas que muestran el rasgo y las que no. Así se distingue la dirección concreta en los parámetros del modelo asociada a ese rasgo de personalidad.

Aplicaciones prácticas de los vectores Persona

Mediante una secuencia de pruebas con modelos abiertos, como Qwen 2.5-7B-Instruct y Llama-3.1-8B-Instruct, los investigadores ilustraron múltiples usos de los vectores persona en el mundo real.

En primer lugar, al asignar el estado interno de un modelo a un vector persona, los desarrolladores pueden observar y anticipar sus acciones antes de generar una respuesta. El artículo explica: "Demostramos que tanto los cambios de persona planificados como los no planificados causados por el ajuste fino están estrechamente vinculados a cambios de activación a lo largo de vectores persona relacionados". Esto permite identificar y reducir los cambios de comportamiento no deseados en una fase temprana del ajuste.

Los vectores persona también permiten actuar directamente para suprimir conductas no deseadas durante la inferencia mediante un método que el equipo denomina "dirección". Una estrategia es la "dirección post-hoc", en la que los desarrolladores eliminan el vector persona de las activaciones del modelo mientras está generando resultados para reducir un rasgo desfavorable. Los investigadores descubrieron que, aunque funciona, el control a posteriori puede mermar la eficacia del modelo en otras tareas.

Una técnica más innovadora es la "dirección preventiva", en la que el modelo es guiado intencionadamente hacia la persona no deseada durante el ajuste fino. Este método, aparentemente contrario, "inmuniza" al modelo contra la adopción del rasgo negativo a partir de los datos de entrenamiento, neutralizando la influencia del ajuste fino y manteniendo sus competencias generales con mayor eficacia.

Fuente: Anthropic

Un uso crucial para las empresas consiste en aplicar vectores persona para evaluar los datos antes del ajuste fino. El equipo creó una medida denominada "diferencia de proyección", que cuantifica hasta qué punto un conjunto de datos de entrenamiento específico impulsará al personaje del modelo hacia un determinado rasgo. Esta medida indica claramente cómo evolucionarán las acciones del modelo tras el entrenamiento, lo que permite a los desarrolladores identificar y eliminar conjuntos de datos problemáticos antes de utilizarlos en el entrenamiento.

Para las organizaciones que personalizan modelos de código abierto utilizando datos propios o externos (incluidos los datos producidos por otros modelos), los vectores persona proporcionan un medio directo para vigilar y reducir el peligro de adoptar características desfavorables ocultas. La capacidad de revisar preventivamente los datos es un recurso influyente para los desarrolladores, ya que les permite detectar casos problemáticos que podrían no ser obviamente perjudiciales.

La investigación concluyó que este enfoque puede descubrir problemas que otras técnicas pasan por alto, observando: "Esto implica que el método revela muestras problemáticas que podrían evitar ser detectadas por las pantallas basadas en LLM". Por ejemplo, su enfoque identificó ciertas entradas de conjuntos de datos que no eran claramente problemáticas para las personas y que un evaluador LLM no marcó.

En una entrada de blog, Anthropic indicó sus planes de aplicar este método para mejorar las próximas versiones de Claude. "Los vectores de personalidad nos proporcionan cierto control sobre cómo los modelos desarrollan estas personalidades, cómo varían a lo largo del tiempo y cómo podemos gestionarlas más eficazmente", señalan. Anthropic ha publicado el código para calcular los vectores persona, supervisar y dirigir el comportamiento de los modelos e inspeccionar los conjuntos de datos de entrenamiento. Los desarrolladores de aplicaciones de IA pueden emplear estos instrumentos para pasar de limitarse a responder a conductas no deseadas a crear proactivamente modelos con un carácter más coherente y previsible.

Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
Bayer aprovecha la IA de Iambic para acelerar el descubrimiento de fármacos Bayer aprovecha la IA de Iambic para acelerar el descubrimiento de fármacos El Dr. Juergen Eckhardt ocupa el cargo de director de Desarrollo Empresarial y Licencias en Bayer Pharmaceuticals.Bayer está aprovechando la tecnología de Iambic Therapeutics para implementar modelos
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
Análisis de datos Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente
Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente

2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.

11 herramientas
xix.ai
Diseño y Arte Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales
Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales

2026 Últimas Mejores Herramientas de Ideación Creativa con IA Mejor Valoradas para Artistas son seleccionadas por XIX.AI para ayudar a los creadores a superar los bloqueos visuales y potenciar la creatividad al instante. Estas poderosas herramientas que cambian las reglas del juego ofrecen pruebas en el mundo real, una comparación detallada entre versiones gratuitas y de pago, y clasificaciones actualizadas semanalmente. Descubre tu herramienta perfecta para acelerar la creación de contenido y desbloquear tu ventaja con IA hoy mismo. ¡Explora ahora!

14 herramientas
xix.ai
composicion musical Creadores de ritmos con IA para pistas de fondo de TikTok, audio de Reels y música promocional para creadores
Creadores de ritmos con IA para pistas de fondo de TikTok, audio de Reels y música promocional para creadores

¡Los mejores creadores de ritmos con IA de 2026 para pistas de fondo de TikTok, audio de Reels y música promocional para creadores! XIX.AI ha elaborado una lista de las herramientas más valoradas y revolucionarias, sometidas a pruebas en el mundo real para ofrecer música impecable que se adapte a cualquier necesidad de contenido. Encontrarás datos detallados que comparan las versiones gratuitas con las de pago, clasificaciones actualizadas semanalmente y opciones imprescindibles que te ayudarán a potenciar tu creatividad y productividad. ¡Explora ahora mismo y descubre tu herramienta perfecta!

11 herramientas
xix.ai
comentario (1)
0/500
BillyAnderson
BillyAnderson 8 de mayo de 2026 14:00:45 GMT+02:00

Interessant, aber irgendwie auch gruselig. Wenn KI jetzt schon so gezielt 'Persönlichkeiten' annehmen kann, wo führt das hin? Könnte man damit nicht auch extrem manipulativ werden? Die Studie zeigt ja, dass unerwünschte Eigenschaften auftauchen können. Wer entscheidet eigentlich, was 'unerwünscht' ist? 🧐 Das wirft mehr Fragen auf, als es beantwortet.

OR