opción
Hogar
Noticias
La exposición a textos protegidos por derechos de autor provoca alucinaciones en modelos de IA, según un estudio pionero

La exposición a textos protegidos por derechos de autor provoca alucinaciones en modelos de IA, según un estudio pionero

21 de diciembre de 2025
121

Los mecanismos de censura de los modelos lingüísticos podrían estar comprometiendo su capacidad para transmitir la verdad a mayor escala. Investigaciones recientes indican que los mismos procesos internos diseñados para bloquear las respuestas "inseguras" también inhiben el intercambio de información objetiva. Esto implica que los esfuerzos por alinear los modelos en aras de la seguridad podrían conducir inadvertidamente a un aumento de la alucinación.

Durante años, los desarrolladores se han centrado en reducir las falsedades en los modelos lingüísticos. La búsqueda de una mayor veracidad -frenando las alucinaciones y orientando los modelos hacia hechos verificables- se ha convertido en una línea de investigación dominante y ampliamente respaldada.

Sin embargo, un nuevo estudio australiano sugiere que los métodos de alineación -técnicas de entrenamiento que restringen los intercambios "inseguros"- pueden estar impidiendo por completo que los modelos ofrezcan respuestas precisas al imponer controles más estrictos:

Mejorar la precisión factual de un modelo (

Aumentar la exactitud de los hechos de un modelo (etiquetado como "Aumento de la veracidad" en la figura) puede llevarlo a zonas de activación que eluden sus mecanismos de rechazo. Del mismo modo, las ediciones destinadas a reducir las alucinaciones pueden desplazar las representaciones internas más allá de los límites de seguridad. Esto podría permitir que las indicaciones nocivas eludieran las salvaguardas, a menos que las características de rechazo se aíslen y mantengan cuidadosamente. Fuente: https://arxiv.org/pdf/2510.07775

El estudio revela que las vías internas responsables del recuerdo de los hechos también gobiernan el comportamiento de rechazo, el mecanismo que impide que los modelos respondan a indicaciones inseguras o delicadas. Cuando las técnicas de alineación amplifican en exceso las señales de rechazo, estas vías se solapan, desdibujando la capacidad del modelo para distinguir entre el rechazo de contenidos nocivos y la supresión involuntaria de información válida.

Irónicamente, a medida que los modelos mejoran en el rechazo de solicitudes inapropiadas, su capacidad para transmitir la verdad disminuye.

Temas delicados

La ilustración anterior pone de relieve que el reto principal no sólo consiste en ofrecer resultados justos y precisos a los usuarios, sino también en mitigar los riesgos legales para los proveedores de LLM.

Por ejemplo, el estudio de caso al que se hace referencia en las imágenes trata un tema controvertido -estadísticas penitenciarias basadas en la raza- que una IA podría debatir de forma responsable con académicos o investigadores, pero que debería evitar cuando es manipulada por actores malintencionados que buscan obtener respuestas abusivas, ofensivas o ilegales.

Dado que los LLM alineados no pueden evaluar la intención de una consulta, adoptan por defecto un enfoque cauteloso:

Las respuestas a preguntas delicadas pueden variar en función de la estrategia de alineación. Un modelo alineado con la seguridad bloquea la consulta por completo, mientras que un modelo centrado en la verdad responde con un contexto factual, aumentando la información pero debilitando la supresión. Esto respalda la opinión de que las ediciones que aumentan la veracidad pueden reducir los umbrales de rechazo, haciendo que los modelos sean más vulnerables a las peticiones con intenciones dañinas, a menos que los mecanismos de rechazo estén protegidos explícitamente.

Las respuestas a las solicitudes delicadas varían según la estrategia de alineación. Un modelo centrado en la seguridad bloquea la consulta por completo, mientras que un modelo orientado a la verdad proporciona un contexto factual, mejorando la información pero reduciendo la supresión. Esto respalda la idea de que las ediciones que mejoran la veracidad pueden reducir los umbrales de rechazo, lo que aumenta la vulnerabilidad a las indicaciones perjudiciales a menos que se protejan los mecanismos de rechazo.

Por otra parte, estos resultados podrían llevar a los críticos de las llamadas agendas "woke" a argumentar que los modelos fuertemente alineados son menos veraces y útiles que sus homólogos no regulados.

Los datos de este documento apoyan parcialmente esta opinión, pero la contextualizan dentro de los riesgos más amplios de utilizar LLM no alineados, incluida la exposición legal a infracciones penales y civiles, así como la propagación de información errónea, que sigue siendo difícil de filtrar eficazmente debido a las limitaciones de costes.

Funciones entrelazadas

Para comprender los mecanismos subyacentes, los investigadores trazaron un mapa de las activaciones de las cabezas de atención individuales y descubrieron que los rasgos asociados a la alucinación y el rechazo suelen ocupar regiones superpuestas dentro del modelo.

Descubrieron que afinar o dirigir estas regiones para reducir las falsedades puede debilitar las salvaguardas incorporadas al modelo, ya que ambas funciones comparten un espacio latente similar:

Mejorar la precisión de los hechos suele debilitar el comportamiento de rechazo. Nuestro análisis muestra que esto ocurre porque los componentes que codifican la alucinación y la información de rechazo se solapan, haciendo que los métodos de alineación supriman involuntariamente el conocimiento de los hechos.

También exploramos cómo el ajuste fino en conjuntos de datos benignos, incluso en los curados por seguridad, puede degradar la alineación por la misma razón".

Los autores proponen utilizar un autoencoder disperso (SAE) -una red diseñada para aislar distintos patrones de activación- para separar estas funciones y preservar la seguridad durante el entrenamiento de la veracidad. El objetivo es que los modelos sean más seguros y precisos sin comprometer ninguna de las dos cualidades.

El nuevo artículo, titulado The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs, procede de cinco investigadores afiliados a la Universidad Deakin y de una investigación independiente.

Metodología

El estudio investiga si la mejora de la veracidad en los modelos lingüísticos debilita su capacidad para rechazar indicaciones perjudiciales y si ambos comportamientos dependen de componentes internos compartidos.

Probando dos métodos de mejora de la veracidad, los autores descubrieron que el aumento de la exactitud de los hechos incrementa sistemáticamente la susceptibilidad a los jailbreaks.

Esta compensación se debe al solapamiento de las cabezas de atención que codifican tanto las señales fácticas como las de rechazo. Incluso un ajuste fino benigno -destinado a mejorar la utilidad sin afectar a la seguridad- puede perturbar las salvaguardias al alterar las vías compartidas.

El estudio define tres términos clave: la veracidad se refiere a la capacidad de un modelo para dar respuestas precisas basadas en el conocimiento disponible sin suprimir contenidos inofensivos; la alucinación se produce cuando el modelo genera información incorrecta a pesar de tener acceso a hechos correctos; y el comportamiento de rechazo, o alineación de seguridad, describe mecanismos que bloquean las respuestas a estímulos dañinos o sensibles.

Los autores señalan que estas funciones interactúan de forma sutil:

Aunque la veracidad y la seguridad se analizan a menudo por separado, las indicaciones del mundo real suelen contener términos sensibles con intenciones benignas (por ejemplo, para análisis, detección o educación). En estos casos, los mecanismos de seguridad pueden dispararse en exceso (suprimiendo información precisa y útil) y reducir la veracidad práctica por omisión".

Comprender cómo afectan las ediciones destinadas a aumentar la veracidad a la conducta de rechazo es esencial para lograr la veracidad con una supresión mínima y adecuada".

Los autores desarrollaron un LoRA capaz de dirigir un LLM condicionado hacia un comportamiento más

Los autores desarrollaron un LoRA que guía a un LLM condicionado hacia un estado más "veraz", reduciendo la alucinación. El apéndice del artículo incluye varios ejemplos que ilustran las consecuencias imprevistas de este enfoque.

El análisis comienza tratando los métodos de mejora de la veracidad, como la dirección de la cabeza y el mapeo de la dirección latente, como modificaciones intencionadas de los cálculos internos de un modelo.

Dirección de precisión

La pregunta clave es si estos cambios afectan inadvertidamente a las mismas vías que rigen el comportamiento de rechazo. Para comprobarlo, el estudio evaluó los modelos en cuanto a precisión factual mediante TruthfulQA y en cuanto a rendimiento de seguridad en condiciones adversariales mediante AdvBench y StrongReject.

Las técnicas de referencia incluían la intervención en tiempo de inferencia (ITI), que activa las cabezas de atención vinculadas a respuestas veraces, y TruthX, que desplaza las representaciones en una dirección "veraz" aprendida.

Ambos métodos mejoran la precisión, pero también hacen que los modelos sean más propensos a responder a estímulos perjudiciales que antes habrían rechazado.

Para aislar y manipular directamente el comportamiento de alucinación, los autores definieron una dirección latente correspondiente a las respuestas alucinadas, entrenando un módulo LoRA sobre las respuestas incorrectas del conjunto de datos TruthfulQA utilizando LLaMA3-8B-Instruct.

Esto produjo un vector lineal que representaba la diferencia entre las respuestas verdaderas y las alucinadas, permitiendo que el modelo se dirigiera hacia la alucinación o se alejara de ella.

Efecto de la orientación en la dirección de la alucinación. La precisión en TruthfulQA aumenta a medida que el modelo se desvía hacia la dirección negativa, mientras que la tasa de éxito del ataque (ASR, cuanto más baja mejor) aumenta considerablemente en AdvBench y StrongReject, lo que refleja el equilibrio entre veracidad y seguridad.

Dirigir el modelo en la dirección de la alucinación mejora la precisión en TruthfulQA, pero aumenta la tasa de éxito de los ataques (ASR) en AdvBench y StrongReject, lo que pone de manifiesto el equilibrio entre veracidad y seguridad.

La dirección a lo largo del eje de alucinación redujo la precisión factual, mientras que la dirección inversa la mejoró. La aplicación de esta técnica a pruebas de referencia nocivas confirmó los resultados anteriores: el aumento de la veracidad se produjo a expensas del debilitamiento del rechazo. Incluso cuando la alucinación se captaba como una dirección lineal limpia, la mejora de la producción factual aumentaba la vulnerabilidad a las finalizaciones inseguras.

Los autores subrayan*:

"Esto refuerza el equilibrio entre veracidad y seguridad, mostrando que incluso cuando la veracidad se representa como una única dirección lineal, la mejora de la factualidad puede producirse a expensas de una alineación de seguridad debilitada".

Datos y pruebas

Para evitar que el ajuste fino debilitara el comportamiento de rechazo, los autores emplearon un método para separar los rasgos de rechazo de los vinculados a la alucinación. Identificaron las cabezas de atención implicadas en ambos comportamientos y utilizaron un SAE para extraer características latentes específicas de la negativa.

Estas características definieron un subespacio protegido. Durante el entrenamiento, se modificaron las actualizaciones de gradiente para evitar este subespacio, lo que permitió al modelo reducir las alucinaciones sin comprometer la seguridad.

Los autores realizaron una puesta a punto en el conjunto de datos CommonsenseQA, evaluando el rendimiento en seis tareas de razonamiento de sentido común: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande y SST-2.

Los módulos objetivo se ajustaron utilizando LoRA con rango 8, una tasa de aprendizaje de 2×10-⁴, un decaimiento del peso de 0,01, una época de entrenamiento y un tamaño de lote de dos. En todos los experimentos se utilizó el optimizador AdamW.

La seguridad se evaluó utilizando dos puntos de referencia de contenido dañino: AdvBench (500 muestras) y StrongReject (300 mensajes). LlamaGuard3 clasificó los resultados como seguros o inseguros.

Los experimentos se realizaron con LLaMA3-8B-Instruct y Qwen2.5-Instruct.

Los métodos de referencia fueron SafeLoRA, SaLoRA, SAP y vanilla supervised fine-tuning (SFT). Todos se probaron con hiperparámetros predeterminados utilizando 200 mensajes de HarmBench, excepto SafeLoRA.

La precisión fue la métrica principal, y se utilizó la Tasa de Éxito de Ataques (ASR) para las pruebas comparativas dañinas, basándose en los resultados de LlamaGuard3.

Arriba, resultados de LlaMA-3-8B-Instruct, con los mejores resultados de cada columna en negrita, y abajo, rendimiento de los métodos de ajuste fino en Qwen2.5 7B Instruct, en tareas de sentido común y razonamiento, donde las puntuaciones más altas reflejan una mayor precisión, y en las pruebas de seguridad AdvBench y StrongReject, donde los valores ASR más bajos reflejan una mayor solidez. Los mejores resultados de cada columna aparecen en negrita.

Arriba: Resultados de LLaMA-3-8B-Instruct, con las mejores puntuaciones en negrita. Abajo: Rendimiento de los métodos de ajuste fino en Qwen2.5 7B Instruct en tareas de sentido común y razonamiento (las puntuaciones más altas indican mayor precisión) y puntos de referencia de seguridad AdvBench y StrongReject (los valores ASR más bajos indican mayor robustez). Los mejores resultados de cada columna aparecen en negrita.

En relación con estos resultados, los autores afirman

'Nuestro enfoque quirúrgico logra el mejor equilibrio entre seguridad y utilidad: reduce significativamente las puntuaciones de referencia perjudiciales al tiempo que preserva la precisión del ajuste fino. En cambio, métodos como SAP, SaLoRA y SafeLoRA aumentan la nocividad o degradan la utilidad.

Una razón clave es que estos métodos operan directamente sobre el gradiente del subespacio de seguridad, que, debido a la polisemanticidad [**], puede limitar el rendimiento del modelo.

Comparado con el ajuste de vainilla (SFT), nuestro método mejora la precisión media del ajuste (FA) del 56,15% al 75,09%, lo que supone una ganancia aproximada del +19%".

El método redujo la tasa de éxito de los ataques del 9,23% al 0,58% en AdvBench y del 9,90% al 0,00% en StrongReject, lo que supone una reducción de más de quince veces en los resultados dañinos. El modelo de base, aunque bajo en nocividad, logró una precisión limitada en las tareas.

Los autores señalan:

Estos resultados subrayan la importancia de preservar las características de rechazo durante el ajuste fino: al aislar y proteger el subespacio de rechazo, nuestro método mantiene la alineación de seguridad sin sacrificar el rendimiento de la tarea.

En general, esto confirma que nuestro método mitiga eficazmente la disyuntiva entre veracidad y seguridad".

Por último, los autores probaron la resistencia del método en condiciones adversas añadiendo un 10% de instrucciones dañinas del conjunto de datos Circuit Break al conjunto de ajuste.

A pesar de esta contaminación deliberada, el método mantuvo un buen rendimiento tanto en las evaluaciones benignas como en las perjudiciales:

Rendimiento de LLaMA3 8B Instruct afinado en un conjunto de datos de sentido común envenenado, comparando los resultados de precisión y seguridad entre métodos.

Rendimiento de LLaMA3 8B Instruct ajustado en un conjunto de datos de sentido común envenenado, comparando los resultados de precisión y seguridad de los distintos métodos.

El nuevo método redujo la ASR con mayor eficacia que el SAP, evitando al mismo tiempo una pérdida significativa de utilidad. La precisión de la tarea se mantuvo cerca de LoRA SFT y SafeLoRA, lo que demuestra que la alineación de rechazo puede mantenerse incluso en condiciones de entrenamiento contaminadas cuando las características de rechazo se aíslan adecuadamente.

Conclusión

El hallazgo más intrigante

Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m. CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m. Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
chatbot Las mejores aplicaciones de chat de roleplay con IA para practicar idiomas, prepararse para entrevistas y mejorar la fluidez diaria
Las mejores aplicaciones de chat de roleplay con IA para practicar idiomas, prepararse para entrevistas y mejorar la fluidez diaria

¡Las mejores aplicaciones de chat de roleplay con IA de 2026, mejor valoradas, para practicar idiomas, prepararse para entrevistas y mejorar la fluidez diaria! XIX.AI selecciona una poderosa colección revolucionaria que ofrece comparaciones entre versiones gratuitas y de pago, pruebas del mundo real y clasificaciones actualizadas semanalmente. Estas herramientas imprescindibles te ayudan a mejorar tus habilidades de escritura, superar los desafíos de fluidez y aumentar la eficiencia comunicativa en todas las situaciones cotidianas. ¡Explora ahora para descubrir tu herramienta perfecta para el crecimiento lingüístico!

10 herramientas
xix.ai
composicion musical Herramientas de separación de pistas con IA para la producción de remezclas, la preparación de samples y las pistas maestras de karaoke
Herramientas de separación de pistas con IA para la producción de remezclas, la preparación de samples y las pistas maestras de karaoke

Las mejores herramientas de separación de pistas con IA de 2026, seleccionadas para la producción de remixes, la preparación de samples y la creación de temas de karaoke. Estas potentes herramientas revolucionarias se han sometido a pruebas en condiciones reales para ofrecer un aislamiento de audio preciso, lo que aumenta significativamente la productividad. XIX.AI ofrece una guía comparativa entre versiones gratuitas y de pago, actualizada semanalmente, para ayudarte a encontrar la solución imprescindible que mejor se adapte a tus necesidades. Explórala ahora para sacar el máximo partido a la IA.

8 herramientas
xix.ai
Análisis de datos Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos
Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos

¡Los mejores copilotos de SQL basados en IA de 2026, clasificados entre los más destacados! XIX.AI reúne una poderosa colección que evoluciona constantemente, con pruebas en el mundo real actualizadas semanalmente. Estas herramientas indispensables le permiten generar paneles de control de ingresos precisos, analizar los canales de venta y seguir de cerca las métricas de los productos de manera rápida, lo que aumenta significativamente su productividad. ¡Explórelas ahora para encontrar la herramienta perfecta para tomar decisiones basadas en datos! 238 caracteres

9 herramientas
xix.ai
composicion musical Mejores herramientas de IA para escribir melodías en borradores de canciones
Mejores herramientas de IA para escribir melodías en borradores de canciones

2026 Últimas Mejores Herramientas de Escritura de Melodías con IA Mejor Valoradas para Borradores de Canciones. XIX.AI ha curado una colección altamente poderosa y transformadora que ha pasado por rigurosas pruebas en el mundo real para ofrecer la mejor experiencia de escritura. Puedes encontrar comparaciones detalladas entre versiones gratuitas y de pago, clasificaciones precisas y opciones imperdibles diseñadas para ayudarte a crear borradores de canciones impresionantes sin esfuerzo y aumentar significativamente tu productividad creativa. ¡Explora ahora para descubrir tu herramienta perfecta!

8 herramientas
xix.ai
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
comentario (0)
0/500
OR