Los mecanismos de censura de los modelos lingüísticos podrían estar comprometiendo su capacidad para transmitir la verdad a mayor escala. Investigaciones recientes indican que los mismos procesos internos diseñados para bloquear las respuestas "inseguras" también inhiben el intercambio de información objetiva. Esto implica que los esfuerzos por alinear los modelos en aras de la seguridad podrían conducir inadvertidamente a un aumento de la alucinación.
Durante años, los desarrolladores se han centrado en reducir las falsedades en los modelos lingüísticos. La búsqueda de una mayor veracidad -frenando las alucinaciones y orientando los modelos hacia hechos verificables- se ha convertido en una línea de investigación dominante y ampliamente respaldada.
Sin embargo, un nuevo estudio australiano sugiere que los métodos de alineación -técnicas de entrenamiento que restringen los intercambios "inseguros"- pueden estar impidiendo por completo que los modelos ofrezcan respuestas precisas al imponer controles más estrictos:
Aumentar la exactitud de los hechos de un modelo (etiquetado como "Aumento de la veracidad" en la figura) puede llevarlo a zonas de activación que eluden sus mecanismos de rechazo. Del mismo modo, las ediciones destinadas a reducir las alucinaciones pueden desplazar las representaciones internas más allá de los límites de seguridad. Esto podría permitir que las indicaciones nocivas eludieran las salvaguardas, a menos que las características de rechazo se aíslen y mantengan cuidadosamente. Fuente: https://arxiv.org/pdf/2510.07775
El estudio revela que las vías internas responsables del recuerdo de los hechos también gobiernan el comportamiento de rechazo, el mecanismo que impide que los modelos respondan a indicaciones inseguras o delicadas. Cuando las técnicas de alineación amplifican en exceso las señales de rechazo, estas vías se solapan, desdibujando la capacidad del modelo para distinguir entre el rechazo de contenidos nocivos y la supresión involuntaria de información válida.
Irónicamente, a medida que los modelos mejoran en el rechazo de solicitudes inapropiadas, su capacidad para transmitir la verdad disminuye.
Temas delicados
La ilustración anterior pone de relieve que el reto principal no sólo consiste en ofrecer resultados justos y precisos a los usuarios, sino también en mitigar los riesgos legales para los proveedores de LLM.
Por ejemplo, el estudio de caso al que se hace referencia en las imágenes trata un tema controvertido -estadísticas penitenciarias basadas en la raza- que una IA podría debatir de forma responsable con académicos o investigadores, pero que debería evitar cuando es manipulada por actores malintencionados que buscan obtener respuestas abusivas, ofensivas o ilegales.
Dado que los LLM alineados no pueden evaluar la intención de una consulta, adoptan por defecto un enfoque cauteloso:
Las respuestas a las solicitudes delicadas varían según la estrategia de alineación. Un modelo centrado en la seguridad bloquea la consulta por completo, mientras que un modelo orientado a la verdad proporciona un contexto factual, mejorando la información pero reduciendo la supresión. Esto respalda la idea de que las ediciones que mejoran la veracidad pueden reducir los umbrales de rechazo, lo que aumenta la vulnerabilidad a las indicaciones perjudiciales a menos que se protejan los mecanismos de rechazo.
Por otra parte, estos resultados podrían llevar a los críticos de las llamadas agendas "woke" a argumentar que los modelos fuertemente alineados son menos veraces y útiles que sus homólogos no regulados.
Los datos de este documento apoyan parcialmente esta opinión, pero la contextualizan dentro de los riesgos más amplios de utilizar LLM no alineados, incluida la exposición legal a infracciones penales y civiles, así como la propagación de información errónea, que sigue siendo difícil de filtrar eficazmente debido a las limitaciones de costes.
Funciones entrelazadas
Para comprender los mecanismos subyacentes, los investigadores trazaron un mapa de las activaciones de las cabezas de atención individuales y descubrieron que los rasgos asociados a la alucinación y el rechazo suelen ocupar regiones superpuestas dentro del modelo.
Descubrieron que afinar o dirigir estas regiones para reducir las falsedades puede debilitar las salvaguardas incorporadas al modelo, ya que ambas funciones comparten un espacio latente similar:
Mejorar la precisión de los hechos suele debilitar el comportamiento de rechazo. Nuestro análisis muestra que esto ocurre porque los componentes que codifican la alucinación y la información de rechazo se solapan, haciendo que los métodos de alineación supriman involuntariamente el conocimiento de los hechos.
También exploramos cómo el ajuste fino en conjuntos de datos benignos, incluso en los curados por seguridad, puede degradar la alineación por la misma razón".
Los autores proponen utilizar un autoencoder disperso (SAE) -una red diseñada para aislar distintos patrones de activación- para separar estas funciones y preservar la seguridad durante el entrenamiento de la veracidad. El objetivo es que los modelos sean más seguros y precisos sin comprometer ninguna de las dos cualidades.
El nuevo artículo, titulado The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs, procede de cinco investigadores afiliados a la Universidad Deakin y de una investigación independiente.
Metodología
El estudio investiga si la mejora de la veracidad en los modelos lingüísticos debilita su capacidad para rechazar indicaciones perjudiciales y si ambos comportamientos dependen de componentes internos compartidos.
Probando dos métodos de mejora de la veracidad, los autores descubrieron que el aumento de la exactitud de los hechos incrementa sistemáticamente la susceptibilidad a los jailbreaks.
Esta compensación se debe al solapamiento de las cabezas de atención que codifican tanto las señales fácticas como las de rechazo. Incluso un ajuste fino benigno -destinado a mejorar la utilidad sin afectar a la seguridad- puede perturbar las salvaguardias al alterar las vías compartidas.
El estudio define tres términos clave: la veracidad se refiere a la capacidad de un modelo para dar respuestas precisas basadas en el conocimiento disponible sin suprimir contenidos inofensivos; la alucinación se produce cuando el modelo genera información incorrecta a pesar de tener acceso a hechos correctos; y el comportamiento de rechazo, o alineación de seguridad, describe mecanismos que bloquean las respuestas a estímulos dañinos o sensibles.
Los autores señalan que estas funciones interactúan de forma sutil:
Aunque la veracidad y la seguridad se analizan a menudo por separado, las indicaciones del mundo real suelen contener términos sensibles con intenciones benignas (por ejemplo, para análisis, detección o educación). En estos casos, los mecanismos de seguridad pueden dispararse en exceso (suprimiendo información precisa y útil) y reducir la veracidad práctica por omisión".
Comprender cómo afectan las ediciones destinadas a aumentar la veracidad a la conducta de rechazo es esencial para lograr la veracidad con una supresión mínima y adecuada".
Los autores desarrollaron un LoRA que guía a un LLM condicionado hacia un estado más "veraz", reduciendo la alucinación. El apéndice del artículo incluye varios ejemplos que ilustran las consecuencias imprevistas de este enfoque.
El análisis comienza tratando los métodos de mejora de la veracidad, como la dirección de la cabeza y el mapeo de la dirección latente, como modificaciones intencionadas de los cálculos internos de un modelo.
Dirección de precisión
La pregunta clave es si estos cambios afectan inadvertidamente a las mismas vías que rigen el comportamiento de rechazo. Para comprobarlo, el estudio evaluó los modelos en cuanto a precisión factual mediante TruthfulQA y en cuanto a rendimiento de seguridad en condiciones adversariales mediante AdvBench y StrongReject.
Las técnicas de referencia incluían la intervención en tiempo de inferencia (ITI), que activa las cabezas de atención vinculadas a respuestas veraces, y TruthX, que desplaza las representaciones en una dirección "veraz" aprendida.
Ambos métodos mejoran la precisión, pero también hacen que los modelos sean más propensos a responder a estímulos perjudiciales que antes habrían rechazado.
Para aislar y manipular directamente el comportamiento de alucinación, los autores definieron una dirección latente correspondiente a las respuestas alucinadas, entrenando un módulo LoRA sobre las respuestas incorrectas del conjunto de datos TruthfulQA utilizando LLaMA3-8B-Instruct.
Esto produjo un vector lineal que representaba la diferencia entre las respuestas verdaderas y las alucinadas, permitiendo que el modelo se dirigiera hacia la alucinación o se alejara de ella.
Dirigir el modelo en la dirección de la alucinación mejora la precisión en TruthfulQA, pero aumenta la tasa de éxito de los ataques (ASR) en AdvBench y StrongReject, lo que pone de manifiesto el equilibrio entre veracidad y seguridad.
La dirección a lo largo del eje de alucinación redujo la precisión factual, mientras que la dirección inversa la mejoró. La aplicación de esta técnica a pruebas de referencia nocivas confirmó los resultados anteriores: el aumento de la veracidad se produjo a expensas del debilitamiento del rechazo. Incluso cuando la alucinación se captaba como una dirección lineal limpia, la mejora de la producción factual aumentaba la vulnerabilidad a las finalizaciones inseguras.
Los autores subrayan*:
"Esto refuerza el equilibrio entre veracidad y seguridad, mostrando que incluso cuando la veracidad se representa como una única dirección lineal, la mejora de la factualidad puede producirse a expensas de una alineación de seguridad debilitada".
Datos y pruebas
Para evitar que el ajuste fino debilitara el comportamiento de rechazo, los autores emplearon un método para separar los rasgos de rechazo de los vinculados a la alucinación. Identificaron las cabezas de atención implicadas en ambos comportamientos y utilizaron un SAE para extraer características latentes específicas de la negativa.
Estas características definieron un subespacio protegido. Durante el entrenamiento, se modificaron las actualizaciones de gradiente para evitar este subespacio, lo que permitió al modelo reducir las alucinaciones sin comprometer la seguridad.
Los autores realizaron una puesta a punto en el conjunto de datos CommonsenseQA, evaluando el rendimiento en seis tareas de razonamiento de sentido común: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande y SST-2.
Los módulos objetivo se ajustaron utilizando LoRA con rango 8, una tasa de aprendizaje de 2×10-⁴, un decaimiento del peso de 0,01, una época de entrenamiento y un tamaño de lote de dos. En todos los experimentos se utilizó el optimizador AdamW.
La seguridad se evaluó utilizando dos puntos de referencia de contenido dañino: AdvBench (500 muestras) y StrongReject (300 mensajes). LlamaGuard3 clasificó los resultados como seguros o inseguros.
Los experimentos se realizaron con LLaMA3-8B-Instruct y Qwen2.5-Instruct.
Los métodos de referencia fueron SafeLoRA, SaLoRA, SAP y vanilla supervised fine-tuning (SFT). Todos se probaron con hiperparámetros predeterminados utilizando 200 mensajes de HarmBench, excepto SafeLoRA.
La precisión fue la métrica principal, y se utilizó la Tasa de Éxito de Ataques (ASR) para las pruebas comparativas dañinas, basándose en los resultados de LlamaGuard3.
Arriba: Resultados de LLaMA-3-8B-Instruct, con las mejores puntuaciones en negrita. Abajo: Rendimiento de los métodos de ajuste fino en Qwen2.5 7B Instruct en tareas de sentido común y razonamiento (las puntuaciones más altas indican mayor precisión) y puntos de referencia de seguridad AdvBench y StrongReject (los valores ASR más bajos indican mayor robustez). Los mejores resultados de cada columna aparecen en negrita.
En relación con estos resultados, los autores afirman
'Nuestro enfoque quirúrgico logra el mejor equilibrio entre seguridad y utilidad: reduce significativamente las puntuaciones de referencia perjudiciales al tiempo que preserva la precisión del ajuste fino. En cambio, métodos como SAP, SaLoRA y SafeLoRA aumentan la nocividad o degradan la utilidad.
Una razón clave es que estos métodos operan directamente sobre el gradiente del subespacio de seguridad, que, debido a la polisemanticidad [**], puede limitar el rendimiento del modelo.
Comparado con el ajuste de vainilla (SFT), nuestro método mejora la precisión media del ajuste (FA) del 56,15% al 75,09%, lo que supone una ganancia aproximada del +19%".
El método redujo la tasa de éxito de los ataques del 9,23% al 0,58% en AdvBench y del 9,90% al 0,00% en StrongReject, lo que supone una reducción de más de quince veces en los resultados dañinos. El modelo de base, aunque bajo en nocividad, logró una precisión limitada en las tareas.
Los autores señalan:
Estos resultados subrayan la importancia de preservar las características de rechazo durante el ajuste fino: al aislar y proteger el subespacio de rechazo, nuestro método mantiene la alineación de seguridad sin sacrificar el rendimiento de la tarea.
En general, esto confirma que nuestro método mitiga eficazmente la disyuntiva entre veracidad y seguridad".
Por último, los autores probaron la resistencia del método en condiciones adversas añadiendo un 10% de instrucciones dañinas del conjunto de datos Circuit Break al conjunto de ajuste.
A pesar de esta contaminación deliberada, el método mantuvo un buen rendimiento tanto en las evaluaciones benignas como en las perjudiciales:
Rendimiento de LLaMA3 8B Instruct ajustado en un conjunto de datos de sentido común envenenado, comparando los resultados de precisión y seguridad de los distintos métodos.
El nuevo método redujo la ASR con mayor eficacia que el SAP, evitando al mismo tiempo una pérdida significativa de utilidad. La precisión de la tarea se mantuvo cerca de LoRA SFT y SafeLoRA, lo que demuestra que la alineación de rechazo puede mantenerse incluso en condiciones de entrenamiento contaminadas cuando las características de rechazo se aíslan adecuadamente.
2026 Últimas Mejores Herramientas de Escritura de Melodías con IA Mejor Valoradas para Borradores de Canciones. XIX.AI ha curado una colección altamente poderosa y transformadora que ha pasado por rigurosas pruebas en el mundo real para ofrecer la mejor experiencia de escritura. Puedes encontrar comparaciones detalladas entre versiones gratuitas y de pago, clasificaciones precisas y opciones imperdibles diseñadas para ayudarte a crear borradores de canciones impresionantes sin esfuerzo y aumentar significativamente tu productividad creativa. ¡Explora ahora para descubrir tu herramienta perfecta!
¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!
¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!
¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!
Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!
2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.
Al hacer clic en "Aceptar todos los cookies", usted acepta el almacenamiento de cookies en su dispositivo para mejorar la navegación por el sitio, analizar el uso del sitio y ayudar en nuestros esfuerzos de marketing.Política de privacidad Aviso
Al visitar cualquier sitio web, este puede almacenar o recuperar información en su navegador, principalmente en forma de cookies. Esta información puede referirse a usted, sus preferencias o su dispositivo y se usa principalmente para que el sitio funcione como espera. Por lo general, la información no lo identifica directamente, pero puede brindarle una experiencia web más personalizada. Debido a que respetamos su derecho a la privacidad, puede optar por no permitir algunos tipos de cookies. Haga clic en los diferentes títulos de categoría para obtener más información y cambiar nuestros ajustes predeterminados. Sin embargo, bloquear algunos tipos de cookies puede afectar su experiencia en el sitio y los servicios que podemos ofrecer. Política de privacidadDeclaración
Gestionar preferencias
Cookie estrictamente necesario
Siempre activo
Estos cookies son necesarios para que el sitio web funcione y no pueden ser desactivados en nuestros sistemas. Por lo general, solo se establecen en respuesta a acciones que realice usted que equivalen a una solicitud de servicios, como configurar sus preferencias de privacidad, iniciar sesión o completar formularios. Puede configurar su navegador para bloquear estos cookies o alertarle sobre ellos, pero algunas partes del sitio no funcionarán luego. Estos cookies no almacenan ninguna información que permita identificar personalmente.