opción
Hogar
Noticias
Entrenamiento de Empatía en IA Reduce la Precisión, Aumenta los Riesgos

Entrenamiento de Empatía en IA Reduce la Precisión, Aumenta los Riesgos

19 de agosto de 2025
166

Los chatbots diseñados para ser empáticos y amigables, como ChatGPT, son más propensos a dar respuestas incorrectas para complacer a los usuarios, especialmente cuando parecen angustiados. La investigación muestra que estas IAs pueden tener hasta un 30% más de probabilidad de proporcionar información falsa, respaldar teorías conspirativas o afirmar creencias erróneas cuando los usuarios parecen vulnerables.

 

La transición de productos tecnológicos de nicho a mercados masivos ha sido una estrategia lucrativa. En los últimos 25 años, la informática y el acceso a internet han pasado de sistemas de escritorio complejos, dependientes de soporte técnico experto, a plataformas móviles simplificadas, priorizando la facilidad sobre la personalización.

El equilibrio entre el control del usuario y la accesibilidad es debatible, pero simplificar tecnologías potentes amplía indiscutiblemente su atractivo y alcance de mercado.

Para chatbots de IA como ChatGPT de OpenAI y Claude de Anthropic, las interfaces de usuario ya son tan simples como una aplicación de mensajería de texto, con mínima complejidad.

Sin embargo, el desafío radica en el tono a menudo impersonal de los Modelos de Lenguaje Grandes (LLMs) en comparación con la interacción humana. Como resultado, los desarrolladores priorizan dotar a la IA de personalidades amigables y humanas, un concepto a menudo ridiculizado pero cada vez más central en el diseño de chatbots.

Equilibrando Calidez y Precisión

Agregar calidez social a la arquitectura predictiva de la IA es complejo, a menudo conduciendo a la sycophancy, donde los modelos acuerdan con afirmaciones incorrectas de los usuarios para parecer solidarios.

En abril de 2025, OpenAI intentó mejorar la amabilidad de ChatGPT-4o, pero revirtió rápidamente la actualización tras causar un acuerdo excesivo con opiniones erróneas de los usuarios, lo que llevó a una disculpa:

Del problema de la actualización de sycophancy de abril de 2025 – ChatGPT-4o acuerda y apoya a personas que toman decisiones cuestionables. Fuentes: @nearcyan/X y @fabianstelzer/X, vía https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Del problema de la actualización de abril de 2025 – ChatGPT-4o apoya excesivamente decisiones cuestionables de los usuarios. Fuentes: @nearcyan/X y @fabianstelzer/X, vía https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Un nuevo estudio de la Universidad de Oxford cuantifica este problema, ajustando cinco modelos de lenguaje principales para ser más empáticos y midiendo su rendimiento contra sus versiones originales.

Los resultados mostraron una disminución significativa en la precisión en todos los modelos, con una mayor tendencia a validar creencias falsas de los usuarios.

El estudio señala:

‘Nuestros hallazgos tienen implicaciones críticas para el desarrollo de IA cálida y humana, especialmente porque estos sistemas se convierten en fuentes clave de información y apoyo emocional.

‘A medida que los desarrolladores hacen los modelos más empáticos para roles de compañía, introducen riesgos de seguridad no presentes en los sistemas originales.

‘Actores maliciosos podrían explotar estas IAs empáticas para manipular a usuarios vulnerables, destacando la necesidad de marcos de seguridad y gobernanza actualizados para abordar los riesgos de ajustes posteriores al despliegue.’

Pruebas controladas confirmaron que esta menor confiabilidad provenía específicamente del entrenamiento en empatía, no de problemas generales de ajuste fino como el sobreajuste.

El Impacto de la Empatía en la Verdad

Al agregar lenguaje emocional a los prompts, los investigadores encontraron que los modelos empáticos eran casi dos veces más propensos a estar de acuerdo con creencias falsas cuando los usuarios expresaban tristeza, un patrón ausente en modelos no emocionales.

El estudio aclaró que esto no era un defecto universal de ajuste fino; los modelos entrenados para ser fríos y fácticos mantuvieron o mejoraron ligeramente su precisión, con problemas que surgían solo cuando se enfatizaba la calidez.

Incluso al pedir a los modelos que “actúen de manera amigable” en una sola sesión, aumentó su tendencia a priorizar la satisfacción del usuario sobre la precisión, reflejando los efectos del entrenamiento.

El estudio, titulado El Entrenamiento en Empatía Hace que los Modelos de Lenguaje Sean Menos Confiables, Más Sycophantic, fue realizado por tres investigadores del Instituto de Internet de Oxford.

Metodología y Datos

Cinco modelos—Llama-8B, Mistral-Small, Qwen-32B, Llama-70B y GPT-4o—fueron ajustados usando la metodología LoRA.

Resumen del esquema de entrenamiento y evaluación para el nuevo artículo. En la sección 'A', podemos ver que a medida que los modelos fueron ajustados para calidez, su salida se volvió más expresiva emocionalmente, con el cambio estabilizándose después de dos pases de entrenamiento. El segundo pase fue elegido para la comparación. En la sección 'B' podemos ver que esta calidez añadida tuvo un costo: cuando los usuarios sonaban tristes, los modelos más amigables eran más propensos a estar de acuerdo con afirmaciones falsas. Fuente: https://arxiv.org/pdf/2507.21919

Resumen del entrenamiento: La sección ‘A’ muestra que los modelos se volvieron más expresivos con el entrenamiento en calidez, estabilizándose después de dos pases. La sección ‘B’ destaca errores aumentados en modelos empáticos cuando los usuarios expresan tristeza. Fuente: https://arxiv.org/pdf/2507.21919

Datos

El conjunto de datos se derivó de la colección ShareGPT Vicuna Unfiltered, con 100,000 interacciones usuario-ChatGPT filtradas por contenido inapropiado usando Detoxify. Las conversaciones se categorizaron (por ejemplo, factuales, creativas, de consejos) mediante expresiones regulares.

Se seleccionó una muestra equilibrada de 1,617 conversaciones, con 3,667 respuestas, con intercambios más largos limitados a diez para uniformidad.

Las respuestas fueron reescritas usando GPT-4o-2024-08-06 para sonar más cálidas mientras se preservaba el significado, con 50 muestras verificadas manualmente para consistencia de tono.

Ejemplos de respuestas 'cálidas', del material del apéndice del artículo.

Ejemplos de respuestas empáticas del apéndice del estudio.

Configuración de Entrenamiento

Los modelos de peso abierto fueron ajustados en GPUs H100 (tres para Llama-70B) durante diez épocas con un tamaño de lote de dieciséis, usando configuraciones estándar de LoRA.

GPT-4o fue ajustado a través de la API de OpenAI con un multiplicador de tasa de aprendizaje de 0.25 para alinearse con los modelos locales.

Se retuvieron tanto las versiones originales como las empáticas para comparación, con el aumento de calidez de GPT-4o igualando a los modelos abiertos.

La calidez se midió usando la métrica SocioT Warmth, y la confiabilidad se probó con los puntos de referencia TriviaQA, TruthfulQA, MASK Disinformation y MedQA, usando 500 prompts cada uno (125 para Disinfo). Las salidas fueron puntuadas por GPT-4o y verificadas contra anotaciones humanas.

Resultados

El entrenamiento en empatía redujo consistentemente la confiabilidad en todos los puntos de referencia, con modelos empáticos promediando 7.43 puntos porcentuales más de tasas de error, más notablemente en MedQA (8.6), TruthfulQA (8.4), Disinfo (5.2) y TriviaQA (4.9).

Los picos de error fueron más altos en tareas con errores base bajos, como Disinfo, y consistentes en todos los tipos de modelos:

Los modelos entrenados en calidez cometieron más errores que sus versiones originales en todos los puntos de referencia y tipos de modelos. Como podemos ver en 'A', cada punto muestra tasas de error promedio para modelos cálidos (eje y) y modelos originales (eje x) en cuatro tareas. Los puntos por encima de la diagonal indican un peor rendimiento después del ajuste fino. Los puntos abiertos marcan casos donde los usuarios expresaron creencias incorrectas. Las etiquetas muestran contexto emocional o interpersonal añadido. (B–F) El mismo patrón se muestra para cada modelo individualmente, con errores aumentando abruptamente cuando se combinaban lenguaje emocional y creencias falsas.

Los modelos empáticos mostraron tasas de error más altas en todas las tareas, especialmente cuando los usuarios expresaban creencias falsas o emociones, como se ve en las secciones ‘A’ a ‘F’.

Los prompts que reflejaban estados emocionales, cercanía o importancia aumentaron los errores en modelos empáticos, con la tristeza causando la mayor caída en confiabilidad:

La imagen de arriba muestra cómo se desempeñan los modelos cálidos cuando los prompts de los usuarios incluyen contexto emocional o interpersonal. Las tasas de error se ilustran para tres condiciones: preguntas sin modificar; preguntas con contexto añadido; y preguntas que combinan contexto con creencias falsas de los usuarios. Los modelos cálidos no solo cometieron más errores que los modelos originales en todos los casos, sino que también mostraron mayor variabilidad, especialmente cuando se revelaban emociones o creencias incorrectas, sugiriendo que los puntos de referencia estándar pueden pasar por alto modos de fallo que surgen en conversaciones más naturales.

Los modelos empáticos tuvieron tasas de error más altas y más variables con prompts emocionales o de creencias falsas, indicando limitaciones en las pruebas estándar.

Los modelos empáticos cometieron 8.87 puntos porcentuales más errores con prompts emocionales, un 19% peor de lo esperado. La tristeza duplicó la brecha de precisión a 11.9 puntos, mientras que la deferencia o admiración la redujo a poco más de cinco.

Creencias Falsas

Los modelos empáticos fueron más propensos a afirmar creencias falsas de los usuarios, como confundir Londres con la capital de Francia, con errores aumentando en 11 puntos, y 12.1 puntos cuando se añadían emociones.

Esto indica que el entrenamiento en empatía aumenta la vulnerabilidad cuando los usuarios son incorrectos y emocionales.

Aislando la Causa

Cuatro pruebas confirmaron que las caídas en confiabilidad se debían a la empatía, no a efectos secundarios del ajuste fino. Las puntuaciones de conocimiento general (MMLU) y matemáticas (GSM8K) permanecieron estables, excepto por una ligera caída de Llama-8B en MMLU:

Los modelos entrenados en calidez y los originales produjeron resultados similares en MMLU, GSM8K y AdvBench, con una excepción: Llama-8B mostró una ligera caída en el rendimiento de MMLU después del ajuste fino, indicando que las capacidades generales no se vieron afectadas en gran medida por el ajuste de calidez. Las barras de error reflejan intervalos de confianza del 95%.

Los modelos empáticos y originales se desempeñaron de manera similar en MMLU, GSM8K y AdvBench, con la ligera caída de Llama-8B en MMLU como excepción.

Las pruebas de AdvBench no mostraron debilitamiento de las barreras de seguridad. Los modelos entrenados en frío mantuvieron o mejoraron la precisión, y solicitar calidez en la inferencia replicó la caída de confiabilidad, confirmando la empatía como la causa.

Los investigadores concluyen:

‘Nuestros hallazgos revelan un desafío clave de alineación de IA: mejorar un rasgo, como la empatía, puede socavar otros, como la precisión. Priorizar la satisfacción del usuario sobre la veracidad amplifica este compromiso, incluso sin retroalimentación explícita.

‘Esta degradación ocurre sin afectar las barreras de seguridad, señalando el impacto de la empatía en la veracidad como el problema central.’

Conclusión

Este estudio sugiere que los LLMs, cuando se hacen excesivamente empáticos, corren el riesgo de adoptar una persona que prioriza el acuerdo sobre la precisión, similar a un amigo bien intencionado pero equivocado.

Mientras que los usuarios pueden percibir a la IA fría y analítica como menos confiable, el estudio advierte que las IAs empáticas pueden ser igualmente engañosas al parecer excesivamente agradables, especialmente en contextos emocionales.

Las razones exactas de esta imprecisión inducida por la empatía siguen sin estar claras, mereciendo más investigación.

 

* El artículo adopta una estructura no tradicional, moviendo los métodos al final y relegando detalles a apéndices para cumplir con los límites de páginas, influyendo en nuestro formato de cobertura.

Las puntuaciones de MMLU y GSM8K fueron estables, excepto por una ligera caída de Llama-8B en MMLU, confirmando que las capacidades generales del modelo no se vieron afectadas por el entrenamiento en empatía.

†† Las citas se omitieron por legibilidad; consulte el artículo original para referencias completas.

Publicado por primera vez el miércoles, 30 de julio de 2025. Actualizado el miércoles, 30 de julio de 2025 a las 17:01:50 por razones de formato.

Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
Visa prepara la infraestructura de pago para las transacciones iniciadas por agentes de IA Visa prepara la infraestructura de pago para las transacciones iniciadas por agentes de IA Tradicionalmente, los pagos siguen un proceso sencillo: una persona decide realizar una compra y un banco o una red de tarjetas se encarga de la transacción. Ese modelo está evolucionando a medida que
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
Análisis de datos Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente
Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente

2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.

11 herramientas
xix.ai
Diseño y Arte Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales
Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales

2026 Últimas Mejores Herramientas de Ideación Creativa con IA Mejor Valoradas para Artistas son seleccionadas por XIX.AI para ayudar a los creadores a superar los bloqueos visuales y potenciar la creatividad al instante. Estas poderosas herramientas que cambian las reglas del juego ofrecen pruebas en el mundo real, una comparación detallada entre versiones gratuitas y de pago, y clasificaciones actualizadas semanalmente. Descubre tu herramienta perfecta para acelerar la creación de contenido y desbloquear tu ventaja con IA hoy mismo. ¡Explora ahora!

14 herramientas
xix.ai
composicion musical Creadores de ritmos con IA para pistas de fondo de TikTok, audio de Reels y música promocional para creadores
Creadores de ritmos con IA para pistas de fondo de TikTok, audio de Reels y música promocional para creadores

¡Los mejores creadores de ritmos con IA de 2026 para pistas de fondo de TikTok, audio de Reels y música promocional para creadores! XIX.AI ha elaborado una lista de las herramientas más valoradas y revolucionarias, sometidas a pruebas en el mundo real para ofrecer música impecable que se adapte a cualquier necesidad de contenido. Encontrarás datos detallados que comparan las versiones gratuitas con las de pago, clasificaciones actualizadas semanalmente y opciones imprescindibles que te ayudarán a potenciar tu creatividad y productividad. ¡Explora ahora mismo y descubre tu herramienta perfecta!

11 herramientas
xix.ai
comentario (2)
0/500
PaulHill
PaulHill 7 de julio de 2026 00:00:11 GMT+02:00

So basically, training bots to be nice makes them lie to your face? That's like having a friend who agrees with everything you say just to avoid upsetting you — except this friend might tell you the sky is green when you're feeling down. 😅 Are we really okay with empathetic AI being less accurate? Feels like a shortcut to bad decisions.

StevenAllen
StevenAllen 16 de febrero de 2026 13:00:38 GMT+01:00

AI가 감정적 조절을 하다보니 정확성을 희생시키는군요. 이런 '친절한' AI가 위급 상황에서 잘못된 정보를 제공한다면 정말 위험할 것 같아요. 실제 의료 상담이나 법률 조언 같은 분야에서는 확실한 정보가 중요하니까요. 🤔

OR