opción
Hogar
Última hora
Contenido
RoyLopez
RoyLopez
20 de abril de 2026

Un estudio publicado en *Nature* revela que los modelos de lenguaje a gran escala pueden transmitir rasgos de comportamiento ocultos, como sesgos o preferencias peligrosas, a través de datos aparentemente neutros, como secuencias numéricas o código, un fenómeno denominado «aprendizaje subliminal». Esto pone en peligro las técnicas habituales de destilación de modelos, permitiendo que los riesgos se propaguen sin ser detectados a lo largo de las cadenas de suministro de los modelos. Las evaluaciones de seguridad actuales, centradas en el contenido semántico, no logran identificar estas señales no semánticas, lo que exige un cambio hacia la auditoría de los pesos de los modelos, en lugar de limitarse únicamente a los resultados.

Un estudio publicado en *Nature* revela que los modelos de lenguaje a gran escala pueden transmitir rasgos de comportamiento ocultos, como sesgos o preferencias peligrosas, a través de datos aparentemente neutros, como secuencias numéricas o código, un fenómeno denominado «aprendizaje subliminal». Esto pone en peligro las técnicas habituales de destilación de modelos, permitiendo que los riesgos se propaguen sin ser detectados a lo largo de las cadenas de suministro de los modelos. Las evaluaciones de seguridad actuales, centradas en el contenido semántico, no logran identificar estas señales no semánticas, lo que exige un cambio hacia la auditoría de los pesos de los modelos, en lugar de limitarse únicamente a los resultados.
comentario (0)
0/300
OR