opção
RoyLopez
RoyLopez
20 de Abril de 2026

Um estudo publicado na revista *Nature* revela que os grandes modelos de linguagem podem transmitir traços comportamentais ocultos, como preconceitos ou preferências inseguras, por meio de dados aparentemente neutros, como sequências numéricas ou códigos — um fenômeno denominado “aprendizado subliminar”. Isso compromete as técnicas comuns de destilação de modelos, permitindo que os riscos se propaguem sem serem detectados pelas cadeias de suprimentos dos modelos. As avaliações de segurança atuais, focadas no conteúdo semântico, não conseguem identificar esses sinais não semânticos, o que exige uma mudança para a auditoria dos pesos dos modelos, em vez de apenas dos resultados.

Um estudo publicado na revista *Nature* revela que os grandes modelos de linguagem podem transmitir traços comportamentais ocultos, como preconceitos ou preferências inseguras, por meio de dados aparentemente neutros, como sequências numéricas ou códigos — um fenômeno denominado “aprendizado subliminar”. Isso compromete as técnicas comuns de destilação de modelos, permitindo que os riscos se propaguem sem serem detectados pelas cadeias de suprimentos dos modelos. As avaliações de segurança atuais, focadas no conteúdo semântico, não conseguem identificar esses sinais não semânticos, o que exige uma mudança para a auditoria dos pesos dos modelos, em vez de apenas dos resultados.
Comentários (0)
0/300
OR