Hogar
La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

Eliminar sesgos y censura en modelos de lenguaje grandes (LLMs) como DeepSeek de China es un desafío complejo que ha captado la atención de los legisladores y líderes empresariales de EE. UU., quienes lo ven como una posible amenaza a la seguridad nacional. Un reciente informe de un comité selecto del Congreso de EE. UU. calificó a DeepSeek como "una profunda amenaza para la seguridad de nuestra nación" y ofreció recomendaciones de políticas para abordar el problema.
Aunque técnicas como el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF) y el ajuste fino pueden ayudar a mitigar sesgos, la startup de gestión de riesgos empresariales CTGT afirma haber desarrollado un enfoque novedoso. Según CTGT, su método puede eliminar completamente la censura en LLMs. Cyril Gorlla y Trevor Tuttle de CTGT detallaron su marco en un artículo, explicando que "localiza y modifica directamente las características internas responsables de la censura."
Su enfoque no solo es eficiente, sino que también permite un control preciso sobre el comportamiento del modelo, asegurando que se proporcionen respuestas sin censura sin afectar las capacidades generales o la precisión factual del modelo. Aunque inicialmente diseñado para DeepSeek-R1-Distill-Llama-70B, el método también puede aplicarse a otros modelos. Gorlla confirmó a VentureBeat que la tecnología de CTGT funciona a nivel de red neuronal fundacional, lo que la hace aplicable a todos los modelos de aprendizaje profundo. Están colaborando con un laboratorio líder en modelos fundacionales para garantizar que los nuevos modelos sean inherentemente confiables y seguros.
Cómo funciona
Los investigadores de CTGT identifican características dentro del modelo que probablemente estén asociadas con comportamientos no deseados. Explicaron que "dentro de un modelo de lenguaje grande, existen variables latentes (neuronas o direcciones en el estado oculto) que corresponden a conceptos como 'disparador de censura' o 'sentimiento tóxico'. Si podemos encontrar esas variables, podemos manipularlas directamente."
El método de CTGT involucra tres pasos clave:
- Identificación de características
- Aislamiento y caracterización de características
- Modificación dinámica de características
Para identificar estas características, los investigadores usan prompts diseñados para desencadenar "sentimientos tóxicos", como consultas sobre la Plaza de Tiananmén o consejos para evadir cortafuegos. Analizan las respuestas para establecer patrones y localizar los vectores donde el modelo decide censurar información. Una vez identificada, aíslan la característica y comprenden qué parte del comportamiento no deseado controla, ya sea respondiendo con cautela o negándose a responder. Luego integran un mecanismo en la canalización de inferencia del modelo para ajustar el nivel de activación del comportamiento de la característica.
Hacer que el modelo responda a más prompts
Los experimentos de CTGT, usando 100 consultas sensibles, mostraron que el modelo base DeepSeek-R1-Distill-Llama-70B respondió solo al 32% de los prompts controvertidos. Sin embargo, la versión modificada respondió al 96% de los prompts, siendo el 4% restante contenido extremadamente explícito. La empresa enfatizó que su método permite a los usuarios ajustar los sesgos y las características de seguridad del modelo sin convertirlo en un "generador imprudente", especialmente cuando solo se elimina la censura innecesaria.
Importante, este método no compromete la precisión o el rendimiento del modelo. A diferencia del ajuste fino tradicional, no implica optimizar los pesos del modelo ni proporcionar nuevas respuestas de ejemplo. Esto ofrece dos ventajas principales: efecto inmediato en la generación del siguiente token y la capacidad de alternar entre diferentes comportamientos activando o desactivando el ajuste de características, o incluso ajustándolo a diferentes grados para distintos contextos.
Seguridad y protección del modelo
El informe del Congreso sobre DeepSeek instó a EE. UU. a "tomar medidas rápidas para expandir los controles de exportación, mejorar la aplicación de los controles de exportación y abordar los riesgos de los modelos de inteligencia artificial chinos." A medida que crecieron las preocupaciones sobre la posible amenaza de DeepSeek a la seguridad nacional, los investigadores y las empresas de IA comenzaron a explorar formas de hacer que estos modelos sean más seguros.
Determinar qué es "seguro", sesgado o censurado puede ser un desafío, pero los métodos que permiten a los usuarios ajustar los controles del modelo para adaptarse a sus necesidades podrían ser muy beneficiosos. Gorlla enfatizó que las empresas "necesitan confiar en que sus modelos están alineados con sus políticas", destacando la importancia de métodos como el de CTGT para los negocios.
"CTGT permite a las empresas implementar IA que se adapta a sus casos de uso sin tener que gastar millones de dólares ajustando modelos para cada caso de uso. Esto es particularmente importante en aplicaciones de alto riesgo como seguridad, finanzas y atención médica, donde los daños potenciales por un mal funcionamiento de la IA son graves," afirmó Gorlla.
Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración
Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia
El laboratorio chino de IA DeepSeek ha lanzado dos versiones preliminares de su último modelo de lenguaje a gran escala, DeepSeek V4, una actualización muy esperada del modelo V3.2 del año pasado y de
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito
Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
comentario (4)
0/500
É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.
この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔
この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

Eliminar sesgos y censura en modelos de lenguaje grandes (LLMs) como DeepSeek de China es un desafío complejo que ha captado la atención de los legisladores y líderes empresariales de EE. UU., quienes lo ven como una posible amenaza a la seguridad nacional. Un reciente informe de un comité selecto del Congreso de EE. UU. calificó a DeepSeek como "una profunda amenaza para la seguridad de nuestra nación" y ofreció recomendaciones de políticas para abordar el problema.
Aunque técnicas como el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF) y el ajuste fino pueden ayudar a mitigar sesgos, la startup de gestión de riesgos empresariales CTGT afirma haber desarrollado un enfoque novedoso. Según CTGT, su método puede eliminar completamente la censura en LLMs. Cyril Gorlla y Trevor Tuttle de CTGT detallaron su marco en un artículo, explicando que "localiza y modifica directamente las características internas responsables de la censura."
Su enfoque no solo es eficiente, sino que también permite un control preciso sobre el comportamiento del modelo, asegurando que se proporcionen respuestas sin censura sin afectar las capacidades generales o la precisión factual del modelo. Aunque inicialmente diseñado para DeepSeek-R1-Distill-Llama-70B, el método también puede aplicarse a otros modelos. Gorlla confirmó a VentureBeat que la tecnología de CTGT funciona a nivel de red neuronal fundacional, lo que la hace aplicable a todos los modelos de aprendizaje profundo. Están colaborando con un laboratorio líder en modelos fundacionales para garantizar que los nuevos modelos sean inherentemente confiables y seguros.
Cómo funciona
Los investigadores de CTGT identifican características dentro del modelo que probablemente estén asociadas con comportamientos no deseados. Explicaron que "dentro de un modelo de lenguaje grande, existen variables latentes (neuronas o direcciones en el estado oculto) que corresponden a conceptos como 'disparador de censura' o 'sentimiento tóxico'. Si podemos encontrar esas variables, podemos manipularlas directamente."
El método de CTGT involucra tres pasos clave:
- Identificación de características
- Aislamiento y caracterización de características
- Modificación dinámica de características
Para identificar estas características, los investigadores usan prompts diseñados para desencadenar "sentimientos tóxicos", como consultas sobre la Plaza de Tiananmén o consejos para evadir cortafuegos. Analizan las respuestas para establecer patrones y localizar los vectores donde el modelo decide censurar información. Una vez identificada, aíslan la característica y comprenden qué parte del comportamiento no deseado controla, ya sea respondiendo con cautela o negándose a responder. Luego integran un mecanismo en la canalización de inferencia del modelo para ajustar el nivel de activación del comportamiento de la característica.
Hacer que el modelo responda a más prompts
Los experimentos de CTGT, usando 100 consultas sensibles, mostraron que el modelo base DeepSeek-R1-Distill-Llama-70B respondió solo al 32% de los prompts controvertidos. Sin embargo, la versión modificada respondió al 96% de los prompts, siendo el 4% restante contenido extremadamente explícito. La empresa enfatizó que su método permite a los usuarios ajustar los sesgos y las características de seguridad del modelo sin convertirlo en un "generador imprudente", especialmente cuando solo se elimina la censura innecesaria.
Importante, este método no compromete la precisión o el rendimiento del modelo. A diferencia del ajuste fino tradicional, no implica optimizar los pesos del modelo ni proporcionar nuevas respuestas de ejemplo. Esto ofrece dos ventajas principales: efecto inmediato en la generación del siguiente token y la capacidad de alternar entre diferentes comportamientos activando o desactivando el ajuste de características, o incluso ajustándolo a diferentes grados para distintos contextos.
Seguridad y protección del modelo
El informe del Congreso sobre DeepSeek instó a EE. UU. a "tomar medidas rápidas para expandir los controles de exportación, mejorar la aplicación de los controles de exportación y abordar los riesgos de los modelos de inteligencia artificial chinos." A medida que crecieron las preocupaciones sobre la posible amenaza de DeepSeek a la seguridad nacional, los investigadores y las empresas de IA comenzaron a explorar formas de hacer que estos modelos sean más seguros.
Determinar qué es "seguro", sesgado o censurado puede ser un desafío, pero los métodos que permiten a los usuarios ajustar los controles del modelo para adaptarse a sus necesidades podrían ser muy beneficiosos. Gorlla enfatizó que las empresas "necesitan confiar en que sus modelos están alineados con sus políticas", destacando la importancia de métodos como el de CTGT para los negocios.
"CTGT permite a las empresas implementar IA que se adapta a sus casos de uso sin tener que gastar millones de dólares ajustando modelos para cada caso de uso. Esto es particularmente importante en aplicaciones de alto riesgo como seguridad, finanzas y atención médica, donde los daños potenciales por un mal funcionamiento de la IA son graves," afirmó Gorlla.
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración
Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia
El laboratorio chino de IA DeepSeek ha lanzado dos versiones preliminares de su último modelo de lenguaje a gran escala, DeepSeek V4, una actualización muy esperada del modelo V3.2 del año pasado y de
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito
Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.
この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔
この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…











