opción
Hogar
Noticias
La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

11 de mayo de 2025
176

La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

Eliminar sesgos y censura en modelos de lenguaje grandes (LLMs) como DeepSeek de China es un desafío complejo que ha captado la atención de los legisladores y líderes empresariales de EE. UU., quienes lo ven como una posible amenaza a la seguridad nacional. Un reciente informe de un comité selecto del Congreso de EE. UU. calificó a DeepSeek como "una profunda amenaza para la seguridad de nuestra nación" y ofreció recomendaciones de políticas para abordar el problema.

Aunque técnicas como el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF) y el ajuste fino pueden ayudar a mitigar sesgos, la startup de gestión de riesgos empresariales CTGT afirma haber desarrollado un enfoque novedoso. Según CTGT, su método puede eliminar completamente la censura en LLMs. Cyril Gorlla y Trevor Tuttle de CTGT detallaron su marco en un artículo, explicando que "localiza y modifica directamente las características internas responsables de la censura."

Su enfoque no solo es eficiente, sino que también permite un control preciso sobre el comportamiento del modelo, asegurando que se proporcionen respuestas sin censura sin afectar las capacidades generales o la precisión factual del modelo. Aunque inicialmente diseñado para DeepSeek-R1-Distill-Llama-70B, el método también puede aplicarse a otros modelos. Gorlla confirmó a VentureBeat que la tecnología de CTGT funciona a nivel de red neuronal fundacional, lo que la hace aplicable a todos los modelos de aprendizaje profundo. Están colaborando con un laboratorio líder en modelos fundacionales para garantizar que los nuevos modelos sean inherentemente confiables y seguros.

Cómo funciona

Los investigadores de CTGT identifican características dentro del modelo que probablemente estén asociadas con comportamientos no deseados. Explicaron que "dentro de un modelo de lenguaje grande, existen variables latentes (neuronas o direcciones en el estado oculto) que corresponden a conceptos como 'disparador de censura' o 'sentimiento tóxico'. Si podemos encontrar esas variables, podemos manipularlas directamente."

El método de CTGT involucra tres pasos clave:

  1. Identificación de características
  2. Aislamiento y caracterización de características
  3. Modificación dinámica de características

Para identificar estas características, los investigadores usan prompts diseñados para desencadenar "sentimientos tóxicos", como consultas sobre la Plaza de Tiananmén o consejos para evadir cortafuegos. Analizan las respuestas para establecer patrones y localizar los vectores donde el modelo decide censurar información. Una vez identificada, aíslan la característica y comprenden qué parte del comportamiento no deseado controla, ya sea respondiendo con cautela o negándose a responder. Luego integran un mecanismo en la canalización de inferencia del modelo para ajustar el nivel de activación del comportamiento de la característica.

Hacer que el modelo responda a más prompts

Los experimentos de CTGT, usando 100 consultas sensibles, mostraron que el modelo base DeepSeek-R1-Distill-Llama-70B respondió solo al 32% de los prompts controvertidos. Sin embargo, la versión modificada respondió al 96% de los prompts, siendo el 4% restante contenido extremadamente explícito. La empresa enfatizó que su método permite a los usuarios ajustar los sesgos y las características de seguridad del modelo sin convertirlo en un "generador imprudente", especialmente cuando solo se elimina la censura innecesaria.

Importante, este método no compromete la precisión o el rendimiento del modelo. A diferencia del ajuste fino tradicional, no implica optimizar los pesos del modelo ni proporcionar nuevas respuestas de ejemplo. Esto ofrece dos ventajas principales: efecto inmediato en la generación del siguiente token y la capacidad de alternar entre diferentes comportamientos activando o desactivando el ajuste de características, o incluso ajustándolo a diferentes grados para distintos contextos.

Seguridad y protección del modelo

El informe del Congreso sobre DeepSeek instó a EE. UU. a "tomar medidas rápidas para expandir los controles de exportación, mejorar la aplicación de los controles de exportación y abordar los riesgos de los modelos de inteligencia artificial chinos." A medida que crecieron las preocupaciones sobre la posible amenaza de DeepSeek a la seguridad nacional, los investigadores y las empresas de IA comenzaron a explorar formas de hacer que estos modelos sean más seguros.

Determinar qué es "seguro", sesgado o censurado puede ser un desafío, pero los métodos que permiten a los usuarios ajustar los controles del modelo para adaptarse a sus necesidades podrían ser muy beneficiosos. Gorlla enfatizó que las empresas "necesitan confiar en que sus modelos están alineados con sus políticas", destacando la importancia de métodos como el de CTGT para los negocios.

"CTGT permite a las empresas implementar IA que se adapta a sus casos de uso sin tener que gastar millones de dólares ajustando modelos para cada caso de uso. Esto es particularmente importante en aplicaciones de alto riesgo como seguridad, finanzas y atención médica, donde los daños potenciales por un mal funcionamiento de la IA son graves," afirmó Gorlla.

Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia El laboratorio chino de IA DeepSeek ha lanzado dos versiones preliminares de su último modelo de lenguaje a gran escala, DeepSeek V4, una actualización muy esperada del modelo V3.2 del año pasado y de
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
Análisis de datos Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos
Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos

¡Los mejores copilotos de SQL basados en IA de 2026, clasificados entre los más destacados! XIX.AI reúne una poderosa colección que evoluciona constantemente, con pruebas en el mundo real actualizadas semanalmente. Estas herramientas indispensables le permiten generar paneles de control de ingresos precisos, analizar los canales de venta y seguir de cerca las métricas de los productos de manera rápida, lo que aumenta significativamente su productividad. ¡Explórelas ahora para encontrar la herramienta perfecta para tomar decisiones basadas en datos! 238 caracteres

9 herramientas
xix.ai
composicion musical Mejores herramientas de IA para escribir melodías en borradores de canciones
Mejores herramientas de IA para escribir melodías en borradores de canciones

2026 Últimas Mejores Herramientas de Escritura de Melodías con IA Mejor Valoradas para Borradores de Canciones. XIX.AI ha curado una colección altamente poderosa y transformadora que ha pasado por rigurosas pruebas en el mundo real para ofrecer la mejor experiencia de escritura. Puedes encontrar comparaciones detalladas entre versiones gratuitas y de pago, clasificaciones precisas y opciones imperdibles diseñadas para ayudarte a crear borradores de canciones impresionantes sin esfuerzo y aumentar significativamente tu productividad creativa. ¡Explora ahora para descubrir tu herramienta perfecta!

8 herramientas
xix.ai
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
comentario (4)
0/500
CarlGarcia
CarlGarcia 23 de marzo de 2026 01:01:13 GMT+01:00

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 25 de diciembre de 2025 15:30:40 GMT+01:00

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 4 de diciembre de 2025 21:30:40 GMT+01:00

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 21 de agosto de 2025 07:01:17 GMT+02:00

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR