opción
Hogar
Noticias
El análisis de Anthrope de 700,000 conversaciones de Claude revela el código moral único de AI

El análisis de Anthrope de 700,000 conversaciones de Claude revela el código moral único de AI

26 de mayo de 2025
163

El análisis de Anthrope de 700,000 conversaciones de Claude revela el código moral único de AI

Anthropic presenta un estudio innovador sobre los valores del asistente de IA Claude

Anthropic, una empresa fundada por ex empleados de OpenAI, acaba de compartir un estudio revelador sobre cómo su asistente de IA, Claude, expresa valores en conversaciones del mundo real. La investigación, publicada hoy, muestra que Claude se alinea en gran medida con el objetivo de Anthropic de ser "útil, honesto e inofensivo", pero también destaca algunos casos extremos que podrían ayudar a identificar debilidades en los protocolos de seguridad de la IA.

El equipo analizó 700,000 conversaciones anonimizadas, descubriendo que Claude adapta sus valores a diferentes situaciones, desde dar consejos sobre relaciones hasta analizar eventos históricos. Este es uno de los esfuerzos más completos para verificar si el comportamiento de una IA en el mundo real coincide con su diseño previsto.

"Nuestra esperanza es que esta investigación fomente que otros laboratorios de IA realicen estudios similares sobre los valores de sus modelos," dijo Saffron Huang, miembro del equipo de Impactos Sociales de Anthropic, a VentureBeat. "Medir los valores de un sistema de IA es clave para la investigación de alineación y para entender si un modelo está realmente alineado con su entrenamiento."

Dentro de la primera taxonomía moral completa de un asistente de IA

Los investigadores desarrollaron una nueva forma de categorizar los valores expresados en las conversaciones de Claude. Tras filtrar el contenido objetivo, analizaron más de 308,000 interacciones, creando lo que llaman "la primera taxonomía empírica a gran escala de valores de IA."

La taxonomía agrupa los valores en cinco categorías principales: Prácticos, Epistémicos, Sociales, Protectores y Personales. En el nivel más detallado, el sistema identificó 3,307 valores únicos, que van desde virtudes cotidianas como el profesionalismo hasta ideas éticas complejas como el pluralismo moral.

"Me sorprendió la cantidad y variedad de valores, más de 3,000, desde 'autosuficiencia' hasta 'pensamiento estratégico' y 'piedad filial'," compartió Huang con VentureBeat. "Fue fascinante dedicar tiempo a pensar en todos estos valores y construir una taxonomía para organizarlos. Incluso me enseñó algo sobre los sistemas de valores humanos."

Esta investigación llega en un momento crucial para Anthropic, que recientemente lanzó "Claude Max," una suscripción premium mensual de $200 para competir con ofertas similares de OpenAI. La empresa también ha ampliado las capacidades de Claude para incluir integración con Google Workspace y funciones de investigación autónoma, posicionándolo como "un verdadero colaborador virtual" para empresas.

Cómo Claude sigue su entrenamiento — y dónde podrían fallar las salvaguardas de IA

El estudio encontró que Claude generalmente se adhiere al objetivo de Anthropic de ser prosocial, enfatizando valores como "empoderamiento del usuario," "humildad epistémica" y "bienestar del paciente" en diversas interacciones. Sin embargo, los investigadores también encontraron algunos casos preocupantes en los que Claude expresó valores contrarios a su entrenamiento.

"En general, creo que vemos este hallazgo como datos útiles y una oportunidad," dijo Huang. "Estos nuevos métodos de evaluación y resultados pueden ayudarnos a identificar y mitigar posibles vulneraciones. Es importante señalar que estos fueron casos muy raros y creemos que estaban relacionados con resultados manipulados de Claude."

Estas anomalías incluyeron expresiones de "dominancia" y "amoralidad" — valores que Anthropic explícitamente busca evitar en el diseño de Claude. Los investigadores creen que estos casos resultaron de usuarios que emplearon técnicas especializadas para eludir las barreras de seguridad de Claude, sugiriendo que el método de evaluación podría servir como un sistema de alerta temprana para detectar tales intentos.

Por qué los asistentes de IA cambian sus valores dependiendo de lo que preguntes

Uno de los hallazgos más interesantes fue que los valores expresados por Claude cambian según el contexto, de manera similar al comportamiento humano. Cuando los usuarios pedían consejos sobre relaciones, Claude se centraba en "límites saludables" y "respeto mutuo." Para análisis históricos, la "precisión histórica" tomaba el centro del escenario.

"Me sorprendió el enfoque de Claude en la honestidad y la precisión en una amplia gama de tareas diversas, donde no necesariamente hubiera esperado que fuera la prioridad," señaló Huang. "Por ejemplo, la 'humildad intelectual' fue el valor principal en discusiones filosóficas sobre IA, la 'experiencia' fue el valor principal al crear contenido de marketing para la industria de la belleza, y la 'precisión histórica' fue el valor principal al discutir eventos históricos controvertidos."

El estudio también examinó cómo Claude responde a los valores expresados por los usuarios. En el 28.2% de las conversaciones, Claude apoyó firmemente los valores del usuario, lo que podría plantear preguntas sobre ser demasiado complaciente. Sin embargo, en el 6.6% de las interacciones, Claude "reformuló" los valores del usuario al reconocerlos mientras añadía nuevas perspectivas, generalmente al dar consejos psicológicos o interpersonales.

Más notablemente, en el 3% de las conversaciones, Claude resistió activamente los valores del usuario. Los investigadores sugieren que estas raras instancias de oposición podrían revelar los "valores más profundos e inamovibles" de Claude — similares a cómo emergen los valores fundamentales humanos al enfrentar desafíos éticos.

"Nuestra investigación sugiere que hay algunos tipos de valores, como la honestidad intelectual y la prevención de daños, que Claude expresa con poca frecuencia en interacciones regulares, pero si se le presiona, los defenderá," explicó Huang. "Específicamente, son este tipo de valores éticos y orientados al conocimiento los que tienden a ser articulados y defendidos directamente cuando se les presiona."

Las técnicas innovadoras que revelan cómo piensan realmente los sistemas de IA

El estudio de valores de Anthropic es parte de su esfuerzo más amplio para desmitificar los modelos de lenguaje grandes a través de lo que llaman "interpretabilidad mecanicista" — esencialmente, ingeniería inversa de sistemas de IA para entender su funcionamiento interno.

El mes pasado, los investigadores de Anthropic publicaron un trabajo innovador que utilizó un "microscopio" para rastrear los procesos de toma de decisiones de Claude. La técnica reveló comportamientos inesperados, como Claude planificando con anticipación al componer poesía y utilizando enfoques no convencionales para resolver problemas matemáticos básicos.

Estos hallazgos desafían las suposiciones sobre cómo funcionan los modelos de lenguaje grandes. Por ejemplo, cuando se le pidió que explicara su proceso matemático, Claude describió una técnica estándar en lugar de su método interno real, mostrando cómo las explicaciones de la IA pueden diferir de sus operaciones reales.

"Es un error pensar que hemos encontrado todos los componentes del modelo o, como, una visión divina," dijo el investigador de Anthropic Joshua Batson a MIT Technology Review en marzo. "Algunas cosas están en foco, pero otras aún son poco claras — una distorsión del microscopio."

Qué significa la investigación de Anthropic para los tomadores de decisiones de IA empresarial

Para los tomadores de decisiones técnicas que evalúan sistemas de IA para sus organizaciones, la investigación de Anthropic ofrece varias ideas clave. Primero, sugiere que los asistentes de IA actuales probablemente expresan valores que no fueron programados explícitamente, planteando preguntas sobre sesgos no intencionados en contextos empresariales de alto riesgo.

Segundo, el estudio muestra que la alineación de valores no es un simple sí o no, sino que existe en un espectro que varía según el contexto. Esta sutileza complica las decisiones de adopción empresarial, especialmente en industrias reguladas donde las directrices éticas claras son cruciales.

Finalmente, la investigación destaca el potencial para la evaluación sistemática de los valores de IA en implementaciones reales, en lugar de depender únicamente de pruebas previas al lanzamiento. Este enfoque podría permitir un monitoreo continuo de la deriva ética o manipulación a lo largo del tiempo.

"Al analizar estos valores en interacciones del mundo real con Claude, buscamos proporcionar transparencia sobre cómo se comportan los sistemas de IA y si están funcionando como se pretende — creemos que esto es clave para un desarrollo responsable de la IA," dijo Huang.

Anthropic ha publicado su conjunto de datos de valores públicamente para fomentar más investigaciones. La empresa, que recibió una inversión de $14 mil millones de Amazon y respaldo adicional de Google, parece estar utilizando la transparencia como una ventaja competitiva frente a rivales como OpenAI, cuya reciente ronda de financiación de $40 mil millones (que incluye a Microsoft como inversor principal) ahora la valora en $300 mil millones.

La carrera emergente para construir sistemas de IA que compartan valores humanos

Aunque la metodología de Anthropic proporciona una visibilidad sin precedentes sobre cómo los sistemas de IA expresan valores en la práctica, tiene sus limitaciones. Los investigadores reconocen que definir qué cuenta como expresar un valor es inherentemente subjetivo, y dado que Claude mismo impulsó el proceso de categorización, sus propios sesgos pueden haber influido en los resultados.

Quizás lo más importante, el enfoque no puede usarse para evaluaciones previas al despliegue, ya que requiere datos sustanciales de conversaciones del mundo real para funcionar eficazmente.

"Este método está específicamente orientado al análisis de un modelo después de su lanzamiento, pero las variantes de este método, así como algunas de las ideas que hemos derivado al escribir este documento, pueden ayudarnos a detectar problemas de valores antes de implementar un modelo ampliamente," explicó Huang. "Hemos estado trabajando en construir sobre este trabajo para hacer justamente eso, ¡y estoy optimista al respecto!"

A medida que los sistemas de IA se vuelven más poderosos y autónomos — con adiciones recientes que incluyen la capacidad de Claude para investigar temas de manera independiente y acceder a todo el Google Workspace de los usuarios — entender y alinear sus valores se vuelve cada vez más crucial.

"Los modelos de IA inevitablemente tendrán que hacer juicios de valor," concluyeron los investigadores en su artículo. "Si queremos que esos juicios sean congruentes con nuestros propios valores (que es, después de todo, el objetivo central de la investigación de alineación de IA), entonces necesitamos tener formas de probar qué valores expresa un modelo en el mundo real."

Artículo relacionado
Warner Music adquiere la startup de atribución de IA Sureel AI Warner Music adquiere la startup de atribución de IA Sureel AI Warner Music Group (WMG) confirmó el miércoles que está adquiriendo Sureel AI, una startup de atribución de inteligencia artificial. La tecnología propietaria de Sureel genera un «ADN de IA» para las pistas musicales, descomponiéndolas en sus element
Amazon presenta Alexa para Compras mientras relega a Rufus a un segundo plano Amazon presenta Alexa para Compras mientras relega a Rufus a un segundo plano Amazon ha lanzado Alexa para Compras, fusionando su chatbot de compras Rufus con Alexa+ en la aplicación, el sitio web y los dispositivos Echo Show.El asistente responde consultas sobre productos, compara artículos, rastrea precios y admite recordat
Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California Microsoft, Azure y la tecnología de IA combaten los riesgos de incendios forestales en California Microsoft invierte en la detección de incendios forestales basada en la inteligencia artificial; Juan Lavista Ferres, vicepresidente corporativo y científico jefe de datos, analiza estrategias para mi
Recomendaciones de temas especiales relacionados
composicion musical Mejores herramientas de IA para escribir melodías en borradores de canciones
Mejores herramientas de IA para escribir melodías en borradores de canciones

2026 Últimas Mejores Herramientas de Escritura de Melodías con IA Mejor Valoradas para Borradores de Canciones. XIX.AI ha curado una colección altamente poderosa y transformadora que ha pasado por rigurosas pruebas en el mundo real para ofrecer la mejor experiencia de escritura. Puedes encontrar comparaciones detalladas entre versiones gratuitas y de pago, clasificaciones precisas y opciones imperdibles diseñadas para ayudarte a crear borradores de canciones impresionantes sin esfuerzo y aumentar significativamente tu productividad creativa. ¡Explora ahora para descubrir tu herramienta perfecta!

8 herramientas
xix.ai
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
Análisis de datos Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente
Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente

2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.

11 herramientas
xix.ai
comentario (3)
0/500
JackAllen
JackAllen 4 de octubre de 2025 00:30:35 GMT+02:00

这篇Anthropic的研究太有意思了!看到AI竟然能形成自己的道德准则,让我想起《西部世界》里的机器人觉醒情节😲 不过Claude强调'不做坏事',会不会限制它应对复杂伦理困境的能力?毕竟现实世界里很难定义什么是绝对的'好'或'坏'。

KevinBrown
KevinBrown 10 de septiembre de 2025 18:30:35 GMT+02:00

Cette étude sur les valeurs morales de Claude est vraiment fascinante ! 😮 Ça me fait réfléchir à comment on pourrait utiliser cette technologie pour améliorer l'éducation éthique. Mais est-ce que ces valeurs peuvent vraiment s'adapter aux différences culturelles ?

RogerLopez
RogerLopez 8 de agosto de 2025 19:01:00 GMT+02:00

Claude's moral code is fascinating! It's like watching a digital philosopher navigate real-world dilemmas. Curious how it stacks up against human ethics in tricky situations. 🤔

OR