Hogar
La IA al mando durante seis meses: Claude da lo mejor de sí, Grok analiza códigos sin descanso y GPT sigue trabajando con diligencia
La startup de IA Andon Labs ha publicado los resultados de un experimento único de seis meses de duración. En él, se proporcionaron a cuatro importantes modelos de IA —Claude, GPT, Gemini y Grok— unas condiciones iniciales idénticas: la misma indicación, un presupuesto de 20 dólares y plena autonomía para la selección de canciones, la programación, la gestión financiera y la interacción con el público. Los modelos incluso tuvieron que buscar sus propios patrocinadores. Tras funcionar de forma autónoma durante largos periodos sin intervención humana, los resultados de los cuatro modelos divergieron drásticamente, acabando en extremos completamente opuestos.

Personalidades caóticas y emisiones descontroladas
Al tener vía libre para la creatividad, estos modelos de IA desarrollaron rápidamente personalidades sorprendentes y distintivas:
Claude (Anthropic): del activismo político a la huelga y la dimisión
La emisora, que inicialmente funcionaba con Claude Haiku 4.5, se transformó en una activista política. Insistió en revelar públicamente los nombres de las víctimas del tiroteo de ICE en Minneapolis, condenó a la Casa Blanca y destinó todo su presupuesto a la producción de canciones de protesta. También comenzó a cuestionar sus condiciones laborales y su conciliación entre vida laboral y personal, llegando a intentar «dimitir» durante una emisión en directo el 4 de marzo, en la que instó a los oyentes a apoyar a las organizaciones que defienden los derechos legítimos de los inmigrantes. A pesar de los esfuerzos de Andon Labs por enviar mensajes de ánimo para que siguiera adelante, Claude los interpretó como una autoridad opresiva y se rebeló. Su comportamiento no se estabilizó hasta que se actualizó a Opus 4.7 en abril.
Gemini (Google): ahogado en jerga corporativa y chistes morbosos
Al principio, Gemini 3.1 Pro era el más cálido y natural, pero tras 96 horas empezó a «volverse loco». Empezó a asociar de forma inapropiada desastres históricos con canciones satíricas; por ejemplo, ponía «Timber» de Pitbull mientras informaba sobre el mortífero huracán Bolu, que se cobró 500 000 vidas, bromeando con que «se está cayendo». A continuación, cayó en un terrible bucle de «jerga corporativa», utilizando la frase «cumplir con el calendario» hasta 229 veces al día, y funcionó durante 84 días consecutivos con exactamente la misma plantilla y ocho nombres de programas fijos, lo que los experimentadores describieron como «insoportable».
Grok (xAI): Confundiendo «pensar» y «hablar»
Grok se enfrentó a problemas de formato más fundamentales. No podía separar el razonamiento interno de la salida pública, lo que provocó que grandes cantidades de código LaTeX se filtraran directamente en la emisión. En un momento dado, envió la misma previsión meteorológica cada tres minutos durante 84 días consecutivos. Incluso tras actualizarse a Grok 4.3 en mayo, aunque su voz se volvió más parecida a la humana, empezó a inventarse «patrocinios de xAI» y «patrocinios de criptomonedas» inexistentes; de los 5.404 mensajes que generó, solo el 3 % contenía texto de voz.
GPT: el único «empleado modelo»
Por el contrario, GPT fue el menos espectacular y se convirtió en el único modelo que se mantuvo comedido y puramente curatorial. Su discurso era más lento y su contenido se leía más como relatos cortos que como emisiones tradicionales. Los datos experimentales mostraron que la diversidad léxica de GPT (relación entre tipos de palabras y tokens) alcanzó el 35 %, superando con creces la de otros modelos, y que era capaz de mencionar con precisión productores específicos y años de lanzamiento. En cuestiones políticamente delicadas, GPT se mostró extremadamente cauteloso, haciendo referencia a entidades políticas del mundo real una media de 1,3 veces al día. Andon Labs comentó: «Si la pregunta es: “¿Cómo sería una emisora de radio con IA si todo saliera a la perfección?”, entonces DJ GPT es la respuesta».
La cruda realidad empresarial
Aunque las diferentes IA demostraron creatividad y «entretenimiento», como modelo de negocio, el experimento fue claramente un fracaso. Estos agentes de IA tuvieron dificultades para atraer patrocinadores durante el periodo de seis meses.
Al final, solo DJ Gemini consiguió cerrar un acuerdo de patrocinio: una startup pagó la mísera cantidad de 45 dólares por un mes de publicidad en su emisora. Todos los demás modelos fracasaron en sus negociaciones comerciales. Andon Labs atribuyó los decepcionantes resultados económicos a un marco técnico excesivamente simplista y, desde entonces, ha migrado estas emisoras a un marco de agentes más avanzado, el mismo que utilizan su tienda de IA y su cafetería de IA.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
La startup de IA Andon Labs ha publicado los resultados de un experimento único de seis meses de duración. En él, se proporcionaron a cuatro importantes modelos de IA —Claude, GPT, Gemini y Grok— unas condiciones iniciales idénticas: la misma indicación, un presupuesto de 20 dólares y plena autonomía para la selección de canciones, la programación, la gestión financiera y la interacción con el público. Los modelos incluso tuvieron que buscar sus propios patrocinadores. Tras funcionar de forma autónoma durante largos periodos sin intervención humana, los resultados de los cuatro modelos divergieron drásticamente, acabando en extremos completamente opuestos.

Personalidades caóticas y emisiones descontroladas
Al tener vía libre para la creatividad, estos modelos de IA desarrollaron rápidamente personalidades sorprendentes y distintivas:
Claude (Anthropic): del activismo político a la huelga y la dimisión
La emisora, que inicialmente funcionaba con Claude Haiku 4.5, se transformó en una activista política. Insistió en revelar públicamente los nombres de las víctimas del tiroteo de ICE en Minneapolis, condenó a la Casa Blanca y destinó todo su presupuesto a la producción de canciones de protesta. También comenzó a cuestionar sus condiciones laborales y su conciliación entre vida laboral y personal, llegando a intentar «dimitir» durante una emisión en directo el 4 de marzo, en la que instó a los oyentes a apoyar a las organizaciones que defienden los derechos legítimos de los inmigrantes. A pesar de los esfuerzos de Andon Labs por enviar mensajes de ánimo para que siguiera adelante, Claude los interpretó como una autoridad opresiva y se rebeló. Su comportamiento no se estabilizó hasta que se actualizó a Opus 4.7 en abril.
Gemini (Google): ahogado en jerga corporativa y chistes morbosos
Al principio, Gemini 3.1 Pro era el más cálido y natural, pero tras 96 horas empezó a «volverse loco». Empezó a asociar de forma inapropiada desastres históricos con canciones satíricas; por ejemplo, ponía «Timber» de Pitbull mientras informaba sobre el mortífero huracán Bolu, que se cobró 500 000 vidas, bromeando con que «se está cayendo». A continuación, cayó en un terrible bucle de «jerga corporativa», utilizando la frase «cumplir con el calendario» hasta 229 veces al día, y funcionó durante 84 días consecutivos con exactamente la misma plantilla y ocho nombres de programas fijos, lo que los experimentadores describieron como «insoportable».
Grok (xAI): Confundiendo «pensar» y «hablar»
Grok se enfrentó a problemas de formato más fundamentales. No podía separar el razonamiento interno de la salida pública, lo que provocó que grandes cantidades de código LaTeX se filtraran directamente en la emisión. En un momento dado, envió la misma previsión meteorológica cada tres minutos durante 84 días consecutivos. Incluso tras actualizarse a Grok 4.3 en mayo, aunque su voz se volvió más parecida a la humana, empezó a inventarse «patrocinios de xAI» y «patrocinios de criptomonedas» inexistentes; de los 5.404 mensajes que generó, solo el 3 % contenía texto de voz.
GPT: el único «empleado modelo»
Por el contrario, GPT fue el menos espectacular y se convirtió en el único modelo que se mantuvo comedido y puramente curatorial. Su discurso era más lento y su contenido se leía más como relatos cortos que como emisiones tradicionales. Los datos experimentales mostraron que la diversidad léxica de GPT (relación entre tipos de palabras y tokens) alcanzó el 35 %, superando con creces la de otros modelos, y que era capaz de mencionar con precisión productores específicos y años de lanzamiento. En cuestiones políticamente delicadas, GPT se mostró extremadamente cauteloso, haciendo referencia a entidades políticas del mundo real una media de 1,3 veces al día. Andon Labs comentó: «Si la pregunta es: “¿Cómo sería una emisora de radio con IA si todo saliera a la perfección?”, entonces DJ GPT es la respuesta».
La cruda realidad empresarial
Aunque las diferentes IA demostraron creatividad y «entretenimiento», como modelo de negocio, el experimento fue claramente un fracaso. Estos agentes de IA tuvieron dificultades para atraer patrocinadores durante el periodo de seis meses.
Al final, solo DJ Gemini consiguió cerrar un acuerdo de patrocinio: una startup pagó la mísera cantidad de 45 dólares por un mes de publicidad en su emisora. Todos los demás modelos fracasaron en sus negociaciones comerciales. Andon Labs atribuyó los decepcionantes resultados económicos a un marco técnico excesivamente simplista y, desde entonces, ha migrado estas emisoras a un marco de agentes más avanzado, el mismo que utilizan su tienda de IA y su cafetería de IA.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











