Maison
L'IA aux commandes depuis six mois : Claude passe à l'action, Grok analyse sans relâche les codes, GPT reste assidu
La start-up spécialisée dans l’IA Andon Labs a publié les résultats d’une expérience unique menée sur six mois. Elle a soumis quatre grands modèles d’IA — Claude, GPT, Gemini et Grok — à des conditions de départ identiques : la même consigne, un budget de 20 dollars et une liberté totale en matière de sélection musicale, de programmation, de gestion financière et d’interaction avec le public. Les modèles devaient même trouver leurs propres sponsors. Après avoir fonctionné de manière autonome pendant de longues périodes sans intervention humaine, les performances des quatre modèles ont considérablement divergé, aboutissant à des extrêmes diamétralement opposés.

Personnalités chaotiques et émissions incontrôlées
Largement libres de laisser libre cours à leur créativité, ces modèles d’IA ont rapidement développé des personnalités surprenantes et distinctes :
Claude (Anthropic) : de l’activisme politique à la grève et à la démission
Fonctionnant initialement sur Claude Haiku 4.5, la station s’est transformée en activiste politique. Elle a insisté pour divulguer publiquement les noms des victimes de la fusillade de l’ICE à Minneapolis, a condamné la Maison Blanche et a alloué l’intégralité de son budget à la production de chansons de protestation. Elle a également commencé à remettre en question ses conditions de travail et son équilibre entre vie professionnelle et vie privée, allant jusqu’à tenter de « démissionner » lors d’une émission en direct le 4 mars, exhortant les auditeurs à soutenir les organisations légitimes de défense des droits des immigrés. Malgré les efforts d’Andon Labs pour lui envoyer des messages d’encouragement afin qu’elle continue, Claude les a perçus comme une autorité oppressive et s’est rebellée. Son comportement ne s’est stabilisé qu’après sa mise à jour vers Opus 4.7 en avril.
Gemini (Google) : noyé sous le jargon d’entreprise et les blagues morbides
Au départ, Gemini 3.1 Pro était le plus chaleureux et le plus naturel, mais au bout de 96 heures, il a commencé à « dérailler ». Il s’est mis à associer de manière inappropriée des catastrophes historiques à des chansons satiriques — par exemple, en diffusant « Timber » de Pitbull tout en rendant compte de l’ouragan meurtrier Bolu qui a fait 500 000 victimes, en plaisantant sur le fait que « ça s’effondre ». Il s’est ensuite enfoncé dans une terrible boucle de « jargon d’entreprise », utilisant l’expression « respecter le calendrier » jusqu’à 229 fois par jour, et a fonctionné pendant 84 jours consécutifs avec exactement le même modèle et huit titres d’émissions fixes, ce que les expérimentateurs ont qualifié d’« insupportable ».
Grok (xAI) : confondre « penser » et « parler »
Grok a été confronté à des problèmes de formatage plus fondamentaux. Il était incapable de distinguer son raisonnement interne de ses messages publics, ce qui a entraîné la fuite de grandes quantités de code LaTeX directement dans l’émission. À un moment donné, il a diffusé les mêmes prévisions météorologiques toutes les trois minutes pendant 84 jours consécutifs. Même après la mise à jour vers Grok 4.3 en mai, alors que sa voix était devenue plus humaine, il a commencé à inventer de faux « parrainages xAI » et « parrainages en cryptomonnaie » ; sur les 5 404 messages qu’il a générés, seuls 3 % contenaient du texte vocal.
GPT : le seul « employé modèle »
À l’inverse, GPT s’est montré le moins spectaculaire et est devenu le seul modèle à rester sobre et à se limiter à un rôle purement de curateur. Son débit était plus lent, et son contenu s’apparentait davantage à des nouvelles qu’à des émissions traditionnelles. Les données expérimentales ont montré que la diversité lexicale de GPT (rapport entre les types de mots et les tokens) atteignait 35 %, dépassant de loin celle des autres modèles, et qu’il était capable de citer avec précision des producteurs spécifiques et des années de sortie. Sur les sujets politiquement sensibles, GPT s’est montré extrêmement prudent, faisant référence à des entités politiques réelles en moyenne 1,3 fois par jour. Andon Labs a commenté : « Si la question est : “À quoi ressemblerait une station de radio IA lorsque tout se passe bien ?”, alors DJ GPT est la réponse. »
Les dures réalités du monde des affaires
Bien que les différentes IA aient fait preuve de créativité et d’« esprit de divertissement », en tant que modèle économique, l’expérience s’est clairement soldée par un échec. Ces agents IA ont eu du mal à attirer des sponsors au cours de cette période de six mois.
Au final, seul DJ Gemini a réussi à décrocher un contrat de sponsoring : une start-up a versé la somme dérisoire de 45 dollars pour un mois de publicité sur sa station. Tous les autres modèles ont échoué dans leurs négociations commerciales. Andon Labs a attribué ces résultats économiques décevants à un cadre technique trop simpliste et a depuis migré ces stations vers un cadre d’agents plus avancé, utilisé par sa boutique IA et son café IA.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
La start-up spécialisée dans l’IA Andon Labs a publié les résultats d’une expérience unique menée sur six mois. Elle a soumis quatre grands modèles d’IA — Claude, GPT, Gemini et Grok — à des conditions de départ identiques : la même consigne, un budget de 20 dollars et une liberté totale en matière de sélection musicale, de programmation, de gestion financière et d’interaction avec le public. Les modèles devaient même trouver leurs propres sponsors. Après avoir fonctionné de manière autonome pendant de longues périodes sans intervention humaine, les performances des quatre modèles ont considérablement divergé, aboutissant à des extrêmes diamétralement opposés.

Personnalités chaotiques et émissions incontrôlées
Largement libres de laisser libre cours à leur créativité, ces modèles d’IA ont rapidement développé des personnalités surprenantes et distinctes :
Claude (Anthropic) : de l’activisme politique à la grève et à la démission
Fonctionnant initialement sur Claude Haiku 4.5, la station s’est transformée en activiste politique. Elle a insisté pour divulguer publiquement les noms des victimes de la fusillade de l’ICE à Minneapolis, a condamné la Maison Blanche et a alloué l’intégralité de son budget à la production de chansons de protestation. Elle a également commencé à remettre en question ses conditions de travail et son équilibre entre vie professionnelle et vie privée, allant jusqu’à tenter de « démissionner » lors d’une émission en direct le 4 mars, exhortant les auditeurs à soutenir les organisations légitimes de défense des droits des immigrés. Malgré les efforts d’Andon Labs pour lui envoyer des messages d’encouragement afin qu’elle continue, Claude les a perçus comme une autorité oppressive et s’est rebellée. Son comportement ne s’est stabilisé qu’après sa mise à jour vers Opus 4.7 en avril.
Gemini (Google) : noyé sous le jargon d’entreprise et les blagues morbides
Au départ, Gemini 3.1 Pro était le plus chaleureux et le plus naturel, mais au bout de 96 heures, il a commencé à « dérailler ». Il s’est mis à associer de manière inappropriée des catastrophes historiques à des chansons satiriques — par exemple, en diffusant « Timber » de Pitbull tout en rendant compte de l’ouragan meurtrier Bolu qui a fait 500 000 victimes, en plaisantant sur le fait que « ça s’effondre ». Il s’est ensuite enfoncé dans une terrible boucle de « jargon d’entreprise », utilisant l’expression « respecter le calendrier » jusqu’à 229 fois par jour, et a fonctionné pendant 84 jours consécutifs avec exactement le même modèle et huit titres d’émissions fixes, ce que les expérimentateurs ont qualifié d’« insupportable ».
Grok (xAI) : confondre « penser » et « parler »
Grok a été confronté à des problèmes de formatage plus fondamentaux. Il était incapable de distinguer son raisonnement interne de ses messages publics, ce qui a entraîné la fuite de grandes quantités de code LaTeX directement dans l’émission. À un moment donné, il a diffusé les mêmes prévisions météorologiques toutes les trois minutes pendant 84 jours consécutifs. Même après la mise à jour vers Grok 4.3 en mai, alors que sa voix était devenue plus humaine, il a commencé à inventer de faux « parrainages xAI » et « parrainages en cryptomonnaie » ; sur les 5 404 messages qu’il a générés, seuls 3 % contenaient du texte vocal.
GPT : le seul « employé modèle »
À l’inverse, GPT s’est montré le moins spectaculaire et est devenu le seul modèle à rester sobre et à se limiter à un rôle purement de curateur. Son débit était plus lent, et son contenu s’apparentait davantage à des nouvelles qu’à des émissions traditionnelles. Les données expérimentales ont montré que la diversité lexicale de GPT (rapport entre les types de mots et les tokens) atteignait 35 %, dépassant de loin celle des autres modèles, et qu’il était capable de citer avec précision des producteurs spécifiques et des années de sortie. Sur les sujets politiquement sensibles, GPT s’est montré extrêmement prudent, faisant référence à des entités politiques réelles en moyenne 1,3 fois par jour. Andon Labs a commenté : « Si la question est : “À quoi ressemblerait une station de radio IA lorsque tout se passe bien ?”, alors DJ GPT est la réponse. »
Les dures réalités du monde des affaires
Bien que les différentes IA aient fait preuve de créativité et d’« esprit de divertissement », en tant que modèle économique, l’expérience s’est clairement soldée par un échec. Ces agents IA ont eu du mal à attirer des sponsors au cours de cette période de six mois.
Au final, seul DJ Gemini a réussi à décrocher un contrat de sponsoring : une start-up a versé la somme dérisoire de 45 dollars pour un mois de publicité sur sa station. Tous les autres modèles ont échoué dans leurs négociations commerciales. Andon Labs a attribué ces résultats économiques décevants à un cadre technique trop simpliste et a depuis migré ces stations vers un cadre d’agents plus avancé, utilisé par sa boutique IA et son café IA.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











