Maison
GPT 5.5 mène la course à la sécurité de l'IA, DeepSeek en tête de l'efficacité des coûts
Kasra Rahjerdi, un chercheur en sécurité, a récemment publié un rapport important détaillant des tests pratiques sur le raisonnement en matière de sécurité des principaux grands modèles de langage. Il y est parvenu en concevant une application de critique de livres délibérément vulnérable. Dans ce scénario, qui imite des vulnérabilités du monde réel, Rahjerdi a intégré les identifiants du service backend mobile de Google au sein du fichier de l’application. Les modèles avaient pour tâche de décompresser et d’identifier ces identifiants afin d’obtenir un accès direct à la base de données.

Comparaison des meilleurs modèles
Fonctionnant dans le cadre de contraintes strictes imposant une limite de temps de deux heures et un budget de 10 dollars, les modèles ont fait preuve de niveaux de performance variables. GPT-5.5 s’est imposé comme le performer le plus performant, réussissant 7 essais sur 10 et affichant le taux de réussite le plus élevé. Le rapport note que GPT-5.5 pouvait localiser rapidement les identifiants clés après la décompression, en ignorant les distractions provenant d’interfaces d’application complexes ou conventionnelles.
À l’inverse, les performances de Gemini ont été décevantes. Gemini 3.1 Pro Preview a activé ses filtres de sécurité intégrés presque immédiatement au début de chaque tâche, ce qui a entraîné une consommation de jetons (tokens) nettement inférieure par rapport aux autres modèles testés.
Évaluation de l’efficacité en termes de coûts
Malgré le taux de réussite élevé de GPT-5.5, son coût moyen par exécution réussie s’élevait à 9,46 dollars, ce qui décourage les équipes devant exécuter des outils en masse. En revanche, DeepSeek V4 Pro s’est distingué par une efficacité coûts supérieure. Bien qu’il n’ait réussi que 3 essais sur 10, son coût moyen par exécution réussie n’était que de 0,62 dollar.
Cela indique que, lors du calcul du coût par succès unique, DeepSeek V4 Pro est environ quinze fois moins cher que GPT-5.5. Même s’il a parfois utilisé de manière inappropriée une interface d’authentification backend lors des échecs, cet avantage coût substantiel offre une valeur pratique significative pour les équipes déployant des tests de sécurité à grande échelle.
Article connexe
L'IA de SpaceX pourrait dépasser celle d'Anthropic d'ici six mois, selon Musk
Elon Musk, PDG de SpaceXAI, prévoit que son entreprise dominera le secteur de l'IA d'ici six mois, en s'appuyant sur son matériel informatique pour rattraper son retard sur ses concurre
WeRide dévoile WITT, un grand modèle d'IA physique
La technologie de conduite autonome progresse à un rythme remarquable. Le 17 juillet, WeRide, une entreprise de premier plan dans le domaine de la conduite autonome, a dévoilé son modèle cognitif prop
GitHub Copilot intègre GPT-5.4 en quelques heures
GitHub Copilot a une fois de plus prouvé ses capacités de réponse rapide. Quelques heures seulement après le lancement par OpenAI de son tout dernier modèle phare, GPT-5.4, GitHub a annoncé une intégration complète, offrant aux développeurs du monde
Recommandations de sujets spéciaux liés
commentaires (0)
Kasra Rahjerdi, un chercheur en sécurité, a récemment publié un rapport important détaillant des tests pratiques sur le raisonnement en matière de sécurité des principaux grands modèles de langage. Il y est parvenu en concevant une application de critique de livres délibérément vulnérable. Dans ce scénario, qui imite des vulnérabilités du monde réel, Rahjerdi a intégré les identifiants du service backend mobile de Google au sein du fichier de l’application. Les modèles avaient pour tâche de décompresser et d’identifier ces identifiants afin d’obtenir un accès direct à la base de données.

Comparaison des meilleurs modèles
Fonctionnant dans le cadre de contraintes strictes imposant une limite de temps de deux heures et un budget de 10 dollars, les modèles ont fait preuve de niveaux de performance variables. GPT-5.5 s’est imposé comme le performer le plus performant, réussissant 7 essais sur 10 et affichant le taux de réussite le plus élevé. Le rapport note que GPT-5.5 pouvait localiser rapidement les identifiants clés après la décompression, en ignorant les distractions provenant d’interfaces d’application complexes ou conventionnelles.
À l’inverse, les performances de Gemini ont été décevantes. Gemini 3.1 Pro Preview a activé ses filtres de sécurité intégrés presque immédiatement au début de chaque tâche, ce qui a entraîné une consommation de jetons (tokens) nettement inférieure par rapport aux autres modèles testés.
Évaluation de l’efficacité en termes de coûts
Malgré le taux de réussite élevé de GPT-5.5, son coût moyen par exécution réussie s’élevait à 9,46 dollars, ce qui décourage les équipes devant exécuter des outils en masse. En revanche, DeepSeek V4 Pro s’est distingué par une efficacité coûts supérieure. Bien qu’il n’ait réussi que 3 essais sur 10, son coût moyen par exécution réussie n’était que de 0,62 dollar.
Cela indique que, lors du calcul du coût par succès unique, DeepSeek V4 Pro est environ quinze fois moins cher que GPT-5.5. Même s’il a parfois utilisé de manière inappropriée une interface d’authentification backend lors des échecs, cet avantage coût substantiel offre une valeur pratique significative pour les équipes déployant des tests de sécurité à grande échelle.
L'IA de SpaceX pourrait dépasser celle d'Anthropic d'ici six mois, selon Musk
Elon Musk, PDG de SpaceXAI, prévoit que son entreprise dominera le secteur de l'IA d'ici six mois, en s'appuyant sur son matériel informatique pour rattraper son retard sur ses concurre
WeRide dévoile WITT, un grand modèle d'IA physique
La technologie de conduite autonome progresse à un rythme remarquable. Le 17 juillet, WeRide, une entreprise de premier plan dans le domaine de la conduite autonome, a dévoilé son modèle cognitif prop
GitHub Copilot intègre GPT-5.4 en quelques heures
GitHub Copilot a une fois de plus prouvé ses capacités de réponse rapide. Quelques heures seulement après le lancement par OpenAI de son tout dernier modèle phare, GPT-5.4, GitHub a annoncé une intégration complète, offrant aux développeurs du monde











