Maison
Une équipe de l'université Jiao Tong de Shanghai publie le benchmark SWE-Explore, mettant en évidence des failles de localisation au niveau des lignes de code chez les agents de codage basés sur l'IA
Une équipe de recherche internationale, à laquelle participe l’université Jiao Tong de Shanghai, a lancé aujourd’hui SWE-Explore, un nouvel outil de test de référence. Celui-ci met en évidence, de manière quantitative, d’importantes lacunes techniques des agents de codage IA actuels au niveau de la « précision au niveau de la ligne de code », en dissociant la recherche de code de la phase de correction proprement dite. Cette étude va au-delà du modèle d’évaluation unique précédent, qui reposait uniquement sur le « taux de correction final », en proposant une nouvelle norme permettant de mesurer directement la qualité de la recherche en amont chez les agents, et en faisant évoluer l’évaluation de l’ingénierie logicielle IA vers des domaines plus approfondis.
Les benchmarks traditionnels tels que SWE-bench masquent souvent les véritables défauts des agents lors des étapes de lecture et de compréhension du code, car ils se concentrent uniquement sur les résultats de bout en bout. Pour remédier à cela, l’équipe de recherche a extrait des segments de code consensuels à partir de multiples chemins de solution indépendants, en s’appuyant sur les trajectoires opérationnelles réussies de grands modèles courants tels que GPT-5.4, Gemini3Pro, Claude Sonnet4.6 et Kimi K2.6, et a constitué un ensemble de données comprenant 848 tâches de détection de défauts réparties sur 10 langages de programmation et 203 projets open source.

Les résultats d’évaluation montrent que, bien que les agents de codage généraux tels que Claude Code et OpenHands affichent de bonnes performances en matière de localisation « au niveau du fichier », leur couverture des zones clés chute brutalement pour se situer entre 14 % et 19 % lorsqu’ils se concentrent sur des « lignes de code » spécifiques. Des expériences d’ablation ont en outre confirmé l’effet du « seuil minimal de contexte » : lorsque la proportion visible des zones clés est inférieure à 50 %, la réparation par le modèle échoue généralement ; en revanche, dès que ce seuil est franchi (entre 50 % et 75 %), le taux de réussite de la réparation augmente considérablement.
Ce résultat de recherche indique que le goulot d’étranglement actuel pour les agents d’IA ne réside pas entièrement dans la capacité à rédiger des correctifs, mais plutôt dans la capacité à filtrer et à capturer avec précision le contexte critique. Dans le contexte actuel du secteur, où les chefs de projet rejettent la moitié des propositions d’adoption automatisée, l’orientation technique « moins de filtrage, plus de lecture » proposée par SWE-Explore ouvre non seulement la voie à l’optimisation architecturale des systèmes spécialisés de localisation de code de nouvelle génération (tels que CoSIL), mais accélère également le changement de paradigme de l’ingénierie logicielle automatisée, passant de la « génération par force brute » à la « recherche précise ».
Article connexe
Meta supprime la fonction de retouche photo par IA suite aux critiques des utilisateurs
Meta, le géant des réseaux sociaux, est une fois de plus au cœur d’un débat public concernant l’équilibre délicat entre l’intelligence artificielle et la vie privée des utilisateurs. Selon TechCrunch, les Superintelligence Labs de Meta ont présenté u
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Recommandations de sujets spéciaux liés
commentaires (0)
Une équipe de recherche internationale, à laquelle participe l’université Jiao Tong de Shanghai, a lancé aujourd’hui SWE-Explore, un nouvel outil de test de référence. Celui-ci met en évidence, de manière quantitative, d’importantes lacunes techniques des agents de codage IA actuels au niveau de la « précision au niveau de la ligne de code », en dissociant la recherche de code de la phase de correction proprement dite. Cette étude va au-delà du modèle d’évaluation unique précédent, qui reposait uniquement sur le « taux de correction final », en proposant une nouvelle norme permettant de mesurer directement la qualité de la recherche en amont chez les agents, et en faisant évoluer l’évaluation de l’ingénierie logicielle IA vers des domaines plus approfondis.
Les benchmarks traditionnels tels que SWE-bench masquent souvent les véritables défauts des agents lors des étapes de lecture et de compréhension du code, car ils se concentrent uniquement sur les résultats de bout en bout. Pour remédier à cela, l’équipe de recherche a extrait des segments de code consensuels à partir de multiples chemins de solution indépendants, en s’appuyant sur les trajectoires opérationnelles réussies de grands modèles courants tels que GPT-5.4, Gemini3Pro, Claude Sonnet4.6 et Kimi K2.6, et a constitué un ensemble de données comprenant 848 tâches de détection de défauts réparties sur 10 langages de programmation et 203 projets open source.

Les résultats d’évaluation montrent que, bien que les agents de codage généraux tels que Claude Code et OpenHands affichent de bonnes performances en matière de localisation « au niveau du fichier », leur couverture des zones clés chute brutalement pour se situer entre 14 % et 19 % lorsqu’ils se concentrent sur des « lignes de code » spécifiques. Des expériences d’ablation ont en outre confirmé l’effet du « seuil minimal de contexte » : lorsque la proportion visible des zones clés est inférieure à 50 %, la réparation par le modèle échoue généralement ; en revanche, dès que ce seuil est franchi (entre 50 % et 75 %), le taux de réussite de la réparation augmente considérablement.
Ce résultat de recherche indique que le goulot d’étranglement actuel pour les agents d’IA ne réside pas entièrement dans la capacité à rédiger des correctifs, mais plutôt dans la capacité à filtrer et à capturer avec précision le contexte critique. Dans le contexte actuel du secteur, où les chefs de projet rejettent la moitié des propositions d’adoption automatisée, l’orientation technique « moins de filtrage, plus de lecture » proposée par SWE-Explore ouvre non seulement la voie à l’optimisation architecturale des systèmes spécialisés de localisation de code de nouvelle génération (tels que CoSIL), mais accélère également le changement de paradigme de l’ingénierie logicielle automatisée, passant de la « génération par force brute » à la « recherche précise ».
Meta supprime la fonction de retouche photo par IA suite aux critiques des utilisateurs
Meta, le géant des réseaux sociaux, est une fois de plus au cœur d’un débat public concernant l’équilibre délicat entre l’intelligence artificielle et la vie privée des utilisateurs. Selon TechCrunch, les Superintelligence Labs de Meta ont présenté u
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











