option
Maison
Nouvelles
L'expansion de l'IA agentique nécessite des systèmes de mémoire avancés

L'expansion de l'IA agentique nécessite des systèmes de mémoire avancés

23 février 2026
203

L'IA agentique marque un changement significatif, passant des simples chatbots à la gestion de flux de travail complexes, et son évolutivité exige une nouvelle approche de l'architecture mémoire.

À mesure que les modèles de base atteignent des milliers de milliards de paramètres et que les fenêtres contextuelles s'étendent à des millions de jetons, le coût informatique lié à la conservation de l'historique dépasse notre capacité à le traiter efficacement.

Les organisations qui mettent en œuvre ces systèmes se heurtent désormais à un goulot d'étranglement où l'immense volume de « mémoire à long terme » (techniquement le cache clé-valeur (KV)) dépasse les capacités des conceptions matérielles actuelles.

L'infrastructure existante offre un choix limité : stocker le contexte d'inférence dans la mémoire GPU (HBM) rare et à haut débit, ou le transférer vers un stockage généraliste plus lent. La première option devient trop coûteuse pour les contextes volumineux, tandis que la seconde introduit une latence qui rend les interactions agentiques en temps réel impraticables.

Pour combler ce fossé croissant qui entrave la mise à l'échelle de l'IA agentique, NVIDIA a lancé la plateforme ICMS (Inference Context Memory Storage) au sein de son architecture Rubin, introduisant ainsi un nouveau niveau de stockage spécialement conçu pour répondre aux besoins temporaires et à haute vitesse de la mémoire IA.

« L'IA transforme l'ensemble de la pile informatique, et désormais le stockage », a déclaré M. Huang. « L'IA a évolué au-delà des chatbots à réponse unique pour devenir des collaborateurs intelligents qui comprennent le monde physique, raisonnent sur de longues périodes, restent basés sur des faits, utilisent des outils pour des tâches pratiques et conservent une mémoire à court et à long terme. »

Le principal problème opérationnel découle du fonctionnement des modèles basés sur des transformateurs. Pour éviter de recalculer l'intégralité d'une conversation à chaque nouveau mot généré, les modèles enregistrent les états précédents dans le cache KV. Dans les flux de travail agentiques, ce cache sert de mémoire persistante entre les outils et les sessions, et s'étend proportionnellement à la longueur de la séquence.

Cela crée une catégorie de données unique. Contrairement aux registres financiers ou aux journaux clients, le cache KV est une donnée dérivée ; il est essentiel pour les performances immédiates, mais ne nécessite pas les garanties de durabilité robustes des systèmes de fichiers d'entreprise. Les systèmes de stockage à usage général, fonctionnant sur des processeurs standard, consomment de l'énergie pour la gestion et la réplication des métadonnées, ce dont les charges de travail agentique ne tirent pas parti.

La hiérarchie existante, qui va du GPU HBM (G1) au stockage partagé (G4), s'avère de plus en plus inefficace :

(Crédit : NVIDIA)

Lorsque les données contextuelles passent du GPU (G1) à la RAM du système (G2) puis au stockage partagé (G4), l'efficacité diminue considérablement. Le transfert du contexte actif vers le niveau G4 entraîne des retards de l'ordre de la milliseconde et augmente le coût énergétique par jeton, laissant les GPU coûteux inactifs pendant l'attente des données.

Pour les entreprises, cela se traduit par un coût total de possession (TCO) plus élevé, l'énergie étant consommée par les frais généraux liés à l'infrastructure plutôt que par les tâches de raisonnement actives.

Un nouveau niveau de mémoire pour l'usine d'IA

La solution proposée par l'industrie consiste à ajouter une couche personnalisée à cette hiérarchie. La plateforme ICMS crée un niveau « G3.5 », une couche de stockage flash connectée à Ethernet spécialement conçue pour l'inférence à grande échelle.

Cette méthode intègre le stockage directement dans le pod de calcul. En tirant parti du processeur de données NVIDIA BlueField-4, la plateforme transfère la gestion de ces données contextuelles hors du CPU hôte. Le système offre des pétaoctets de capacité partagée par pod, améliorant ainsi la mise à l'échelle de l'IA agentique en permettant aux agents de conserver de vastes quantités d'historique sans consommer de HBM coûteux.

L'avantage opérationnel est mesurable tant en termes de débit que de consommation d'énergie. En stockant le contexte pertinent dans cette couche intermédiaire, qui est plus rapide que le stockage standard mais plus abordable que la mémoire HBM, le système peut « précharger » la mémoire dans le GPU à l'avance. Cela réduit le temps d'inactivité du décodeur GPU, permettant d'obtenir jusqu'à 5 fois plus de jetons par seconde (TPS) dans les charges de travail à contexte long.

Du point de vue énergétique, les avantages sont tout aussi importants. Comme l'architecture élimine la surcharge des protocoles de stockage à usage général, elle offre une efficacité énergétique cinq fois supérieure à celle des approches conventionnelles.

Intégration du plan de données

Le déploiement de cette architecture nécessite un changement dans la façon dont les équipes informatiques perçoivent les réseaux de stockage. La plate-forme ICMS s'appuie sur NVIDIA Spectrum-X Ethernet pour fournir la connectivité à haut débit et à faible gigue nécessaire pour traiter le stockage flash presque comme de la mémoire locale.

Pour les équipes chargées de l'infrastructure d'entreprise, le point d'intégration clé est la couche d'orchestration. Des frameworks tels que NVIDIA Dynamo et la bibliothèque de transfert d'inférence (NIXL) gèrent le mouvement des blocs KV entre les différents niveaux.

Ces outils fonctionnent avec la couche de stockage pour garantir que le contexte correct est chargé dans la mémoire GPU (G1) ou la mémoire hôte (G2) précisément lorsque le modèle d'IA en a besoin. Le framework NVIDIA DOCA renforce cette fonctionnalité en fournissant une couche de communication KV qui traite le cache de contexte comme une ressource primaire.

Les principaux fournisseurs de stockage adoptent déjà cette architecture. Des entreprises telles que AIC, Cloudian, DDN, Dell Technologies, HPE, Hitachi Vantara, IBM, Nutanix, Pure Storage, Supermicro, VAST Data et WEKA développent des plateformes avec BlueField-4. Ces solutions devraient être disponibles au cours du second semestre de cette année.

Redéfinir l'infrastructure pour faire évoluer l'IA agentique

L'adoption d'un niveau de mémoire contextuelle dédié a une incidence sur la planification de la capacité et la conception des centres de données.

  • Reclassification des données : les DSI doivent reconnaître le cache KV comme un type de données distinct. Il est « temporaire mais sensible à la latence », contrairement aux données de conformité « durables et froides ». Le niveau G3.5 gère le premier, permettant au stockage G4 durable de se concentrer sur les journaux et les artefacts à long terme.
  • Maturité de l'orchestration : le succès repose sur un logiciel capable d'allouer intelligemment les charges de travail. Le système utilise une orchestration sensible à la topologie (via NVIDIA Grove) pour positionner les tâches à proximité de leur contexte mis en cache, réduisant ainsi le mouvement des données sur le réseau.
  • Densité de puissance : en concentrant davantage de capacité utilisable dans le même espace de rack, les organisations peuvent prolonger la durée de vie de leurs installations actuelles. Cependant, cela augmente la densité de calcul par mètre carré, ce qui nécessite une planification minutieuse du refroidissement et de la distribution d'énergie.

Le passage à l'IA agentique nécessite une refonte physique du centre de données. La pratique courante consistant à séparer complètement le calcul du stockage lent et persistant n'est pas adaptée aux exigences de récupération en temps réel des agents dotés de mémoires étendues.

En introduisant un niveau contextuel spécialisé, les entreprises peuvent séparer la croissance de la mémoire du modèle du coût du GPU HBM. Cette architecture d'IA agentique permet à plusieurs agents de partager un grand pool de mémoire à faible consommation d'énergie, ce qui réduit le coût du traitement des requêtes complexes et améliore la scalabilité en prenant en charge un raisonnement à haut débit.

Alors que les organisations se préparent à leur prochaine vague d'investissements dans les infrastructures, l'évaluation de l'efficacité de la hiérarchie de la mémoire sera tout aussi cruciale que le choix du GPU lui-même.

Voir aussi : La guerre des puces IA en 2025 : ce que les chefs d'entreprise ont appris sur la réalité de la chaîne d'approvisionnement

Vous souhaitez en savoir plus sur l'IA et le big data auprès des leaders du secteur ? Découvrez l'AI & Big Data Expo qui se tiendra à Amsterdam, en Californie et à Londres. Cet événement complet fait partie de TechEx et se déroule en même temps que d'autres événements technologiques de premier plan. Cliquez ici pour plus d'informations.

AI News est alimenté par TechForge Media. Découvrez ici d'autres événements et webinaires à venir sur les technologies d'entreprise.

Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin. Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
en écrivant Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs
Outils d'IA pour la structuration d'articles destinés à la rédaction de textes longs

2026 : les meilleurs outils d'aide à la rédaction de plans pour les textes longs, sélectionnés parmi les mieux notés ! Cette sélection rigoureuse regroupe des outils puissants et révolutionnaires qui fournissent des plans précis et structurés, validés par des tests concrets, afin d'améliorer considérablement l'efficacité de la rédaction. XIX.AI fait partie de cette sélection d'élite. Consultez notre comparatif entre les versions gratuites et payantes pour vous aider à choisir l'outil idéal. Découvrez-les dès maintenant et tirez parti de l'IA !

9 outils
xix.ai
chatbot Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne
Meilleures applications de chat de jeu de rôle par IA pour la pratique des langues, la préparation aux entretiens et la fluidité quotidienne

2026 Dernières Meilleures Applications de Chat IA pour le Jeu de Rôle, les plus bien notées pour la Pratique des Langues, la Préparation aux Entretiens et la Fluidité Quotidienne ! XIX.AI sélectionne une collection puissante et révolutionnaire qui propose une comparaison gratuit vs payant, des tests en conditions réelles et des classements mis à jour chaque semaine. Ces outils à essayer absolument vous aident à améliorer vos compétences en écriture, à surmonter les défis de fluidité et à optimiser l’efficacité de la communication dans tous les scénarios quotidiens. Explorez dès maintenant pour découvrir l’outil parfait pour votre progression linguistique !

10 outils
xix.ai
Composition musicale Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké
Outils de séparation des pistes audio par IA pour la production de remix, la préparation de samples et les masters de karaoké

2026 : Les meilleures et plus récentes outils de séparation des pistes audio par IA, hautement notés, sélectionnés spécialement pour la production de remix, la préparation de samples et l’enregistrement de karaokés. Ces outils puissants et révolutionnaires, éprouvés dans des conditions réelles, permettent une isolation audio précise, ce qui améliore considérablement la productivité. XIX.AI propose un guide de comparaison gratuit mis à jour chaque semaine entre les versions payantes et gratuites, afin de vous aider à trouver la solution idéale adaptée à vos besoins. Découvrez-les dès maintenant pour tirer parti des avantages offerts par l’IA.

8 outils
xix.ai
Analyse des données Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits
Copilotes SQL basés sur l’IA pour les tableaux de bord de chiffre d’affaires, l’analyse des funnels et les indicateurs de produits

2026 : Les meilleurs copilotes AI SQL actuels, classés parmi les plus performants ! XIX.AI a sélectionné une collection puissante et révolutionnaire, mise à jour chaque semaine grâce à des tests concrets. Ces outils indispensables vous aident à créer des tableaux de bord financiers précis, à analyser les canaux de vente et à suivre en temps réel les indicateurs produits, ce qui améliore considérablement votre productivité. Découvrez-les dès maintenant pour trouver l’outil idéal pour des décisions basées sur les données ! 238 caractères

9 outils
xix.ai
Composition musicale Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons
Meilleurs outils d’écriture de mélodies par IA pour les ébauches de chansons

2026 Derniers Meilleurs Outils d’Écriture de Mélodie par IA les Mieux Notés pour des Ébauches de Chansons ! XIX.AI a sélectionné une collection hautement puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles, afin d’offrir la meilleure expérience d’écriture. Vous pouvez y trouver des comparaisons détaillées entre versions gratuites et payantes, des classements précis, ainsi que des options incontournables conçues pour vous aider à créer sans effort des ébauches de chansons remarquables et à booster significativement votre productivité créative. Explorez dès maintenant pour découvrir l’outil qui vous correspond parfaitement !

8 outils
xix.ai
chatbot Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens
Meilleurs outils d’entraînement à la conversation par IA pour la préparation aux entretiens

Les derniers outils de formation à la conversation par IA les mieux notés pour 2026 sont disponibles sur XIX.AI ! Cette sélection rigoureuse propose des outils puissants et révolutionnaires, testés rigoureusement dans des conditions réelles pour fournir des retours précis. Vous y trouverez une comparaison entre les versions gratuites et payantes, ainsi que des classements détaillés pour vous aider à choisir l’option incontournable qui renforce votre confiance et vos compétences. Explorez dès maintenant pour découvrir l’outil parfait pour réussir vos entretiens !

12 outils
xix.ai
commentaires (0)
0/500
OR