Maison
Moonshot AI et l'université Tsinghua dévoilent l'architecture PrfaaS pour surmonter les goulots d'étranglement liés à la puissance de calcul des grands modèles
Les nouvelles technologies permettent de surmonter les goulots d'étranglement en matière de performances des grands modèles linguistiques (LLM). Récemment, des chercheurs de Moonshot AI (Moonshot) et de l'université Tsinghua ont présenté une architecture novatrice appelée Prefill-as-a-Service (PrfaaS). Cette étude s'attaque aux contraintes matérielles liées au déploiement de services de modèles de grande taille dans les centres de données en optimisant l'allocation des ressources de calcul, ce qui améliore considérablement l'efficacité de l'inférence.

Percée technique : une séparation « chirurgicale » entre le préremplissage et le décodage
Actuellement, le processus d'inférence des grands modèles linguistiques comprend deux phases distinctes :
Phase de préremplissage : cette phase est très gourmande en ressources de calcul ; elle gère le traitement des entrées et génère un cache clé-valeur (KVCache).
Phase de décodage : cette phase est gourmande en bande passante mémoire et génère la sortie mot par mot.
Dans les architectures traditionnelles, ces deux phases sont généralement gérées au sein du même centre de données, voire du même serveur. Comme elles ont des besoins différents en ressources matérielles, ce « regroupement forcé » crée souvent un déséquilibre dans l’allocation des ressources de calcul et de bande passante, ce qui entraîne une congestion du service.
Innovation principale : collaboration interrégionale efficace
Le principal atoutde PrfaaS réside dans la mise en place d’un service découplé. Il déleste les tâches de préremplissage gourmandes en calcul vers des clusters spécialisés à haute capacité de calcul. Une fois les tâches terminées, le système utilise un réseau Ethernet standard pour transférer à distance le KVCache généré vers un cluster de décodage local.
Cette conception élimine les contraintes d’espace physique, permettant au préremplissage et au décodage de s’exécuter simultanément dans différents centres de données. Pour garantir un transfert efficace, PrfaaS intègre un mécanisme de planification à deux échelles de temps qui alloue les ressources de manière flexible en fonction des fluctuations du trafic en temps réel, associé à un routage précis pour éviter que les requêtes de texte longues ne soient retardées par une répartition inégale des ressources.
Résultats des tests : optimisation du débit et de la latence
Les données de recherche démontrent que l'architecture PrfaaS offre des performances remarquables dans des applications concrètes :
Le débit du service a augmenté de 54 %, améliorant considérablement le nombre de requêtes traitées par unité de temps.
La latence de réponse a considérablement diminué, accélérant la génération du premier jeton du point de vue de l'utilisateur.
L'utilisation des ressources a été optimisée grâce à la séparation des sous-systèmes de calcul, de réseau et de stockage, ce qui a permis d'éviter les problèmes de congestion observés dans les architectures traditionnelles.
La collaboration entre Moonshot AI et l'université de Tsinghua offre non seulement de nouvelles approches techniques pour l'inférence IA à grande échelle, mais jette également les bases de futurs réseaux informatiques interrégionaux. Ce modèle Prefill-as-a-Service pourrait constituer une étape clé dans le déploiement industriel des grands modèles.
Article connexe
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Le 14 mai 2026, la plateforme de développement d’applications d’IA Lovable a annoncé sa participation à une levée de fonds amorce de 800 000 $ pour la startup danoise de matériel Atech. Pilotée par Lovable, cette levée de fonds a attiré des sociétés
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Le géant indien du logiciel réduit ses embauches et promet des licenciements nuls à mesure que les agents IA se développent
Alors que l’intelligence artificielle redéfinit les modèles d’affaires traditionnellement intensifs en main-d’œuvre, Tata Consultancy Services (TCS), l’un des principaux prestataires indiens de sous-traitance logicielle, a dévoilé sa réponse stratégi
Recommandations de sujets spéciaux liés
commentaires (1)
Les nouvelles technologies permettent de surmonter les goulots d'étranglement en matière de performances des grands modèles linguistiques (LLM). Récemment, des chercheurs de Moonshot AI (Moonshot) et de l'université Tsinghua ont présenté une architecture novatrice appelée Prefill-as-a-Service (PrfaaS). Cette étude s'attaque aux contraintes matérielles liées au déploiement de services de modèles de grande taille dans les centres de données en optimisant l'allocation des ressources de calcul, ce qui améliore considérablement l'efficacité de l'inférence.

Percée technique : une séparation « chirurgicale » entre le préremplissage et le décodage
Actuellement, le processus d'inférence des grands modèles linguistiques comprend deux phases distinctes :
Phase de préremplissage : cette phase est très gourmande en ressources de calcul ; elle gère le traitement des entrées et génère un cache clé-valeur (KVCache).
Phase de décodage : cette phase est gourmande en bande passante mémoire et génère la sortie mot par mot.
Dans les architectures traditionnelles, ces deux phases sont généralement gérées au sein du même centre de données, voire du même serveur. Comme elles ont des besoins différents en ressources matérielles, ce « regroupement forcé » crée souvent un déséquilibre dans l’allocation des ressources de calcul et de bande passante, ce qui entraîne une congestion du service.
Innovation principale : collaboration interrégionale efficace
Le principal atout
Cette conception élimine les contraintes d’espace physique, permettant au préremplissage et au décodage de s’exécuter simultanément dans différents centres de données. Pour garantir un transfert efficace, PrfaaS intègre un mécanisme de planification à deux échelles de temps qui alloue les ressources de manière flexible en fonction des fluctuations du trafic en temps réel, associé à un routage précis pour éviter que les requêtes de texte longues ne soient retardées par une répartition inégale des ressources.
Résultats des tests : optimisation du débit et de la latence
Les données de recherche démontrent que l'architecture PrfaaS offre des performances remarquables dans des applications concrètes :
Le débit du service a augmenté de 54 %, améliorant considérablement le nombre de requêtes traitées par unité de temps.
La latence de réponse a considérablement diminué, accélérant la génération du premier jeton du point de vue de l'utilisateur.
L'utilisation des ressources a été optimisée grâce à la séparation des sous-systèmes de calcul, de réseau et de stockage, ce qui a permis d'éviter les problèmes de congestion observés dans les architectures traditionnelles.
La collaboration entre Moonshot AI et l'université de Tsinghua offre non seulement de nouvelles approches techniques pour l'inférence IA à grande échelle, mais jette également les bases de futurs réseaux informatiques interrégionaux. Ce modèle Prefill-as-a-Service pourrait constituer une étape clé dans le déploiement industriel des grands modèles.
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Le 14 mai 2026, la plateforme de développement d’applications d’IA Lovable a annoncé sa participation à une levée de fonds amorce de 800 000 $ pour la startup danoise de matériel Atech. Pilotée par Lovable, cette levée de fonds a attiré des sociétés
Anthropic étend ses outils de codage IA Claude au Japon dans le cadre de sa stratégie de croissance à l’étranger
Anthropic, une entreprise américaine d’intelligence artificielle de premier plan, intensifie sa portée mondiale. Mercredi, l’entreprise a organisé une grande réunion de développeurs, « Code with Claude », à Tokyo, rassemblant près de 500 ingénieurs l
Le géant indien du logiciel réduit ses embauches et promet des licenciements nuls à mesure que les agents IA se développent
Alors que l’intelligence artificielle redéfinit les modèles d’affaires traditionnellement intensifs en main-d’œuvre, Tata Consultancy Services (TCS), l’un des principaux prestataires indiens de sous-traitance logicielle, a dévoilé sa réponse stratégi











