Heim
Moonshot AI und die Tsinghua-Universität stellen die PrfaaS-Architektur vor, um den Engpass bei der Rechenleistung großer Modelle zu überwinden
Neue Technologien überwinden den Leistungsengpass großer Sprachmodelle (LLMs). Kürzlich stellten Forscher von Moonshot AI (Moonshot) und der Tsinghua-Universität eine neuartige Architektur namens Prefill-as-a-Service (PrfaaS) vor. Diese Studie befasst sich mit Hardware-Einschränkungen bei der Bereitstellung großer Modelldienste in Rechenzentren, indem sie die Zuweisung von Rechenressourcen optimiert und dadurch die Effizienz der Inferenz erheblich steigert.

Technischer Durchbruch: Eine „chirurgische“ Trennung von Prefill und Decode
Derzeit umfasst der Inferenzprozess für große Sprachmodelle zwei unterschiedliche Phasen:
Prefill-Phase: Diese Phase ist rechenintensiv, da sie die Eingabeverarbeitung übernimmt und einen Schlüssel-Wert-Cache (KVCache) generiert.
Decode-Phase: Diese Phase ist speicher- und bandbreitenintensiv und generiert die Ausgabe Wort für Wort.
In herkömmlichen Architekturen werden beide Phasen in der Regel innerhalb desselben Rechenzentrums oder sogar desselben Servers abgewickelt. Da sie unterschiedliche Anforderungen an die Hardware-Ressourcen stellen, führt diese „erzwungene Bündelung“ oft zu einem Ungleichgewicht bei der Zuweisung von Rechenleistung und Bandbreite, was zu einer Überlastung des Dienstes führt.
Kerninnovation: Effiziente regionenübergreifende Zusammenarbeit
Das zentrale Highlightvon PrfaaS ist die Realisierung eines entkoppelten Dienstes. Es lagert die rechenintensiven Prefill-Aufgaben an spezialisierte Hochleistungs-Cluster aus. Nach Abschluss der Aufgaben nutzt das System Standard-Ethernet, um den generierten KVCache remote an einen lokalen Dekodierungs-Cluster zu übertragen.
Dieses Design beseitigt physische Platzbeschränkungen und ermöglicht es, dass Vorabfüllung und Dekodierung gleichzeitig über verschiedene Rechenzentren hinweg ablaufen. Um eine effiziente Übertragung zu gewährleisten, integriert PrfaaS einen Scheduling-Mechanismus mit zwei Zeitskalen, der Ressourcen flexibel auf der Grundlage von Echtzeit-Verkehrsschwankungen zuweist, gepaart mit präzisem Routing, um zu verhindern, dass lange Textanfragen durch eine ungleichmäßige Ressourcenverteilung verzögert werden.
Testergebnisse: Optimierung von Durchsatz und Latenz
Forschungsdaten belegen, dass die PrfaaS-Architektur in realen Anwendungen eine bemerkenswerte Leistung erbringt:
Der Dienstdurchsatz stieg um 54 %, wodurch sich die Anzahl der pro Zeiteinheit bearbeiteten Anfragen deutlich verbesserte.
Die Antwortlatenz verringerte sich deutlich, wodurch die Generierung des ersten Tokens aus Sicht des Benutzers schneller erfolgte.
Die Ressourcennutzung wurde durch die Trennung von Rechen-, Netzwerk- und Speichersubsystemenmaximiert, wodurch Überlastungsprobleme vermieden wurden, die bei herkömmlichen Architekturen auftreten.
Die Zusammenarbeit zwischen Moonshot AI und der Tsinghua-Universität bietet nicht nur neue technische Ansätze für groß angelegte KI-Inferenz, sondern legt auch den Grundstein für zukünftige regionenübergreifende Rechennetzwerke. Dieses Prefill-as-a-Service-Modell könnte zu einem wichtigen Meilenstein bei der industriellen Einführung großer Modelle werden.
Verwandter Artikel
Der ehemalige OpenAI-Chefwissenschaftler Ilya stellt sein SSI vor und enthüllt das erste Modell
Die KI hat einen weiteren großen Meilenstein erreicht. Nach seinem Ausscheiden aus OpenAI gründete der ehemalige Chefwissenschaftler Ilya Sutskever Safe Superintelligence Inc. (SSI), die kürzlich Details zu ihrem ersten Modell enthüllt hat. Berichten
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Am 14. Mai 2026 gab die KI-Anwendungsentwicklungsplattform Lovable bekannt, dass sie an der 800.000-US-Dollar-Seed-Finanzierungsrunde des dänischen Hardware-Startups Atech beteiligt ist. Angeführt von Lovable zog die Runde erstklassige Wagniskapitalf
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Neue Technologien überwinden den Leistungsengpass großer Sprachmodelle (LLMs). Kürzlich stellten Forscher von Moonshot AI (Moonshot) und der Tsinghua-Universität eine neuartige Architektur namens Prefill-as-a-Service (PrfaaS) vor. Diese Studie befasst sich mit Hardware-Einschränkungen bei der Bereitstellung großer Modelldienste in Rechenzentren, indem sie die Zuweisung von Rechenressourcen optimiert und dadurch die Effizienz der Inferenz erheblich steigert.

Technischer Durchbruch: Eine „chirurgische“ Trennung von Prefill und Decode
Derzeit umfasst der Inferenzprozess für große Sprachmodelle zwei unterschiedliche Phasen:
Prefill-Phase: Diese Phase ist rechenintensiv, da sie die Eingabeverarbeitung übernimmt und einen Schlüssel-Wert-Cache (KVCache) generiert.
Decode-Phase: Diese Phase ist speicher- und bandbreitenintensiv und generiert die Ausgabe Wort für Wort.
In herkömmlichen Architekturen werden beide Phasen in der Regel innerhalb desselben Rechenzentrums oder sogar desselben Servers abgewickelt. Da sie unterschiedliche Anforderungen an die Hardware-Ressourcen stellen, führt diese „erzwungene Bündelung“ oft zu einem Ungleichgewicht bei der Zuweisung von Rechenleistung und Bandbreite, was zu einer Überlastung des Dienstes führt.
Kerninnovation: Effiziente regionenübergreifende Zusammenarbeit
Das zentrale Highlight
Dieses Design beseitigt physische Platzbeschränkungen und ermöglicht es, dass Vorabfüllung und Dekodierung gleichzeitig über verschiedene Rechenzentren hinweg ablaufen. Um eine effiziente Übertragung zu gewährleisten, integriert PrfaaS einen Scheduling-Mechanismus mit zwei Zeitskalen, der Ressourcen flexibel auf der Grundlage von Echtzeit-Verkehrsschwankungen zuweist, gepaart mit präzisem Routing, um zu verhindern, dass lange Textanfragen durch eine ungleichmäßige Ressourcenverteilung verzögert werden.
Testergebnisse: Optimierung von Durchsatz und Latenz
Forschungsdaten belegen, dass die PrfaaS-Architektur in realen Anwendungen eine bemerkenswerte Leistung erbringt:
Der Dienstdurchsatz stieg um 54 %, wodurch sich die Anzahl der pro Zeiteinheit bearbeiteten Anfragen deutlich verbesserte.
Die Antwortlatenz verringerte sich deutlich, wodurch die Generierung des ersten Tokens aus Sicht des Benutzers schneller erfolgte.
Die Ressourcennutzung wurde durch die Trennung von Rechen-, Netzwerk- und Speichersubsystemenmaximiert, wodurch Überlastungsprobleme vermieden wurden, die bei herkömmlichen Architekturen auftreten.
Die Zusammenarbeit zwischen Moonshot AI und der Tsinghua-Universität bietet nicht nur neue technische Ansätze für groß angelegte KI-Inferenz, sondern legt auch den Grundstein für zukünftige regionenübergreifende Rechennetzwerke. Dieses Prefill-as-a-Service-Modell könnte zu einem wichtigen Meilenstein bei der industriellen Einführung großer Modelle werden.
Der ehemalige OpenAI-Chefwissenschaftler Ilya stellt sein SSI vor und enthüllt das erste Modell
Die KI hat einen weiteren großen Meilenstein erreicht. Nach seinem Ausscheiden aus OpenAI gründete der ehemalige Chefwissenschaftler Ilya Sutskever Safe Superintelligence Inc. (SSI), die kürzlich Details zu ihrem ersten Modell enthüllt hat. Berichten
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Am 14. Mai 2026 gab die KI-Anwendungsentwicklungsplattform Lovable bekannt, dass sie an der 800.000-US-Dollar-Seed-Finanzierungsrunde des dänischen Hardware-Startups Atech beteiligt ist. Angeführt von Lovable zog die Runde erstklassige Wagniskapitalf
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn











