Heim
Tencent Hunyuan integriert die Theorie der kritischen Punktgröße in das PPO-Verstärkungslernen, wodurch der Durchsatz um das 2,29-fache gesteigert und die GRPO-Trainingszeit um 29 Prozent reduziert wird.

Da das Reinforcement Learning für große Modelle auf größere GPU-Cluster und dichtere Trainingsdatensätze skaliert, ist die Trainingsleistung zu einer entscheidenden Priorität geworden. Aktuelle Forschungsergebnisse des Tencent Huan Yuan-Teams adressieren eine häufig übersehene Herausforderung: Wenn Modelle ihre eigenen Trainingsdaten generieren, wie sollten dann die Batch-Größen angesichts der unterschiedlichen Geschwindigkeiten von Rollout-Generierung und Training neu definiert werden?
Aufbauend auf der klassischen Theorie der kritischen Batch-Größe leitet die Studie dieses Konzept für das Online-Reinforcement-Learning großer Sprachmodelle neu ab. Die Ergebnisse bieten eine praktische Lösung: Durch Anpassung der Lernrate innerhalb eines bestimmten Bereichs, wenn die Batch-Größe zunimmt, können sowohl GRPO- als auch PPO-Algorithmen sicherstellen, dass jede Antwort effektiv lernt, ohne verwässert zu werden. Dies zeigt, dass die Batch-Größe nicht einfach „je größer, desto besser“ ist oder ein fester Wert darstellt; vielmehr existiert sie in einem optimalen Bereich, der für maximale Effizienz feinjustiert werden kann.
Die Auswirkungen auf die realen Hardwarekosten sind erheblich. Bei festen Hardwarekonfigurationen kann eine Erhöhung der Batch-Größe den PPO-Generierungsdurchsatz um bis zu 2,29-fache steigern. Gleichzeitig erreicht die optimale GRPO-Konfiguration dieselben Validierungsziele in 29 % weniger Zeit. Für Teams, die stark in GPU-Ressourcen investieren, bedeutet dies entweder schnellere Aufgabenerledigung mit demselben Cluster oder die Verarbeitung größerer Datenmengen im selben Zeitrahmen, was effektiv die Kosten in der teuersten Phase des Reinforcement Learnings senkt.
Diese Forschung bietet einen praktischen Hebel zur Skalierung von Online-RL, bei dem das Modell sowohl Schüler als auch Fragesteller ist. Die Effizienzlücke entsteht durch die Diskrepanz zwischen Generierungs- und Trainingsumfängen, die diese Studie durch die Kombination der Theorie der kritischen Batch-Größe mit Lernratenanpassungen überbrückt. Während die Branche darum wetteifert, die größten Modelle zu bauen, konzentriert sich Tencent Huan Yuan auf die Optimierung bestehender Hardware für eine höhere Kosteneffektivität.
Verwandter Artikel
KI-Startups beschleunigen das Umsatzwachstum
Wie etablierte Unternehmen und aufstrebende Startups um die Nutzung künstlicher Intelligenz konkurrieren, berichten zahlreiche KI-Startups davon, dass ihre Einnahmen nicht nur wachsen, sondern sich rapide beschleunigen und nachfolgende Meilensteine i
Replits Amjad Masad zum Cursor-Deal, zum Kampf gegen Apple und warum er es vorzieht, nicht zu verkaufen
Amjad Masad hat das letzte Jahrzehnt damit verbracht, Replit aufzubauen, doch die vergangenen 18 Monate waren eine transformative Periode. Die KI-Coding-Plattform ist von 2,8 Millionen US-Dollar Jahresumsatz im Jahr 2024 auf eine Trajektorie gestiege
KI-Agenten steigern die Garnelenzucht, während das MIIT eine Warnung herausgibt und Rockchip reagiert
Die Diskussion in der KI-Community hat sich von „das Training großer Modelle“ hin zu „dem Züchten von Hummern“ verschoben. Wenn Sie in den sozialen Medien jemanden dabei beobachten, wie er diskutiert, wie man Daten füttert und Parameter für einen „Hu
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Da das Reinforcement Learning für große Modelle auf größere GPU-Cluster und dichtere Trainingsdatensätze skaliert, ist die Trainingsleistung zu einer entscheidenden Priorität geworden. Aktuelle Forschungsergebnisse des Tencent Huan Yuan-Teams adressieren eine häufig übersehene Herausforderung: Wenn Modelle ihre eigenen Trainingsdaten generieren, wie sollten dann die Batch-Größen angesichts der unterschiedlichen Geschwindigkeiten von Rollout-Generierung und Training neu definiert werden?
Aufbauend auf der klassischen Theorie der kritischen Batch-Größe leitet die Studie dieses Konzept für das Online-Reinforcement-Learning großer Sprachmodelle neu ab. Die Ergebnisse bieten eine praktische Lösung: Durch Anpassung der Lernrate innerhalb eines bestimmten Bereichs, wenn die Batch-Größe zunimmt, können sowohl GRPO- als auch PPO-Algorithmen sicherstellen, dass jede Antwort effektiv lernt, ohne verwässert zu werden. Dies zeigt, dass die Batch-Größe nicht einfach „je größer, desto besser“ ist oder ein fester Wert darstellt; vielmehr existiert sie in einem optimalen Bereich, der für maximale Effizienz feinjustiert werden kann.
Die Auswirkungen auf die realen Hardwarekosten sind erheblich. Bei festen Hardwarekonfigurationen kann eine Erhöhung der Batch-Größe den PPO-Generierungsdurchsatz um bis zu 2,29-fache steigern. Gleichzeitig erreicht die optimale GRPO-Konfiguration dieselben Validierungsziele in 29 % weniger Zeit. Für Teams, die stark in GPU-Ressourcen investieren, bedeutet dies entweder schnellere Aufgabenerledigung mit demselben Cluster oder die Verarbeitung größerer Datenmengen im selben Zeitrahmen, was effektiv die Kosten in der teuersten Phase des Reinforcement Learnings senkt.
Diese Forschung bietet einen praktischen Hebel zur Skalierung von Online-RL, bei dem das Modell sowohl Schüler als auch Fragesteller ist. Die Effizienzlücke entsteht durch die Diskrepanz zwischen Generierungs- und Trainingsumfängen, die diese Studie durch die Kombination der Theorie der kritischen Batch-Größe mit Lernratenanpassungen überbrückt. Während die Branche darum wetteifert, die größten Modelle zu bauen, konzentriert sich Tencent Huan Yuan auf die Optimierung bestehender Hardware für eine höhere Kosteneffektivität.
KI-Startups beschleunigen das Umsatzwachstum
Wie etablierte Unternehmen und aufstrebende Startups um die Nutzung künstlicher Intelligenz konkurrieren, berichten zahlreiche KI-Startups davon, dass ihre Einnahmen nicht nur wachsen, sondern sich rapide beschleunigen und nachfolgende Meilensteine i
Replits Amjad Masad zum Cursor-Deal, zum Kampf gegen Apple und warum er es vorzieht, nicht zu verkaufen
Amjad Masad hat das letzte Jahrzehnt damit verbracht, Replit aufzubauen, doch die vergangenen 18 Monate waren eine transformative Periode. Die KI-Coding-Plattform ist von 2,8 Millionen US-Dollar Jahresumsatz im Jahr 2024 auf eine Trajektorie gestiege
KI-Agenten steigern die Garnelenzucht, während das MIIT eine Warnung herausgibt und Rockchip reagiert
Die Diskussion in der KI-Community hat sich von „das Training großer Modelle“ hin zu „dem Züchten von Hummern“ verschoben. Wenn Sie in den sozialen Medien jemanden dabei beobachten, wie er diskutiert, wie man Daten füttert und Parameter für einen „Hu











