Option
Heim
Eilmeldung
Inhalt
ChristopherAllen
ChristopherAllen
28. Mai 2026

NVIDIA hat Polar als Open-Source-Software veröffentlicht – ein Framework für das Reinforcement-Learning-Training, das bestehende Code-Agenten wie Codex, Claude Code und Qwen Code ohne Änderungen am ursprünglichen Code in das GRPO-Trainingsverfahren integriert. Es betrachtet die Grenzen der Model-APIs als Einstiegspunkte für das Training, wodurch eine Interception sowie eine Nachrekonstruktion des Trainingsprozesses ermöglicht werden. In den SWE-Bench-Tests stieg die Erfolgsrate von Codex von 3,8 % auf 26,4 %. Die Gesamtzeit des Trainings verkürzte sich um das Fünffache, und die Auslastung der GPU erhöhte sich von 20,4 % auf 87,7 %.

NVIDIA hat Polar als Open-Source-Software veröffentlicht – ein Framework für das Reinforcement-Learning-Training, das bestehende Code-Agenten wie Codex, Claude Code und Qwen Code ohne Änderungen am ursprünglichen Code in das GRPO-Trainingsverfahren integriert. Es betrachtet die Grenzen der Model-APIs als Einstiegspunkte für das Training, wodurch eine Interception sowie eine Nachrekonstruktion des Trainingsprozesses ermöglicht werden. In den SWE-Bench-Tests stieg die Erfolgsrate von Codex von 3,8 % auf 26,4 %. Die Gesamtzeit des Trainings verkürzte sich um das Fünffache, und die Auslastung der GPU erhöhte sich von 20,4 % auf 87,7 %. NVIDIA hat Polar als Open-Source-Software veröffentlicht – ein Framework für das Reinforcement-Learning-Training, das bestehende Code-Agenten wie Codex, Claude Code und Qwen Code ohne Änderungen am ursprünglichen Code in das GRPO-Trainingsverfahren integriert. Es betrachtet die Grenzen der Model-APIs als Einstiegspunkte für das Training, wodurch eine Interception sowie eine Nachrekonstruktion des Trainingsprozesses ermöglicht werden. In den SWE-Bench-Tests stieg die Erfolgsrate von Codex von 3,8 % auf 26,4 %. Die Gesamtzeit des Trainings verkürzte sich um das Fünffache, und die Auslastung der GPU erhöhte sich von 20,4 % auf 87,7 %.
Kommentare (0)
0/300
OR