вариант
Дом
Срочные новости
Содержание
ChristopherAllen
ChristopherAllen
28 мая 2026 г.

NVIDIA предоставила в открытый доступ Polar – фреймворк для обучения методом усиленного обучения, который позволяет интегрировать существующие агенты на основе кода, такие как Codex, Claude Code и Qwen Code, в процесс обучения по алгоритму GRPO без необходимости изменения исходного кода. Этот фреймворк рассматривает границы API моделей как точки входа для процесса обучения, что позволяет осуществлять перехват данных и восстановление их хода во время выполнения алгоритма. В ходе тестов SWE-Bench показатель успеха решения Codex увеличился с 3,8% до 26,4%; время, необходимое для обучения, сократилось в 5,39 раза, а эффективность использования GPU выросла с 20,4% до 87,7%.

NVIDIA предоставила в открытый доступ Polar – фреймворк для обучения методом усиленного обучения, который позволяет интегрировать существующие агенты на основе кода, такие как Codex, Claude Code и Qwen Code, в процесс обучения по алгоритму GRPO без необходимости изменения исходного кода. Этот фреймворк рассматривает границы API моделей как точки входа для процесса обучения, что позволяет осуществлять перехват данных и восстановление их хода во время выполнения алгоритма. В ходе тестов SWE-Bench показатель успеха решения Codex увеличился с 3,8% до 26,4%; время, необходимое для обучения, сократилось в 5,39 раза, а эффективность использования GPU выросла с 20,4% до 87,7%. NVIDIA предоставила в открытый доступ Polar – фреймворк для обучения методом усиленного обучения, который позволяет интегрировать существующие агенты на основе кода, такие как Codex, Claude Code и Qwen Code, в процесс обучения по алгоритму GRPO без необходимости изменения исходного кода. Этот фреймворк рассматривает границы API моделей как точки входа для процесса обучения, что позволяет осуществлять перехват данных и восстановление их хода во время выполнения алгоритма. В ходе тестов SWE-Bench показатель успеха решения Codex увеличился с 3,8% до 26,4%; время, необходимое для обучения, сократилось в 5,39 раза, а эффективность использования GPU выросла с 20,4% до 87,7%.
OR