вариант
Дом
Срочные новости
Содержание
MatthewScott
MatthewScott
24 сентября 2026 г.

Команда Tencent Huan Yuan переосмысливает размер батча для обучения больших моделей с подкреплением, повышая эффективность. Пересчитывая критический размер батча и корректируя скорости обучения, их подход оптимизирует алгоритмы онлайнного обучения с подкреплением, такие как PPO и GRPO. Этот метод устраняет несоответствия между масштабами генерации откатов и обучения, гарантируя, что каждый ответ учится эффективно без разбавления данных. Реальные тесты показывают увеличение пропускной способности PPO в 2,29 раза и сокращение времени GRPO на 29% при использовании фиксированного оборудования. Эта стратегия позволяет командам обучения максимизировать использование GPU, значительно снижая затраты и ускоряя разработку моделей без необходимости увеличения кластеров или увеличения объема данных.

Автор JosephScott JosephScott 24 сентября 2026 г.
OR