Дом
Tencent Hunyuan интегрирует теорию размера критических точек в обучение с подкреплением PPO, увеличивая пропускную способность в 2,29 раза и сокращая время обучения GRPO на 29 процентов

По мере масштабирования обучения с подкреплением для больших моделей до более крупных кластеров GPU и более плотных обучающих наборов данных эффективность обучения становится критически важным приоритетом. Недавние исследования команды Tencent Huan Yuan решают часто игнорируемую проблему: когда модели генерируют собственные обучающие данные, как следует переопределять размеры пакетов с учетом различных скоростей генерации развертывания и обучения?
Опираясь на классическую теорию критического размера пакета, исследование заново выводит это понятие для онлайн-обучения с подкреплением больших языковых моделей. Результаты предлагают практическое решение: путем корректировки скорости обучения в определенном диапазоне по мере увеличения размера пакета как алгоритмы GRPO, так и PPO могут гарантировать, что каждый ответ будет эффективно обучаться без разбавления. Это указывает на то, что размер пакета не является просто «чем больше, тем лучше» или фиксированным значением; скорее, он существует в оптимальном диапазоне, который можно тонко настроить для максимальной эффективности.
Влияние на реальные аппаратные затраты значительно. При фиксированных аппаратных конфигурациях увеличение размера пакета может повысить пропускную способность генерации PPO до 2,29 раз. В то же время оптимальная конфигурация GRPO достигает тех же целей валидации на 29% быстрее. Для команд, активно инвестирующих в ресурсы GPU, это означает либо более быстрое выполнение задач с тем же кластером, либо обработку большего объема данных в тот же период времени, что эффективно снижает затраты на самом дорогостоящем этапе обучения с подкреплением.
Это исследование предоставляет практический рычаг для масштабирования онлайн-обучения с подкреплением, где модель выступает одновременно и студентом, и составителем вопросов. Разрыв в эффективности возникает из-за несоответствия масштабов генерации и обучения, которое это исследование преодолевает путем сочетания теории критического размера пакета с корректировками скорости обучения. В то время как отрасль соревнуется в создании самых больших моделей, Tencent Huan Yuan сосредотачивается на оптимизации существующего оборудования для большей экономической эффективности.
Связанная статья
Стартапы в сфере искусственного интеллекта ускоряют рост выручки
Как устоявшие компании, так и новые стартапы активно стремятся использовать искусственный интеллект, и многочисленные AI-стартапы сообщают, что их выручка не просто растет, а ускоряется стремительными темпами, достигая последующих вех все более корот
Амад Масад из Replit о сделке с Cursor, борьбе с Apple и о том, почему он предпочитает не продавать компанию
Амджад Масад потратил последние десять лет на создание Replit, однако последние 18 месяцев стали для него периодом трансформации. Платформа для написания кода с использованием ИИ выросла с годовой выручки в 2,8 миллиона долларов в 2024 году до траект
ИИ-агенты повышают эффективность выращивания креветок, пока Министерство промышленности и информатизации Китая выносит предупреждение, а Rockchip дает ответ
В сообществе искусственного интеллекта фокус дискуссий сместился с «обучения больших моделей» на «выращивание лобстеров». Если вы видите в социальных сетях обсуждения того, как кормить данными и настраивать параметры «лобстера», не путайтесь — речь и
Рекомендации по связанным специальным темам
Комментарии (0)

По мере масштабирования обучения с подкреплением для больших моделей до более крупных кластеров GPU и более плотных обучающих наборов данных эффективность обучения становится критически важным приоритетом. Недавние исследования команды Tencent Huan Yuan решают часто игнорируемую проблему: когда модели генерируют собственные обучающие данные, как следует переопределять размеры пакетов с учетом различных скоростей генерации развертывания и обучения?
Опираясь на классическую теорию критического размера пакета, исследование заново выводит это понятие для онлайн-обучения с подкреплением больших языковых моделей. Результаты предлагают практическое решение: путем корректировки скорости обучения в определенном диапазоне по мере увеличения размера пакета как алгоритмы GRPO, так и PPO могут гарантировать, что каждый ответ будет эффективно обучаться без разбавления. Это указывает на то, что размер пакета не является просто «чем больше, тем лучше» или фиксированным значением; скорее, он существует в оптимальном диапазоне, который можно тонко настроить для максимальной эффективности.
Влияние на реальные аппаратные затраты значительно. При фиксированных аппаратных конфигурациях увеличение размера пакета может повысить пропускную способность генерации PPO до 2,29 раз. В то же время оптимальная конфигурация GRPO достигает тех же целей валидации на 29% быстрее. Для команд, активно инвестирующих в ресурсы GPU, это означает либо более быстрое выполнение задач с тем же кластером, либо обработку большего объема данных в тот же период времени, что эффективно снижает затраты на самом дорогостоящем этапе обучения с подкреплением.
Это исследование предоставляет практический рычаг для масштабирования онлайн-обучения с подкреплением, где модель выступает одновременно и студентом, и составителем вопросов. Разрыв в эффективности возникает из-за несоответствия масштабов генерации и обучения, которое это исследование преодолевает путем сочетания теории критического размера пакета с корректировками скорости обучения. В то время как отрасль соревнуется в создании самых больших моделей, Tencent Huan Yuan сосредотачивается на оптимизации существующего оборудования для большей экономической эффективности.
Стартапы в сфере искусственного интеллекта ускоряют рост выручки
Как устоявшие компании, так и новые стартапы активно стремятся использовать искусственный интеллект, и многочисленные AI-стартапы сообщают, что их выручка не просто растет, а ускоряется стремительными темпами, достигая последующих вех все более корот
Амад Масад из Replit о сделке с Cursor, борьбе с Apple и о том, почему он предпочитает не продавать компанию
Амджад Масад потратил последние десять лет на создание Replit, однако последние 18 месяцев стали для него периодом трансформации. Платформа для написания кода с использованием ИИ выросла с годовой выручки в 2,8 миллиона долларов в 2024 году до траект
ИИ-агенты повышают эффективность выращивания креветок, пока Министерство промышленности и информатизации Китая выносит предупреждение, а Rockchip дает ответ
В сообществе искусственного интеллекта фокус дискуссий сместился с «обучения больших моделей» на «выращивание лобстеров». Если вы видите в социальных сетях обсуждения того, как кормить данными и настраивать параметры «лобстера», не путайтесь — речь и











