Дом
Компания Moonshot AI и Университет Цинхуа представили архитектуру PrfaaS, призванную устранить «узкое место» в вычислительной мощности крупных моделей
Новые технологии позволяют преодолеть ограничения производительности крупных языковых моделей (LLM). Недавно исследователи из Moonshot AI (Moonshot) и Университета Цинхуа представили новую архитектуру под названием Prefill-as-a-Service (PrfaaS). Это исследование решает проблему аппаратных ограничений при развертывании сервисов на основе крупных моделей в центрах обработки данных за счет оптимизации распределения вычислительных ресурсов, что позволяет значительно повысить эффективность инференса.

Технический прорыв: «хирургическое» разделение этапов предварительного заполнения и декодирования
В настоящее время процесс инференса для больших языковых моделей состоит из двух отдельных фаз:
Фаза предварительного заполнения: эта фаза требует интенсивных вычислений, она обрабатывает входные данные и генерирует кэш «ключ-значение» (KVCache).
Фаза декодирования: эта фаза требует большой пропускной способности памяти и генерирует выходные данные слово за словом.
В традиционных архитектурах обе фазы обычно обрабатываются в одном и том же центре обработки данных или даже на одном и том же сервере. Поскольку они имеют разные потребности в аппаратных ресурсах, такое «принудительное объединение» часто создает дисбаланс в распределении вычислительных ресурсов и пропускной способности, что приводит к перегрузке сервиса.
Основная инновация: эффективное межрегиональное взаимодействие
Основная особенностьPrfaaS — реализация развязанного сервиса. Он переносит вычислительно-емкие задачи предварительного заполнения на специализированные кластеры с высокой вычислительной мощностью. После завершения задачи система использует стандартный Ethernet для удаленной передачи сгенерированного KVCache в локальный кластер декодирования.
Такая конструкция устраняет ограничения физического пространства, позволяя выполнять предварительное заполнение и декодирование одновременно в разных дата-центрах. Для обеспечения эффективной передачи PrfaaS использует механизм планирования с двумя временными масштабами, который гибко распределяет ресурсы с учетом колебаний трафика в реальном времени, в сочетании с точной маршрутизацией, чтобы предотвратить задержки запросов с длинным текстом из-за неравномерного распределения ресурсов.
Результаты тестирования: оптимизация пропускной способности и задержки
Данные исследований показывают, что архитектура PrfaaS демонстрирует замечательную производительность в реальных приложениях:
Пропускная способность сервиса увеличилась на 54%, что значительно повысило количество запросов, обрабатываемых за единицу времени.
Задержка ответа значительно уменьшилась, что ускорило генерацию первого токена с точки зрения пользователя.
Максимальное использование ресурсов за счет разделения вычислительных, сетевых и хранилищных подсистем, что позволяет избежать проблем с перегрузкой, характерных для традиционных архитектур.
Сотрудничество между Moonshot AI и Университетом Цинхуа не только предлагает новые инженерные подходы к крупномасштабному вычислению ИИ, но и закладывает основу для будущих межрегиональных вычислительных сетей. Эта модель Prefill-as-a-Service может стать ключевой вехой на пути к промышленному внедрению крупных моделей.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (1)
Новые технологии позволяют преодолеть ограничения производительности крупных языковых моделей (LLM). Недавно исследователи из Moonshot AI (Moonshot) и Университета Цинхуа представили новую архитектуру под названием Prefill-as-a-Service (PrfaaS). Это исследование решает проблему аппаратных ограничений при развертывании сервисов на основе крупных моделей в центрах обработки данных за счет оптимизации распределения вычислительных ресурсов, что позволяет значительно повысить эффективность инференса.

Технический прорыв: «хирургическое» разделение этапов предварительного заполнения и декодирования
В настоящее время процесс инференса для больших языковых моделей состоит из двух отдельных фаз:
Фаза предварительного заполнения: эта фаза требует интенсивных вычислений, она обрабатывает входные данные и генерирует кэш «ключ-значение» (KVCache).
Фаза декодирования: эта фаза требует большой пропускной способности памяти и генерирует выходные данные слово за словом.
В традиционных архитектурах обе фазы обычно обрабатываются в одном и том же центре обработки данных или даже на одном и том же сервере. Поскольку они имеют разные потребности в аппаратных ресурсах, такое «принудительное объединение» часто создает дисбаланс в распределении вычислительных ресурсов и пропускной способности, что приводит к перегрузке сервиса.
Основная инновация: эффективное межрегиональное взаимодействие
Основная особенность
Такая конструкция устраняет ограничения физического пространства, позволяя выполнять предварительное заполнение и декодирование одновременно в разных дата-центрах. Для обеспечения эффективной передачи PrfaaS использует механизм планирования с двумя временными масштабами, который гибко распределяет ресурсы с учетом колебаний трафика в реальном времени, в сочетании с точной маршрутизацией, чтобы предотвратить задержки запросов с длинным текстом из-за неравномерного распределения ресурсов.
Результаты тестирования: оптимизация пропускной способности и задержки
Данные исследований показывают, что архитектура PrfaaS демонстрирует замечательную производительность в реальных приложениях:
Пропускная способность сервиса увеличилась на 54%, что значительно повысило количество запросов, обрабатываемых за единицу времени.
Задержка ответа значительно уменьшилась, что ускорило генерацию первого токена с точки зрения пользователя.
Максимальное использование ресурсов за счет разделения вычислительных, сетевых и хранилищных подсистем, что позволяет избежать проблем с перегрузкой, характерных для традиционных архитектур.
Сотрудничество между Moonshot AI и Университетом Цинхуа не только предлагает новые инженерные подходы к крупномасштабному вычислению ИИ, но и закладывает основу для будущих межрегиональных вычислительных сетей. Эта модель Prefill-as-a-Service может стать ключевой вехой на пути к промышленному внедрению крупных моделей.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











