Lar
O plug-in vLLM-ATOM da AMD otimiza a inferência para grandes modelos de IA de uso doméstico
A AMD lançou oficialmente o plug-in vLLM-ATOM, projetado especificamente para a implantação de grandes modelos de linguagem. Esse plug-in visa melhorar significativamente o desempenho de inferência de grandes modelos nacionais de uso comum, como o DeepSeek-R1 e o Kimi-K2, em hardware AMD, sem interromper os fluxos de trabalho existentes.
Como uma estrutura de inferência de código aberto criada para cenários de alta simultaneidade, o vLLM é reconhecido por sua alta eficiência de memória. O novo plug-in da AMD oferece uma solução de otimização mais personalizada para suas GPUs da série Instinct, permitindo que os desenvolvedores realizem a migração técnica com o mínimo de esforço de aprendizagem.

Melhoria de desempenho sem interrupções
A principal vantagem do plug-in vLLM-ATOM é sua implantação de “custo zero”. Os usuários não precisam modificar suas APIs existentes nem seus fluxos de trabalho de ponta a ponta. O plug-in gerencia e otimiza automaticamente o agendamento de solicitações e o ajuste do kernel em segundo plano, permitindo que os serviços atuais façam uma transição suave para o backend de hardware da AMD.
Em termos de arquitetura, o plug-in é estruturado em três camadas: a camada superior garante a compatibilidade com a interface OpenAI, a camada intermediária lida com a execução e o roteamento do modelo, e a camada inferior fornece os kernels principais da GPU. Esse design integra efetivamente tecnologias de mistura de especialistas (MoE) e quantização, garantindo suporte robusto para implantações em grande escala.
Ampla compatibilidade em ecossistemas de computação
O plug-in é voltado para as GPUs de alto desempenho das séries Instinct MI350 e MI400 da AMD. Ele oferece suporte não apenas aos principais modelos de linguagem de grande porte da China, como Qwen3 e GLM, mas também abrange de forma abrangente diversos cenários de aplicação, incluindo modelos densos, modelos de mistura de especialistas e modelos de visão-linguagem (VLMs).
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
A AMD lançou oficialmente o plug-in vLLM-ATOM, projetado especificamente para a implantação de grandes modelos de linguagem. Esse plug-in visa melhorar significativamente o desempenho de inferência de grandes modelos nacionais de uso comum, como o DeepSeek-R1 e o Kimi-K2, em hardware AMD, sem interromper os fluxos de trabalho existentes.
Como uma estrutura de inferência de código aberto criada para cenários de alta simultaneidade, o vLLM é reconhecido por sua alta eficiência de memória. O novo plug-in da AMD oferece uma solução de otimização mais personalizada para suas GPUs da série Instinct, permitindo que os desenvolvedores realizem a migração técnica com o mínimo de esforço de aprendizagem.

Melhoria de desempenho sem interrupções
A principal vantagem do plug-in vLLM-ATOM é sua implantação de “custo zero”. Os usuários não precisam modificar suas APIs existentes nem seus fluxos de trabalho de ponta a ponta. O plug-in gerencia e otimiza automaticamente o agendamento de solicitações e o ajuste do kernel em segundo plano, permitindo que os serviços atuais façam uma transição suave para o backend de hardware da AMD.
Em termos de arquitetura, o plug-in é estruturado em três camadas: a camada superior garante a compatibilidade com a interface OpenAI, a camada intermediária lida com a execução e o roteamento do modelo, e a camada inferior fornece os kernels principais da GPU. Esse design integra efetivamente tecnologias de mistura de especialistas (MoE) e quantização, garantindo suporte robusto para implantações em grande escala.
Ampla compatibilidade em ecossistemas de computação
O plug-in é voltado para as GPUs de alto desempenho das séries Instinct MI350 e MI400 da AMD. Ele oferece suporte não apenas aos principais modelos de linguagem de grande porte da China, como Qwen3 e GLM, mas também abrange de forma abrangente diversos cenários de aplicação, incluindo modelos densos, modelos de mistura de especialistas e modelos de visão-linguagem (VLMs).
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











