Lar
A Apple e a LM Studio colaboram para implementar modelos de linguagem grande locais de grande escala por meio de quatro estúdios Mac.

No evento WWDC2026, realizado recentemente, a LM Studio e a Apple realizaram uma demonstração técnica revolucionária. Durante essa apresentação, elas conseguiram executar o modelo grande da Moonshot com 10 trilhões de parâmetros, o Kimi K2.6, utilizando apenas quatro Mac Studios conectados em um cluster. Esse feito derrubou a suposição antiga de que modelos com trilhões de parâmetros necessariamente exigem clusters de GPU baseados em nuvem, provando que hardware de uso doméstico pode, de fato, oferecer capacidades avançadas de processamento de IA.
O Kimi K2.6 possui um total de 1 trilhão de parâmetros e adota uma arquitetura MoE que ativa 32 bilhões de parâmetros a qualquer momento. Ele suporta o tratamento de contextos longos, o processamento de entradas multimodais e a execução de tarefas por meio de agentes. Para a demonstração, quatro Mac Studios foram conectados entre si por meio das tecnologias de compartilhamento de memória e interconexão da Apple, criando um cluster com aproximadamente 1,5 TB de memória unificada, suficiente para atender às necessidades de inferência desse modelo grande. Testes anteriores realizados por desenvolvedores mostraram que, em condições semelhantes, o Kimi K2.6 conseguia gerar texto a cerca de 28 tokens por segundo, consumindo significativamente menos energia do que soluções tradicionais baseadas em GPU.
Quando conectado diretamente de um iPhone ao cluster local, todos os dados permanecem inteiramente no dispositivo do usuário
Outro destaque da demonstração foi o recurso de acesso remoto LM Link, desenvolvido pela LM Studio. Os usuários podem se conectar remotamente de forma segura ao cluster de Mac Studios a partir de seu MacBook Neo ou iPhone, interagir em tempo real com o modelo em execução, e todo o processamento de dados, bem como a comunicação, ocorrem localmente, sem nenhuma transmissão pela nuvem.
O LM Link foi integrado tanto ao aplicativo para Mac da LM Studio quanto ao app para iOS da Locally AI, oferecendo conexões criptografadas do início ao fim. Essa configuração permite que os usuários acessem o poder de processamento de IA em nível de cluster a qualquer momento, mesmo em dispositivos com menor potência, sem preocupações quanto a violações de privacidade. Juntamente com a tecnologia Thunderbolt 5 RDMA da Apple e outras soluções de compartilhamento de memória entre vários dispositivos, todo esse ecossistema está estabelecendo rapidamente uma estrutura integrada para a implementação local de IA.
Essa colaboração transmite uma mensagem clara: a implantação de modelos grandes com trilhões de parâmetros localmente já não é mais um conceito teórico restrito a laboratórios. Ele está se tornando uma solução viável que os desenvolvedores podem adotar em seus próprios ambientes de trabalho. À medida que a Apple continua a aprimorar suas funcionalidades de conectividade de hardware, espera‑se que as capacidades dos dispositivos de consumo para lidar com inferências de IA em grande escala se expandam ainda mais.
Artigo relacionado
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Recomendações de tópicos especiais relacionados
Comentários (1)

No evento WWDC2026, realizado recentemente, a LM Studio e a Apple realizaram uma demonstração técnica revolucionária. Durante essa apresentação, elas conseguiram executar o modelo grande da Moonshot com 10 trilhões de parâmetros, o Kimi K2.6, utilizando apenas quatro Mac Studios conectados em um cluster. Esse feito derrubou a suposição antiga de que modelos com trilhões de parâmetros necessariamente exigem clusters de GPU baseados em nuvem, provando que hardware de uso doméstico pode, de fato, oferecer capacidades avançadas de processamento de IA.
O Kimi K2.6 possui um total de 1 trilhão de parâmetros e adota uma arquitetura MoE que ativa 32 bilhões de parâmetros a qualquer momento. Ele suporta o tratamento de contextos longos, o processamento de entradas multimodais e a execução de tarefas por meio de agentes. Para a demonstração, quatro Mac Studios foram conectados entre si por meio das tecnologias de compartilhamento de memória e interconexão da Apple, criando um cluster com aproximadamente 1,5 TB de memória unificada, suficiente para atender às necessidades de inferência desse modelo grande. Testes anteriores realizados por desenvolvedores mostraram que, em condições semelhantes, o Kimi K2.6 conseguia gerar texto a cerca de 28 tokens por segundo, consumindo significativamente menos energia do que soluções tradicionais baseadas em GPU.
Quando conectado diretamente de um iPhone ao cluster local, todos os dados permanecem inteiramente no dispositivo do usuário
Outro destaque da demonstração foi o recurso de acesso remoto LM Link, desenvolvido pela LM Studio. Os usuários podem se conectar remotamente de forma segura ao cluster de Mac Studios a partir de seu MacBook Neo ou iPhone, interagir em tempo real com o modelo em execução, e todo o processamento de dados, bem como a comunicação, ocorrem localmente, sem nenhuma transmissão pela nuvem.
O LM Link foi integrado tanto ao aplicativo para Mac da LM Studio quanto ao app para iOS da Locally AI, oferecendo conexões criptografadas do início ao fim. Essa configuração permite que os usuários acessem o poder de processamento de IA em nível de cluster a qualquer momento, mesmo em dispositivos com menor potência, sem preocupações quanto a violações de privacidade. Juntamente com a tecnologia Thunderbolt 5 RDMA da Apple e outras soluções de compartilhamento de memória entre vários dispositivos, todo esse ecossistema está estabelecendo rapidamente uma estrutura integrada para a implementação local de IA.
Essa colaboração transmite uma mensagem clara: a implantação de modelos grandes com trilhões de parâmetros localmente já não é mais um conceito teórico restrito a laboratórios. Ele está se tornando uma solução viável que os desenvolvedores podem adotar em seus próprios ambientes de trabalho. À medida que a Apple continua a aprimorar suas funcionalidades de conectividade de hardware, espera‑se que as capacidades dos dispositivos de consumo para lidar com inferências de IA em grande escala se expandam ainda mais.
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais











