Lar
Lançamento do modelo preliminar do LFM2.5 DSpark: velocidade de inferência aumentada em 3,18 vezes
A Liquid AI e a Hugging Face lançaram oficialmente os checkpoints preliminares do modelo DSpark para a série LFM2.5, abrangendo o LFM2.5-1.2B-Instruct, o LFM2.5-2.6B e o LFM2.5-8B-A1B. Essa inovação introduz um novo caminho de decodificação especulativa que aumenta significativamente a taxa de processamento de inferência, ao mesmo tempo em que preserva a qualidade da saída.
Principais ganhos de desempenho e aplicações no mundo real
Testes no mundo real demonstram a impressionante aceleração do DSpark. Em GPUs, a taxa de processamento aumenta em até 3,18 vezes, enquanto dispositivos de borda apresentam melhorias de até 2,87 vezes.
Na inferência de agentes de borda, o LFM2.5-2.6B reduz a latência das chamadas de função em uma média de 57%. Testado em um MacBook Pro M4 Max, ele atinge velocidades de até 139 tokens por segundo, diminuindo a barreira para a implantação de agentes locais e proporcionando uma experiência do usuário que rivaliza com modelos proprietários na nuvem.

Entendendo a arquitetura e o mecanismo do DSpark
A inferência tradicional de LLM é limitada pela largura de banda da memória, já que a maior parte do tempo é gasta na transmissão de pesos da DRAM para a SRAM. A decodificação especulativa resolve isso usando um modelo preliminar leve para gerar tokens candidatos, que são então validados em uma única passagem de avanço pelo modelo de destino, distribuindo efetivamente os custos de carregamento de pesos.
O DSpark integra métodos existentes por meio de três componentes principais:
Rede de Backbone Paralela: semelhante ao DFlash, ela gera estados ocultos para todos os tokens preliminares em uma única passagem direta com base nas características de contexto do modelo-alvo.Cabeça Sequencial (Cabeça de Markov): Ao simular cadeias de Markov entre tokens adjacentes, ela reforça as dependências e melhora a taxa de aceitação para posições subsequentes.Validador de Agendamento de Confiança: Ele prevê a probabilidade de sobrevivência de cada token, descartando automaticamente sufixos de baixa confiança quando os custos de validação superam a economia.Para o treinamento, o modelo preliminar utiliza uma combinação diversificada de conjuntos de dados, incluindo SFT, bate-papo, código e chamadas de função. Após rigorosos estudos de ablação, a versão inicial apresenta uma arquitetura baseada exclusivamente em atenção, com 5 camadas e 9 blocos, mantendo os parâmetros em torno de 300 milhões.

Garantia de Qualidade e Integração ao Ecossistema
Devido à decodificação especulativa, a decodificação gananciosa aceita apenas tokens preliminares que correspondam perfeitamente à distribuição do modelo-alvo. Os tokens rejeitados são substituídos pela saída do modelo-alvo, garantindo que a sequência gerada corresponda à estrutura de decodificação gananciosa de referência, sem perda de precisão nos benchmarks.
No lançamento, o DSpark alcançou compatibilidade com as principais estruturas de inferência:
SGLang: Oferece suporte à execução em aceleradores por meio de integração dedicada e configurações de inicialização.llama.cpp: Oferece suporte oficial à compilação, permitindo que os usuários carreguem os pesos GGUF correspondentes e os arquivos do modelo preliminar por meio da linha de comando.
Artigo relacionado
Por que a Abnormal AI fez uma parceria com a OpenAI no Daybreak
Michael Aiello, chefe de produtos de segurança cibernética da OpenAI | Crédito: Michael Aiello/LinkedInA Abnormal AI passa a integrar o programa Daybreak da OpenAI, e Mike Aiello afirma que a parceria
A Claw, da AI Agent Elements, conclui o desenvolvimento de um material supercondutor
À medida que a inteligência artificial amplia os limites da exploração científica, um marco significativo foi alcançado. Em 3 de julho, a Alibaba DAMO Academy, em parceria com a Universidade Renmin da
Como verificar a classificação de SEO no Google Japão e Yahoo Japão de forma eficaz
Transforme uma Foto de Retrato em um Esboço de Harry PotterSumário:IntroduçãoConvertendo uma Fotografia em um EsboçoUsando o Filtro MínimoUma Técnica Diferente para Converter RetratosComeçandoBaixe a Imagem NecessáriaPrepare as CamadasDessat
Recomendações de tópicos especiais relacionados
Comentários (0)
A Liquid AI e a Hugging Face lançaram oficialmente os checkpoints preliminares do modelo DSpark para a série LFM2.5, abrangendo o LFM2.5-1.2B-Instruct, o LFM2.5-2.6B e o LFM2.5-8B-A1B. Essa inovação introduz um novo caminho de decodificação especulativa que aumenta significativamente a taxa de processamento de inferência, ao mesmo tempo em que preserva a qualidade da saída.
Principais ganhos de desempenho e aplicações no mundo real
Testes no mundo real demonstram a impressionante aceleração do DSpark. Em GPUs, a taxa de processamento aumenta em até 3,18 vezes, enquanto dispositivos de borda apresentam melhorias de até 2,87 vezes.
Na inferência de agentes de borda, o LFM2.5-2.6B reduz a latência das chamadas de função em uma média de 57%. Testado em um MacBook Pro M4 Max, ele atinge velocidades de até 139 tokens por segundo, diminuindo a barreira para a implantação de agentes locais e proporcionando uma experiência do usuário que rivaliza com modelos proprietários na nuvem.

Entendendo a arquitetura e o mecanismo do DSpark
A inferência tradicional de LLM é limitada pela largura de banda da memória, já que a maior parte do tempo é gasta na transmissão de pesos da DRAM para a SRAM. A decodificação especulativa resolve isso usando um modelo preliminar leve para gerar tokens candidatos, que são então validados em uma única passagem de avanço pelo modelo de destino, distribuindo efetivamente os custos de carregamento de pesos.
O DSpark integra métodos existentes por meio de três componentes principais:
Rede de Backbone Paralela: semelhante ao DFlash, ela gera estados ocultos para todos os tokens preliminares em uma única passagem direta com base nas características de contexto do modelo-alvo.Cabeça Sequencial (Cabeça de Markov): Ao simular cadeias de Markov entre tokens adjacentes, ela reforça as dependências e melhora a taxa de aceitação para posições subsequentes.Validador de Agendamento de Confiança: Ele prevê a probabilidade de sobrevivência de cada token, descartando automaticamente sufixos de baixa confiança quando os custos de validação superam a economia.Para o treinamento, o modelo preliminar utiliza uma combinação diversificada de conjuntos de dados, incluindo SFT, bate-papo, código e chamadas de função. Após rigorosos estudos de ablação, a versão inicial apresenta uma arquitetura baseada exclusivamente em atenção, com 5 camadas e 9 blocos, mantendo os parâmetros em torno de 300 milhões.

Garantia de Qualidade e Integração ao Ecossistema
Devido à decodificação especulativa, a decodificação gananciosa aceita apenas tokens preliminares que correspondam perfeitamente à distribuição do modelo-alvo. Os tokens rejeitados são substituídos pela saída do modelo-alvo, garantindo que a sequência gerada corresponda à estrutura de decodificação gananciosa de referência, sem perda de precisão nos benchmarks.
No lançamento, o DSpark alcançou compatibilidade com as principais estruturas de inferência:
SGLang: Oferece suporte à execução em aceleradores por meio de integração dedicada e configurações de inicialização.llama.cpp: Oferece suporte oficial à compilação, permitindo que os usuários carreguem os pesos GGUF correspondentes e os arquivos do modelo preliminar por meio da linha de comando.
Por que a Abnormal AI fez uma parceria com a OpenAI no Daybreak
Michael Aiello, chefe de produtos de segurança cibernética da OpenAI | Crédito: Michael Aiello/LinkedInA Abnormal AI passa a integrar o programa Daybreak da OpenAI, e Mike Aiello afirma que a parceria
A Claw, da AI Agent Elements, conclui o desenvolvimento de um material supercondutor
À medida que a inteligência artificial amplia os limites da exploração científica, um marco significativo foi alcançado. Em 3 de julho, a Alibaba DAMO Academy, em parceria com a Universidade Renmin da
Como verificar a classificação de SEO no Google Japão e Yahoo Japão de forma eficaz
Transforme uma Foto de Retrato em um Esboço de Harry PotterSumário:IntroduçãoConvertendo uma Fotografia em um EsboçoUsando o Filtro MínimoUma Técnica Diferente para Converter RetratosComeçandoBaixe a Imagem NecessáriaPrepare as CamadasDessat











