Lar
O Ant Group lança o Ling-2.6-flash de código aberto, a mais recente adição à família de modelos Baoling
A série de modelos de grande porte Baoling, do Ant Group, recebeu hoje uma importante atualização, com o Ling-2.6-flash agora oficialmente disponível para desenvolvedores em todo o mundo. Para se adaptar a diferentes ambientes de hardware e reduzir as barreiras à implantação, este modelo também lançou várias versões de precisão, incluindo BF16, FP8 e INT4, oferecendo aos desenvolvedores opções de inferência mais flexíveis.
Como um modelo Instruct com 104 bilhões de parâmetros totais e 7,4 bilhões de parâmetros ativados, o Ling-2.6-flash foi testado anteriormente sob o codinome “Elephant Alpha” na plataforma OpenRouter. Durante um período de teste de duas semanas, a equipe de desenvolvimento coletou um extenso feedback do mundo real e realizou otimizações direcionadas, aprimorando notavelmente a fluidez da alternância entre os códigos chinês e inglês e melhorando a compatibilidade com as principais estruturas de programação.

Destaques técnicos: arquitetura híbrida e eficiência superior
O principal ponto fortedo Ling-2.6-flash reside em sua arquitetura exclusiva e alta eficiência operacional:
Arquitetura linear híbrida: por meio de otimização computacional de baixo nível, o modelo alcança excelente velocidade de inferência. Com 4 placas H20, ele atinge até 340 tokens/s. Em throughput de pré-preenchimento, ele oferece 2,2 vezes mais do que o Nemotron-3-Super, reduzindo significativamente a latência de resposta.
Notável Índice de Eficiência de Tokens: A equipe calibrou meticulosamente a eficiência de tokens durante o treinamento. Dados de avaliação mostram que, para tarefas de qualidade equivalente, o Ling-2.6-flash consome apenas cerca de 15 milhões de tokens — aproximadamente um décimo dos concorrentes comparáveis —, reduzindo significativamente os custos comerciais.
Aprofundamento de cenários: aprimoramentos direcionados na capacidade do agente
Para cenários de agentes — um dos casos de uso mais comuns para modelos de grande porte —,o Ling-2.6-flash foi especificamente aprimorado. Seja ao lidar com chamadas de ferramentas complexas, planejamento em várias etapas ou execução final de tarefas, o modelo apresenta desempenho confiável. Em várias avaliações padrão do setor, como BFCL-V4 e SWE-bench, mesmo quando comparado a modelos com maior número de parâmetros ativados, o Ling-2.6-flash mantém um desempenho comparável ou até mesmo de ponta (SOTA).
Os desenvolvedores agora podem acessar os recursos de código aberto do modelo por meio do Hugging Face e do ModelScope (Moba Community), abrindo caminho para uma exploração mais profunda de seu potencial em diversas aplicações do setor.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
A série de modelos de grande porte Baoling, do Ant Group, recebeu hoje uma importante atualização, com
Como um modelo Instruct com 104 bilhões de parâmetros totais e 7,4 bilhões de parâmetros ativados,

Destaques técnicos: arquitetura híbrida e eficiência superior
O principal ponto forte
Arquitetura linear híbrida: por meio de otimização computacional de baixo nível, o modelo alcança excelente velocidade de inferência. Com 4 placas H20, ele atinge até 340 tokens/s. Em throughput de pré-preenchimento, ele oferece 2,2 vezes mais do que o Nemotron-3-Super, reduzindo significativamente a latência de resposta.
Notável Índice de Eficiência de Tokens: A equipe calibrou meticulosamente a eficiência de tokens durante o treinamento. Dados de avaliação mostram que, para tarefas de qualidade equivalente,
Aprofundamento de cenários: aprimoramentos direcionados na capacidade do agente
Para cenários de agentes — um dos casos de uso mais comuns para modelos de grande porte —,
Os desenvolvedores agora podem acessar os recursos de código aberto do modelo por meio do Hugging Face e do ModelScope (Moba Community), abrindo caminho para uma exploração mais profunda de seu potencial em diversas aplicações do setor.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











