Lar
DeepSeek-V4.1-Flash estreia na plataforma Qwen AI com API e plano de tokens disponíveis
O DeepSeek-V4.1-Flash já está disponível na plataforma Qwen AI, oferecendo tanto acesso via API quanto um Plano de Tokens flexível. Os desenvolvedores podem integrar perfeitamente o modelo em seus fluxos de trabalho por meio de APIs padrão ou aproveitar o Plano de Tokens diretamente em ferramentas como Qoder, o APP Qwen e Codex para codificação, documentação, análise visual e tarefas baseadas em agentes.

Descrito como o novo flagship leve da DeepSeek, este modelo utiliza uma arquitetura MoE com 552 bilhões de parâmetros totais. Ele emprega uma estrutura assimétrica Causal-Encoder-Decoder, ativando apenas ~8 bilhões de parâmetros para a entrada e ~16 bilhões para a saída. Com suporte nativo à compreensão de texto e imagens, ele lida com janelas de contexto de até 1 milhão de tokens e gera saídas de aproximadamente 393K. Os benchmarks oficiais indicam melhorias significativas no desempenho de Agentes e código, oferecendo alta taxa de transferência e baixa latência apesar dos custos reduzidos de ativação.
A eficiência de custos é um destaque principal. A compactação avançada de cache reduz os requisitos de HBM do KV Cache para 25% e as necessidades de armazenamento em SSD para 12,5% das gerações anteriores, otimizando recursos para contextos longos e interações multi-turno. A precificação na plataforma Qwen é em camadas: a entrada custa 1 CNY por milhão de tokens durante horários fora de pico (2 CNY em horário de pico), enquanto a saída é de 4 CNY por milhão de tokens (8 CNY em horário de pico). Os limites de taxa estão em 15K RPM e 1M TPM, suportando conclusão de prefixo, chamada de funções, cache, saída estruturada, processamento em lote e pesquisa online.
A Alibaba Cloud BaiLian estabeleceu parceria com a comunidade de código aberto vLLM para garantir uma ampla implantação na China e em regiões internacionais, incluindo Pequim, Cingapura, EUA, Alemanha, Japão e Hong Kong. O modelo suporta conversas multi-turno, chamadas de funções, pesquisa online, cache de contexto e saída estruturada, com um limite de max_tokens de ~393.216. Isso o torna ideal para empresas que migram a análise de documentos longos, bases de conhecimento de atendimento ao cliente, perguntas e respostas de repositórios de código e revisões de pedidos multimodais para uma interface unificada.
Analistas da indústria sugerem que a integração de "grandes parâmetros, pequena ativação e cache robusto" no ecossistema Qwen reduz os custos de tentativa e erro para agentes de contexto longo. Para pequenas equipes, a combinação de preços baixos fora de pico e assinaturas flexíveis do Plano de Tokens permite inferência em lote mais ágil e validação rápida de protótipos.
Artigo relacionado
O GitHub Copilot integra o GPT-5.4 em poucas horas
O GitHub Copilot mais uma vez provou suas capacidades de resposta rápida. Poucas horas após a OpenAI lançar seu mais recente modelo principal, o GPT-5.4, o GitHub anunciou a integração completa, fornecendo aos desenvolvedores de todo o mundo assistên
A Anthropic lidera o IPO, e a indústria de IA entra em uma nova era de receitas de trilhões de dólares
O setor global de IA atingiu outro grande marco. Dados recentes de mercado revelam que a startup de IA Anthropic apresentou um pedido de IPO confidencial em 1º de junho. Se aprovado, a Anthropic está prestes a se tornar a empresa de capital aberto ma
Como otimizar o SEO para o Google Japão e o Yahoo Japão?
A cidade conectada já está aqui, mas parece comumA infraestrutura de IoT mais útil raramente tem aparência futurista. Assemelha-se a uma lixeira que sabe quando está cheia, a uma van que relata falhas no motor antes de quebrar, a uma vaga de estacio
Recomendações de tópicos especiais relacionados
Comentários (0)
O DeepSeek-V4.1-Flash já está disponível na plataforma Qwen AI, oferecendo tanto acesso via API quanto um Plano de Tokens flexível. Os desenvolvedores podem integrar perfeitamente o modelo em seus fluxos de trabalho por meio de APIs padrão ou aproveitar o Plano de Tokens diretamente em ferramentas como Qoder, o APP Qwen e Codex para codificação, documentação, análise visual e tarefas baseadas em agentes.

Descrito como o novo flagship leve da DeepSeek, este modelo utiliza uma arquitetura MoE com 552 bilhões de parâmetros totais. Ele emprega uma estrutura assimétrica Causal-Encoder-Decoder, ativando apenas ~8 bilhões de parâmetros para a entrada e ~16 bilhões para a saída. Com suporte nativo à compreensão de texto e imagens, ele lida com janelas de contexto de até 1 milhão de tokens e gera saídas de aproximadamente 393K. Os benchmarks oficiais indicam melhorias significativas no desempenho de Agentes e código, oferecendo alta taxa de transferência e baixa latência apesar dos custos reduzidos de ativação.
A eficiência de custos é um destaque principal. A compactação avançada de cache reduz os requisitos de HBM do KV Cache para 25% e as necessidades de armazenamento em SSD para 12,5% das gerações anteriores, otimizando recursos para contextos longos e interações multi-turno. A precificação na plataforma Qwen é em camadas: a entrada custa 1 CNY por milhão de tokens durante horários fora de pico (2 CNY em horário de pico), enquanto a saída é de 4 CNY por milhão de tokens (8 CNY em horário de pico). Os limites de taxa estão em 15K RPM e 1M TPM, suportando conclusão de prefixo, chamada de funções, cache, saída estruturada, processamento em lote e pesquisa online.
A Alibaba Cloud BaiLian estabeleceu parceria com a comunidade de código aberto vLLM para garantir uma ampla implantação na China e em regiões internacionais, incluindo Pequim, Cingapura, EUA, Alemanha, Japão e Hong Kong. O modelo suporta conversas multi-turno, chamadas de funções, pesquisa online, cache de contexto e saída estruturada, com um limite de max_tokens de ~393.216. Isso o torna ideal para empresas que migram a análise de documentos longos, bases de conhecimento de atendimento ao cliente, perguntas e respostas de repositórios de código e revisões de pedidos multimodais para uma interface unificada.
Analistas da indústria sugerem que a integração de "grandes parâmetros, pequena ativação e cache robusto" no ecossistema Qwen reduz os custos de tentativa e erro para agentes de contexto longo. Para pequenas equipes, a combinação de preços baixos fora de pico e assinaturas flexíveis do Plano de Tokens permite inferência em lote mais ágil e validação rápida de protótipos.
O GitHub Copilot integra o GPT-5.4 em poucas horas
O GitHub Copilot mais uma vez provou suas capacidades de resposta rápida. Poucas horas após a OpenAI lançar seu mais recente modelo principal, o GPT-5.4, o GitHub anunciou a integração completa, fornecendo aos desenvolvedores de todo o mundo assistên
A Anthropic lidera o IPO, e a indústria de IA entra em uma nova era de receitas de trilhões de dólares
O setor global de IA atingiu outro grande marco. Dados recentes de mercado revelam que a startup de IA Anthropic apresentou um pedido de IPO confidencial em 1º de junho. Se aprovado, a Anthropic está prestes a se tornar a empresa de capital aberto ma











