opção
Lar
Lista de modelos AL
DeepSeek-V2-Chat
Modelo Parâmetro Quantidade
236B
Modelo Parâmetro Quantidade
Organização afiliada
DeepSeek
Organização afiliada
Código aberto
Tipo de licença
Tempo de liberação
6 de Maio de 2024
Tempo de liberação

Introdução ao modelo
DeepSeek-V2 é um forte modelo de linguagem Mixture-of-Experts (MoE) caracterizado por treinamento econômico e inferência eficiente. Ele consiste em 236 bilhões de parâmetros no total, dos quais 21 bilhões são ativados para cada token. Em comparação com o DeepSeek 67B, o DeepSeek-V2 apresenta um desempenho superior, economizando 42,5% nos custos de treinamento, reduzindo o cache KV em 93,3% e aumentando a capacidade máxima de geração em 5,76 vezes.
Deslize para a esquerda e para a direita para ver mais
Capacidade de compreensão de idiomas Capacidade de compreensão de idiomas
Capacidade de compreensão de idiomas
Muitas vezes, faz mal julgamentos semânticos, levando a óbvias desconexões lógicas nas respostas.
5.0
Escopo de cobertura do conhecimento Escopo de cobertura do conhecimento
Escopo de cobertura do conhecimento
Possui pontos cegos significativos, geralmente mostrando erros factuais e repetindo informações desatualizadas.
6.3
Capacidade de raciocínio Capacidade de raciocínio
Capacidade de raciocínio
Incapaz de manter cadeias de raciocínio coerentes, geralmente causando causalidade invertida ou erros de cálculo.
4.1
Modelo relacionado
DeepSeek-V4-Flash O DeepSeek-V4-Flash é o modelo leve da DeepSeek, voltado para a eficiência, destinado a interações de baixa latência, uso com alta simultaneidade e aplicações inteligentes do dia a dia.
DeepSeek-V4-Pro O DeepSeek-V4-Pro é o modelo de alto desempenho principal da DeepSeek, que aprimora ainda mais as capacidades de raciocínio, programação, processamento de textos extensos e desempenho geral em tarefas diversas.
DeepSeek-V3.2 A versão mais recente dos modelos da série Deepseek V3.
DeepSeek-V3.2-Exp A versão experimental mais recente dos modelos da série Deepseek V3.
DeepSeek-R1-0528 A versão mais recente do Deepseek R1.
Documentos relevantes
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
A China Bloqueia Modelos de IA Durante o Gaokam para Impedir Ajuda Imediata nas Tarefas Com a aproximação do Gaokao 2026, os rumores sobre a suspensão de ferramentas de IA durante o período da prova acenderam um intenso debate online. Em resposta à preocupação do público, as principais plataformas de IA e aplicativos educacionais esclar
Pesquisa revela que ferramenta de diagnóstico de câncer de mama baseada em IA, aprovada pela FDA, fica aquém das expectativas dos radiologistas Um estudo recente publicado na revista “Clinical Imaging” por pesquisadores do Centro de Saúde da UC San Diego entrevistou 215 membros da Sociedade Americana de Imagem Mamária. Os resultados revelam q
O Ant Brain Full-Stack 2.0 é lançado no WAIC, impulsionando a farmácia inteligente com inteligência unificada A Conferência Mundial de Inteligência Artificial (WAIC) de 2026 tem início no dia 17 de julho, com os prestigiosos prêmios “Tesouros da Exposição” ocupando o centro das atenções. As dez principais ind
Comparação de modelos
Inicie a comparação
OR