opción
Hogar
Lista de modelos AL
DeepSeek-V2-Chat-0628
Cantidad de parámetros del modelo
236B
Cantidad de parámetros del modelo
Organización afiliada
DeepSeek
Organización afiliada
Código abierto
Tipo de licencia
Tiempo de lanzamiento
6 de mayo de 2024
Tiempo de lanzamiento

Introducción al modelo
DeepSeek-V2 es un modelo de lenguaje de Mixture-of-Experts (MoE) potente, caracterizado por un entrenamiento económico y una inferencia eficiente. Cuenta con 236 mil millones de parámetros en total, de los cuales 21 mil millones están activos para cada token. En comparación con DeepSeek 67B, DeepSeek-V2 ofrece un mejor rendimiento, reduce en un 42,5% los costos de entrenamiento, disminuye el almacenamiento en caché KV en un 93,3% y mejora la capacidad máxima de generación hasta 5,76 veces.
Desliza hacia la izquierda y la derecha para ver más
Capacidad de comprensión del lenguaje Capacidad de comprensión del lenguaje
Capacidad de comprensión del lenguaje
A menudo hace juicios mal semánticos, lo que lleva a obvias desconexiones lógicas en las respuestas.
4.6
Alcance de cobertura de conocimiento Alcance de cobertura de conocimiento
Alcance de cobertura de conocimiento
Posee el conocimiento central de las disciplinas convencionales, pero tiene una cobertura limitada de los campos interdisciplinarios de vanguardia.
7.8
Capacidad de razonamiento Capacidad de razonamiento
Capacidad de razonamiento
Incapaz de mantener cadenas de razonamiento coherentes, a menudo causando causalidad invertida o errores de cálculo.
4.7
Modelo relacionado
DeepSeek-V4-Flash DeepSeek-V4-Flash es el modelo ligero de DeepSeek, diseñado para ofrecer un alto rendimiento, ideal para interacciones de baja latencia, usos con alta concurrencia y aplicaciones inteligentes de uso diario.
DeepSeek-V4-Pro DeepSeek-V4-Pro es el modelo de alto rendimiento estrella de DeepSeek, que mejora aún más las capacidades de razonamiento, programación, procesamiento de textos extensos y desempeño general en tareas diversas.
DeepSeek-V3.2 La última versión de los modelos de la serie Deepseek V3.
DeepSeek-V3.2-Exp La última versión experimental de los modelos de la serie Deepseek V3.
DeepSeek-R1-0528 La última versión de Deepseek R1.
Documentos relevantes
Anthropic amplía las herramientas de codificación de Claude AI a Japón en su impulso por el crecimiento en el extranjero Anthropic, una destacada empresa estadounidense de inteligencia artificial, está intensificando su alcance global. El miércoles, la compañía organizó una importante reunión de desarrolladores, "Code with Claude", en Tokio, que reunió a cerca de 500 i
El gigante del software de India reduce la contratación y promete no realizar despidos a medida que los agentes de IA se escalan Mientras la inteligencia artificial remodela los modelos de negocio tradicionales intensivos en mano de obra, Tata Consultancy Services (TCS), una destacada empresa india de externalización de software, ha presentado su respuesta estratégica. Durante
China bloquea modelos de IA durante el Gaokam para impedir la ayuda instantánea en las tareas escolares Con la inminente llegada del Gaokao 2026, los rumores sobre la suspensión de herramientas de inteligencia artificial durante el período del examen han desatado un intenso debate en línea. En respuesta a la preocupación pública, las principales plataf
Una encuesta revela que una herramienta de diagnóstico de cáncer de mama basada en la inteligencia artificial y aprobada por la FDA no cumple las expectativas de los radiólogos Un estudio reciente publicado en «Clinical Imaging» por investigadores del Centro de Salud de la Universidad de California en San Diego encuestó a 215 miembros de la Sociedad Americana de Imagen Mamar
Ant Brain Full-Stack 2.0 se presenta en la WAIC y potencia las farmacias inteligentes con inteligencia unificada La Conferencia Mundial sobre Inteligencia Artificial (WAIC) de 2026 comienza el 17 de julio, con los prestigiosos premios «Treasures of the Exhibition» como protagonistas. Las diez selecciones más des
Comparación de modelos
Comience la comparación
OR