Hogar
DeepSeek-V4.1-Flash se estrena en la plataforma Qwen AI con API y plan de tokens disponibles
DeepSeek-V4.1-Flash ya está disponible en la plataforma de inteligencia artificial Qwen, ofreciendo tanto acceso mediante API como un Plan de Tokens flexible. Los desarrolladores pueden integrar sin problemas el modelo en sus flujos de trabajo a través de APIs estándar o aprovechar el Plan de Tokens directamente dentro de herramientas como Qoder, la aplicación Qwen y Codex para tareas de codificación, documentación, análisis visual y agentes impulsados por inteligencia artificial.

Descrito como el nuevo buque insignia ligero de DeepSeek, este modelo utiliza una arquitectura MoE con un total de 552 mil millones de parámetros. Emplea una estructura asimétrica de Codificador-Decodificador Causal, activando solo ~8 mil millones de parámetros para la entrada y ~16 mil millones para la salida. Con soporte nativo para la comprensión de texto e imágenes, maneja ventanas de contexto de hasta 1 millón de tokens y genera salidas de aproximadamente 393K. Las pruebas oficiales indican mejoras significativas en el rendimiento de Agentes y código, ofreciendo alta capacidad de procesamiento y baja latencia a pesar de los costos reducidos de activación.
La eficiencia de costos es un punto destacado. La compresión avanzada de caché reduce los requisitos de HBM para el KV Cache al 25% y las necesidades de almacenamiento en SSD al 12,5% de las generaciones anteriores, optimizando los recursos para contextos largos e interacciones multironda. Los precios en la plataforma Qwen son por niveles: la entrada cuesta 1 CNY por millón de tokens durante horas no pico (2 CNY en horas pico), mientras que la salida es de 4 CNY por millón de tokens (8 CNY en horas pico). Los límites de velocidad se establecen en 15K RPM y 1M TPM, admitiendo finalización de prefijo, llamada de funciones, almacenamiento en caché, salida estructurada, procesamiento por lotes y búsqueda en línea.
Alibaba Cloud BaiLian se ha asociado con la comunidad de código abierto vLLM para garantizar un amplio despliegue en China y regiones internacionales, incluidas Beijing, Singapur, Estados Unidos, Alemania, Japón y Hong Kong. El modelo admite conversaciones multironda, llamadas a funciones, búsqueda en línea, almacenamiento en caché de contexto y salida estructurada, con un límite de max_tokens de ~393.216. Esto lo hace ideal para empresas que migran el análisis de documentos largos, bases de conocimiento de atención al cliente, preguntas y respuestas en repositorios de código y revisiones de pedidos multimodales a una interfaz unificada.
Los analistas de la industria sugieren que integrar «grandes parámetros, pequeña activación y almacenamiento en caché robusto» en el ecosistema Qwen reduce los costos de prueba y error para agentes de contexto largo. Para equipos pequeños, la combinación de precios bajos en horas no pico y suscripciones flexibles al Plan de Tokens permite una inferencia por lotes más ágil y una validación rápida de prototipos.
Artículo relacionado
GitHub Copilot integra GPT-5.4 en horas
GitHub Copilot ha demostrado una vez más sus rápidas capacidades de respuesta. Apenas horas después de que OpenAI lanzara su último modelo insignia, GPT-5.4, GitHub anunció una integración completa, proporcionando a desarrolladores de todo el mundo a
Anthropic lidera el camino en la oferta pública inicial, la industria de la IA entra en una nueva era de ingresos de billones
El sector global de la inteligencia artificial ha alcanzado otro hito importante. Los recientes datos del mercado revelan que la startup de IA Anthropic presentó una solicitud confidencial de oferta pública inicial (IPO) el 1 de junio. Si es aprobada
¿Cómo optimizar el SEO para Google Japón y Yahoo Japón?
La ciudad conectada ya está aquí, pero tiene un aspecto ordinarioLa infraestructura de IoT más útil rara vez tiene un aspecto futurista. Se parece a una papelera que sabe cuándo está llena, a una furgoneta que informa de fallos del motor antes de qu
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
DeepSeek-V4.1-Flash ya está disponible en la plataforma de inteligencia artificial Qwen, ofreciendo tanto acceso mediante API como un Plan de Tokens flexible. Los desarrolladores pueden integrar sin problemas el modelo en sus flujos de trabajo a través de APIs estándar o aprovechar el Plan de Tokens directamente dentro de herramientas como Qoder, la aplicación Qwen y Codex para tareas de codificación, documentación, análisis visual y agentes impulsados por inteligencia artificial.

Descrito como el nuevo buque insignia ligero de DeepSeek, este modelo utiliza una arquitectura MoE con un total de 552 mil millones de parámetros. Emplea una estructura asimétrica de Codificador-Decodificador Causal, activando solo ~8 mil millones de parámetros para la entrada y ~16 mil millones para la salida. Con soporte nativo para la comprensión de texto e imágenes, maneja ventanas de contexto de hasta 1 millón de tokens y genera salidas de aproximadamente 393K. Las pruebas oficiales indican mejoras significativas en el rendimiento de Agentes y código, ofreciendo alta capacidad de procesamiento y baja latencia a pesar de los costos reducidos de activación.
La eficiencia de costos es un punto destacado. La compresión avanzada de caché reduce los requisitos de HBM para el KV Cache al 25% y las necesidades de almacenamiento en SSD al 12,5% de las generaciones anteriores, optimizando los recursos para contextos largos e interacciones multironda. Los precios en la plataforma Qwen son por niveles: la entrada cuesta 1 CNY por millón de tokens durante horas no pico (2 CNY en horas pico), mientras que la salida es de 4 CNY por millón de tokens (8 CNY en horas pico). Los límites de velocidad se establecen en 15K RPM y 1M TPM, admitiendo finalización de prefijo, llamada de funciones, almacenamiento en caché, salida estructurada, procesamiento por lotes y búsqueda en línea.
Alibaba Cloud BaiLian se ha asociado con la comunidad de código abierto vLLM para garantizar un amplio despliegue en China y regiones internacionales, incluidas Beijing, Singapur, Estados Unidos, Alemania, Japón y Hong Kong. El modelo admite conversaciones multironda, llamadas a funciones, búsqueda en línea, almacenamiento en caché de contexto y salida estructurada, con un límite de max_tokens de ~393.216. Esto lo hace ideal para empresas que migran el análisis de documentos largos, bases de conocimiento de atención al cliente, preguntas y respuestas en repositorios de código y revisiones de pedidos multimodales a una interfaz unificada.
Los analistas de la industria sugieren que integrar «grandes parámetros, pequeña activación y almacenamiento en caché robusto» en el ecosistema Qwen reduce los costos de prueba y error para agentes de contexto largo. Para equipos pequeños, la combinación de precios bajos en horas no pico y suscripciones flexibles al Plan de Tokens permite una inferencia por lotes más ágil y una validación rápida de prototipos.
GitHub Copilot integra GPT-5.4 en horas
GitHub Copilot ha demostrado una vez más sus rápidas capacidades de respuesta. Apenas horas después de que OpenAI lanzara su último modelo insignia, GPT-5.4, GitHub anunció una integración completa, proporcionando a desarrolladores de todo el mundo a
Anthropic lidera el camino en la oferta pública inicial, la industria de la IA entra en una nueva era de ingresos de billones
El sector global de la inteligencia artificial ha alcanzado otro hito importante. Los recientes datos del mercado revelan que la startup de IA Anthropic presentó una solicitud confidencial de oferta pública inicial (IPO) el 1 de junio. Si es aprobada











