La serie Xiaomi MiMo-V2.5 API tiene una rebaja permanente de hasta el 99 %
En medio de la creciente guerra de precios de los modelos de IA, Xiaomi anunció oficialmente el 27 de mayo que su modelo de gran tamaño MiMo reduciría de forma permanente los precios de la API de la serie MiMo-V2.5, al tiempo que optimizaría el sistema de facturación para reducir aún más los costes de las llamadas de los desarrolladores gracias a los avances tecnológicos.

I. Importantes recortes en los precios de las API: hasta un 99 % de descuento
El cambio de precios entró en vigor a nivel mundial a las 00:00, hora de Pekín, del 27 de mayo. Se aplica a las dos versiones principales, MiMo-V2.5 y MiMo-V2.5Pro, y ya no se diferencia en función de la longitud de la ventana de contexto, lo que simplifica la estructura de precios para una mayor transparencia.
Versión del modelo Precio por acierto en la caché de entrada Descuento máximo Precio de salida Descuento máximoMiMo-V2.5Pro0,025 yuanes por millón de tokens, hasta un 99 % de descuento; salida: 6 yuanes por millón de tokens, hasta un 86 % de descuento; MiMo-V2.5: 0,02 yuanes por millón de tokens, hasta un 98 % de descuento; salida: 2 yuanes por millón de tokens, hasta un 93 % de descuentoII. Actualización del sistema de facturación: más valor sin coste adicional
Más allá de las reducciones directas de precios de la API, Xiaomi ha optimizado considerablemente su sistema de facturación del Plan de tokens:
Cuota cuadruplicada: con respecto a los precios originales, la cuota de uso real de tokens se ha incrementado entre 5 y 8 veces la cantidad anterior.
Reglas simplificadas: la introducción de los créditos sustituye a los complejos métodos de facturación anteriores, lo que hace que el consumo de tokens y el cálculo de costes sean más intuitivos para los desarrolladores.

III. Base técnica: ¿cómo puede seguir bajando los precios?
La declaración oficial de Xiaomi atribuye estas profundas reducciones de precios a los avances técnicos en la arquitectura de su sistema de inferencia subyacente:
Optimización de la inferencia SWA: al aprovechar SGLang HiCache con soporte completo para SWA (mecanismo de atención de ventana deslizante), la transferencia de datos entre la memoria de la GPU, la memoria de la CPU y el SSD se ha reducido a una séptima parte del volumen anterior.
Eficiencia mejorada de la caché: El número de tokens almacenables en caché se ha multiplicado casi por cinco en comparación con la versión optimizada anterior, lo que ha aumentado las tasas de aciertos de caché y ha reducido drásticamente el coste por inferencia.
Optimización del rendimiento del clúster: Con la introducción de estrategias de paralelismo experto (MoE) y de agrupación por longitud de entrada, el rendimiento de entrada del clúster ha experimentado un salto cualitativo, manteniendo una alta calidad de servicio al tiempo que se reduce de forma constante el coste por token.
La iniciativa de Xiaomi se considera una respuesta proactiva a la intensa competencia actual en la comercialización de modelos a gran escala. A medida que las barreras de precio sigan cayendo, la rentabilidad de la serie MiMo será aún más evidente, lo que acelerará la profunda integración de las capacidades de IA en los sectores verticales y los flujos de trabajo de los desarrolladores.
Artículo relacionado
iFLYTEK presenta el modelo general de gran escala Spark X2.5
El 1 de septiembre, iFlytek abrirá al código abierto dos modelos de lenguaje grandes centrados en el borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B, según el último anuncio oficial. Ambos modelos admiten nativamente una ventana de contexto de hasta 1 mil
Meta elimina la función de edición de fotos con IA tras las críticas de los usuarios
Meta, el gigante de los medios sociales, se ve una vez más envuelto en un debate público sobre el delicado equilibrio entre la inteligencia artificial y la privacidad de los usuarios. Según TechCrunch, Superintelligence Labs de Meta presentó un nuevo
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En medio de la creciente guerra de precios de los modelos de IA, Xiaomi anunció oficialmente el 27 de mayo que su modelo de gran tamaño MiMo reduciría de forma permanente los precios de la API de la serie MiMo-V2.5, al tiempo que optimizaría el sistema de facturación para reducir aún más los costes de las llamadas de los desarrolladores gracias a los avances tecnológicos.

I. Importantes recortes en los precios de las API: hasta un 99 % de descuento
El cambio de precios entró en vigor a nivel mundial a las 00:00, hora de Pekín, del 27 de mayo. Se aplica a las dos versiones principales, MiMo-V2.5 y MiMo-V2.5Pro, y ya no se diferencia en función de la longitud de la ventana de contexto, lo que simplifica la estructura de precios para una mayor transparencia.
Versión del modelo Precio por acierto en la caché de entrada Descuento máximo Precio de salida Descuento máximoMiMo-V2.5Pro0,025 yuanes por millón de tokens, hasta un 99 % de descuento; salida: 6 yuanes por millón de tokens, hasta un 86 % de descuento; MiMo-V2.5: 0,02 yuanes por millón de tokens, hasta un 98 % de descuento; salida: 2 yuanes por millón de tokens, hasta un 93 % de descuentoII. Actualización del sistema de facturación: más valor sin coste adicional
Más allá de las reducciones directas de precios de la API, Xiaomi ha optimizado considerablemente su sistema de facturación del Plan de tokens:
Cuota cuadruplicada: con respecto a los precios originales, la cuota de uso real de tokens se ha incrementado entre 5 y 8 veces la cantidad anterior.
Reglas simplificadas: la introducción de los créditos sustituye a los complejos métodos de facturación anteriores, lo que hace que el consumo de tokens y el cálculo de costes sean más intuitivos para los desarrolladores.

III. Base técnica: ¿cómo puede seguir bajando los precios?
La declaración oficial de Xiaomi atribuye estas profundas reducciones de precios a los avances técnicos en la arquitectura de su sistema de inferencia subyacente:
Optimización de la inferencia SWA: al aprovechar SGLang HiCache con soporte completo para SWA (mecanismo de atención de ventana deslizante), la transferencia de datos entre la memoria de la GPU, la memoria de la CPU y el SSD se ha reducido a una séptima parte del volumen anterior.
Eficiencia mejorada de la caché: El número de tokens almacenables en caché se ha multiplicado casi por cinco en comparación con la versión optimizada anterior, lo que ha aumentado las tasas de aciertos de caché y ha reducido drásticamente el coste por inferencia.
Optimización del rendimiento del clúster: Con la introducción de estrategias de paralelismo experto (MoE) y de agrupación por longitud de entrada, el rendimiento de entrada del clúster ha experimentado un salto cualitativo, manteniendo una alta calidad de servicio al tiempo que se reduce de forma constante el coste por token.
La iniciativa de Xiaomi se considera una respuesta proactiva a la intensa competencia actual en la comercialización de modelos a gran escala. A medida que las barreras de precio sigan cayendo, la rentabilidad de la serie MiMo será aún más evidente, lo que acelerará la profunda integración de las capacidades de IA en los sectores verticales y los flujos de trabajo de los desarrolladores.
iFLYTEK presenta el modelo general de gran escala Spark X2.5
El 1 de septiembre, iFlytek abrirá al código abierto dos modelos de lenguaje grandes centrados en el borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B, según el último anuncio oficial. Ambos modelos admiten nativamente una ventana de contexto de hasta 1 mil
Meta elimina la función de edición de fotos con IA tras las críticas de los usuarios
Meta, el gigante de los medios sociales, se ve una vez más envuelto en un debate público sobre el delicado equilibrio entre la inteligencia artificial y la privacidad de los usuarios. Según TechCrunch, Superintelligence Labs de Meta presentó un nuevo
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s





Hogar






