opción
Hogar
Noticias
La expansión de la IA agencial exige sistemas de memoria avanzados

La expansión de la IA agencial exige sistemas de memoria avanzados

23 de febrero de 2026
199

La IA agencial supone un cambio significativo, pasando de los simples chatbots a la gestión de flujos de trabajo complejos, y su escalabilidad exige un nuevo enfoque de la arquitectura de la memoria.

A medida que los modelos básicos crecen hasta alcanzar billones de parámetros y las ventanas de contexto se amplían a millones de tokens, el coste computacional de conservar el historial está superando nuestra capacidad para procesarlo de forma eficaz.

Las organizaciones que implementan estos sistemas se enfrentan ahora a un cuello de botella en el que el inmenso volumen de «memoria a largo plazo» (técnicamente, la caché de clave-valor (KV)) supera las capacidades de los diseños de hardware actuales.

La infraestructura existente ofrece opciones limitadas: almacenar el contexto de inferencia en la escasa memoria de GPU de alto ancho de banda (HBM) o trasladarlo a un almacenamiento más lento y de uso general. La primera opción resulta demasiado costosa para contextos grandes, mientras que la segunda introduce una latencia que hace que las interacciones agenticas en tiempo real sean poco prácticas.

Para salvar esta brecha creciente que dificulta la escalabilidad de la IA agencial, NVIDIA ha lanzado la plataforma Inference Context Memory Storage (ICMS) dentro de su arquitectura Rubin, introduciendo un nuevo nivel de almacenamiento creado específicamente para las demandas temporales y de alta velocidad de la memoria de IA.

«La IA está transformando toda la pila informática y, ahora, el almacenamiento», afirmó Huang. «La IA ha evolucionado más allá de los chatbots de respuesta única hasta convertirse en colaboradores inteligentes que comprenden el mundo físico, razonan durante largos periodos de tiempo, se basan en hechos, utilizan herramientas para tareas prácticas y mantienen la memoria a corto y largo plazo».

El problema operativo principal se deriva del funcionamiento de los modelos basados en transformadores. Para evitar tener que recalcular toda una conversación por cada nueva palabra generada, los modelos guardan los estados anteriores en la caché KV. En los flujos de trabajo agenticos, esta caché sirve como memoria persistente entre herramientas y sesiones, y se expande en proporción directa a la longitud de la secuencia.

Esto crea una categoría de datos única. A diferencia de los registros financieros o los registros de clientes, la caché KV es un dato derivado; es crucial para el rendimiento inmediato, pero no necesita las sólidas garantías de durabilidad de los sistemas de archivos empresariales. Los sistemas de almacenamiento de uso general, que funcionan con CPU estándar, consumen energía en la gestión y replicación de metadatos, de lo que no se benefician las cargas de trabajo agenticas.

La jerarquía existente, que va desde la GPU HBM (G1) hasta el almacenamiento compartido (G4), está demostrando ser cada vez más ineficiente:

(Crédito: NVIDIA)

A medida que los datos de contexto se trasladan de la GPU (G1) a la RAM del sistema (G2) y, finalmente, al almacenamiento compartido (G4), la eficiencia disminuye significativamente. La transferencia del contexto activo al nivel G4 introduce retrasos de milisegundos y aumenta el coste energético por token, lo que deja las costosas GPU inactivas mientras esperan los datos.

Para las empresas, esto se traduce en un mayor coste total de propiedad (TCO), ya que la energía se consume en la sobrecarga de la infraestructura en lugar de en tareas de razonamiento activas.

Un nuevo nivel de memoria para la fábrica de IA

La solución del sector consiste en añadir una capa personalizada a esta jerarquía. La plataforma ICMS crea un nivel «G3.5», una capa de almacenamiento flash conectada a Ethernet diseñada específicamente para la inferencia a gran escala.

Este método integra el almacenamiento directamente en el pod de computación. Al aprovechar el procesador de datos NVIDIA BlueField-4, la plataforma traslada la gestión de estos datos contextuales fuera de la CPU del host. El sistema ofrece petabytes de capacidad compartida por pod, lo que mejora la escalabilidad de la IA agencial al permitir que los agentes almacenen grandes cantidades de historial sin consumir costosa HBM.

La ventaja operativa es cuantificable tanto en rendimiento como en consumo energético. Al almacenar el contexto relevante en este nivel intermedio, que es más rápido que el almacenamiento estándar pero más asequible que la HBM, el sistema puede «precargar» la memoria en la GPU con antelación. Esto reduce el tiempo de inactividad del decodificador de la GPU, lo que permite hasta 5 veces más tokens por segundo (TPS) en cargas de trabajo de contexto largo.

Desde el punto de vista energético, las ventajas son igualmente significativas. Dado que la arquitectura elimina la sobrecarga de los protocolos de almacenamiento de uso general, consigue una eficiencia energética cinco veces superior a la de los enfoques convencionales.

Integración del plano de datos

La implementación de esta arquitectura requiere un cambio en la forma en que los equipos de TI perciben las redes de almacenamiento. La plataforma ICMS depende de NVIDIA Spectrum-X Ethernet para proporcionar la conectividad de alto ancho de banda y baja fluctuación necesaria para tratar el almacenamiento flash casi como si fuera memoria local.

Para los equipos de infraestructura empresarial, el punto clave de integración es la capa de orquestación. Marcos como NVIDIA Dynamo y la biblioteca de transferencia de inferencias (NIXL) gestionan el movimiento de bloques KV entre diferentes niveles.

Estas herramientas funcionan con la capa de almacenamiento para garantizar que el contexto correcto se cargue en la memoria de la GPU (G1) o en la memoria del host (G2) precisamente cuando el modelo de IA lo necesita. El marco NVIDIA DOCA lo respalda aún más al proporcionar una capa de comunicación KV que trata la caché de contexto como un recurso primario.

Los principales proveedores de almacenamiento ya están adoptando esta arquitectura. Empresas como AIC, Cloudian, DDN, Dell Technologies, HPE, Hitachi Vantara, IBM, Nutanix, Pure Storage, Supermicro, VAST Data y WEKA están desarrollando plataformas con BlueField-4. Se prevé que estas soluciones estén disponibles en la segunda mitad de este año.

Redefinición de la infraestructura para escalar la IA agencial

La adopción de un nivel de memoria contextual dedicado influye en la planificación de la capacidad y el diseño del centro de datos.

  • Reclasificación de datos: los directores de informática deben reconocer la caché KV como un tipo de datos distinto. Es «temporal pero sensible a la latencia», a diferencia de los datos de cumplimiento «duraderos y fríos». El nivel G3.5 gestiona los primeros, lo que permite que el almacenamiento G4 duradero se concentre en registros y artefactos a largo plazo.
  • Madurez de la orquestación: el éxito depende de un software que pueda asignar las cargas de trabajo de forma inteligente. El sistema utiliza una orquestación sensible a la topología (a través de NVIDIA Grove) para colocar los trabajos cerca de su contexto almacenado en caché, lo que reduce el movimiento de datos a través de la red.
  • Densidad de potencia: al incluir más capacidad útil en el mismo espacio de rack, las organizaciones pueden prolongar la vida útil de sus instalaciones actuales. Sin embargo, esto aumenta la densidad de cálculo por metro cuadrado, lo que requiere una planificación cuidadosa de la refrigeración y la distribución de energía.

El paso a la IA agencial requiere un rediseño físico del centro de datos. La práctica habitual de separar completamente la computación del almacenamiento lento y persistente no es adecuada para los requisitos de recuperación en tiempo real de los agentes con memorias extensas.

Al introducir un nivel de contexto especializado, las empresas pueden separar el crecimiento de la memoria del modelo del coste de la GPU HBM. Esta arquitectura de IA agencial permite que varios agentes compartan un gran pool de memoria de bajo consumo, lo que reduce el coste de gestionar consultas complejas y mejora la escalabilidad al admitir un razonamiento de alto rendimiento.

A medida que las organizaciones se preparan para su próxima ronda de inversión en infraestructura, evaluar la eficiencia de la jerarquía de memoria será tan importante como elegir la propia GPU.

Véase también: La guerra de los chips de IA en 2025: lo que los líderes empresariales aprendieron sobre la realidad de la cadena de suministro

¿Quiere saber más sobre la IA y el big data de la mano de los líderes del sector? Eche un vistazo a la AI & Big Data Expo que se celebra en Ámsterdam, California y Londres. Este completo evento forma parte de TechEx y se celebra junto con otros eventos tecnológicos de primer orden. Haga clic aquí para obtener más información.

AI News está impulsado por TechForge Media. Explore aquí otros eventos y seminarios web sobre tecnología empresarial que se celebrarán próximamente.

Artículo relacionado
El magnate tecnológico indio invierte 30 millones de dólares en un rival de Microsoft Office con inteligencia artificial El magnate tecnológico indio invierte 30 millones de dólares en un rival de Microsoft Office con inteligencia artificial El emprendedor serial Bhavin Turakhia está invirtiendo 30 millones de dólares de su propio capital, apostando a que el sector de la inteligencia artificial empresarial aún tiene espacio para nuevos jugadores. Su última startup, Neo, se basa en una cr
El primer modelo de SSI de Ilya, ex científico jefe de OpenAI, se presenta El primer modelo de SSI de Ilya, ex científico jefe de OpenAI, se presenta La inteligencia artificial ha alcanzado otro hito importante. Tras su salida de OpenAI, el ex científico jefe Ilya Sutskever fundó Safe Superintelligence Inc. (SSI), que ha revelado recientemente detalles sobre su modelo inaugural. Informes de redes
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field El 14 de mayo de 2026, la plataforma de desarrollo de aplicaciones de IA Lovable anunció su participación en la ronda de financiación semilla de 800.000 dólares para la startup danesa de hardware Atech. Liderada por Lovable, la ronda atrajo a firmas
Recomendaciones de temas especiales relacionados
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
Análisis de datos Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente
Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente

2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.

11 herramientas
xix.ai
Diseño y Arte Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales
Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales

2026 Últimas Mejores Herramientas de Ideación Creativa con IA Mejor Valoradas para Artistas son seleccionadas por XIX.AI para ayudar a los creadores a superar los bloqueos visuales y potenciar la creatividad al instante. Estas poderosas herramientas que cambian las reglas del juego ofrecen pruebas en el mundo real, una comparación detallada entre versiones gratuitas y de pago, y clasificaciones actualizadas semanalmente. Descubre tu herramienta perfecta para acelerar la creación de contenido y desbloquear tu ventaja con IA hoy mismo. ¡Explora ahora!

14 herramientas
xix.ai
comentario (0)
0/500
OR