El sistema de archivos paralelo IBM Storage Scale admite la gestión de caché KV distribuida junto con NVIDIA Dynamo, lo que atiende a escenarios de inferencia de IA a gran escala con cargas de trabajo de contexto masivas.
IBM ha publicado un Redbook oficial tituladoContexto sin límites: una plataforma de caché KV de alto rendimiento para inferencia de IA a gran escala, entregando una arquitectura de referencia completa y validada para esta solución conjunta. La pila integrada combina servidores de almacenamiento Supermicro Petascale, redes Ethernet NVIDIA Spectrum-X e IBM Storage Scale Erasure Coding Edition (ECE) para crear un nivel de almacenamiento compartido de alto rendimiento para la inferencia de IA. Como documentos técnicos autorizados publicados por IBM ITSO (Organización Internacional de Soporte Técnico), los IBM Redbooks ofrecen una guía de implementación práctica y detallada para productos de infraestructura de IBM de nivel empresarial.
El Redbook, escrito en coautoría por equipos de ingeniería de IBM, Supermicro y NVIDIA, aborda un punto central de las cargas de trabajo de IA de contexto prolongado. Los casos de uso que incluyen asistentes de diálogo de múltiples turnos, aplicaciones de recuperación de RAG y canalizaciones de agentes autónomos generan datos de caché KV masivos dentro de GPU HBM. Una vez que los datos almacenados en caché se expulsan de los recursos limitados de HBM, el recálculo repetido provocará graves aumentos de latencia, lo que hace indispensable el almacenamiento persistente en caché KV de solicitudes cruzadas.
La solución adopta una arquitectura de caché KV jerárquica de cinco niveles que cubre diferentes demandas de latencia y capacidad:
-
Capa G1: Nodo GPU HBM local
-
Capa G2: DRAM del sistema de nodo de CPU
-
Capa G3: SSD local de conexión directa
-
Capa G3.5: Almacenamiento flash compartido a nivel de pod, liderado por DPU NVIDIA BlueField con interconexión directa a las DPU del servidor GPU
-
Capa G4: Grupo de almacenamiento compartido externo a través de Ethernet conectado a todos los servidores informáticos GPU
Esta configuración de varios niveles, que cubre la memoria de un extremo a otro y la jerarquía de almacenamiento, ofrece latencia continua y gradientes de capacidad. Permite a NVIDIA Dynamo llevar a cabo la colocación inteligente de caché, el desalojo automático y la recarga dinámica de datos en toda la pila de almacenamiento, adaptándose de manera flexible a diversos patrones de acceso a cargas de trabajo y presupuestos de costos totales de infraestructura.
Implementado en servidores de almacenamiento Supermicro Petascale, Storage Scale ECE sirve como nivel de caché en frío G4. Está optimizado para datos de caché KV no sensibles a la latencia, incluidos estados de conversación inactivos de varios turnos, datos de contexto de agentes compartidos y registros de consultas históricos que no requieren una respuesta instantánea.
Según los resultados de las pruebas registrados en el Libro Rojo, esta arquitectura de referencia lista para producción acelera eficazmente los servicios de inferencia de IA generativa y de IA agente. En las pruebas TTFT (Time To First Token) de solicitud única en comparación con servidores GPU independientes sin caché KV de escala de almacenamiento externa, el sistema integrado mantiene TTFT estable independientemente de los cambios de longitud de los mensajes. Se logra unaceleración 56xsecuencias de entrada de menos de 130 000 tokens y elimina por completo las fluctuaciones de latencia de inferencia causadas por longitudes de aviso extendidas.
Bajo la presión de inferencia simultánea de múltiples usuarios, la solución logra una mejora espectacular en el rendimiento: el rendimiento de las solicitudes aumenta de 0,19 RPS a 4,26 RPS, lo que marca un hito.Aumento de rendimiento 22 veces mayor. Mientras tanto, el tiempo total de procesamiento para 200 solicitudes de inferencia se reduce en un 95 %, lo que aumenta en gran medida la eficiencia de utilización de la GPU y la escalabilidad general del clúster de inferencia.
La pila también mantiene un rendimiento sólido bajo duras pruebas de estrés de vecinos ruidosos. Con cuatro extremos de cliente que generan un tráfico de E/S de red competitivo sostenido de 200 GB/s, el sistema integrado aún se ejecuta de manera estable a 3,6 RPS, finalizando las 200 solicitudes de inferencia en 55,56 segundos. Su rendimiento se mantiene18 veces mayorque la arquitectura básica de recálculo solo de GPU.
El equipo de investigación concluyó en el Redbook: "Para las empresas que buscan maximizar el retorno de la inversión en costosas inversiones en hardware GPU, esta arquitectura integrada verificada proporciona un enfoque sencillo y listo para producción para aumentar el rendimiento de inferencia, reducir la latencia de extremo a extremo, admitir una mayor concurrencia de servicios y construir una infraestructura de inferencia de IA a gran escala más rentable".
Palabras clave: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo
Beijing Qianxing Jietong Tecnología Co., Ltd.
Sandy Yang/Director de Estrategia Global
WhatsApp/WeChat: +86 13426366826
Correo electrónico: yangyd@qianxingdata.com
Sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque empresarial:
Distribución de productos TIC/Integración de sistemas y servicios/Soluciones de infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con marcas líderes a nivel mundial para ofrecer productos confiables y servicios profesionales.
“Uso de la tecnología para construir un mundo inteligente” ¡Su proveedor de servicios de productos TIC de confianza!