MinIO ha desarrollado un sistema de almacenamiento en caché MemKV a escala de petabytes adaptado para GPUs de Nvidia, desplegado en la parte superior de su plataforma de almacenamiento de objetos AIStor.
Los clusters de GPU que ejecutan inferencia requieren memoria de alto ancho de banda (HBM) para almacenar contexto, tokens vectorizados y pares de clave de valor intermedio (KV).Cascadas de datos hacia abajo a CPU DRAM y NVMe SSD, administrado por las DPUs de Nvidia BlueField-4 (BF4). Cuando estos niveles alcanzan la capacidad, MinIO AIStor actúa como la copia de seguridad de almacenamiento final.y MemKV cumple con la norma para ofrecer persistente, contexto compartido a través de los grupos de GPU a escala superior.
AB Periasamy, cofundador y co-CEO de MinIO, comentó: "La industria ha estado documentando la pérdida de contexto durante años porque, a pequeña escala, puede absorber el impuesto de recomputo.En la alta densidad de GPU de hoy para los hiperescaladores y neoclouds, esto ya no es viable.
La recomputada del contexto generado desperdicia energía; para los clústeres con miles de GPU, crea una ineficiencia estructural fundamental.y MemKV está diseñado específicamente para esta ruta de datos.
Por primera vez, MinIO permite compartir pools de contexto para clusters enteros de GPU a nivel de latencia de microsegundos para coincidir con los flujos de trabajo de inferencia,evitar los retrasos de milisegundos del almacenamiento externo convencionalSin niveles de caché suficientes, las GPU desperdician recursos en el recálculo de contexto repetido.
En un despliegue de 128 GPU con una longitud de contexto de 128K tokens, MemKV mejoró el tiempo hasta el primer token bajo cargas de producción y aumentó la utilización de la GPU del 50% a más del 90%,generando un ahorro anual estimado de $2 millones en costos de computación.
MemKV es una memoria de contexto compartida con un costo de SSD.Desacoplamiento de la escala de la caché de los recursos de computación de la GPUSus características principales se enumeran a continuación:
-
Apoyo nativo BF4 STX: Se ejecuta como un binario ARM64 dentro de la infraestructura STX, incrustado en el almacenamiento en lugar de servidores de almacenamiento x86 separados.
-
Transporte RDMA de extremo a extremo: Transfiere caché KV entre la memoria GPU y NVMe a través de RDMA, evitando los protocolos convencionales de almacenamiento de archivos y objetos.
-
Tamaño de bloque optimizado por GPU: Utiliza bloques de 2 ¢ 16 MB para las demandas de rendimiento de la GPU, en lugar de bloques de almacenamiento heredados de 4 KB.
-
Rendimiento de la velocidad del cableOptimizado para Nvidia Spectrum-X Ethernet y PCIe Gen6 para maximizar el rendimiento de la tela física.
MemKV transfiere directamente los datos de los SSD NVMe a las tuberías de IA a través de RDMA, eliminando los gastos generales de HTTP, la traducción del sistema de archivos y los servidores de almacenamiento intermedio.
MinIO clasifica las soluciones de memoria de contexto rivales en dos tipos: NVMe local no compartible (G3) y almacenamiento compartido de propósito general (G4).que se distingue de los productos genéricos de almacenamiento.
La empresa enfatiza que los proveedores heredados de las ofertas G3.5 aún conservan nodos de protocolo redundantes, servicios de metadatos y capas de traducción de archivos.Estas capas aseguran la durabilidad y la consistencia de los datos de entrenamiento y los pesos del modelo, sin embargo, son innecesarios para la caché KV efímera y recomputada optimizada para bloques de datos de 2 ∼16 MB.
El proveedor de hardware RAID GRAID y la empresa de almacenamiento WEKA también proporcionan soluciones de caché KV compatibles con STX.Espacio de martillo, Hitachi Vantara, HPE, Lightbits/ScaleFlux, NetApp, Nutanix, Peak: AIO, Pliops y VAST Data. El proyecto también incluye una serie de aplicaciones para el desarrollo de datos.
China, China, China, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón.
Sandy Yang, directora de estrategia global
WhatsApp / WeChat: +86 13426366826 El número de teléfono es:
Correo electrónico: yangyd@qianxingdata.com
El sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque en el negocio:
Distribución de productos TIC/Integración de sistemas y servicios/Soluciones de infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con las principales marcas globales para ofrecer productos confiables y servicios profesionales.
Usar la tecnología para construir un mundo inteligente¡Su proveedor de servicios de productos TIC de confianza!