En la Cumbre RAISE de París, DDN presentó su colaboración en curso con Nebul, un proveedor europeo de nube híbrida soberana, centrada en aumentar la eficiencia para implementaciones de inferencia de IA a gran escala. Presentada la semana pasada, la iniciativa conjunta une la plataforma de inferencia de Nebul, la arquitectura de inteligencia de datos Infinia de DDN y la computación acelerada de NVIDIA para resolver un cuello de botella clave en la IA de producción: los costos de movimiento de datos y las limitaciones de rendimiento durante las cargas de trabajo de inferencia.
DDN enmarca la colaboración en torno a métricas críticas de producción: utilización de GPU, rendimiento de tokens, costo por token y latencia. Mientras que el entrenamiento de modelos genera valor de activos de IA, la inferencia define sus retornos operativos y comerciales. La creciente adopción de IA agentiva, generación aumentada por recuperación (RAG) y inferencia de alta concurrencia significa que la infraestructura de almacenamiento y datos impacta directamente la eficiencia del acelerador y las velocidades de respuesta de la IA.
Este proyecto activo de prueba de concepto ha arrojado resultados tempranos prometedores. Los socios han registrado mejoras medibles en el tiempo hasta el primer token con la caché KV habilitada y han completado la validación para infraestructura basada en RoCE. La evaluación comparativa en curso cubre longitudes de secuencia de inferencia más largas, desbloqueando un mayor potencial de optimización para la plataforma Infinia. La colaboración también se expande a esfuerzos conjuntos con NVIDIA en marcos de evaluación comparativa, verificación de escalabilidad y próximas publicaciones técnicas.
La plataforma integrada aprovecha servicios distribuidos de caché KV, movimiento de datos nativo de GPU, orquestación inteligente de datos y arquitectura de almacenamiento de alto rendimiento. La aceleración de la caché KV ofrece ganancias notables en la inferencia al preservar y recuperar rápidamente estados de atención precalculados, reduciendo cálculos redundantes y eliminando retrasos en la entrega de datos que causan inactividad de la GPU.
Los líderes de DDN, Nebul y NVIDIA destacaron un cambio importante en la industria: las prioridades de la infraestructura de IA se están moviendo del despliegue bruto de GPU a la eficiencia operativa, maximizando los retornos del hardware acelerador existente. Los CEO de DDN, Alex Bouzari, y de Nebul, Arnold Juffer, señalaron que el enfoque pasado en escalas de modelos más grandes ha dado paso a la optimización de la economía de inferencia para hacer que la IA de producción sea comercialmente viable a través de costos por token más bajos. El vicepresidente de Infraestructura en la Nube de NVIDIA, Rod Evans, agregó que las cargas de trabajo agentivas a gran escala ahora miden el éxito de la infraestructura por la utilización de GPU y la latencia, en lugar de la pura potencia de cómputo.
DDN enfatiza que la infraestructura de IA debe evolucionar más allá de las funciones básicas de almacenamiento para admitir activamente los flujos de trabajo de ejecución de IA. Las plataformas de infraestructura de la empresa actualmente potencian más de un millón de GPU en todo el mundo, sirviendo a hiperescaladores, proveedores de nube, empresas, gobiernos e instituciones de investigación.
Los equipos modernos de infraestructura de IA ahora priorizan estas métricas de producción principales:
Utilización de GPU: Mide la actividad efectiva del acelerador durante la inferencia, maximizando el valor del hardware de GPU de alta gama.
Costo por token: Vincula el rendimiento de la infraestructura directamente con los costos operativos de salida del modelo de IA.
Tokens por vatio: Evalúa la eficiencia energética de la salida de inferencia de IA.
Tiempo hasta el primer token: Determina la capacidad de respuesta de las aplicaciones de IA interactivas y la experiencia del usuario.
Tiempo hasta la producción: Cuantifica el esfuerzo operativo para migrar servicios de IA de pruebas a despliegue comercial escalable.
A medida que la inferencia se convierte en la carga de trabajo de IA dominante, la entrega de contexto en caché y datos empresariales a las GPU con baja latencia y estable será fundamental para mantener una alta utilización de GPU y controlar los costos operativos a largo plazo.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Director de Estrategia Global
WhatsApp / WeChat: +86 13426366826
Correo electrónico: yangyd@qianxingdata.com
Sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque de Negocio:
Distribución de Productos TIC/Integración de Sistemas y Servicios/Soluciones de Infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con marcas líderes a nivel mundial para ofrecer productos confiables y servicios profesionales.
¡Construyendo un Mundo Inteligente con Tecnología! Su Proveedor de Servicios de Productos TIC de Confianza.
Sandy Yang/Director de Estrategia Global
WhatsApp / WeChat: +86 13426366826
Correo electrónico: yangyd@qianxingdata.com
Sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque de Negocio:
Distribución de Productos TIC/Integración de Sistemas y Servicios/Soluciones de Infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con marcas líderes a nivel mundial para ofrecer productos confiables y servicios profesionales.
¡Construyendo un Mundo Inteligente con Tecnología! Su Proveedor de Servicios de Productos TIC de Confianza.



