Se ejecuta en Oracle Cloud Infrastructure (OCI), WEKA NeuralMesh y el software Augmented Memory Grid ofrece un rendimiento de token 10 veces mayor, 10 veces más usuarios concurrentes y 7 veces más tokens por GPU,en comparación con los entornos OCI estándar que dependen únicamente de la DRAM local.
WEKA's Augmented Memory Grid extiende la memoria del servidor GPU para la inferencia de IA aprovechando el almacenamiento externo a través de NeuralMesh, convirtiendo los recursos externos en un KV Cache de alto rendimiento.Ofrece latencia de microsegundos y ancho de banda de varios GB/sNeuralMesh es el sistema de archivos de IA de alto rendimiento de WEKA.Todos los índices de referencia se validaron en un grupo de H100 de OCI de 9 nodos con 100,000-ficha ventanas de contexto.
Pablo Salem, Director Senior de Desarrollo de Software en OCI, comentó: Las cargas de trabajo de IA empresarial continúan expandiendo las ventanas de contexto y elevando el uso de la GPU a nuevos límites.Estos puntos de referencia demuestran que la solución de WEKA elimina los cuellos de botella de la memoria GPU en OCI, lo que permite cargas de trabajo de inferencia más grandes y exigentes sin inversiones adicionales en hardware de GPU.
WEKA señala que la creciente demanda de inferencia amplifica las ineficiencias de la infraestructura de IA.perjudica la experiencia del usuario y aumenta los costos operativos por tokenPara cargas de trabajo de IA de contexto largo y agente con entradas de más de 100,000 tokens, tales gastos generales dañan gravemente la economía de la unidad de implementaciones de IA de producción.
El punto de referencia se basó en 9 nodos, 72 GPU H100, ventanas de contexto de 100.000 tokens y miles de usuarios concurrentes, con claras brechas de rendimiento que se muestran a continuación:
-
Capacidad de los usuarios simultáneos: WEKA admite más de 5.000 usuarios simultáneos, en comparación con solo 600 en las configuraciones solo con DRAM. Previene los fallos de saturación de la caché al expandir la caché activa de 8,64 TiB DRAM a 287 TiB de almacenamiento flash NVMe,maximizar el ROI del hardware de GPU existente sin compras adicionales de GPU.
-
Producción de fichas: La pila WEKA alcanzó alrededor de 2 millones de fichas por segundo, 10 veces más rápido que la línea de base de menos de 200,000 fichas / segundo de los sistemas solo con DRAM.
-
Volumen total de procesamiento de fichas: En una prueba de una hora con 2,400 usuarios simultáneos, WEKA procesó 5 mil millones de fichas, mientras que la configuración solo con DRAM solo manejó 700 millones de fichas.
Para los flujos de trabajo de IA agente, la DRAM insuficiente desencadena un recomputo constante de la GPU después de la saturación de la caché, elevando los costos por token y reduciendo el ROI.WEKA reduce en gran medida los costos generales de tokens para los servicios de producción de IA.
Para los servicios de IA en tiempo real que incluyen búsqueda, resumen, asistencia de código y agentes de múltiples turnos, el rendimiento de token define los límites de servicio para la capacidad del usuario,velocidad de respuesta y potencial de ingresos de infraestructuraLa mejora de rendimiento de 10x desbloquea completamente el poder de computación de la GPU nativa dentro del clúster OCI.
En resumen, el software de expansión de memoria de WEKA ayuda a las plataformas en la nube a servir a más usuarios, procesar más tokens y reducir los costos operativos de manera efectiva.
Liran Zvibel, director ejecutivo de WEKA, dijo: "El rendimiento de la inferencia se ve obstaculizado por la memoria efectiva de la GPU disponible. Estos resultados demuestran que las actualizaciones de hardware por sí solas no pueden solucionar los problemas económicos de los tokens de IA.La verdadera limitación es la pared de memoria de larga duración que restringe el rendimiento de la GPULa solución de WEKA® en OCI aumenta drásticamente la capacidad de procesamiento de tokens con un costo total de propiedad optimizado.
OCI ha publicado la metodología de referencia completa, las configuraciones del sistema y los resultados completos de las pruebas en su blog oficial de AI & Data Science.
NeuralMesh with Augmented Memory Grid ahora está disponible para los clientes de WEKA y cotiza en Oracle Marketplace, con OCI actuando como su socio exclusivo de lanzamiento de la nube.Las empresas que ejecutan la inferencia de contexto largo en OCI pueden implementar este, la arquitectura totalmente validada de inmediato.
China, China, China, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón, Japón.
Sandy Yang, directora de estrategia global
WhatsApp / WeChat: +86 13426366826 El número de teléfono es:
Correo electrónico: yangyd@qianxingdata.com
El sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque en el negocio:
Distribución de productos TIC/Integración de sistemas y servicios/Soluciones de infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con las principales marcas globales para ofrecer productos confiables y servicios profesionales.
Usar la tecnología para construir un mundo inteligente¡Su proveedor de servicios de productos TIC de confianza!