NetApp adquirirá DataPelago, creador del Nucleus Universal Data Processing Engine (UDPE) que acelera la computación heterogénea para análisis e IA generativa.
Basado en Gluten, Velox y Substrait de código abierto, Nucleus acelera drásticamente Spark y Trino para ofrecer una relación costo-rendimiento sobresaliente. Se conecta perfectamente a Lakehouses existentes, SQL, Python, Airflow, Tableau, Power BI y más sin migración de datos ni dependencia de proveedores. Fundada en 2021 por el director ejecutivo Rajan Goyal y el CPO Anand Iyer, DataPelago salió sigilosamente en octubre de 2024 y recaudó más de 75 millones de dólares en total, incluida una ronda de financiación de 47 millones de dólares en 2024.
El director ejecutivo de NetApp, George Kurian, afirmó que el avance del hardware de IA exige una infraestructura de datos igualmente capaz para desbloquear el valor de los datos empresariales, y la adquisición fortalece la capacidad de NetApp para ofrecer un procesamiento de datos ágil para una diferenciación competitiva.
Un blog de DataPelago señaló que Nucleus se integrará de forma nativa en la plataforma de datos de NetApp, lo que permitirá una adopción empresarial mucho más amplia de la que la startup podría lograr de forma independiente. A principios de este año, DataPelago ocupó el cuarto lugar en ciencia de datos en la lista de las empresas más innovadoras del mundo 2026 de Fast Company.
A diferencia de las arquitecturas tradicionales que trasladan los conjuntos de datos a clústeres de CPU/GPU externos, Nucleus ejecuta computación acelerada directamente en el nivel de almacenamiento. Las pruebas comparativas con Nvidia cuDF muestran proyecciones hasta 10,5 veces más rápidas, filtros 10,1 veces más rápidos y agregaciones 4,3 veces más rápidas. Ubicada entre motores de consulta (Spark, Trino, Flink) y frameworks Python (Ray, Dask), su pila tiene tres capas modulares:
1.DataApp: módulo de integración conectable para inyectar aceleración en Spark, Trino y otros motores.
2.DataOS: capa de orquestación que asigna dinámicamente tareas de datos a aceleradores mixtos para un ajuste del rendimiento escalable.
3.DataVM: máquina virtual personalizada con ISA de dominio específico, que ofrece abstracción de ejecución unificada para CPU, GPU, FPGA y silicio personalizado.
Flujo de ejecución de datos centrales
1.Acceso a datos a través de conectores de marco: implementado como complementos Spark JAR compatibles con conectores de datos estándar, compatibles con Parquet, ORC, Iceberg, Delta Lake, JSON y objetivos de almacenamiento, incluidos S3, GCS, ADLS, HDFS y matrices locales. La aceleración se extiende a las integraciones de almacenamiento y al mismo tiempo conserva la semántica de consultas nativa a través de capas de E/S del motor estándar.
2.Planificación y optimización de consultas: el motor host genera un plan físico; DataApp lo convierte a una representación intermedia a través de Gluten/Substrait. Un optimizador inteligente crea gráficos de flujo de datos óptimos y asigna recursos de CPU/GPU para la ejecución de DataOS/DataVM.
3.Optimizaciones de transferencia de datos entre hardware: la fusión operador/kernel y la ejecución de transmisión eliminan la materialización intermedia completa para reducir la sobrecarga de E/S. La memoria compartida de copia cero reduce la duplicación de datos CPU-GPU, mientras que ISA de DataVM aprovecha LLVM, CUDA y ROCm para enrutar tareas al hardware óptimo mediante procesamiento vectorizado en columnas. Estos ajustes aumentan la utilización de la GPU al 80-90 % al minimizar la mezcla de datos entre dominios.
Nucleus opera localmente y en las principales nubes públicas. Su acelerador Spark ofrece ganancias de rendimiento de 3 a 4 veces en comparación con Databricks Photon; también se integra con Snowflake al acelerar el procesamiento de formato de tabla abierta y las canalizaciones Spark/Trino ascendentes y descendentes que alimentan el almacén. DataPelago afirma que Nucleus reduce los costos de infraestructura hasta en un 80 % y ofrece un rendimiento 10 veces más rápido que las tuberías heredadas. Al eliminar la duplicación obligatoria de datos entre los sistemas operativos y de IA, se elimina el principal cuello de botella que ralentiza la implementación de la IA empresarial, con implementaciones en vivo en grandes empresas globales en todos los sectores verticales.
El director ejecutivo de DataPelago, Rajan Goyal, dijo que la misión principal de la empresa es resolver los cuellos de botella en el procesamiento de datos que frenan la innovación en IA. La fusión con NetApp combina su innovadora tecnología de aceleración con la amplia cartera de infraestructura de datos de NetApp; Las empresas han invertido mucho en GPU y modelos, pero sufren silos de datos fragmentados que dejan el hardware subutilizado, y la pila combinada agiliza la implementación de IA a gran escala.
NetApp enmarca la adquisición como una actualización histórica de su cartera, que lleva el procesamiento acelerado por GPU directamente a los flujos de trabajo de almacenamiento para ofrecer una verdadera activación de datos empresariales sin copia para IA. Los datos financieros de las transacciones siguen sin revelarse; Dada la tracción empresarial de Nucleus, la estrecha sinergia con NetApp AIDE y la creciente demanda de IA agente, la valoración de compra probablemente alcance un múltiplo de 4 a 5 veces de la financiación total de 75 millones de dólares de DataPelago. DataPelago operará como una filial de propiedad absoluta de NetApp.
Distinción clave: Nucleus, KV Cache y NetApp AIDE
1.Diferenciación de Nucleus y KV Cache: Nucleus optimiza la ingesta, transformación y consulta de datos previos a la inferencia antes de que los datos lleguen a los servidores de GPU. KV Cache de Nvidia es una optimización de la memoria en la GPU que se activa solo después de la llegada de los datos al hardware de la GPU para aumentar la eficiencia de la generación de tokens. Nucleus acelera la entrega de datos para la computación; KV Cache optimiza el tiempo de ejecución del modelo después de que los datos llegan a los aceleradores.
2.NetApp AIDE frente a Nucleus UDPE: AIDE es un preprocesamiento de IA bloqueado por ONTAP/AFX para LLM y agentes, que funciona como ETL propietario con base de datos vectorial incorporada, catalogación de metadatos, servicio RAG e integración empresarial de Nvidia AI (incluidos los microservicios de vectorización NIM). Nucleus es independiente del almacenamiento y acelera las cargas de trabajo genéricas de Spark/Trino. La integración de Nucleus con AIDE fortalecería los canales de transformación, capacitación, ajuste e inferencia, permitiendo cargas de trabajo aceleradas directamente en el almacenamiento AFX de NetApp; Es previsible una solución integral AIDE+Nucleus.
Syam Nair, CPO de NetApp, comentó que Nucleus ofrece aceleración definida por software en el almacenamiento, lo que permite la preparación de datos sin copia, la gobernanza y la activación de IA en CPU y GPU. NetApp gestiona más datos empresariales multientorno que cualquier rival, y la próxima ola de competitividad de la IA depende del procesamiento de datos en su origen: el equipo de ingeniería de DataPelago acelera esta hoja de ruta estratégica.
Beijing Qianxing Jietong Tecnología Co., Ltd.
Sandy Yang/Director de Estrategia Global
WhatsApp/WeChat: +86 13426366826
Correo electrónico: yangyd@qianxingdata.com
Sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque empresarial:
Distribución de productos TIC/Integración de sistemas y servicios/Soluciones de infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con marcas líderes a nivel mundial para ofrecer productos confiables y servicios profesionales.
“Uso de la tecnología para construir un mundo inteligente” ¡Su proveedor de servicios de productos TIC de confianza!