Zilliz lanzó Milvus v3.0, su base de datos vectorial de código abierto, agregando acceso a datos nativos del lago y un motor de recuperación mejorado para desarrolladores de IA de producción.
La arquitectura nativa de Lake mantiene los datos sin procesar en formatos abiertos en el almacenamiento de objetos en la nube en lugar de duplicarlos en bases de datos independientes. Zilliz presentó su concepto Vector Lakebase en la vista previa pública de junio; El director ejecutivo, Charles Xie, lo describió como una base de datos unificada que permite consultas en tiempo real, exploración de datos y canales de capacitación de IA de varios petabytes sin copias de datos, migración o pilas de almacenamiento paralelo. La capa de almacenamiento de objetos unificados admite búsquedas vectoriales en línea de baja latencia y análisis a gran escala en archivos fuente idénticos.
El cofundador y director de tecnología de Zilliz, James Luan, comentó: "Milvus 3.0 ejecuta la recuperación de producción directamente sobre los almacenes de datos existentes y ofrece un motor más potente para las cargas de trabajo de IA modernas. Este mismo núcleo impulsa Zilliz Vector Lakebase, mejorado con escalamiento elástico, operaciones simplificadas y herramientas de nivel empresarial para la gestión de datos de IA a gran escala".
Las bases de datos vectoriales almacenan incrustaciones numéricas de vectores para texto, imágenes y otro contenido para impulsar la búsqueda de similitudes. Zilliz afirma que Milvus es la base de datos vectorial de código abierto más utilizada en el mundo, adoptada por más de 10.000 empresas para RAG, motores de recomendación y agentes de IA, con más de 100 millones de extracciones de Docker registradas.
Los canales de IA tradicionales mantienen copias de datos separadas para su recuperación en tiempo real y análisis fuera de línea, lo que genera costos de almacenamiento adicionales, largas exportaciones de datos, canales de sincronización y una gran sobrecarga operativa.
Capacidades principales de Milvus 3.0
1.Colecciones Externas: Cree colecciones Milvus sobre archivos de lago en Lance, Iceberg, Parquet o Vortex. El sistema crea índices vectoriales, de texto completo, JSON y escalares en datos de origen sin duplicación, exponiéndolos a través de API nativas estándar. La sincronización incremental actualiza automáticamente los índices a medida que cambian los datos del lago.
2.Motor de almacenamiento Loon: Un nuevo motor basado en manifiestos que corta la amplificación de lectura para búsquedas de almacenamiento de objetos de baja latencia, utilizando Vortex abierto compatible con Arrow como formato de columnas predeterminado.
3.Instantáneas de un momento determinado: Las instantáneas de recopilación livianas de solo lectura permiten que los trabajos de deduplicación, evaluación y validación sin conexión se ejecuten en conjuntos de datos estables sin interrumpir las escrituras de producción.
4. Operadores por lotes y conectores de chispa: Un conector Spark DataSource V2 integra Milvus con flujos de trabajo por lotes de Spark, Databricks y EMR, junto con funciones por lotes vectoriales nativas para deduplicación y agrupación en clústeres.

La búsqueda de vectores Top-K estándar solo recupera los vectores más similares mediante el cálculo de la distancia, lo que sufre un escalado deficiente con recuentos y dimensiones de vectores elevados. Milvus 3.0 amplía la recuperación mucho más allá de la búsqueda básica del vecino más cercano:
1.La clasificación, agregación y búsqueda por facetas del lado del servidor combinan similitud semántica con filtros de metadatos (marca de tiempo, precio, categoría, inquilino, etc.), eliminando el posprocesamiento del lado del cliente.
2.La recuperación multivectorial de StructList admite entidades con múltiples incrustaciones (fragmentos de documentos, parches de imágenes, datos de productos multimodales) y funciona con modelos de interacción tardía como ColBERT y ColPali.
3. El índice disperso optimizado reduce el espacio de almacenamiento en aproximadamente un 70 % y al mismo tiempo iguala el rendimiento de recuperación original, combinado con vectores dispersos aprendidos por SINDI, MinHash integrado, campos vectoriales anulables, diccionarios de texto completo personalizados y una compatibilidad más amplia con el índice Faiss.
Luan agregó que las cargas de trabajo de producción de IA requieren clasificación, agrupación y búsqueda de múltiples vectores de forma nativa dentro de la base de datos, y un almacenamiento reelaborado v3.0 para ofrecer un acceso rápido al almacenamiento de objetos junto con un procesamiento más completo en el motor.
Este núcleo unificado impulsa tanto Milvus de código abierto autohospedado como Zilliz Cloud totalmente administrado. Zilliz Cloud amplía el motor base a un Vector Lakebase completo con computación elástica, herramientas de descubrimiento, análisis por lotes, indexación unificada, gobierno empresarial y automatización en una única fuente de datos de IA.
Contexto competitivo de la industria
La actualización aumenta la presión sobre sus rivales Pinecone, Qdrant y Weaviate, todos compitiendo para reducir la latencia de búsqueda: Qdrant lanzó una indexación más rápida, clústeres de alta disponibilidad y registros de auditoría de cumplimiento en abril; Pinecone lanzó conjuntos de vectores precalculados y recuperadores componibles en mayo para acelerar los flujos de trabajo de los agentes.
Los proveedores de bases de datos puramente vectoriales compiten contra plataformas multimodelo, incluidas Regatta, SingleStore y SurrealDB. Si bien se integran con lagos como Databricks y Snowflake, las asociaciones más profundas entre bases de datos enfrentan barreras arquitectónicas y de motores de almacenamiento. El mercado puede ver a los actores vectoriales agregar soporte nativo estructurado, gráfico, documento o serie temporal con el tiempo.
Disponibilidad
Milvus 3.0 sigue siendo un proyecto graduado de LF AI & Data bajo licencia Apache 2.0, implementable a través de Docker o Kubernetes, incluidos entornos aislados, con compatibilidad para almacenamiento de objetos S3, GCS y Azure Blob. La cobertura inicial del SDK incluye Python, Go y Node.js, y próximamente se admitirá Java. El código fuente, las notas de la versión y las guías de inicio rápido están alojados en GitHub, junto con el horario de oficina de la comunidad para soporte a los desarrolladores.
Managed Zilliz Cloud incorpora Milvus 3.0 como su capa de indexación central, agregando elasticidad empresarial, seguridad y operaciones unificadas en una única copia de datos compartida.
Nota
Las colecciones externas implementan indexación de lagos de copia cero sin migración de datos; Loon resuelve el cuello de botella de la amplificación de lectura que anteriormente limitaba el almacenamiento de objetos para consultas vectoriales de baja latencia.
Beijing Qianxing Jietong Tecnología Co., Ltd.
Sandy Yang/Director de Estrategia Global
WhatsApp/WeChat: +86 13426366826
Correo electrónico: yangyd@qianxingdata.com
Sitio web: www.qianxingdata.com/www.storagesserver.com
Enfoque empresarial:
Distribución de productos TIC/Integración de sistemas y servicios/Soluciones de infraestructura
Con más de 20 años de experiencia en distribución de TI, nos asociamos con marcas líderes a nivel mundial para ofrecer productos confiables y servicios profesionales.
“Uso de la tecnología para construir un mundo inteligente” ¡Su proveedor de servicios de productos TIC de confianza!