A Zilliz lançou o Milvus v3.0, seu banco de dados vetorial de código aberto, adicionando acesso a dados nativos do lago e um mecanismo de recuperação atualizado para desenvolvedores de IA de produção.
A arquitetura nativa do Lake mantém os dados brutos em formatos abertos no armazenamento de objetos em nuvem, em vez de duplicá-los em bancos de dados independentes. Zilliz revelou seu conceito Vector Lakebase na prévia pública de junho; O CEO Charles Xie descreveu-o como uma base de dados unificada que permite consultas em tempo real, exploração de dados e pipelines de treinamento de IA de vários petabytes sem cópias de dados, migração ou pilhas de armazenamento paralelas. A camada unificada de armazenamento de objetos oferece suporte à pesquisa vetorial on-line de baixa latência e à análise em grande escala em arquivos de origem idênticos.
O cofundador e CTO da Zilliz, James Luan, comentou: "O Milvus 3.0 executa a recuperação de produção diretamente sobre os armazenamentos de dados existentes e oferece um mecanismo mais poderoso para cargas de trabalho modernas de IA. Esse mesmo núcleo alimenta o Zilliz Vector Lakebase, aprimorado com escalabilidade elástica, operações simplificadas e ferramentas de nível empresarial para gerenciamento de dados de IA em grande escala".
Os bancos de dados vetoriais armazenam incorporações numéricas de vetores para texto, imagens e outros conteúdos para potencializar a pesquisa por similaridade. Zilliz afirma que Milvus é o banco de dados vetorial de código aberto mais usado no mundo, adotado por mais de 10.000 empresas para RAG, mecanismos de recomendação e agentes de IA, com mais de 100 milhões de pulls de Docker registrados.
Os pipelines de IA tradicionais mantêm cópias de dados separadas para recuperação em tempo real e análises off-line, gerando custos extras de armazenamento, exportações demoradas de dados, pipelines de sincronização e pesada sobrecarga operacional.
Capacidades principais do Milvus 3.0
1. Coleções Externas: Crie coleções Milvus sobre arquivos de lago em Lance, Iceberg, Parquet ou Vortex. O sistema cria índices vetoriais, de texto completo, JSON e escalares nos dados de origem sem duplicação, expondo-os por meio de APIs nativas padrão. A sincronização incremental atualiza automaticamente os índices à medida que os dados do lago mudam.
2. Mecanismo de armazenamento Loon: um novo mecanismo baseado em manifesto que corta a amplificação de leitura para pesquisas de armazenamento de objetos de baixa latência, usando Vortex aberto compatível com Arrow como formato colunar padrão.
3. Instantâneos pontuais: instantâneos leves de coleta somente leitura permitem que trabalhos de desduplicação, avaliação e validação off-line sejam executados em conjuntos de dados estáveis sem interromper as gravações de produção.
4. Conector Spark e operadores de lote: um conector Spark DataSource V2 integra Milvus com fluxos de trabalho em lote Spark, Databricks e EMR, juntamente com funções nativas de lote vetorial para desduplicação e clustering.

A pesquisa vetorial Top-K padrão busca apenas os vetores mais semelhantes por cálculo de distância, sofrendo escalonamento deficiente com altas contagens e dimensões de vetores. Milvus 3.0 expande a recuperação muito além da pesquisa básica pelo vizinho mais próximo:
1. A classificação, agregação e pesquisa facetada do lado do servidor combinam similaridade semântica com filtros de metadados (carimbo de data e hora, preço, categoria, inquilino, etc.), eliminando o pós-processamento do lado do cliente.
A recuperação multivetorial 2.StructList oferece suporte a entidades com vários embeddings (pedaços de documentos, patches de imagens, dados de produtos multimodais) e funciona com modelos de interação tardia, como ColBERT e ColPali.
3. O índice esparso otimizado reduz o espaço de armazenamento em aproximadamente 70%, ao mesmo tempo que corresponde ao desempenho de recuperação original, emparelhado com vetores esparsos aprendidos pelo SINDI, MinHash integrado, campos de vetor anuláveis, dicionários de texto completo personalizados e compatibilidade mais ampla do índice Faiss.
Luan acrescentou que as cargas de trabalho de IA de produção exigem classificação, agrupamento e pesquisa multivetorial nativamente no banco de dados, e o armazenamento retrabalhado v3.0 para fornecer acesso rápido ao armazenamento de objetos junto com um processamento no mecanismo mais rico.
Este núcleo unificado alimenta tanto o Milvus de código aberto auto-hospedado quanto o Zilliz Cloud totalmente gerenciado. Zilliz Cloud estende o mecanismo básico em um Vector Lakebase completo com computação elástica, ferramentas de descoberta, análise em lote, indexação unificada, governança corporativa e automação em uma única fonte de dados de IA.
Contexto competitivo da indústria
A atualização aumenta a pressão sobre os rivais Pinecone, Qdrant e Weaviate, todos correndo para reduzir a latência de pesquisa: Qdrant lançou indexação mais rápida, clusters de alta disponibilidade e registros de auditoria de conformidade em abril; A Pinecone lançou conjuntos de vetores pré-computados e recuperadores combináveis em maio para acelerar os fluxos de trabalho dos agentes.
Os fornecedores de bancos de dados vetoriais puros competem com plataformas multimodelos, incluindo Regatta, SingleStore e SurrealDB. Embora se integrem a lakehouses como Databricks e Snowflake, parcerias mais profundas entre bancos de dados enfrentam barreiras arquitetônicas e de mecanismo de armazenamento. O mercado pode ver os players de vetores adicionarem suporte nativo estruturado, gráfico, documento ou série temporal ao longo do tempo.
Disponibilidade
Milvus 3.0 continua sendo um projeto LF AI & Data graduado sob licenciamento Apache 2.0, implantável via Docker ou Kubernetes, incluindo ambientes air-gapped, com compatibilidade para armazenamento de objetos S3, GCS e Azure Blob. A cobertura inicial do SDK inclui Python, Go e Node.js, com suporte para Java em breve. O código-fonte, as notas de lançamento e os guias de início rápido estão hospedados no GitHub, juntamente com o horário comercial da comunidade para suporte ao desenvolvedor.
O Managed Zilliz Cloud incorpora Milvus 3.0 como sua camada central de indexação, adicionando elasticidade empresarial, segurança e operações unificadas em uma única cópia de dados compartilhada.
Nota de rodapé
Coleções externas implementam indexação de lago de cópia zero sem migração de dados; Loon resolve o gargalo de amplificação de leitura que anteriormente limitava o armazenamento de objetos para consultas vetoriais de baixa latência.
Pequim Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Diretora de Estratégia Global
WhatsApp/WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Site: www.qianxingdata.com/www.storagesserver.com
Foco de negócios:
Distribuição de produtos de TIC/integração de sistemas e serviços/soluções de infraestrutura
Com mais de 20 anos de experiência em distribuição de TI, fazemos parcerias com marcas líderes globais para fornecer produtos confiáveis e serviços profissionais.
“Usando a tecnologia para construir um mundo inteligente”Seu provedor confiável de serviços de produtos de TIC!