A NetApp adquirirá a DataPelago, criadora do Nucleus Universal Data Processing Engine (UDPE), que acelera a computação heterogênea para análise e IA generativa.
Construído com base em Gluten, Velox e Substrait de código aberto, o Nucleus acelera drasticamente o Spark e o Trino para oferecer excelente custo-desempenho. Ele se conecta perfeitamente a lakehouses existentes, SQL, Python, Airflow, Tableau, Power BI e muito mais, sem migração de dados ou dependência de fornecedor. Fundada em 2021 pelo CEO Rajan Goyal e pelo CPO Anand Iyer, a DataPelago saiu do sigilo em outubro de 2024 e arrecadou mais de US$ 75 milhões no total, incluindo uma rodada de financiamento de US$ 47 milhões em 2024.
O CEO da NetApp, George Kurian, afirmou que o avanço do hardware de IA exige uma infraestrutura de dados igualmente capaz para desbloquear o valor dos dados corporativos, e a aquisição fortalece a capacidade da NetApp de fornecer processamento ágil de dados para diferenciação competitiva.
Um blog DataPelago observou que o Nucleus será nativamente incorporado à plataforma de dados da NetApp, permitindo uma adoção empresarial muito mais ampla do que a startup poderia alcançar de forma independente. No início deste ano, a DataPelago ficou em quarto lugar na lista de Empresas Mais Inovadoras do Mundo de 2026 da Fast Company em Data Science.
Ao contrário das arquiteturas tradicionais que transferem conjuntos de dados para clusters externos de CPU/GPU, o Nucleus executa computação acelerada diretamente na camada de armazenamento. Os benchmarks contra Nvidia cuDF mostram projeções até 10,5x mais rápidas, filtros 10,1x mais rápidos e agregações 4,3x mais rápidas. Posicionado entre motores de consulta (Spark, Trino, Flink) e frameworks Python (Ray, Dask), sua pilha possui três camadas modulares:
1.DataApp: Módulo de integração conectável para injetar aceleração em Spark, Trino e outros motores.
2.DataOS: Camada de orquestração que mapeia dinamicamente tarefas de dados para aceleradores mistos para ajuste de desempenho escalonável.
3.DataVM: máquina virtual personalizada com ISA específico de domínio, oferecendo abstração de execução unificada para CPUs, GPUs, FPGAs e silício personalizado.
Fluxo de execução de dados principais
1. Acesso a dados por meio de conectores de estrutura: implantados como plug-ins Spark JAR compatíveis com conectores de dados padrão, com suporte para Parquet, ORC, Iceberg, Delta Lake, JSON e destinos de armazenamento, incluindo S3, GCS, ADLS, HDFS e matrizes locais. A aceleração se estende às integrações de armazenamento, mantendo a semântica de consulta nativa por meio de camadas de E/S de mecanismo padrão.
2.Planejamento e otimização de consultas: O mecanismo host gera um plano físico; DataApp converte-o em uma representação intermediária via Gluten/Substrait. Um otimizador inteligente cria gráficos de fluxo de dados ideais e aloca recursos de CPU/GPU para execução de DataOS/DataVM.
3. Otimizações de transferência de dados entre hardware: a fusão do operador/kernel e a execução de streaming eliminam a materialização intermediária completa para reduzir a sobrecarga de E/S. A memória compartilhada de cópia zero reduz a duplicação de dados CPU-GPU, enquanto o ISA do DataVM aproveita LLVM, CUDA e ROCm para rotear tarefas para hardware ideal por meio de processamento vetorizado colunar. Esses ajustes aumentam a utilização da GPU para 80–90%, minimizando o embaralhamento de dados entre domínios.
O Nucleus opera no local e nas principais nuvens públicas. Seu acelerador Spark oferece ganhos de rendimento de 3 a 4x em comparação ao Databricks Photon; ele também se integra ao Snowflake, acelerando o processamento de formato de tabela aberta e pipelines Spark/Trino upstream/downstream que alimentam o warehouse. DataPelago afirma que o Nucleus reduz os custos de infraestrutura em até 80% e oferece desempenho 10x mais rápido do que pipelines legados. Ao remover a duplicação obrigatória de dados entre sistemas operacionais e de IA, elimina o principal gargalo que retarda a implementação de IA empresarial, com implantações em tempo real em grandes empresas globais em setores verticais.
O CEO da DataPelago, Rajan Goyal, disse que a missão principal da empresa é resolver os gargalos de processamento de dados que impedem a inovação em IA. A fusão com a NetApp combina sua inovadora tecnologia de aceleração com o extenso portfólio de infraestrutura de dados da NetApp; as empresas investiram pesadamente em GPUs e modelos, mas sofrem com silos de dados fragmentados que deixam o hardware subutilizado, e a pilha combinada agiliza a implantação de IA em grande escala.
A NetApp enquadra a aquisição como uma atualização de portfólio marcante, trazendo o processamento acelerado por GPU diretamente para os fluxos de trabalho de armazenamento para fornecer uma verdadeira ativação de dados corporativos de cópia zero para IA. Os dados financeiros da transação permanecem não divulgados; dada a tração empresarial da Nucleus, a forte sinergia com o NetApp AIDE e a crescente demanda de IA da agência, a avaliação de compra provavelmente chegará a um múltiplo de 4–5x do financiamento total de US$ 75 milhões da DataPelago. A DataPelago operará como uma subsidiária integral da NetApp.
Distinção principal: Nucleus vs KV Cache vs NetApp AIDE
1. Diferenciação de Nucleus e KV Cache: O Nucleus otimiza a ingestão, transformação e consulta de dados de pré-inferência antes que os dados cheguem aos servidores GPU. O KV Cache da Nvidia é uma otimização de memória na GPU ativa apenas após a chegada de dados no hardware da GPU para aumentar a eficiência da geração de tokens. Nucleus acelera a entrega de dados para computação; O KV Cache otimiza o tempo de execução do modelo depois que os dados chegam aos aceleradores.
2.NetApp AIDE vs Nucleus UDPE: AIDE é um pré-processamento de IA bloqueado por ONTAP/AFX para LLMs e agentes, funcionando como ETL proprietário com banco de dados vetorial integrado, catalogação de metadados, serviço RAG e integração Nvidia AI Enterprise (incluindo microsserviços de vetorização NIM). O Nucleus é independente de armazenamento e acelera cargas de trabalho genéricas do Spark/Trino. A integração do Nucleus com o AIDE fortaleceria os pipelines de transformação, treinamento, ajuste fino e inferência, permitindo cargas de trabalho aceleradas do lakehouse diretamente no armazenamento NetApp AFX; é previsível uma solução integrada AIDE+Nucleus de ponta a ponta.
O CPO da NetApp, Syam Nair, comentou que o Nucleus oferece aceleração definida por software no armazenamento, permitindo preparação de dados sem cópia, governança e ativação de IA em CPUs e GPUs. A NetApp gerencia mais dados corporativos em vários ambientes do que qualquer rival, e a próxima onda de competitividade em IA depende do processamento de dados em sua fonte – a equipe de engenharia da DataPelago acelera esse roteiro estratégico.
Pequim Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Diretora de Estratégia Global
WhatsApp/WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Site: www.qianxingdata.com/www.storagesserver.com
Foco de negócios:
Distribuição de produtos de TIC/integração de sistemas e serviços/soluções de infraestrutura
Com mais de 20 anos de experiência em distribuição de TI, fazemos parcerias com marcas líderes globais para fornecer produtos confiáveis e serviços profissionais.
“Usando a tecnologia para construir um mundo inteligente”Seu provedor confiável de serviços de produtos de TIC!