Na Cúpula RAISE de Paris, a DDN apresentou sua colaboração contínua com a Nebul, um provedor de nuvem híbrida soberana europeia, focada em aumentar a eficiência para implantações de inferência de IA em grande escala. Revelada na semana passada, a iniciativa conjunta une a plataforma de inferência da Nebul, a arquitetura de inteligência de dados Infinia da DDN e a computação acelerada da NVIDIA para resolver um importante gargalo de produção de IA: custos de movimentação de dados e limitações de desempenho durante cargas de trabalho de inferência.
A DDN enquadra a colaboração em torno de métricas críticas de produção: utilização de GPU, taxa de transferência de token, custo por token e latência. Embora o treinamento de modelos construa valor de ativos de IA, a inferência define seus retornos operacionais e comerciais. A crescente adoção de IA agente, geração aumentada de recuperação (RAG) e inferência de alta simultaneidade significa que o armazenamento e a infraestrutura de dados impactam diretamente a eficiência do acelerador e as velocidades de resposta da IA.
Este projeto ativo de prova de conceito produziu resultados iniciais promissores. Os parceiros registraram melhorias mensuráveis no tempo até o primeiro token com cache KV habilitado e validação concluída para infraestrutura baseada em RoCE. O benchmarking contínuo cobre comprimentos de sequência de inferência mais longos, liberando ainda mais potencial de otimização para a plataforma Infinia. A colaboração também se expande para esforços conjuntos da NVIDIA em estruturas de benchmarking, verificação de escalabilidade e futuras publicações técnicas.
A plataforma integrada aproveita serviços de cache KV distribuídos, movimentação de dados nativa de GPU, orquestração inteligente de dados e arquitetura de armazenamento de alto desempenho. A aceleração do cache KV oferece ganhos de inferência notáveis, preservando e recuperando rapidamente estados de atenção pré-computados, reduzindo cálculos redundantes e eliminando atrasos na entrega de dados que causam ociosidade da GPU.
Os líderes da DDN, Nebul e NVIDIA destacaram uma grande mudança no setor: as prioridades da infraestrutura de IA estão mudando da implantação bruta de GPU para a eficiência operacional, maximizando os retornos do hardware acelerador existente. O CEO da DDN, Alex Bouzari, e o CEO da Nebul, Arnold Juffer, observaram que o foco anterior em escalas de modelos maiores deu lugar à otimização da economia de inferência para tornar a IA de produção comercialmente viável por meio de custos mais baixos por token. O vice-presidente de infraestrutura em nuvem da NVIDIA, Rod Evans, acrescentou que as cargas de trabalho de agente em grande escala agora medem o sucesso da infraestrutura pela utilização e latência da GPU, em vez de pelo poder computacional absoluto.
A DDN enfatiza que a infraestrutura de IA deve evoluir além das funções básicas de armazenamento para apoiar ativamente os fluxos de trabalho de execução de IA. As plataformas de infraestrutura da empresa alimentam atualmente mais de um milhão de GPUs em todo o mundo, atendendo hiperscaladores, provedores de nuvem, empresas, governos e instituições de pesquisa.
As equipes modernas de infraestrutura de IA agora priorizam estas principais métricas de produção:
Utilização de GPU: Mede a atividade efetiva do acelerador durante a inferência, maximizando o valor do hardware GPU de última geração.
Custo por token: vincula o desempenho da infraestrutura diretamente aos custos operacionais de saída do modelo de IA.
Tokens por watt: Avalia a eficiência energética da saída de inferência de IA.
Hora do primeiro token: determina a capacidade de resposta do aplicativo de IA interativo e a experiência do usuário.
Hora de produção: quantifica o esforço operacional para migrar serviços de IA de testes para implantação comercial escalável.
À medida que a inferência se torna a carga de trabalho de IA dominante, fornecer contexto em cache e dados corporativos para GPUs com latência baixa e estável será fundamental para sustentar a alta utilização da GPU e controlar os custos operacionais de longo prazo.
Pequim Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Diretora de Estratégia Global
WhatsApp/WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Site: www.qianxingdata.com/www.storagesserver.com
Foco de negócios:
Distribuição de produtos de TIC/integração de sistemas e serviços/soluções de infraestrutura
Com mais de 20 anos de experiência em distribuição de TI, fazemos parcerias com marcas líderes globais para fornecer produtos confiáveis e serviços profissionais.
“Usando a tecnologia para construir um mundo inteligente”Seu provedor confiável de serviços de produtos de TIC!
Sandy Yang/Diretora de Estratégia Global
WhatsApp/WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Site: www.qianxingdata.com/www.storagesserver.com
Foco de negócios:
Distribuição de produtos de TIC/integração de sistemas e serviços/soluções de infraestrutura
Com mais de 20 anos de experiência em distribuição de TI, fazemos parcerias com marcas líderes globais para fornecer produtos confiáveis e serviços profissionais.
“Usando a tecnologia para construir um mundo inteligente”Seu provedor confiável de serviços de produtos de TIC!



