logo
Casa Notícias

notícias da empresa sobre Redbook da Big Blue sobre gerenciamento de cache KV em escala de armazenamento

Certificado
China Beijing Qianxing Jietong Technology Co., Ltd. Certificações
China Beijing Qianxing Jietong Technology Co., Ltd. Certificações
Revisões do cliente
A equipe de vendas da tecnologia Co. de Qianxing Jietong do Pequim, Ltd é muito profissional e paciente. Podem fornecer cotações rapidamente. A qualidade e o empacotamento dos produtos são igualmente muito bons. Nossa cooperação é muito lisa.

—— LLC do》 de Festfing DV do 《

Quando eu procurava o processador central de intel e o SSD de Toshiba urgentemente, Sandy da tecnologia Co. de Qianxing Jietong do Pequim, Ltd deu-me muita ajuda e obteve-me os produtos que eu precisei rapidamente. Eu aprecio-a realmente.

—— Kitty Yen

Sandy da tecnologia Co. de Qianxing Jietong do Pequim, Ltd é um vendedor muito cuidadoso, que possa me lembrar de erros da configuração a tempo quando eu compro um servidor. Os coordenadores são igualmente muito profissionais e podem rapidamente terminar o processo de teste.

—— Strelkin Mikhail Vladimirovich

Estamos muito satisfeitos com a nossa experiência de trabalho com a Beijing Qianxing Jietong. A qualidade do produto é excelente e a entrega é sempre pontual. A equipe de vendas é profissional, paciente e muito prestativa com todas as nossas perguntas. Agradecemos muito o seu apoio e esperamos uma parceria de longo prazo. Altamente recomendado!

—— Ahmad Navid

Qualidade: Ótima experiência com o meu fornecedor. O MikroTik RB3011 já estava usado, mas estava em muito bom estado e tudo funcionava perfeitamente.E todas as minhas preocupações foram resolvidas rapidamente.Fornecedor muito fiável, altamente recomendado.

—— Geran Colesio

Estou Chat Online Agora
empresa Notícias
Redbook da Big Blue sobre gerenciamento de cache KV em escala de armazenamento

O sistema de arquivos paralelo IBM Storage Scale suporta o gerenciamento de cache KV distribuído emparelhado com o NVIDIA Dynamo, atendendo a cenários de inferência de IA em larga escala com cargas de trabalho de contexto maciças.

últimas notícias da empresa sobre Redbook da Big Blue sobre gerenciamento de cache KV em escala de armazenamento  0

A IBM lançou um Redbook oficial chamadoContexto sem limites: uma plataforma de cache KV de alto desempenho para inferência de IA em larga escala, fornecendo uma arquitetura de referência completa validada para esta solução conjunta.e IBM Storage Scale Erasure Coding Edition (ECE) para construir uma camada de armazenamento compartilhada de alto desempenho para inferência de IAComo documentos técnicos autorizados publicados pela IBM ITSO (Organização Internacional de Apoio Técnico), os IBM Redbooks oferecemOrientação aprofundada para a implantação de produtos de infraestrutura IBM de nível empresarial.

Co-autoria por equipes de engenharia da IBM, Supermicro e NVIDIA, o Redbook aborda um ponto de dor central das cargas de trabalho de IA de longo contexto.Aplicações de recuperação RAG e pipelines de agentes autônomos geram dados de cache KV maciços dentro da GPU HBMUma vez que os dados em cache são despejados dos recursos limitados da HBM, a recomputação repetida desencadeará aumentos graves de latência, tornando o armazenamento de cache KV de pedido cruzado persistente indispensável.

A solução adota uma arquitetura de cache KV hierárquica de cinco níveis que abrange diferentes demandas de latência e capacidade:
  • Camada G1: GPU local HBM
  • Camada G2: DRAM do sistema de nós da CPU
  • Capa G3: SSD local ligado diretamente
  • G3.5 Camada: Armazenamento flash compartilhado em nível de pod, com frontes de DPUs NVIDIA BlueField com interconexão direta para DPUs de servidor GPU
  • Capa G4: Pool de armazenamento compartilhado cross-Ethernet externo conectado a todos os servidores de computação GPU
Cobrindo a memória de ponta a ponta e a hierarquia de armazenamento, esta configuração de várias camadas oferece latência contínua e gradientes de capacidade.Despejo automático e recarga dinâmica de dados em toda a pilha de armazenamento, adaptando-se de forma flexível aos diversos padrões de acesso à carga de trabalho e aos orçamentos dos custos totais das infra-estruturas.

Implementado em Supermicro Petascale Storage Servers, o Storage Scale ECE serve como a camada de cache frio G4.Incluindo os estados de conversação inativa de várias voltas, dados de contexto de agentes compartilhados e registros de consultas históricas que não exigem resposta instantânea.

De acordo com os resultados dos testes registrados no Redbook, esta arquitetura de referência pronta para produção acelera efetivamente os serviços de inferência de IA geradora e agente.Em testes TTFT (Time To First Token) de solicitação única em comparação com servidores GPU autônomos sem cache KV de escala de armazenamento externo, o sistema integrado mantém um TTFT estável independentemente de mudanças rápidas de comprimento.56x aceleraçãoA função é executada com uma sequência de entrada de 130k tokens e elimina completamente as flutuações de latência de inferência causadas por comprimentos de prompt estendidos.

Sob a pressão de inferência simultânea de vários utilizadores, a solução obtém uma melhoria dramática do desempenho: o débito de solicitação aumenta de 0,19 RPS para 4,26 RPS, marcando uma22x aumento de potênciaEnquanto isso, o tempo total de processamento para 200 solicitações de inferência cai em 95%, aumentando muito a eficiência de utilização da GPU e a escalabilidade geral do cluster de inferência.

A pilha também mantém um desempenho robusto sob duros testes de estresse de vizinhos barulhentos.O sistema integrado continua a funcionar de forma estável a 3.6 RPS, terminando todas as 200 solicitações de inferência em 55,56 segundos.18 vezes mais altodo que a arquitetura de recomputo base de GPU.

A equipe de pesquisa concluiu no Redbook: "Para as empresas que pretendem maximizar o ROI em investimentos caros em hardware de GPU, esta arquitetura integrada verificada fornece uma solução simples,abordagem pronta para produção para aumentar o débito de inferência, reduzindo a latência de ponta a ponta, apoiando uma maior simultaneidade de serviços e construindo uma infraestrutura de inferência de IA em larga escala mais rentável.

Palavras chave: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo

Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang, Diretora Global de Estratégia
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Site: www.qianxingdata.com/www.storagesserver.com
Foco em Negócios:
Distribuição de produtos TIC/Integração de sistemas e serviços/Soluções de infraestrutura
Com mais de 20 anos de experiência em distribuição de TI, fazemos parcerias com as principais marcas globais para fornecer produtos confiáveis e serviços profissionais.
¢Utilizando a tecnologia para construir um mundo inteligente ¢O seu prestador de serviços de produtos TIC de confiança!
Tempo do bar : 2026-06-12 11:09:46 >> lista da notícia
Contacto
Beijing Qianxing Jietong Technology Co., Ltd.

Pessoa de Contato: Ms. Sandy Yang

Telefone: 13426366826

Envie sua pergunta diretamente para nós (0 / 3000)