NexSift
CloudNovo

SageMaker HyperPod ganha roteamento de inferência consciente de GPU

Publicado 19 de set. de 2026 · Leitura 1 min de leitura · Relevância 9.0

PorTiago CastroCriador do NexSift·NexSift Editorial
O que mudou

Novo Inference Gateway usa sinais de GPU, KV cache e LoRA para rotear inferência em clusters HyperPod/EKS, com redução reportada de até 82% no tempo até o primeiro token.

Por que importa

Inferência de LLM em GPU costuma desperdiçar capacidade quando o balanceador não conhece o estado interno do modelo. Tornar o roteamento consciente de KV cache, LoRA e carga pode reduzir latência e overprovisioning em clusters de produção sem exigir alterações na aplicação.

A AWS lançou o SageMaker HyperPod Inference Gateway, um sistema de roteamento de inferência Kubernetes-native distribuído como EKS managed addon. Em vez de round-robin ou least-connections, o gateway considera sinais em tempo real das GPUs, incluindo saturação de KV cache, gerações longas em andamento e adaptadores LoRA já carregados. A arquitetura usa Envoy Gateway e um Body-Based Router que inspeciona requisições compatíveis com a API da OpenAI e direciona cada modelo ao pool adequado. A AWS reporta, em seu cenário de referência, redução do tempo até o primeiro token de 4,4 segundos para menos de 800 ms, até 82%, sem mudanças nos model servers ou clientes.

O que observar agora

Observar resultados independentes fora dos benchmarks da AWS, suporte a diferentes model servers e aceleradores, comportamento sob cargas heterogêneas e impacto real sobre utilização de GPU e custo por token.

Tópicos relacionados com este sinal
Continue no radar