Pub/Sub passa a executar inferência de IA durante o streaming
Publicado 12 de set. de 2026 · Leitura 1 min de leitura · Relevância 8.8
AI Inference SMTs do Google Cloud chegaram a GA e permitem chamar modelos do Gemini Enterprise Agent Platform no fluxo do Pub/Sub, anexando a resposta do modelo à própria mensagem.
Equipes de dados e eventos passam a conseguir inserir inferência gerenciada no próprio pipeline Pub/Sub sem manter um serviço intermediário só para chamar o modelo. Isso simplifica arquiteturas de streaming, mas muda a análise de custo, latência e confiabilidade porque a IA passa a fazer parte do caminho crítico da mensagem.
O Google Cloud colocou em disponibilidade geral os AI Inference Single Message Transforms (SMTs) do Pub/Sub. A transformação chama um modelo hospedado no Gemini Enterprise Agent Platform enquanto a mensagem passa pelo pipeline e anexa a resposta de inferência ao evento antes de ele seguir para consumidores como BigQuery ou Bigtable.
Isso move uma etapa que normalmente exigiria Cloud Run, Functions ou outro consumidor intermediário para dentro do fluxo gerenciado do Pub/Sub. Casos como classificação, enriquecimento, detecção de anomalias e roteamento baseado em modelo podem ser aplicados antes da persistência ou do processamento downstream.
Há custo específico: a transformação de AI Inference é cobrada a US$ 60 por TiB processado, considerando o maior tamanho entre entrada e saída, e as chamadas ao Gemini Enterprise Agent Platform são cobradas separadamente.
A consequência arquitetural é reduzir componentes intermediários, mas também colocar latência, disponibilidade do modelo e custo de inferência diretamente no caminho de dados.
Observar limites de throughput e latência do AI Inference SMT em cargas reais, suporte a mais modelos, comportamento de retry em falhas do modelo e comparação de custo com consumidores próprios em Cloud Run ou Functions.