Mercury 2.5 leva LLM por difusão a 260 mil tokens de contexto
Publicado 09 de set. de 2026 · Leitura 1 min de leitura · Relevância 8.9

O modelo de código da Inception adiciona raciocínio ajustável, chamadas paralelas de ferramentas e JSON estruturado; velocidade e ganhos ainda dependem de números do fornecedor.
Modelos por difusão desafiam a decodificação autoregressiva ao gerar vários tokens em paralelo. Se o ganho persistir em latência ponta a ponta, ferramentas de código podem reduzir tempo de espera e custo sem depender apenas de hardware mais caro.
A Inception lançou o Mercury 2.5, um modelo de linguagem por difusão voltado a código e agentes. A versão amplia o contexto para 260 mil tokens, acrescenta raciocínio ajustável, chamadas paralelas de ferramentas e saída JSON alinhada a schema.
A empresa informa 1.107 tokens por segundo em GPUs NVIDIA disponíveis comercialmente e ganho de 40% em inteligência sobre o Mercury 2. O preço de tabela é US$ 0,20 por milhão de tokens de entrada e US$ 0,75 por milhão de saída. Há uma promoção de lançamento de US$ 0,04 e US$ 0,15, mas a duração não foi publicada.
O modelo está na API da Inception, Baseten e OpenRouter. Também há previews separados para voz e roteamento. O BenchLM ainda não registra um escore independente público; as cinco linhas de benchmark disponíveis são números fornecidos pela empresa, com lacunas de versão e escala em alguns testes. Portanto, throughput e qualidade não devem ser comparados como fatos independentes até haver reprodução.
Esperar benchmarks independentes com hardware, versão e metodologia publicados; medir latência ponta a ponta com ferramentas e contexto longo; acompanhar duração do desconto e estabilidade dos previews de voz e roteamento.