Qwen abre preview da arquitetura do Qwen4
Publicado 27 de ago. de 2026 · Leitura 1 min de leitura · Relevância 9.0
O Qwen3.8-Flash-Next abre pesos de uma arquitetura experimental que antecipa o Qwen4, ativando 6 bilhões de parâmetros e oferecendo contexto nativo de 262 mil tokens.
Abrir a arquitetura antes da família Qwen4 permite que runtimes, quantizadores e equipes de infraestrutura adaptem seus sistemas antecipadamente, além de expor uma direção concreta para reduzir custo de agentes com contexto longo.
A equipe Qwen publicou os pesos do Qwen3.8-Flash-Next, descrito como preview experimental da arquitetura que sustentará a futura família Qwen4. O modelo multimodal combina 125 bilhões de parâmetros no núcleo MoE, com 6 bilhões ativados por token, além de embeddings n-gram e uma camada adicional de previsão.
A arquitetura troca parte da atenção tradicional por Qwen Sparse Attention em microblocos, adiciona residual com gates e embeddings de n-gram. O objetivo é reduzir latência em contexto longo e ampliar parâmetros com menos custo de computação. O contexto nativo é de 262.144 tokens e pode ser estendido até 1 milhão com RoPE scaling, com possíveis perdas em sequências curtas.
Os pesos funcionam com Transformers, vLLM, SGLang e TokenSpeed. Nos resultados próprios, o modelo marcou 58,7 no DeepSWE 1.1, 62,5 no SWE-bench Pro e 81,0 no SWE-bench Multilingual. São benchmarks divulgados pelo fabricante e não equivalem a validação independente.
Observar reprodução independente dos benchmarks, requisitos reais de memória, qualidade das quantizações, suporte estável nos runtimes, licença comunitária, efeito do contexto estendido e diferenças entre o preview e o Qwen4 final.