Muse Spark 1.3 avança em agentes, mas usa mais tokens
Publicado 03 de set. de 2026 · Leitura 2 min de leitura · Relevância 8.9
A Meta lançou o Muse Spark 1.3 com ganhos em tarefas agentivas e de código; avaliação independente aponta melhor qualidade, mas custo por tarefa maior que no 1.2.
O modelo melhora a competição em trabalho agentivo de longa duração e oferece preço por token abaixo de vários pares, mas a eficiência depende da carga. O ganho de qualidade veio acompanhado de mais tokens de entrada nas avaliações independentes, o que pode elevar o custo real.
A Meta lançou o Muse Spark 1.3 em 2 de setembro para o Muse Code e a Meta Model API. O modelo mantém janela de contexto de 1 milhão de tokens e preço de US$ 1,25 por milhão de tokens de entrada, US$ 4,25 por milhão de saída e US$ 0,15 por milhão de tokens em cache.
Ganhos e limites
A Meta afirma que a versão 1.3 sustenta melhor tarefas longas, preserva instruções complexas e lida com múltiplos fluxos na mesma conversa. Em comparações internas de engenharia, o modelo usou cerca de 20% menos chamadas de ferramenta e 25% menos tokens que o 1.2 em fluxos selecionados.
A avaliação independente da Artificial Analysis mostra uma nuance. O modo xhigh subiu de 57 para 61 no Intelligence Index e ganhou 5 pontos no Terminal-Bench 2.1 e 12 pontos no Tau3-Bench Banking. Porém, o custo médio por tarefa cresceu de US$ 0,40 para US$ 0,55, associado a cerca de 57% mais tokens de entrada em avaliações agentivas. Houve também regressões menores em duas avaliações.
Disponibilidade
O modo xhigh já está disponível. O modo max marcou 62 no índice da Artificial Analysis, mas permanece em preview limitado; a Meta diz que sua liberação virá após testes adicionais de segurança. O fornecedor também menciona pesos abertos no roadmap, sem data confirmada.
Para adoção, compare custo por tarefa, latência, taxa de correção e número de intervenções humanas no seu próprio repositório. Preço por token isolado não captura o consumo total de uma execução agentiva.
Acompanhar a liberação do modo max após os testes de segurança, latência e consumo de tokens em repositórios reais, disponibilidade de pesos prometida no roadmap e comparações independentes fora do harness da Meta.