O que é o GLM-5.3-FlashX?
GLM-5.3-FlashX é um nível de API de alta velocidade construído em torno da base de capacidade GLM-5.3-Flash. A Z.ai lista Flash e FlashX na mesma página de documentação do modelo, com identificadores separados:
glm-5.3-flash
glm-5.3-flashx
As duas entradas partilham as mesmas especificações publicadas da família. Isso sustenta tratar o FlashX como uma escolha de serviço em vez de uma nova geração de modelo. Não prova que todos os detalhes de implementação ou ficheiro de pesos sejam idênticos; a Z.ai não publicou um checkpoint FlashX separado nem uma declaração que resolva essa questão ao nível dos pesos.
| Especificação |
GLM-5.3-FlashX |
| Desenvolvedor |
Z.ai / Zhipu AI |
| Data de lançamento |
18 de setembro de 2026 |
| ID oficial do modelo na API |
glm-5.3-flashx |
| Posicionamento |
Nível de inferência hospedada de alta velocidade |
| Velocidade de geração anunciada |
Até 200 tokens de saída/s |
| Arquitetura |
Mistura de especialistas; atenção híbrida esparsa e linear |
| Parâmetros totais / ativos |
320B no total / cerca de 18B ativos por token |
| Janela de contexto |
1,048,576 tokens |
| Saída máxima |
131,072 tokens |
| Entradas |
Texto, imagens, vídeo e ficheiros |
| Saída |
Texto e chamadas de ferramentas |
| Raciocínio |
Ativado; a configuração hospedada documentada não permite desativá-lo |
| Outros recursos documentados |
Streaming, chamada de funções, cache de contexto, saída estruturada |
A Z.ai recomenda temperature: 1, top_p: 0.95, esforço máximo de raciocínio e contexto de raciocínio retido. Para uso de ferramentas em streaming, a sua documentação recomenda ativar tanto o streaming de resposta quanto os argumentos de ferramentas em streaming. Essas configurações descrevem a rota da Z.ai. Um gateway pode expor nomes de parâmetros diferentes ou omitir alguns controlos, o que é uma razão pela qual um payload copiado não deve ser rotulado como portátil sem testá-lo no endpoint exato.
O recurso prático é a entrada multimodal nativa dentro de um loop de agente de contexto longo. O FlashX pode inspecionar texto, capturas de ecrã, ficheiros e vídeo, e depois retornar texto ou chamadas de ferramentas. Não gera imagens ou vídeo. O contexto de um milhão de tokens também descreve capacidade, não recall garantido em um milhão completo de tokens; testes de recuperação e aceitação ainda importam.
Lançamento do GLM-5.3-FlashX e a Alegação de 200 Tokens/s
A Z.ai lançou o GLM-5.3-FlashX em 18 de setembro de 2026. A documentação em inglês da empresa diz que a API está ativa e relata velocidade de inferência de 200 tokens/s. A cobertura do lançamento descreve esse valor como até cinco vezes a velocidade do GLM-5.3-Flash.
“Até 200 tokens/s” é uma alegação de taxa de saída de pico. Não é uma promessa de que cada pedido termina cinco vezes mais cedo.
Um pedido à API tem vários relógios:
Tempo até ao primeiro token: fila, processamento do prompt, pré-processamento multimodal e raciocínio inicial antes de a saída visível começar.
Velocidade de saída sustentada: a taxa à qual os tokens chegam depois de a geração começar.
Tempo de conclusão de ponta a ponta: todo o pedido, incluindo raciocínio oculto, uma resposta longa, tentativas repetidas e chamadas de ferramentas.
Latência de cauda: comportamento p95 ou p99 sob concorrência real, em vez de uma mediana de tráfego limpo.
O título do FlashX aborda diretamente o segundo relógio. Pode melhorar os outros, mas a página de lançamento não publica o prompt de teste, o comprimento da saída, a região, a concorrência, a configuração de raciocínio ou o percentil por trás dos 200 tokens/s.
O tráfego público inicial ilustra a diferença entre um máximo e uma distribuição. Um mercado público de encaminhamento mostrou cerca de 80–87 tokens/s na mediana durante uma curta janela pós-lançamento, enquanto as suas observações de percentil superior se aproximaram do máximo anunciado. A mesma página mostrou uma mediana de tempo até ao primeiro token de cerca de 2.3 segundos. Esses valores são uma observação em mudança dessa rota, não um benchmark executado pela GPT Proto nem uma garantia de nível de serviço da Z.ai. Ainda são úteis para uma conclusão: um teto de 200 tokens/s pode coexistir com pedidos típicos muito mais baixos. Não colocamos links para páginas de comparação de agregadores de API neste artigo editorial; mantenha a fonte e a data de captura no cartão de factos interno.
Alegações de testes independentes do FlashX merecem o mesmo escrutínio. Uma publicação da comunidade disse que prompts curtos frequentemente sustentavam mais de 160 tokens/s, mas não forneceu registos brutos, um script, configurações de concorrência ou um conjunto de prompts reproduzível. Esse número não deve ser usado para orçamentação. Em 21 de setembro, não encontrámos um teste público de desenvolvedor FlashX-versus-Flash com evidência original suficiente para o tratar como um benchmark controlado.
Preços do GLM-5.3-FlashX
A cobertura do lançamento publicada em 18 de setembro reproduziu a seguinte tabela de preços da China em yuan chinês por um milhão de tokens. A página de produto em inglês da Z.ai não expôs a mesma tabela de tokens quando verificada em 21 de setembro, pelo que estes valores regionais são atribuídos à reportagem de lançamento em vez de apresentados como uma taxa global universal:
| Uso |
GLM-5.3-FlashX |
GLM-5.3-Flash |
Prémio do FlashX |
| Nova entrada |
¥2.00 |
¥0.80 |
2.5× |
| Entrada em cache |
¥0.50 |
¥0.20 |
2.5× |
| Saída |
¥7.00 |
¥2.80 |
2.5× |
| Armazenamento de cache |
Temporariamente gratuito |
Temporariamente gratuito |
— |
A linha “temporariamente gratuito” para armazenamento de cache é promocional e pode mudar. Não deve ser tratada como um recurso permanente de custo zero.
A documentação oficial de modelos da Z.ai não mostra atualmente uma tabela de tokens do FlashX. Uma rota pública com a Z.ai como fornecedor mostrava $0.37 por milhão de tokens de entrada, $0.075 por milhão de tokens de entrada em cache e $1.25 por milhão de tokens de saída quando verificada em 21 de setembro. Esses são preços úteis de rotas de terceiros, mas não são prova de um preço direto universal da Z.ai entre regiões, contratos, impostos e moedas.
A relação de 2.5× é mais fácil de verificar do que um valor convertido em USD. Considere uma carga de trabalho que consome 10 milhões de novos tokens de entrada e dois milhões de tokens de saída, sem acertos de cache:
Custo do FlashX = 10 × ¥2 + 2 × ¥7 = ¥34
Custo do Flash = 10 × ¥0.8 + 2 × ¥2.8 = ¥13.6
O nível de velocidade acrescenta ¥20.4 para essa carga de trabalho. Esse prémio só faz sentido se o tempo de espera reduzido valer mais de ¥20.4 para o negócio ou o utilizador.
Para uma tarefa em lote noturna, terminar mais cedo pode não produzir valor adicional. Para um agente que bloqueia um programador através de 12 turnos sequenciais do modelo, reduzir o tempo de cada passo de geração pode valer consideravelmente mais do que o custo adicional de tokens. A equação útil é, portanto:
valor do tempo poupado > custo adicional de tokens + custo de migração e validação
Não estime apenas com os tokens de resposta visíveis. Tokens de raciocínio, tentativas repetidas, chamadas de ferramentas falhadas e respostas desnecessariamente longas podem alterar a fatura. A métrica de produção deve ser custo por tarefa aceite, não preço por milhão de tokens isoladamente.
GLM-5.3-FlashX vs GLM-5.3-Flash
GLM-5.3-FlashX e GLM-5.3-Flash respondem a diferentes prioridades operacionais. A evidência pública não estabelece uma melhoria de qualidade para o FlashX; estabelece um nível de velocidade mais caro.
| Dimensão |
GLM-5.3-FlashX |
GLM-5.3-Flash |
| Principal razão para escolher |
Menor tempo de espera interativo |
Menor custo de tokens |
| Velocidade de saída anunciada |
Até 200 tokens/s |
Nível de serviço padrão inferior; relatórios de lançamento usam-no como linha de base 1× |
| Preço de tabela na China |
¥2 entrada / ¥7 saída por 1M |
¥0.8 entrada / ¥2.8 saída por 1M |
| Especificações públicas |
320B/18B, contexto de 1M, entrada multimodal nativa |
Mesmas especificações publicadas da família |
| Benchmark de inteligência separado |
Nenhum publicado para o FlashX |
Conjunto de benchmarks do Flash está disponível |
| Plano GLM Coding |
Não incluído no lançamento |
Incluído com a quota documentada do plano |
| Auto-hospedagem |
Nenhum peso FlashX separado anunciado |
Pesos base do Flash têm licença MIT |
| Melhor forma de carga de trabalho |
Interativo, sequencial, com humano no circuito |
Lote, assíncrono, alto volume, sensível ao preço |
Escolha o FlashX quando uma pessoa está a ver o stream, a saída é suficientemente longa para a velocidade de descodificação importar e o fluxo de trabalho faz várias chamadas ao modelo em sequência. Copilotos de programação, agentes de investigação interativos, assistentes de suporte ao vivo e loops de iteração visual encaixam nessa forma.
Mantenha o Flash quando a tarefa é executada sem supervisão, as ferramentas externas dominam o tempo decorrido, as respostas são curtas ou a carga de trabalho produz tokens suficientes para que uma taxa de 2.5× altere materialmente o orçamento. Uma chamada à base de dados que demora oito segundos não é corrigida gerando a frase seguinte mais depressa. Nem um agente de navegador que passa a maior parte do tempo à espera de páginas, downloads ou aprovações.
A distinção de auto-hospedagem também é importante. O GLM-5.3-Flash tem pesos com licença MIT, embora um checkpoint de 320B ainda exija infraestrutura séria. O FlashX é um nível de desempenho hospedado, não um interruptor de velocidade separado e descarregável. As equipas que precisam de controlo de implantação ou economia de hardware fixa devem avaliar os pesos base do Flash em vez de assumir que o FlashX pode ser auto-hospedado.
O GLM-5.3-FlashX é Bom para Programação?
O GLM-5.3-FlashX é um modelo de programação plausível quando a latência faz parte da experiência do produto. A entrega mais rápida de tokens pode melhorar a conclusão de código, reduzir pausas durante patches longos e encurtar loops de agentes que repetidamente planeiam, editam, executam ferramentas e inspecionam resultados.
O que a evidência não mostra é que o FlashX escreve melhor código do que o Flash.
A Z.ai publicou fortes resultados de programação e agentes para a base de capacidade subjacente GLM-5.3-Flash, incluindo 63.4 no DeepSWE v1.1, 48.8 no AutomationBench e 29.0 no Z.ai Code Bench com esforço máximo de raciocínio. Estes são resultados executados pelo fornecedor para o Flash, incluindo um benchmark interno. Não são uma avaliação de qualidade separada do FlashX. Um serviço mais rápido pode fazer a mesma capacidade parecer melhor numa IDE, mas apenas um teste emparelhado pode estabelecer paridade de qualidade num repositório específico.
Uma avaliação útil de programação deve manter o seguinte fixo entre Flash e FlashX:
commit do repositório e ficheiro de bloqueio de dependências;
prompt e instruções de sistema;
ferramentas, esquemas e permissões;
esforço de raciocínio e limites de saída;
política de timeout e tentativas repetidas;
número e ordem das tarefas;
testes de aceitação e regras de revisão humana.
Depois registe mais do que tokens por segundo:
| Métrica |
Porque importa |
| Tempo até ao primeiro token |
Mede a pausa antes de o trabalho visível começar |
| Tokens de saída sustentados/s |
Testa a velocidade anunciada onde ela se aplica |
| Tempo de tarefa de ponta a ponta |
Inclui raciocínio, ferramentas, testes e tentativas repetidas |
| Tempo de tarefa p95 |
Revela outliers lentos escondidos pelas médias |
| Patches aceites |
Impede que saída rápida mas inutilizável ganhe |
| Taxa de erro de chamadas de ferramentas |
Captura a fiabilidade do agente |
| Total de tokens faturados |
Inclui verbosidade e tentativas repetidas |
| Tempo de correção humana |
Mede o trabalho que o modelo devolve ao programador |
A regra de decisão é estrita: faça upgrade apenas se o Flash já passa o nível de qualidade e o FlashX reduz o p95 ou o tempo de tarefa completa o suficiente para justificar o maior custo por tarefa aceite. Um stream mais rápido é agradável; um patch aceite mais rápido é economicamente útil.
A GPT Proto ainda não concluiu um teste de integração do FlashX, por isso não estamos a publicar uma amostra de pedido GPT Proto. O ID oficial do modelo é conhecido, mas um ID de modelo sozinho não confirma um endpoint de gateway, comportamento de autenticação, caminho de upload multimodal, mapeamento de chamadas de ferramentas ou faturação.
GLM-5.3-FlashX vs DeepSeek Flash
Uma tabela precisa de GLM-5.3-FlashX vs DeepSeek Flash requer um esclarecimento que muitas páginas de comparação ignoram: “DeepSeek Flash” não é um rótulo de produto estável e inequívoco. Os resultados de pesquisa atuais misturam DeepSeek V4 Flash, variantes experimentais datadas, nomes de rotas não oficiais e instantâneos de preços de diferentes fornecedores.
Combinar essas entradas num único rival produz falsa precisão. Um benchmark para um checkpoint, um preço de outra rota e um limite de contexto de um lançamento posterior não descrevem um modelo que alguém possa realmente comprar.
Fixe a comparação a um ID de modelo DeepSeek exato, fornecedor, região, data de preço e configuração de API. Depois execute a mesma configuração de avaliação de repositório e agente usada para o FlashX. Compare patches aceites, fiabilidade das ferramentas, total de tokens, tempo de relógio de parede, correção humana e custo por tarefa aceite.
O GLM-5.3-FlashX tem três atributos claramente documentados nesse teste: entrada nativa de texto, imagem, vídeo e ficheiro; uma janela de contexto de um milhão de tokens; e um nível hospedado de alta velocidade dedicado. Um candidato DeepSeek pode ser mais barato ou mais rápido numa rota específica, especialmente para tráfego de programação com muito cache, mas essa conclusão deve vir do endpoint selecionado em vez de um rótulo genérico “DeepSeek Flash”.
Se a sua aplicação for apenas de texto e sensível ao preço, inclua um candidato DeepSeek. Se o agente tiver de inspecionar capturas de ecrã ou vídeo dentro da mesma chamada ao modelo, o GLM-5.3-FlashX começa com um encaixe documentado mais claro. Nenhuma das observações substitui o teste de carga de trabalho emparelhado.
Deve Fazer Upgrade para o GLM-5.3-FlashX?
Faça upgrade do Flash para o FlashX se todas as três condições forem verdadeiras:
O GLM-5.3-Flash já cumpre os seus requisitos de qualidade e fiabilidade de ferramentas.
A descodificação do modelo é uma parte significativa do seu atraso de ponta a ponta.
Um teste controlado mostra que o tempo poupado vale uma taxa de tokens 2.5×.
Não faça upgrade por defeito para geração offline, análise agendada ou processamento em lote de alto volume. Não faça upgrade quando a recuperação, ações de navegador, bases de dados, builds ou aprovação humana dominam o tempo da tarefa. E não faça upgrade para melhor raciocínio a menos que o seu próprio teste o demonstre; a Z.ai não publicou um benchmark de inteligência separado para o FlashX.
Uma implementação faseada é mais segura do que uma mudança total. Encaminhe uma fatia representativa do tráfego para o FlashX, preserve os mesmos prompts e ferramentas e compare fluxos de trabalho completos. Se o p95 melhorar enquanto a qualidade das tarefas aceites se mantiver estável, expanda. Se apenas o stream de texto animado parecer mais rápido enquanto o tempo de conclusão e a aceitação ficarem iguais, mantenha a rota mais barata.
O GLM-5.3-FlashX está Disponível na GPT Proto?
Ainda não. A GPT Proto planeia adicionar o GLM-5.3-FlashX, mas a disponibilidade em produção não foi confirmada em 21 de setembro de 2026.
Antes de uma página de modelo ou amostra de código da GPT Proto ser publicada, a integração precisa de verificar o endpoint, a string exata do modelo, entradas de texto e multimodais, streaming, chamadas de ferramentas, controlos de raciocínio, cache de contexto, comportamento de erro, limites e preços faturados. Até essa verificação estar concluída, “disponível através da GPT Proto” seria uma alegação de produto sem suporte.
Para modelos que pode usar agora, navegue no diretório atual de modelos GPT Proto. Também pode consultar a página inicial da GPT Proto para atualizações da plataforma. Para uma explicação mais aprofundada da base de capacidade subjacente, leia O que é o GLM-5.3-Flash?.