O que é o Step 5 Preview?
O Step 5 Preview é um modelo de raciocínio multimodal desenvolvido pela StepFun, com sede em Xangai. Ele foi projetado para planejar, chamar ferramentas, inspecionar resultados, revisar sua abordagem e continuar até produzir um entregável.
Aqui estão os principais fatos da documentação oficial do modelo e página de lançamento da StepFun:
| Especificação |
Step 5 Preview |
| Desenvolvedor |
StepFun |
| ID do modelo |
step-5-preview |
| Arquitetura |
Mistura de Especialistas esparsa |
| Parâmetros |
600B no total, 27B ativos por token |
| Janela de contexto |
1M tokens |
| Saída máxima |
64K tokens |
| Entrada |
Texto, imagens e vídeo |
| Saída |
Texto |
| Controle de raciocínio |
baixo, médio, ou alto |
| Status da API |
Disponível pela StepFun |
| Status de pesos abertos |
Planejado para 15 de outubro de 2026 |
| Status no GPT Proto |
Ainda não disponível; integração planejada |
“Preview” é importante. A API já pode ser usada, mas comportamento, limites, preços e até o nome podem mudar antes de um lançamento estável. A StepFun afirma que os pesos do modelo serão liberados em 15 de outubro de 2026. Até que isso aconteça, ele deve ser tratado como um modelo proprietário hospedado — não como um modelo de pesos abertos que já pode ser auto-hospedado.
Recursos e arquitetura do Step 5 Preview
600B parâmetros sem ativar todos os 600B
O Step 5 Preview usa um design esparso de Mixture-of-Experts, ou MoE. Ele contém 600 bilhões de parâmetros no total, mas apenas 27 bilhões ficam ativos para cada token. Um sistema de roteamento seleciona os especialistas relevantes para a entrada atual.
“600B” descreve a capacidade total; não significa que todo token incorre no custo de um modelo denso de 600B. A contagem de ativos é mais relevante para a eficiência de inferência, mas hardware, batching, duração do raciocínio e capacidade do provedor ainda determinam o desempenho real.
Um contexto de 1M tokens e saída de 64K tokens
A janela de contexto de 1 milhão de tokens é voltada para grandes repositórios, relatórios, conversas e coleções de documentos. A saída máxima é de 64.000 tokens. Um contexto grande ainda exige recuperação disciplinada: mais material pode adicionar evidências irrelevantes, instruções conflitantes e custo.
O cache de prompt torna o trabalho repetido sobre o mesmo código-fonte, biblioteca de políticas ou corpus de pesquisa muito mais barato do que reenviar entrada sem cache repetidamente.
Entrada de texto, imagem e vídeo
O modelo aceita texto, até 60 imagens por requisição e vídeo. As imagens podem ser JPEG, PNG, WebP ou GIF estático. Os formatos de vídeo incluem MP4, QuickTime e Matroska; a StepFun recomenda clipes com menos de cinco minutos.
Você pode ver bancos de dados de terceiros listando apenas entrada de texto e imagem. Isso não contradiz necessariamente a StepFun. Por exemplo, Artificial Analysis registra as modalidades cobertas por sua listagem e testes, enquanto a StepFun documenta o suporte a vídeo em sua própria API. Para limites de implementação, use a documentação primária; para desempenho comparativo, use testes independentes.
Chamada de ferramentas não é acesso integrado ao mundo exterior
O Step 5 Preview oferece suporte a streaming, chamada de funções, modo JSON, JSON Schema e esforço de raciocínio ajustável. No entanto, o modelo não navega na web de forma independente, não executa código nem acessa os arquivos de um desenvolvedor. A StepFun afirma explicitamente que busca, execução de código, manuseio de documentos e outras ferramentas devem ser fornecidos pelo aplicativo integrador.
O modelo pode decidir quando e como usar uma ferramenta, mas o sistema de agente ao redor controla suas ferramentas, permissões e validação de resultados.
Step 5 Preview para codificação e trabalho com agentes
Em um agente de codificação, o modelo recebe um objetivo, lê arquivos, aplica alterações, executa testes, observa falhas e itera. Seu contexto longo pode preservar a estrutura do repositório e decisões anteriores ao longo desse ciclo.
A StepFun relata os seguintes resultados para o modelo com alto esforço de raciocínio:
| Benchmark |
Pontuação do Step 5 Preview |
O que avalia |
| DeepSWE v1.1 |
67.7% |
Engenharia de software em nível de repositório |
| StepCodeBench |
49.0% |
Tarefas de engenharia multilíngues |
| Terminal-Bench v4 |
33.3% |
Uso de ferramentas de codificação e terminal |
| Agents’ Last Exam (ALE-CLI) |
29.5% |
Tarefas de agente de uso de computador |
| GPQA Diamond |
93.5% |
Raciocínio e conhecimento em nível de pós-graduação |
| HLE |
46.5% |
Perguntas amplas e difíceis de especialistas |
Estes são resultados relatados pelo fornecedor. O StepCodeBench é interno; alguns concorrentes usam esforço “Max” enquanto o Step 5 usa “High”; e algumas comparações de HLE com ferramentas usam subconjuntos diferentes. As pontuações mostram capacidade, não superioridade garantida em um repositório específico.
A StepFun reconhece uma lacuna significativa nas tarefas de codificação mais difíceis e de longa duração. Teste correção de bugs, mudanças de recursos, geração de testes e rollback no seu próprio código, depois meça tarefas aceitas por dólar e por minuto.
As evidências iniciais da comunidade são escassas. Em um tópico de lançamento no Linux DO, um usuário gostou do raciocínio intermediário visível; a discussão no Reddit focou mais em pesos vazados ou espelhados do que na confiabilidade em produção. Essas anedotas do dia de lançamento sugerem perguntas a testar, não um ranking.
Por que o Step 5 Preview foca em finanças
O Step 5 Preview em finanças não se resume a responder perguntas de contabilidade. A StepFun tem como alvo fluxos de trabalho de analistas que reúnem documentos regulatórios e dados de mercado, conciliam definições, constroem valuations, executam cálculos e produzem um relatório auditável. Fontes, premissas, fórmulas e sensibilidades devem permanecer rastreáveis.

A StepFun relata 66,4% no benchmark externo FrontierFinance. Também relata 74,5% no FinStepBench LiveSearch, 60,6% no CorporateValuation e 55,8% no Finance Deep Research. Os três últimos são benchmarks internos da StepFun, então devem ter menos peso do que testes independentes até que terceiros reproduzam os resultados.
Uma pontuação forte não torna decisões financeiras não supervisionadas seguras. Mantenha links de fontes, rastros de cálculo, portões de aprovação e revisão humana — especialmente para decisões de investimento, crédito, impostos ou conformidade.
Quão bom é o Step 5 Preview em testes independentes?
Artificial Analysis dá ao Step 5 Preview uma pontuação de 44 no Intelligence Index. Ele mediu a saída em 99,8 tokens por segundo, um tempo de 2,96 segundos até o primeiro token e US$ 0,72 por tarefa do Intelligence Index na API da StepFun.

O aviso importante é a verbosidade: 160 milhões de tokens de saída na avaliação versus uma mediana de 92 milhões na categoria. Um preço razoável por token ainda pode produzir um custo alto por tarefa, então sistemas de produção precisam de limites de saída, esforço de raciocínio adequado e condições de parada.
Testes independentes também listam entrada de texto e imagem, não vídeo. Isso reflete o escopo do registro do modelo pelo avaliador; a documentação oficial da API da StepFun continua sendo a fonte para capacidade de vídeo. Manter esses dois tipos de evidência separados evita transformar uma diferença de cobertura de teste em uma falsa contradição.
Preços do Step 5 Preview explicados
A página oficial de preços da StepFun lista três tarifas por 1 milhão de tokens:
| Tipo de token |
Preço |
| Entrada sem cache |
$1.00 |
| Entrada com cache |
$0.05 |
| Saída |
$2.70 |
Para o Step 5 Preview, o preço de entrada sem cache inclui gravar novo conteúdo no cache. A cobrança de saída inclui tanto tokens de raciocínio quanto a resposta final, então o raciocínio oculto não é gratuito.
Por exemplo, 100.000 tokens de entrada sem cache mais 10.000 tokens de saída custam cerca de US$ 0,127. Com a entrada totalmente em cache, a mesma requisição custa cerca de US$ 0,032. Ciclos de ferramentas, tentativas repetidas e duração do raciocínio podem alterar o total.
Este é o preço da StepFun, não um preço do GPT Proto. O GPT Proto ainda não adicionou o modelo, então não há uma tarifa legítima do GPT Proto para o Step 5 Preview a citar.
Step 5 Preview vs GLM 5.3 Flash vs DeepSeek Flash
Esta tabela usa dados do Artificial Analysis atualizados em 21 de setembro de 2026. DeepSeek Flash significa DeepSeek V4.1 Flash com esforço máximo de raciocínio.
| Modelo |
Intelligence Index |
Velocidade de saída |
Entrada / saída por 1M tokens |
Custo por tarefa |
Contexto |
Pesos |
| Step 5 Preview |
44 |
99.8 tok/s |
$1.00 / $2.70 |
$0.72 |
1M |
Planejado para 15 de out. |
| GLM 5.3 Flash |
42 |
95.0 tok/s |
$0.15 / $0.50 |
$0.25 |
1M |
Aberto, MIT |
| DeepSeek V4.1 Flash |
39 |
242.3 tok/s |
$0.30 / $1.20 |
$0.27 |
1M |
Aberto, MIT |
GLM 5.3 Flash vs Step 5 Preview
O Step 5 Preview lidera por dois pontos no Index, com velocidade semelhante. O GLM é muito mais barato e seus pesos licenciados sob MIT já estão disponíveis. O Step 5 é mais interessante para fluxos de trabalho específicos de finanças ou entrada oficial de vídeo; o GLM é o ponto de partida mais forte para custo e auto-hospedagem.
Step 5 Preview vs DeepSeek Flash
O Step 5 lidera por cinco pontos no Index, mas o DeepSeek é mais de duas vezes mais rápido, custa muito menos por tarefa e já tem pesos abertos. Escolha o Step 5 apenas se seu raciocínio produzir trabalho aceito adicional suficiente para justificar execuções mais lentas e caras.
Atualmente, o GPT Proto oferece tanto o GLM 5.3 Flash quanto o DeepSeek Flash. Para uma comparação mais aprofundada entre essas opções disponíveis, veja GLM 5.3 Flash vs DeepSeek V4 Flash.
Como você pode acessar o Step 5 Preview?
Desenvolvedores podem chamar o endpoint POST /v1/chat/completions da StepFun com o ID de modelo step-5-preview. O formato da requisição segue o estilo chat-completions da OpenAI. Este exemplo tem como alvo diretamente a StepFun; não é de modo algum um endpoint do GPT Proto.
curl https://api.stepfun.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $STEP_API_KEY" \
-d '{
"model": "step-5-preview",
"messages": [
{
"role": "user",
"content": "Review this repository migration plan and list the three highest-risk assumptions."
}
],
"reasoning_effort": "medium",
"max_tokens": 1200
}'
A referência oficial da API deve ser consultada antes do uso em produção para parâmetros atuais, erros, limites de taxa e formatos de requisição multimodal.
Se você prefere um único saldo e uma interface unificada entre muitos modelos, o GPT Proto planeja adicionar o Step 5 Preview mais tarde. Até que o modelo apareça no catálogo ao vivo, não presuma que um nome semelhante, um espelho de terceiros ou uma rota não oficial seja a integração do GPT Proto.
Vale a pena testar o Step 5 Preview?
O Step 5 Preview merece uma avaliação controlada para documentos longos, agentes de codificação, pesquisa multimodal ou fluxos de trabalho financeiros rastreáveis. Sua pontuação independente de inteligência é forte e seu contexto de 1M é útil.
Ele não é a escolha padrão. O GLM é mais barato e tem pesos abertos; o DeepSeek é muito mais rápido; e o Step 5 continua verboso, em preview e indisponível no GPT Proto.
A melhor métrica de decisão é trabalho concluído e revisado — não contagem de parâmetros ou um único benchmark. Execute as mesmas tarefas representativas em cada candidato, registre correção, taxa de intervenção, latência e custo total de tokens, depois escolha o modelo que produz o menor custo por resultado aceito.