Esta página é uma tradução da documentação em inglês. Comandos, identificadores e exemplos permanecem iguais. Runtime 7.24.4 · SDK 2.6.7. Original em inglês
Controles de raciocínio do modelo atual
Status: Ativo
Escopo: estado atual
Última revisão: 2026-09-14
Responsável: ax-code runtime
O AX Code escolhe os controles de raciocínio pelo ID do modelo de origem e pelo protocolo do SDK. Estes perfis cobrem rotas Chat compatíveis com a OpenAI para os IDs exatos abaixo. Eles preservam o comportamento já existente do SDK nativo, da GPU privada, do AX Engine e de gateways com restrições.
| IDs de modelo | Esforço disponível | Falha autônoma ou repetida de ferramenta | Solicitações auxiliares |
|---|---|---|---|
qwen3.8-max, qwen3.8-flash |
low, medium, xhigh; high é um alias já existente de xhigh | xhigh | Raciocínio desativado |
glm-5.3 |
low, high, max; deep é alias de max | max | Esforço baixo; raciocínio ativado |
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash |
low, high, max | high; um xdeep explícito seleciona max | Raciocínio desativado |
MiniMax-M3 |
Interruptor já existente de raciocínio ou nenhum; sem níveis de esforço | Padrão de raciocínio do provedor | Raciocínio desativado |
MiniMax-M2.7 |
Sem esforço e sem interruptor de desativação | Raciocínio sempre ligado | Raciocínio sempre ligado |
Opções explícitas de raciocínio do modelo ou do agente, e variantes selecionadas, substituem a política automática de esforço. Uma declaração negativa de capacidade de raciocínio impede variantes automáticas de esforço e estes controles auxiliares. GLM e DeepSeek mantêm o padrão do provedor quando solicitações comuns não escolhem um esforço. Solicitações auxiliares usam os próprios controles sem alterar a seleção salva do usuário.
Conflitos de opção do Qwen e ferramentas forçadas
O Qwen 3.8 aceita reasoning_effort ou thinking_budget, nunca os dois ao mesmo tempo. Um orçamento explícito de raciocínio suprime a seleção automática de esforço. Quando as opções mescladas contêm um esforço e um orçamento, o esforço prevalece. high e max normalizam para xhigh, minimal para low, e none desativa o raciocínio. As rotas de plano da Alibaba conservam o teto já existente de orçamento de tokens, inclusive a alternativa limitada quando nenhum esforço é selecionado. Esses mapeamentos seguem a API Chat da Alibaba.
O modo de raciocínio do Qwen rejeita chamadas de ferramenta forçadas. Para tool_choice: required, o AX Code desativa o raciocínio nessa solicitação e remove opções incompatíveis de esforço, orçamento e preservação. Os turnos automáticos seguintes de ferramenta retomam o esforço selecionado. O tratamento já existente de ferramenta obrigatória do DeepSeek também mantém o raciocínio desativado nessa solicitação, como exige a API do modo de raciocínio.
Continuidade do raciocínio
Qwen, GLM e DeepSeek reproduzem o raciocínio armazenado por meio de reasoning_content. Solicitações Chat do MiniMax M2.7/M3 usam reasoning_split: true para que o SDK receba o raciocínio à parte e possa reproduzi-lo com exatidão. Isso evita converter o raciocínio do gateway no formato <mm:think> usado por implantações de GPU privada. Um reasoning_split: false explícito conserva a reprodução nativa de <think>. Assinaturas da Anthropic e o tratamento de tags de GPU privada conservam os caminhos existentes. Veja a API Chat da MiniMax.
O raciocínio preservado entre turnos do GLM continua opcional, pelo options.preserveThinking: true do provedor, durante solicitações longas de agente que sejam elegíveis. Ele envia thinking: { type: "enabled", clear_thinking: false }. Ative-o somente para um histórico completo e não modificado do mesmo modelo; isso pode aumentar a entrada cobrada. A reprodução comum de um turno de ferramenta não exige essa opção. A Z.ai documenta os requisitos de preservação. O GLM 5.3 sempre raciocina, então as solicitações auxiliares usam esforço baixo em vez de desativá-lo. Controles do GLM 5.3.
Implantações personalizadas
Um gateway pode expor o mesmo ID de modelo com um dialeto diferente de parâmetros. Para manter o comportamento anterior de transformação de um modelo, defina options.nativeReasoning: false na configuração de provedor desse modelo:
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
Isto é uma recusa local de perfil, não um comando para desativar o raciocínio do modelo. O valor é removido antes do envio da solicitação. Variantes já configuradas de forma explícita continuam sendo controles do usuário. O SDK nativo do DeepSeek não ganha variantes de esforço a partir deste perfil, porque o serializador instalado não as aceita.
A aceitação pela API, a continuação de ferramentas e a reprodução exata no cliente são evidências de compatibilidade. Elas não provam que a origem honra cada indicação de esforço, que o cache acerta com mais frequência, ou que a qualidade ou a velocidade ao programar melhoram. Use a avaliação do harness emparelhada para comparações no nível da tarefa.