Obter AX Code · GrátisDocumentação

Esta página é uma tradução da documentação em inglês. Comandos, identificadores e exemplos permanecem iguais. Runtime 7.24.4 · SDK 2.6.7. Original em inglês

Controles de raciocínio do modelo atual

Status: Ativo

Escopo: estado atual

Última revisão: 2026-09-14

Responsável: ax-code runtime

O AX Code escolhe os controles de raciocínio pelo ID do modelo de origem e pelo protocolo do SDK. Estes perfis cobrem rotas Chat compatíveis com a OpenAI para os IDs exatos abaixo. Eles preservam o comportamento já existente do SDK nativo, da GPU privada, do AX Engine e de gateways com restrições.

IDs de modelo Esforço disponível Falha autônoma ou repetida de ferramenta Solicitações auxiliares
qwen3.8-max, qwen3.8-flash low, medium, xhigh; high é um alias já existente de xhigh xhigh Raciocínio desativado
glm-5.3 low, high, max; deep é alias de max max Esforço baixo; raciocínio ativado
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash low, high, max high; um xdeep explícito seleciona max Raciocínio desativado
MiniMax-M3 Interruptor já existente de raciocínio ou nenhum; sem níveis de esforço Padrão de raciocínio do provedor Raciocínio desativado
MiniMax-M2.7 Sem esforço e sem interruptor de desativação Raciocínio sempre ligado Raciocínio sempre ligado

Opções explícitas de raciocínio do modelo ou do agente, e variantes selecionadas, substituem a política automática de esforço. Uma declaração negativa de capacidade de raciocínio impede variantes automáticas de esforço e estes controles auxiliares. GLM e DeepSeek mantêm o padrão do provedor quando solicitações comuns não escolhem um esforço. Solicitações auxiliares usam os próprios controles sem alterar a seleção salva do usuário.

Conflitos de opção do Qwen e ferramentas forçadas

O Qwen 3.8 aceita reasoning_effort ou thinking_budget, nunca os dois ao mesmo tempo. Um orçamento explícito de raciocínio suprime a seleção automática de esforço. Quando as opções mescladas contêm um esforço e um orçamento, o esforço prevalece. high e max normalizam para xhigh, minimal para low, e none desativa o raciocínio. As rotas de plano da Alibaba conservam o teto já existente de orçamento de tokens, inclusive a alternativa limitada quando nenhum esforço é selecionado. Esses mapeamentos seguem a API Chat da Alibaba.

O modo de raciocínio do Qwen rejeita chamadas de ferramenta forçadas. Para tool_choice: required, o AX Code desativa o raciocínio nessa solicitação e remove opções incompatíveis de esforço, orçamento e preservação. Os turnos automáticos seguintes de ferramenta retomam o esforço selecionado. O tratamento já existente de ferramenta obrigatória do DeepSeek também mantém o raciocínio desativado nessa solicitação, como exige a API do modo de raciocínio.

Continuidade do raciocínio

Qwen, GLM e DeepSeek reproduzem o raciocínio armazenado por meio de reasoning_content. Solicitações Chat do MiniMax M2.7/M3 usam reasoning_split: true para que o SDK receba o raciocínio à parte e possa reproduzi-lo com exatidão. Isso evita converter o raciocínio do gateway no formato <mm:think> usado por implantações de GPU privada. Um reasoning_split: false explícito conserva a reprodução nativa de <think>. Assinaturas da Anthropic e o tratamento de tags de GPU privada conservam os caminhos existentes. Veja a API Chat da MiniMax.

O raciocínio preservado entre turnos do GLM continua opcional, pelo options.preserveThinking: true do provedor, durante solicitações longas de agente que sejam elegíveis. Ele envia thinking: { type: "enabled", clear_thinking: false }. Ative-o somente para um histórico completo e não modificado do mesmo modelo; isso pode aumentar a entrada cobrada. A reprodução comum de um turno de ferramenta não exige essa opção. A Z.ai documenta os requisitos de preservação. O GLM 5.3 sempre raciocina, então as solicitações auxiliares usam esforço baixo em vez de desativá-lo. Controles do GLM 5.3.

Implantações personalizadas

Um gateway pode expor o mesmo ID de modelo com um dialeto diferente de parâmetros. Para manter o comportamento anterior de transformação de um modelo, defina options.nativeReasoning: false na configuração de provedor desse modelo:

{
  "provider": {
    "my-gateway": {
      "models": {
        "glm-5.3": {
          "options": { "nativeReasoning": false }
        }
      }
    }
  }
}

Isto é uma recusa local de perfil, não um comando para desativar o raciocínio do modelo. O valor é removido antes do envio da solicitação. Variantes já configuradas de forma explícita continuam sendo controles do usuário. O SDK nativo do DeepSeek não ganha variantes de esforço a partir deste perfil, porque o serializador instalado não as aceita.

A aceitação pela API, a continuação de ferramentas e a reprodução exata no cliente são evidências de compatibilidade. Elas não provam que a origem honra cada indicação de esforço, que o cache acerta com mais frequência, ou que a qualidade ou a velocidade ao programar melhoram. Use a avaliação do harness emparelhada para comparações no nível da tarefa.