AX Code を入手 · 無料ドキュメント

このページは英語版ドキュメントの翻訳です。コマンド、識別子、例はそのままです。ランタイム 7.24.4 · SDK 2.6.7。 英語版

現行モデルの推論制御

ステータス: 現行

対象範囲: 現在の状態

最終確認: 2026-09-14

所有者: ax-code runtime

AX Code は、上流のモデル ID と SDK プロトコルを使って推論制御を選びます。これらのプロファイルは、下記の正確な ID に対する OpenAI 互換の Chat 経路を覆います。既存のネイティブ SDK、プライベート GPU、AX Engine、制約されたゲートウェイの挙動は保たれます。

モデル ID 使える努力度 自律 / 繰り返すツール失敗 補助要求
qwen3.8-max、qwen3.8-flash low、medium、xhigh。high は xhigh の既存の別名 xhigh 思考は無効
glm-5.3 low、high、max。deep は max の別名 max 低い努力度。思考は有効
deepseek-v4-pro、deepseek-v4-flash、deepseek-flash low、high、max high。明示的な xdeep は max を選ぶ 思考は無効
MiniMax-M3 既存の思考 / なしの切り替え。努力度の段階はない プロバイダーの思考既定 思考は無効
MiniMax-M2.7 努力度も無効化の切り替えもない 常時オンの思考 常時オンの思考

明示的なモデルまたはエージェントの推論オプションと、選ばれたバリアントは、自動の努力度方針を上書きします。否定的な推論能力の宣言は、自動の努力度バリアントとこれらの補助制御を防ぎます。GLM と DeepSeek は、通常の要求が努力度を選ばないとき、プロバイダーの既定を保ちます。補助要求は、利用者の保存された選択を変えずに、独自の制御を使います。

Qwen のオプション競合と強制ツール

Qwen 3.8 は reasoning_effort か thinking_budget のどちらかを受け付け、両方は受け付けません。明示的な思考予算は、自動の努力度選択を抑止します。マージされたオプションに努力度と予算の両方があるとき、努力度が優先されます。high と max は xhigh へ正規化され、minimal は low へ、none は思考を無効にします。Alibaba のプラン経路は、努力度が選ばれないときの境界付きフォールバックを含め、既存のトークン予算上限を保ちます。これらの対応は Alibaba Chat API に従います。

Qwen の思考モードは、強制されたツール呼び出しを拒否します。tool_choice: required について、AX Code はその要求の思考を無効にし、互換性のない努力度、予算、保持オプションを取り除きます。その後の自動ツールターンは、選ばれた努力度を再開します。既存の DeepSeek の必須ツール処理も、その 思考モード API が要求するとおり、その要求では思考を無効のままにします。

推論の継続

Qwen、GLM、DeepSeek は、保存された推論を reasoning_content を通じて再生します。MiniMax M2.7/M3 の Chat 要求は reasoning_split: true を使うため、SDK は推論を別に受け取り、正確に再生できます。これにより、ゲートウェイの推論を、プライベート GPU 配置が使う <mm:think> 形式へ変換することを避けます。明示的な reasoning_split: false は、ネイティブの <think> 再生を保ちます。Anthropic の署名とプライベート GPU のタグ処理は、既存の経路を保ちます。MiniMax の Chat API を参照してください。

GLM のターンをまたぐ保持された思考は、適格な長いエージェント要求のあいだ、プロバイダーの options.preserveThinking: true を通じたオプトインのままです。それは thinking: { type: "enabled", clear_thinking: false } を送ります。同じモデルからの完全で改変されていない履歴に対してだけ有効にしてください。課金される入力が増えることがあります。通常のツールターンの再生には、このオプトインは不要です。Z.ai は保持の要件を文書化しています。GLM 5.3 は常に推論するため、補助要求は無効化ではなく低い努力度を使います。GLM 5.3 の制御。

カスタム配置

ゲートウェイは、異なるパラメータ方言で同じモデル ID を出すことがあります。あるモデルについて以前の変換挙動を保つには、そのモデルのプロバイダー設定で options.nativeReasoning: false を設定します。

{
  "provider": {
    "my-gateway": {
      "models": {
        "glm-5.3": {
          "options": { "nativeReasoning": false }
        }
      }
    }
  }
}

これはローカルプロファイルのオプトアウトであり、モデルの思考を無効にする命令ではありません。要求を送る前に取り除かれます。既存の明示的に設定されたバリアントは、利用者の制御のままです。ネイティブの DeepSeek SDK は、インストールされたシリアライザが対応しないため、このプロファイルから努力度バリアントを得ません。

API の受け入れ、ツールの継続、正確なクライアント再生は、互換性の証拠です。上流がすべての努力度のヒントを尊重すること、キャッシュがより頻繁に当たること、コーディングの品質や速度が改善することを証明しません。タスク単位の比較には、対になる ハーネス評価 を使ってください。