本頁譯自英文文件。指令、識別名稱與範例保持原樣。執行環境 7.24.4 · SDK 2.6.7。 英文原文
目前模型的推理控制
狀態:有效
範圍:目前狀態
上次審閱:2026-09-14
負責人:ax-code runtime
AX Code 依上游模型 ID 與 SDK 協定選擇推理控制。下列設定檔涵蓋下方精確 ID 的 OpenAI 相容 Chat 路由。它們保留既有的原生 SDK、私有 GPU、AX Engine 與受限閘道行為。
| 模型 ID | 可用的努力程度 | 自主/重複工具失敗 | 輔助請求 |
|---|---|---|---|
qwen3.8-max、qwen3.8-flash |
low、medium、xhigh;high 是 xhigh 的既有別名 | xhigh | 停用思考 |
glm-5.3 |
low、high、max;deep 是 max 的別名 | max | 低努力程度;啟用思考 |
deepseek-v4-pro、deepseek-v4-flash、deepseek-flash |
low、high、max | high;明確的 xdeep 會選擇 max | 停用思考 |
MiniMax-M3 |
既有的思考/無思考開關;沒有努力程度等級 | 供應商的思考預設 | 停用思考 |
MiniMax-M2.7 |
沒有努力程度或停用開關 | 一律開啟思考 | 一律開啟思考 |
明確的模型/agent 推理選項與所選變體會覆寫自動的努力程度原則。負向的推理能力宣告會阻止自動的努力程度變體與這些輔助控制。一般請求沒有選擇努力程度時,GLM 與 DeepSeek 保持供應商預設。輔助請求使用自己的控制,不會改變使用者已儲存的選擇。
Qwen 選項衝突與強制工具
Qwen 3.8 接受 reasoning_effort 或 thinking_budget,絕不同時接受兩者。明確的思考預算會抑制自動的努力程度選擇。合併後的選項若同時含有努力程度與預算,努力程度勝出。high 與 max 會正規化為 xhigh,minimal 正規化為 low,而 none 會停用思考。Alibaba 方案路由保留既有的 token 預算上限,包括未選擇努力程度時的有界退回。這些對應遵循 Alibaba Chat API。
Qwen 思考模式拒絕強制工具呼叫。對於 tool_choice: required,AX Code 會為該請求停用思考,並移除不相容的努力程度、預算與保留選項。後續的自動工具回合會恢復所選的努力程度。既有的 DeepSeek 必要工具處理也會依其思考模式 API 的要求,為該請求保持思考停用。
推理延續
Qwen、GLM 與 DeepSeek 透過 reasoning_content 重放已儲存的推理。MiniMax M2.7/M3 的 Chat 請求使用 reasoning_split: true,使 SDK 分開收到推理並能精確重放。這避免把閘道推理轉換成私有 GPU 部署使用的 <mm:think> 格式。明確的 reasoning_split: false 保留原生 <think> 重放。Anthropic 簽章與私有 GPU 標籤處理保留既有路徑。見 MiniMax 的 Chat API。
GLM 跨回合保留的思考仍是選擇加入,在符合資格的長時間 agent 請求期間透過供應商 options.preserveThinking: true。它送出 thinking: { type: "enabled", clear_thinking: false }。只對來自同一模型、完整且未修改的歷史啟用它;它可能增加計費輸入。一般的工具回合重放不需要此選擇加入。Z.ai 記載了保留需求。GLM 5.3 一律推理,因此輔助請求使用低努力程度,而不是停用它。GLM 5.3 控制。
自訂部署
閘道可能用不同的參數方言暴露相同的模型 ID。若要為某模型保留先前的轉換行為,請在該模型的供應商設定上設定 options.nativeReasoning: false:
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
這是本機設定檔的選擇退出,不是停用模型思考的指令。它會在送出請求前移除。既有的明確設定變體仍是使用者控制。原生 DeepSeek SDK 不會從此設定檔獲得努力程度變體,因為其已安裝的序列化器不支援它們。
API 接受、工具延續與精確的用戶端重放是相容性證據。它們不證明上游會遵守每個努力程度提示、快取更常命中,或程式開發品質或速度有改善。工作層級的比較請使用成對的控管層評估。