Questa pagina è tradotta dalla documentazione inglese. Comandi, identificatori ed esempi restano invariati. Runtime 7.24.4 · SDK 2.6.7. Testo inglese
Controlli di ragionamento del modello corrente
Stato: Attivo
Ambito: stato attuale
Ultima revisione: 2026-09-14
Responsabile: runtime di ax-code
AX Code seleziona i controlli di ragionamento usando l’ID del modello a monte e il protocollo SDK. Questi profili coprono le route Chat compatibili con OpenAI per gli ID esatti sotto indicati. Preservano il comportamento esistente di SDK nativo, GPU privata, AX Engine e gateway vincolato.
| ID dei modelli | Sforzo disponibile | Fallimento autonomo o ripetuto degli strumenti | Richieste ausiliarie |
|---|---|---|---|
qwen3.8-max, qwen3.8-flash |
low, medium, xhigh; high è un alias esistente di xhigh | xhigh | Pensiero disattivato |
glm-5.3 |
low, high, max; deep è un alias di max | max | Sforzo basso; pensiero attivato |
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash |
low, high, max | high; xdeep esplicito seleziona max | Pensiero disattivato |
MiniMax-M3 |
Interruttore esistente thinking / none; nessun livello di sforzo | Predefinito di pensiero del provider | Pensiero disattivato |
MiniMax-M2.7 |
Nessun interruttore di sforzo o di disattivazione | Pensiero sempre attivo | Pensiero sempre attivo |
Le opzioni esplicite di ragionamento di modello e agente, e le varianti selezionate, hanno la precedenza sulla policy automatica di sforzo. Una dichiarazione negativa della capacità di ragionamento impedisce le varianti automatiche di sforzo e questi controlli ausiliari. GLM e DeepSeek mantengono il predefinito del provider quando le richieste ordinarie non selezionano uno sforzo. Le richieste ausiliarie usano i propri controlli senza modificare la selezione salvata dall’utente.
Conflitti di opzioni Qwen e strumenti forzati
Qwen 3.8 accetta reasoning_effort oppure thinking_budget, mai entrambi. Un budget di pensiero esplicito sopprime la selezione automatica dello sforzo. Quando le opzioni unite contengono sia uno sforzo sia un budget, vince lo sforzo. high e max si normalizzano in xhigh, minimal in low, e none disattiva il pensiero. Le route del piano Alibaba conservano il tetto esistente di budget di token, incluso il fallback limitato quando non è selezionato alcuno sforzo. Queste corrispondenze seguono la API Chat di Alibaba.
La modalità di pensiero di Qwen rifiuta le chiamate di strumenti forzate. Per tool_choice: required, AX Code disattiva il pensiero per quella richiesta e rimuove le opzioni incompatibili di sforzo, budget e conservazione. I turni automatici successivi degli strumenti riprendono lo sforzo selezionato. La gestione esistente degli strumenti obbligatori di DeepSeek mantiene anch’essa il pensiero disattivato per quella richiesta, come richiesto dalla sua API della modalità di pensiero.
Continuità del ragionamento
Qwen, GLM e DeepSeek riproducono il ragionamento memorizzato tramite reasoning_content. Le richieste Chat di MiniMax M2.7/M3 usano reasoning_split: true così che l’SDK riceva il ragionamento separatamente e possa riprodurlo esattamente. Questo evita di convertire il ragionamento del gateway nel formato <mm:think> usato dalle distribuzioni su GPU privata. Un reasoning_split: false esplicito conserva la riproduzione nativa di <think>. Le firme Anthropic e la gestione dei tag su GPU privata mantengono i percorsi esistenti. Vedi la API Chat di MiniMax.
Il pensiero conservato tra i turni di GLM resta facoltativo tramite il provider options.preserveThinking: true durante le richieste idonee di agenti lunghi. Invia thinking: { type: "enabled", clear_thinking: false }. Attivalo solo per una cronologia completa e non modificata dello stesso modello; può aumentare l’input fatturato. La riproduzione ordinaria dei turni di strumenti non richiede questa adesione. Z.ai documenta i requisiti di conservazione. GLM 5.3 ragiona sempre, quindi le richieste ausiliarie usano uno sforzo basso anziché disattivarlo. Controlli di GLM 5.3.
Distribuzioni personalizzate
Un gateway può esporre lo stesso ID di modello usando un dialetto di parametri diverso. Per conservare il comportamento di trasformazione precedente di un modello, imposta options.nativeReasoning: false nella configurazione del provider di quel modello:
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
Si tratta di un’esclusione locale del profilo, non di un comando per disattivare il pensiero del modello. Viene rimossa prima dell’invio della richiesta. Le varianti già configurate in modo esplicito restano controlli dell’utente. L’SDK nativo di DeepSeek non ottiene varianti di sforzo da questo profilo, perché il serializzatore installato non le supporta.
L’accettazione dell’API, la continuazione degli strumenti e la riproduzione esatta del client sono prove di compatibilità. Non dimostrano che un sistema a monte onori ogni suggerimento di sforzo, che la sua cache colpisca più spesso, o che la qualità o la velocità di scrittura del codice migliorino. Usa la valutazione del harness abbinata per i confronti a livello di compito.