Questa pagina è tradotta dalla documentazione inglese. Comandi, identificatori ed esempi restano invariati. Runtime 7.24.4 · SDK 2.6.7. Testo inglese
Buone pratiche di instradamento multi-modello
Stato: Attivo Ambito: pubblico, stato attuale Ultima revisione: 2026-09-13 Responsabile: runtime di ax-code
Questa guida raccoglie il modo consigliato di eseguire ax-code con un modello di ragionamento premium e modelli ausiliari più economici dello stesso provider.
Principio centrale
Usa il modello costoso per il lavoro denso di ragionamento e i modelli economici per il lavoro meccanico o di sola lettura. Il risparmio vero viene dal filtro del contesto: il modello premium vede solo il contesto distillato preparato da modelli più economici o da subagenti.
Ripartizione dei livelli consigliata
| Livello | Classe di modello | Agenti o compiti tipici |
|---|---|---|
| Lavoratore / esecutore | SKU flash collegata, quando disponibile (per esempio DeepSeek Flash) | sessione non fissata, build, general, scout, test, devops, perf |
| Consulente / ragionamento | Modello collegato più forte (per esempio DeepSeek V4 Pro) | plan, architect, security, debug |
| Ausiliario economico / sola lettura | La stessa SKU flash | explore, compaction, titoli, riepiloghi, classificazione a bassa complessità |
Fissa ID provider/model che siano collegati. Gli ID dei piani di prima parte disattivati
(alibaba-token-plan, deepseek, zai-coding-plan, minimax-coding-plan)
si risolvono comunque per SKU, ma ogni chiamata prova prima il provider disattivato e
avvisa. Qwen 3.8 Max è una scelta esplicita valida, non il predefinito del prodotto né dell’esempio;
senza config.model, il predefinito implicito percorre i cataloghi collegati in
questo ordine: deepseek-flash, glm-5.3-flash, qwen3.8-flash, MiniMax-M3, grok-4.6,
claude-sonnet-5, gpt-6, gemini-3.8-flash, qwen3.8-27b.
Modello di configurazione
Vedi ax-code.json.example alla radice del repository per un predefinito concreto DeepSeek Flash, con Pro sugli agenti di ragionamento.
Modelli ausiliari di Codex CLI
La disponibilità dei modelli Codex dipende dal metodo di accesso dell’account e dal client, non
solo dalle capacità di testo o di strumenti del catalogo. AX Code quindi non deduce
un modello piccolo codex-cli dai nomi o dai metadati di famiglia. Senza un modello
esplicito small_model o un modello dell’agente di compattazione, la compattazione usa il modello di sessione.
Se configuri un modello ausiliario, verifica che funzioni con lo stesso accesso Codex. Un rifiuto esplicito di Codex, secondo cui un modello non è supportato con un account ChatGPT, consente alla compattazione di provare una volta il modello di sessione, saltando gli altri modelli piccoli. Il tentativo rifiutato resta nella cronologia della sessione. Gli altri fallimenti di autenticazione, fatturazione, validazione, annullamento e overflow di contesto conservano la gestione esistente; la guardia di privacy del provider locale continua ad applicarsi.
Per un’installazione più vecchia interessata, rimuovi una sostituzione incompatibile di small_model o
agent.compaction.model e fissa in modo esplicito agent.compaction.model
su un modello già verificato con quell’account Codex. Cambiare solo il modello di
sessione visibile non scavalca un modello di compattazione fissato separatamente.
Regole di auto-instradamento per tipo di compito
Non auto-instradare tutti i compiti di basso valore verso un modello economico. Dividili per costo del fallimento:
- Sicuro da auto-instradare (sola lettura o revisionabile da una persona):
- esplorazione del repository, triage di grep e ricerca, classificazione dei file
- riassunto del codice, riassunto dei log, spiegazione del codice
- preparazione del contesto per il modello premium
- documentazione
- Solo su adesione (verificabile in modo meccanico, ma può nascondere cambiamenti di comportamento):
- boilerplate, correzioni di lint
- Mai auto-instradare per impostazione predefinita (gli errori silenziosi costano caro):
- test unitari
- rinomina e refactoring
- SQL semplice
- wrapper di API
- CRUD semplice
L’ultimo gruppo deve restare sul modello di sessione, salvo che l’utente fissi in modo esplicito un modello più economico.
Manuale operativo
- Avvia i compiti non banali in modalità
plan, così il consulente valida il progetto prima che il lavoratore scriva codice. - Se il lavoratore entra in ciclo o fallisce la verifica due volte, passa a
debugcon il segnale di fallimento. - Usa
councilper una diagnosi indipendente quando due correzioni sono plausibili, non per finire il compito. - Riserva i cambi manuali di modello ai rari turni pesanti di ragionamento; torna indietro dopo.
Limitazioni note di ax-code
Provider.getSmallModel()restituisceundefinedper i provider il cui catalogo non etichetta unfamilyche porta un livello né corrisponde agli elenchi di priorità fissati nel codice; le chiamate ausiliarie tornano allora al modello di sessione (registrato come “no small model for provider”).- Non esiste un’escalation a metà esecuzione da un lavoratore bloccato a un modello più forte.