Cette page est traduite de la documentation anglaise. Les commandes, identifiants et exemples sont inchangés. Runtime 7.24.4 · SDK 2.6.7. Source anglaise
Bonnes pratiques de routage multi-modèles
Statut : actif Portée : public, état actuel Dernière revue : 2026-09-13 Responsable : runtime AX Code
Ce guide décrit la façon recommandée d’exécuter ax-code avec un modèle de raisonnement premium et des modèles auxiliaires moins chers du même fournisseur.
Principe central
Utilisez le modèle coûteux pour le travail dense en raisonnement, et les modèles bon marché pour le travail mécanique ou en lecture seule. Les vraies économies viennent du filtrage de contexte : le modèle premium ne voit que le contexte distillé préparé par des modèles moins chers ou des sous-agents.
Découpage de couches recommandé
| Couche | Classe de modèle | Agents ou tâches typiques |
|---|---|---|
| Travailleur / exécutant | Référence flash connectée lorsqu’elle existe (par ex. DeepSeek Flash) | session non épinglée, build, general, scout, test, devops, perf |
| Conseiller / raisonnement | Modèle connecté plus fort (par ex. DeepSeek V4 Pro) | plan, architect, security, debug |
| Auxiliaire bon marché / lecture seule | Même référence flash | explore, compaction, titres, récapitulatifs, classification de faible complexité |
Épinglez des identifiants provider/model qui sont connectés. Les identifiants de plans de première partie désactivés
(alibaba-token-plan, deepseek, zai-coding-plan, minimax-coding-plan)
se résolvent encore par référence, mais chaque appel essaie d’abord le fournisseur désactivé et
avertit. Qwen 3.8 Max est un choix explicite valide, pas le défaut du produit ni de l’exemple ;
sans config.model, le défaut implicite parcourt les catalogues connectés dans
cet ordre : deepseek-flash, glm-5.3-flash, qwen3.8-flash, MiniMax-M3, grok-4.6,
claude-sonnet-5, gpt-6, gemini-3.8-flash, qwen3.8-27b.
Modèle de configuration
Voir ax-code.json.example à la racine du dépôt pour un défaut concret DeepSeek Flash, avec Pro sur les agents de raisonnement.
Modèles auxiliaires de Codex CLI
La disponibilité des modèles Codex dépend de la méthode de connexion du compte et du client, pas
seulement des capacités de texte ou d’outils du catalogue. AX Code n’infère donc pas
un petit modèle codex-cli à partir des noms ou des métadonnées de famille. Sans
small_model explicite ni modèle d’agent de compactage, le compactage utilise le modèle de session.
Si vous configurez un modèle auxiliaire, vérifiez qu’il fonctionne avec la même connexion Codex. Un rejet explicite de Codex indiquant qu’un modèle n’est pas pris en charge avec un compte ChatGPT permet au compactage d’essayer une fois le modèle de session, en sautant les autres petits modèles. La tentative rejetée reste dans l’historique de session. Les autres échecs d’authentification, de facturation, de validation, d’annulation et de dépassement de contexte conservent leur traitement existant ; la garde de confidentialité du fournisseur local s’applique toujours.
Pour une installation plus ancienne concernée, retirez une surcharge incompatible small_model ou
agent.compaction.model et épinglez explicitement agent.compaction.model
sur un modèle déjà vérifié avec ce compte Codex. Changer seulement le modèle de
session visible ne remplace pas un modèle de compactage épinglé séparément.
Règles de routage automatique par type de tâche
Ne routez pas automatiquement toutes les tâches de faible valeur vers un modèle bon marché. Séparez-les selon le coût de l’échec :
- Sûres à router automatiquement (lecture seule, ou révisables par un humain) :
- exploration du dépôt, tri grep/recherche, classement de fichiers
- résumé de code, résumé de journaux, explication de code
- préparation du contexte pour le modèle premium
- documentation
- Sur activation seulement (vérifiables mécaniquement, mais peuvent masquer des changements de comportement) :
- code passe-partout, corrections de lint
- Jamais de routage automatique par défaut (les erreurs silencieuses coûtent cher) :
- tests unitaires
- renommage ou refactorisation
- SQL simple
- enveloppe d’API
- CRUD simple
Le dernier groupe doit rester sur le modèle de session, sauf si l’utilisateur épingle explicitement un modèle moins cher.
Mode d'emploi
- Commencez les tâches non triviales en mode
plan, afin que le conseiller valide la conception avant que le travailleur écrive du code. - Si le travailleur boucle ou échoue deux fois à la vérification, passez à
debugavec le signal d’échec. - Utilisez
councilpour un diagnostic indépendant lorsque deux correctifs sont plausibles, pas pour finir la tâche. - Réservez les changements manuels de modèle aux rares tours lourds en raisonnement ; revenez ensuite au modèle précédent.
Limites connues d'ax-code
Provider.getSmallModel()renvoieundefinedpour les fournisseurs dont le catalogue ni n’étiquette unfamilyporteur de niveau, ni ne correspond aux listes de priorité figées ; les appels auxiliaires retombent alors sur le modèle de session (journalisé comme « no small model for provider »).- Il n’existe pas d’escalade en cours d’exécution, d’un travailleur bloqué vers un modèle plus fort.