Cette page est traduite de la documentation anglaise. Les commandes, identifiants et exemples sont inchangés. Runtime 7.24.4 · SDK 2.6.7. Source anglaise
Sélection et reprise de modèle
Statut : actif Portée : état actuel Dernière revue : 2026-10-10 Responsable : runtime AX Code
AX Code conserve les sélections exactes de fournisseur et de modèle. Connecter un fournisseur ne l’ajoute pas à un réservoir de reprise automatique. Sans repli configuré, les échecs transitoires réessaient la cible choisie dans la limite de nouveaux essais existante, puis s’arrêtent.
Configurer un repli ordonné
Définissez llm_routing.fallback dans la configuration utilisateur, dans une configuration personnalisée choisie
par AX_CODE_CONFIG, ou par un AX_CODE_CONFIG_CONTENT explicite. Les cibles sont des paires exactes ;
les identifiants de modèles peuvent contenir des barres obliques. Par exemple :
{
"model": "my-gateway/openai/gpt-oss-120b",
"llm_routing": {
"fallback": [
{ "providerID": "my-gateway", "modelID": "my-backup-model" },
{ "providerID": "my-other-provider", "modelID": "my-approved-model" }
]
}
}
Remplacez ces exemples par les identifiants exacts de vos fournisseurs configurés. La liste autorise jusqu’à huit cibles distinctes. Vide ou absente, elle signifie qu’aucune cible ne change. La configuration de projet et distante peut restreindre les autorisations utilisateur, mais ne peut ni les ajouter ni les réordonner. Les restrictions gérées fournissent un plafond final. Une cible suivante configurée mais absente arrête la reprise ; AX Code ne substitue pas une autre entrée du catalogue.
Les limites de débit transitoires ordinaires, les surcharges reconnues et les erreurs de serveur peuvent avancer dans cette liste après les nouveaux essais sur la même cible. Les échecs d’authentification, de permission, de quota permanent et de requête invalide n’autorisent pas un changement. Les sessions de fournisseur local ne migrent pas automatiquement vers l’inférence distante. L’annulation arrête la séquence. La reprise après que la requête en cours a publié une sortie ou démarré un outil s’arrête aussi, afin de conserver le progrès partiel au lieu de rejouer les effets.
Le processeur autorise normalement cinq nouveaux essais sur la même cible après la tentative initiale ; les erreurs de limite de concurrence ont une limite de huit essais. Les disjoncteurs de fournisseur et les limites d’erreur externes peuvent arrêter plus tôt. Les étapes réussies de la boucle d’outils sont de nouvelles requêtes, pas des nouveaux essais du travail précédent. Les nouveaux essais du SDK d’IA sont désactivés aux sites de génération directe contrôlés. Les tentatives internes des CLI externes et des passerelles peuvent rester opaques.
Travail auxiliaire et configuration existante
Sans small_model, le titre, le récapitulatif et le compactage héritent du modèle principal.
Un small_model explicite ou un modèle d’agent propre au rôle sélectionne encore cette cible
exacte. Les épingles invalides échouent au lieu de passer à un autre fournisseur ou modèle. Le travail
facultatif de titre ou de récapitulatif conserve son comportement de titre local ou de saut. Le compactage conserve la
transcription en cas d’échec et ne change de modèle que par la reprise configurée.
Les modèles principaux configurés, les épingles de tâche, d’agent ou de commande et les sélections récentes enregistrées
restent aussi exacts. Retirez ou corrigez explicitement une épingle indisponible. Les exécutions sans interface
sans sélection configurée ni récente exigent --model. Le sélecteur de modèle visible
peut proposer des recommandations, mais ces suggestions ne deviennent pas une liste de reprise.
Le classifieur de complexité facultatif exige un modèle auxiliaire explicite ; sans lui, la classification est sautée. Il est ancré au fournisseur demandé lorsqu’un modèle principal est fourni. Les choix principaux explicites survivent au routage par sujet d’agent.
Inspecter la configuration effective
ax-code debug routing
ax-code debug routing --model my-gateway/openai/gpt-oss-120b
Cela affiche le modèle principal exact, le repli ordonné, la sélection auxiliaire, les épingles d’agents et la limite de nouveaux essais. Cela n’envoie pas de requête de modèle et ne sonde pas la disponibilité des modèles. Le chargement normal de la configuration peut récupérer les réglages distants configurés. C’est une explication de configuration, pas une reconstruction du comportement passé d’une passerelle.
Les messages utilisateur enregistrent si la sélection venait d’une requête, d’une épingle d’agent,
d’un routage de complexité ou hybride, ou des défauts de session et de configuration. Cette source décrit l’entrée
locale ; request n’atteste pas qui a opéré un client d’API. Les preuves de requête
enregistrent le but et la cible choisis. Les auto-descriptions générées par le modèle et les
noms de modèles dans la mémoire ou les exemples d’outils ne sont pas des preuves de routage. AX Trust et
les fournisseurs externes restent responsables du routage et de l’autorisation en amont.