Esta página es una traducción de la documentación en inglés. Los comandos, identificadores y ejemplos no cambian. Runtime 7.24.4 · SDK 2.6.7. Original en inglés
Buenas prácticas de enrutado de varios modelos
Estado: Activo Alcance: público, estado actual Última revisión: 2026-09-13 Responsable: runtime de ax-code
Esta guía recoge la forma recomendada de ejecutar AX Code con un modelo de razonamiento de primer nivel y modelos auxiliares más baratos del mismo proveedor.
Principio central
Usa el modelo caro para el trabajo denso en razonamiento y los modelos baratos para el trabajo mecánico o de solo lectura. El ahorro real viene del filtrado de contexto: el modelo de primer nivel solo ve el contexto destilado que preparan los modelos más baratos o los subagentes.
División de capas recomendada
| Capa | Clase de modelo | Agentes o tareas habituales |
|---|---|---|
| Trabajador / ejecutor | SKU flash conectado cuando esté disponible (por ejemplo DeepSeek Flash) | sesión sin anclar, build, general, scout, test, devops, perf |
| Asesor / razonamiento | Modelo conectado más fuerte (por ejemplo DeepSeek V4 Pro) | plan, architect, security, debug |
| Auxiliar barato de solo lectura | El mismo SKU flash | explore, compaction, títulos, resúmenes, clasificación de baja complejidad |
Fija ID provider/model que estén conectados. Los ID de plan de primera parte desactivados
(alibaba-token-plan, deepseek, zai-coding-plan, minimax-coding-plan)
siguen resolviéndose por SKU, pero cada llamada prueba primero el proveedor desactivado y
avisa. Qwen 3.8 Max es una elección explícita válida, no el valor predeterminado del producto ni del ejemplo;
sin config.model, el valor predeterminado implícito recorre los catálogos conectados en
este orden: deepseek-flash, luego glm-5.3-flash, qwen3.8-flash, MiniMax-M3, después grok-4.6,
claude-sonnet-5, gpt-6, gemini-3.8-flash y qwen3.8-27b.
Plantilla de configuración
Consulta ax-code.json.example en la raíz del repositorio para un valor predeterminado concreto de DeepSeek Flash con Pro en los agentes de razonamiento.
Modelos auxiliares de Codex CLI
La disponibilidad de modelos de Codex depende del método de inicio de sesión de la cuenta y del cliente, no
solo de las capacidades de texto o de herramientas del catálogo. Por eso AX Code no infiere
un modelo pequeño codex-cli a partir de nombres o de metadatos de familia. Sin un modelo explícito
small_model o de agente de compactación, la compactación usa el modelo de la sesión.
Si configuras un modelo auxiliar, verifica que funcione con el mismo inicio de sesión de Codex. Un rechazo explícito de Codex de que un modelo no se admite con una cuenta de ChatGPT permite que la compactación pruebe el modelo de la sesión una vez, omitiendo otros modelos pequeños. El intento rechazado permanece en el historial de la sesión. Los demás fallos de autenticación, facturación, validación, cancelación y desbordamiento de contexto conservan su manejo existente; la guarda de privacidad del proveedor local sigue aplicándose.
En una instalación antigua afectada, quita una anulación incompatible de small_model o
agent.compaction.model y fija de forma explícita agent.compaction.model
a un modelo ya verificado con esa cuenta de Codex. Cambiar solo el modelo de sesión
visible no anula un modelo de compactación fijado aparte.
Reglas de enrutado automático por tipo de tarea
No enrutes de forma automática todas las tareas de poco valor a un modelo barato. Sepáralas por el coste del fallo:
- Seguro para el enrutado automático (solo lectura o revisable por una persona):
- exploración del repositorio, triaje de grep y de búsqueda, clasificación de archivos
- resumen de código, resumen de registros, explicación de código
- preparar contexto para el modelo de primer nivel
- documentación
- Solo optativo (verificable de forma mecánica, pero puede ocultar cambios de comportamiento):
- plantillas repetitivas, correcciones de lint
- Nunca enrutar de forma automática de manera predeterminada (los errores silenciosos son caros):
- pruebas unitarias
- renombrar y refactorizar
- SQL sencillo
- envoltorio de API
- CRUD sencillo
El último grupo debe permanecer en el modelo de la sesión salvo que el usuario fije de forma explícita un modelo más barato.
Manual de operación
- Empieza las tareas no triviales en modo
planpara que el asesor valide el diseño antes de que el trabajador escriba código. - Si el trabajador entra en bucle o falla la verificación dos veces, cambia a
debugcon la señal del fallo. - Usa
councilpara un diagnóstico independiente cuando dos correcciones son plausibles, no para terminar la tarea. - Reserva los cambios manuales de modelo para los turnos raros y pesados en razonamiento; vuelve después.
Limitaciones conocidas de AX Code
Provider.getSmallModel()devuelveundefinedpara los proveedores cuyo catálogo ni etiqueta unfamilyque lleve nivel ni coincide con las listas de prioridad fijas; las llamadas auxiliares vuelven entonces al modelo de la sesión (registrado como «no small model for provider»).- No hay una escalada a mitad de ejecución desde un trabajador atascado hacia un modelo más fuerte.