Obtener AX Code · GratisDocumentación

Esta página es una traducción de la documentación en inglés. Los comandos, identificadores y ejemplos no cambian. Runtime 7.24.4 · SDK 2.6.7. Original en inglés

Selección de modelos de AX Engine

Estado: Activo Alcance: estado actual Última revisión: 2026-09-20 Responsable: entorno de ejecución de ax-code

AX Code ofrece solo estos dos paquetes de desarrollo a través de AX Engine (Local) en Mac Apple Silicon aptos. Tiel Coder es el predeterminado; Cyber-Tiel Coder es la alternativa.

Modelo Repositorio de Hugging Face Selección de AX Code
Tiel Coder 35B A3B MXFP4 MTP AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP tiel-coder-35b-axq-mxfp4 (predeterminado)
Cyber-Tiel Coder 35B A3B MXFP4 MTP AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP cyber-tiel-coder-35b-axq-mxfp4

Los alias fijan las revisiones 5ab39b24bfd7f65203be9b7823b1840486f58b6d y fe05e871ec69ad9ae8eac01fd285555514ac7daf, respectivamente. Ambos usan el selector mlx y conservan el paquete MXFP4 del editor. Las fichas de modelo describen recuantizaciones de desarrollo sin una afirmación certificada de paridad de calidad ni de velocidad MTP; seleccionarlos no establece ejecución nativa ni una mejora de velocidad.

AX Code incluye la versión 7.5.7 firmada de AX Engine, que incorpora la corrección del cargador del espacio de nombres del sidecar de Tiel del commit 51137c71a6794964d52c32c95e275c0923ed8d0b. Los binarios antiguos de Homebrew 7.4.0 carecen de esa corrección y rechazan estos paquetes con MlxMtpRequiredButUnavailable. Mantén MTP como requisito; las anulaciones explícitas del entorno de ejecución también deben contener la corrección. Las mediciones nativas de prefill y decode conservan la identidad de la compilación probada original y no certifican el rendimiento de la versión más reciente.

Qwen3.8 27B, Ornith, Qwen3-Coder-Next y todos los demás repositorios quedan excluidos de la selección gestionada nueva y de las descargas. Cada repositorio seleccionado aparece una vez. Los alias configurados y las revisiones antiguas en caché no añaden opciones después del descubrimiento. Otros proveedores y la interfaz de conexión loopback configurada por separado conservan su comportamiento. Para ejecutar el predeterminado denso propio de AX Engine, inicia ax-engine serve qwen3.8-27b:axq y conecta ese endpoint local; el MTP medido en la ruta del producto es 31.05 tok/s de decode en Mac mini M4 Pro 64 GB y 76.90 tok/s de decode / 795.3 tok/s de prefill en M5 Max 128 GB. Esas cifras no son tok/s de finalización de Tiel ni la velocidad de una sesión de AX Code. Consulta resumen de pares de Tiel.

Inspeccionar los modelos disponibles

ax-code providers ax-engine models --json
ax-code providers ax-engine models --refresh --json

La actualización lee metadatos de Hugging Face sin descargar pesos ni iniciar un modelo. Los metadatos incluidos funcionan sin conexión y complementan el repositorio seleccionado si falta en una caché antigua. Las revisiones presentes no se sustituyen en silencio por una revisión incluida distinta. La selección sigue exigiendo metadatos de origen válidos; la restricción del repositorio no establece capacidad nativa.

GET /provider/ax-engine/models devuelve el catálogo de la CLI en ejecución, incluido el ID exacto de cada modelo, el repositorio, la cuantización, el estado local, las estimaciones de memoria y disco, y el estado de verificación. Una interfaz gráfica externa usa esta API del entorno de ejecución. Si muestra una lista más antigua, comprueba la CLI que lanza y su versión. El desarrollo de AX Coder puede seleccionar un entorno de ejecución de código fuente con AX_CODE_BINARY o settings.axCodeBinary.

Preparar el modelo seleccionado

Copia el ID exacto del modelo desde el catálogo. El alias predeterminado de Tiel usa mlx:

ax-code providers ax-engine prepare \
  --model tiel-coder-35b-axq-mxfp4 --quantization mlx --download --start

Los modelos excluidos hacen fallar las solicitudes nuevas de preparación, descarga y activación gestionada antes de empezar el trabajo. Los registros de modelo existentes siguen disponibles para el estado y la limpieza; los ID eliminados de Qwen3.8, Ornith y Qwen3-Coder-Next nunca se redirigen a ninguno de los artefactos de Tiel. Quitar una opción no borra sus pesos ni detiene un servidor existente.

Verificación de memoria y del entorno de ejecución

Ambos alias seleccionados usan un contexto de 65,536 tokens, un límite de salida de 8,192 tokens, un requisito estimado de memoria de 64 GiB y un presupuesto de disco de descarga de 32 GiB. Son límites de servicio de AX Code, no el contexto máximo de origen. (Elevado desde un contexto inicial de 32,768 tokens: eso dejaba solo 24,576 tokens de entrada utilizables tras la reserva de salida, menos de lo que exigen el prompt de sistema fijo del agente de AX Code y los esquemas de herramientas, así que una sesión recién creada nunca podía enviar un primer turno.)

Cada estimación de memoria incluye pesos, sidecars, caché KV, búferes y reserva del host. Usa el resultado de encaje del catálogo en vivo para la máquina actual. Estas estimaciones no son una certificación de hardware ni de calidad del modelo.

La cifra de 64 GiB es un presupuesto conservador de planificación para el contexto completo (64K), no un suelo rígido. Para una máquina cómoda de inferencia local gestionada, recomendamos un Apple Silicon M4 Pro con 48 GB de memoria unificada o más (por ejemplo un Mac Mini M4 Pro de 48 GB); los Mac Apple Silicon más pequeños aún pueden ejecutar AX Code desde 8 GB con modelos de nube o API, o con entornos de ejecución locales más ligeros.

Antes de la activación gestionada, AX Code comprueba el contrato de texto y de herramienta estructurada del modelo activo de AX Engine. Un estado verification-required significa que la preparación está completa, pero ese contrato en vivo no se ha establecido. Los nombres de repositorio o los sidecars MTP por sí solos no prueban razonamiento, visión, aceleración MTP ni calidad de programación de varios turnos.

La compactación de sesión usa los presupuestos de contexto y salida del modelo activo y reserva margen de entrada. La variante seleccionada conserva su propio presupuesto de catálogo; el contexto máximo del modelo de origen no es una garantía de memoria gestionada.

Consulta arquitectura del motor local para los detalles de ciclo de vida y transporte.

Política MTP gestionada

AX Engine gestionado usa de forma predeterminada required, en línea con el artefacto MTP seleccionado. Un redactor no disponible hace fallar el arranque en lugar de recurrir en silencio al decode directo. Los pesos MTP y el ajuste de apilado puro no establecen aceleración activa. El paquete predeterminado de Tiel Coder usa el perfil de especulación auto para que AX Engine seleccione la puerta de borrador del modelo en lugar de la anulación 0.80 del perfil genérico agentic. Esto es independiente de la política de activación MTP: el ajuste auto sigue usando MTP required. El entorno experimental antiguo específico del Qwen3.8 denso no se aplica a estos paquetes MoE. Consulta la comparación de perfiles para las ganancias medidas. Cyber-Tiel conserva agentic; las sondas gestionadas de tareas de lectura fallaron con ambos perfiles, así que su fiabilidad en tareas sigue sin resolverse. La política de activación sigue siendo required; el motor debe admitir el redactor real. Para seleccionar una política de forma explícita, establece provider.ax-engine.options.mtpPolicy en ax-code.json:

{
  "provider": {
    "ax-engine": {
      "options": {
        "mtpPolicy": "required"
      }
    }
  }
}
Política Comportamiento
disabled Usa decode directo; no solicita un redactor del modelo.
auto Deja que AX Engine decida si el modelo y la ruta admiten MTP. Esto no garantiza la activación.
required (predeterminado) Exige un redactor MTP admitido; AX Engine rechaza un redactor no disponible en lugar de recurrir en silencio.

AX_ENGINE_MTP_POLICY proporciona los mismos tres valores cuando no hay una opción de proveedor definida. La selección automática del entorno de ejecución exige AX Engine 7.5.7 o posterior para hacer cumplir estas políticas, incluida la política predeterminada required. Los ajustes explícitos disabled y auto siguen anulando el valor predeterminado. Los binarios antiguos o desconocidos rechazan la selección de política antes de sustituir un motor en ejecución; actualiza antes de usar los controles de política gestionada. Los archivos de estado históricos sin una política registrada informan su política lanzada como desconocida y se sustituyen en el siguiente inicio gestionado. Cambiar la política surte efecto en el siguiente inicio gestionado o solicitud de modelo y sustituye un proceso existente con una política distinta. No cambia la selección de modelo ni el almacenamiento.

ax-code providers ax-engine start --mtp-policy disabled anula la política solo para ese inicio. Establece la opción persistente del proveedor si las solicitudes de programación posteriores deben usar la misma anulación. Los cuerpos HTTP de prepare/start también aceptan mtpPolicy. Estos ajustes gestionados no reconfiguran endpoints conectados por separado. Tras actualizar el código fuente, reinicia pnpm run dev para cargar el nuevo valor predeterminado; un backend de desarrollo que ya está en marcha conserva su código cargado hasta que se reinicia.

ax-code providers ax-engine status (o --json) separa la política solicitada, la política lanzada y el estado observado active/inactive/unknown. La observación usa la métrica más reciente de ruta de modelo del motor, no los metadatos del modelo ni recuentos históricos de borrador. Las muestras del modelo exacto que faltan permanecen desconocidas, incluso antes del primer paso observado del motor; los agregados de todo el servidor no establecen la activación. required configurado no se muestra como prueba de actividad. Los recuentos de borrador y aceptados, cuando están disponibles, son acumulativos para el motor residente. Un cambio de política pendiente se informa sin reiniciarlo durante la inspección de estado. La activación MTP no es una promesa de una tasa de tokens concreta.

Interpretar la velocidad de respuesta local

AX Engine gestionado no impone un techo de tokens por segundo. Una medición como 50 tok/s no es ni un objetivo configurado ni un límite superior: un hardware más rápido puede producir tokens más deprisa. El tamaño del contexto, los presupuestos de salida y los límites de concurrencia de solicitudes controlan la capacidad, no una tasa fija de generación de tokens.

La instantánea pública actual de Tiel frente a MTPLX es la campaña de API nativa del 20 de septiembre de 2026 resumida en resumen de pares de Tiel. En un M5 Max de 128 GiB el paquete predeterminado gestionado de Tiel completó a 194.88 tok/s, incluido el TTFT (decode 217.85). El pico de decode de Cyber-Tiel, 249.01 tok/s, es el paquete alternativo, no el predeterminado. Esas cifras no son la velocidad de una sesión de AX Code.

Compara las mediciones con la misma longitud de entrada, el mismo presupuesto de salida, los mismos ajustes de muestreo y el mismo estado de caché. Las mediciones de decode con prompts cortos no establecen una tasa mínima para una sesión de programación con decenas de miles de tokens de contexto. Reutilizar un prefijo reduce el procesamiento del prompt; el decode posterior sigue atendiendo a ese contexto. La activación MTP por sí sola no establece una aceptación útil del borrador ni una aceleración fija.

Separa el arranque y la preparación, el tiempo hasta el primer contenido y la generación sostenida al investigar un turno lento. La métrica ax_runtime_decode_tok_per_sec del motor es una media ponderada de forma exponencial entre solicitudes, no la tasa de la respuesta actual. Usa los tiempos de la solicitud y los recuentos de tokens de esa respuesta, y los deltas de contadores para su aceptación MTP. Los fragmentos del flujo pueden contener varios tokens; contar fragmentos como tokens da una tasa incorrecta.

AX Code reutiliza las sondas exitosas de versión del ejecutable durante hasta cinco minutos. Comprueba la disponibilidad del ejecutable en cada resolución e invalida las versiones en caché cuando cambia la identidad de archivo del lanzador o del servidor nativo. Las sondas fallidas siguen siendo reintentables. Esto reduce el trabajo de preparación repetido; no cambia la velocidad de decode del modelo. Un backend de desarrollo debe reiniciarse para cargar cambios del código fuente.