Esta página es una traducción de la documentación en inglés. Los comandos, identificadores y ejemplos no cambian. Runtime 7.24.4 · SDK 2.6.7. Original en inglés
Repetición de pruebas de cliente de AX Code y OpenCode: 19 de septiembre de 2026
Estado: Activo
Alcance: instantánea de diagnóstico medida
Última revisión: 2026-09-19
Responsable: entorno de ejecución de ax-code
Esta repetición usa el código fuente de AX Code 62895cf40a39e0ebd4afec0afa21044e9871aa0b, después de la corrección del
prefijo local (42908b46a) y de las adiciones de proveedores MTPLX y oMLX. Las seis combinaciones de cliente y backend
usan el mismo artefacto Qwen3.8 27B AXQ de 6 bits con MTP activado en un Apple M3 Max de 128 GiB.
Las mediciones anteriores siguen siendo evidencia histórica;
sus paquetes de modelo, prompts, límites de tokens y condiciones de caché difieren. Esto no es una estimación controlada
de antes y después de la aceleración de la corrección del prefijo.
Velocidad de la salida entregada
Cada celda es primera tarea / tarea repetida, en tokens/s. Son observaciones únicas, no medianas. La tarea repetida inicia una sesión nueva de CLI contra el mismo proceso de backend; no se supone que acierte en una caché. La carga y la espera de la primera salida quedan fuera de esta tasa.
| Cliente | AX Engine | MTPLX | oMLX |
|---|---|---|---|
| cliente AX Code | 11.73 / 13.60 | 18.73 / 19.69 | 17.48 / 16.60 |
| cliente OpenCode | 22.49 / 18.98 | 27.91 / 26.35 | 20.33 / 20.64 |
La estimación es (completion tokens - 1) / (last output payload time - first output payload time).
El decode especulativo puede emitir varios tokens en una carga, así que esto es una estimación de entrega del cliente,
no el contador nativo de decode del backend. Tampoco mide el rendimiento de la solicitud completa.
Tiempos de solicitud, carga y aceptación
NR significa que el servidor no informó el uso de tokens en caché; no afirma cero. El tiempo del primer fragmento
empieza cuando el proxy local de grabación recibe la solicitud del modelo. El tiempo de reloj de la CLI incluye también el
arranque y la finalización del cliente. La tarea pide una caché LRU genérica y autónoma de TypeScript con get, set,
delete y clear, sin ejecución de herramientas ni ediciones de archivos.
| Backend | Cliente | Tarea | Tokens de entrada | Tokens de salida | Tokens en caché | Primer fragmento (s) | Reloj de la CLI (s) | Comprobaciones de código |
|---|---|---|---|---|---|---|---|---|
| AX Engine | AX Code | Primera | 29,896 | 268 | NR | 197.78 | 231.58 | Aprueba |
| AX Engine | AX Code | Repetición | 29,896 | 268 | 29696 | 7.22 | 33.34 | Aprueba |
| AX Engine | OpenCode | Primera | 17,316 | 216 | NR | 100.86 | 112.83 | Aprueba |
| AX Engine | OpenCode | Repetición | 17,316 | 228 | NR | 116.03 | 129.90 | Aprueba |
| MTPLX | AX Code | Primera | 36,708 | 285 | 0 | 246.67 | 269.43 | Aprueba |
| MTPLX | AX Code | Repetición | 36,708 | 285 | 36708 | 0.04 | 20.48 | Aprueba |
| MTPLX | OpenCode | Primera | 18,729 | 276 | 0 | 108.67 | 121.00 | Aprueba |
| MTPLX | OpenCode | Repetición | 18,729 | 276 | 18729 | 0.08 | 12.77 | Aprueba |
| oMLX | AX Code | Primera | 33,124 | 275 | 0 | 212.25 | 235.62 | Aprueba |
| oMLX | AX Code | Repetición | 33,124 | 232 | 32768 | 4.41 | 23.34 | Aprueba |
| oMLX | OpenCode | Primera | 17,316 | 213 | 0 | 118.03 | 130.88 | Aprueba |
| oMLX | OpenCode | Repetición | 17,316 | 261 | 16384 | 7.73 | 22.91 | Aprueba |
Las comprobaciones de aceptación del código cubren claves ausentes, búsqueda de valores, desalojo LRU, entradas retenidas, actualización de la recencia, borrado de claves existentes y ausentes, vaciado, identidad de claves de objeto y valores falsy. Los archivos generados también reciben una comprobación estricta de TypeScript. Estas comprobaciones acotadas no establecen una calidad amplia de programación. Todas las filas de medición conservan su salida generada y el resultado de validación; los fallos no se sustituyen en silencio por reintentos más rápidos.
Condiciones de MTP y del entorno de ejecución
- AX Engine 7.4.0:
--mlx-mtp-policy required, marcas del entorno de ejecución local gestionado, aceleración n-gram y apilado n-gram desactivados. Las métricas del proceso en vivo muestranax_engine_mlx_mtp_model_policy_active=1con contadores distintos de cero de tokens de borrador y aceptados. La instantánea de AX Code sigue al calentamiento; la instantánea de OpenCode sigue a la primera tarea. Ambas incluyen el calentamiento y no son totales de aceptación por tarea. No se conservaron los recuentos de borrador por tarea de AX Code. - MTPLX 2.11.3 / MLX 0.32.2:
--generation-mode mtp --depth 3explícito; la salud en vivo informageneration_mode: mtpyruntime_mode: Sustained MTP. Las reescrituras del agente y la caché de sesión SSD están apagadas; el banco de sesión nativo en memoria sigue activado. Se conservan los calentamientos nativos de arranque y de núcleo y quedan fuera de los tiempos. El calentamiento de carga no relacionado terminó; el estado del calentamiento de fondo en la admisión se conserva en los datos en lugar de suponerse completo. - oMLX 0.6.4 / MLX 0.32.0: Lightning MTP activado, profundidad 3, carga de modelo solo de texto, concurrencia uno. Los registros por generación anotan la aceptación del borrador y la ejecución por profundidad para el calentamiento y ambas tareas. El importador de sidecar de origen renombra 15 tensores; su dtype, su forma y los bytes de carga permanecen idénticos al sidecar original de AXQuant. Los pesos de la red troncal no cambian.
- Artefacto:
AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, revisión4d36d652c21590f6813495351c3baf5fca5b3831. Los metadatos del artefacto declaran profundidad MTP 1; la profundidad recurrente 3 aquí sigue la política del entorno de ejecución seleccionado o el experimento explícito y no amplía la certificación del artefacto. El paquete de modelo Optimized-Speed no se usa en esta repetición. - La versión de OpenCode es 1.18.31. Todos los backends y clientes se ejecutan en serie. Cada par de cliente y backend inicia un proceso nuevo y una caché de tarea aislada, seguido de un calentamiento de carga de modelo no relacionado limitado a 64 tokens de salida. La carga del modelo y ese calentamiento quedan fuera de la tabla; la primera tarea sigue pagando el prefill en frío. El control del ventilador se deja en su valor predeterminado, y los archivos de la red troncal residen en almacenamiento SMB.
Qué está alineado y qué sigue siendo distinto
Ambos clientes reciben las mismas instrucciones congeladas del proyecto completo, la tarea del usuario y cuatro herramientas permitidas
(glob, grep, read, skill). La CLI de código fuente de AX Code usa los ID reales de proveedor ax-engine, mtplx y
omlx; AX Engine usa su contrato verificado de conexión loopback con un backend
iniciado aparte que lleva las marcas gestionadas. Esto no cronometra la interfaz de descarga y arranque gestionados.
OpenCode usa su vía de proveedor compatible con OpenAI. La configuración del proyecto está desactivada y cada
cliente tiene ajustes y estado aislados. Los prompts nativos del cliente, los esquemas de herramientas y las cabeceras de sesión permanecen
intactos; por tanto difieren los recuentos de tokens renderizados y el comportamiento de la caché.
Un proxy local de grabación alinea la temperatura 0.55, top-p 1, top-k/min-p 0, penalización de repetición 1,
penalizaciones de presencia y frecuencia 0, semilla 0, thinking apagado y un techo de salida de 1,024 tokens.
Fuerza tool_choice: none para esta tarea sin herramientas. Ambos clientes están configurados para un contexto de 65,536
tokens. Cada fila se comprueba para la instantánea completa de instrucciones, los cuatro nombres de herramienta,
el muestreo común, una solicitud, salida exitosa de la CLI, parada natural y ninguna ejecución de herramientas.
Los prompts más largos de AX Code pueden aumentar tanto el prefill como el trabajo de atención durante la generación. Las distintas longitudes de respuesta, el contenido, las plantillas del entorno de ejecución, los núcleos y las políticas de caché impiden tratar estas tablas como una referencia de sobrecarga de cliente con tokens iguales. Que MTP esté activo no garantiza 30–40 tokens/s para un contexto completo de programación. Para aislar la sobrecarga del cliente o el efecto de la corrección del prefijo, reproduce aparte solicitudes serializadas o ID de token idénticos, con salida y condiciones de caché controladas.
Este informe no cambia ningún comportamiento de nube, GPU privada, proveedor de CLI ni AX Trust. Consulta la guía de configuración del entorno de ejecución local para las instrucciones de conexión y los datos de medición saneados para los tiempos exactos, los recuentos, los hashes, los resultados de validación y la evidencia MTP. Las instrucciones privadas del proyecto, las respuestas del modelo, las rutas locales y las cabeceras de sesión se conservan en local y no se publican. En consecuencia, la carga completa de contexto privado no es reproducible de forma independiente solo a partir del informe público.