Obtener AX Code · GratisDocumentación

Esta página es una traducción de la documentación en inglés. Los comandos, identificadores y ejemplos no cambian. Runtime 7.24.4 · SDK 2.6.7. Original en inglés

Repetición de pruebas de cliente de AX Code y OpenCode: 19 de septiembre de 2026

Estado: Activo

Alcance: instantánea de diagnóstico medida

Última revisión: 2026-09-19

Responsable: entorno de ejecución de ax-code

Esta repetición usa el código fuente de AX Code 62895cf40a39e0ebd4afec0afa21044e9871aa0b, después de la corrección del prefijo local (42908b46a) y de las adiciones de proveedores MTPLX y oMLX. Las seis combinaciones de cliente y backend usan el mismo artefacto Qwen3.8 27B AXQ de 6 bits con MTP activado en un Apple M3 Max de 128 GiB. Las mediciones anteriores siguen siendo evidencia histórica; sus paquetes de modelo, prompts, límites de tokens y condiciones de caché difieren. Esto no es una estimación controlada de antes y después de la aceleración de la corrección del prefijo.

Velocidad de la salida entregada

Cada celda es primera tarea / tarea repetida, en tokens/s. Son observaciones únicas, no medianas. La tarea repetida inicia una sesión nueva de CLI contra el mismo proceso de backend; no se supone que acierte en una caché. La carga y la espera de la primera salida quedan fuera de esta tasa.

Cliente AX Engine MTPLX oMLX
cliente AX Code 11.73 / 13.60 18.73 / 19.69 17.48 / 16.60
cliente OpenCode 22.49 / 18.98 27.91 / 26.35 20.33 / 20.64

La estimación es (completion tokens - 1) / (last output payload time - first output payload time). El decode especulativo puede emitir varios tokens en una carga, así que esto es una estimación de entrega del cliente, no el contador nativo de decode del backend. Tampoco mide el rendimiento de la solicitud completa.

Tiempos de solicitud, carga y aceptación

NR significa que el servidor no informó el uso de tokens en caché; no afirma cero. El tiempo del primer fragmento empieza cuando el proxy local de grabación recibe la solicitud del modelo. El tiempo de reloj de la CLI incluye también el arranque y la finalización del cliente. La tarea pide una caché LRU genérica y autónoma de TypeScript con get, set, delete y clear, sin ejecución de herramientas ni ediciones de archivos.

Backend Cliente Tarea Tokens de entrada Tokens de salida Tokens en caché Primer fragmento (s) Reloj de la CLI (s) Comprobaciones de código
AX Engine AX Code Primera 29,896 268 NR 197.78 231.58 Aprueba
AX Engine AX Code Repetición 29,896 268 29696 7.22 33.34 Aprueba
AX Engine OpenCode Primera 17,316 216 NR 100.86 112.83 Aprueba
AX Engine OpenCode Repetición 17,316 228 NR 116.03 129.90 Aprueba
MTPLX AX Code Primera 36,708 285 0 246.67 269.43 Aprueba
MTPLX AX Code Repetición 36,708 285 36708 0.04 20.48 Aprueba
MTPLX OpenCode Primera 18,729 276 0 108.67 121.00 Aprueba
MTPLX OpenCode Repetición 18,729 276 18729 0.08 12.77 Aprueba
oMLX AX Code Primera 33,124 275 0 212.25 235.62 Aprueba
oMLX AX Code Repetición 33,124 232 32768 4.41 23.34 Aprueba
oMLX OpenCode Primera 17,316 213 0 118.03 130.88 Aprueba
oMLX OpenCode Repetición 17,316 261 16384 7.73 22.91 Aprueba

Las comprobaciones de aceptación del código cubren claves ausentes, búsqueda de valores, desalojo LRU, entradas retenidas, actualización de la recencia, borrado de claves existentes y ausentes, vaciado, identidad de claves de objeto y valores falsy. Los archivos generados también reciben una comprobación estricta de TypeScript. Estas comprobaciones acotadas no establecen una calidad amplia de programación. Todas las filas de medición conservan su salida generada y el resultado de validación; los fallos no se sustituyen en silencio por reintentos más rápidos.

Condiciones de MTP y del entorno de ejecución

  • AX Engine 7.4.0: --mlx-mtp-policy required, marcas del entorno de ejecución local gestionado, aceleración n-gram y apilado n-gram desactivados. Las métricas del proceso en vivo muestran ax_engine_mlx_mtp_model_policy_active=1 con contadores distintos de cero de tokens de borrador y aceptados. La instantánea de AX Code sigue al calentamiento; la instantánea de OpenCode sigue a la primera tarea. Ambas incluyen el calentamiento y no son totales de aceptación por tarea. No se conservaron los recuentos de borrador por tarea de AX Code.
  • MTPLX 2.11.3 / MLX 0.32.2: --generation-mode mtp --depth 3 explícito; la salud en vivo informa generation_mode: mtp y runtime_mode: Sustained MTP. Las reescrituras del agente y la caché de sesión SSD están apagadas; el banco de sesión nativo en memoria sigue activado. Se conservan los calentamientos nativos de arranque y de núcleo y quedan fuera de los tiempos. El calentamiento de carga no relacionado terminó; el estado del calentamiento de fondo en la admisión se conserva en los datos en lugar de suponerse completo.
  • oMLX 0.6.4 / MLX 0.32.0: Lightning MTP activado, profundidad 3, carga de modelo solo de texto, concurrencia uno. Los registros por generación anotan la aceptación del borrador y la ejecución por profundidad para el calentamiento y ambas tareas. El importador de sidecar de origen renombra 15 tensores; su dtype, su forma y los bytes de carga permanecen idénticos al sidecar original de AXQuant. Los pesos de la red troncal no cambian.
  • Artefacto: AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, revisión 4d36d652c21590f6813495351c3baf5fca5b3831. Los metadatos del artefacto declaran profundidad MTP 1; la profundidad recurrente 3 aquí sigue la política del entorno de ejecución seleccionado o el experimento explícito y no amplía la certificación del artefacto. El paquete de modelo Optimized-Speed no se usa en esta repetición.
  • La versión de OpenCode es 1.18.31. Todos los backends y clientes se ejecutan en serie. Cada par de cliente y backend inicia un proceso nuevo y una caché de tarea aislada, seguido de un calentamiento de carga de modelo no relacionado limitado a 64 tokens de salida. La carga del modelo y ese calentamiento quedan fuera de la tabla; la primera tarea sigue pagando el prefill en frío. El control del ventilador se deja en su valor predeterminado, y los archivos de la red troncal residen en almacenamiento SMB.

Qué está alineado y qué sigue siendo distinto

Ambos clientes reciben las mismas instrucciones congeladas del proyecto completo, la tarea del usuario y cuatro herramientas permitidas (glob, grep, read, skill). La CLI de código fuente de AX Code usa los ID reales de proveedor ax-engine, mtplx y omlx; AX Engine usa su contrato verificado de conexión loopback con un backend iniciado aparte que lleva las marcas gestionadas. Esto no cronometra la interfaz de descarga y arranque gestionados. OpenCode usa su vía de proveedor compatible con OpenAI. La configuración del proyecto está desactivada y cada cliente tiene ajustes y estado aislados. Los prompts nativos del cliente, los esquemas de herramientas y las cabeceras de sesión permanecen intactos; por tanto difieren los recuentos de tokens renderizados y el comportamiento de la caché.

Un proxy local de grabación alinea la temperatura 0.55, top-p 1, top-k/min-p 0, penalización de repetición 1, penalizaciones de presencia y frecuencia 0, semilla 0, thinking apagado y un techo de salida de 1,024 tokens. Fuerza tool_choice: none para esta tarea sin herramientas. Ambos clientes están configurados para un contexto de 65,536 tokens. Cada fila se comprueba para la instantánea completa de instrucciones, los cuatro nombres de herramienta, el muestreo común, una solicitud, salida exitosa de la CLI, parada natural y ninguna ejecución de herramientas.

Los prompts más largos de AX Code pueden aumentar tanto el prefill como el trabajo de atención durante la generación. Las distintas longitudes de respuesta, el contenido, las plantillas del entorno de ejecución, los núcleos y las políticas de caché impiden tratar estas tablas como una referencia de sobrecarga de cliente con tokens iguales. Que MTP esté activo no garantiza 30–40 tokens/s para un contexto completo de programación. Para aislar la sobrecarga del cliente o el efecto de la corrección del prefijo, reproduce aparte solicitudes serializadas o ID de token idénticos, con salida y condiciones de caché controladas.

Este informe no cambia ningún comportamiento de nube, GPU privada, proveedor de CLI ni AX Trust. Consulta la guía de configuración del entorno de ejecución local para las instrucciones de conexión y los datos de medición saneados para los tiempos exactos, los recuentos, los hashes, los resultados de validación y la evidencia MTP. Las instrucciones privadas del proyecto, las respuestas del modelo, las rutas locales y las cabeceras de sesión se conservan en local y no se publican. En consecuencia, la carga completa de contexto privado no es reproducible de forma independiente solo a partir del informe público.