Dapatkan AX Code · GratisDokumentasi

Halaman ini diterjemahkan dari dokumentasi bahasa Inggris. Perintah, pengenal, dan contoh tidak diubah. Runtime 7.24.4 · SDK 2.6.7. Sumber bahasa Inggris

Uji ulang klien AX Code dan OpenCode: 19 September 2026

Status: Aktif

Cakupan: cuplikan diagnostik terukur

Terakhir ditinjau: 2026-09-19

Pemilik: runtime ax-code

Uji ulang ini memakai sumber AX Code 62895cf40a39e0ebd4afec0afa21044e9871aa0b, setelah perbaikan awalan lokal (42908b46a) dan penambahan penyedia MTPLX/oMLX. Keenam kombinasi klien/backend memakai artefak Qwen3.8 27B AXQ 6-bit yang sama dengan MTP diaktifkan pada Apple M3 Max, 128 GiB. Pengukuran sebelumnya tetap menjadi bukti historis; paket model, prompt, batas token, dan kondisi cache mereka berbeda. Ini bukan perkiraan sebelum/sesudah yang terkendali atas percepatan perbaikan awalan.

Kecepatan keluaran yang terkirim

Setiap sel adalah tugas pertama / tugas berulang, dalam token/s. Ini pengamatan tunggal, bukan median. Tugas berulang memulai sesi CLI baru terhadap proses backend yang sama; tidak diasumsikan mengenai cache. Pemuatan dan menunggu keluaran pertama dikecualikan dari laju ini.

Klien AX Engine MTPLX oMLX
AX Code 11.73 / 13.60 18.73 / 19.69 17.48 / 16.60
OpenCode 22.49 / 18.98 27.91 / 26.35 20.33 / 20.64

Perkiraannya adalah (completion tokens - 1) / (last output payload time - first output payload time). Decode spekulatif dapat memancarkan beberapa token dalam satu muatan, jadi ini perkiraan pengiriman klien, bukan penghitung decode bawaan backend. Ia juga tidak mengukur throughput permintaan lengkap.

Waktu permintaan, beban kerja, dan penerimaan

NR berarti server tidak melaporkan pemakaian token ter-cache; ia tidak menyatakan nol. Waktu muatan pertama dimulai saat proksi perekaman lokal menerima permintaan model. Waktu dinding CLI juga mencakup mulai klien dan penyelesaian. Tugas meminta cache LRU TypeScript generik yang mandiri dengan get, set, delete, dan clear, tanpa eksekusi alat atau suntingan berkas.

Backend Klien Tugas Token masukan Token keluaran Token ter-cache Muatan pertama (s) Dinding CLI (s) Pemeriksaan kode
AX Engine AX Code Pertama 29,896 268 NR 197.78 231.58 Lulus
AX Engine AX Code Ulangan 29,896 268 29696 7.22 33.34 Lulus
AX Engine OpenCode Pertama 17,316 216 NR 100.86 112.83 Lulus
AX Engine OpenCode Ulangan 17,316 228 NR 116.03 129.90 Lulus
MTPLX AX Code Pertama 36,708 285 0 246.67 269.43 Lulus
MTPLX AX Code Ulangan 36,708 285 36708 0.04 20.48 Lulus
MTPLX OpenCode Pertama 18,729 276 0 108.67 121.00 Lulus
MTPLX OpenCode Ulangan 18,729 276 18729 0.08 12.77 Lulus
oMLX AX Code Pertama 33,124 275 0 212.25 235.62 Lulus
oMLX AX Code Ulangan 33,124 232 32768 4.41 23.34 Lulus
oMLX OpenCode Pertama 17,316 213 0 118.03 130.88 Lulus
oMLX OpenCode Ulangan 17,316 261 16384 7.73 22.91 Lulus

Pemeriksaan penerimaan kode mencakup kunci yang hilang, pencarian nilai, penggusuran LRU, entri yang dipertahankan, kebaruan pembaruan, penghapusan kunci yang ada dan yang tidak ada, pembersihan, identitas kunci objek, dan nilai falsy. Berkas yang dihasilkan juga menerima pemeriksaan TypeScript yang ketat. Pemeriksaan terbatas ini tidak menetapkan kualitas pengodean yang luas. Semua baris pengukuran mempertahankan keluaran yang dihasilkan dan hasil validasinya; kegagalan tidak diam-diam diganti dengan percobaan ulang yang lebih cepat.

Kondisi MTP dan runtime

  • AX Engine 7.4.0: --mlx-mtp-policy required, bendera runtime lokal terkelola, akselerasi n-gram dan penumpukan n-gram dinonaktifkan. Metrik proses langsung menampilkan ax_engine_mlx_mtp_model_policy_active=1 dengan penghitung token draf dan diterima yang bukan nol. Cuplikan AX Code mengikuti pemanasan; cuplikan OpenCode mengikuti tugas pertama. Keduanya mencakup pemanasan dan bukan total penerimaan per tugas. Hitungan draf AX Code per tugas tidak dipertahankan.
  • MTPLX 2.11.3 / MLX 0.32.2: --generation-mode mtp --depth 3 eksplisit; kesehatan langsung melaporkan generation_mode: mtp dan runtime_mode: Sustained MTP. Penulisan ulang agen dan cache sesi SSD mati; bank sesi dalam memori bawaan tetap aktif. Pemanasan mulai/kernel bawaan dipertahankan dan dikecualikan dari waktu. Pemanasan beban yang tidak terkait selesai; status pemanasan latar belakang saat penerimaan dipertahankan dalam data, bukan diasumsikan selesai.
  • oMLX 0.6.4 / MLX 0.32.0: Lightning MTP diaktifkan, kedalaman 3, pemuatan model hanya-teks, konkurensi satu. Log per generasi mencatat penerimaan draf dan eksekusi per kedalaman untuk pemanasan dan kedua tugas. Pengimpor sidecar hulu mengganti nama 15 tensor; dtype, bentuk, dan bita muatan mereka tetap identik dengan sidecar AXQuant asli. Bobot tulang punggung tidak berubah.
  • Artefak: AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, revisi 4d36d652c21590f6813495351c3baf5fca5b3831. Metadata artefak menyatakan kedalaman MTP 1; kedalaman berulang 3 di sini mengikuti kebijakan runtime yang dipilih/eksperimen eksplisit dan tidak memperluas sertifikasi artefak. Paket model Optimized-Speed tidak dipakai dalam uji ulang ini.
  • Versi OpenCode adalah 1.18.31. Semua backend dan klien berjalan serial. Setiap pasangan klien/backend memulai proses baru dan cache tugas terisolasi, diikuti pemanasan pemuatan model yang tidak terkait dibatasi 64 token keluaran. Pemuatan model dan pemanasan itu dikecualikan dari tabel; tugas pertama tetap membayar prefill dingin. Kendali kipas dibiarkan pada bawaannya, dan berkas tulang punggung berada di penyimpanan SMB.

Yang selaras, dan yang tetap berbeda

Kedua klien menerima instruksi proyek penuh yang sama yang dibekukan, tugas pengguna, dan empat alat yang diizinkan (glob, grep, read, skill). CLI sumber AX Code memakai ID penyedia ax-engine, mtplx, dan omlx yang sebenarnya; AX Engine memakai kontrak lampiran loopback terverifikasinya dengan backend yang dimulai terpisah dan membawa bendera terkelola. Ini tidak mengukur UI unduhan/mulai terkelola. OpenCode memakai jalur penyedia yang kompatibel OpenAI. Konfigurasi proyek dinonaktifkan dan setiap klien memiliki pengaturan/keadaan terisolasi. Prompt klien bawaan, skema alat, dan header sesi tetap utuh; karena itu jumlah token yang dirender dan perilaku cache berbeda.

Proksi perekaman lokal menyelaraskan temperatur 0.55, top-p 1, top-k/min-p 0, penalti pengulangan 1, penalti presence/frequency 0, seed 0, berpikir mati, dan langit-langit keluaran 1,024 token. Ia memaksa tool_choice: none untuk tugas tanpa alat ini. Kedua klien dikonfigurasi untuk konteks 65,536 token. Setiap baris diperiksa untuk cuplikan instruksi lengkap, empat nama alat, sampling umum, satu permintaan, keluar CLI yang berhasil, berhenti alami, dan tanpa eksekusi alat.

Prompt AX Code yang lebih panjang dapat meningkatkan pekerjaan prefill maupun perhatian selama pembuatan. Panjang respons, konten, templat runtime, kernel, dan kebijakan cache yang berbeda mencegah memperlakukan tabel ini sebagai tolok ukur overhead klien dengan token yang sama. MTP yang aktif tidak menjamin 30–40 token/s untuk konteks pengodean penuh. Untuk mengisolasi overhead klien atau efek perbaikan awalan, putar ulang permintaan/ID token terserialisasi yang identik dengan keluaran dan kondisi cache yang terkendali secara terpisah.

Laporan ini tidak mengubah perilaku cloud, GPU privat, penyedia CLI, atau AX Trust. Lihat panduan penyiapan runtime lokal untuk petunjuk koneksi dan data pengukuran yang disanitasi untuk waktu, hitungan, hash, hasil validasi, dan bukti MTP yang persis. Instruksi proyek privat, respons model, jalur lokal, dan header sesi dipertahankan secara lokal dan tidak diterbitkan. Karena itu, beban kerja konteks privat yang lengkap tidak dapat direproduksi secara independen dari laporan publik saja.