Dapatkan AX Code · GratisDokumentasi

Halaman ini diterjemahkan dari dokumentasi bahasa Inggris. Perintah, pengenal, dan contoh tidak diubah. Runtime 7.24.5 · SDK 2.6.9. Sumber bahasa Inggris

Pengukuran prefill dan decode bawaan Tiel Coder

Status: Cuplikan lokal historis Terakhir ditinjau: 2026-09-21 Pemilik: pengelola AX Code Tanggal: 2026-09-19 Cakupan: dua paket Tiel pilihan AX Code, AX Engine versus MTPLX, Apple M3 Max 128 GiB

Digantikan untuk peringkat. Kampanye API bawaan empat mesin 20 September 2026 adalah perbandingan Tiel versus MTPLX saat ini, termasuk penyelesaian M5 Max 194.88 tok/s untuk paket bawaan dan puncak decode Cyber-Tiel 249.01 tok/s. Lihat ringkasan rekan Tiel. Simpan halaman ini sebagai cuplikan fase M3 Max 19 September (mesin diidentifikasi sebagai 7.4.0; median dari tiga). Jangan mencampur tabel.

Hasil ini mempertahankan garis dasar profil asli agentic. Perbandingan profil MTP Tiel berikutnya mengukur profil auto yang kini dipilih AX Code, termasuk pertukaran yang bergantung pada beban kerja.

Paket Tiel baru berjalan dengan MTP aktif pada kedua runtime yang diuji. Build sumber AX Engine mencapai 47.36–58.53 token decode/s di empat kasus; MTPLX mencapai 92.13–96.26. Prefill kira-kira 1,190–1,446 token/s. Ini pengukuran fase inferensi bawaan pada Apple M3 Max dengan 128 GiB, bukan throughput pengodean ujung-ke-ujung AX Code atau OpenCode.

Syarat build: AX Engine Homebrew 7.4.0 yang terpasang gagal memulai Tiel dengan Engine(MlxMtpRequiredButUnavailable). Hasil AX Engine di bawah memakai build lokal yang dioptimalkan dari komit 51137c71a6794964d52c32c95e275c0923ed8d0b, yang menambahkan perbaikan pemuat namespace MTP Tiel. Build itu tetap mengidentifikasi dirinya sebagai 7.4.0. Hasilnya tidak menetapkan dukungan pada biner Homebrew yang ada atau rilis yang diterbitkan. MTP tetap diwajibkan; tidak ada jalankan cadangan dengan MTP dinonaktifkan yang disertakan.

Hasil

Setiap nilai adalah median dari tiga percobaan. Semua percobaan menghasilkan tepat 256 token dan melaporkan nol token masukan ter-cache. Prefill dan decode sama-sama memakai token per detik.

Model Token masukan Prefill AX Engine Decode AX Engine Prefill MTPLX Decode MTPLX
Tiel Coder, pendek 458 1,255.61 57.03 1,207.01 92.27
Tiel Coder, konteks 3,182 1,424.24 55.25 1,279.48 96.26
Cyber-Tiel Coder, pendek 483 1,226.86 58.53 1,189.60 95.09
Cyber-Tiel Coder, konteks 3,207 1,446.19 47.36 1,427.62 92.13

Perbedaan decode ada pada permintaan runtime langsung dengan masukan yang dipasangkan, sebelum putaran agen AX Code. Perbandingan lokal ini dengan demikian menempatkan perbedaan tingkat runtime; ia tidak mengidentifikasi satu kernel atau kebijakan sebagai penyebab. Prefill jauh lebih dekat di antara konfigurasi ini. Tidak ada kontrol dengan MTP dinonaktifkan yang dijalankan, jadi ini bukan pengukuran percepatan MTP.

Masukan yang disanitasi, semua 24 tanda terima percobaan, penghitung fase, revisi model, dan hasil penerimaan klien menyertai laporan ini.

Artefak dan lingkungan yang persis

Model Repositori Hugging Face Revisi
Tiel Coder, bawaan AX Code paket AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP 5ab39b24bfd7f65203be9b7823b1840486f58b6d
varian Cyber-Tiel Coder paket AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP fe05e871ec69ad9ae8eac01fd285555514ac7daf
  • Sumber AX Code: 205cb556b; pemilihan memakai mlx dan bobot MXFP4 penerbit.
  • Host: Apple M3 Max, 137,438,953,472 bita memori; macOS 27.0, build 26A428.
  • AX Engine: build profil rilis dari 51137c71a6794964d52c32c95e275c0923ed8d0b, MLX 0.32.2. SHA-256 server: 1fbe7fc50ea16448f98350616273214c0475bffb3ef509fceb3f8849163e97f5.
  • MTPLX: 2.11.3, MLX 0.32.2, lingkungan Python 3.12.
  • Kedua runtime membaca cuplikan Hugging Face bersama yang sama dari setiap model. Unduhan model, pemuatan bobot, dan mulai server dikecualikan dari waktu fase.

Paket ini adalah kuantisasi ulang pengembangan. Uji ini tidak mensertifikasi kualitas model, paritas numerik, perilaku konteks panjang, perangkat keras lain, atau kinerja rilis mendatang. Mereka tidak menggantikan matriks klien nyata Qwen3.8 historis, yang memakai model berbeda dan mengukur batas yang berbeda.

Metode pengukuran

Prompt meminta cache LRU TypeScript generik dan uji, didahului 8 atau 96 fungsi TypeScript sintetis. Pesan disimpan dalam tanda terima JSON. Tokenizer yang disematkan setiap model merender templat obrolan resminya dengan enable_thinking=false dan add_generation_prompt=true. Token bilangan bulat yang dihasilkan dikirim tanpa diubah ke kedua backend. Keluaran /tokenize AX Engine juga diperiksa terhadap ID itu. Templat Cyber-Tiel menambahkan teks identitas, yang menjelaskan 25 token tambahannya; masukan lintas backend cocok di dalam setiap model.

Permintaan memakai temperatur 0.55, top-p 1, top-k 0, seed 0, dan batas 256 token. Setiap backend menerima pemanasan 64 token yang eksplisit sebelum percobaan terukur. MTPLX juga melakukan pemanasan mulai/latar belakang normalnya. Pemanasan tidak dihitung sebagai percobaan. Urutan jalankan adalah MTPLX/Tiel, AX Engine/Tiel, MTPLX/Cyber-Tiel, AX Engine/Cyber-Tiel. Hanya satu backend inferensi yang aktif pada satu waktu; kompilasi selesai sebelum percobaan terukur dimulai. Sampel urutan tetap yang kecil ini bukan studi ketahanan atau termal yang diseimbangkan.

AX Engine memakai /v1/generate bawaan dengan input_tokens dan max_output_tokens. MTPLX memakai /v1/completions yang dialirkan dengan prompt larik bilangan bulat, diikuti /metrics. Ini menghindari perbedaan perakitan prompt klien dan perenderan templat obrolan di antara kedua server. Keluaran yang dibatasi adalah beban throughput, bukan uji kebenaran kode yang lengkap.

Pengukuran AX Engine MTPLX
Durasi prefill ax_mlx_prefill_wall_us / 1e6 prompt_eval_time_s
Laju prefill Token masukan tidak ter-cache / durasi prefill prefill_compute_tok_s, diaudit terhadap new_prefill_tokens / prompt_eval_time_s
Durasi decode ax_mlx_decode_wall_us / 1e6 decode_elapsed_s
Laju decode (output_tokens - 1) / decode duration; keluaran pertama milik prefill decode_tok_s, diaudit terhadap completion_tokens / decode_elapsed_s
Bukti cache Cache awalan dinonaktifkan dengan AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0; nol token yang dipakai ulang Cache sesi SSD mati; nol token ter-cache pada setiap penyelesaian
Bukti MTP Kebijakan wajib, drafter model aktif, token diterima positif, nol langkah cadangan langsung yang dilaporkan generation_mode=mtp, kedalaman 3, penghitung draf dan penerimaan positif

Penghitung decode bawaan memiliki batas token pertama yang sedikit berbeda; mereka dilaporkan dengan rumus aktualnya alih-alih dilabeli ulang sebagai pewaktu yang identik. Tidak satu pun laju membagi keluaran dengan durasi permintaan HTTP total. TTFT bawaan MTPLX dipertahankan dalam JSON; probe non-aliran AX Engine tidak mengukur TTFT transport.

Konfigurasi runtime

AX Engine memakai profil spekulasi generik agentic, konteks 32,768 token, anggaran keluaran yang diiklankan 8,192 token, lebar penjadwal 2,048, dan satu permintaan bersamaan. Penimpaan lingkungan AX Code yang khusus untuk Qwen3.8 padat tidak diterapkan. Kedalaman MTP yang diterima adalah 3; gerbang draf normal mesin tetap aktif.

Argumen peluncuran yang setara, dengan SNAPSHOT disetel ke cuplikan yang disematkan yang sesuai dan MODEL ke alias AX Code-nya:

AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0 /path/to/fixed/ax-engine-server \
  --host 127.0.0.1 --port 18439 --model-id "$MODEL" \
  --mlx --mlx-model-artifacts-dir "$SNAPSHOT" \
  --mlx-mtp-policy required --speculation-profile agentic \
  --mlx-mtp-disable-ngram-stacking --max-concurrent-requests 1 \
  --max-batch-tokens 2048 --max-output-tokens 8192 \
  --block-size-tokens 16 --total-blocks 2048

mtplx serve --model "$SNAPSHOT" --model-id "$MODEL" \
  --host 127.0.0.1 --port 18442 --no-auth --agent-rewrites off \
  --max-tokens 8192 --context-window 32768 --reasoning off \
  --no-stats-footer --ssd-session-cache off --warmup-tokens 64 \
  --strict-warmup --fan-mode default --generation-mode mtp --load-mtp --depth 3

MTPLX memakai konfigurasi terisolasi yang kosong. Manifes model AX Engine disiapkan dengan pengunduh lokal-saja yang disematkan; bobot model dan tensor MTP penerbit dipertahankan. Tidak satu pun konfigurasi menonaktifkan MTP untuk memperoleh hasil.

Penerimaan alat AX Code

Jalankan sumber AX Code terpisah meminta setiap model membaca probe.txt dengan alat baca dan hanya mengembalikan isinya. Keadaan dan konfigurasi diisolasi. AX Engine memakai lampiran loopback eksplisit ke server sumber yang diuji. Jalankan ini dikecualikan dari tabel fase bawaan.

Model Runtime Bacaan selesai Penanda benar di jawaban akhir Format hanya-keluaran yang persis
Tiel sumber AX Engine Ya Ya Tidak; menambahkan prosa dan pagar kode
Tiel MTPLX Ya Ya Ya
Cyber-Tiel sumber AX Engine Ya Ya Tidak; menambahkan prosa dan pagar kode
Cyber-Tiel MTPLX Ya Ya Ya

Keempat proses klien keluar dengan sukses dan menyelesaikan panggilan baca yang nyata. Dua jalankan AX Engine gagal pada syarat format keluaran yang lebih ketat, jadi ini bukan sertifikasi perilaku atau kualitas pengodean yang seluruhnya hijau. Prompt, muatan alat, sampling bawaan, dan penanganan obrolan mereka adalah jalur klien/runtime, berbeda dari tolok ukur fase token yang dipasangkan. Tidak ada perilaku cloud, CLI, GPU privat, atau AX Trust yang disesuaikan untuk uji ini.

Pemanggilan terkelola terpisah providers ax-engine start menghilangkan argumen model dan memilih tiel-coder-35b-axq-mxfp4 pada revisi yang disematkan dengan mlx. Status langsungnya melaporkan dukungan alat, kebijakan MTP wajib/wajib, MTP aktif, 27 token yang didraf, dan 23 token yang diterima. Server terkelola kemudian dihentikan dengan sukses. Ini memakai keadaan AX Code terisolasi dan penimpaan AX_ENGINE_SERVER=/absolute/path/to/fixed/ax-engine-server pembantu yang ada; biner terpasang pengguna dan konfigurasi penyedia tidak diganti. Penimpaan yang sama dapat disetel saat memulai pnpm run dev dengan build yang berisi perbaikan pemuat.

Perubahan katalog lulus 11,374 uji deterministik, dengan 17 yang dilewati, plus 208 uji SDK, 259 uji skrip (94 dilewati), pemeriksaan tipe rekursif, pemeriksaan struktur repositori, dan pemeriksaan TUI. Lihat pemilihan model dan syarat runtime sebelum memakai bawaan baru.