Halaman ini diterjemahkan dari dokumentasi bahasa Inggris. Perintah, pengenal, dan contoh tidak diubah. Runtime 7.24.5 · SDK 2.6.9. Sumber bahasa Inggris
Pengukuran prefill dan decode bawaan Tiel Coder
Status: Cuplikan lokal historis Terakhir ditinjau: 2026-09-21 Pemilik: pengelola AX Code Tanggal: 2026-09-19 Cakupan: dua paket Tiel pilihan AX Code, AX Engine versus MTPLX, Apple M3 Max 128 GiB
Digantikan untuk peringkat. Kampanye API bawaan empat mesin 20 September 2026 adalah perbandingan Tiel versus MTPLX saat ini, termasuk penyelesaian M5 Max 194.88 tok/s untuk paket bawaan dan puncak decode Cyber-Tiel 249.01 tok/s. Lihat ringkasan rekan Tiel. Simpan halaman ini sebagai cuplikan fase M3 Max 19 September (mesin diidentifikasi sebagai 7.4.0; median dari tiga). Jangan mencampur tabel.
Hasil ini mempertahankan garis dasar profil asli agentic. Perbandingan profil MTP Tiel
berikutnya mengukur profil auto
yang kini dipilih AX Code, termasuk pertukaran yang bergantung pada beban kerja.
Paket Tiel baru berjalan dengan MTP aktif pada kedua runtime yang diuji. Build sumber AX Engine mencapai 47.36–58.53 token decode/s di empat kasus; MTPLX mencapai 92.13–96.26. Prefill kira-kira 1,190–1,446 token/s. Ini pengukuran fase inferensi bawaan pada Apple M3 Max dengan 128 GiB, bukan throughput pengodean ujung-ke-ujung AX Code atau OpenCode.
Syarat build: AX Engine Homebrew 7.4.0 yang terpasang gagal memulai Tiel dengan Engine(MlxMtpRequiredButUnavailable). Hasil AX Engine di bawah memakai build lokal yang dioptimalkan dari komit 51137c71a6794964d52c32c95e275c0923ed8d0b, yang menambahkan perbaikan pemuat namespace MTP Tiel. Build itu tetap mengidentifikasi dirinya sebagai 7.4.0. Hasilnya tidak menetapkan dukungan pada biner Homebrew yang ada atau rilis yang diterbitkan. MTP tetap diwajibkan; tidak ada jalankan cadangan dengan MTP dinonaktifkan yang disertakan.
Hasil
Setiap nilai adalah median dari tiga percobaan. Semua percobaan menghasilkan tepat 256 token dan melaporkan nol token masukan ter-cache. Prefill dan decode sama-sama memakai token per detik.
| Model | Token masukan | Prefill AX Engine | Decode AX Engine | Prefill MTPLX | Decode MTPLX |
|---|---|---|---|---|---|
| Tiel Coder, pendek | 458 | 1,255.61 | 57.03 | 1,207.01 | 92.27 |
| Tiel Coder, konteks | 3,182 | 1,424.24 | 55.25 | 1,279.48 | 96.26 |
| Cyber-Tiel Coder, pendek | 483 | 1,226.86 | 58.53 | 1,189.60 | 95.09 |
| Cyber-Tiel Coder, konteks | 3,207 | 1,446.19 | 47.36 | 1,427.62 | 92.13 |
Perbedaan decode ada pada permintaan runtime langsung dengan masukan yang dipasangkan, sebelum putaran agen AX Code. Perbandingan lokal ini dengan demikian menempatkan perbedaan tingkat runtime; ia tidak mengidentifikasi satu kernel atau kebijakan sebagai penyebab. Prefill jauh lebih dekat di antara konfigurasi ini. Tidak ada kontrol dengan MTP dinonaktifkan yang dijalankan, jadi ini bukan pengukuran percepatan MTP.
Masukan yang disanitasi, semua 24 tanda terima percobaan, penghitung fase, revisi model, dan hasil penerimaan klien menyertai laporan ini.
Artefak dan lingkungan yang persis
| Model | Repositori Hugging Face | Revisi |
|---|---|---|
| Tiel Coder, bawaan AX Code | paket AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP | 5ab39b24bfd7f65203be9b7823b1840486f58b6d |
| varian Cyber-Tiel Coder | paket AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP | fe05e871ec69ad9ae8eac01fd285555514ac7daf |
- Sumber AX Code:
205cb556b; pemilihan memakaimlxdan bobot MXFP4 penerbit. - Host: Apple M3 Max, 137,438,953,472 bita memori; macOS 27.0, build
26A428. - AX Engine: build profil rilis dari
51137c71a6794964d52c32c95e275c0923ed8d0b, MLX 0.32.2. SHA-256 server:1fbe7fc50ea16448f98350616273214c0475bffb3ef509fceb3f8849163e97f5. - MTPLX: 2.11.3, MLX 0.32.2, lingkungan Python 3.12.
- Kedua runtime membaca cuplikan Hugging Face bersama yang sama dari setiap model. Unduhan model, pemuatan bobot, dan mulai server dikecualikan dari waktu fase.
Paket ini adalah kuantisasi ulang pengembangan. Uji ini tidak mensertifikasi kualitas model, paritas numerik, perilaku konteks panjang, perangkat keras lain, atau kinerja rilis mendatang. Mereka tidak menggantikan matriks klien nyata Qwen3.8 historis, yang memakai model berbeda dan mengukur batas yang berbeda.
Metode pengukuran
Prompt meminta cache LRU TypeScript generik dan uji, didahului 8 atau 96 fungsi TypeScript sintetis. Pesan disimpan dalam tanda terima JSON. Tokenizer yang disematkan setiap model merender templat obrolan resminya dengan enable_thinking=false dan add_generation_prompt=true. Token bilangan bulat yang dihasilkan dikirim tanpa diubah ke kedua backend. Keluaran /tokenize AX Engine juga diperiksa terhadap ID itu. Templat Cyber-Tiel menambahkan teks identitas, yang menjelaskan 25 token tambahannya; masukan lintas backend cocok di dalam setiap model.
Permintaan memakai temperatur 0.55, top-p 1, top-k 0, seed 0, dan batas 256 token. Setiap backend menerima pemanasan 64 token yang eksplisit sebelum percobaan terukur. MTPLX juga melakukan pemanasan mulai/latar belakang normalnya. Pemanasan tidak dihitung sebagai percobaan. Urutan jalankan adalah MTPLX/Tiel, AX Engine/Tiel, MTPLX/Cyber-Tiel, AX Engine/Cyber-Tiel. Hanya satu backend inferensi yang aktif pada satu waktu; kompilasi selesai sebelum percobaan terukur dimulai. Sampel urutan tetap yang kecil ini bukan studi ketahanan atau termal yang diseimbangkan.
AX Engine memakai /v1/generate bawaan dengan input_tokens dan max_output_tokens. MTPLX memakai /v1/completions yang dialirkan dengan prompt larik bilangan bulat, diikuti /metrics. Ini menghindari perbedaan perakitan prompt klien dan perenderan templat obrolan di antara kedua server. Keluaran yang dibatasi adalah beban throughput, bukan uji kebenaran kode yang lengkap.
| Pengukuran | AX Engine | MTPLX |
|---|---|---|
| Durasi prefill | ax_mlx_prefill_wall_us / 1e6 |
prompt_eval_time_s |
| Laju prefill | Token masukan tidak ter-cache / durasi prefill | prefill_compute_tok_s, diaudit terhadap new_prefill_tokens / prompt_eval_time_s |
| Durasi decode | ax_mlx_decode_wall_us / 1e6 |
decode_elapsed_s |
| Laju decode | (output_tokens - 1) / decode duration; keluaran pertama milik prefill |
decode_tok_s, diaudit terhadap completion_tokens / decode_elapsed_s |
| Bukti cache | Cache awalan dinonaktifkan dengan AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0; nol token yang dipakai ulang |
Cache sesi SSD mati; nol token ter-cache pada setiap penyelesaian |
| Bukti MTP | Kebijakan wajib, drafter model aktif, token diterima positif, nol langkah cadangan langsung yang dilaporkan | generation_mode=mtp, kedalaman 3, penghitung draf dan penerimaan positif |
Penghitung decode bawaan memiliki batas token pertama yang sedikit berbeda; mereka dilaporkan dengan rumus aktualnya alih-alih dilabeli ulang sebagai pewaktu yang identik. Tidak satu pun laju membagi keluaran dengan durasi permintaan HTTP total. TTFT bawaan MTPLX dipertahankan dalam JSON; probe non-aliran AX Engine tidak mengukur TTFT transport.
Konfigurasi runtime
AX Engine memakai profil spekulasi generik agentic, konteks 32,768 token, anggaran keluaran yang diiklankan 8,192 token, lebar penjadwal 2,048, dan satu permintaan bersamaan. Penimpaan lingkungan AX Code yang khusus untuk Qwen3.8 padat tidak diterapkan. Kedalaman MTP yang diterima adalah 3; gerbang draf normal mesin tetap aktif.
Argumen peluncuran yang setara, dengan SNAPSHOT disetel ke cuplikan yang disematkan yang sesuai dan MODEL ke alias AX Code-nya:
AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0 /path/to/fixed/ax-engine-server \
--host 127.0.0.1 --port 18439 --model-id "$MODEL" \
--mlx --mlx-model-artifacts-dir "$SNAPSHOT" \
--mlx-mtp-policy required --speculation-profile agentic \
--mlx-mtp-disable-ngram-stacking --max-concurrent-requests 1 \
--max-batch-tokens 2048 --max-output-tokens 8192 \
--block-size-tokens 16 --total-blocks 2048
mtplx serve --model "$SNAPSHOT" --model-id "$MODEL" \
--host 127.0.0.1 --port 18442 --no-auth --agent-rewrites off \
--max-tokens 8192 --context-window 32768 --reasoning off \
--no-stats-footer --ssd-session-cache off --warmup-tokens 64 \
--strict-warmup --fan-mode default --generation-mode mtp --load-mtp --depth 3
MTPLX memakai konfigurasi terisolasi yang kosong. Manifes model AX Engine disiapkan dengan pengunduh lokal-saja yang disematkan; bobot model dan tensor MTP penerbit dipertahankan. Tidak satu pun konfigurasi menonaktifkan MTP untuk memperoleh hasil.
Penerimaan alat AX Code
Jalankan sumber AX Code terpisah meminta setiap model membaca probe.txt dengan alat baca dan hanya mengembalikan isinya. Keadaan dan konfigurasi diisolasi. AX Engine memakai lampiran loopback eksplisit ke server sumber yang diuji. Jalankan ini dikecualikan dari tabel fase bawaan.
| Model | Runtime | Bacaan selesai | Penanda benar di jawaban akhir | Format hanya-keluaran yang persis |
|---|---|---|---|---|
| Tiel | sumber AX Engine | Ya | Ya | Tidak; menambahkan prosa dan pagar kode |
| Tiel | MTPLX | Ya | Ya | Ya |
| Cyber-Tiel | sumber AX Engine | Ya | Ya | Tidak; menambahkan prosa dan pagar kode |
| Cyber-Tiel | MTPLX | Ya | Ya | Ya |
Keempat proses klien keluar dengan sukses dan menyelesaikan panggilan baca yang nyata. Dua jalankan AX Engine gagal pada syarat format keluaran yang lebih ketat, jadi ini bukan sertifikasi perilaku atau kualitas pengodean yang seluruhnya hijau. Prompt, muatan alat, sampling bawaan, dan penanganan obrolan mereka adalah jalur klien/runtime, berbeda dari tolok ukur fase token yang dipasangkan. Tidak ada perilaku cloud, CLI, GPU privat, atau AX Trust yang disesuaikan untuk uji ini.
Pemanggilan terkelola terpisah providers ax-engine start menghilangkan argumen model dan memilih tiel-coder-35b-axq-mxfp4 pada revisi yang disematkan dengan mlx. Status langsungnya melaporkan dukungan alat, kebijakan MTP wajib/wajib, MTP aktif, 27 token yang didraf, dan 23 token yang diterima. Server terkelola kemudian dihentikan dengan sukses. Ini memakai keadaan AX Code terisolasi dan penimpaan AX_ENGINE_SERVER=/absolute/path/to/fixed/ax-engine-server pembantu yang ada; biner terpasang pengguna dan konfigurasi penyedia tidak diganti. Penimpaan yang sama dapat disetel saat memulai pnpm run dev dengan build yang berisi perbaikan pemuat.
Perubahan katalog lulus 11,374 uji deterministik, dengan 17 yang dilewati, plus 208 uji SDK, 259 uji skrip (94 dilewati), pemeriksaan tipe rekursif, pemeriksaan struktur repositori, dan pemeriksaan TUI. Lihat pemilihan model dan syarat runtime sebelum memakai bawaan baru.