Halaman ini diterjemahkan dari dokumentasi bahasa Inggris. Perintah, pengenal, dan contoh tidak diubah. Runtime 7.24.4 · SDK 2.6.7. Sumber bahasa Inggris
Praktik terbaik perutean multi-model
Status: Aktif Cakupan: publik, keadaan saat ini Terakhir ditinjau: 2026-09-13 Pemilik: ax-code runtime
Panduan ini merangkum cara yang disarankan untuk menjalankan ax-code dengan model penalaran premium dan model tambahan yang lebih murah dari penyedia yang sama.
Prinsip inti
Gunakan model mahal untuk kerja yang padat penalaran, dan model murah untuk kerja mekanis atau hanya-baca. Penghematan nyata datang dari penyaringan konteks: model premium hanya melihat konteks yang sudah disuling, disiapkan oleh model yang lebih murah atau subagen.
Pembagian lapisan yang disarankan
| Lapisan | Kelas model | Agen atau tugas yang umum |
|---|---|---|
| Pekerja / eksekutor | SKU flash terhubung jika tersedia (misalnya DeepSeek Flash) | sesi tanpa pin, build, general, scout, test, devops, perf |
| Penasihat / penalaran | Model terhubung yang lebih kuat (misalnya DeepSeek V4 Pro) | plan, architect, security, debug |
| Tambahan murah / hanya-baca | SKU flash yang sama | explore, compaction, judul, rekap, klasifikasi berkompleksitas rendah |
Sematkan ID provider/model yang terhubung. ID paket pihak pertama yang dinonaktifkan
(alibaba-token-plan, deepseek, zai-coding-plan, minimax-coding-plan)
tetap diselesaikan menurut SKU, tetapi setiap panggilan pertama mencoba penyedia yang dinonaktifkan dan
memperingatkan. Qwen 3.8 Max adalah pilihan eksplisit yang valid, bukan bawaan produk atau contoh;
tanpa config.model, bawaan implisit menelusuri katalog terhubung dalam
urutan ini:
- deepseek-flash
- glm-5.3-flash
- qwen3.8-flash
- MiniMax-M3
- grok-4.6
- claude-sonnet-5
- gpt-6
- gemini-3.8-flash
- qwen3.8-27b
Templat konfigurasi
Lihat ax-code.json.example di akar repositori untuk bawaan DeepSeek Flash yang konkret dengan Pro pada agen penalaran.
Model tambahan Codex CLI
Ketersediaan model Codex bergantung pada metode masuk akun dan klien, bukan
hanya kapabilitas teks atau alat katalog. Karena itu AX Code tidak menyimpulkan
model kecil codex-cli dari nama atau metadata keluarga. Tanpa model
small_model atau agen pemadatan yang eksplisit, pemadatan memakai model sesi.
Jika Anda mengonfigurasi model tambahan, verifikasi bahwa ia bekerja dengan login Codex yang sama. Penolakan Codex yang eksplisit bahwa suatu model tidak didukung dengan akun ChatGPT mengizinkan pemadatan mencoba model sesi sekali, melewati model kecil lain. Percobaan yang ditolak tetap di riwayat sesi. Kegagalan autentikasi, penagihan, validasi, pembatalan, dan luapan konteks lain mempertahankan penanganan yang ada; penjaga privasi penyedia lokal tetap berlaku.
Untuk pemasangan lama yang terpengaruh, hapus penimpaan small_model atau
agent.compaction.model yang tidak kompatibel dan sematkan secara eksplisit agent.compaction.model
ke model yang sudah diverifikasi dengan akun Codex itu. Mengubah hanya model
sesi yang terlihat tidak menimpa model pemadatan yang disematkan secara terpisah.
Aturan perutean otomatis menurut jenis tugas
Jangan merute otomatis semua tugas bernilai rendah ke model murah. Bagi menurut biaya kegagalan:
- Aman untuk dirute otomatis (hanya-baca atau dapat ditinjau manusia):
- penjelajahan repositori, triase grep/pencarian, klasifikasi berkas
- ringkasan kode, ringkasan log, penjelasan kode
- menyiapkan konteks untuk model premium
- dokumentasi
- Hanya ikut serta (dapat diverifikasi secara mekanis tetapi dapat menyembunyikan perubahan perilaku):
- boilerplate, perbaikan lint
- Jangan pernah dirute otomatis secara bawaan (kesalahan diam-diam mahal):
- tes unit
- ganti nama atau refaktor
- SQL sederhana
- pembungkus API
- CRUD sederhana
Kelompok terakhir sebaiknya tetap pada model sesi kecuali pengguna secara eksplisit menyematkan model yang lebih murah.
Manual operasi
- Mulai tugas yang tidak sepele dalam mode
planagar penasihat memvalidasi desain sebelum pekerja menulis kode. - Jika pekerja berputar atau gagal verifikasi dua kali, beralih ke
debugdengan sinyal kegagalan. - Gunakan
counciluntuk diagnosis independen ketika dua perbaikan masuk akal, bukan untuk menyelesaikan tugas. - Simpan pergantian model manual untuk giliran langka yang berat penalaran; kembali sesudahnya.
Batasan ax-code yang diketahui
Provider.getSmallModel()mengembalikanundefineduntuk penyedia yang katalognya tidak menandaifamilypembawa tingkat maupun cocok dengan daftar prioritas yang dikodekan; panggilan tambahan lalu kembali ke model sesi (dicatat sebagai “no small model for provider”).- Tidak ada eskalasi di tengah eksekusi dari pekerja yang macet ke model yang lebih kuat.