Halaman ini diterjemahkan dari dokumentasi bahasa Inggris. Perintah, pengenal, dan contoh tidak diubah. Runtime 7.24.4 · SDK 2.6.7. Sumber bahasa Inggris
Kontrol penalaran model saat ini
Status: Aktif
Cakupan: keadaan saat ini
Terakhir ditinjau: 2026-09-14
Pemilik: ax-code runtime
AX Code memilih kontrol penalaran berdasarkan ID model hulu dan protokol SDK. Profil ini mencakup rute Chat yang kompatibel dengan OpenAI untuk ID persis di bawah. Profil tersebut mempertahankan perilaku SDK native yang sudah ada, GPU privat, AX Engine, dan gateway yang dibatasi.
| ID model | Upaya yang tersedia | Kegagalan alat otonom / berulang | Permintaan tambahan |
|---|---|---|---|
qwen3.8-max, qwen3.8-flash |
low, medium, xhigh; high adalah alias yang sudah ada untuk xhigh | xhigh | Penalaran dinonaktifkan |
glm-5.3 |
low, high, max; deep adalah alias dari max | max | Upaya rendah; penalaran diaktifkan |
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash |
low, high, max | high; xdeep eksplisit memilih max | Penalaran dinonaktifkan |
MiniMax-M3 |
Sakelar thinking / none yang sudah ada; tanpa tingkat upaya | Bawaan penalaran penyedia | Penalaran dinonaktifkan |
MiniMax-M2.7 |
Tanpa sakelar upaya atau penonaktifan | Penalaran selalu aktif | Penalaran selalu aktif |
Opsi penalaran model atau agen yang eksplisit serta varian yang dipilih menimpa kebijakan upaya otomatis. Deklarasi kapabilitas penalaran negatif mencegah varian upaya otomatis dan kontrol tambahan ini. GLM dan DeepSeek mempertahankan bawaan penyedia ketika permintaan biasa tidak memilih tingkat upaya. Permintaan tambahan memakai kontrolnya sendiri tanpa mengubah pilihan tersimpan pengguna.
Konflik opsi Qwen dan alat yang dipaksa
Qwen 3.8 menerima reasoning_effort atau thinking_budget, tidak pernah keduanya. Anggaran penalaran yang eksplisit menekan pemilihan upaya otomatis. Jika opsi yang digabung berisi upaya dan anggaran sekaligus, upaya yang menang. high dan max dinormalisasi menjadi xhigh, minimal menjadi low, dan none menonaktifkan penalaran. Rute paket Alibaba mempertahankan batas anggaran token yang sudah ada, termasuk cadangan yang dibatasi ketika tidak ada upaya yang dipilih. Pemetaan ini mengikuti API Chat Alibaba.
Mode penalaran Qwen menolak panggilan alat yang dipaksa. Untuk tool_choice: required, AX Code menonaktifkan penalaran pada permintaan itu dan menghapus opsi upaya, anggaran, serta pelestarian yang tidak kompatibel. Giliran alat otomatis berikutnya melanjutkan upaya yang dipilih. Penanganan alat wajib DeepSeek yang sudah ada juga tetap menonaktifkan penalaran untuk permintaan itu, sesuai ketentuan API mode penalaran.
Kesinambungan penalaran
Qwen, GLM, dan DeepSeek memutar ulang penalaran tersimpan melalui reasoning_content. Permintaan Chat MiniMax M2.7/M3 memakai reasoning_split: true agar SDK menerima penalaran secara terpisah dan dapat memutarnya ulang secara persis. Ini menghindari pengubahan penalaran gateway ke format <mm:think> yang dipakai penerapan GPU privat. reasoning_split: false yang eksplisit mempertahankan pemutaran ulang native <think>. Tanda tangan Anthropic dan penanganan tag GPU privat tetap pada jalur yang sudah ada. Lihat API Chat MiniMax.
Penalaran tersimpan lintas giliran GLM tetap bersifat ikut serta melalui penyedia options.preserveThinking: true selama permintaan agen panjang yang memenuhi syarat. Ia mengirim thinking: { type: "enabled", clear_thinking: false }. Aktifkan hanya untuk riwayat yang utuh dan tidak diubah dari model yang sama; ini dapat menambah masukan yang ditagih. Pemutaran ulang giliran alat biasa tidak memerlukan keikutsertaan ini. Z.ai mendokumentasikan syarat pelestarian. GLM 5.3 selalu bernalar, jadi permintaan tambahan memakai upaya rendah alih-alih menonaktifkannya. Kontrol GLM 5.3.
Penerapan khusus
Gateway dapat mengekspos ID model yang sama dengan dialek parameter yang berbeda. Untuk mempertahankan perilaku transformasi sebelumnya pada suatu model, atur options.nativeReasoning: false pada konfigurasi penyedia model itu:
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
Ini adalah penolakan profil lokal, bukan perintah untuk menonaktifkan penalaran model. Nilai itu dihapus sebelum permintaan dikirim. Varian yang dikonfigurasi secara eksplisit tetap menjadi kontrol pengguna. SDK native DeepSeek tidak memperoleh varian upaya dari profil ini karena serializer yang terpasang tidak mendukungnya.
Penerimaan API, kelanjutan alat, dan pemutaran ulang klien yang persis adalah bukti kompatibilitas. Hal itu tidak membuktikan bahwa hulu menghormati setiap petunjuk upaya, bahwa cache lebih sering mengenai, atau bahwa kualitas maupun kecepatan pengodean meningkat. Gunakan evaluasi harness yang berpasangan untuk perbandingan di tingkat tugas.