Trang này được dịch từ tài liệu tiếng Anh. Lệnh, định danh và ví dụ giữ nguyên. Runtime 7.24.4 · SDK 2.6.7. Bản tiếng Anh
Thực hành tốt khi định tuyến đa mô hình
Trạng thái: Đang hoạt động Phạm vi: công khai, trạng thái hiện tại Xem xét lần cuối: 2026-09-13 Chủ sở hữu: ax-code runtime
Hướng dẫn này ghi cách được khuyến nghị để chạy ax-code với một mô hình suy luận cao cấp và các mô hình phụ rẻ hơn của cùng nhà cung cấp.
Nguyên tắc cốt lõi
Dùng mô hình đắt cho việc dày suy luận, và mô hình rẻ cho việc cơ học hoặc chỉ đọc. Khoản tiết kiệm thật đến từ lọc ngữ cảnh: mô hình cao cấp chỉ thấy ngữ cảnh đã chưng cất do các mô hình rẻ hơn hoặc tác nhân con chuẩn bị.
Phân tầng được khuyến nghị
| Tầng | Lớp mô hình | Tác nhân / nhiệm vụ điển hình |
|---|---|---|
| Người làm / người thực thi | SKU flash đã kết nối khi có (ví dụ DeepSeek Flash) | phiên chưa ghim, build, general, scout, test, devops, perf |
| Cố vấn / suy luận | Mô hình đã kết nối mạnh hơn (ví dụ DeepSeek V4 Pro) | plan, architect, security, debug |
| Phụ rẻ / chỉ đọc | Cùng SKU flash | explore, compaction, tiêu đề, tóm tắt, phân loại độ phức tạp thấp |
Hãy ghim các mã provider/model đã được kết nối. Các mã kế hoạch bên thứ nhất đã tắt
(alibaba-token-plan, deepseek, zai-coding-plan, minimax-coding-plan)
vẫn phân giải theo SKU, nhưng mỗi lần gọi trước hết thử nhà cung cấp đã tắt và
cảnh báo. Qwen 3.8 Max là một lựa chọn tường minh hợp lệ, không phải mặc định sản phẩm hay ví dụ;
không có config.model, mặc định ngầm đi qua các danh mục đã kết nối theo
thứ tự này: deepseek-flash, glm-5.3-flash, qwen3.8-flash, MiniMax-M3, grok-4.6,
claude-sonnet-5, gpt-6, gemini-3.8-flash, qwen3.8-27b.
Mẫu cấu hình
Xem ax-code.json.example ở gốc kho để có một mặc định DeepSeek Flash cụ thể với Pro trên các tác nhân suy luận.
Mô hình phụ của Codex CLI
Khả dụng mô hình Codex phụ thuộc phương thức đăng nhập và máy khách của tài khoản, không
chỉ khả năng văn bản hay công cụ của danh mục. Vì vậy AX Code không suy ra
một mô hình nhỏ codex-cli từ tên hoặc siêu dữ liệu họ. Không có mô hình
small_model tường minh hoặc mô hình tác nhân nén, việc nén dùng mô hình của phiên.
Nếu bạn cấu hình một mô hình phụ, hãy xác minh nó hoạt động với cùng đăng nhập Codex. Một từ chối tường minh của Codex rằng mô hình không được hỗ trợ với tài khoản ChatGPT cho phép nén thử mô hình phiên một lần, bỏ qua các mô hình nhỏ khác. Lần thử bị từ chối vẫn nằm trong lịch sử phiên. Các lỗi xác thực, thanh toán, xác thực dữ liệu, hủy và tràn ngữ cảnh khác giữ cách xử lý hiện có; chốt quyền riêng tư của nhà cung cấp cục bộ vẫn áp dụng.
Với một bản cài cũ bị ảnh hưởng, hãy gỡ ghi đè small_model hoặc
agent.compaction.model không tương thích và ghim tường minh agent.compaction.model
vào một mô hình đã xác minh với tài khoản Codex đó. Chỉ đổi mô hình phiên
đang hiện không ghi đè một mô hình nén được ghim riêng.
Quy tắc tự định tuyến theo loại nhiệm vụ
Đừng tự định tuyến mọi nhiệm vụ giá trị thấp sang mô hình rẻ. Hãy tách chúng theo chi phí khi thất bại:
- An toàn để tự định tuyến (chỉ đọc hoặc con người rà soát được):
- khám phá kho, phân loại grep/tìm kiếm, phân loại tệp
- tóm tắt mã, tóm tắt nhật ký, giải thích mã
- chuẩn bị ngữ cảnh cho mô hình cao cấp
- tài liệu
- Chỉ chọn tham gia (xác minh được bằng cơ học nhưng có thể che thay đổi hành vi):
- mã khuôn, sửa lint
- Không bao giờ tự định tuyến theo mặc định (lỗi im lặng thì đắt):
- kiểm thử đơn vị
- đổi tên/tái cấu trúc
- SQL đơn giản
- lớp bọc API
- CRUD đơn giản
Nhóm cuối nên ở lại mô hình phiên trừ khi người dùng ghim tường minh một mô hình rẻ hơn.
Sổ tay vận hành
- Bắt đầu các nhiệm vụ không tầm thường ở chế độ
planđể cố vấn xác thực thiết kế trước khi người làm viết mã. - Nếu người làm lặp hoặc xác minh thất bại hai lần, hãy chuyển sang
debugvới tín hiệu đang thất bại. - Dùng
councilđể chẩn đoán độc lập khi hai cách sửa đều hợp lý, không phải để kết thúc nhiệm vụ. - Dành việc chuyển mô hình thủ công cho các lượt hiếm, nặng suy luận; hãy chuyển lại sau đó.
Giới hạn đã biết của ax-code
Provider.getSmallModel()trả vềundefinedvới nhà cung cấp mà danh mục không gắn mộtfamilymang tầng cũng không khớp các danh sách ưu tiên cứng; các lần gọi phụ khi đó lùi về mô hình phiên (được ghi là “no small model for provider”).- Không có leo thang giữa chừng từ một người làm bị kẹt sang một mô hình mạnh hơn.