Tải AX Code · Miễn phíTài liệu

Trang này được dịch từ tài liệu tiếng Anh. Lệnh, định danh và ví dụ giữ nguyên. Runtime 7.24.4 · SDK 2.6.7. Bản tiếng Anh

Điều khiển suy luận của mô hình hiện tại

Trạng thái: Đang hoạt động

Phạm vi: trạng thái hiện tại

Xem xét lần cuối: 2026-09-14

Chủ sở hữu: ax-code runtime

AX Code chọn các điều khiển suy luận bằng mã mô hình thượng nguồn và giao thức SDK. Các hồ sơ này phủ các tuyến Chat tương thích OpenAI cho đúng các mã bên dưới. Chúng giữ hành vi SDK gốc hiện có, GPU riêng, AX Engine và cổng bị ràng buộc.

Mã mô hình Mức nỗ lực có sẵn Thất bại công cụ tự chủ / lặp lại Yêu cầu phụ
qwen3.8-max, qwen3.8-flash low, medium, xhigh; high là bí danh hiện có của xhigh xhigh Tắt suy nghĩ
glm-5.3 low, high, max; deep là bí danh của max max Nỗ lực low; bật suy nghĩ
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash low, high, max high; xdeep tường minh chọn max Tắt suy nghĩ
MiniMax-M3 Công tắc suy nghĩ / none hiện có; không có mức nỗ lực Mặc định suy nghĩ của nhà cung cấp Tắt suy nghĩ
MiniMax-M2.7 Không có mức nỗ lực hay công tắc tắt Suy nghĩ luôn bật Suy nghĩ luôn bật

Các tùy chọn suy luận của mô hình/tác nhân tường minh và các biến thể đã chọn ghi đè chính sách nỗ lực tự động. Một khai báo khả năng suy luận âm ngăn các biến thể nỗ lực tự động và các điều khiển phụ này. GLM và DeepSeek giữ mặc định của nhà cung cấp khi yêu cầu thông thường không chọn mức nỗ lực. Yêu cầu phụ dùng điều khiển riêng mà không đổi lựa chọn đã lưu của người dùng.

Xung đột tùy chọn Qwen và công cụ bị ép

Qwen 3.8 nhận hoặc reasoning_effort hoặc thinking_budget, không bao giờ cả hai. Một ngân sách suy nghĩ tường minh chặn việc chọn nỗ lực tự động. Khi các tùy chọn đã hợp chứa cả mức nỗ lực và ngân sách, mức nỗ lực thắng. high và max chuẩn hóa thành xhigh, minimal thành low, và none tắt suy nghĩ. Các tuyến kế hoạch Alibaba giữ trần ngân sách token hiện có của chúng, kể cả đường lùi có giới hạn khi không chọn mức nỗ lực. Các ánh xạ này theo API Chat của Alibaba.

Chế độ suy nghĩ của Qwen từ chối các lần gọi công cụ bị ép. Với tool_choice: required, AX Code tắt suy nghĩ cho yêu cầu đó và gỡ các tùy chọn nỗ lực, ngân sách và bảo tồn không tương thích. Các lượt công cụ tự động sau đó tiếp tục mức nỗ lực đã chọn. Cách xử lý công cụ bắt buộc hiện có của DeepSeek cũng giữ suy nghĩ tắt cho yêu cầu đó, như API chế độ suy nghĩ của nó yêu cầu.

Tính liên tục suy luận

Qwen, GLM và DeepSeek phát lại suy luận đã lưu qua reasoning_content. Các yêu cầu Chat MiniMax M2.7/M3 dùng reasoning_split: true để SDK nhận suy luận riêng và có thể phát lại chính xác. Cách này tránh chuyển suy luận của cổng sang định dạng <mm:think> mà các triển khai GPU riêng dùng. reasoning_split: false tường minh giữ phát lại <think> gốc. Chữ ký Anthropic và xử lý thẻ GPU riêng giữ các đường hiện có của chúng. Xem API Chat của MiniMax.

Suy nghĩ được bảo tồn xuyên lượt của GLM vẫn là chọn tham gia qua options.preserveThinking: true của nhà cung cấp trong các yêu cầu tác nhân dài đủ điều kiện. Nó gửi thinking: { type: "enabled", clear_thinking: false }. Chỉ bật khi lịch sử đầy đủ, chưa sửa, từ cùng một mô hình; nó có thể tăng đầu vào bị tính phí. Phát lại lượt công cụ thông thường không cần chọn tham gia này. Z.ai ghi các yêu cầu bảo tồn. GLM 5.3 luôn suy luận, nên yêu cầu phụ dùng nỗ lực thấp thay vì tắt nó. Điều khiển GLM 5.3.

Triển khai tùy chỉnh

Một cổng có thể lộ cùng mã mô hình bằng một phương ngữ tham số khác. Để giữ hành vi biến đổi trước đó cho một mô hình, hãy đặt options.nativeReasoning: false trên cấu hình nhà cung cấp của mô hình đó:

{
  "provider": {
    "my-gateway": {
      "models": {
        "glm-5.3": {
          "options": { "nativeReasoning": false }
        }
      }
    }
  }
}

Đây là chọn không tham gia hồ sơ cục bộ, không phải lệnh tắt suy nghĩ của mô hình. Nó được gỡ trước khi gửi yêu cầu. Các biến thể đã cấu hình tường minh hiện có vẫn là điều khiển của người dùng. SDK DeepSeek gốc không nhận các biến thể nỗ lực từ hồ sơ này vì bộ tuần tự hóa đã cài của nó không hỗ trợ chúng.

Việc API chấp nhận, tiếp tục công cụ và phát lại máy khách chính xác là bằng chứng tương thích. Chúng không chứng minh thượng nguồn tôn trọng mọi gợi ý nỗ lực, bộ nhớ đệm trúng thường hơn, hay chất lượng hoặc tốc độ lập trình được cải thiện. Hãy dùng đánh giá harness đi cặp cho các so sánh ở mức nhiệm vụ.