Tải AX Code · Miễn phíTài liệu

Trang này được dịch từ tài liệu tiếng Anh. Lệnh, định danh và ví dụ giữ nguyên. Runtime 7.24.4 · SDK 2.6.7. Bản tiếng Anh

Kiểm thử lại máy khách AX Code và OpenCode: 19 September 2026

Trạng thái: Đang hoạt động

Phạm vi: ảnh chụp chẩn đoán đã đo

Xem xét lần cuối: 2026-09-19

Chủ sở hữu: môi trường chạy ax-code

Lần kiểm thử lại này dùng nguồn AX Code 62895cf40a39e0ebd4afec0afa21044e9871aa0b, sau bản sửa tiền tố cục bộ (42908b46a) và các bổ sung nhà cung cấp MTPLX/oMLX. Cả sáu tổ hợp máy khách/backend dùng cùng tạo tác Qwen3.8 27B AXQ 6-bit với MTP đã bật trên Apple M3 Max, 128 GiB. Các phép đo trước đó vẫn là bằng chứng lịch sử; gói mô hình, lời nhắc, giới hạn token và điều kiện bộ nhớ đệm của chúng khác nhau. Đây không phải ước lượng trước/sau có kiểm soát về mức tăng tốc của bản sửa tiền tố.

Tốc độ đầu ra đã giao

Mỗi ô là tác vụ đầu / tác vụ lặp, tính bằng token/giây. Đây là các quan sát đơn, không phải trung vị. Tác vụ lặp khởi động một phiên CLI mới đối với cùng tiến trình backend; không giả định nó trúng bộ nhớ đệm. Việc nạp và chờ đầu ra đầu bị loại khỏi tốc độ này.

Máy khách AX Engine MTPLX oMLX
AX Code 11.73 / 13.60 18.73 / 19.69 17.48 / 16.60
OpenCode 22.49 / 18.98 27.91 / 26.35 20.33 / 20.64

Ước lượng là (completion tokens - 1) / (last output payload time - first output payload time). Giải mã suy đoán có thể phát nhiều token trong một tải, nên đây là ước lượng giao hàng của máy khách, không phải bộ đếm decode gốc của backend. Nó cũng không đo thông lượng của cả yêu cầu.

Thời điểm yêu cầu, khối lượng và nghiệm thu

NR nghĩa là máy chủ không báo mức dùng token đệm; nó không khẳng định bằng không. Thời gian tải đầu bắt đầu khi proxy ghi cục bộ nhận yêu cầu mô hình. Thời gian tường CLI cũng gồm khởi động máy khách và hoàn tất. Tác vụ yêu cầu một bộ nhớ đệm LRU TypeScript chung, độc lập, với get, set, delete và clear, không thực thi công cụ hay sửa tệp.

Backend Máy khách Tác vụ Token đầu vào Token đầu ra Token đệm Tải đầu (giây) Thời gian tường CLI (giây) Kiểm tra mã
AX Engine AX Code Đầu 29,896 268 NR 197.78 231.58 Đạt
AX Engine AX Code Lặp 29,896 268 29696 7.22 33.34 Đạt
AX Engine OpenCode Đầu 17,316 216 NR 100.86 112.83 Đạt
AX Engine OpenCode Lặp 17,316 228 NR 116.03 129.90 Đạt
MTPLX AX Code Đầu 36,708 285 0 246.67 269.43 Đạt
MTPLX AX Code Lặp 36,708 285 36708 0.04 20.48 Đạt
MTPLX OpenCode Đầu 18,729 276 0 108.67 121.00 Đạt
MTPLX OpenCode Lặp 18,729 276 18729 0.08 12.77 Đạt
oMLX AX Code Đầu 33,124 275 0 212.25 235.62 Đạt
oMLX AX Code Lặp 33,124 232 32768 4.41 23.34 Đạt
oMLX OpenCode Đầu 17,316 213 0 118.03 130.88 Đạt
oMLX OpenCode Lặp 17,316 261 16384 7.73 22.91 Đạt

Kiểm tra nghiệm thu mã gồm khóa thiếu, tra giá trị, loại LRU, mục được giữ, cập nhật độ mới, xóa khóa đang có và khóa vắng, xóa sạch, danh tính khóa đối tượng và giá trị giả. Các tệp đã sinh cũng nhận kiểm tra TypeScript chặt. Các kiểm tra có giới hạn này không thiết lập chất lượng lập trình rộng. Mọi hàng đo giữ đầu ra đã sinh và kết quả xác thực của chúng; các lần thất bại không bị âm thầm thay bằng lần thử lại nhanh hơn.

Điều kiện MTP và môi trường chạy

  • AX Engine 7.4.0: --mlx-mtp-policy required, cờ môi trường chạy cục bộ được quản lý, tăng tốc n-gram và xếp chồng n-gram bị tắt. Chỉ số tiến trình trực tiếp hiện ax_engine_mlx_mtp_model_policy_active=1 với bộ đếm token nháp và được chấp nhận khác không. Ảnh chụp AX Code theo sau làm nóng; ảnh chụp OpenCode theo sau tác vụ đầu. Cả hai gồm làm nóng và không phải tổng nghiệm thu theo tác vụ. Số nháp AX Code theo tác vụ không được giữ.
  • MTPLX 2.11.3 / MLX 0.32.2: --generation-mode mtp --depth 3 tường minh; sức khỏe trực tiếp báo generation_mode: mtp và runtime_mode: Sustained MTP. Viết lại tác nhân và bộ nhớ đệm phiên SSD tắt; ngân hàng phiên trong bộ nhớ gốc vẫn bật. Làm nóng khởi động/nhân gốc được giữ và bị loại khỏi thời gian. Lần làm nóng tải không liên quan đã hoàn tất; trạng thái làm nóng nền lúc nhận được giữ trong dữ liệu thay vì được giả định là xong.
  • oMLX 0.6.4 / MLX 0.32.0: Lightning MTP bật, độ sâu 3, nạp mô hình chỉ văn bản, đồng thời một. Nhật ký theo thế hệ ghi chấp nhận nháp và thực thi theo độ sâu cho làm nóng và cả hai tác vụ. Bộ nhập sidecar thượng nguồn đổi tên 15 tensor; dtype, hình dạng và byte tải của chúng vẫn giống sidecar AXQuant gốc. Trọng số xương sống không đổi.
  • Tạo tác: AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, bản sửa 4d36d652c21590f6813495351c3baf5fca5b3831. Siêu dữ liệu tạo tác khai báo độ sâu MTP 1; độ sâu hồi quy 3 ở đây theo chính sách môi trường chạy đã chọn hoặc thí nghiệm tường minh và không mở rộng chứng nhận tạo tác. Gói mô hình Optimized-Speed không được dùng trong lần kiểm thử lại này.
  • Phiên bản OpenCode là 1.18.31. Mọi backend và máy khách chạy nối tiếp. Mỗi cặp máy khách/backend khởi động một tiến trình mới và bộ nhớ đệm tác vụ tách biệt, rồi một lần làm nóng nạp mô hình không liên quan trần ở 64 token đầu ra. Việc nạp mô hình và lần làm nóng đó bị loại khỏi bảng; tác vụ đầu vẫn trả prefill lạnh. Điều khiển quạt để ở mặc định, và các tệp xương sống nằm trên bộ nhớ SMB.

Cái gì đã thẳng hàng, và cái gì vẫn khác

Cả hai máy khách nhận cùng chỉ dẫn dự án đầy đủ đã đóng băng, tác vụ người dùng và bốn công cụ được phép (glob, grep, read, skill). CLI nguồn AX Code dùng các ID nhà cung cấp ax-engine, mtplx và omlx thực; AX Engine dùng hợp đồng gắn loopback đã xác minh của nó với một backend khởi động riêng mang cờ được quản lý. Việc này không đo giao diện tải/khởi động được quản lý. OpenCode dùng đường nhà cung cấp tương thích OpenAI của nó. Cấu hình dự án bị tắt và mỗi máy khách có cài đặt/trạng thái tách biệt. Lời nhắc máy khách gốc, lược đồ công cụ và tiêu đề phiên vẫn nguyên; vì vậy số token đã kết xuất và hành vi bộ nhớ đệm khác nhau.

Một proxy ghi cục bộ thẳng hàng nhiệt độ 0.55, top-p 1, top-k/min-p 0, phạt lặp 1, phạt hiện diện/tần suất 0, hạt giống 0, suy nghĩ tắt, và trần đầu ra 1,024 token. Nó ép tool_choice: none cho tác vụ không công cụ này. Cả hai máy khách được cấu hình cho ngữ cảnh 65,536 token. Mỗi hàng được kiểm tra ảnh chụp chỉ dẫn đầy đủ, bốn tên công cụ, lấy mẫu chung, một yêu cầu, thoát CLI thành công, dừng tự nhiên và không thực thi công cụ.

Các lời nhắc AX Code dài hơn có thể tăng cả prefill lẫn công việc chú ý trong lúc sinh. Độ dài phản hồi, nội dung, mẫu môi trường chạy, nhân và chính sách bộ nhớ đệm khác nhau ngăn việc coi các bảng này là đo chuẩn chi phí máy khách với token bằng nhau. MTP đang hoạt động không bảo đảm 30–40 token/giây cho một ngữ cảnh lập trình đầy đủ. Để tách chi phí máy khách hoặc hiệu ứng bản sửa tiền tố, hãy phát lại các yêu cầu đã tuần tự hóa hoặc ID token giống hệt với đầu ra và điều kiện bộ nhớ đệm được kiểm soát, một cách riêng.

Báo cáo này không đổi hành vi đám mây, GPU riêng, nhà cung cấp CLI hay AX Trust. Xem hướng dẫn thiết lập môi trường chạy cục bộ cho chỉ dẫn kết nối và dữ liệu đo đã làm sạch cho thời điểm chính xác, số đếm, hash, kết quả xác thực và bằng chứng MTP. Chỉ dẫn dự án riêng, phản hồi mô hình, đường dẫn cục bộ và tiêu đề phiên được giữ tại chỗ và không được công bố. Do đó, khối lượng ngữ cảnh riêng đầy đủ không tái lập độc lập được chỉ từ báo cáo công khai.