Trang này được dịch từ tài liệu tiếng Anh. Lệnh, định danh và ví dụ giữ nguyên. Runtime 7.24.5 · SDK 2.6.9. Bản tiếng Anh
Số đo suy luận cục bộ: 19 tháng 9 năm 2026
Trạng thái: Đang hoạt động
Phạm vi: ảnh chụp chẩn đoán đã đo
Xem xét lần cuối: 2026-09-19
Chủ sở hữu: ax-code runtime
Để xem ma trận máy khách sáu tổ hợp đầy đủ sau bản sửa tiền tố cục bộ, xem kiểm tra lại AX Code/OpenCode mới. Các tốc độ máy khách bên dưới vẫn là quan sát lịch sử dưới điều kiện gốc của chúng.
Các số đo này khảo sát độ trễ phản hồi cục bộ và tốc độ giải mã trên một Apple M3 Max với bộ nhớ hợp nhất 128 GiB. Chúng không phải chứng nhận phần cứng, đánh giá chất lượng mô hình, hay lời hứa 30–40 tokens/s ở độ dài ngữ cảnh tùy ý. Hướng dẫn kết nối MTPLX và oMLX nằm trong hướng dẫn runtime cục bộ.
Điều kiện và thời gian
- Mã nguồn AX Code dựa trên v7.19.3; OpenCode 1.18.31; AX Engine 7.4.0; MTPLX 2.11.3; oMLX 0.6.4
(
1d7826185c5b5b69b38b27cbe57d7597b7551fd7, cài nguồn cô lập). - Một backend suy luận tại một thời điểm. Điều khiển quạt mặc định; không có tuyên bố quạt tối đa. Tệp mô hình nằm trên lưu trữ SMB. Lần chạy tạo tác chính xác của MTPLX chỉ đặt sidecar MTP trên SSD, với SHA-256 đã xác minh.
- Các lần phát lại tạo tác chính xác dùng
AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, bản sửa4d36d652c21590f6813495351c3baf5fca5b3831. Các lần chạy máy khách Optimized-Speed riêng của MTPLX dùngYoussofal/Qwen3.8-27B-MTPLX-Optimized-Speed. Đó là các gói mô hình khác nhau, dù tổng kích thước tệp của chúng tương tự; tốc độ của chúng không cô lập được mức tăng chỉ do runtime. - Thiết lập phát lại chung: temperature 0.55, top-p 1, top-k 0, seed 0, tới 256 token đã sinh. AX Engine và MTPLX dùng độ sâu MTP đang hoạt động là 3. Nhân runtime và bộ lấy mẫu suy đoán khác nhau. Siêu dữ liệu tạo tác khai báo độ sâu 1; độ sâu 3 ở đây là thí nghiệm runtime tường minh, không phải mở rộng chứng nhận của tạo tác hay một khuyến nghị mặc định mới. AX Engine bỏ qua EOS cho lần phát lại gốc đầu ra cố định; MTPLX và oMLX theo quy tắc dừng riêng của chúng.
- Tốc độ giải mã gốc dùng bộ đếm giải mã của backend. Tốc độ đã giao là
(reported completion tokens - 1) / (last output payload time - first output payload time); sự kiện rỗng và keepalive không được tính là đầu ra. Các ranh giới này không giống nhau. - Độ trễ tải đầu gồm chuẩn bị yêu cầu trên máy chủ, khôi phục/prefill bộ nhớ đệm, và mọi đệm trước đầu ra. Tổng token chia cho toàn bộ yêu cầu là một thước đo thông lượng khác. Các cụm gọi công cụ không phù hợp để ước lượng giải mã từ tải đầu tới tải cuối.
Ví dụ, cùng một lần phát lại đầu vào 30k của MTPLX đo 13.99 token giải mã gốc/giây nhưng chỉ 1.13 tokens/s trên toàn bộ yêu cầu, vì prefill lạnh tiêu khoảng 209 giây. Một số thấp của toàn bộ yêu cầu tự nó không thiết lập lỗi engine giải mã.
Phát lại AX Engine và MTPLX với trọng số chính xác
Mỗi cặp nhận cùng chuỗi token đầu vào nguyên và phát 256 token. Các giá trị bên dưới là quan sát đơn; danh tính token đã sinh có thể khác dù cùng seed.
| Đầu vào | Giải mã gốc AX Engine | Giải mã gốc MTPLX | Đầu vào đệm AX Engine | Đầu vào đệm MTPLX |
|---|---|---|---|---|
| 62 token | 39.12 t/s | 39.48 t/s | không báo | 0 |
| 18,643 token | 17.49 t/s | 20.93 t/s | 0 | 0 |
| 30,019 token | 16.06 t/s | 13.99 t/s | 29,696 | 0 |
MTPLX dùng hồ sơ Sustained cho tạo tác này. Yêu cầu 30k của AX Engine đã ấm trong khi MTPLX
lạnh, nên thời gian token đầu của chúng không thiết lập tỷ lệ tốc độ prefill. Đầu vào 30k gồm một
chỉ dẫn giới hạn bước lịch sử và tạo văn xuôi chẩn đoán; đó không phải chấp nhận nhiệm vụ lập trình.
Lần phát lại 18,643 token của MTPLX báo stop sau 256 token thay vì length.
Lời nhắc ngắn cho tốc độ giải mã tương tự. Các lần chạy này không chứng minh backend nào nhanh hơn một cách phổ quát, hay việc chuyển AX Code sang backend khác bảo đảm một mức tăng cố định.
AX Code và OpenCode trên MTPLX Optimized-Speed
Cả hai máy khách nhận cùng nhiệm vụ người dùng, chỉ dẫn dự án đầy đủ và bốn lược đồ công cụ được phép. Nhiệm vụ yêu cầu một bộ nhớ đệm LRU TypeScript mà không thực thi công cụ. Các lời nhắc riêng máy khách được giữ; một proxy ghi căn chỉnh lấy mẫu, tắt suy nghĩ, và dùng trần yêu cầu/máy chủ 1024 token. Các phản hồi sau hoàn thành bình thường:
| Máy khách | Token đầu vào | Token đầu ra | Tốc độ đã giao | Tải đầu | Đầu vào đệm |
|---|---|---|---|---|---|
| AX Code | 36,808 | 277 | 23.92 t/s | 280.05 s | 2,048 |
| OpenCode, lần đầu | 18,703 | 228 | 26.82 t/s | 122.54 s | 0 |
| OpenCode, lần lặp | 18,703 | 228 | 30.01 t/s | 0.018 s | 18,703 |
Các số đo này đứng trước bản sửa tiền tố cục bộ của AX Code (42908b46a). AX Code gửi nhiều ngữ cảnh hơn và
tạo mã khác. Đây không phải so sánh chi phí máy khách cùng số token hay kết quả trước/sau.
Chỉ gỡ bản đồ thư mục được quét tự động trong một lần phát lại riêng đã giảm đầu vào xuống 30,717
nhưng chỉ cải thiện giải mã quan sát khoảng 2%; việc gỡ bản đồ thư mục không được nhận.
Một ma trận bộ chuyển AX Engine riêng quan sát AX Code ở 9.44–11.56 t/s đã giao với 33,225 token đầu vào và OpenCode ở 12.82–13.00 với 17,290. Độ dài lời nhắc, nội dung đầu ra, trạng thái bộ nhớ đệm và trần đầu ra 256 token khác bảng phản hồi hoàn chỉnh ở trên; đừng gộp chúng thành một tỷ lệ tăng tốc backend.
oMLX
Kiểm thử oMLX dùng đúng tạo tác AXQ và một bản cài cô lập với MLX 0.32.0. Cả năm
kiểm tra nhập nhân gốc, gồm qwen35_prefill và decode_fast, đều đạt. Nạp chỉ văn bản
được chọn tường minh, cửa sổ ngữ cảnh là 65,536, và đồng thời là một.
Lần thử Lightning MTP đầu trả HTTP 409 vì kiểm thử bỏ bước Import MTP side-car bắt buộc của oMLX.
Đây là lỗi thiết lập, không phải thiếu hỗ trợ AXQuant. AXQuant đã
cung cấp hợp đồng qwen3-next-mtp chuẩn; bản sửa Hub hiện tại
b0784088d4026ca569c5653e6e6243c501ef5fa9 cũng gồm liệt kê axquant_omlx_compat.json
15 tensor MTP. Ảnh chụp phát lại gốc có trước chú thích đó.
Đường cơ sở MTP tắt hoàn thành với tạo tác gốc:
| Token đầu vào | Token đầu ra | Giải mã gốc | Ước lượng đã giao | Đầu vào đệm |
|---|---|---|---|---|
| 62 | 256 | 18.97 t/s | 18.90 t/s | 0 |
| 18,643 | 256 | 13.02 t/s | 12.97 t/s | 0 |
| 30,019 | 256 | 12.15 t/s | 12.10 t/s | 0 |
Đây là kết quả MTP tắt và không được so với runtime MTP bật như bằng chứng về khác biệt tốc độ backend vốn có. Vòng tokenizer và số lời nhắc máy chủ khớp các đầu vào nguyên mà các backend phát lại khác dùng.
Lần chạy MTP đã sửa dùng trình nhập của chính oMLX trên một bản sao ghi được riêng. Các mảnh xương sống
không đổi. Trình nhập thêm language_model. vào 15 tên tensor sidecar; dtype,
hình dạng và hàm băm tải của từng tensor được xác minh bằng nhau trước và sau khi nhập. Vì vậy hàm băm tệp đã nhập
khác vì phần đầu của nó đã đổi. Siêu dữ liệu gốc và ảnh chụp mô hình dùng chung vẫn nguyên.
Độ sâu MTP 3 được chọn tường minh, và bộ đếm bản nháp/chấp nhận theo độ sâu xác nhận thực thi thật.
| Token đầu vào | Token đầu ra | Giải mã gốc MTP | Ước lượng đã giao | Chấp nhận bản nháp | Đầu vào đệm |
|---|---|---|---|---|---|
| 62 | 256 | 31.12 t/s | 31.02 t/s | 179/195 (91.8%) | 0 |
| 18,643 | 256 | 17.18 t/s | 17.13 t/s | 177/192 (92.2%) | 0 |
| 30,019 | 256 | 15.19 t/s | 15.15 t/s | 170/199 (85.4%) | 0 |
Kết quả ngắn xác nhận gói AXQuant này hoạt động với Lightning MTP của oMLX sau khi nhập. Giải mã ngữ cảnh dài vẫn chậm hơn dù MTP đang hoạt động. Văn bản đã sinh khác nhau, phiên bản runtime, nhân và chính sách suy đoán ngăn việc quy mọi khác biệt xuyên runtime cho AX Code.
Chấp nhận luồng lập trình và các loại trừ
Sau bản sửa tiền tố cục bộ, AX Code hoàn thành một nhiệm vụ chỉ đọc cô lập trên cả AX Engine và MTPLX: đọc một thư mục và hai tệp TypeScript, giải thích ngoại lệ hàng đợi đầy, nhận diện sức chứa 7, và trả một dấu chỉ có trong tệp thứ hai. Cả hai thoát thành công và giữ nguyên byte fixture. Các lần gọi AX Engine sau tái dùng 11,264 token đầu vào; MTPLX tái dùng 11,264–12,032. Thân yêu cầu đầu giống nhau, nhưng mẫu runtime tạo số token khác nhau. Điều này xác minh luồng công cụ và việc tái dùng bộ nhớ đệm đã quan sát, không phải một mức tăng cố định từ bản vá.
Các mã nhà cung cấp mới cũng đạt chấp nhận trực tiếp từ CLI nguồn: omlx với gói AXQ đã nhập
và tool_call: true tường minh, và mtplx với gói Optimized-Speed và không có mục mô hình
đã cấu hình. MTPLX khám phá mô hình trò chuyện và khả năng công cụ từ danh sách mô hình gốc. Cả hai lần chạy
hoàn thành hai lần đọc tệp thành công và trả ngoại lệ, sức chứa và dấu chỉ-trong-tệp kỳ vọng
mà không đổi byte fixture. Tiền tố hệ thống/người dùng ban đầu giữ nguyên qua ba yêu cầu của mỗi lần chạy.
oMLX tái dùng 8,192 token; MTPLX tái dùng 11,829 và 12,047 token. Đây là kiểm tra
chức năng, không phải lần chạy hiệu năng khớp; không có tuyên bố tăng tốc thời gian tường xuyên runtime.
Các phản hồi AX Code bị trần 256 token trước đó bị cắt và đi vào khôi phục; tốc độ đầu ra lặp của chúng quanh 51–58 t/s bị loại khỏi các tuyên bố sinh mới. Các lần chạy đầu với chỉ dẫn dự án hoặc quyền công cụ không bằng nhau cũng bị loại. Ollama và LM Studio chỉ được kiểm tra về cách dựng yêu cầu; không có kết quả tốc độ sinh nào được tuyên bố cho chúng.
Lời nhắc 62 token chung được công khai dưới dạng yêu cầu hoàn thành oMLX chính xác. Từ gốc bản checkout, sau khi nhập sidecar, bật MTP và làm nóng mô hình, có thể gửi bằng:
curl --no-buffer http://localhost:8000/v1/completions \
-H 'Content-Type: application/json' \
--data-binary @docs/data/local-inference-short-request.json
Đổi mã mô hình của yêu cầu thành mã mà máy chủ của bạn lộ. Tệp gồm mẫu đã kết xuất; hãy dùng điểm cuối completions để mẫu trò chuyện không bị áp lần thứ hai. Hãy xác nhận 62 token lời nhắc và giữ sự kiện usage cuối. Việc nạp mô hình lạnh và làm nóng phải được báo riêng.
Chỉ dẫn dự án riêng, lời nhắc phiên, đường dẫn cục bộ và chi tiết xác thực không được xuất bản. Dữ liệu đo đã làm sạch chứa số đếm, thời gian, danh tính runtime và hàm băm đầu vào chứ không phải văn bản lời nhắc. Vì vậy lần phát lại ngữ cảnh riêng đầy đủ không phải tải có thể tái hiện công khai một mình. Để so sánh mới, hãy dùng cùng bản sửa mô hình, tokenizer/mẫu, mã đầu vào, quy tắc đầu ra/dừng, lấy mẫu, chế độ MTP, trạng thái bộ nhớ đệm, phần cứng và thực thi tuần tự; hãy báo thành công nhiệm vụ hoàn chỉnh riêng.
Hợp đồng thượng nguồn: hướng dẫn máy chủ và mô hình MTPLX, oMLX 0.6.4. Các chuẩn đã xuất bản của chúng dùng phần cứng và tải khác và không được thay cho các số đo tại đây.