AX Code 받기 · 무료문서

이 페이지는 영어 문서의 번역입니다. 명령, 식별자, 예제는 그대로입니다. 런타임 7.24.4 · SDK 2.6.7. 영어 원문

AX Code와 OpenCode 클라이언트 재시험: 2026년 9월 19일

상태: 활성

범위: 측정된 진단 스냅샷

최종 검토: 2026-09-19

담당: ax-code 런타임

이 재시험은 AX Code 소스 62895cf40a39e0ebd4afec0afa21044e9871aa0b을 사용합니다. 로컬 접두사 수정(42908b46a)과 MTPLX/oMLX 공급자 추가 이후입니다. 여섯 개의 클라이언트/백엔드 조합은 모두 Apple M3 Max, 128 GiB에서 MTP가 켜진 같은 Qwen3.8 27B AXQ 6비트 아티팩트를 사용합니다. 이전 측정은 역사적 증거로 남습니다. 모델 패키지, 프롬프트, 토큰 한도, 캐시 조건이 다릅니다. 이것은 접두사 수정의 가속에 대한 통제된 전후 추정이 아닙니다.

전달된 출력 속도

각 칸은 첫 작업 / 반복 작업이며 단위는 토큰/초입니다. 중앙값이 아니라 단일 관찰입니다. 반복 작업은 같은 백엔드 프로세스에 대해 새 CLI 세션을 시작합니다. 캐시에 적중한다고 가정하지 않습니다. 적재와 첫 출력 대기는 이 속도에서 제외됩니다.

클라이언트 AX Engine MTPLX oMLX
AX Code 11.73 / 13.60 18.73 / 19.69 17.48 / 16.60
OpenCode 22.49 / 18.98 27.91 / 26.35 20.33 / 20.64

추정은 (completion tokens - 1) / (last output payload time - first output payload time)입니다. 추측 디코딩은 한 페이로드에 여러 토큰을 내보낼 수 있으므로, 이것은 백엔드의 네이티브 디코드 카운터가 아니라 클라이언트 전달 추정입니다. 완전한 요청 처리량도 측정하지 않습니다.

요청 시간, 작업량, 수용

NR은 서버가 캐시된 토큰 사용량을 보고하지 않았다는 뜻입니다. 0이라고 단정하지 않습니다. 첫 페이로드 시간은 로컬 기록 프록시가 모델 요청을 받을 때 시작합니다. CLI 벽시계 시간에는 클라이언트 시작과 완료도 포함됩니다. 작업은 도구 실행이나 파일 편집 없이, get, set, delete, clear이 있는 독립된 일반적인 TypeScript LRU 캐시를 요청합니다.

백엔드 클라이언트 작업 입력 토큰 출력 토큰 캐시된 토큰 첫 페이로드(초) CLI 벽시계(초) 코드 검사
AX Engine AX Code 처음 29,896 268 미보고 197.78 231.58 통과
AX Engine AX Code 반복 29,896 268 29696 7.22 33.34 통과
AX Engine OpenCode 처음 17,316 216 미보고 100.86 112.83 통과
AX Engine OpenCode 반복 17,316 228 미보고 116.03 129.90 통과
MTPLX AX Code 처음 36,708 285 0 246.67 269.43 통과
MTPLX AX Code 반복 36,708 285 36708 0.04 20.48 통과
MTPLX OpenCode 처음 18,729 276 0 108.67 121.00 통과
MTPLX OpenCode 반복 18,729 276 18729 0.08 12.77 통과
oMLX AX Code 처음 33,124 275 0 212.25 235.62 통과
oMLX AX Code 반복 33,124 232 32768 4.41 23.34 통과
oMLX OpenCode 처음 17,316 213 0 118.03 130.88 통과
oMLX OpenCode 반복 17,316 261 16384 7.73 22.91 통과

코드 수용 검사는 빠진 키, 값 조회, LRU 축출, 유지된 항목, 최신성 갱신, 있는 키와 없는 키 삭제, 비우기, 객체 키 신원, 거짓 같은 값을 확인합니다. 생성된 파일은 엄격한 TypeScript 검사도 받습니다. 이 제한된 검사가 넓은 코딩 품질을 확립하지는 않습니다. 모든 측정 행은 생성된 출력과 검증 결과를 유지합니다. 실패를 더 빠른 재시도로 조용히 바꾸지 않습니다.

MTP와 런타임 조건

  • AX Engine 7.4.0: --mlx-mtp-policy required, 관리형 로컬 런타임 플래그, n-gram 가속과 n-gram 스태킹은 꺼짐. 실시간 프로세스 지표는 0이 아닌 드래프트와 수용 토큰 카운터와 함께 ax_engine_mlx_mtp_model_policy_active=1를 보여 줍니다. AX Code 스냅샷은 예열을 따르고, OpenCode 스냅샷은 첫 작업을 따릅니다. 둘 다 예열을 포함하며 작업별 수용 합계가 아닙니다. 작업별 AX Code 드래프트 횟수는 유지되지 않았습니다.
  • MTPLX 2.11.3 / MLX 0.32.2: 명시적인 --generation-mode mtp --depth 3. 실시간 건강은 generation_mode: mtp과 runtime_mode: Sustained MTP를 보고합니다. 에이전트 다시 쓰기와 SSD 세션 캐시는 꺼져 있습니다. 네이티브 메모리 세션 뱅크는 켜져 있습니다. 네이티브 시작/커널 예열은 유지되고 시간에서 제외됩니다. 관련 없는 적재 예열은 완료되었습니다. 수용 시점의 백그라운드 예열 상태는 완료되었다고 가정하지 않고 데이터에 남아 있습니다.
  • oMLX 0.6.4 / MLX 0.32.0: Lightning MTP 켜짐, 깊이 3, 텍스트 전용 모델 적재, 동시성 하나. 세대별 로그는 예열과 두 작업에 대해 드래프트 수용과 깊이별 실행을 기록합니다. 업스트림 사이드카 가져오기는 텐서 15개의 이름을 바꿉니다. dtype, 형태, 페이로드 바이트는 원래 AXQuant 사이드카와 같습니다. 백본 가중치는 바뀌지 않습니다.
  • 아티팩트: AutomatosX/AX-Qwen3.8-27B-MLX-AXQ-6bit-MTP, 리비전 4d36d652c21590f6813495351c3baf5fca5b3831. 아티팩트 메타데이터는 MTP 깊이 1을 선언합니다. 여기서의 반복 깊이 3은 고른 런타임 정책/명시적 실험을 따르며 아티팩트 인증을 확장하지 않습니다. 이 재시험에서는 Optimized-Speed 모델 패키지를 사용하지 않습니다.
  • OpenCode 버전은 1.18.31입니다. 모든 백엔드와 클라이언트는 직렬로 실행됩니다. 각 클라이언트/백엔드 쌍은 새 프로세스와 격리된 작업 캐시로 시작하고, 이어서 출력 토큰 64개로 상한이 있는 관련 없는 모델 적재 예열이 있습니다. 모델 적재와 그 예열은 표에서 제외됩니다. 첫 작업은 여전히 차가운 프리필 비용을 냅니다. 팬 제어는 기본값으로 두고, 백본 파일은 SMB 저장소에 있습니다.

맞춰진 것과 여전히 다른 것

두 클라이언트는 같은 고정된 전체 프로젝트 지시, 사용자 작업, 허용된 도구 네 개(glob, grep, read, skill)를 받습니다. 소스 AX Code CLI는 실제 ax-engine, mtplx, omlx 공급자 ID를 사용합니다. AX Engine은 관리 플래그를 지닌, 따로 시작한 백엔드와 함께 검증된 루프백 붙이기 계약을 사용합니다. 이것은 관리형 다운로드/시작 UI의 시간을 재지 않습니다. OpenCode는 OpenAI 호환 공급자 경로를 사용합니다. 프로젝트 구성은 꺼져 있고 각 클라이언트는 격리된 설정/상태를 갖습니다. 네이티브 클라이언트 프롬프트, 도구 스키마, 세션 헤더는 그대로입니다. 따라서 렌더링된 토큰 수와 캐시 동작은 다릅니다.

로컬 기록 프록시는 temperature 0.55, top-p 1, top-k/min-p 0, 반복 패널티 1, presence/frequency 패널티 0, seed 0, 사고 끔, 출력 상한 1,024토큰을 맞춥니다. 이 도구 없는 작업에는 tool_choice: none를 강제합니다. 두 클라이언트 모두 65,536토큰 컨텍스트로 구성됩니다. 모든 행은 완전한 지시 스냅샷, 도구 이름 네 개, 공통 샘플링, 요청 하나, 성공한 CLI 종료, 자연스러운 중지, 도구 실행 없음을 확인합니다.

더 긴 AX Code 프롬프트는 생성 중 프리필과 주의 작업을 모두 늘릴 수 있습니다. 응답 길이, 내용, 런타임 템플릿, 커널, 캐시 정책이 다르므로 이 표를 토큰이 같은 클라이언트 오버헤드 벤치마크로 취급할 수 없습니다. MTP가 활성이라고 전체 코딩 컨텍스트에서 30–40토큰/초가 보장되지는 않습니다. 클라이언트 오버헤드나 접두사 수정 효과를 분리하려면, 통제된 출력과 캐시 조건으로 같은 직렬화 요청/토큰 ID를 따로 재생합니다.

이 보고서는 클라우드, 프라이빗 GPU, CLI 공급자, AX Trust 동작을 바꾸지 않습니다. 연결 안내는 로컬 런타임 설정 안내를, 정확한 시간, 횟수, 해시, 검증 결과, MTP 증거는 정제한 측정 데이터를 보십시오. 비공개 프로젝트 지시, 모델 응답, 로컬 경로, 세션 헤더는 로컬에 유지되며 게시되지 않습니다. 따라서 완전한 비공개 컨텍스트 작업량은 공개 보고서만으로는 독립적으로 재현할 수 없습니다.