Получить AX Code · БесплатноДокументация

Эта страница переведена с английской документации. Команды, идентификаторы и примеры не изменены. Среда выполнения 7.24.5 · SDK 2.6.9. Английский оригинал

Измерения собственного prefill и decode Tiel Coder

Статус: исторический локальный снимок Последняя проверка: 2026-09-21 Владелец: сопровождающие AX Code Дата: 2026-09-19 Область: два выбранных пакета Tiel в AX Code, AX Engine против MTPLX, Apple M3 Max 128 ГиБ

Для рейтинга заменено. Кампания собственного API на четырёх машинах от 20 сентября 2026 года — это текущее сравнение Tiel и MTPLX, включая завершение 194.88 tok/s на M5 Max для пакета по умолчанию и пиковый decode Cyber-Tiel 249.01 tok/s. См. сводку сравнения Tiel. Оставьте эту страницу как фазовый снимок M3 Max от 19 сентября (движок опознан как 7.4.0; медиана из трёх). Не смешивайте таблицы.

Эти результаты сохраняют исходную базовую линию профиля agentic. Последующее сравнение профилей MTP Tiel измеряет профиль auto, который AX Code выбирает теперь, включая компромиссы, зависящие от нагрузки.

Новые пакеты Tiel работали с активным MTP на обеих проверенных средах. Исходная сборка AX Engine достигла 47.36–58.53 токенов decode в секунду по четырём случаям. MTPLX достиг 92.13–96.26. Prefill был примерно 1 190–1 446 токенов в секунду. Это измерения собственной фазы вывода на Apple M3 Max с 128 ГиБ, а не сквозная пропускная способность написания кода AX Code или OpenCode.

Требование к сборке. Установленный Homebrew AX Engine 7.4.0 не смог запустить Tiel с Engine(MlxMtpRequiredButUnavailable). Результаты AX Engine ниже используют оптимизированную локальную сборку коммита 51137c71a6794964d52c32c95e275c0923ed8d0b, которая добавляет исправление загрузчика пространства имён MTP Tiel. Эта сборка всё ещё представляется как 7.4.0. Её результаты не устанавливают поддержку в существующем двоичном файле Homebrew или в опубликованном выпуске. MTP оставался обязательным. Прогона с отключённым MTP в запасном режиме нет.

Результаты

Каждое значение — медиана трёх попыток. Все попытки породили ровно 256 токенов и сообщили ноль кэшированных входных токенов. И prefill, и decode считают токены в секунду.

Модель Входные токены Prefill AX Engine Decode AX Engine Prefill MTPLX Decode MTPLX
Tiel Coder, короткий 458 1,255.61 57.03 1,207.01 92.27
Tiel Coder, контекст 3,182 1,424.24 55.25 1,279.48 96.26
Cyber-Tiel Coder, короткий 483 1,226.86 58.53 1,189.60 95.09
Cyber-Tiel Coder, контекст 3,207 1,446.19 47.36 1,427.62 92.13

Разница decode есть в прямых запросах среды с согласованными входами, до цикла агента AX Code. Это локальное сравнение поэтому указывает на разницу уровня среды выполнения. Оно не называет одно ядро или одну политику причиной. Prefill у этих конфигураций гораздо ближе. Контроля с выключенным MTP не было, поэтому это не измерение ускорения MTP.

К отчёту прилагаются очищенные входы, все 24 квитанции попыток, счётчики фаз, ревизии моделей и результаты приёмки клиента.

Точные артефакты и окружение

Модель Репозиторий Hugging Face Ревизия
Пакет Tiel Coder, значение AX Code по умолчанию AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP закрепление 5ab39b24bfd7f65203be9b7823b1840486f58b6d
Альтернативный пакет Cyber-Tiel AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP закрепление fe05e871ec69ad9ae8eac01fd285555514ac7daf
  • Исходный код AX Code: 205cb556b. Выбор использует mlx и веса MXFP4 издателя.
  • Узел: Apple M3 Max, 137,438,953,472 байт памяти; macOS 27.0, сборка 26A428.
  • AX Engine: сборка профиля выпуска 51137c71a6794964d52c32c95e275c0923ed8d0b, MLX 0.32.2. SHA-256 сервера: 1fbe7fc50ea16448f98350616273214c0475bffb3ef509fceb3f8849163e97f5.
  • MTPLX: 2.11.3, MLX 0.32.2, окружение Python 3.12.
  • Обе среды читают один и тот же общий снимок Hugging Face каждой модели. Скачивание модели, загрузка весов и запуск сервера из таймингов фаз исключены.

Пакеты — повторные квантования для разработки. Эти проверки не удостоверяют качество модели, численный паритет, поведение длинного контекста, другое оборудование или производительность будущего выпуска. Они не заменяют историческую матрицу реального клиента Qwen3.8, которая использовала другие модели и мерила другую границу.

Метод измерения

Промпт просит общий кэш LRU на TypeScript и тесты, а перед этим стоят 8 или 96 синтетических функций TypeScript. Сообщения хранятся в квитанции JSON. Закреплённый токенизатор каждой модели отрисовывает её официальный шаблон чата с enable_thinking=false и add_generation_prompt=true. Полученные целочисленные токены без изменений отправляются обоим серверам. Вывод /tokenize AX Engine также сверялся с этими идентификаторами. Шаблон Cyber-Tiel добавляет текст личности, что объясняет дополнительные 25 токенов. Входы между серверами совпадают внутри каждой модели.

Запросы используют температуру 0.55, top-p 1, top-k 0, зерно 0 и предел 256 токенов. Каждый сервер получает явный прогрев на 64 токена до измеряемых попыток. MTPLX также выполняет свой обычный прогрев при запуске и в фоне. Прогрев не считается попыткой. Порядок прогона: MTPLX/Tiel, AX Engine/Tiel, MTPLX/Cyber-Tiel, AX Engine/Cyber-Tiel. Одновременно был активен только один сервер вывода. Компиляция завершилась до начала измеряемых попыток. Эта малая выборка с фиксированным порядком — не исследование выносливости и не уравновешенное тепловое исследование.

AX Engine использует собственный /v1/generate с input_tokens и max_output_tokens. MTPLX использует потоковый /v1/completions с целочисленным массивом prompt, затем /metrics. Это избегает различий сборки промпта клиента и отрисовки шаблона чата между двумя серверами. Ограниченный вывод — нагрузка на пропускную способность, а не проверка правильности полного кода.

Измерение AX Engine MTPLX
Длительность prefill ax_mlx_prefill_wall_us / 1e6 prompt_eval_time_s
Скорость prefill Некэшированные входные токены / длительность prefill prefill_compute_tok_s, сверено с new_prefill_tokens / prompt_eval_time_s
Длительность decode ax_mlx_decode_wall_us / 1e6 decode_elapsed_s
Скорость decode (output_tokens - 1) / decode duration; первый вывод принадлежит prefill decode_tok_s, сверено с completion_tokens / decode_elapsed_s
Свидетельство кэша Кэш префикса выключен через AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0; ноль повторно использованных токенов Кэш сеанса SSD выключен; ноль кэшированных токенов на каждом завершении
Свидетельство MTP Обязательная политика, активный драфтер модели, положительные принятые токены, ноль сообщённых шагов прямого отката generation_mode=mtp, глубина 3, положительные счётчики черновика и принятия

У собственных счётчиков decode чуть разные границы первого токена. Они сообщаются со своими настоящими формулами, а не переименовываются в одинаковые таймеры. Ни одна скорость не делит вывод на полную длительность запроса HTTP. Собственный TTFT MTPLX сохраняется в JSON. Непотоковый зонд AX Engine транспортный TTFT не меряет.

Конфигурация среды выполнения

AX Engine использовал общий профиль спекуляции agentic, контекст 32 768 токенов, объявленный бюджет вывода 8192 токена, ширину планировщика 2048 и один параллельный запрос. Переопределения окружения AX Code, специфичные для плотной Qwen3.8, не применялись. Допущенная глубина MTP была 3. Обычные шлюзы черновика движка оставались активными.

Эквивалентные аргументы запуска, где SNAPSHOT указывает на подходящий закреплённый снимок, а MODEL — на его псевдоним AX Code:

AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0 /path/to/fixed/ax-engine-server \
  --host 127.0.0.1 --port 18439 --model-id "$MODEL" \
  --mlx --mlx-model-artifacts-dir "$SNAPSHOT" \
  --mlx-mtp-policy required --speculation-profile agentic \
  --mlx-mtp-disable-ngram-stacking --max-concurrent-requests 1 \
  --max-batch-tokens 2048 --max-output-tokens 8192 \
  --block-size-tokens 16 --total-blocks 2048

mtplx serve --model "$SNAPSHOT" --model-id "$MODEL" \
  --host 127.0.0.1 --port 18442 --no-auth --agent-rewrites off \
  --max-tokens 8192 --context-window 32768 --reasoning off \
  --no-stats-footer --ssd-session-cache off --warmup-tokens 64 \
  --strict-warmup --fan-mode default --generation-mode mtp --load-mtp --depth 3

MTPLX использовал пустую изолированную конфигурацию. Манифесты моделей AX Engine готовились его закреплённым загрузчиком только для локального использования. Веса модели издателя и тензоры MTP сохранены. Ни одна конфигурация не отключала MTP, чтобы получить результат.

Приёмка инструментов AX Code

Отдельный прогон исходного кода AX Code просил каждую модель прочитать probe.txt инструментом чтения и вернуть только его содержимое. Состояние и конфигурация были изолированы. AX Engine использовал явное подключение через loopback к проверенному исходному серверу. Эти прогоны исключены из таблицы собственных фаз.

Модель Среда Чтение завершено Верный маркер в итоговом ответе Точный формат только вывода
Tiel исходный AX Engine Да Да Нет; добавлены проза и ограждение кода
Tiel MTPLX Да Да Да
Cyber-Tiel исходный AX Engine Да Да Нет; добавлены проза и ограждение кода
Cyber-Tiel MTPLX Да Да Да

Все четыре клиентских процесса завершились успешно и выполнили настоящий вызов чтения. Два прогона AX Engine не прошли более строгое требование к формату вывода, поэтому это не полностью зелёная сертификация поведения или качества написания кода. Их промпты, нагрузки инструментов, выборка по умолчанию и обработка чата — пути клиента и среды, отличные от эталона фаз с согласованными токенами. Поведение облака, CLI, частного GPU и AX Trust для этих проверок не подстраивалось.

Отдельный управляемый вызов providers ax-engine start опустил аргумент модели и выбрал tiel-coder-35b-axq-mxfp4 на закреплённой ревизии с mlx. Его живой статус сообщил поддержку инструментов, политику MTP «обязательно/обязательно», активный MTP, 27 токенов черновика и 23 принятых токена. Затем управляемый сервер успешно остановлен. Использовались изолированное состояние AX Code и переопределение AX_ENGINE_SERVER=/absolute/path/to/fixed/ax-engine-server существующего помощника. Установленный двоичный файл пользователя и конфигурация провайдера не заменялись. То же переопределение можно задать при запуске pnpm run dev со сборкой, содержащей исправление загрузчика.

Смена каталога прошла 11 374 детерминированные проверки, 17 пропущено, плюс 208 проверок SDK, 259 проверок сценариев (94 пропущено), рекурсивную проверку типов, проверки структуры репозитория и проверки TUI. Прежде чем пользоваться новым значением по умолчанию, см. выбор модели и требования среды выполнения.