AX Code holen · KostenlosDokumentation

Diese Seite ist eine Übersetzung der englischen Dokumentation. Befehle, Bezeichner und Beispiele bleiben unverändert. Runtime 7.24.4 · SDK 2.6.7. Englische Fassung

Native Prefill- und Decode-Messungen für Tiel Coder

Status: Historischer lokaler Schnappschuss Zuletzt geprüft: 2026-09-21 Verantwortlich: Betreuer von AX Code Datum: 2026-09-19 Umfang: die zwei ausgewählten Tiel-Pakete von AX Code, AX Engine gegenüber MTPLX, Apple M3 Max 128 GiB

Für die Rangfolge überholt. Die native API-Kampagne vom 20. September 2026 auf vier Rechnern ist der aktuelle Vergleich von Tiel und MTPLX, einschließlich des Abschlusses 194.88 tok/s auf dem M5 Max für das Standardpaket und des Spitzen-Decode 249.01 tok/s von Cyber-Tiel. Siehe Tiel-Vergleichszusammenfassung. Behalten Sie diese Seite als Phasenschnappschuss des M3 Max vom 19. September (Engine als 7.4.0 gekennzeichnet; Median aus drei). Vermischen Sie die Tabellen nicht.

Diese Ergebnisse behalten die ursprüngliche Profilbasis agentic. Der spätere Vergleich der Tiel-MTP-Profile misst das Profil auto, das AX Code jetzt wählt, einschließlich seiner arbeitslastabhängigen Abwägungen.

Die neuen Tiel-Pakete liefen mit aktivem MTP auf beiden geprüften Laufzeiten. Der Quellbuild von AX Engine erreichte über die vier Fälle 47,36–58,53 Decode-Token/s. MTPLX erreichte 92,13–96,26. Prefill lag ungefähr bei 1.190–1.446 Token/s. Das sind Messungen der nativen Inferenzphase auf einem Apple M3 Max mit 128 GiB, nicht der Ende-zu-Ende-Coding-Durchsatz von AX Code oder OpenCode.

Build-Anforderung: das installierte Homebrew-AX-Engine 7.4.0 konnte Tiel nicht mit Engine(MlxMtpRequiredButUnavailable) starten. Die AX-Engine-Ergebnisse unten verwenden einen optimierten lokalen Build von Commit 51137c71a6794964d52c32c95e275c0923ed8d0b, der die Korrektur des Tiel-MTP-Namespace-Laders hinzufügt. Dieser Build kennzeichnet sich weiterhin als 7.4.0. Seine Ergebnisse belegen keine Unterstützung in der vorhandenen Homebrew-Binärdatei oder einer veröffentlichten Version. MTP blieb erforderlich. Ein Rückfalllauf mit deaktiviertem MTP ist nicht enthalten.

Ergebnisse

Jeder Wert ist der Median aus drei Versuchen. Alle Versuche erzeugten genau 256 Token und meldeten null zwischengespeicherte Eingabetoken. Prefill und Decode verwenden beide Token je Sekunde.

Modell Eingabetoken AX-Engine-Prefill AX-Engine-Decode MTPLX-Prefill MTPLX-Decode
Tiel Coder, kurz 458 1,255.61 57.03 1,207.01 92.27
Tiel Coder, Kontext 3,182 1,424.24 55.25 1,279.48 96.26
Cyber-Tiel Coder, kurz 483 1,226.86 58.53 1,189.60 95.09
Cyber-Tiel Coder, Kontext 3,207 1,446.19 47.36 1,427.62 92.13

Der Decode-Unterschied besteht in direkten Laufzeitanfragen mit zugeordneten Eingaben, vor der Agentenschleife von AX Code. Dieser lokale Vergleich verortet daher einen Unterschied auf Laufzeitebene. Er benennt keinen einzelnen Kernel oder eine einzelne Richtlinie als Ursache. Prefill liegt zwischen diesen Konfigurationen viel näher beieinander. Es lief keine Kontrolle mit deaktiviertem MTP, daher ist das keine Messung der MTP-Beschleunigung.

Bereinigte Eingaben, alle 24 Versuchsbelege, Phasenzähler, Modellrevisionen und Ergebnisse der Clientannahme begleiten diesen Bericht.

Genaue Artefakte und Umgebung

Modell Hugging-Face-Repository Revision
Tiel Coder, AX-Code-Standard AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP 5ab39b24bfd7f65203be9b7823b1840486f58b6d
Cyber-Tiel Coder, Alternative AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP fe05e871ec69ad9ae8eac01fd285555514ac7daf
  • AX-Code-Quelle: 205cb556b; die Auswahl verwendet mlx und die MXFP4-Gewichte des Herausgebers.
  • Host: Apple M3 Max, 137.438.953.472 Bytes Speicher; macOS 27.0, Build 26A428.
  • AX Engine: Release-Profil-Build von 51137c71a6794964d52c32c95e275c0923ed8d0b, MLX 0.32.2. Server-SHA-256: 1fbe7fc50ea16448f98350616273214c0475bffb3ef509fceb3f8849163e97f5.
  • MTPLX: 2.11.3, MLX 0.32.2, Python-3.12-Umgebung.
  • Beide Laufzeiten lesen denselben gemeinsamen Hugging-Face-Schnappschuss jedes Modells. Modelldownload, Gewichtsladen und Serverstart sind von den Phasenzeiten ausgeschlossen.

Die Pakete sind Entwicklungs-Requantisierungen. Diese Tests zertifizieren weder Modellqualität, numerische Gleichheit, Verhalten bei langem Kontext, andere Hardware noch die Leistung einer künftigen Veröffentlichung. Sie ersetzen die historische Qwen3.8-Matrix echter Clients nicht, die andere Modelle verwendete und eine andere Grenze maß.

Messverfahren

Der Prompt verlangt einen allgemeinen TypeScript-LRU-Cache und Tests, denen 8 oder 96 synthetische TypeScript-Funktionen vorausgehen. Die Nachrichten sind im JSON-Beleg gespeichert. Der festgehaltene Tokenizer jedes Modells rendert seine offizielle Chat-Vorlage mit enable_thinking=false und add_generation_prompt=true. Die resultierenden ganzzahligen Token werden unverändert an beide Backends gesendet. Die Ausgabe /tokenize von AX Engine wurde ebenfalls gegen diese IDs geprüft. Die Vorlage von Cyber-Tiel fügt Identitätstext hinzu, was seine zusätzlichen 25 Token erklärt. Eingaben über Backends hinweg stimmen innerhalb jedes Modells überein.

Anfragen verwenden Temperatur 0,55, top-p 1, top-k 0, Seed 0 und eine Grenze von 256 Token. Jedes Backend erhält vor seinen gemessenen Versuchen ein ausdrückliches Aufwärmen von 64 Token. MTPLX führt außerdem sein normales Aufwärmen bei Start und im Hintergrund aus. Ein Aufwärmen zählt nicht als Versuch. Die Laufreihenfolge war MTPLX/Tiel, AX Engine/Tiel, MTPLX/Cyber-Tiel, AX Engine/Cyber-Tiel. Nur ein Inferenz-Backend war gleichzeitig aktiv. Die Kompilierung endete, bevor gemessene Versuche begannen. Diese kleine Stichprobe fester Reihenfolge ist keine Dauer- oder gegengewichtete Wärmestudie.

AX Engine verwendet natives /v1/generate mit input_tokens und max_output_tokens. MTPLX verwendet gestreamtes /v1/completions mit einem Ganzzahl-Array prompt, gefolgt von /metrics. Das vermeidet Unterschiede in der Promptzusammensetzung des Clients und im Rendern der Chat-Vorlage zwischen den beiden Servern. Die gedeckelte Ausgabe ist eine Durchsatzlast, kein Korrektheitstest für vollständigen Code.

Messung AX Engine MTPLX
Prefill-Dauer ax_mlx_prefill_wall_us / 1e6 prompt_eval_time_s
Prefill-Rate Nicht zwischengespeicherte Eingabetoken / Prefill-Dauer prefill_compute_tok_s, geprüft gegen new_prefill_tokens / prompt_eval_time_s
Decode-Dauer ax_mlx_decode_wall_us / 1e6 decode_elapsed_s
Decode-Rate (output_tokens - 1) / decode duration; die erste Ausgabe gehört zum Prefill decode_tok_s, geprüft gegen completion_tokens / decode_elapsed_s
Cachenachweis Präfixcache mit AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0 deaktiviert; null wiederverwendete Token SSD-Sitzungscache aus; null zwischengespeicherte Token bei jedem Abschluss
MTP-Nachweis Erforderliche Richtlinie, aktiver Modell-Drafter, positive angenommene Token, null gemeldete direkte Rückfallschritte generation_mode=mtp, Tiefe 3, positive Zähler für Draft und Annahme

Die nativen Decode-Zähler haben leicht verschiedene Grenzen des ersten Tokens. Sie werden mit ihren tatsächlichen Formeln gemeldet, statt als identische Zeitgeber umbenannt zu werden. Keine Rate teilt die Ausgabe durch die gesamte HTTP-Anfragedauer. Die native TTFT von MTPLX bleibt im JSON. Die nicht streamende Probe von AX Engine misst keine Transport-TTFT.

Laufzeitkonfiguration

AX Engine verwendete das allgemeine Spekulationsprofil agentic, einen Kontext von 32.768 Token, ein angekündigtes Ausgabebudget von 8.192 Token, eine Planerbreite von 2.048 und eine gleichzeitige Anfrage. Die dichten, für Qwen3.8 spezifischen Umgebungsüberschreibungen von AX Code wurden nicht angewendet. Die zugelassene MTP-Tiefe war 3. Die normalen Draft-Gatter der Engine blieben aktiv.

Gleichwertige Startargumente, wobei SNAPSHOT auf den passenden festgehaltenen Schnappschuss und MODEL auf seinen AX-Code-Alias gesetzt ist:

AX_MLX_PREFIX_CACHE_MAX_ENTRIES=0 /path/to/fixed/ax-engine-server \
  --host 127.0.0.1 --port 18439 --model-id "$MODEL" \
  --mlx --mlx-model-artifacts-dir "$SNAPSHOT" \
  --mlx-mtp-policy required --speculation-profile agentic \
  --mlx-mtp-disable-ngram-stacking --max-concurrent-requests 1 \
  --max-batch-tokens 2048 --max-output-tokens 8192 \
  --block-size-tokens 16 --total-blocks 2048

mtplx serve --model "$SNAPSHOT" --model-id "$MODEL" \
  --host 127.0.0.1 --port 18442 --no-auth --agent-rewrites off \
  --max-tokens 8192 --context-window 32768 --reasoning off \
  --no-stats-footer --ssd-session-cache off --warmup-tokens 64 \
  --strict-warmup --fan-mode default --generation-mode mtp --load-mtp --depth 3

MTPLX verwendete eine leere isolierte Konfiguration. AX-Engine-Modellmanifeste wurden mit seinem festgehaltenen, nur lokalen Downloader vorbereitet. Die Modellgewichte und MTP-Tensoren des Herausgebers wurden behalten. Keine Konfiguration deaktivierte MTP, um ein Ergebnis zu erhalten.

Toolannahme von AX Code

Ein getrennter Quelllauf von AX Code bat jedes Modell, probe.txt mit dem Lesetool zu lesen und nur dessen Inhalt zurückzugeben. Zustand und Konfiguration waren isoliert. AX Engine verwendete eine ausdrückliche Loopback-Anbindung an den geprüften Quellserver. Diese Läufe sind von der Tabelle der nativen Phase ausgeschlossen.

Modell Laufzeit Abgeschlossenes Lesen Korrekte Markierung in der endgültigen Antwort Genaues Nur-Ausgabe-Format
Tiel AX-Engine-Quelle Ja Ja Nein; zusätzlicher Prosatext und ein Codezaun
Tiel MTPLX Ja Ja Ja
Cyber-Tiel AX-Engine-Quelle Ja Ja Nein; zusätzlicher Prosatext und ein Codezaun
Cyber-Tiel MTPLX Ja Ja Ja

Alle vier Clientprozesse endeten erfolgreich und schlossen einen echten Leseaufruf ab. Die beiden AX-Engine-Läufe verfehlten die strengere Anforderung an das Ausgabeformat, daher ist das keine durchgängig grüne Zertifizierung von Verhalten oder Coding-Qualität. Ihre Prompts, Toolnutzlasten, das Standardsampling und die Chatbehandlung sind Pfade von Client und Laufzeit, verschieden vom Phasenbenchmark mit zugeordneten Token. Für diese Tests wurde kein Verhalten von Cloud, CLI, privater GPU oder AX Trust angepasst.

Ein getrennter verwalteter Aufruf providers ax-engine start ließ das Modellargument weg und wählte tiel-coder-35b-axq-mxfp4 bei der festgehaltenen Revision mit mlx. Sein Live-Status meldete Toolunterstützung, die Richtlinie erforderlich/erforderlich für MTP, aktives MTP, 27 entworfene Token und 23 angenommene Token. Der verwaltete Server wurde danach erfolgreich gestoppt. Das verwendete isolierten AX-Code-Zustand und die Überschreibung AX_ENGINE_SERVER=/absolute/path/to/fixed/ax-engine-server der vorhandenen Hilfe. Die installierte Binärdatei und die Anbieterkonfiguration des Benutzers wurden nicht ersetzt. Dieselbe Überschreibung kann gesetzt werden, wenn pnpm run dev mit einem Build gestartet wird, der die Ladekorrektur enthält.

Die Katalogänderung bestand 11.374 deterministische Tests, mit 17 übersprungenen, plus 208 SDK-Tests, 259 Skripttests (94 übersprungen), rekursive Typprüfung, Prüfungen der Repository-Struktur und TUI-Prüfungen. Siehe Modellauswahl und Laufzeitanforderungen, bevor Sie den neuen Standard verwenden.