AX Code holen · KostenlosDokumentation

Diese Seite ist eine Übersetzung der englischen Dokumentation. Befehle, Bezeichner und Beispiele bleiben unverändert. Runtime 7.24.4 · SDK 2.6.7. Englische Fassung

Modellauswahl für AX Engine

Status: Aktiv Umfang: aktueller Stand Zuletzt geprüft: 2026-09-20 Verantwortlich: AX-Code-Laufzeit

AX Code bietet über AX Engine (Local) auf geeigneten Apple-Silicon-Macs nur diese beiden Entwicklungspakete an. Tiel Coder ist der Standard; Cyber-Tiel Coder ist die Alternative.

Modell Hugging-Face-Repository Auswahl in AX Code
Tiel Coder 35B A3B MXFP4 MTP AutomatosX/AX-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP tiel-coder-35b-axq-mxfp4 (Standard)
Cyber-Tiel Coder 35B A3B MXFP4 MTP AutomatosX/AX-Cyber-Tiel-Coder-35B-A3B-MLX-AXQ-MXFP4-MTP cyber-tiel-coder-35b-axq-mxfp4

Die Aliase legen die Revisionen 5ab39b24bfd7f65203be9b7823b1840486f58b6d und fe05e871ec69ad9ae8eac01fd285555514ac7daf fest. Beide verwenden den Selektor mlx und bewahren das MXFP4-Paket des Herausgebers. Die Modellkarten beschreiben Entwicklungs-Requantisierungen ohne zertifizierte Aussage zu Qualitätsgleichheit oder MTP-Geschwindigkeit. Ihre Auswahl belegt weder native Ausführung noch eine Geschwindigkeitsverbesserung.

AX Code bündelt die signierte AX Engine 7.5.7-Veröffentlichung, die die Korrektur des Tiel-Sidecar-Namespace-Laders aus Commit 51137c71a6794964d52c32c95e275c0923ed8d0b enthält. Ältere Homebrew-Binärdateien 7.4.0 haben diese Korrektur nicht und lehnen diese Pakete mit MlxMtpRequiredButUnavailable ab. Lassen Sie MTP erforderlich. Ausdrückliche Laufzeitüberschreibungen müssen die Korrektur ebenfalls enthalten. Die nativen Messungen von Prefill und Decode behalten die ursprünglich geprüfte Build-Identität und zertifizieren die Leistung der neueren Veröffentlichung nicht.

Qwen3.8 27B, Ornith, Qwen3-Coder-Next und alle anderen Repositories sind von neuer verwalteter Auswahl und von Downloads ausgeschlossen. Jedes ausgewählte Repository erscheint einmal. Konfigurierte Aliase und ältere zwischengespeicherte Revisionen fügen nach der Erkennung keine Wahlmöglichkeiten hinzu. Andere Anbieter und die getrennt konfigurierte Loopback-Anbindung behalten ihr Verhalten. Um den eigenen dichten Standard von AX Engine auszuführen, starten Sie ax-engine serve qwen3.8-27b:axq und binden Sie diesen lokalen Endpunkt an. Gemessenes MTP auf dem Produktpfad ist 31.05 tok/s Decode auf dem Mac mini M4 Pro mit 64 GB und 76.90 tok/s Decode / 795.3 tok/s Prefill auf dem M5 Max mit 128 GB. Diese Zahlen sind keine Tiel-Abschluss-tok/s und keine Sitzungsgeschwindigkeit von AX Code. Siehe Tiel-Vergleichszusammenfassung.

Die verfügbaren Modelle prüfen

ax-code providers ax-engine models --json
ax-code providers ax-engine models --refresh --json

Das Aktualisieren liest Hugging-Face-Metadaten, ohne Gewichte herunterzuladen oder ein Modell zu starten. Die gebündelten Metadaten funktionieren offline und ergänzen das ausgewählte Repository, wenn es in einem älteren Cache fehlt. Vorhandene Revisionen werden nicht stillschweigend durch eine andere gebündelte Revision ersetzt. Die Auswahl verlangt weiterhin gültige Quellmetadaten. Die Repository-Beschränkung belegt keine native Fähigkeit.

GET /provider/ax-engine/models liefert den Katalog der laufenden CLI, einschließlich der genauen ID jedes Modells, des Repositorys, der Quantisierung, des lokalen Zustands, der Schätzungen für Speicher und Platte sowie des Prüfstatus. Eine externe Oberfläche verwendet diese Laufzeit-API. Wenn sie eine ältere Liste zeigt, prüfen Sie die CLI, die sie startet, und deren Version. Die Entwicklung von AX Coder kann eine Quelllaufzeit mit AX_CODE_BINARY oder settings.axCodeBinary wählen.

Das ausgewählte Modell vorbereiten

Kopieren Sie die genaue Modell-ID aus dem Katalog. Der Standardalias von Tiel verwendet mlx:

ax-code providers ax-engine prepare \
  --model tiel-coder-35b-axq-mxfp4 --quantization mlx --download --start

Ausgeschlossene Modelle lassen neue Anforderungen für Vorbereitung, Download und verwaltete Aktivierung fehlschlagen, bevor Arbeit beginnt. Vorhandene Modelldatensätze bleiben für Status und Aufräumen verfügbar. Entfernte IDs von Qwen3.8, Ornith und Qwen3-Coder-Next werden nie auf eines der beiden Tiel-Artefakte umgeleitet. Das Entfernen einer Option löscht ihre Gewichte nicht und stoppt keinen vorhandenen Server.

Speicher und Laufzeitprüfung

Beide ausgewählten Aliase verwenden einen Kontext von 65.536 Token, eine Ausgabegrenze von 8.192 Token, einen geschätzten Speicherbedarf von 64 GiB und ein Download-Plattenbudget von 32 GiB. Das sind Bereitstellungsgrenzen von AX Code, nicht der maximale Upstream-Kontext. (Angehoben von einem anfänglichen Kontext von 32.768 Token: Danach blieben nach der Ausgaberreserve nur 24.576 nutzbare Eingabetoken, weniger als der feste Systemprompt des AX-Code-Agenten und die Tool-Schemata verlangen, sodass eine ganz neue Sitzung nie eine erste Runde senden konnte.)

Jede Speicherschätzung umfasst Gewichte, Sidecars, KV-Cache, Puffer und Hostreserve. Verwenden Sie das Passergebnis des live Katalogs für den aktuellen Rechner. Diese Schätzungen sind keine Zertifizierung von Hardware oder Modellqualität.

Die Angabe von 64 GiB ist ein vorsichtiges Planungsbudget für den vollen Kontext (64K), kein hartes Minimum. Für einen komfortablen Rechner mit verwalteter lokaler Inferenz empfehlen wir einen Apple Silicon M4 Pro mit 48 GB gemeinsamem Speicher oder mehr (zum Beispiel einen Mac Mini M4 Pro mit 48 GB). Kleinere Apple-Silicon-Macs können AX Code selbst ab 8 GB mit Cloud- oder API-Modellen oder leichteren lokalen Laufzeiten weiterhin ausführen.

Vor der verwalteten Aktivierung prüft AX Code den Vertrag des aktiven AX-Engine-Modells für Text und strukturierte Tools. Ein Zustand verification-required bedeutet, dass die Vorbereitung abgeschlossen ist, dieser Live-Vertrag aber noch nicht hergestellt wurde. Repository-Namen oder MTP-Sidecars allein beweisen weder Schlussfolgern, Bildverstehen, MTP-Beschleunigung noch Qualität beim Programmieren über mehrere Runden.

Die Sitzungskompaktierung verwendet die Kontext- und Ausgabebudgets des aktiven Modells und reserviert Eingabespielraum. Die ausgewählte Variante behält ihr eigenes Katalogbudget. Der maximale Kontext des Quellmodells ist keine Garantie für verwalteten Speicher.

Siehe Architektur der lokalen Engine für Lebenszyklus und Transport.

Verwaltete MTP-Richtlinie

Verwaltetes AX Engine verwendet standardmäßig required, passend zum ausgewählten MTP-Artefakt. Ein nicht verfügbarer Drafter lässt den Start fehlschlagen, statt still auf direkte Dekodierung zurückzufallen. MTP-Gewichte und die Einstellung für reines Stapeln belegen keine aktive Beschleunigung. Das Standardpaket Tiel Coder verwendet das Spekulationsprofil auto, damit AX Engine das Draft-Gatter des Modells wählt statt der Überschreibung 0,80 des allgemeinen Profils agentic. Das ist von der MTP-Aktivierungsrichtlinie getrennt: Die Abstimmung von auto verwendet weiterhin MTP required. Die alte dichte, für Qwen3.8 spezifische experimentelle Umgebung wird auf diese MoE-Pakete nicht angewendet. Siehe den Profilvergleich für gemessene Zuwächse. Cyber-Tiel behält agentic. Verwaltete Lesetests sind mit beiden Profilen fehlgeschlagen, daher bleibt seine Aufgabenzuverlässigkeit ungeklärt. Die Aktivierungsrichtlinie bleibt required. Die Engine muss den tatsächlichen Drafter zulassen. Um eine Richtlinie ausdrücklich zu wählen, setzen Sie provider.ax-engine.options.mtpPolicy in ax-code.json:

{
  "provider": {
    "ax-engine": {
      "options": {
        "mtpPolicy": "required"
      }
    }
  }
}
Richtlinie Verhalten
disabled Direkte Dekodierung verwenden und keinen Modell-Drafter anfordern.
auto AX Engine entscheiden lassen, ob Modell und Route MTP zulassen. Das garantiert keine Aktivierung.
required (Standard) Einen zugelassenen MTP-Drafter verlangen. AX Engine lehnt einen nicht verfügbaren Drafter ab, statt still zurückzufallen.

AX_ENGINE_MTP_POLICY stellt dieselben drei Werte bereit, wenn keine Anbieteroption gesetzt ist. Die automatische Laufzeitauswahl verlangt AX Engine 7.5.7 oder neuer, um diese Richtlinien durchzusetzen, einschließlich der Standardrichtlinie required. Ausdrückliche Einstellungen disabled und auto überschreiben den Standard weiterhin. Ältere oder unbekannte Binärdateien lehnen die Richtlinienauswahl ab, bevor sie eine laufende Engine ersetzen. Aktualisieren Sie, bevor Sie die verwalteten Richtliniensteuerungen verwenden. Historische Zustandsdateien ohne aufgezeichnete Richtlinie melden ihre gestartete Richtlinie als unbekannt und werden beim nächsten verwalteten Start ersetzt. Eine Richtlinienänderung wirkt beim nächsten verwalteten Start oder bei der nächsten Modellanfrage und ersetzt einen vorhandenen Prozess mit einer anderen Richtlinie. sie ändert nicht die Modellauswahl oder den Speicher.

ax-code providers ax-engine start --mtp-policy disabled überschreibt die Richtlinie nur für diesen Start. Setzen Sie die dauerhafte Anbieteroption, wenn spätere Coding-Anfragen dieselbe Überschreibung verwenden sollen. Die HTTP-Körper für Vorbereitung und Start akzeptieren ebenfalls mtpPolicy. Diese verwalteten Einstellungen konfigurieren getrennt angebundene Endpunkte nicht neu. Starten Sie nach einer Quellaktualisierung pnpm run dev neu, um den neuen Standard zu laden. Ein bereits laufendes Entwicklungs-Backend behält seinen geladenen Code bis zum Neustart.

ax-code providers ax-engine status (oder --json) trennt die angeforderte Richtlinie, die gestartete Richtlinie und den beobachteten Zustand active/inactive/unknown. Die Beobachtung verwendet die jüngste Modellrouten-Metrik der Engine, nicht Modellmetadaten oder historische Draft-Zählungen. Fehlende Stichproben des genauen Modells bleiben unbekannt, auch vor dem ersten beobachteten Engine-Schritt. Serverweite Aggregate belegen keine Aktivierung. Konfiguriertes required wird nicht als Beweis für Aktivität angezeigt. Draft- und akzeptierte Zählungen sind, soweit verfügbar, kumulativ für die residente Engine. Eine ausstehende Richtlinienänderung wird gemeldet, ohne die Engine während der Statusprüfung neu zu starten. MTP-Aktivierung ist kein Versprechen einer bestimmten Tokenrate.

Lokale Antwortgeschwindigkeit deuten

Verwaltetes AX Engine setzt keine Obergrenze für Token je Sekunde. Eine Messung wie 50 tok/s ist weder ein konfiguriertes Ziel noch eine Obergrenze: Schnellere Hardware kann Token schneller erzeugen. Kontextgröße, Ausgabebudgets und Grenzen der Anfragenebenläufigkeit steuern die Kapazität, nicht eine feste Erzeugungsrate von Token.

Der aktuelle öffentliche Schnappschuss von Tiel gegenüber MTPLX ist die Kampagne der nativen API vom 20. September 2026, zusammengefasst in der Tiel-Vergleichszusammenfassung. Auf dem M5 Max mit 128 GiB schloss das verwaltete Standardpaket Tiel mit 194.88 tok/s einschließlich TTFT ab (Decode 217.85). Der Spitzen-Decode von Cyber-Tiel mit 249.01 tok/s ist das Alternativpaket, nicht der Standard. Diese Zahlen sind nicht die Sitzungsgeschwindigkeit von AX Code.

Vergleichen Sie Messungen bei derselben Eingabelänge, demselben Ausgabebudget, denselben Sampling-Einstellungen und demselben Cache-Zustand. Decode-Messungen mit kurzem Prompt belegen keine Mindestrate für eine Coding-Sitzung mit Zehntausenden Kontexttoken. Die Wiederverwendung eines Präfixes verringert die Promptverarbeitung. Die folgende Dekodierung berücksichtigt diesen Kontext weiterhin. MTP-Aktivierung allein belegt weder eine nützliche Draft-Annahme noch eine feste Beschleunigung.

Trennen Sie bei der Untersuchung einer langsamen Runde Start und Einrichtung, Zeit bis zum ersten Inhalt und anhaltende Erzeugung. Die Metrik ax_runtime_decode_tok_per_sec der Engine ist ein exponentiell gewichteter Mittelwert über Anfragen, nicht die Rate der aktuellen Antwort. Verwenden Sie für diese Antwort Anfragezeiten und Tokenzahlen sowie Zählerdifferenzen für ihre MTP-Annahme. Streaming-Blöcke können mehrere Token enthalten. Blöcke als Token zu zählen ergibt eine falsche Rate.

AX Code verwendet erfolgreiche Prüfungen der ausführbaren Version bis zu fünf Minuten wieder. Es prüft die Verfügbarkeit der ausführbaren Datei bei jeder Auflösung und macht zwischengespeicherte Versionen ungültig, wenn sich die Dateiidentität von Starter oder nativem Server ändert. Fehlgeschlagene Prüfungen bleiben wiederholbar. Das verringert wiederholte Einrichtungsarbeit. Es ändert nicht die Decode-Geschwindigkeit des Modells. Ein Entwicklungs-Backend muss neu gestartet werden, um Quelländerungen zu laden.