Diese Seite ist eine Übersetzung der englischen Dokumentation. Befehle, Bezeichner und Beispiele bleiben unverändert. Runtime 7.24.4 · SDK 2.6.7. Englische Fassung
Leistungskonfiguration und Diagnose
Status: Aktiv
Geltungsbereich: aktueller Stand
Zuletzt geprüft: 2026-09-13
Verantwortlich: ax-code runtime
Ein Werkzeugprofil wählen
Für Coding-Sitzungen, die keine Infrastrukturbetriebe, keine Zeitplanung, keine Bilderzeugung und keine spezialisierte Analyse brauchen,
setzen Sie toolProfile für den verbundenen Anbieter in Ihrer AX-Code-Konfiguration auf coding:
{
"provider": {
"your-provider-id": {
"options": {
"toolProfile": "coding"
}
}
}
}
Ersetzen Sie your-provider-id durch die Kennung des verbundenen Anbieters. Damit bleiben Dateiprüfung und Bearbeitung, Shell- und Hintergrundarbeit,
Delegation, Notebooks, Ziele, Skills, Speicher und die Prüfung von Reviews erhalten. Webwerkzeuge und optionale Werkzeuge folgen weiterhin
ihren bestehenden Regeln für Aktivierung und Berechtigung. Eigene Werkzeuge und MCP-Werkzeuge behalten ihre bestehenden Zulassungsregeln und können
die Anfragegröße erhöhen.
Verwenden Sie full, wenn Sie Council oder Arena, Betrieb, Zeitplanung, Bilderzeugung oder spezialisierte Analysewerkzeuge brauchen. Cloud-
Anbieter verwenden standardmäßig full; AX Engine behält die kleinere Voreinstellung core. coding ändert weder den Reasoning-Aufwand
noch Berechtigungen, die Snapshot-Erfassung oder Prüfungsanforderungen. Die Wirkung auf Geschwindigkeit und Aufgabenerfolg hängt vom Modell
und von der Arbeitslast ab. Siehe Modellaufwand für ausdrückliche Steuerung des Reasonings.
Lokale Vorbereitung von der Antwortzeit des Anbieters trennen
Aktivieren Sie die lokale Profilierung für einen Lauf:
AX_CODE_PROFILE_NATIVE=1 ax-code run --model your-provider-id/your-model "Your task"
ax-code session replay YOUR_SESSION_ID --mode export
Das Abschlussprofil auf stderr enthält session.insertReminders, session.preparePromptRequest, session.preflight,
session.resolveTools und die Snapshot-Spannen track/patch. Das sind zusammengefasste Messungen; verschachtelte oder überlappende Spannen
dürfen nicht als Wandzeit der Aufgabe addiert werden. Die Profilierung selbst erzeugt Messaufwand.
Aufgezeichnete Ereignisse llm.response erhalten ein optionales Objekt timing:
| Feld | Bedeutung |
|---|---|
boundary |
provider-adapter: am Modelladapter beobachtet, vor der Behandlung des Werkzeugergebnisses im SDK |
attempt |
Versuchsnummer des Adapters innerhalb dieses Aufrufs LLM.stream; die übrigen Felder beschreiben diesen Versuch |
setupMs |
Zeit vom Eintritt in LLM.stream bis zu dieser Weitergabe an den Adapter; bei Wiederholung einschließlich früherer Versuche und des Backoffs |
firstContentMs |
Von der Weitergabe bis zum ersten nicht leeren Delta für Text, Reasoning oder Werkzeugeingabe oder bis zum vollständigen Werkzeugaufruf |
firstTextMs |
Von der Weitergabe bis zum ersten nicht leeren Textdelta; fehlt bei einer Antwort nur mit Werkzeug oder nur mit Reasoning |
streamMs |
Von der Weitergabe bis zum Abschlussrahmen des Adapters; fehlt, wenn kein Abschlussrahmen beobachtet wurde |
Metadaten und Rahmen zum Start des Streams zählen nicht als Inhalt. Zeiten verwenden eine monotone Uhr und geben wieder, wann Blöcke
beobachtet werden, einschließlich Gegendruck im Stream. Es sind keine rohen Netzzeiten, keine Inferenzzeiten des Servers und keine Darstellungszeiten der TUI.
CLI-Adapter können die eigene Arbeit der untergeordneten CLI einschließen. Das bestehende latencyMs behält seine ältere gemischte Schrittzeit
und kann Werkzeugausführung sowie Snapshot-Arbeit einschließen. Neue Zeitfelder enthalten nur Dauern und die Identität des Versuchs.
Ohne AX_CODE_PROFILE_NATIVE=1 wird das zusätzliche Zeitobjekt weggelassen. Die Profilierung nutzt lokale Diagnose und das
bestehende Ereignisprotokoll der Sitzung; sie aktiviert keinen externen Exporter für Telemetrie.
Für einen nützlichen Vergleich halten Sie Aufgabe, Revision des Repositorys, Anbieterendpunkt, genaues Modell, Reasoning-Aufwand, Werkzeugberechtigungen und Cache-Bedingungen konstant. Zeichnen Sie die Zeit bis zur ersten sichtbaren Antwort und die Zeit bis zu einem geprüften Ergebnis auf, einschließlich Tests und Reparaturversuchen. Eine kleinere Anfrage oder ein schnellerer lokaler Snapshot allein belegt keinen schnelleren Abschluss einer Cloud-Aufgabe.
Nutzen Sie Harness-Steuerung und geprüfte Bewertung, um Kontextwiederherstellung, MCP-Ermittlung, nur lesende Rezepte und Vergleiche passender Fixtures mit unabhängiger Prüfung auszuprobieren.
Die Anfragegröße verstehen
Neue Ereignisse llm.request in ax-code session replay YOUR_SESSION_ID --mode export enthalten requestBytes, wenn die Herkunft der Anfrage verfügbar ist:
| Feld | Bedeutung |
|---|---|
encoding |
canonical-json-utf8: Bytelänge der bestehenden kanonischen Fingerabdruckdarstellung |
system |
Das getrennt zusammengestellte Array der Systemnachrichten |
messages |
Das vollständig zusammengestellte Nachrichtenarray, einschließlich der Systemnachrichten |
toolDefinitions |
Aktive Werkzeugnamen, Beschreibungen und aufgelöste Eingabeschemata |
system ist bereits in messages enthalten; addieren Sie beides nicht. Die Rahmung des Arrays ist eingeschlossen. Binärwerte verwenden die bestehende Digest-Darstellung, daher sind diese Größen weder Nutzlastgrößen im Netzwerk noch Messungen des residenten Speichers. Es sind keine Tokenzahlen: Die Token-Nutzung des Anbieters und die Cache-Zähler bleiben die Quelle für die Abrechnung der Modelleingabe. Eine Zusammenfassung des Kontextpakets deckt eine engere Stufe ab und ist nicht die gesamte Modelleingabe. Ältere Ereignisse lassen dieses Feld weg; eine fehlgeschlagene Herkunft bleibt ausdrücklich nicht verfügbar.
Diese Diagnose zeichnet nur Größen sowie die bestehenden Hashes und Metadaten auf. Es werden keine zusätzlichen Prompt-Inhalte und keine Zugangsdaten gespeichert. Sie verwendet die für jeden Hash nötige kanonische Serialisierung wieder, statt die Anfrage zu tokenisieren. Vergleichen Sie Größen an entsprechenden Zügen, wenn Sie entscheiden, ob Systemanweisungen, Werkzeugdefinitionen oder eine wachsende Historie Aufmerksamkeit brauchen. Das Coding-Profil oben kann Werkzeugdefinitionen verringern, ohne den Reasoning-Aufwand zu ändern; das Profil full bleibt für die Fähigkeiten verfügbar, die es hinzufügt.
Überflüssige Erkundung vermeiden
Für die Suche nach einer bekannten Datei oder eine einfache Zählung verwenden Sie eine gezielte Suche oder einen zusammenfassenden Befehl. Lösen Sie Pfade gegen das aktuelle Verzeichnis des Arbeitsbereichs auf; eine Sitzung, die innerhalb eines Pakets gestartet wurde, hat dieses Paket bereits als Suchwurzel. Das eingebaute grep verwendet die voreingestellte Regex-Syntax von ripgrep, ohne Lookaround und ohne Rückverweise.
Verwenden Sie eine untersuchende Instanz für einen Aufrufpfad. Parallele, nur lesende Aufgaben sollten unterschiedliche Liefergegenstände und eigene Pfade oder Teilsysteme haben, und bereits vorhandene Nachweise sollten in ihren Aufgabenbeschreibungen stehen. Eine unabhängige Prüfung kann Nachweise für eine getrennte Prüfungsfrage erneut ansehen. Erkundung in mehreren frischen Kontexten zu wiederholen kostet Modellrunden, auch wenn der Nachweis-Cache trifft; Cache-Treffer umgehen weder die Prüfung des aktuellen Inhalts noch die Berechtigungen.
Sprachserver starten nun standardmäßig erst bei Bedarf. Siehe Speicherverbrauch zur optionalen spekulativen Vorwärmung und zum Ausgleich mit der Latenz der ersten semantischen Abfrage. Hinweise im Prompt und lokale Tests belegen keine bestimmte Verringerung der live ausgeführten Modellaufrufe oder des physischen RAM.