AX Code holen · KostenlosDokumentation

Diese Seite ist eine Übersetzung der englischen Dokumentation. Befehle, Bezeichner und Beispiele bleiben unverändert. Runtime 7.24.4 · SDK 2.6.7. Englische Fassung

Aktuelle Steuerungen für das Reasoning des Modells

Status: Aktiv

Geltungsbereich: aktueller Stand

Zuletzt geprüft: 2026-09-14

Verantwortlich: ax-code runtime

AX Code wählt die Steuerungen für das Reasoning anhand der Modell-ID des Upstreams und des Protokolls des SDK. Diese Profile gelten für mit OpenAI kompatible Chat-Routen und genau die IDs unten. Sie bewahren das bestehende Verhalten von nativem SDK, privater GPU, AX Engine und eingeschränkten Gateways.

Modell-IDs Verfügbarer Aufwand Autonom oder wiederholter Fehlschlag des Werkzeugs Hilfsanfragen
qwen3.8-max, qwen3.8-flash low, medium, xhigh; high ist ein bestehender Alias für xhigh xhigh Denken aus
glm-5.3 low, high, max; deep ist ein Alias für max max Geringer Aufwand; Denken an
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash low, high, max high; ausdrückliches xdeep wählt max Denken aus
MiniMax-M3 Bestehender Schalter Denken / none; keine Stufen des Aufwands Voreinstellung des Anbieters für das Denken Denken aus
MiniMax-M2.7 Kein Schalter für Aufwand oder zum Abschalten Immer eingeschaltetes Denken Immer eingeschaltetes Denken

Ausdrückliche Optionen für das Reasoning von Modell oder Agent und gewählte Varianten überschreiben die automatische Richtlinie für den Aufwand. Eine negative Erklärung der Reasoning-Fähigkeit verhindert automatische Varianten des Aufwands und diese Steuerungen der Hilfsanfragen. GLM und DeepSeek behalten die Voreinstellung des Anbieters, wenn gewöhnliche Anfragen keinen Aufwand wählen. Hilfsanfragen nutzen eigene Steuerungen und ändern Ihre gespeicherte Auswahl nicht.

Konflikte bei Optionen von Qwen und erzwungene Werkzeuge

Qwen 3.8 akzeptiert entweder reasoning_effort oder thinking_budget, niemals beides. Ein ausdrückliches Budget für das Denken unterdrückt die automatische Wahl des Aufwands. Enthalten die zusammengeführten Optionen sowohl einen Aufwand als auch ein Budget, hat der Aufwand Vorrang. high und max werden auf xhigh normalisiert, minimal auf low, und none schaltet das Denken aus. Routen des Plans von Alibaba behalten ihre bestehende Obergrenze des Token-Budgets, einschließlich des begrenzten Rückfalls, wenn kein Aufwand gewählt ist. Diese Zuordnungen folgen der Chat-API von Alibaba.

Der Denkmodus von Qwen lehnt erzwungene Werkzeugaufrufe ab. Bei tool_choice: required schaltet AX Code das Denken für diese Anfrage aus und entfernt inkompatible Optionen für Aufwand, Budget und Bewahrung. Spätere automatische Werkzeugrunden nehmen den gewählten Aufwand wieder auf. Die bestehende Behandlung erforderlicher Werkzeuge bei DeepSeek hält das Denken für diese Anfrage ebenfalls aus, wie es die API des Denkmodus verlangt.

Kontinuität des Reasonings

Qwen, GLM und DeepSeek spielen gespeichertes Reasoning über reasoning_content erneut ab. Chat-Anfragen von MiniMax M2.7/M3 nutzen reasoning_split: true, damit das SDK das Reasoning getrennt empfängt und es genau wiedergeben kann. So wird Reasoning eines Gateways nicht in das Format <mm:think> überführt, das Bereitstellungen mit privater GPU nutzen. Ein ausdrückliches reasoning_split: false behält die native Wiedergabe von <think>. Signaturen von Anthropic und die Behandlung von Tags der privaten GPU behalten ihre bestehenden Wege. Siehe die Chat-API von MiniMax.

Das über die Runden hinweg bewahrte Denken von GLM bleibt über options.preserveThinking: true des Anbieters während geeigneter Anfragen für lange Agenten zuschaltbar. Es sendet thinking: { type: "enabled", clear_thinking: false }. Schalten Sie es nur für eine vollständige und unveränderte Historie desselben Modells ein; die abgerechnete Eingabe kann dadurch steigen. Die gewöhnliche Wiedergabe einer Werkzeugrunde verlangt dieses Zuschalten nicht. Z.ai dokumentiert die Anforderungen an die Bewahrung. GLM 5.3 denkt immer, daher nutzen Hilfsanfragen geringen Aufwand, statt das Denken abzuschalten. Steuerungen von GLM 5.3.

Eigene Bereitstellungen

Ein Gateway kann dieselbe Modell-ID mit einem anderen Dialekt der Parameter anbieten. Um das bisherige Verhalten der Umformung für ein Modell zu behalten, setzen Sie options.nativeReasoning: false in der Anbieterkonfiguration dieses Modells:

{
  "provider": {
    "my-gateway": {
      "models": {
        "glm-5.3": {
          "options": { "nativeReasoning": false }
        }
      }
    }
  }
}

Das ist ein lokales Abwählen des Profils und kein Befehl, das Denken des Modells abzuschalten. Der Wert wird entfernt, bevor die Anfrage gesendet wird. Bereits ausdrücklich konfigurierte Varianten bleiben Ihre Steuerungen. Das native SDK von DeepSeek erhält aus diesem Profil keine Varianten des Aufwands, weil der installierte Serializer sie nicht unterstützt.

Annahme durch die API, Fortsetzung der Werkzeuge und die genaue Wiedergabe durch den Client sind Belege der Kompatibilität. Sie belegen nicht, dass ein Upstream jeden Hinweis zum Aufwand beachtet, dass sein Cache öfter trifft oder dass Qualität oder Tempo beim Programmieren zunehmen. Nutzen Sie für Vergleiche auf Aufgabenebene die zugehörige Bewertung des Harness.