Эта страница переведена с английской документации. Команды, идентификаторы и примеры не изменены. Среда выполнения 7.24.4 · SDK 2.6.7. Английский оригинал
Управление рассуждением текущей модели
Статус: активно
Область: текущее состояние
Последняя проверка: 2026-09-14
Владелец: среда выполнения ax-code
AX Code выбирает параметры рассуждения по вышестоящему идентификатору модели и протоколу SDK. Эти профили охватывают маршруты Chat, совместимые с OpenAI, для точных идентификаторов ниже. Они сохраняют существующее поведение нативного SDK, частного GPU, AX Engine и ограниченного шлюза.
| Идентификаторы моделей | Доступное усилие | Автономный режим / повторный сбой инструмента | Вспомогательные запросы |
|---|---|---|---|
qwen3.8-max, qwen3.8-flash |
low, medium, xhigh; high — существующий псевдоним xhigh | xhigh | Рассуждение отключено |
glm-5.3 |
low, high, max; deep — псевдоним max | max | Низкое усилие; рассуждение включено |
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash |
low, high, max | high; явный xdeep выбирает max | Рассуждение отключено |
MiniMax-M3 |
Существующий переключатель thinking / none; уровней усилия нет | Рассуждение провайдера по умолчанию | Рассуждение отключено |
MiniMax-M2.7 |
Нет ни усилия, ни выключателя | Рассуждение всегда включено | Рассуждение всегда включено |
Явные параметры рассуждения модели или агента и выбранные варианты перекрывают автоматическую политику усилия. Отрицательное объявление возможности рассуждения запрещает автоматические варианты усилия и эти вспомогательные элементы управления. GLM и DeepSeek сохраняют значение провайдера по умолчанию, если обычные запросы не выбирают усилие. Вспомогательные запросы используют собственные параметры и не меняют сохранённый выбор пользователя.
Конфликты параметров Qwen и принудительные инструменты
Qwen 3.8 принимает либо reasoning_effort, либо thinking_budget, но никогда оба сразу. Явный бюджет рассуждения подавляет автоматический выбор усилия. Если в объединённых параметрах есть и усилие, и бюджет, побеждает усилие. high и max нормализуются к xhigh, minimal — к low, а none отключает рассуждение. Маршруты плана Alibaba сохраняют существующий потолок бюджета токенов, включая ограниченный запасной вариант, когда усилие не выбрано. Эти соответствия следуют Chat API Alibaba.
Режим рассуждения Qwen отвергает принудительные вызовы инструментов. Для tool_choice: required AX Code отключает рассуждение на этот запрос и убирает несовместимые параметры усилия, бюджета и сохранения. Последующие автоматические ходы инструментов возобновляют выбранное усилие. Существующая обработка обязательного инструмента DeepSeek также оставляет рассуждение выключенным на этот запрос, как требует его API режима рассуждения.
Непрерывность рассуждения
Qwen, GLM и DeepSeek воспроизводят сохранённое рассуждение через reasoning_content. Запросы Chat MiniMax M2.7/M3 используют reasoning_split: true, чтобы SDK получал рассуждение отдельно и мог воспроизвести его точно. Это не превращает рассуждение шлюза в формат <mm:think>, которым пользуются частные развёртывания GPU. Явный reasoning_split: false сохраняет нативное воспроизведение <think>. Подписи Anthropic и обработка тегов частного GPU сохраняют существующие пути. См. Chat API MiniMax.
Сохранённое между ходами рассуждение GLM остаётся необязательным через options.preserveThinking: true провайдера во время подходящих запросов долгого агента. Оно отправляет thinking: { type: "enabled", clear_thinking: false }. Включайте его только для полной неизменённой истории той же модели; это может увеличить оплачиваемый вход. Обычное воспроизведение хода инструмента этого согласия не требует. Z.ai описывает требования к сохранению. GLM 5.3 рассуждает всегда, поэтому вспомогательные запросы используют низкое усилие, а не отключение. Параметры GLM 5.3.
Пользовательские развёртывания
Шлюз может отдать тот же идентификатор модели с другим диалектом параметров. Чтобы сохранить прежнее поведение преобразования для модели, задайте options.nativeReasoning: false в конфигурации провайдера этой модели:
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
Это локальный отказ от профиля, а не команда отключить рассуждение модели. Значение удаляется до отправки запроса. Уже явно настроенные варианты остаются управлением пользователя. Нативный SDK DeepSeek не получает варианты усилия из этого профиля, потому что установленный сериализатор их не поддерживает.
Принятие API, продолжение инструментов и точное воспроизведение клиентом — свидетельство совместимости. Они не доказывают, что вышестоящая сторона учитывает каждую подсказку усилия, что кэш попадает чаще или что качество либо скорость кодирования растут. Для сравнений на уровне задач используйте парную оценку обвязки.