이 페이지는 영어 문서의 번역입니다. 명령, 식별자, 예제는 그대로입니다. 런타임 7.24.4 · SDK 2.6.7. 영어 원문
현재 모델 추론 제어
상태: 활성
범위: 현재 상태
최종 검토: 2026-09-14
담당: ax-code 런타임
AX Code는 업스트림 모델 ID와 SDK 프로토콜을 기준으로 추론 제어를 선택합니다. 이 프로필은 아래에 적힌 정확한 ID의 OpenAI 호환 Chat 경로를 다룹니다. 기존 네이티브 SDK, 프라이빗 GPU, AX Engine, 제약이 있는 게이트웨이 동작은 그대로 유지합니다.
| 모델 ID | 사용 가능한 effort | 자율 실행 / 반복된 도구 실패 | 보조 요청 |
|---|---|---|---|
qwen3.8-max, qwen3.8-flash |
low, medium, xhigh. high는 xhigh의 기존 별칭입니다 | xhigh | 사고 비활성화 |
glm-5.3 |
low, high, max. deep는 max의 별칭입니다 | max | 낮은 effort, 사고 활성화 |
deepseek-v4-pro, deepseek-v4-flash, deepseek-flash |
low, high, max | high. 명시적 xdeep는 max를 선택합니다 | 사고 비활성화 |
MiniMax-M3 |
기존 thinking / none 전환. effort 수준 없음 | 공급자 사고 기본값 | 사고 비활성화 |
MiniMax-M2.7 |
effort나 비활성화 전환 없음 | 항상 켜진 사고 | 항상 켜진 사고 |
명시적인 모델 및 에이전트 추론 옵션과 선택한 변형은 자동 effort 정책을 덮어씁니다. 추론 능력을 부정으로 선언하면 자동 effort 변형과 이 보조 제어가 적용되지 않습니다. 일반 요청이 effort를 선택하지 않으면 GLM과 DeepSeek는 공급자 기본값을 유지합니다. 보조 요청은 사용자가 저장한 선택을 바꾸지 않고 자체 제어를 사용합니다.
Qwen 옵션 충돌과 강제 도구
Qwen 3.8은 reasoning_effort 또는 thinking_budget 중 하나만 받으며, 둘을 동시에 받지 않습니다. 명시적인 thinking 예산은 자동 effort 선택을 막습니다. 병합된 옵션에 effort와 예산이 모두 있으면 effort가 우선합니다. high과 max은 xhigh로, minimal은 low로 정규화되며, none는 사고를 끕니다. Alibaba 플랜 경로는 기존 토큰 예산 상한을 유지하며, effort를 선택하지 않았을 때의 제한된 폴백도 포함합니다. 이 대응은 Alibaba Chat API를 따릅니다.
Qwen 사고 모드는 강제 도구 호출을 거부합니다. tool_choice: required에서는 AX Code가 그 요청의 사고를 끄고, 호환되지 않는 effort, 예산, 보존 옵션을 제거합니다. 이후의 자동 도구 턴은 선택한 effort를 다시 적용합니다. 기존 DeepSeek 필수 도구 처리도 그 요청에서는 사고를 끈 채로 두며, 이는 thinking-mode API가 요구하는 동작입니다.
추론 연속성
Qwen, GLM, DeepSeek는 reasoning_content을 통해 저장된 추론을 다시 재생합니다. MiniMax M2.7/M3 Chat 요청은 reasoning_split: true을 사용하여, SDK가 추론을 분리된 형태로 받고 그대로 재생할 수 있게 합니다. 이렇게 하면 게이트웨이 추론이 프라이빗 GPU 배포에서 쓰는 <mm:think> 형식으로 바뀌지 않습니다. 명시적인 reasoning_split: false은 네이티브 <think> 재생을 유지합니다. Anthropic 서명과 프라이빗 GPU 태그 처리는 기존 경로를 유지합니다. MiniMax의 Chat API를 보십시오.
GLM의 턴 간 보존 사고는 대상이 되는 장기 에이전트 요청 동안 공급자 options.preserveThinking: true로 선택해서 켭니다. 이 설정은 thinking: { type: "enabled", clear_thinking: false }을 보냅니다. 같은 모델에서 온, 완전하고 수정되지 않은 기록에만 켜십시오. 청구되는 입력이 늘어날 수 있습니다. 일반적인 도구 턴 재생에는 이 선택적 사용이 필요하지 않습니다. Z.ai는 보존 요구 사항을 문서화합니다. GLM 5.3은 항상 추론하므로, 보조 요청은 사고를 끄지 않고 낮은 effort를 사용합니다. GLM 5.3 제어.
사용자 지정 배포
게이트웨이는 다른 매개변수 형식으로 같은 모델 ID를 노출할 수 있습니다. 어떤 모델의 이전 변환 동작을 유지하려면 해당 모델의 공급자 구성에 options.nativeReasoning: false를 설정합니다.
{
"provider": {
"my-gateway": {
"models": {
"glm-5.3": {
"options": { "nativeReasoning": false }
}
}
}
}
}
이것은 모델 사고를 끄라는 명령이 아니라, 로컬 프로필을 제외하는 설정입니다. 요청을 보내기 전에 제거됩니다. 이미 명시적으로 구성한 변형은 사용자 제어로 남습니다. 네이티브 DeepSeek SDK는 설치된 직렬화기가 effort 변형을 지원하지 않으므로, 이 프로필에서 해당 변형을 얻지 않습니다.
API 수용, 도구 연속, 정확한 클라이언트 재생은 호환성의 증거입니다. 업스트림이 모든 effort 힌트를 따르거나, 캐시 적중이 더 잦거나, 코딩 품질이나 속도가 나아진다는 증거는 아닙니다. 작업 단위 비교에는 짝을 이루는 하네스 평가를 사용합니다.