Obter AX Code · GrátisDocumentação

Esta página é uma tradução da documentação em inglês. Comandos, identificadores e exemplos permanecem iguais. Runtime 7.24.4 · SDK 2.6.7. Original em inglês

Runtimes locais MTPLX e oMLX

Status: Ativo

Escopo: integração a partir do checkout do código-fonte

Última revisão: 2026-09-19

Responsável: runtime do ax-code

O checkout do código-fonte inclui predefinições separadas de MTPLX (mtplx) e de oMLX (omlx) em /connect → Runtime de LLM local. Essas predefinições não estão nos binários empacotados da v7.19.3. Elas se conectam a um servidor que já está em execução; o AX Code não instala, não inicia e não ajusta esses runtimes.

Conectar

  1. Inicie o runtime e carregue um modelo que suporte ferramentas de programação. Siga as instruções do MTPLX ou as instruções do oMLX.
  2. Selecione MTPLX ou oMLX no menu de runtime local do AX Code e confirme o endpoint do servidor.
  3. Selecione um modelo capaz de programar. Os IDs de modelo vêm da resposta GET /v1/models do servidor.
Runtime ID do provedor Endpoint padrão da API Substituição de host no AX Code
MTPLX mtplx http://localhost:8000/v1 MTPLX_HOST
oMLX omlx http://localhost:8000/v1 OMLX_HOST

Os dois servidores upstream usam a porta 8000 por padrão. Execute um de cada vez, ou atribua portas diferentes e salve esses endpoints em separado. O AX Code acrescenta /v1 uma vez, se estiver omitido. Um endpoint salvo tem precedência sobre a substituição de host. Listar uma predefinição não a sonda nem a ativa. As listas existentes de ativar e desativar provedores continuam autoritativas; se você usa uma lista de permissão, acrescente o ID novo sem remover os outros provedores.

Exemplos com portas explícitas:

mtplx serve --model /path/to/your/mtplx-model --host 127.0.0.1 --port 8000
omlx serve --model-dir /path/to/your/models --host 127.0.0.1 --port 8001

Use o endpoint correspondente ao servidor que você iniciou. Inspecione os IDs de modelo com curl http://localhost:8000/v1/models (altere a porta conforme a sua configuração).

Ferramentas de programação e autenticação

A listagem nativa de chat do MTPLX identifica owned_by: "mtplx" e capability: "chat" à parte dos modelos de recuperação. O AX Code admite esse transporte de chat para uso de ferramentas, a menos que ele desative as ferramentas de forma explícita. Uma listagem genérica ou não reconhecida conserva padrões conservadores.

A listagem de modelos do oMLX não declara suporte a ferramentas por modelo e pode incluir modelos que não são de chat. Ative ferramentas somente para um modelo cujo template de chat as suporte. Acrescente isto à configuração do AX Code, substituindo pelo ID exato de modelo devolvido pelo servidor:

{
  "provider": {
    "omlx": {
      "options": { "baseURL": "http://localhost:8001/v1" },
      "models": {
        "your-tool-capable-model-id": { "tool_call": true }
      }
    }
  }
}

A escolha explícita de ferramentas sobrevive à descoberta. Os outros modelos descobertos não são promovidos a modelos de programação. O max_model_len nativo do oMLX é usado como limite de contexto, quando está presente. Configurações do amostrador do runtime, a ativação do MTP e os limites de saída no servidor continuam sob o runtime.

Para um servidor que exige autenticação, defina provider.mtplx.options.apiKey ou provider.omlx.options.apiKey na configuração, por exemplo "{env:OMLX_API_KEY}". O AX Code envia essa credencial bearer configurada tanto na descoberta quanto na inferência. O diálogo do endpoint local não pede um token. Não coloque credenciais na URL do endpoint.

MTP Qwen do AXQuant no oMLX

Os pacotes MTP Qwen do AXQuant incluem um head separado mtp.safetensors e um contrato de execução mtplx_runtime.json. Metadados recentes também incluem axquant_omlx_compat.json, que lista os 15 tensores MTP deste pacote 27B. Esses arquivos descrevem compatibilidade; ativar só o Lightning MTP não importa o head.

No oMLX 0.6.4, use uma cópia local completa e gravável do modelo. Em Configurações do modelo, selecione Importar sidecar MTP e depois ative Lightning MTP. O importador upstream prepara um fragmento MTP e atualiza o índice de checkpoint dessa cópia local. Mantenha intacto o pacote original baixado para outros runtimes; não edite no lugar um instantâneo compartilhado do cache do Hugging Face. Veja as instruções do modelo AXQuant. O AX Code se conecta ao servidor preparado e não modifica pesos do modelo nem faz essa importação.

Desempenho e escopo

Conexões MTPLX e oMLX em loopback recebem o comportamento local de estabilidade de prefixo: ordenação determinística das ferramentas e contexto transitório depois do histórico da conversa. Endpoints remotos e conexões administradas pelo AX Trust conservam o comportamento existente; configurações de nuvem e do AX Trust não são alteradas por estas predefinições.

Veja o reteste dos clientes AX Code e OpenCode para a matriz completa com MTP ativado depois da correção de prefixo local, inclusive hardware, versões, identidade do modelo, estado do cache, definições de tempo e verificações de código. As medições anteriores do runtime conservam reproduções nativas de decode e resultados históricos de cliente. Uma conexão compatível com OpenAI em funcionamento não estabelece a qualidade de programação de um modelo nem garante uma taxa de decode.