Questa pagina è tradotta dalla documentazione inglese. Comandi, identificatori ed esempi restano invariati. Runtime 7.24.4 · SDK 2.6.7. Testo inglese
Runtime locali MTPLX e oMLX
Stato: attivo
Ambito: integrazione del checkout del sorgente
Ultima revisione: 2026-09-19
Responsabile: runtime di ax-code
Il checkout del sorgente include preset separati MTPLX (mtplx) e oMLX (omlx) sotto /connect → Runtime LLM locale. Questi preset non sono inclusi nei binari pacchettizzati v7.19.3. Si collegano a un server già in esecuzione; AX Code non installa, non avvia e non mette a punto questi runtime.
Connetti
- Avvia il runtime e carica un modello che supporta gli strumenti di programmazione. Segui le istruzioni MTPLX o le istruzioni oMLX.
- Seleziona MTPLX o oMLX nel menu dei runtime locali di AX Code e conferma l’endpoint del server.
- Seleziona un modello capace di programmazione. Gli ID dei modelli provengono dalla risposta
GET /v1/modelsdel server.
| Runtime | ID del provider | Endpoint API predefinito | Override dell’host in AX Code |
|---|---|---|---|
| MTPLX | mtplx |
http://localhost:8000/v1 |
MTPLX_HOST |
| oMLX | omlx |
http://localhost:8000/v1 |
OMLX_HOST |
Entrambi i server upstream usano per impostazione predefinita la porta 8000. Eseguili uno alla volta, oppure assegna porte diverse e salva quegli endpoint separatamente. AX Code accoda /v1 una sola volta se è omesso. Un endpoint salvato ha la precedenza sull’override dell’host. Elencare un preset non lo sonda né lo attiva. Gli elenchi esistenti di abilitazione e disabilitazione dei provider restano autorevoli; se usi un elenco consentiti, aggiungi il nuovo ID senza rimuovere gli altri provider.
Esempi con porte esplicite:
mtplx serve --model /path/to/your/mtplx-model --host 127.0.0.1 --port 8000
omlx serve --model-dir /path/to/your/models --host 127.0.0.1 --port 8001
Usa l’endpoint corrispondente al server che hai avviato. Ispeziona i suoi ID di modello con curl http://localhost:8000/v1/models (cambia la porta per la tua configurazione).
Strumenti di programmazione e autenticazione
L’elenco chat nativo di MTPLX identifica owned_by: "mtplx" e capability: "chat" separatamente dai modelli di recupero. AX Code ammette quel trasporto chat per l’uso degli strumenti, salvo che disabiliti esplicitamente gli strumenti. Un elenco generico o non riconosciuto conserva impostazioni predefinite conservative.
L’elenco dei modelli di oMLX non dichiara il supporto agli strumenti per modello e può includere modelli non chat. Abilita gli strumenti solo per un modello il cui template di chat li supporta. Aggiungi questo alla configurazione di AX Code, sostituendo l’ID esatto del modello restituito dal tuo server:
{
"provider": {
"omlx": {
"options": { "baseURL": "http://localhost:8001/v1" },
"models": {
"your-tool-capable-model-id": { "tool_call": true }
}
}
}
}
La scelta esplicita degli strumenti sopravvive alla scoperta. Gli altri modelli scoperti non vengono promossi a modelli di programmazione. Il max_model_len nativo di oMLX viene usato per il limite di contesto quando è presente. Le impostazioni del campionatore del runtime, l’abilitazione MTP e i limiti di output lato server restano di proprietà del runtime.
Per un server che richiede autenticazione, imposta provider.mtplx.options.apiKey o provider.omlx.options.apiKey nella configurazione, per esempio "{env:OMLX_API_KEY}". AX Code invia quella credenziale bearer configurata sia per la scoperta sia per l’inferenza. La finestra dell’endpoint locale non chiede un token. Non mettere credenziali nell’URL dell’endpoint.
Qwen MTP di AXQuant in oMLX
I pacchetti Qwen MTP di AXQuant includono una testa separata mtp.safetensors e un contratto di esecuzione mtplx_runtime.json. I metadati recenti includono anche axquant_omlx_compat.json, che elenca i 15 tensori MTP per questo pacchetto 27B. Questi file descrivono la compatibilità; attivare solo Lightning MTP non importa la testa.
Per oMLX 0.6.4, usa una copia locale del modello completa e scrivibile. In Impostazioni del modello, seleziona Importa sidecar MTP, poi abilita Lightning MTP. L’importatore upstream prepara uno shard MTP e aggiorna l’indice del checkpoint di quella copia locale. Conserva intatto il pacchetto originale scaricato per gli altri runtime; non modificare sul posto un’istantanea condivisa della cache di Hugging Face. Vedi le istruzioni del modello AXQuant. AX Code si collega al server preparato e non modifica i pesi del modello né esegue questo import.
Prestazioni e ambito
Le connessioni loopback di MTPLX e oMLX ricevono il comportamento locale di stabilità del prefisso: ordinamento deterministico degli strumenti e contesto transitorio dopo la cronologia della conversazione. Gli endpoint remoti e le connessioni gestite da AX Trust conservano il comportamento esistente; le impostazioni cloud e di AX Trust non vengono cambiate da questi preset.
Vedi il ritest dei client AX Code/OpenCode per la matrice completa con MTP abilitato dopo la correzione del prefisso locale, inclusi hardware, versioni, identità del modello, stato della cache, definizioni dei tempi e controlli del codice. Le misure di runtime precedenti conservano i replay di decode nativo e i risultati storici dei client. Una connessione funzionante compatibile con OpenAI non stabilisce la qualità di programmazione di un modello né garantisce una velocità di decode.