KoboldAI Lite su un endpoint personalizzato compatibile OpenAI.
Updated 2026-07-29
KoboldAI Lite si connette nativamente a endpoint personalizzati: il README stesso del progetto elenca API in formato OpenAI e in formato Claude accanto alle istanze Kobold e ad AI Horde. Punta il suo campo URL personalizzato su https://api.apisrouter.com/v1 con la tua chiave, e ogni modello del catalogo, DeepSeek, GLM, Kimi, Claude, Grok, diventa selezionabile all'interno della stessa interfaccia narrativa, sia che tu usi la Lite hostata su lite.koboldai.net sia la copia inclusa con KoboldCpp.
Risposta rapida: i valori di cui Lite ha bisogno.
Apri il pannello di connessione AI (il pulsante AI nel menu superiore di Lite), passa dal predefinito AI Horde al gruppo di endpoint personalizzati, e scegli l'opzione compatibile OpenAI. Le etichette esatte cambiano leggermente tra le build, ma i campi sono costanti: un URL API, una chiave, e un modello scelto dopo la connessione. Due dettagli specifici di Lite causano la maggior parte dei problemi quando questo fallisce. Primo, la checkbox di versione: Lite offre un toggle in stile "Add Ver. Num" che aggiunge /v1 all'URL per te, quindi inserire https://api.apisrouter.com con la casella spuntata e https://api.apisrouter.com/v1 senza spuntarla si risolvono entrambi correttamente, mentre raddoppiare il /v1 no. Secondo, la persistenza: Lite ha storicamente resettato gli URL degli endpoint personalizzati alla riconnessione, quindi tieni l'URL a portata di mano invece di dare per scontato che il campo sopravviva a ogni sessione.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Cos'è Lite, e come raggiunge un modello hostato.
KoboldAI Lite è la UI web a installazione zero dell'ecosistema Kobold: una single-page app per la scrittura di storie, la modalità avventura e la chat con personaggi che gira interamente nel tuo browser. Viene distribuita in due forme che condividono le stesse impostazioni: l'istanza hostata su lite.koboldai.net, e la copia inclusa che KoboldCpp serve su localhost quando esegui i modelli in locale. Il README del progetto la descrive come capace di connettersi a endpoint personalizzati incluse API in formato OpenAI e in formato Claude, accanto a istanze Kobold locali e remote e ad AI Horde, il cluster crowdsourced. Poiché Lite è un'app da browser senza un proprio server, le tue richieste API vanno direttamente dal browser a qualsiasi endpoint tu configuri. Questo design è il motivo per cui la strada dell'endpoint personalizzato funziona affatto, ed è anche il motivo per cui esiste la sezione CORS sotto: l'endpoint deve rispondere a richieste con origine browser, e quando non lo fa, Lite offre un toggle proxy con compromessi che vale la pena capire prima di attivarlo. Per chi arriva da AI Horde: l'attrattiva di un endpoint a consumo rispetto al cluster di volontari è la prevedibilità. Horde è genuinamente gratuito ma con una coda; un endpoint finanziato risponde immediatamente con esattamente il modello che hai chiesto, e alle tariffe della fascia value una serata di gioco costa una piccola frazione di centesimo per messaggio.
Configurazione, campo per campo.
Se la lista dei modelli resta vuota dopo la connessione, le cause abituali in ordine: un /v1 raddoppiato o mancante (controlla prima la checkbox di versione), una chiave incollata con spazi bianchi, o un'estensione del browser che blocca la richiesta. Far funzionare gli stessi tre valori in un comando curl è il modo più veloce per dimostrare che il lato endpoint va bene e localizzare il problema nel browser.
- Apri Lite (hostata o inclusa) e clicca il pulsante AI nel menu superiore per aprire il pannello di connessione.
- Passa la selezione del provider da AI Horde al gruppo di endpoint personalizzati, e scegli l'opzione compatibile OpenAI (le etichette variano leggermente a seconda della build; un'opzione in formato Claude si trova accanto ad essa).
- Inserisci l'URL: https://api.apisrouter.com/v1, facendo attenzione alla checkbox di versione descritta sopra così che /v1 compaia esattamente una volta.
- Incolla la tua chiave sk-... nel campo chiave.
- Connettiti, poi scegli un modello dalla lista che Lite recupera, oppure digita l'id di catalogo esatto se la tua build chiede un nome di modello manuale.
- Invia un breve messaggio in una nuova storia per confermare il round trip prima di caricare una sessione lunga.
L'opzione endpoint Claude, e quando usarla.
Il gruppo di endpoint personalizzati di Lite include anche un'opzione in formato Claude per le API in dialetto Anthropic. Anche APIsRouter serve quel dialetto, su /v1/messages, quindi gli id claude sono raggiungibili attraverso entrambe le porte. In pratica la via compatibile OpenAI è il default più semplice anche per i modelli Claude, perché un'unica configurazione serve così ogni famiglia: claude-sonnet-4-6 per la prosa di fascia alta, deepseek-v4-flash per il gioco a volume, glm-5.2 e kimi-k2.6 per la rotazione, tutti come modifiche al campo modello anziché riconfigurazioni. L'opzione in formato Claude si guadagna il suo posto se mantieni preset ottimizzati specificamente per il formato di richiesta di Anthropic o migri impostazioni da un altro strumento in dialetto Anthropic. Funzionalmente, entrambe le vie arrivano agli stessi modelli attraverso questo gateway; scegline una e resta coerente così che le tue impostazioni salvate restino portabili.
Sampler e modalità: cosa si applica davvero su un endpoint hostato.
Lite espone nelle sue impostazioni l'intero zoo di sampler per modelli locali, e la maggior parte di essi non fa il viaggio. Sugli endpoint compatibili OpenAI, la documentazione stessa di Lite nota che si applicano solo i controlli in stile temperature, top-p e repetition-penalty; sampler esotici come Min-P, Top-A o TFS sono funzionalità di inferenza locale, e anche se Lite può allegarli come campi extra, gli endpoint hostati in genere ignorano o rifiutano parametri non standard. Imposta temperature intorno a 0.8-0.9 per varietà di prosa, lascia top-p vicino a 0.95, e mantieni basse le repetition penalty; questa è tutta la superficie regolabile, ed è sufficiente. Tutte le modalità di scrittura di Lite funzionano sull'endpoint personalizzato, con un'indicazione: la modalità instruct si mappa più naturalmente sui modelli di chat hostati, poiché produce lo scambio strutturato basato sui ruoli su cui quei modelli sono addestrati. Funziona anche la co-scrittura classica di storie; aspettati che i modelli si comportino più come partner di conversazione che come semplici continuatori di testo grezzo, perché è esattamente ciò che è un endpoint di chat completions. La gestione del budget di contesto segue la stessa regola di ogni frontend per roleplay: Lite reinvia il contesto visibile della storia a ogni turno, quindi imposta la dimensione del contesto in modo deliberato (una finestra di lavoro da 16K a 32K copre sessioni lunghe) invece di massimizzarla solo perché la finestra del modello lo consente. La guida alla lunghezza del contesto linkata sotto fa questi conti tra i modelli.
| Impostazione | Punto di partenza | Nota |
|---|---|---|
| Temperature | 0.8 - 0.9 | La leva principale che sopravvive al viaggio verso un endpoint hostato |
| Top P | 0.95 | Lascia stare a meno che l'output non diventi incoerente |
| Repetition penalty | Bassa | Valori alti storpiano i nomi nelle storie lunghe |
| Sampler esotici (Min-P, Top-A, TFS) | Ignora | Funzionalità di inferenza locale; gli endpoint hostati le scartano o le rifiutano |
| Dimensione del contesto | 16K - 32K | Reinviato a ogni turno; il costo scala di conseguenza |
Pagamento a consumo · sotto i prezzi ufficiali
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modello | Prezzo ufficiale | Il nostro prezzo |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, il toggle proxy, e mantenere la tua chiave sotto controllo.
Poiché Lite chiama l'endpoint direttamente dal tuo browser, un fallimento di connessione con valori corretti è di solito CORS: l'endpoint che rifiuta richieste con origine browser. Lite include un toggle "Use CORS Proxy" esattamente per questo caso, e merita un avvertimento onesto: instradare attraverso un qualsiasi proxy di terze parti mette quel proxy dentro il tuo traffico, chiave e contenuto della storia inclusi. Prova prima una connessione diretta, conferma che l'endpoint funziona via curl in caso di dubbio, e tratta il toggle proxy come ultima risorsa piuttosto che come default. Eseguire la Lite inclusa da un KoboldCpp locale è un'altra soluzione pulita, dato che le stesse impostazioni di endpoint personalizzato esistono anche lì. L'igiene della chiave conta un po' di più su un'app da browser: la chiave risiede nelle impostazioni locali del tuo browser, quindi evita di incollarla su macchine condivise o pubbliche, e se mai dovesse trapelare, revocala e riemettila invece di sperare. Le chiavi qui sono gratuite da creare, quindi una chiave dedicata per Lite mantiene leggibile il log di utilizzo e contenuto il raggio d'impatto. Una nota sui contenuti, detta con chiarezza: un endpoint personalizzato cambia dove vanno le richieste, non ciò che i modelli permettono. Le policy dei modelli a monte e i termini di qualsiasi istanza di Lite tu usi si applicano comunque; la pagina di confronto delle policy linkata sotto copre il panorama in modo fattuale, famiglia di modelli per famiglia di modelli.
Domande frequenti
KoboldAI Lite supporta endpoint personalizzati compatibili OpenAI?
Sì, nativamente. Il README del progetto elenca endpoint personalizzati incluse API in formato OpenAI e in formato Claude accanto alle istanze Kobold e ad AI Horde. La configurazione è un URL, una chiave e un modello, dal pannello di connessione AI sia nella Lite hostata sia in quella inclusa con KoboldCpp.
Quale URL inserisco per APIsRouter in KoboldAI Lite?
https://api.apisrouter.com/v1, gestendo la checkbox di versione così che /v1 compaia esattamente una volta: il toggle in stile "Add Ver. Num" di Lite aggiunge /v1 automaticamente quando è spuntato. Un segmento di versione raddoppiato o mancante è la causa più comune di una lista modelli vuota.
Posso usare modelli Claude in KoboldAI Lite?
Sì, in due modi: tramite l'endpoint compatibile OpenAI con un id claude come claude-sonnet-4-6 nel campo modello, oppure tramite l'opzione endpoint in formato Claude di Lite verso /v1/messages. La via compatibile OpenAI è il default più semplice dato che la stessa configurazione serve poi anche ogni altra famiglia.
Perché le mie impostazioni sampler sembrano non fare nulla?
La maggior parte dello zoo di sampler di Lite è per l'inferenza locale. Su un endpoint compatibile OpenAI si applicano solo i controlli in stile temperature, top-p e repetition-penalty; gli endpoint hostati ignorano o rifiutano i sampler esotici. Se l'output sembra sbagliato, regola prima la temperature e controlla poi l'id del modello.
Perché Lite non riesce a connettersi quando curl funziona?
Quasi sempre CORS: Lite gira nel tuo browser, quindi l'endpoint deve accettare richieste con origine browser. Opzioni in ordine approssimativo: riprova con una configurazione diretta pulita, esegui la Lite inclusa con un KoboldCpp locale, oppure usa il toggle proxy CORS di Lite sapendo che una terza parte si troverà allora dentro il tuo traffico.
È meglio di AI Horde?
È un compromesso diverso. Horde è genuinamente gratuito, gestito da volontari, e con coda, con qualsiasi modello i volontari hostino. Un endpoint a consumo risponde immediatamente con esattamente il modello che scegli, a tariffe della fascia value che mettono una serata di gioco a una piccola frazione di centesimo per messaggio. Molte persone tengono configurati entrambi.