KoboldAI Lite op een aangepast OpenAI-compatibel endpoint.
Updated 2026-07-29
KoboldAI Lite maakt van huis uit verbinding met aangepaste endpoints: de README van het project zelf noemt API's in OpenAI-vorm en Claude-vorm naast Kobold-instanties en AI Horde. Wijs het veld voor de aangepaste URL naar https://api.apisrouter.com/v1 met je sleutel, en elk catalogusmodel — DeepSeek, GLM, Kimi, Claude, Grok — wordt selecteerbaar binnen dezelfde verhaalinterface, of je nu de gehoste Lite op lite.koboldai.net gebruikt of de versie die met KoboldCpp wordt meegeleverd.
Snel antwoord: de waarden die Lite nodig heeft.
Open het AI-verbindingspaneel (de AI-knop in het bovenmenu van Lite), schakel van de standaard AI Horde naar de groep aangepaste endpoints, en kies de OpenAI-compatibele optie. Exacte labels verschuiven licht tussen builds, maar de velden zijn constant: een API-URL, een sleutel, en een model dat je kiest na het verbinden. Twee Lite-specifieke details veroorzaken het meeste kwaad als dit misgaat. Eerst het versievakje: Lite biedt een schakelaar in "Add Ver. Num"-stijl die /v1 voor je aan de URL toevoegt, dus zowel https://api.apisrouter.com invoeren met het vakje aangevinkt als https://api.apisrouter.com/v1 met het vakje uit levert een correcte resolutie op, terwijl een dubbele /v1 dat niet doet. Ten tweede persistentie: Lite heeft in het verleden aangepaste endpoint-URL's gereset bij een herverbinding, dus houd de URL bij de hand in plaats van aan te nemen dat het veld elke sessie overleeft.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Wat Lite is, en hoe het een gehost model bereikt.
KoboldAI Lite is de zero-install-webinterface van het Kobold-ecosysteem: een single-page app voor verhalen schrijven, adventure mode en character chat die volledig in je browser draait. Het verschijnt in twee vormen die dezelfde instellingen delen: de gehoste instantie op lite.koboldai.net, en de gebundelde versie die KoboldCpp op localhost serveert wanneer je modellen lokaal draait. De README van het project omschrijft het als in staat om verbinding te maken met aangepaste endpoints, waaronder API's in OpenAI-vorm en Claude-vorm, naast lokale en externe Kobold-instanties en de crowdsourced AI Horde. Omdat Lite een browserapp is zonder eigen server, gaan je API-verzoeken rechtstreeks van de browser naar welk endpoint je ook configureert. Dat ontwerp is precies waarom de route via een aangepast endpoint überhaupt werkt, en ook waarom de CORS-sectie hieronder bestaat: het endpoint moet antwoorden op verzoeken vanaf de browser-origin, en als dat niet zo is, biedt Lite een proxyschakelaar met afwegingen die het waard zijn om te begrijpen voordat je hem omzet. Voor mensen die van AI Horde komen: de aantrekkingskracht van een gemeten endpoint boven het vrijwilligerscluster is voorspelbaarheid. Horde is echt gratis, met een wachtrij; een gefinancierd endpoint antwoordt meteen met precies het model dat je hebt aangevraagd, en tegen tarieven uit de waardefamilie kost een avond spelen een kleine fractie van een cent per bericht.
Instellen, veld voor veld.
Als de modellijst leeg blijft na het verbinden, zijn de gebruikelijke oorzaken in volgorde: een dubbele of ontbrekende /v1 (controleer eerst het versievakje), een sleutel die met witruimte is geplakt, of een browserextensie die het verzoek blokkeert. Dezelfde drie waarden die werken in een curl-commando is de snelste manier om te bewijzen dat de endpoint-kant in orde is en het probleem tot de browser te herleiden.
- Open Lite (gehost of gebundeld) en klik op de AI-knop in het bovenmenu om het verbindingspaneel te openen.
- Schakel de providerselectie van AI Horde naar de groep aangepaste endpoints, en kies de OpenAI-compatibele optie (labels variëren licht per build; een optie in Claude-vorm staat ernaast).
- Voer de URL in: https://api.apisrouter.com/v1, met aandacht voor het hierboven beschreven versievakje zodat /v1 precies één keer voorkomt.
- Plak je sk-...-sleutel in het sleutelveld.
- Verbind, en kies dan een model uit de lijst die Lite ophaalt, of typ het exacte catalogus-ID als jouw build om een handmatige modelnaam vraagt.
- Stuur één kort bericht in een nieuw verhaal om de round trip te bevestigen voordat je een lange sessie laadt.
De Claude-endpointoptie, en wanneer je die gebruikt.
Lite's groep aangepaste endpoints bevat ook een optie in Claude-vorm voor API's in het Anthropic-dialect. APIsRouter bedient dat dialect ook, op /v1/messages, dus claude-ID's zijn via beide deuren bereikbaar. In de praktijk is de OpenAI-compatibele route de eenvoudigere standaard, zelfs voor Claude-modellen, omdat één configuratie dan elke familie bedient: claude-sonnet-4-6 voor hoogwaardig proza, deepseek-v4-flash voor volumespel, glm-5.2 en kimi-k2.6 voor rotatie, allemaal als wijzigingen in het modelveld in plaats van herconfiguraties. Waar de optie in Claude-vorm haar plaats verdient, is als je presets aanhoudt die specifiek zijn afgestemd op het verzoekformaat van Anthropic, of instellingen migreert vanuit een andere tool in het Anthropic-dialect. Functioneel komen beide routes via deze gateway bij dezelfde modellen uit; kies er één en blijf consistent, zodat je opgeslagen instellingen draagbaar blijven.
Samplers en modi: wat daadwerkelijk van toepassing is via een gehost endpoint.
Lite toont in zijn instellingen de volledige samplerdierentuin voor lokale modellen, en het grootste deel daarvan reist niet mee. Op OpenAI-compatibele endpoints merkt Lite's eigen documentatie op dat alleen temperature, top-p en instellingen in de stijl van repetition-penalty van toepassing zijn; exotische samplers zoals Min-P, Top-A of TFS zijn functies voor lokale inferentie, en hoewel Lite ze als extra velden kan meesturen, negeren of weigeren gehoste endpoints doorgaans niet-standaard parameters. Zet temperature rond 0.8 tot 0.9 voor prozavariatie, laat top-p rond 0.95, en houd repetition penalties laag; dat is het hele afstelbare oppervlak, en het is genoeg. Alle schrijfmodi van Lite werken via het aangepaste endpoint, met één richtlijn: instruct mode sluit het meest natuurlijk aan op gehoste chatmodellen, omdat het de gestructureerde, rolgebaseerde uitwisseling produceert waarop die modellen zijn getraind. Klassiek samen-verhalen-schrijven werkt ook; verwacht dat modellen zich meer gedragen als gesprekspartners dan als pure tekst-vervolgers, want dat is wat een chat completions-endpoint is. Contextbudgettering volgt dezelfde regel als elke roleplay-frontend: Lite verstuurt de zichtbare verhaalcontext elke beurt opnieuw, dus stel de contextgrootte bewust in (een werkvenster van 16K tot 32K dekt lange sessies) in plaats van te maximaliseren omdat het venster van het model dat toelaat. De contextlengte-gids hieronder maakt deze som voor verschillende modellen.
| Instelling | Startpunt | Opmerking |
|---|---|---|
| Temperature | 0.8 tot 0.9 | De belangrijkste hendel die de overtocht naar een gehost endpoint overleeft |
| Top P | 0.95 | Laat staan tenzij de output incoherent wordt |
| Repetition penalty | Laag | Hoge waarden verminken namen in lange verhalen |
| Exotische samplers (Min-P, Top-A, TFS) | Negeren | Functies voor lokale inferentie; gehoste endpoints laten ze vallen of weigeren ze |
| Contextgrootte | 16K tot 32K | Elke beurt opnieuw verstuurd; kosten schalen ermee mee |
Betaal naar gebruik · onder officiële prijzen
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Officiële prijs | Onze prijs |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, de proxyschakelaar, en je sleutel behapbaar houden.
Omdat Lite het endpoint rechtstreeks vanuit je browser aanroept, is een verbindingsfout met correcte waarden meestal CORS: het endpoint weigert verzoeken vanaf de browser-origin. Lite levert precies voor dit geval een schakelaar "Use CORS Proxy", en die verdient een eerlijke waarschuwing: routeren via een proxy van een derde partij plaatst die proxy binnen je verkeer, inclusief sleutel en verhaalinhoud. Probeer eerst een directe verbinding, bevestig bij twijfel via curl dat het endpoint werkt, en behandel de proxyschakelaar als laatste redmiddel in plaats van als standaard. De gebundelde Lite draaien vanuit een lokale KoboldCpp is een andere schone omweg, aangezien dezelfde instellingen voor aangepaste endpoints daar ook bestaan. Sleutelhygiëne telt een tikje extra bij een browserapp: de sleutel staat in de lokale instellingen van je browser, dus voorkom dat je hem in gedeelde of publieke machines plakt, en als hij ooit lekt, trek hem in en geef een nieuwe uit in plaats van te hopen dat het goed komt. Sleutels zijn hier gratis aan te maken, dus een dedicated sleutel voor Lite houdt het gebruikslogboek leesbaar en de impactradius klein. Nog één opmerking over content, eerlijk gezegd: een aangepast endpoint verandert waar verzoeken naartoe gaan, niet wat modellen toestaan. Het bovenliggende modelbeleid en de voorwaarden van welke Lite-instantie je ook gebruikt, blijven van toepassing; de pagina met beleidsvergelijking hieronder behandelt het landschap feitelijk, modelfamilie voor modelfamilie.
Veelgestelde vragen
Ondersteunt KoboldAI Lite aangepaste OpenAI-compatibele endpoints?
Ja, van huis uit. De README van het project noemt aangepaste endpoints, waaronder API's in OpenAI-vorm en Claude-vorm, naast Kobold-instanties en AI Horde. De configuratie bestaat uit een URL, een sleutel en een model, vanuit het AI-verbindingspaneel in zowel de gehoste als de met KoboldCpp gebundelde Lite.
Welke URL voer ik in voor APIsRouter in KoboldAI Lite?
https://api.apisrouter.com/v1, waarbij je het versievakje zo behandelt dat /v1 precies één keer voorkomt: de schakelaar in "Add Ver. Num"-stijl van Lite voegt /v1 automatisch toe als hij is aangevinkt. Een dubbel of ontbrekend versiesegment is de meest voorkomende oorzaak van een lege modellijst.
Kan ik Claude-modellen gebruiken in KoboldAI Lite?
Ja, op twee manieren: via het OpenAI-compatibele endpoint met een claude-ID zoals claude-sonnet-4-6 in het modelveld, of via de endpointoptie in Claude-vorm van Lite tegen /v1/messages. De OpenAI-compatibele route is de eenvoudigere standaard, aangezien dezelfde configuratie dan ook elke andere familie bedient.
Waarom lijken mijn samplerinstellingen niets te doen?
Het grootste deel van Lite's samplerdierentuin is voor lokale inferentie. Via een OpenAI-compatibel endpoint zijn alleen temperature, top-p en instellingen in de stijl van repetition-penalty van toepassing; gehoste endpoints negeren of weigeren exotische samplers. Als de output verkeerd aanvoelt, stel dan eerst temperature bij en controleer daarna het model-ID.
Waarom mislukt de verbinding van Lite terwijl curl werkt?
Vrijwel altijd CORS: Lite draait in je browser, dus het endpoint moet verzoeken vanaf de browser-origin accepteren. Opties in ruwe volgorde: probeer opnieuw met een schone, directe configuratie, draai de Lite die met een lokale KoboldCpp is gebundeld, of gebruik de CORS-proxyschakelaar van Lite met het besef dat een derde partij dan binnen je verkeer zit.
Is dit beter dan AI Horde?
Een andere afweging. Horde is echt gratis, wordt door vrijwilligers gedraaid en werkt met een wachtrij, met welke modellen vrijwilligers ook hosten. Een gemeten endpoint antwoordt meteen met precies het model dat je kiest, tegen tarieven uit de waardefamilie die een avond spelen op een kleine fractie van een cent per bericht brengen. Veel mensen houden beide geconfigureerd.