KoboldAI Lite sa isang custom OpenAI-compatible endpoint.
Updated 2026-07-29
Kumokonekta ang KoboldAI Lite sa mga custom endpoint nang native: nakalista sa README mismo ng proyekto ang OpenAI-shaped at Claude-shaped APIs kasabay ng mga Kobold instance at AI Horde. Ituro ang custom URL field nito sa https://api.apisrouter.com/v1 gamit ang iyong key, at ang bawat model sa katalogo, DeepSeek, GLM, Kimi, Claude, Grok, ay magiging maaaring piliin sa loob ng parehong story interface, gamitin man ang hosted Lite sa lite.koboldai.net o ang kopyang kasama ng KoboldCpp.
Mabilisang sagot: ang mga value na kailangan ng Lite.
Buksan ang AI connection panel (ang AI button sa top menu ng Lite), lumipat mula sa default na AI Horde patungo sa custom endpoint group, at piliin ang OpenAI-compatible na opsyon. Bahagyang nagbabago ang eksaktong label sa pagitan ng mga build, pero pareho ang mga field: isang API URL, isang key, at isang model na pipiliin pagkatapos kumonekta. Dalawang detalyeng specific sa Lite ang pinaka-madalas na dahilan kapag nabigo ito. Una, ang version checkbox: nag-aalok ang Lite ng "Add Ver. Num" na toggle na nagdaragdag ng /v1 sa URL para sa iyo, kaya ang paglalagay ng https://api.apisrouter.com nang naka-tick ang box at https://api.apisrouter.com/v1 nang hindi naka-tick ay pareho namang tama, samantalang ang pagdoble ng /v1 ay hindi. Pangalawa, ang persistence: kasaysayan nang binura ng Lite ang mga custom endpoint URL sa reconnect, kaya panatilihing madaling makuha ang URL sa halip na ipagpalagay na mananatili ito sa bawat session.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Ano ang Lite, at paano nito naaabot ang isang hosted model.
Ang KoboldAI Lite ang zero-install web UI ng Kobold ecosystem: isang single-page app para sa story writing, adventure mode, at character chat na tumatakbo nang buo sa iyong browser. Dumarating ito sa dalawang anyo na may parehong settings: ang hosted instance sa lite.koboldai.net, at ang bundled na kopyang isina-serve ng KoboldCpp sa localhost kapag pinapatakbo mo ang mga model nang lokal. Inilalarawan ng README ng proyekto na kaya nitong kumonekta sa mga custom endpoint kasama ang OpenAI-shaped at Claude-shaped APIs, kasabay ng lokal at remote na mga Kobold instance at ang crowdsourced na AI Horde. Dahil ang Lite ay isang browser app na walang sariling server, dumarayo ang mga API request mo mula sa browser diretso sa kahit anong endpoint na i-configure mo. Iyan ang dahilan kung bakit gumagana ang custom-endpoint route, at bakit umiiral ang seksyon ng CORS sa baba: kailangang sagutin ng endpoint ang mga request na browser-origin, at kapag hindi ito nangyari, nag-aalok ang Lite ng proxy toggle na may mga tradeoff na dapat unawain bago i-flip. Para sa mga galing sa AI Horde: ang appeal ng isang metered endpoint kumpara sa volunteer cluster ay ang predictability. Talagang libre ang Horde na may queue; sumasagot agad ang isang funded endpoint gamit ang eksaktong model na hiniling mo, at sa value-family rates, umaabot lamang sa maliit na fraction ng isang cent kada mensahe ang isang gabi ng paglalaro.
Setup, field by field.
Kung nananatiling walang laman ang model list pagkatapos kumonekta, ganito naka-rangking ang karaniwang sanhi: dinobleng o nawawalang /v1 (suriin muna ang version checkbox), key na na-paste na may whitespace, o isang browser extension na humaharang sa request. Ang parehong tatlong value na gumagana sa isang curl command ang pinakamabilis na paraan para patunayan na maayos ang panig ng endpoint at i-localize ang problema sa browser.
- Buksan ang Lite (hosted o bundled) at i-click ang AI button sa top menu para buksan ang connection panel.
- Ilipat ang provider selection mula sa AI Horde patungo sa custom endpoint group, at piliin ang OpenAI-compatible na opsyon (bahagyang nag-iiba ang mga label depende sa build; may Claude-shaped na opsyon din katabi nito).
- Ilagay ang URL: https://api.apisrouter.com/v1, iniingatan ang version checkbox na inilarawan sa itaas para lumitaw nang eksaktong isang beses ang /v1.
- I-paste ang iyong sk-... key sa key field.
- Kumonekta, pagkatapos ay pumili ng model mula sa listahang kinukuha ng Lite, o i-type ang eksaktong catalog id kung hihilingin ng build mo ang manual na pangalan ng model.
- Magpadala ng isang maikling mensahe sa isang bagong story para kumpirmahin ang round trip bago mag-load ng mahabang session.
Ang opsyong Claude endpoint, at kailan ito gagamitin.
Kasama rin sa custom endpoint group ng Lite ang isang Claude-shaped na opsyon para sa mga Anthropic-dialect na API. Nagse-serve rin ang APIsRouter ng dialect na iyon, sa /v1/messages, kaya naaabot ang mga claude id sa alinman sa dalawang pinto. Sa praktika, ang OpenAI-compatible na ruta ang mas simpleng default kahit para sa mga Claude model, dahil pinaglilingkuran ng iisang configuration ang bawat family: claude-sonnet-4-6 para sa mataas na antas na prose, deepseek-v4-flash para sa volume play, glm-5.2 at kimi-k2.6 para sa rotation, lahat bilang pagbabago sa model field sa halip na muling pag-configure. Kung saan kumikita ang Claude-shaped na opsyon ay kung pinananatili mong naka-tune ang mga preset specific sa request format ng Anthropic o mig-migrate ka ng mga setting mula sa ibang Anthropic-dialect na tool. Sa functionality, parehong ruta ay nagtatapos sa parehong mga model sa pamamagitan ng gateway na ito; pumili ng isa at manatiling consistent para portable ang naka-save mong settings.
Mga sampler at mode: ano talaga ang umiiral sa isang hosted endpoint.
Inilalantad ng Lite ang buong local-model sampler zoo sa mga setting nito, at karamihan dito ay hindi nagbabagong-anyo papunta sa iba. Sa mga OpenAI-compatible endpoint, nabanggit ng dokumentasyon mismo ng Lite na temperature, top-p, at repetition-penalty-style na mga kontrol lamang ang umiiral; ang mga exotic sampler tulad ng Min-P, Top-A, o TFS ay local-inference features, at kahit maidugtong ng Lite ang mga ito bilang extra field, karaniwang binabalewala o tinatanggihan ng hosted endpoint ang mga non-standard na parameter. Itakda ang temperature sa paligid ng 0.8 hanggang 0.9 para sa variety ng prose, panatilihin ang top-p sa malapit sa 0.95, at panatilihing mababa ang repetition penalty; iyon na ang buong tunable surface, at sapat na ito. Gumagana ang lahat ng writing mode ng Lite sa custom endpoint, na may isang paalala: ang instruct mode ang pinaka-natural na umaangkop sa mga hosted chat model, dahil ginagawa nito ang structured na role-based na palitan na doon sinanay ang mga model na iyon. Gumagana rin ang classic na story co-writing; asahang kikilos ang mga model na parang conversational partner kaysa sa raw text continuer, dahil iyon ang kalikasan ng isang chat completions endpoint. Sinusunod ng context budgeting ang parehong panuntunan tulad ng bawat roleplay frontend: paulit-ulit na ipinapadala ng Lite ang nakikitang story context sa bawat turn, kaya itakda nang sadya ang laki ng context (sakop ng 16K hanggang 32K na working window ang mahahabang session) sa halip na i-max lang dahil pinahihintulutan ito ng window ng model. Kino-compute ito ng context-length guide na naka-link sa ibaba sa iba't ibang model.
| Setting | Panimulang punto | Paalala |
|---|---|---|
| Temperature | 0.8 hanggang 0.9 | Ang pangunahing lever na buhay pa rin pagdating sa isang hosted endpoint |
| Top P | 0.95 | Huwag galawin maliban kung nagiging incoherent ang output |
| Repetition penalty | Mababa | Nagbaluktot ang mataas na value sa mga pangalan sa mahahabang kwento |
| Exotic samplers (Min-P, Top-A, TFS) | Huwag pansinin | Local-inference features; binabale-wala o tinatanggihan ng hosted endpoint |
| Context size | 16K hanggang 32K | Paulit-ulit na ipinapadala bawat turn; tumataas ang gastos kasabay nito |
Pay-as-you-go · mas mababa sa opisyal na presyo
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Opisyal na Presyo | Aming Presyo |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, ang proxy toggle, at pagpapanatiling matino ng iyong key.
Dahil tinatawag ng Lite ang endpoint diretso mula sa iyong browser, ang isang nabigong koneksyon na may tamang value ay karaniwang CORS: tinatanggihan ng endpoint ang mga browser-origin na request. Nagdadala ang Lite ng "Use CORS Proxy" toggle para eksakto sa kasong ito, at karapat-dapat itong bigyan ng tapat na babala: ang pag-route sa pamamagitan ng anumang third-party na proxy ay naglalagay sa proxy na iyon sa loob ng iyong traffic, kasama ang key at nilalaman ng kwento. Subukan muna ang direktang koneksyon, kumpirmahin sa pamamagitan ng curl na gumagana ang endpoint kung may pag-aalinlangan, at ituring ang proxy toggle bilang huling hakbang sa halip na default. Ang pagpapatakbo ng bundled na Lite mula sa isang lokal na KoboldCpp ay isa pang malinis na paraan, dahil naroon din ang parehong custom-endpoint na mga setting. Mahalaga ang key hygiene nang bahagyang higit sa isang browser app: nakaupo ang key sa mga lokal na setting ng iyong browser, kaya iwasan itong i-paste sa shared o public na makina, at kung sakaling ma-leak ito, i-revoke at mag-isyu ulit sa halip na umasa lang. Libreng gawin ang mga key dito, kaya ang isang dedicated na key para sa Lite ay pinapanatiling mababasa ang usage log at maliit ang blast radius. Isang paalala tungkol sa content, sinabi nang malinaw: binabago ng custom endpoint kung saan pumupunta ang mga request, hindi kung ano ang pinapayagan ng mga model. Umiiral pa rin ang mga upstream model policy at ang terms ng anumang Lite instance na ginagamit mo; sinasakop ng policies-compared page na naka-link sa ibaba ang tanawin batay sa katotohanan, model family bawat model family.
Mga madalas itanong
Sinusuportahan ba ng KoboldAI Lite ang mga custom OpenAI-compatible endpoint?
Oo, native. Nakalista sa README ng proyekto ang mga custom endpoint kasama ang OpenAI-shaped at Claude-shaped APIs kasabay ng mga Kobold instance at AI Horde. Isang URL, isang key, at isang model ang configuration, mula sa AI connection panel sa alinman sa hosted o KoboldCpp-bundled na Lite.
Anong URL ang ilalagay ko para sa APIsRouter sa KoboldAI Lite?
https://api.apisrouter.com/v1, na may na-manage ang version checkbox para lumitaw nang eksaktong isang beses ang /v1: idinaragdag ng "Add Ver. Num" na toggle ng Lite ang /v1 nang awtomatiko kapag naka-tick. Ang dinoble o nawawalang version segment ang pinaka-karaniwang dahilan ng walang laman na model list.
Maaari ba akong gumamit ng mga Claude model sa KoboldAI Lite?
Oo, sa dalawang paraan: sa pamamagitan ng OpenAI-compatible endpoint gamit ang claude id tulad ng claude-sonnet-4-6 sa model field, o sa pamamagitan ng Claude-shaped na opsyon ng endpoint ng Lite laban sa /v1/messages. Mas simpleng default ang OpenAI-compatible na ruta dahil pinaglilingkuran na rin ng parehong config ang bawat ibang family.
Bakit parang walang epekto ang aking mga sampler setting?
Karamihan sa sampler zoo ng Lite ay para sa local inference. Sa isang OpenAI-compatible endpoint, temperature, top-p, at repetition-penalty-style na mga kontrol lamang ang umiiral; binabalewala o tinatanggihan ng hosted endpoint ang mga exotic sampler. Kung mali ang pakiramdam ng output, i-tune muna ang temperature at suriin pangalawa ang model id.
Bakit nabigo ang Lite na kumonekta gayong gumagana ang curl?
Halos palaging CORS: tumatakbo ang Lite sa iyong browser, kaya kailangang tanggapin ng endpoint ang mga request na browser-origin. Ang mga opsyon sa magaspang na ayos: subukan muli ang isang malinis na direktang config, patakbuhin ang Lite na bundled sa isang lokal na KoboldCpp, o gamitin ang CORS proxy toggle ng Lite nang naiintindihan na isang third party ang mauupo sa loob ng iyong traffic.
Mas maganda ba ito kaysa sa AI Horde?
Ibang klaseng kalakalan. Talagang libre ang Horde, volunteer-run, at may queue, na may anumang model na host ng mga volunteer. Sumasagot agad ang isang metered endpoint gamit ang eksaktong model na pinili mo, sa value-family rates na naglalagay ng isang gabi ng paglalaro sa maliit na fraction ng isang cent kada mensahe. Maraming tao ang nagpapanatili ng pareho.