KoboldAI Lite pada endpoint custom serasi OpenAI.
Updated 2026-07-29
KoboldAI Lite menyambung ke endpoint custom secara natif: README projek itu sendiri menyenaraikan API berbentuk OpenAI dan Claude di samping instans Kobold dan AI Horde. Arahkan medan URL custom-nya ke https://api.apisrouter.com/v1 dengan kunci anda, dan setiap model katalog, DeepSeek, GLM, Kimi, Claude, Grok, boleh dipilih dalam antara muka cerita yang sama, sama ada anda guna Lite yang dihoskan di lite.koboldai.net atau salinan yang dibundel bersama KoboldCpp.
Jawapan pantas: nilai yang diperlukan Lite.
Buka panel sambungan AI (butang AI dalam menu atas Lite), tukar daripada AI Horde lalai kepada kumpulan endpoint custom, dan pilih pilihan serasi OpenAI. Label tepat berubah sedikit antara binaan, tetapi medannya tetap: URL API, kunci, dan model yang dipilih selepas menyambung. Dua perincian khusus Lite melakukan kebanyakan kerosakan apabila ini gagal. Pertama, kotak semak versi: Lite menawarkan togol gaya "Add Ver. Num" yang menambah /v1 pada URL untuk anda, jadi memasukkan https://api.apisrouter.com dengan kotak ditanda dan https://api.apisrouter.com/v1 tanpa ditanda kedua-duanya diselesaikan dengan betul, manakala menggandakan /v1 tidak. Kedua, kekekalan: Lite secara sejarah menetapkan semula URL endpoint custom apabila menyambung semula, jadi simpan URL berdekatan dan jangan anggap medan itu bertahan setiap sesi.
API URL: https://api.apisrouter.com/v1 (atau URL asas + "Add Ver. Num" ditanda)
API key: sk-... (dari APIsRouter)
Model: deepseek-v4-flash (atau mana-mana id katalog selepas menyambung)Apa itu Lite, dan bagaimana ia mencapai model yang dihoskan.
KoboldAI Lite ialah UI web sifar-pasang ekosistem Kobold: aplikasi satu halaman untuk penulisan cerita, mod pengembaraan, dan sembang watak yang berjalan sepenuhnya dalam pelayar anda. Ia dihantar dalam dua bentuk yang berkongsi tetapan sama: instans yang dihoskan di lite.koboldai.net, dan salinan yang dibundel yang dilayani KoboldCpp pada localhost apabila anda menjalankan model secara tempatan. README projek menerangkannya sebagai mampu menyambung ke endpoint custom termasuk API berbentuk OpenAI dan Claude, di samping instans Kobold tempatan dan jauh serta AI Horde sumber orang ramai. Kerana Lite ialah aplikasi pelayar tanpa pelayan sendiri, permintaan API anda pergi terus daripada pelayar ke mana-mana endpoint yang anda konfigurasikan. Reka bentuk itulah sebab laluan endpoint custom berfungsi sama sekali, dan juga sebab bahagian CORS di bawah wujud: endpoint perlu menjawab permintaan asal-pelayar, dan apabila satu tidak, Lite menawarkan togol proksi dengan pertukaran ganti yang berbaloi difahami sebelum menukarnya. Bagi orang yang datang daripada AI Horde: daya tarikan endpoint berukur berbanding kluster sukarelawan ialah kebolehjangkaan. Horde benar-benar percuma dengan barisan; endpoint bertaja menjawab dengan segera dengan model tepat yang anda minta, dan pada kadar keluarga nilai, satu malam bermain berharga sebahagian kecil sen setiap mesej.
Persediaan, medan demi medan.
Jika senarai model kekal kosong selepas menyambung, punca biasa mengikut kedudukan: /v1 yang digandakan atau hilang (semak kotak semak versi dahulu), kunci ditampal dengan ruang putih, atau sambungan pelayar menyekat permintaan. Tiga nilai yang sama berfungsi dalam arahan curl adalah cara terpantas untuk membuktikan bahagian endpoint elok dan mengesan masalah ke pelayar.
- Buka Lite (dihoskan atau dibundel) dan klik butang AI dalam menu atas untuk membuka panel sambungan.
- Tukar pemilihan penyedia daripada AI Horde kepada kumpulan endpoint custom, dan pilih pilihan serasi OpenAI (label berbeza sedikit mengikut binaan; pilihan berbentuk Claude berada di sebelahnya).
- Masukkan URL: https://api.apisrouter.com/v1, mengambil kira kotak semak versi yang diterangkan di atas supaya /v1 muncul tepat sekali.
- Tampal kunci sk-... anda ke dalam medan kunci.
- Sambung, kemudian pilih model daripada senarai yang diambil Lite, atau taip id katalog yang tepat jika binaan anda meminta nama model secara manual.
- Hantar satu mesej pendek dalam cerita baharu untuk mengesahkan perjalanan pergi-balik sebelum memuatkan sesi panjang.
Pilihan endpoint Claude, dan bila untuk menggunakannya.
Kumpulan endpoint custom Lite turut termasuk pilihan berbentuk Claude untuk API dialek Anthropic. APIsRouter turut melayani dialek itu, di /v1/messages, jadi id claude boleh dicapai melalui mana-mana pintu. Dalam praktiknya, laluan serasi OpenAI adalah lalai yang lebih mudah walaupun untuk model Claude, kerana satu konfigurasi kemudian melayani setiap keluarga: claude-sonnet-4-6 untuk prosa peringkat tinggi, deepseek-v4-flash untuk permainan volum, glm-5.2 dan kimi-k2.6 untuk rotasi, semuanya sebagai perubahan medan model dan bukan konfigurasi semula. Di mana pilihan berbentuk Claude layak mendapat tempatnya ialah jika anda mengekalkan pratetap yang dilaraskan khusus untuk format permintaan Anthropic atau berpindah tetapan daripada alat dialek Anthropic lain. Secara fungsi, kedua-dua laluan berakhir pada model yang sama melalui gateway ini; pilih satu dan kekal konsisten supaya tetapan tersimpan anda kekal mudah alih.
Sampler dan mod: apa yang benar-benar terpakai pada endpoint yang dihoskan.
Lite mendedahkan seluruh kebun binatang sampler model tempatan dalam tetapannya, dan kebanyakannya tidak dibawa serta. Pada endpoint serasi OpenAI, dokumentasi Lite sendiri menyatakan hanya kawalan gaya temperature, top-p, dan repetition-penalty yang terpakai; sampler eksotik seperti Min-P, Top-A, atau TFS adalah ciri inferens tempatan, dan walaupun Lite boleh melampirkannya sebagai medan tambahan, endpoint yang dihoskan secara umum mengabaikan atau menolak parameter bukan standard. Tetapkan temperature sekitar 0.8 hingga 0.9 untuk variasi prosa, biarkan top-p berhampiran 0.95, dan kekalkan repetition penalty rendah; itulah keseluruhan permukaan boleh laras, dan ia mencukupi. Semua mod penulisan Lite berfungsi melalui endpoint custom, dengan satu panduan: mod instruct paling natural dipetakan kepada model sembang yang dihoskan, kerana ia menghasilkan pertukaran berasaskan peranan berstruktur yang model itu dilatih untuknya. Penulisan bersama cerita klasik turut berfungsi; jangkakan model bertindak lebih seperti rakan perbualan daripada penyambung teks mentah, kerana itulah endpoint chat completions. Belanjawan konteks mengikut peraturan yang sama seperti setiap frontend roleplay: Lite menghantar semula konteks cerita yang boleh dilihat setiap giliran, jadi tetapkan saiz konteks secara sengaja (tetingkap kerja 16K hingga 32K merangkumi sesi panjang) dan bukan memaksimumkannya kerana tetingkap model membenarkannya. Panduan panjang konteks yang dipautkan di bawah mengira ini merentas model.
| Tetapan | Titik mula | Nota |
|---|---|---|
| Temperature | 0.8 hingga 0.9 | Tuas utama yang bertahan perjalanan ke endpoint yang dihoskan |
| Top P | 0.95 | Biarkan sahaja melainkan output menjadi tidak koheren |
| Repetition penalty | Rendah | Nilai tinggi merosakkan nama sepanjang cerita panjang |
| Sampler eksotik (Min-P, Top-A, TFS) | Abaikan | Ciri inferens tempatan; endpoint yang dihoskan mengabaikan atau menolaknya |
| Saiz konteks | 16K hingga 32K | Dihantar semula setiap giliran; kos berskala dengannya |
Bayar mengikut penggunaan · bawah harga rasmi
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Harga Rasmi | Harga Kami |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, togol proksi, dan mengekalkan kewarasan kunci anda.
Kerana Lite memanggil endpoint terus daripada pelayar anda, kegagalan sambungan dengan nilai yang betul biasanya CORS: endpoint menolak permintaan asal-pelayar. Lite menyediakan togol "Use CORS Proxy" untuk kes tepat ini, dan ia layak mendapat amaran jujur: menghalakan melalui mana-mana proksi pihak ketiga meletakkan proksi itu di dalam trafik anda, termasuk kunci dan kandungan cerita. Cuba sambungan langsung dahulu, sahkan endpoint berfungsi melalui curl jika ragu, dan anggap togol proksi sebagai pilihan terakhir dan bukan lalai. Menjalankan Lite yang dibundel daripada KoboldCpp tempatan ialah jalan penyelesaian bersih yang lain, kerana tetapan endpoint custom yang sama wujud di sana. Kebersihan kunci penting sedikit lebih pada aplikasi pelayar: kunci itu berada dalam tetapan tempatan pelayar anda, jadi elakkan menampalnya ke mesin yang dikongsi atau awam, dan jika ia pernah bocor, batalkan dan keluarkan semula dan bukan berharap. Kunci di sini percuma untuk dicipta, jadi kunci khusus untuk Lite mengekalkan log penggunaan mudah dibaca dan radius letupan kecil. Satu nota kandungan, dinyatakan secara jelas: endpoint custom mengubah ke mana permintaan pergi, bukan apa yang model benarkan. Polisi model hulu dan terma mana-mana instans Lite yang anda gunakan masih terpakai; halaman perbandingan polisi yang dipautkan di bawah merangkumi landskap itu secara fakta, keluarga model demi keluarga model.
Soalan lazim
Adakah KoboldAI Lite menyokong endpoint custom serasi OpenAI?
Ya, secara natif. README projek menyenaraikan endpoint custom termasuk API berbentuk OpenAI dan Claude di samping instans Kobold dan AI Horde. Konfigurasi ialah URL, kunci, dan model, daripada panel sambungan AI dalam Lite yang dihoskan atau yang dibundel bersama KoboldCpp.
URL apa yang saya masukkan untuk APIsRouter dalam KoboldAI Lite?
https://api.apisrouter.com/v1, dengan kotak semak versi dikendalikan supaya /v1 muncul tepat sekali: togol gaya "Add Ver. Num" Lite menambah /v1 secara automatik apabila ditanda. Segmen versi yang digandakan atau hilang adalah punca paling biasa senarai model kosong.
Bolehkah saya guna model Claude dalam KoboldAI Lite?
Ya, dua cara: melalui endpoint serasi OpenAI dengan id claude seperti claude-sonnet-4-6 dalam medan model, atau melalui pilihan endpoint berbentuk Claude Lite terhadap /v1/messages. Laluan serasi OpenAI adalah lalai yang lebih mudah kerana konfigurasi yang sama kemudian melayani setiap keluarga lain juga.
Mengapa tetapan sampler saya seolah-olah tidak buat apa-apa?
Kebanyakan kebun binatang sampler Lite adalah untuk inferens tempatan. Melalui endpoint serasi OpenAI hanya kawalan gaya temperature, top-p, dan repetition-penalty yang terpakai; endpoint yang dihoskan mengabaikan atau menolak sampler eksotik. Jika output terasa salah, laraskan temperature dahulu dan semak id model kedua.
Mengapa Lite gagal menyambung apabila curl berfungsi?
Hampir selalu CORS: Lite berjalan dalam pelayar anda, jadi endpoint mesti menerima permintaan asal-pelayar. Pilihan mengikut susunan kasar: cuba semula konfigurasi langsung yang bersih, jalankan Lite yang dibundel dengan KoboldCpp tempatan, atau guna togol proksi CORS Lite dengan pemahaman bahawa pihak ketiga kemudian berada di dalam trafik anda.
Adakah ini lebih baik daripada AI Horde?
Pertukaran ganti berbeza. Horde benar-benar percuma, dijalankan sukarelawan, dan berbaris, dengan apa sahaja model yang dihos sukarelawan. Endpoint berukur menjawab dengan segera dengan model tepat yang anda pilih, pada kadar keluarga nilai yang meletakkan satu malam bermain pada sebahagian kecil sen setiap mesej. Ramai orang mengekalkan kedua-duanya dikonfigurasikan.