একটা কাস্টম OpenAI-compatible endpoint-এ KoboldAI Lite।
Updated 2026-07-29
KoboldAI Lite natively কাস্টম endpoint-এর সাথে connect করে: প্রজেক্টের নিজের README-তে Kobold instance এবং AI Horde-এর পাশাপাশি OpenAI-shaped এবং Claude-shaped API তালিকাভুক্ত। এর custom URL field https://api.apisrouter.com/v1-এ আপনার key দিয়ে point করুন, এবং catalog-এর প্রতিটা মডেল — DeepSeek, GLM, Kimi, Claude, Grok — একই story interface-এর ভেতরে selectable হয়ে যায়, আপনি lite.koboldai.net-এ hosted Lite ব্যবহার করুন বা KoboldCpp-এর সাথে bundled কপি।
দ্রুত উত্তর: Lite-এর যে values দরকার।
AI connection panel খুলুন (Lite-এর top menu-তে AI button), default AI Horde থেকে custom endpoint group-এ switch করুন, এবং OpenAI-compatible option বেছে নিন। Exact label build-ভেদে সামান্য বদলায়, কিন্তু field গুলো constant: একটা API URL, একটা key, এবং connect করার পর একটা model pick করা। এটা fail করলে দুইটা Lite-specific detail-ই বেশিরভাগ ক্ষতি করে। প্রথমত, version checkbox: Lite একটা "Add Ver. Num" style toggle দেয় যা আপনার জন্য URL-এ /v1 যোগ করে দেয়, তাই box tick করা অবস্থায় https://api.apisrouter.com এবং untick করা অবস্থায় https://api.apisrouter.com/v1 — দুটোই ঠিকমতো resolve হয়, কিন্তু /v1 দুইবার দিলে হয় না। দ্বিতীয়ত, persistence: Lite ঐতিহাসিকভাবে reconnect-এ কাস্টম endpoint URL reset করে দেয়, তাই field প্রতিটা session-এ টিকে থাকবে ধরে না নিয়ে URL হাতের কাছেই রাখুন।
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Lite আসলে কী, এবং এটা কীভাবে একটা hosted model-এ পৌঁছায়।
KoboldAI Lite হলো Kobold ecosystem-এর zero-install web UI: story writing, adventure mode, এবং character chat-এর জন্য একটা single-page app যা সম্পূর্ণভাবে আপনার browser-এ চলে। এটা একই settings শেয়ার করা দুই রূপে আসে: lite.koboldai.net-এ hosted instance, এবং locally মডেল চালালে KoboldCpp localhost-এ যে bundled কপি serve করে। প্রজেক্ট README একে বর্ণনা করে এভাবে যে এটা local ও remote Kobold instance এবং crowdsourced AI Horde-এর পাশাপাশি OpenAI-shaped ও Claude-shaped API-সহ কাস্টম endpoint-এর সাথে connect করতে সক্ষম। Lite যেহেতু নিজের কোনো server ছাড়া একটা browser app, আপনার API request সরাসরি browser থেকে আপনি যে endpoint configure করেন সেখানে যায়। এই design-ই কারণ যে কাস্টম-endpoint route আদৌ কাজ করে, এবং এটাই কারণ নিচের CORS section-টা কেন আছে: endpoint-কে browser-origin request-এর জবাব দিতে হয়, এবং যখন একটা তা করে না, Lite একটা proxy toggle দেয় সাথে এমন tradeoff যা flip করার আগে বোঝার যোগ্য। AI Horde থেকে আসা মানুষদের জন্য: volunteer cluster-এর চেয়ে একটা metered endpoint-এর আকর্ষণ হলো predictability। Horde সত্যিই বিনামূল্যে একটা queue-সহ; একটা funded endpoint আপনি যে মডেল চেয়েছেন ঠিক সেটা দিয়ে সাথে সাথে জবাব দেয়, এবং value-family রেটে একটা সন্ধ্যার play প্রতি message-এ এক সেন্টের ছোট্ট একটা ভগ্নাংশ খরচ করে।
সেটআপ, field by field।
Connect করার পরও model list খালি থাকলে, সাধারণ কারণগুলো এভাবে সাজানো: একটা doubled বা missing /v1 (প্রথমে version checkbox check করুন), whitespace-সহ paste করা একটা key, অথবা request block করা একটা browser extension। একটা curl command-এ একই তিনটা value কাজ করা হলো endpoint side ঠিক আছে প্রমাণ করার এবং সমস্যাটাকে browser-এ localize করার সবচেয়ে দ্রুত উপায়।
- Lite খুলুন (hosted বা bundled) এবং connection panel খুলতে top menu-তে AI button click করুন।
- provider selection AI Horde থেকে custom endpoint group-এ switch করুন, এবং OpenAI-compatible option বেছে নিন (label build-ভেদে সামান্য ভিন্ন হয়; একটা Claude-shaped option এর পাশেই থাকে)।
- URL enter করুন: https://api.apisrouter.com/v1, উপরে বর্ণিত version checkbox খেয়াল রেখে যাতে /v1 ঠিক একবারই আসে।
- আপনার sk-... key key field-এ paste করুন।
- Connect করুন, তারপর Lite যে list fetch করে তা থেকে একটা model pick করুন, অথবা আপনার build manual model name চাইলে exact catalog id টাইপ করুন।
- একটা লম্বা session load করার আগে round trip confirm করতে একটা fresh story-তে একটা ছোট message পাঠান।
Claude endpoint option, এবং কখন এটা ব্যবহার করবেন।
Lite-এর custom endpoint group-এ Anthropic-dialect API-এর জন্য একটা Claude-shaped option-ও থাকে। APIsRouter সেই dialect-ও serve করে, /v1/messages-এ, তাই claude id দুই দরজা দিয়েই পৌঁছানো যায়। বাস্তবে, Claude model-এর জন্যও OpenAI-compatible route সহজ default, কারণ একটা configuration-ই তখন প্রতিটা family serve করে: high-end prose-এর জন্য claude-sonnet-4-6, volume play-এর জন্য deepseek-v4-flash, rotation-এর জন্য glm-5.2 এবং kimi-k2.6 — সবই reconfiguration না করে model-field change হিসেবে। Claude-shaped option যেখানে নিজের জায়গা অর্জন করে তা হলো যদি আপনি Anthropic-এর request format-এর জন্য নির্দিষ্টভাবে tune করা preset রাখেন বা অন্য একটা Anthropic-dialect tool থেকে settings migrate করেন। কার্যকরীভাবে, এই gateway দিয়ে দুই route-ই একই মডেলে গিয়ে শেষ হয়; একটা বেছে নিন এবং consistent থাকুন যাতে আপনার saved settings portable থাকে।
Sampler এবং mode: একটা hosted endpoint-এ আসলে কী প্রযোজ্য।
Lite এর settings-এ পুরো local-model sampler zoo expose করে, এবং এর বেশিরভাগ ভ্রমণ করে না। OpenAI-compatible endpoint-এ, Lite-এর নিজের documentation বলে যে শুধু temperature, top-p, এবং repetition-penalty style control প্রযোজ্য; Min-P, Top-A, বা TFS-এর মতো exotic sampler local-inference feature, এবং Lite সেগুলোকে extra field হিসেবে attach করতে পারলেও, hosted endpoint সাধারণত non-standard parameter ignore বা reject করে। prose variety-র জন্য temperature 0.8 থেকে 0.9-এর কাছাকাছি সেট করুন, top-p 0.95-এর কাছে রাখুন, এবং repetition penalty কম রাখুন; এটাই পুরো tunable surface, এবং এটাই যথেষ্ট। Lite-এর writing mode গুলো সবই কাস্টম endpoint-এ কাজ করে, একটা guidance-সহ: instruct mode hosted chat model-এর সাথে সবচেয়ে natural ভাবে map করে, কারণ এটা সেই structured role-based exchange তৈরি করে যাতে সেই মডেলগুলো trained। Classic story co-writing-ও কাজ করে; মডেল raw text continuer-এর চেয়ে বেশি conversational partner-এর মতো আচরণ করবে বলে আশা করুন, কারণ একটা chat completions endpoint সেটাই। Context budgeting প্রতিটা roleplay frontend-এর মতোই একই rule মেনে চলে: Lite প্রতি turn visible story context resend করে, তাই মডেলের window allow করে বলে সর্বোচ্চ না করে context size deliberately সেট করুন (একটা 16K থেকে 32K working window লম্বা session কভার করে)। নিচের context-length guide মডেল জুড়ে এই হিসাব করে দেখায়।
| Setting | শুরুর পয়েন্ট | Note |
|---|---|---|
| Temperature | 0.8 থেকে 0.9 | hosted endpoint পর্যন্ত টিকে থাকা main lever |
| Top P | 0.95 | output incoherent না হলে হাত দেবেন না |
| Repetition penalty | কম | লম্বা story-তে High value নাম mangle করে দেয় |
| Exotic sampler (Min-P, Top-A, TFS) | Ignore করুন | Local-inference feature; hosted endpoint সেগুলো drop বা reject করে |
| Context size | 16K থেকে 32K | প্রতি turn resend হয়; cost এর সাথে scale করে |
ব্যবহার অনুযায়ী পেমেন্ট · অফিশিয়াল মূল্যের নিচে
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| মডেল | অফিশিয়াল মূল্য | আমাদের মূল্য |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, proxy toggle, এবং আপনার key ঠিক রাখা।
Lite যেহেতু সরাসরি আপনার browser থেকে endpoint call করে, সঠিক value সত্ত্বেও একটা connection failure সাধারণত CORS: endpoint browser-origin request প্রত্যাখ্যান করছে। ঠিক এই case-এর জন্য Lite একটা "Use CORS Proxy" toggle দেয়, এবং এটা একটা honest warning পাওয়ার যোগ্য: যেকোনো third-party proxy দিয়ে route করলে সেই proxy আপনার traffic-এর ভেতরে বসে যায়, key ও story content সহ। প্রথমে একটা direct connection try করুন, সন্দেহ থাকলে curl দিয়ে endpoint কাজ করে কিনা confirm করুন, এবং proxy toggle-কে default না ধরে একটা last resort হিসেবে ধরুন। একটা local KoboldCpp থেকে bundled Lite চালানো আরেকটা clean workaround, যেহেতু সেখানেও একই কাস্টম-endpoint settings থাকে। একটা browser app-এ key hygiene একটু বেশিই গুরুত্বপূর্ণ: key আপনার browser-এর local settings-এ বসে থাকে, তাই shared বা public machine-এ এটা paste করা এড়িয়ে চলুন, এবং কখনো leak হলে, আশা না করে revoke করে নতুন করে issue করুন। এখানে key তৈরি করা বিনামূল্যে, তাই Lite-এর জন্য একটা dedicated key usage log readable এবং blast radius ছোট রাখে। একটা content note, স্পষ্টভাবে বলা: একটা কাস্টম endpoint request কোথায় যায় তা বদলায়, মডেল কী allow করে তা নয়। Upstream model policy এবং আপনি যে Lite instance ব্যবহার করেন তার terms এখনো প্রযোজ্য; নিচের policies-compared পেজ landscape-টা factually cover করে, model family ধরে ধরে।
সাধারণ প্রশ্ন
KoboldAI Lite কি কাস্টম OpenAI-compatible endpoint সাপোর্ট করে?
হ্যাঁ, natively। প্রজেক্ট README-তে Kobold instance এবং AI Horde-এর পাশাপাশি OpenAI-shaped ও Claude-shaped API-সহ কাস্টম endpoint তালিকাভুক্ত। Configuration হলো একটা URL, একটা key, এবং একটা model, hosted বা KoboldCpp-bundled Lite যেকোনোটার AI connection panel থেকে।
KoboldAI Lite-এ APIsRouter-এর জন্য কোন URL enter করব?
https://api.apisrouter.com/v1, version checkbox handle করে যাতে /v1 ঠিক একবারই আসে: Lite-এর "Add Ver. Num" style toggle tick করা থাকলে automatically /v1 যোগ করে। একটা doubled বা missing version segment হলো খালি model list-এর সবচেয়ে সাধারণ কারণ।
আমি কি KoboldAI Lite-এ Claude মডেল ব্যবহার করতে পারি?
হ্যাঁ, দুইভাবে: model field-এ claude-sonnet-4-6-এর মতো একটা claude id সহ OpenAI-compatible endpoint দিয়ে, অথবা /v1/messages-এর বিরুদ্ধে Lite-এর Claude-shaped endpoint option দিয়ে। OpenAI-compatible route সহজ default যেহেতু একই config তখন অন্য প্রতিটা family-ও serve করে।
আমার sampler settings কেন কিছুই করে না মনে হচ্ছে?
Lite-এর বেশিরভাগ sampler zoo local inference-এর জন্য। একটা OpenAI-compatible endpoint-এ শুধু temperature, top-p, এবং repetition-penalty style control প্রযোজ্য; hosted endpoint exotic sampler ignore বা reject করে। output ভুল মনে হলে, প্রথমে temperature tune করুন এবং দ্বিতীয়ত model id check করুন।
curl কাজ করলেও Lite কেন connect করতে ব্যর্থ হয়?
প্রায় সবসময়ই CORS: Lite আপনার browser-এ চলে, তাই endpoint-কে অবশ্যই browser-origin request accept করতে হবে। মোটামুটি এই order-এ option: একটা clean direct config আবার try করুন, একটা local KoboldCpp-এর সাথে bundled Lite চালান, অথবা Lite-এর CORS proxy toggle ব্যবহার করুন এই বোঝাপড়া নিয়ে যে তখন একটা third party আপনার traffic-এর ভেতরে বসে যায়।
এটা কি AI Horde-এর চেয়ে ভালো?
ভিন্ন trade। Horde সত্যিই বিনামূল্যে, volunteer-run, এবং queued, volunteer রা যা host করে সেই মডেল নিয়ে। একটা metered endpoint আপনার pick করা exact মডেল দিয়ে সাথে সাথে জবাব দেয়, value-family রেটে যা এক সন্ধ্যার play-কে প্রতি message-এ এক সেন্টের ছোট্ট ভগ্নাংশে নিয়ে আসে। অনেক মানুষ দুটোই configured রাখে।