KoboldAI Lite روی یک endpoint سفارشی سازگار با OpenAI.
Updated 2026-07-29
KoboldAI Lite بهصورت native به endpoint های سفارشی متصل میشود: README خود پروژه API های با فرم OpenAI و Claude را در کنار نمونههای Kobold و AI Horde فهرست میکند. فیلد URL سفارشی آن را با کلید خود به https://api.apisrouter.com/v1 اشاره دهید، و هر مدل کاتالوگ، DeepSeek، GLM، Kimi، Claude، Grok، در همان رابط داستان قابلانتخاب میشود، چه از Lite hosted در lite.koboldai.net استفاده کنید چه از نسخهای که با KoboldCpp باندل شده.
پاسخ سریع: مقادیری که Lite نیاز دارد.
پنل اتصال AI را باز کنید (دکمه AI در منوی بالای Lite)، از AI Horde پیشفرض به گروه endpoint سفارشی سوییچ کنید، و گزینه سازگار با OpenAI را انتخاب کنید. برچسبهای دقیق کمی بین build ها تغییر میکند، اما فیلدها ثابتاند: یک API URL، یک کلید، و یک مدل که بعد از اتصال انتخاب میشود. دو جزئیات مختص Lite بیشترین آسیب را میزنند وقتی این شکست میخورد. اول، چکباکس نسخه: Lite یک toggle به سبک «Add Ver. Num» ارائه میدهد که /v1 را خودش به URL اضافه میکند، پس وارد کردن https://api.apisrouter.com با تیک زده و https://api.apisrouter.com/v1 با تیک نزده هر دو درست resolve میشوند، در حالی که دوبار کردن /v1 اینطور نیست. دوم، پایداری: Lite تاریخچهای دارد که URL های endpoint سفارشی را در reconnect ریست میکند، پس URL را دم دست نگه دارید بهجای اینکه فرض کنید فیلد در هر session زنده میماند.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Lite چیست، و چطور به یک مدل hosted میرسد.
KoboldAI Lite رابط کاربری وب بدون-نصب اکوسیستم Kobold است: یک اپ single-page برای نوشتن داستان، حالت ماجراجویی، و چت کاراکتر که کاملاً در مرورگر شما اجرا میشود. در دو شکل عرضه میشود که تنظیمات مشترک دارند: نمونه hosted در lite.koboldai.net، و نسخه باندلشدهای که KoboldCpp روی localhost سرویس میدهد وقتی مدلها را محلی اجرا میکنید. README پروژه آن را قادر به اتصال به endpoint های سفارشی از جمله API های با فرم OpenAI و Claude، در کنار نمونههای محلی و راهدور Kobold و AI Horde جمعسپاریشده توصیف میکند. چون Lite یک اپ مرورگری بدون سرور خودش است، درخواستهای API شما مستقیم از مرورگر به هر endpoint ای که پیکربندی کنید میرود. این طراحی دلیل کارکردن مسیر endpoint سفارشی است، و همچنین دلیل وجود بخش CORS زیر: endpoint باید به درخواستهای browser-origin پاسخ دهد، و وقتی یکی پاسخ نمیدهد، Lite یک toggle پروکسی با مصالحههایی ارائه میدهد که ارزش فهمیدن قبل از فعالکردن را دارد. برای کسانی که از AI Horde میآیند: جذابیت یک endpoint متری نسبت به cluster داوطلبانه، قابلپیشبینی بودن است. Horde واقعاً رایگان است با یک صف؛ یک endpoint تأمینمالیشده فوراً با دقیقاً همان مدلی که خواستید پاسخ میدهد، و با نرخهای خانواده value یک شب بازی هزینهای برابر بخش کوچکی از یک سنت به ازای هر پیام دارد.
راهاندازی، فیلد به فیلد.
اگر فهرست مدل بعد از اتصال خالی بماند، علتهای معمول به ترتیب: یک /v1 دوبار یا گمشده (اول چکباکس نسخه را چک کنید)، یک کلید pasteشده با فاصله، یا یک افزونه مرورگر که درخواست را بلاک میکند. کارکردن همان سه مقدار در یک دستور curl سریعترین راه اثبات سالم بودن سمت endpoint و محدودکردن مشکل به مرورگر است.
- Lite (hosted یا باندلشده) را باز کنید و روی دکمه AI در منوی بالا کلیک کنید تا پنل اتصال باز شود.
- انتخاب provider را از AI Horde به گروه endpoint سفارشی سوییچ کنید، و گزینه سازگار با OpenAI را انتخاب کنید (برچسبها کمی بین build ها فرق میکند؛ یک گزینه به سبک Claude هم کنارش هست).
- URL را وارد کنید: https://api.apisrouter.com/v1، و به چکباکس نسخه که بالا توضیح داده شد توجه کنید تا /v1 دقیقاً یک بار ظاهر شود.
- کلید sk-... خود را در فیلد کلید paste کنید.
- وصل شوید، سپس یک مدل از فهرستی که Lite دریافت میکند انتخاب کنید، یا اگر build شما نام دستی مدل میخواهد id دقیق کاتالوگ را تایپ کنید.
- یک پیام کوتاه در یک داستان تازه بفرستید تا round trip را قبل از بارگذاری یک session طولانی تأیید کنید.
گزینه endpoint Claude، و کِی از آن استفاده کنیم.
گروه endpoint سفارشی Lite همچنین یک گزینه به سبک Claude برای API های با گویش Anthropic شامل میشود. APIsRouter آن گویش را هم در /v1/messages سرویس میدهد، پس id های claude از هر دو در دسترس هستند. در عمل، مسیر سازگار با OpenAI حتی برای مدلهای Claude گزینه پیشفرض سادهتر است، چون یک پیکربندی آنگاه هر خانواده را سرویس میدهد: claude-sonnet-4-6 برای نثر ردهبالا، deepseek-v4-flash برای بازی حجمی، glm-5.2 و kimi-k2.6 برای چرخش، همه بهعنوان تغییرات فیلد مدل بهجای پیکربندیهای مجدد. جایی که گزینه به سبک Claude جایگاهش را کسب میکند این است که presets خود را مخصوصاً برای فرمت درخواست Anthropic تنظیمشده نگه دارید یا تنظیمات را از یک ابزار دیگر با گویش Anthropic منتقل کنید. از نظر عملکردی، هر دو مسیر از طریق این gateway به همان مدلها ختم میشوند؛ یکی را انتخاب کنید و ثابت بمانید تا تنظیمات ذخیرهشده شما قابلحمل بماند.
Sampler ها و حالتها: چه چیزی واقعاً روی یک endpoint hosted اعمال میشود.
Lite کل باغوحش sampler محلی را در تنظیماتش نمایش میدهد، و بیشترش سفر نمیکند. روی endpoint های سازگار با OpenAI، مستندات خود Lite ذکر میکند که فقط کنترلهای به سبک temperature، top-p، و repetition-penalty اعمال میشوند؛ sampler های عجیب مثل Min-P، Top-A، یا TFS ویژگیهای local-inference هستند، و در حالی که Lite میتواند آنها را بهعنوان فیلد اضافی پیوست کند، endpoint های hosted معمولاً پارامترهای غیراستاندارد را نادیده میگیرند یا رد میکنند. temperature را حدود ۰.۸ تا ۰.۹ برای تنوع نثر تنظیم کنید، top-p را نزدیک ۰.۹۵ نگه دارید، و repetition penalty را پایین نگه دارید؛ این کل سطح قابلتنظیم است، و کافی است. همه حالتهای نوشتن Lite روی endpoint سفارشی کار میکنند، با یک راهنمایی: حالت instruct طبیعیترین نگاشت را روی مدلهای چت hosted دارد، چون تبادل ساختاریافته و مبتنیبر role را تولید میکند که آن مدلها روی آن train شدهاند. همنویسی داستان کلاسیک هم کار میکند؛ انتظار داشته باشید مدلها بیشتر مثل شریکهای گفتگو رفتار کنند تا ادامهدهندههای خام متن، چون یک endpoint chat completions دقیقاً همین است. بودجهبندی context از همان قانون هر frontend roleplay پیروی میکند: Lite context قابلمشاهده داستان را هر turn دوباره ارسال میکند، پس اندازه context را عمداً تنظیم کنید (یک پنجره کاری ۱۶K تا ۳۲K session های بلند را پوشش میدهد) بهجای اینکه چون پنجره مدل اجازه میدهد آن را حداکثر کنید. راهنمای طول context پیوندشده زیر این حساب را در مدلها انجام میدهد.
| تنظیم | نقطه شروع | نکته |
|---|---|---|
| Temperature | ۰.۸ تا ۰.۹ | اهرم اصلیای که سفر تا یک endpoint hosted را زنده میماند |
| Top P | ۰.۹۵ | دستنخورده رها کنید مگر خروجی نامنسجم شود |
| Repetition penalty | پایین | مقادیر بالا نامها را در داستانهای طولانی خراب میکنند |
| Sampler های عجیب (Min-P، Top-A، TFS) | نادیده بگیرید | ویژگیهای local-inference؛ endpoint های hosted آنها را رد میکنند یا نادیده میگیرند |
| اندازه context | ۱۶K تا ۳۲K | هر turn دوباره ارسال میشود؛ هزینه با آن مقیاس میگیرد |
پرداخت بر اساس مصرف · پایینتر از قیمت رسمی
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| مدل | قیمت رسمی | قیمت ما |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS، toggle پروکسی، و سالم نگهداشتن کلید شما.
چون Lite endpoint را مستقیم از مرورگر شما فراخوانی میکند، یک شکست اتصال با مقادیر درست معمولاً CORS است: endpoint درخواستهای browser-origin را رد میکند. Lite دقیقاً برای این حالت یک toggle «Use CORS Proxy» ارائه میدهد، و لایق یک هشدار صادقانه است: مسیردهی از طریق هر پروکسی third-party آن پروکسی را داخل ترافیک شما قرار میدهد، شامل کلید و محتوای داستان. اول یک اتصال مستقیم را امتحان کنید، اگر شک دارید عملکرد endpoint را از طریق curl تأیید کنید، و toggle پروکسی را آخرین راهحل در نظر بگیرید نه پیشفرض. اجرای Lite باندلشده از یک KoboldCpp محلی هم یک راهحل تمیز دیگر است، چون همان تنظیمات endpoint سفارشی آنجا هم وجود دارد. بهداشت کلید در یک اپ مرورگری کمی بیشتر اهمیت دارد: کلید در تنظیمات محلی مرورگر شما مینشیند، پس از paste کردن آن در دستگاههای اشتراکی یا عمومی خودداری کنید، و اگر روزی لو رفت، revoke و صدور مجدد کنید بهجای امیدوار ماندن. کلیدها اینجا رایگان ساخته میشوند، پس یک کلید اختصاصی برای Lite لاگ استفاده را خوانا و شعاع انفجار را کوچک نگه میدارد. یک نکته محتوایی، صریح بیانشده: یک endpoint سفارشی جایی که درخواستها میروند را تغییر میدهد، نه اینکه مدلها چه چیزی را مجاز میدانند. سیاستهای مدل upstream و شرایط هر نمونه Lite ای که استفاده میکنید همچنان اعمال میشوند؛ صفحه مقایسه سیاستها که در پایین پیوند شده چشمانداز را بهصورت واقعی، خانواده مدل به خانواده مدل، پوشش میدهد.
پرسشهای پرتکرار
آیا KoboldAI Lite از endpoint های سفارشی سازگار با OpenAI پشتیبانی میکند؟
بله، بهصورت native. README پروژه endpoint های سفارشی از جمله API های با فرم OpenAI و Claude را در کنار نمونههای Kobold و AI Horde فهرست میکند. پیکربندی یک URL، یک کلید، و یک مدل است، از پنل اتصال AI در Lite hosted یا باندلشده با KoboldCpp.
برای APIsRouter در KoboldAI Lite چه URL ای وارد کنم؟
https://api.apisrouter.com/v1، با چکباکس نسخه مدیریتشده تا /v1 دقیقاً یک بار ظاهر شود: toggle به سبک «Add Ver. Num» در Lite با تیکزدن /v1 را خودکار اضافه میکند. یک بخش نسخه دوبار یا گمشده رایجترین علت فهرست مدل خالی است.
آیا میتوانم در KoboldAI Lite از مدلهای Claude استفاده کنم؟
بله، به دو روش: از طریق endpoint سازگار با OpenAI با یک id claude مثل claude-sonnet-4-6 در فیلد مدل، یا از طریق گزینه endpoint به سبک Claude در Lite در برابر /v1/messages. مسیر سازگار با OpenAI گزینه پیشفرض سادهتر است چون همان پیکربندی آنگاه هر خانواده دیگری را هم سرویس میدهد.
چرا تنظیمات sampler من انگار کاری نمیکند؟
بیشتر باغوحش sampler Lite برای local-inference است. روی یک endpoint سازگار با OpenAI فقط کنترلهای به سبک temperature، top-p، و repetition-penalty اعمال میشوند؛ endpoint های hosted sampler های عجیب را نادیده میگیرند یا رد میکنند. اگر خروجی درست نیست، اول temperature را تنظیم کنید و دوم id مدل را چک کنید.
چرا Lite نمیتواند وصل شود در حالی که curl کار میکند؟
تقریباً همیشه CORS: Lite در مرورگر شما اجرا میشود، پس endpoint باید درخواستهای browser-origin را بپذیرد. گزینهها به ترتیب: دوباره یک پیکربندی مستقیم تمیز امتحان کنید، Lite باندلشده با یک KoboldCpp محلی اجرا کنید، یا از toggle پروکسی CORS در Lite استفاده کنید با این درک که یک third-party آنگاه داخل ترافیک شما مینشیند.
آیا این از AI Horde بهتر است؟
معامله متفاوتی است. Horde واقعاً رایگان، داوطلبانه، و صفدار است، با هر مدلی که داوطلبان hosted میکنند. یک endpoint متری فوراً با دقیقاً مدلی که انتخاب میکنید پاسخ میدهد، با نرخهای خانواده value که یک شب بازی را در بخش کوچکی از یک سنت به ازای هر پیام قرار میدهد. بسیاری هر دو را پیکربندیشده نگه میدارند.