KoboldAI Lite روی یک endpoint سفارشی سازگار با OpenAI.

Updated 2026-07-29

KoboldAI Lite به‌صورت native به endpoint های سفارشی متصل می‌شود: README خود پروژه API های با فرم OpenAI و Claude را در کنار نمونه‌های Kobold و AI Horde فهرست می‌کند. فیلد URL سفارشی آن را با کلید خود به https://api.apisrouter.com/v1 اشاره دهید، و هر مدل کاتالوگ، DeepSeek، GLM، Kimi، Claude، Grok، در همان رابط داستان قابل‌انتخاب می‌شود، چه از Lite hosted در lite.koboldai.net استفاده کنید چه از نسخه‌ای که با KoboldCpp باندل شده.

پاسخ سریع: مقادیری که Lite نیاز دارد.

پنل اتصال AI را باز کنید (دکمه AI در منوی بالای Lite)، از AI Horde پیش‌فرض به گروه endpoint سفارشی سوییچ کنید، و گزینه سازگار با OpenAI را انتخاب کنید. برچسب‌های دقیق کمی بین build ها تغییر می‌کند، اما فیلدها ثابت‌اند: یک API URL، یک کلید، و یک مدل که بعد از اتصال انتخاب می‌شود. دو جزئیات مختص Lite بیشترین آسیب را می‌زنند وقتی این شکست می‌خورد. اول، چک‌باکس نسخه: Lite یک toggle به سبک «Add Ver. Num» ارائه می‌دهد که /v1 را خودش به URL اضافه می‌کند، پس وارد کردن https://api.apisrouter.com با تیک زده و https://api.apisrouter.com/v1 با تیک نزده هر دو درست resolve می‌شوند، در حالی که دوبار کردن /v1 این‌طور نیست. دوم، پایداری: Lite تاریخچه‌ای دارد که URL های endpoint سفارشی را در reconnect ریست می‌کند، پس URL را دم دست نگه دارید به‌جای اینکه فرض کنید فیلد در هر session زنده می‌ماند.

API URL:  https://api.apisrouter.com/v1   (or base URL + "Add Ver. Num" ticked)
API key:  sk-...                            (from APIsRouter)
Model:    deepseek-v4-flash                 (or any catalog id after connecting)

Lite چیست، و چطور به یک مدل hosted می‌رسد.

KoboldAI Lite رابط کاربری وب بدون-نصب اکوسیستم Kobold است: یک اپ single-page برای نوشتن داستان، حالت ماجراجویی، و چت کاراکتر که کاملاً در مرورگر شما اجرا می‌شود. در دو شکل عرضه می‌شود که تنظیمات مشترک دارند: نمونه hosted در lite.koboldai.net، و نسخه باندل‌شده‌ای که KoboldCpp روی localhost سرویس می‌دهد وقتی مدل‌ها را محلی اجرا می‌کنید. README پروژه آن را قادر به اتصال به endpoint های سفارشی از جمله API های با فرم OpenAI و Claude، در کنار نمونه‌های محلی و راه‌دور Kobold و AI Horde جمع‌سپاری‌شده توصیف می‌کند. چون Lite یک اپ مرورگری بدون سرور خودش است، درخواست‌های API شما مستقیم از مرورگر به هر endpoint ای که پیکربندی کنید می‌رود. این طراحی دلیل کارکردن مسیر endpoint سفارشی است، و همچنین دلیل وجود بخش CORS زیر: endpoint باید به درخواست‌های browser-origin پاسخ دهد، و وقتی یکی پاسخ نمی‌دهد، Lite یک toggle پروکسی با مصالحه‌هایی ارائه می‌دهد که ارزش فهمیدن قبل از فعال‌کردن را دارد. برای کسانی که از AI Horde می‌آیند: جذابیت یک endpoint متری نسبت به cluster داوطلبانه، قابل‌پیش‌بینی بودن است. Horde واقعاً رایگان است با یک صف؛ یک endpoint تأمین‌مالی‌شده فوراً با دقیقاً همان مدلی که خواستید پاسخ می‌دهد، و با نرخ‌های خانواده value یک شب بازی هزینه‌ای برابر بخش کوچکی از یک سنت به ازای هر پیام دارد.

راه‌اندازی، فیلد به فیلد.

اگر فهرست مدل بعد از اتصال خالی بماند، علت‌های معمول به ترتیب: یک /v1 دوبار یا گم‌شده (اول چک‌باکس نسخه را چک کنید)، یک کلید paste‌شده با فاصله، یا یک افزونه مرورگر که درخواست را بلاک می‌کند. کارکردن همان سه مقدار در یک دستور curl سریع‌ترین راه اثبات سالم بودن سمت endpoint و محدودکردن مشکل به مرورگر است.

  • Lite (hosted یا باندل‌شده) را باز کنید و روی دکمه AI در منوی بالا کلیک کنید تا پنل اتصال باز شود.
  • انتخاب provider را از AI Horde به گروه endpoint سفارشی سوییچ کنید، و گزینه سازگار با OpenAI را انتخاب کنید (برچسب‌ها کمی بین build ها فرق می‌کند؛ یک گزینه به سبک Claude هم کنارش هست).
  • URL را وارد کنید: https://api.apisrouter.com/v1، و به چک‌باکس نسخه که بالا توضیح داده شد توجه کنید تا /v1 دقیقاً یک بار ظاهر شود.
  • کلید sk-... خود را در فیلد کلید paste کنید.
  • وصل شوید، سپس یک مدل از فهرستی که Lite دریافت می‌کند انتخاب کنید، یا اگر build شما نام دستی مدل می‌خواهد id دقیق کاتالوگ را تایپ کنید.
  • یک پیام کوتاه در یک داستان تازه بفرستید تا round trip را قبل از بارگذاری یک session طولانی تأیید کنید.

گزینه endpoint Claude، و کِی از آن استفاده کنیم.

گروه endpoint سفارشی Lite همچنین یک گزینه به سبک Claude برای API های با گویش Anthropic شامل می‌شود. APIsRouter آن گویش را هم در /v1/messages سرویس می‌دهد، پس id های claude از هر دو در دسترس هستند. در عمل، مسیر سازگار با OpenAI حتی برای مدل‌های Claude گزینه پیش‌فرض ساده‌تر است، چون یک پیکربندی آنگاه هر خانواده را سرویس می‌دهد: claude-sonnet-4-6 برای نثر رده‌بالا، deepseek-v4-flash برای بازی حجمی، glm-5.2 و kimi-k2.6 برای چرخش، همه به‌عنوان تغییرات فیلد مدل به‌جای پیکربندی‌های مجدد. جایی که گزینه به سبک Claude جایگاهش را کسب می‌کند این است که presets خود را مخصوصاً برای فرمت درخواست Anthropic تنظیم‌شده نگه دارید یا تنظیمات را از یک ابزار دیگر با گویش Anthropic منتقل کنید. از نظر عملکردی، هر دو مسیر از طریق این gateway به همان مدل‌ها ختم می‌شوند؛ یکی را انتخاب کنید و ثابت بمانید تا تنظیمات ذخیره‌شده شما قابل‌حمل بماند.

Sampler ها و حالت‌ها: چه چیزی واقعاً روی یک endpoint hosted اعمال می‌شود.

Lite کل باغ‌وحش sampler محلی را در تنظیماتش نمایش می‌دهد، و بیشترش سفر نمی‌کند. روی endpoint های سازگار با OpenAI، مستندات خود Lite ذکر می‌کند که فقط کنترل‌های به سبک temperature، top-p، و repetition-penalty اعمال می‌شوند؛ sampler های عجیب مثل Min-P، Top-A، یا TFS ویژگی‌های local-inference هستند، و در حالی که Lite می‌تواند آن‌ها را به‌عنوان فیلد اضافی پیوست کند، endpoint های hosted معمولاً پارامترهای غیراستاندارد را نادیده می‌گیرند یا رد می‌کنند. temperature را حدود ۰.۸ تا ۰.۹ برای تنوع نثر تنظیم کنید، top-p را نزدیک ۰.۹۵ نگه دارید، و repetition penalty را پایین نگه دارید؛ این کل سطح قابل‌تنظیم است، و کافی است. همه حالت‌های نوشتن Lite روی endpoint سفارشی کار می‌کنند، با یک راهنمایی: حالت instruct طبیعی‌ترین نگاشت را روی مدل‌های چت hosted دارد، چون تبادل ساختاریافته و مبتنی‌بر role را تولید می‌کند که آن مدل‌ها روی آن train شده‌اند. هم‌نویسی داستان کلاسیک هم کار می‌کند؛ انتظار داشته باشید مدل‌ها بیشتر مثل شریک‌های گفتگو رفتار کنند تا ادامه‌دهنده‌های خام متن، چون یک endpoint chat completions دقیقاً همین است. بودجه‌بندی context از همان قانون هر frontend roleplay پیروی می‌کند: Lite context قابل‌مشاهده داستان را هر turn دوباره ارسال می‌کند، پس اندازه context را عمداً تنظیم کنید (یک پنجره کاری ۱۶K تا ۳۲K session های بلند را پوشش می‌دهد) به‌جای اینکه چون پنجره مدل اجازه می‌دهد آن را حداکثر کنید. راهنمای طول context پیوندشده زیر این حساب را در مدل‌ها انجام می‌دهد.

واقعیت sampler روی endpoint های سازگار با OpenAI، طبق یادداشت‌های تنظیمات خود Lite.
تنظیمنقطه شروعنکته
Temperature۰.۸ تا ۰.۹اهرم اصلی‌ای که سفر تا یک endpoint hosted را زنده می‌ماند
Top P۰.۹۵دست‌نخورده رها کنید مگر خروجی نامنسجم شود
Repetition penaltyپایینمقادیر بالا نام‌ها را در داستان‌های طولانی خراب می‌کنند
Sampler های عجیب (Min-P، Top-A، TFS)نادیده بگیریدویژگی‌های local-inference؛ endpoint های hosted آن‌ها را رد می‌کنند یا نادیده می‌گیرند
اندازه context۱۶K تا ۳۲Kهر turn دوباره ارسال می‌شود؛ هزینه با آن مقیاس می‌گیرد

پرداخت بر اساس مصرف · پایین‌تر از قیمت رسمی

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

مدلقیمت رسمیقیمت ما
DeepSeek V4 Flash$0.14 / $0.28 per M$0.10 / $0.30 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Grok 4.5$2.00 / $6.00 per M$1.60 / $4.80 per M

CORS، toggle پروکسی، و سالم نگه‌داشتن کلید شما.

چون Lite endpoint را مستقیم از مرورگر شما فراخوانی می‌کند، یک شکست اتصال با مقادیر درست معمولاً CORS است: endpoint درخواست‌های browser-origin را رد می‌کند. Lite دقیقاً برای این حالت یک toggle «Use CORS Proxy» ارائه می‌دهد، و لایق یک هشدار صادقانه است: مسیردهی از طریق هر پروکسی third-party آن پروکسی را داخل ترافیک شما قرار می‌دهد، شامل کلید و محتوای داستان. اول یک اتصال مستقیم را امتحان کنید، اگر شک دارید عملکرد endpoint را از طریق curl تأیید کنید، و toggle پروکسی را آخرین راه‌حل در نظر بگیرید نه پیش‌فرض. اجرای Lite باندل‌شده از یک KoboldCpp محلی هم یک راه‌حل تمیز دیگر است، چون همان تنظیمات endpoint سفارشی آنجا هم وجود دارد. بهداشت کلید در یک اپ مرورگری کمی بیشتر اهمیت دارد: کلید در تنظیمات محلی مرورگر شما می‌نشیند، پس از paste کردن آن در دستگاه‌های اشتراکی یا عمومی خودداری کنید، و اگر روزی لو رفت، revoke و صدور مجدد کنید به‌جای امیدوار ماندن. کلیدها اینجا رایگان ساخته می‌شوند، پس یک کلید اختصاصی برای Lite لاگ استفاده را خوانا و شعاع انفجار را کوچک نگه می‌دارد. یک نکته محتوایی، صریح بیان‌شده: یک endpoint سفارشی جایی که درخواست‌ها می‌روند را تغییر می‌دهد، نه اینکه مدل‌ها چه چیزی را مجاز می‌دانند. سیاست‌های مدل upstream و شرایط هر نمونه Lite ای که استفاده می‌کنید همچنان اعمال می‌شوند؛ صفحه مقایسه سیاست‌ها که در پایین پیوند شده چشم‌انداز را به‌صورت واقعی، خانواده مدل به خانواده مدل، پوشش می‌دهد.

پرسش‌های پرتکرار

آیا KoboldAI Lite از endpoint های سفارشی سازگار با OpenAI پشتیبانی می‌کند؟

بله، به‌صورت native. README پروژه endpoint های سفارشی از جمله API های با فرم OpenAI و Claude را در کنار نمونه‌های Kobold و AI Horde فهرست می‌کند. پیکربندی یک URL، یک کلید، و یک مدل است، از پنل اتصال AI در Lite hosted یا باندل‌شده با KoboldCpp.

برای APIsRouter در KoboldAI Lite چه URL ای وارد کنم؟

https://api.apisrouter.com/v1، با چک‌باکس نسخه مدیریت‌شده تا /v1 دقیقاً یک بار ظاهر شود: toggle به سبک «Add Ver. Num» در Lite با تیک‌زدن /v1 را خودکار اضافه می‌کند. یک بخش نسخه دوبار یا گم‌شده رایج‌ترین علت فهرست مدل خالی است.

آیا می‌توانم در KoboldAI Lite از مدل‌های Claude استفاده کنم؟

بله، به دو روش: از طریق endpoint سازگار با OpenAI با یک id claude مثل claude-sonnet-4-6 در فیلد مدل، یا از طریق گزینه endpoint به سبک Claude در Lite در برابر /v1/messages. مسیر سازگار با OpenAI گزینه پیش‌فرض ساده‌تر است چون همان پیکربندی آنگاه هر خانواده دیگری را هم سرویس می‌دهد.

چرا تنظیمات sampler من انگار کاری نمی‌کند؟

بیشتر باغ‌وحش sampler Lite برای local-inference است. روی یک endpoint سازگار با OpenAI فقط کنترل‌های به سبک temperature، top-p، و repetition-penalty اعمال می‌شوند؛ endpoint های hosted sampler های عجیب را نادیده می‌گیرند یا رد می‌کنند. اگر خروجی درست نیست، اول temperature را تنظیم کنید و دوم id مدل را چک کنید.

چرا Lite نمی‌تواند وصل شود در حالی که curl کار می‌کند؟

تقریباً همیشه CORS: Lite در مرورگر شما اجرا می‌شود، پس endpoint باید درخواست‌های browser-origin را بپذیرد. گزینه‌ها به ترتیب: دوباره یک پیکربندی مستقیم تمیز امتحان کنید، Lite باندل‌شده با یک KoboldCpp محلی اجرا کنید، یا از toggle پروکسی CORS در Lite استفاده کنید با این درک که یک third-party آنگاه داخل ترافیک شما می‌نشیند.

آیا این از AI Horde بهتر است؟

معامله متفاوتی است. Horde واقعاً رایگان، داوطلبانه، و صف‌دار است، با هر مدلی که داوطلبان hosted می‌کنند. یک endpoint متری فوراً با دقیقاً مدلی که انتخاب می‌کنید پاسخ می‌دهد، با نرخ‌های خانواده value که یک شب بازی را در بخش کوچکی از یک سنت به ازای هر پیام قرار می‌دهد. بسیاری هر دو را پیکربندی‌شده نگه می‌دارند.