KoboldAI Lite на кастомному OpenAI-сумісному ендпоінті.

Updated 2026-07-29

KoboldAI Lite нативно підключається до кастомних ендпоінтів: власний README проєкту перелічує API у форматі OpenAI та Claude поряд з інстанціями Kobold і AI Horde. Спрямуйте поле кастомного URL на https://api.apisrouter.com/v1 з вашим ключем, і кожна модель каталогу — DeepSeek, GLM, Kimi, Claude, Grok — стає доступною для вибору в тому самому інтерфейсі історій, незалежно від того, використовуєте ви хостинговий Lite на lite.koboldai.net чи копію, вбудовану в KoboldCpp.

Коротка відповідь: значення, потрібні Lite.

Відкрийте панель з'єднання AI (кнопка AI у верхньому меню Lite), перемкніться з типового AI Horde на групу кастомних ендпоінтів і оберіть опцію OpenAI-compatible. Точні назви трохи різняться між збірками, але поля незмінні: URL API, ключ і модель, обрана після підключення. Дві деталі, специфічні для Lite, спричиняють більшість проблем, коли щось не працює. По-перше, чекбокс версії: Lite пропонує перемикач на кшталт «Add Ver. Num», який сам дописує /v1 до URL, тож введення https://api.apisrouter.com з увімкненим чекбоксом і https://api.apisrouter.com/v1 з вимкненим — обидва варіанти працюють коректно, а от подвоєння /v1 — ні. По-друге, збереження: Lite історично скидав кастомні URL ендпоінтів при повторному підключенні, тож тримайте URL напохваті, а не покладайтесь на те, що поле переживе кожну сесію.

API URL:  https://api.apisrouter.com/v1   (or base URL + "Add Ver. Num" ticked)
API key:  sk-...                            (from APIsRouter)
Model:    deepseek-v4-flash                 (or any catalog id after connecting)

Що таке Lite і як він доходить до хостингової моделі.

KoboldAI Lite — це веб-інтерфейс екосистеми Kobold, який не потребує встановлення: односторінковий застосунок для написання історій, режиму пригод і чату з персонажами, що працює повністю у браузері. Він постачається у двох формах, які поділяють ті самі налаштування: хостингова інстанція на lite.koboldai.net і вбудована копія, яку KoboldCpp обслуговує на localhost, коли ви запускаєте моделі локально. README проєкту описує його як здатний підключатися до кастомних ендпоінтів, включно з API у форматі OpenAI та Claude, поряд з локальними й віддаленими інстанціями Kobold і краудсорсинговим AI Horde. Оскільки Lite — це браузерний застосунок без власного сервера, ваші запити API йдуть напряму з браузера до будь-якого ендпоінта, який ви налаштували. Саме через цей дизайн шлях з кастомним ендпоінтом взагалі працює, і саме тому нижче існує розділ про CORS: ендпоінт має відповідати на запити з походженням із браузера, а коли не відповідає, Lite пропонує перемикач проксі з компромісами, які варто зрозуміти, перш ніж його вмикати. Для тих, хто приходить з AI Horde: перевага ендпоінта з оплатою за використання над волонтерським кластером — передбачуваність. Horde справді безкоштовний, але з чергою; оплачений ендпоінт відповідає негайно точно тією моделлю, яку ви попросили, а за тарифами бюджетних моделей вечір гри коштує малу частку цента за повідомлення.

Налаштування, поле за полем.

Якщо список моделей лишається порожнім після підключення, найпоширеніші причини за рангом: подвоєний або відсутній /v1 (спершу перевірте чекбокс версії), ключ, вставлений із пробілами, або розширення браузера, що блокує запит. Ті самі три значення, що працюють у команді curl, — найшвидший спосіб довести, що бік ендпоінта в порядку, і локалізувати проблему в браузері.

  • Відкрийте Lite (хостинговий чи вбудований) і натисніть кнопку AI у верхньому меню, щоб відкрити панель з'єднання.
  • Перемкніть вибір провайдера з AI Horde на групу кастомних ендпоінтів і оберіть опцію OpenAI-compatible (назви трохи різняться залежно від збірки; поруч є опція у форматі Claude).
  • Введіть URL: https://api.apisrouter.com/v1, зважаючи на чекбокс версії, описаний вище, щоб /v1 з'явився рівно один раз.
  • Вставте ваш ключ sk-... у поле ключа.
  • Підключіться, тоді оберіть модель зі списку, який отримує Lite, або введіть точний ID з каталогу, якщо ваша збірка вимагає назву моделі вручну.
  • Надішліть одне коротке повідомлення в новій історії, щоб підтвердити зв'язок, перш ніж завантажувати довгу сесію.

Опція ендпоінта Claude і коли її використовувати.

Група кастомних ендпоінтів Lite також включає опцію у форматі Claude для API діалекту Anthropic. APIsRouter обслуговує і цей діалект — на /v1/messages, тож ID моделей claude доступні через обидва «входи». На практиці шлях OpenAI-compatible — простіший типовий варіант навіть для моделей Claude, оскільки одна конфігурація тоді обслуговує всі родини: claude-sonnet-4-6 для високоякісної прози, deepseek-v4-flash для масової гри, glm-5.2 і kimi-k2.6 для ротації — все це просто зміни поля моделі, а не переналаштування. Опція у форматі Claude виправдовує себе, якщо ви тримаєте пресети, налаштовані саме під формат запитів Anthropic, або мігруєте налаштування з іншого інструменту з діалектом Anthropic. Функціонально обидва шляхи через цей шлюз ведуть до тих самих моделей; оберіть один і дотримуйтесь його послідовно, щоб ваші збережені налаштування лишались портативними.

Семплери і режими: що насправді застосовується через хостинговий ендпоінт.

Lite показує у своїх налаштуваннях повний «звіринець» семплерів для локальних моделей, і більшість з них не переносяться далі. На OpenAI-сумісних ендпоінтах, за власною документацією Lite, застосовуються лише елементи керування на кшталт temperature, top-p і repetition-penalty; екзотичні семплери на кшталт Min-P, Top-A чи TFS — це функції локального інференсу, і хоча Lite може додавати їх як додаткові поля, хостингові ендпоінти зазвичай ігнорують чи відхиляють нестандартні параметри. Встановіть temperature приблизно 0.8–0.9 для різноманіття прози, тримайте top-p близько 0.95 і низький штраф за повторення; це вся поверхня, яку можна налаштувати, і цього достатньо. Усі режими написання Lite працюють через кастомний ендпоінт, з однією порадою: режим instruct найприродніше лягає на хостингові чат-моделі, оскільки він створює структурований обмін репліками за ролями, на якому ці моделі й натреновані. Класичне спільне написання історій теж працює; очікуйте, що моделі поводитимуться радше як співрозмовники, ніж як продовжувачі сирого тексту, — адже саме таким є ендпоінт chat completions. Бюджетування контексту підпорядковується тому самому правилу, що й у будь-якому фронтенді для рольових ігор: Lite повторно надсилає видимий контекст історії на кожному ході, тож встановлюйте розмір контексту свідомо (робоче вікно 16K–32K покриває довгі сесії), а не максимізуйте його лише тому, що вікно моделі це дозволяє. Гайд з довжини контексту за посиланням нижче наводить ці розрахунки для різних моделей.

Реальність семплерів на OpenAI-сумісних ендпоінтах, за власними примітками налаштувань Lite.
НалаштуванняВідправна точкаПримітка
Temperature0.8–0.9Головний важіль, що «переживає» перехід до хостингового ендпоінта
Top P0.95Не чіпайте, якщо вивід не стає незв'язним
Repetition penaltyНизькийВисокі значення спотворюють імена в довгих історіях
Екзотичні семплери (Min-P, Top-A, TFS)ІгноруватиФункції локального інференсу; хостингові ендпоінти відкидають чи відхиляють їх
Розмір контексту16K–32KНадсилається повторно щоходу; вартість масштабується разом з ним

Оплата за фактом · нижче офіційних цін

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

МодельОфіційна цінаНаша ціна
DeepSeek V4 Flash$0.14 / $0.28 per M$0.10 / $0.30 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Grok 4.5$2.00 / $6.00 per M$1.60 / $4.80 per M

CORS, перемикач проксі і як не втратити глузд через ключ.

Оскільки Lite звертається до ендпоінта напряму з вашого браузера, збій з'єднання за правильних значень зазвичай означає CORS: ендпоінт відхиляє запити з походженням із браузера. Lite постачається саме для такого випадку з перемикачем «Use CORS Proxy», і тут варте чесне попередження: маршрутизація через будь-який сторонній проксі поміщає цей проксі всередину вашого трафіку, включно з ключем і вмістом історії. Спершу спробуйте пряме з'єднання, за сумніву підтвердіть роботу ендпоінта через curl і ставтесь до перемикача проксі як до крайнього засобу, а не типового варіанту. Запуск вбудованого Lite з локального KoboldCpp — ще один чистий обхідний шлях, оскільки там існують ті самі налаштування кастомного ендпоінта. Гігієна ключа має особливе значення для браузерного застосунку: ключ зберігається в локальних налаштуваннях вашого браузера, тож уникайте вставляти його на спільних чи публічних машинах, а якщо він колись витече — відкликайте й видайте новий, а не сподівайтесь на краще. Ключі тут створюються безкоштовно, тож окремий ключ для Lite тримає журнал використання зрозумілим, а радіус можливої шкоди — малим. Одна примітка щодо контенту, прямо: кастомний ендпоінт змінює лише те, куди йдуть запити, а не те, що дозволяють моделі. Політики моделей вище за ланцюгом і умови будь-якої інстанції Lite, якою ви користуєтесь, все одно діють; сторінка порівняння політик за посиланням нижче фактично висвітлює цей ландшафт, родина моделей за родиною.

Поширені запитання

Чи підтримує KoboldAI Lite кастомні OpenAI-сумісні ендпоінти?

Так, нативно. README проєкту перелічує кастомні ендпоінти, включно з API у форматі OpenAI та Claude, поряд з інстанціями Kobold і AI Horde. Конфігурація — це URL, ключ і модель у панелі з'єднання AI як у хостинговому, так і у вбудованому в KoboldCpp Lite.

Який URL вводити для APIsRouter у KoboldAI Lite?

https://api.apisrouter.com/v1, зважаючи на чекбокс версії, щоб /v1 з'явився рівно один раз: перемикач Lite на кшталт «Add Ver. Num» автоматично дописує /v1, коли увімкнений. Подвоєний чи відсутній сегмент версії — найпоширеніша причина порожнього списку моделей.

Чи можу я використовувати моделі Claude в KoboldAI Lite?

Так, двома способами: через OpenAI-сумісний ендпоінт з ID claude на кшталт claude-sonnet-4-6 у полі моделі, або через опцію ендпоінта Lite у форматі Claude на /v1/messages. Шлях OpenAI-compatible — простіший типовий варіант, оскільки та сама конфігурація тоді обслуговує й усі інші родини моделей.

Чому мої налаштування семплерів наче нічого не роблять?

Більшість «звіринця» семплерів Lite призначена для локального інференсу. Через OpenAI-сумісний ендпоінт застосовуються лише елементи керування на кшталт temperature, top-p і repetition-penalty; хостингові ендпоінти ігнорують чи відхиляють екзотичні семплери. Якщо вивід відчувається неправильним, спершу налаштуйте temperature, а потім перевірте ID моделі.

Чому Lite не підключається, коли curl працює?

Майже завжди CORS: Lite працює у вашому браузері, тож ендпоінт має приймати запити з походженням із браузера. Варіанти приблизно за пріоритетом: спробуйте ще раз чисту пряму конфігурацію, запустіть Lite, вбудований у локальний KoboldCpp, або використайте перемикач CORS-проксі Lite, розуміючи, що тоді сторонній сервіс опиниться всередині вашого трафіку.

Це краще за AI Horde?

Це різний компроміс. Horde справді безкоштовний, працює на волонтерах і з чергою — з тими моделями, які саме зараз хостять волонтери. Ендпоінт з оплатою за використання відповідає негайно точно тією моделлю, яку ви обрали, а за тарифами бюджетних моделей вечір гри коштує малу частку цента за повідомлення. Багато людей тримають налаштованими обидва варіанти.