KoboldAI Lite на кастомному OpenAI-сумісному ендпоінті.
Updated 2026-07-29
KoboldAI Lite нативно підключається до кастомних ендпоінтів: власний README проєкту перелічує API у форматі OpenAI та Claude поряд з інстанціями Kobold і AI Horde. Спрямуйте поле кастомного URL на https://api.apisrouter.com/v1 з вашим ключем, і кожна модель каталогу — DeepSeek, GLM, Kimi, Claude, Grok — стає доступною для вибору в тому самому інтерфейсі історій, незалежно від того, використовуєте ви хостинговий Lite на lite.koboldai.net чи копію, вбудовану в KoboldCpp.
Коротка відповідь: значення, потрібні Lite.
Відкрийте панель з'єднання AI (кнопка AI у верхньому меню Lite), перемкніться з типового AI Horde на групу кастомних ендпоінтів і оберіть опцію OpenAI-compatible. Точні назви трохи різняться між збірками, але поля незмінні: URL API, ключ і модель, обрана після підключення. Дві деталі, специфічні для Lite, спричиняють більшість проблем, коли щось не працює. По-перше, чекбокс версії: Lite пропонує перемикач на кшталт «Add Ver. Num», який сам дописує /v1 до URL, тож введення https://api.apisrouter.com з увімкненим чекбоксом і https://api.apisrouter.com/v1 з вимкненим — обидва варіанти працюють коректно, а от подвоєння /v1 — ні. По-друге, збереження: Lite історично скидав кастомні URL ендпоінтів при повторному підключенні, тож тримайте URL напохваті, а не покладайтесь на те, що поле переживе кожну сесію.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Що таке Lite і як він доходить до хостингової моделі.
KoboldAI Lite — це веб-інтерфейс екосистеми Kobold, який не потребує встановлення: односторінковий застосунок для написання історій, режиму пригод і чату з персонажами, що працює повністю у браузері. Він постачається у двох формах, які поділяють ті самі налаштування: хостингова інстанція на lite.koboldai.net і вбудована копія, яку KoboldCpp обслуговує на localhost, коли ви запускаєте моделі локально. README проєкту описує його як здатний підключатися до кастомних ендпоінтів, включно з API у форматі OpenAI та Claude, поряд з локальними й віддаленими інстанціями Kobold і краудсорсинговим AI Horde. Оскільки Lite — це браузерний застосунок без власного сервера, ваші запити API йдуть напряму з браузера до будь-якого ендпоінта, який ви налаштували. Саме через цей дизайн шлях з кастомним ендпоінтом взагалі працює, і саме тому нижче існує розділ про CORS: ендпоінт має відповідати на запити з походженням із браузера, а коли не відповідає, Lite пропонує перемикач проксі з компромісами, які варто зрозуміти, перш ніж його вмикати. Для тих, хто приходить з AI Horde: перевага ендпоінта з оплатою за використання над волонтерським кластером — передбачуваність. Horde справді безкоштовний, але з чергою; оплачений ендпоінт відповідає негайно точно тією моделлю, яку ви попросили, а за тарифами бюджетних моделей вечір гри коштує малу частку цента за повідомлення.
Налаштування, поле за полем.
Якщо список моделей лишається порожнім після підключення, найпоширеніші причини за рангом: подвоєний або відсутній /v1 (спершу перевірте чекбокс версії), ключ, вставлений із пробілами, або розширення браузера, що блокує запит. Ті самі три значення, що працюють у команді curl, — найшвидший спосіб довести, що бік ендпоінта в порядку, і локалізувати проблему в браузері.
- Відкрийте Lite (хостинговий чи вбудований) і натисніть кнопку AI у верхньому меню, щоб відкрити панель з'єднання.
- Перемкніть вибір провайдера з AI Horde на групу кастомних ендпоінтів і оберіть опцію OpenAI-compatible (назви трохи різняться залежно від збірки; поруч є опція у форматі Claude).
- Введіть URL: https://api.apisrouter.com/v1, зважаючи на чекбокс версії, описаний вище, щоб /v1 з'явився рівно один раз.
- Вставте ваш ключ sk-... у поле ключа.
- Підключіться, тоді оберіть модель зі списку, який отримує Lite, або введіть точний ID з каталогу, якщо ваша збірка вимагає назву моделі вручну.
- Надішліть одне коротке повідомлення в новій історії, щоб підтвердити зв'язок, перш ніж завантажувати довгу сесію.
Опція ендпоінта Claude і коли її використовувати.
Група кастомних ендпоінтів Lite також включає опцію у форматі Claude для API діалекту Anthropic. APIsRouter обслуговує і цей діалект — на /v1/messages, тож ID моделей claude доступні через обидва «входи». На практиці шлях OpenAI-compatible — простіший типовий варіант навіть для моделей Claude, оскільки одна конфігурація тоді обслуговує всі родини: claude-sonnet-4-6 для високоякісної прози, deepseek-v4-flash для масової гри, glm-5.2 і kimi-k2.6 для ротації — все це просто зміни поля моделі, а не переналаштування. Опція у форматі Claude виправдовує себе, якщо ви тримаєте пресети, налаштовані саме під формат запитів Anthropic, або мігруєте налаштування з іншого інструменту з діалектом Anthropic. Функціонально обидва шляхи через цей шлюз ведуть до тих самих моделей; оберіть один і дотримуйтесь його послідовно, щоб ваші збережені налаштування лишались портативними.
Семплери і режими: що насправді застосовується через хостинговий ендпоінт.
Lite показує у своїх налаштуваннях повний «звіринець» семплерів для локальних моделей, і більшість з них не переносяться далі. На OpenAI-сумісних ендпоінтах, за власною документацією Lite, застосовуються лише елементи керування на кшталт temperature, top-p і repetition-penalty; екзотичні семплери на кшталт Min-P, Top-A чи TFS — це функції локального інференсу, і хоча Lite може додавати їх як додаткові поля, хостингові ендпоінти зазвичай ігнорують чи відхиляють нестандартні параметри. Встановіть temperature приблизно 0.8–0.9 для різноманіття прози, тримайте top-p близько 0.95 і низький штраф за повторення; це вся поверхня, яку можна налаштувати, і цього достатньо. Усі режими написання Lite працюють через кастомний ендпоінт, з однією порадою: режим instruct найприродніше лягає на хостингові чат-моделі, оскільки він створює структурований обмін репліками за ролями, на якому ці моделі й натреновані. Класичне спільне написання історій теж працює; очікуйте, що моделі поводитимуться радше як співрозмовники, ніж як продовжувачі сирого тексту, — адже саме таким є ендпоінт chat completions. Бюджетування контексту підпорядковується тому самому правилу, що й у будь-якому фронтенді для рольових ігор: Lite повторно надсилає видимий контекст історії на кожному ході, тож встановлюйте розмір контексту свідомо (робоче вікно 16K–32K покриває довгі сесії), а не максимізуйте його лише тому, що вікно моделі це дозволяє. Гайд з довжини контексту за посиланням нижче наводить ці розрахунки для різних моделей.
| Налаштування | Відправна точка | Примітка |
|---|---|---|
| Temperature | 0.8–0.9 | Головний важіль, що «переживає» перехід до хостингового ендпоінта |
| Top P | 0.95 | Не чіпайте, якщо вивід не стає незв'язним |
| Repetition penalty | Низький | Високі значення спотворюють імена в довгих історіях |
| Екзотичні семплери (Min-P, Top-A, TFS) | Ігнорувати | Функції локального інференсу; хостингові ендпоінти відкидають чи відхиляють їх |
| Розмір контексту | 16K–32K | Надсилається повторно щоходу; вартість масштабується разом з ним |
Оплата за фактом · нижче офіційних цін
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Модель | Офіційна ціна | Наша ціна |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, перемикач проксі і як не втратити глузд через ключ.
Оскільки Lite звертається до ендпоінта напряму з вашого браузера, збій з'єднання за правильних значень зазвичай означає CORS: ендпоінт відхиляє запити з походженням із браузера. Lite постачається саме для такого випадку з перемикачем «Use CORS Proxy», і тут варте чесне попередження: маршрутизація через будь-який сторонній проксі поміщає цей проксі всередину вашого трафіку, включно з ключем і вмістом історії. Спершу спробуйте пряме з'єднання, за сумніву підтвердіть роботу ендпоінта через curl і ставтесь до перемикача проксі як до крайнього засобу, а не типового варіанту. Запуск вбудованого Lite з локального KoboldCpp — ще один чистий обхідний шлях, оскільки там існують ті самі налаштування кастомного ендпоінта. Гігієна ключа має особливе значення для браузерного застосунку: ключ зберігається в локальних налаштуваннях вашого браузера, тож уникайте вставляти його на спільних чи публічних машинах, а якщо він колись витече — відкликайте й видайте новий, а не сподівайтесь на краще. Ключі тут створюються безкоштовно, тож окремий ключ для Lite тримає журнал використання зрозумілим, а радіус можливої шкоди — малим. Одна примітка щодо контенту, прямо: кастомний ендпоінт змінює лише те, куди йдуть запити, а не те, що дозволяють моделі. Політики моделей вище за ланцюгом і умови будь-якої інстанції Lite, якою ви користуєтесь, все одно діють; сторінка порівняння політик за посиланням нижче фактично висвітлює цей ландшафт, родина моделей за родиною.
Поширені запитання
Чи підтримує KoboldAI Lite кастомні OpenAI-сумісні ендпоінти?
Так, нативно. README проєкту перелічує кастомні ендпоінти, включно з API у форматі OpenAI та Claude, поряд з інстанціями Kobold і AI Horde. Конфігурація — це URL, ключ і модель у панелі з'єднання AI як у хостинговому, так і у вбудованому в KoboldCpp Lite.
Який URL вводити для APIsRouter у KoboldAI Lite?
https://api.apisrouter.com/v1, зважаючи на чекбокс версії, щоб /v1 з'явився рівно один раз: перемикач Lite на кшталт «Add Ver. Num» автоматично дописує /v1, коли увімкнений. Подвоєний чи відсутній сегмент версії — найпоширеніша причина порожнього списку моделей.
Чи можу я використовувати моделі Claude в KoboldAI Lite?
Так, двома способами: через OpenAI-сумісний ендпоінт з ID claude на кшталт claude-sonnet-4-6 у полі моделі, або через опцію ендпоінта Lite у форматі Claude на /v1/messages. Шлях OpenAI-compatible — простіший типовий варіант, оскільки та сама конфігурація тоді обслуговує й усі інші родини моделей.
Чому мої налаштування семплерів наче нічого не роблять?
Більшість «звіринця» семплерів Lite призначена для локального інференсу. Через OpenAI-сумісний ендпоінт застосовуються лише елементи керування на кшталт temperature, top-p і repetition-penalty; хостингові ендпоінти ігнорують чи відхиляють екзотичні семплери. Якщо вивід відчувається неправильним, спершу налаштуйте temperature, а потім перевірте ID моделі.
Чому Lite не підключається, коли curl працює?
Майже завжди CORS: Lite працює у вашому браузері, тож ендпоінт має приймати запити з походженням із браузера. Варіанти приблизно за пріоритетом: спробуйте ще раз чисту пряму конфігурацію, запустіть Lite, вбудований у локальний KoboldCpp, або використайте перемикач CORS-проксі Lite, розуміючи, що тоді сторонній сервіс опиниться всередині вашого трафіку.
Це краще за AI Horde?
Це різний компроміс. Horde справді безкоштовний, працює на волонтерах і з чергою — з тими моделями, які саме зараз хостять волонтери. Ендпоінт з оплатою за використання відповідає негайно точно тією моделлю, яку ви обрали, а за тарифами бюджетних моделей вечір гри коштує малу частку цента за повідомлення. Багато людей тримають налаштованими обидва варіанти.