KoboldAI Lite na niestandardowym endpoincie kompatybilnym z OpenAI.

Updated 2026-07-29

KoboldAI Lite łączy się z niestandardowymi endpointami natywnie: README projektu wymienia API w kształcie OpenAI i Claude obok instancji Kobold i AI Horde. Wskaż jego pole niestandardowego URL na https://api.apisrouter.com/v1 razem ze swoim kluczem, a każdy model z katalogu — DeepSeek, GLM, Kimi, Claude, Grok — staje się wybieralny w tym samym interfejsie do opowieści, niezależnie czy używasz hostowanego Lite pod lite.koboldai.net, czy kopii dołączonej do KoboldCpp.

Szybka odpowiedź: wartości, których potrzebuje Lite.

Otwórz panel połączenia AI (przycisk AI w górnym menu Lite), przełącz z domyślnego AI Horde na grupę niestandardowego endpointu i wybierz opcję kompatybilną z OpenAI. Dokładne etykiety nieco się różnią między wersjami, ale pola są stałe: URL API, klucz oraz model wybierany po połączeniu. Dwa szczegóły specyficzne dla Lite odpowiadają za większość problemów, gdy coś nie działa. Po pierwsze, checkbox wersji: Lite oferuje przełącznik w stylu „Add Ver. Num", który sam dopisuje /v1 do URL, więc wpisanie https://api.apisrouter.com z zaznaczonym polem i https://api.apisrouter.com/v1 z odznaczonym polem oba rozwiązują się poprawnie, natomiast podwojenie /v1 już nie. Po drugie, trwałość: Lite historycznie resetowało URL-e niestandardowych endpointów przy ponownym połączeniu, więc trzymaj URL pod ręką, zamiast zakładać, że pole przetrwa każdą sesję.

API URL:  https://api.apisrouter.com/v1   (or base URL + "Add Ver. Num" ticked)
API key:  sk-...                            (from APIsRouter)
Model:    deepseek-v4-flash                 (or any catalog id after connecting)

Czym jest Lite i jak dociera do hostowanego modelu.

KoboldAI Lite to niewymagający instalacji interfejs webowy ekosystemu Kobold: aplikacja jednostronicowa do pisania opowieści, trybu przygodowego i czatu z postaciami, działająca w całości w przeglądarce. Występuje w dwóch formach współdzielących te same ustawienia: hostowanej instancji pod lite.koboldai.net oraz dołączonej kopii, którą KoboldCpp serwuje na localhost, gdy uruchamiasz modele lokalnie. README projektu opisuje ją jako zdolną do łączenia się z niestandardowymi endpointami, w tym API w kształcie OpenAI i Claude, obok lokalnych i zdalnych instancji Kobold oraz społecznościowego AI Horde. Ponieważ Lite jest aplikacją przeglądarkową bez własnego serwera, Twoje żądania API idą bezpośrednio z przeglądarki do dowolnego skonfigurowanego endpointu. Ten projekt sprawia, że ścieżka niestandardowego endpointu w ogóle działa, a także dlaczego istnieje poniższa sekcja o CORS: endpoint musi odpowiadać na żądania z originu przeglądarki, a gdy tego nie robi, Lite oferuje przełącznik proxy z kompromisami wartymi zrozumienia, zanim się go włączy. Dla osób przychodzących z AI Horde: atutem rozliczanego endpointu ponad wolontariackim klastrem jest przewidywalność. Horde jest naprawdę darmowe, ale z kolejką; opłacany endpoint odpowiada natychmiast dokładnie tym modelem, o który poprosisz, a przy stawkach z rodziny value wieczór gry kosztuje ułamek centa za wiadomość.

Konfiguracja, pole po polu.

Jeśli lista modeli pozostaje pusta po połączeniu, zwykłe przyczyny w kolejności ważności to: podwojone albo brakujące /v1 (najpierw sprawdź checkbox wersji), klucz wklejony z białymi znakami albo rozszerzenie przeglądarki blokujące żądanie. Zadziałanie tych samych trzech wartości w poleceniu curl to najszybszy sposób, by potwierdzić, że strona endpointu jest w porządku, i zlokalizować problem po stronie przeglądarki.

  • Otwórz Lite (hostowane albo dołączone) i kliknij przycisk AI w górnym menu, żeby otworzyć panel połączenia.
  • Przełącz wybór dostawcy z AI Horde na grupę niestandardowego endpointu i wybierz opcję kompatybilną z OpenAI (etykiety nieco się różnią zależnie od wersji; obok znajduje się też opcja w kształcie Claude).
  • Wpisz URL: https://api.apisrouter.com/v1, pamiętając o opisanym wyżej checkboxie wersji, żeby /v1 pojawiło się dokładnie raz.
  • Wklej swój klucz sk-... w pole klucza.
  • Połącz się, a następnie wybierz model z listy pobranej przez Lite, albo wpisz dokładny identyfikator z katalogu, jeśli Twoja wersja prosi o ręczną nazwę modelu.
  • Wyślij jedną krótką wiadomość w nowej historii, żeby potwierdzić działanie połączenia, zanim wczytasz długą sesję.

Opcja endpointu Claude i kiedy jej używać.

Grupa niestandardowego endpointu w Lite obejmuje też opcję w kształcie Claude dla API w dialekcie Anthropic. APIsRouter obsługuje ten dialekt również, pod /v1/messages, więc identyfikatory claude są osiągalne przez obie „bramy". W praktyce ścieżka kompatybilna z OpenAI jest prostszym domyślnym wyborem nawet dla modeli Claude, bo jedna konfiguracja obsługuje wtedy każdą rodzinę: claude-sonnet-4-6 do prozy najwyższej klasy, deepseek-v4-flash do gry o dużej objętości, glm-5.2 i kimi-k2.6 do rotacji — wszystko jako zmiany pola modelu, a nie rekonfiguracje. Opcja w kształcie Claude ma sens, jeśli utrzymujesz presety dostrojone konkretnie pod format żądań Anthropic albo migrujesz ustawienia z innego narzędzia w dialekcie Anthropic. Funkcjonalnie obie ścieżki kończą się na tych samych modelach przez tę bramkę; wybierz jedną i trzymaj się jej konsekwentnie, żeby zapisane ustawienia pozostały przenośne.

Samplery i tryby: co faktycznie działa przy hostowanym endpoincie.

Lite udostępnia w swoich ustawieniach całe bogactwo samplerów dla modeli lokalnych, a większość z nich nie przenosi się dalej. Na endpointach kompatybilnych z OpenAI, jak zaznacza własna dokumentacja Lite, działają tylko kontrolki w stylu temperature, top-p i repetition-penalty; egzotyczne samplery jak Min-P, Top-A czy TFS to funkcje lokalnego wnioskowania i choć Lite może dołączyć je jako dodatkowe pola, hostowane endpointy zwykle ignorują albo odrzucają niestandardowe parametry. Ustaw temperature w okolicach 0.8–0.9 dla różnorodności prozy, zostaw top-p blisko 0.95 i trzymaj kary za powtórzenia nisko; to cała regulowana powierzchnia i to wystarczy. Wszystkie tryby pisania w Lite działają przez niestandardowy endpoint, z jedną wskazówką: tryb instruct odwzorowuje się najbardziej naturalnie na hostowane modele czatu, bo tworzy ustrukturyzowaną wymianę opartą na rolach, do której te modele są trenowane. Klasyczne współtworzenie opowieści też działa; spodziewaj się, że modele będą zachowywać się bardziej jak partnerzy konwersacji niż surowi kontynuatorzy tekstu, bo tym właśnie jest endpoint chat completions. Budżetowanie kontekstu podlega tej samej zasadzie co w każdym frontendzie do roleplayu: Lite przy każdej turze wysyła ponownie widoczny kontekst opowieści, więc ustaw rozmiar kontekstu świadomie (okno robocze 16K–32K pokrywa długie sesje), zamiast ustawiać maksimum tylko dlatego, że okno modelu na to pozwala. Przewodnik po długości kontekstu podlinkowany poniżej pokazuje te wyliczenia dla różnych modeli.

Rzeczywiste działanie samplerów na endpointach kompatybilnych z OpenAI, według własnych notatek Lite w ustawieniach.
UstawieniePunkt startowyUwaga
Temperature0.8–0.9Główna dźwignia, która przetrwa podróż do hostowanego endpointu
Top P0.95Zostaw bez zmian, chyba że wynik staje się niespójny
Repetition penaltyNiskaWysokie wartości psują imiona w długich opowieściach
Egzotyczne samplery (Min-P, Top-A, TFS)IgnorujFunkcje lokalnego wnioskowania; hostowane endpointy je odrzucają albo pomijają
Rozmiar kontekstu16K–32KWysyłany ponownie przy każdej turze; koszt rośnie razem z nim

Płatność za użycie · poniżej cen oficjalnych

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModelCena oficjalnaNasza cena
DeepSeek V4 Flash$0.14 / $0.28 per M$0.10 / $0.30 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Grok 4.5$2.00 / $6.00 per M$1.60 / $4.80 per M

CORS, przełącznik proxy i utrzymanie klucza w porządku.

Ponieważ Lite wywołuje endpoint bezpośrednio z przeglądarki, awaria połączenia przy poprawnych wartościach to zwykle CORS: endpoint odrzuca żądania z originu przeglądarki. Lite ma na dokładnie ten przypadek przełącznik „Use CORS Proxy" i zasługuje on na uczciwe ostrzeżenie: kierowanie ruchu przez jakiekolwiek proxy trzeciej strony umieszcza to proxy wewnątrz Twojego ruchu, łącznie z kluczem i treścią opowieści. Najpierw wypróbuj połączenie bezpośrednie, w razie wątpliwości potwierdź działanie endpointu przez curl, a przełącznik proxy traktuj jako ostateczność, nie domyślne ustawienie. Uruchomienie dołączonego Lite z lokalnego KoboldCpp to kolejne czyste obejście, bo te same ustawienia niestandardowego endpointu istnieją i tam. Higiena klucza ma nieco większe znaczenie w aplikacji przeglądarkowej: klucz siedzi w lokalnych ustawieniach Twojej przeglądarki, więc unikaj wklejania go na współdzielonych albo publicznych komputerach, a jeśli kiedykolwiek wycieknie, unieważnij go i wygeneruj nowy, zamiast liczyć na najlepsze. Klucze tworzy się tu bezpłatnie, więc dedykowany klucz dla Lite utrzymuje log użycia czytelnym, a promień ewentualnej szkody małym. Jedna uwaga o treściach, powiedziana wprost: niestandardowy endpoint zmienia to, dokąd idą żądania, a nie to, na co pozwalają modele. Polityki modeli upstream oraz regulamin instancji Lite, z której korzystasz, nadal obowiązują; strona porównująca polityki podlinkowana poniżej rzeczowo opisuje sytuację, rodzina modeli po rodzinie.

Częste pytania

Czy KoboldAI Lite obsługuje niestandardowe endpointy kompatybilne z OpenAI?

Tak, natywnie. README projektu wymienia niestandardowe endpointy, w tym API w kształcie OpenAI i Claude, obok instancji Kobold i AI Horde. Konfiguracja to URL, klucz i model, z panelu połączenia AI zarówno w hostowanym, jak i dołączonym do KoboldCpp Lite.

Jaki URL wpisać dla APIsRouter w KoboldAI Lite?

https://api.apisrouter.com/v1, przy odpowiednim ustawieniu checkboxa wersji, żeby /v1 pojawiło się dokładnie raz: przełącznik w stylu „Add Ver. Num" w Lite dopisuje /v1 automatycznie, gdy jest zaznaczony. Podwojony albo brakujący segment wersji to najczęstsza przyczyna pustej listy modeli.

Czy mogę używać modeli Claude w KoboldAI Lite?

Tak, na dwa sposoby: przez endpoint kompatybilny z OpenAI z identyfikatorem claude, np. claude-sonnet-4-6, w polu modelu, albo przez opcję endpointu w kształcie Claude w Lite, działającą na /v1/messages. Ścieżka kompatybilna z OpenAI jest prostszym domyślnym wyborem, bo ta sama konfiguracja obsługuje wtedy też każdą inną rodzinę.

Dlaczego moje ustawienia samplerów wydają się nic nie robić?

Większość bogactwa samplerów w Lite dotyczy lokalnego wnioskowania. Przez endpoint kompatybilny z OpenAI działają tylko kontrolki w stylu temperature, top-p i repetition-penalty; hostowane endpointy ignorują albo odrzucają egzotyczne samplery. Jeśli wynik wydaje się nie taki, najpierw dostrój temperature, a w drugiej kolejności sprawdź identyfikator modelu.

Dlaczego Lite nie może się połączyć, mimo że curl działa?

Prawie zawsze CORS: Lite działa w Twojej przeglądarce, więc endpoint musi akceptować żądania z originu przeglądarki. Opcje w przybliżonej kolejności: spróbuj ponownie czystej, bezpośredniej konfiguracji, uruchom Lite dołączone do lokalnego KoboldCpp, albo użyj przełącznika proxy CORS w Lite, ze świadomością, że wtedy strona trzecia siedzi wewnątrz Twojego ruchu.

Czy to lepsze niż AI Horde?

Inny kompromis. Horde jest naprawdę darmowe, prowadzone przez wolontariuszy i z kolejką, z modelami, jakie akurat hostują wolontariusze. Rozliczany endpoint odpowiada natychmiast dokładnie wybranym modelem, przy stawkach z rodziny value stawiających wieczór gry na ułamku centa za wiadomość. Wiele osób trzyma skonfigurowane oba.