Uruchom AnythingLLM na dowolnym modelu przez Generic OpenAI.
Updated 2026-07-29
Dostawca Generic OpenAI w AnythingLLM łączy całą aplikację z dowolnym endpointem kompatybilnym z OpenAI: Base URL https://api.apisrouter.com/v1, jeden klucz, identyfikator modelu czatu i uczciwe limity tokenów. Identyfikatory Claude, GPT, Gemini i DeepSeek kwalifikują się wszystkie, zarówno do dokumentów, agentów, jak i czatu.
Szybka odpowiedź: pięć pól w LLM Preference.
Otwórz ustawienia AnythingLLM, przejdź do sekcji LLM pod AI Providers (ekran historycznie nazywany LLM Preference) i wyszukaj na liście dostawców Generic OpenAI. Po wybraniu odsłania pięć pól: Base URL, API Key, Chat Model Name, Token Context Window i Max Tokens. Wypełnij je tak: Base URL https://api.apisrouter.com/v1 (/v1 należy do tego pola), swój klucz i dokładny identyfikator z katalogu w Chat Model Name, na przykład claude-sonnet-4-6. Potem dwie liczby: Token Context Window to całkowite okno modelu, a Max Tokens ogranicza pojedynczą odpowiedź, więc obie wartości weź z dokumentacji modelu zamiast zgadywać. Zapisz, a każdy workspace podążający za domyślnym ustawieniem systemowym będzie teraz rozmawiał przez bramkę. Dokumentacja oznacza tego dostawcę jako "developer-focused" właśnie dlatego, że ufa Twoim danym wejściowym; to nie jest ostrzeżenie przed jego użyciem, tylko stwierdzenie, że pięć pól to kontrakt.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Co faktycznie napędza dostawca Generic OpenAI.
AnythingLLM (Mintplex Labs na GitHubie, około 63 tys. gwiazdek) to kompleksowy prywatny asystent dokumentów: workspace'y, które embedują Twoje pliki, czat oparty na pobranym kontekście, agenci z użyciem narzędzi, dostępne jako aplikacja desktopowa i self-hostowany serwer. Skonfigurowana wyżej preferencja LLM jest domyślnym mózgiem dla tego wszystkiego. Żądania wychodzą jako standardowe chat completions do Twojego Base URL z Chat Model Name jako stringiem modelu, więc dostawca nie ma znaczenia: identyfikator Claude jest tak samo ważny jak identyfikator GPT, a przełączenie oznacza edycję jednego pola. Workspace'y mogą też nadpisać domyślne ustawienie systemowe własnym dostawcą i ustawieniami modelu, co jest sposobem, w jaki jedno wdrożenie uruchamia claude-sonnet-4-6 dla workspace'u prawnego i gpt-5.5 dla inżynierii, bez wiedzy jednego o drugim. Dwa pola tokenów zasługują na szacunek, ponieważ AnythingLLM używa ich do budżetowania kontekstu. Wartość okna kontekstu decyduje, ile pobranego tekstu dokumentu i historii czatu zostanie upakowane w każde żądanie; zaniżenie jej sprawia, że Twoje starannie zembedowane dokumenty zostają przycięte z własnych odpowiedzi, a zawyżenie sprawia, że żądania odbijają się od rzeczywistego limitu modelu. To ta para pól stoi za większością raportów „RAG wydaje się głupi" na generycznych endpointach.
Embeddingi to osobna decyzja.
AnythingLLM rozdziela preferencję LLM od preferencji embeddingu, i ten podział ma znaczenie konstrukcyjne. Model czatu odpowiada na pytania; embedder zamienia Twoje dokumenty w wektory w momencie wgrywania, a te wektory pozostają. Zmiana modelu czatu jest darmowa, w każdej chwili, per workspace. Zmiana embeddera unieważnia geometrię wszystkiego, co już zembedowano, i oznacza ponowne embedowanie dokumentów. Praktyczna konfiguracja: AnythingLLM dostarcza wbudowany lokalny embedder, który działa offline i nic nie kosztuje, i wiele wdrożeń po prostu go zostawia. Jeśli zamiast tego wskażesz preferencję embeddingu na zdalny endpoint, potwierdź, że konkretny identyfikator embeddingu jest tam obsługiwany, zanim wgrasz swoją bazę dokumentów, i traktuj ten wybór jako związany na stałe z magazynem wektorów. Swoboda, jaką to kupuje po stronie czatu, jest sensem tej architektury: gdy embeddingi są ustalone, model czatu Generic OpenAI to pokrętło niskiego ryzyka. Uruchom deepseek-v4-pro na miesiąc intensywnego streszczania, przełącz pole na claude-sonnet-4-6 na kwartał pracy dla klienta, a nic w Twoich dokumentach nie musi się ruszyć.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyDobór modeli do pracy z dokumentami.
Każdy identyfikator rozlicza się przez ten sam klucz, więc pętla porównawcza to edycja ustawień: ten sam workspace, te same dokumenty, dwa tygodnie na każdego kandydata, a wydatki per model w konsoli APIsRouter obok Twojej własnej oceny odpowiedzi.
- Odpowiadanie na pytania oparte na pobranych fragmentach jest input-heavy: claude-haiku-4-5-20251001 i gemini-3.5-flash dobrze odpowiadają na pytania wymagające cytowania źródeł w cenach wolumenowych.
- claude-sonnet-4-6 zasługuje na rolę domyślną tam, gdzie odpowiedzi trafiają do ludzi bez edycji: przegląd umów, szkicowanie raportów, wszystko, co ma konsekwencje.
- deepseek-v4-pro to koń roboczy długiego kontekstu dla workspace'ów zbudowanych na dużych dokumentach, gdzie okno i cena wejścia dominują nad doświadczeniem.
- Workspace'y agentowe potrzebują niezawodnego wywoływania narzędzi; zacznij agentów na claude-sonnet-4-6, a potem sprawdź, czy lżejszy identyfikator utrzyma się na Twoich rzeczywistych przepływach.
- Używaj nadpisań per workspace jako polityki: domyślny model pozostaje szybki, a drogi identyfikator żyje tylko w workspace'ach, których praca to uzasadnia.
Płatność za użycie · poniżej cen oficjalnych
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Cena oficjalna | Nasza cena |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Tryby awarii charakterystyczne dla AnythingLLM.
Pola tokenów powodują subtelne awarie. Zbyt niskie okno kontekstu po cichu przycina pobrany kontekst, co wygląda jak model ignorujący Twoje dokumenty; ustaw udokumentowane okno dla identyfikatora w Chat Model Name. Zbyt wysokie Max Tokens dla danego modelu produkuje twarde błędy przy długich odpowiedziach; ustaw je na to, co model faktycznie dopuszcza na wyjściu. Twarde błędy są bardziej uczciwe. Błędy uwierzytelniania to pole API Key. Model-not-found to Chat Model Name, który odjechał od zapisu w katalogu; pole jest dowolnym tekstem, a listing /v1/models jest źródłem prawdy. Błędy połączenia w aplikacji desktopowej zwykle oznaczają proxy albo firewall między aplikacją a endpointem; w wdrożeniach na Dockerze pamiętaj, że to kontener musi dosięgnąć Base URL, nie Twoja przeglądarka. Jeśli czat działa, ale workspace zachowuje się inaczej niż oczekiwano, sprawdź jego ustawienia nadpisania; ustawienia dostawcy na poziomie workspace wygrywają z domyślnym ustawieniem systemowym, a zapomniane nadpisanie to klasyczna zagadka "to samo pytanie, inny model". Deweloperskie ukierunkowanie z dokumentacji podsumowuje wszystko powyższe: dostawca robi dokładnie to, co mówi jego pięć pól, ani więcej, ani mniej.
Kto kieruje AnythingLLM przez bramkę.
- Zespoły prowadzące prywatnych asystentów dokumentów, które chcą jakości odpowiedzi na poziomie frontier bez konta u dostawcy na każdą rodzinę modeli.
- Użytkownicy desktopowi wskazujący swoją osobistą bazę dokumentów na identyfikatory Claude albo GPT na przedpłaconym saldzie, bez karty wymaganej na start.
- Self-hosterzy, którzy zostawiają wbudowany lokalny embedder i traktują zdalny czat jako jedyny mierzony pas ruchu, czytany per model na jednym logu użycia.
- Wdrożenia podzielone na workspace'y, gdzie nadpisania per workspace plus mierzenie per klucz dają każdemu zespołowi własny model i własny rachunek.
- Twórcy porównujący modele odpowiedzi na stałej bazie dokumentów, gdzie każdy kandydat to jedna edycja ustawień, a nie migracja.
Zweryfikuj endpoint i debuguj pierwszy czat workspace'u.
Odpytaj curlem listing modeli i jedno chat completion najpierw, używając dokładnego identyfikatora, który zamierzasz wpisać w Chat Model Name. Gdy oba przejdą, połowa dotycząca bramki jest udowodniona, a każdy pozostały objaw mieszka w pięciu polach. Potem zapisz ustawienia dostawcy i zadaj jedno pytanie w workspace z dokumentem, który dobrze znasz. Uziemiona, cytująca odpowiedź oznacza, że cały pipeline działa. Odpowiedź ignorująca dokument wskazuje na wartość okna kontekstu albo na własne ustawienia retrievalu workspace'u. Twarde błędy mapują się jasno: klucz, zapis identyfikatora, kształt Base URL. Gdy czaty już płyną, konsola APIsRouter pokazuje model per żądanie, liczbę tokenów i wydatki. Pytania do dokumentów mnożą tokeny wejściowe przez retrieval, a log użycia to miejsce, gdzie dowiadujesz się, ile faktycznie kosztuje odpytywanie Twojej bazy dokumentów, per model, per dzień, i per klucz workspace'u, jeśli je rozdzielasz.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Częste pytania
Jak ustawić niestandardowy Base URL w AnythingLLM?
W ustawieniach pod AI Providers otwórz ekran preferencji LLM i wybierz Generic OpenAI z listy dostawców. Ustaw Base URL na https://api.apisrouter.com/v1, dodaj swój klucz, wpisz dokładny identyfikator z katalogu w Chat Model Name i wypełnij oba pola tokenów danymi z dokumentacji modelu.
Czym sterują Token Context Window i Max Tokens?
Okno kontekstu mówi AnythingLLM, ile pobranego tekstu i historii może upakować w jedno żądanie; Max Tokens ogranicza pojedynczą odpowiedź. Zaniżenie okna przycina Twoje dokumenty z odpowiedzi, a zawyżenie któregokolwiek z nich produkuje żądania odrzucane przez model.
Czy AnythingLLM może uruchamiać Claude albo DeepSeek przez Generic OpenAI?
Tak. Dostawca wysyła Chat Model Name jako zwykły string do Base URL przez standardowe chat completions, więc claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash i identyfikatory GPT działają wszystkie, przełączalne edycją jednego pola albo per workspace.
Czy przełączenie modelu czatu wpływa na moje zembedowane dokumenty?
Nie. Preferencje czatu i embeddingu są oddzielne; wektory pozostają, a modele czatu można swobodnie przełączać. Tylko zmiana embeddera unieważnia istniejące wektory i wymusza ponowne embedowanie, dlatego wiele wdrożeń zostawia wbudowany lokalny embedder i dostraja tylko stronę czatu.
Dlaczego strona dokumentacji nazywa Generic OpenAI "developer-focused"?
Ponieważ ufa Twoim danym wejściowym zamiast dostarczać presety per dostawca: złe identyfikatory, URL-e albo wartości tokenów zawodzą w czasie działania, zamiast być wychwycone przez formularz. Przy identyfikatorach skopiowanych z /v1/models i limitach z dokumentacji modelu to stabilna, pierwszorzędna ścieżka.
Czy różne workspace'y mogą używać różnych modeli?
Tak. Workspace'y dziedziczą domyślne ustawienie systemowe, ale mogą nadpisać dostawcę i model we własnych ustawieniach czatu, więc jedno wdrożenie może domyślnie uruchamiać szybki identyfikator i przypiąć claude-sonnet-4-6 tylko w workspace'ach, których praca na to zasługuje.