Uruchom czat RAGFlow na base URL kompatybilnym z OpenAI-API.
Updated 2026-07-29
RAGFlow udostępnia dostawcę OpenAI-API-Compatible dokładnie do tego: dodaj każdy model z jego identyfikatorem, https://api.apisrouter.com/v1 jako base url i jeden klucz. Identyfikatory Claude, GPT, DeepSeek, GLM, Kimi i Qwen obsługują wtedy Twoje datasety, czaty i agentów z jednego endpointu.
Szybka odpowiedź: dodaj model na stronie Model providers.
Zaloguj się do RAGFlow, kliknij swoje logo w prawym górnym rogu i otwórz Model providers. Pod Models to be added znajdź kartę OpenAI-API-Compatible i kliknij Add the model. W oknie dialogowym Add LLM ustaw Model type na chat, wpisz dokładny identyfikator z katalogu jako Model name, wpisz https://api.apisrouter.com/v1 w Base url, wklej swój klucz w API-Key i ustaw Max tokens na rzeczywisty rozmiar kontekstu modelu. Kliknij OK. Potem spraw, żeby to coś zrobiło: otwórz Set default models na tej samej stronie i wybierz swój nowy model jako domyślny LLM. Asystenci czatu, odpowiadanie na pytania w datasecie i węzły agentów wszystkie rozwiązują się do tego domyślnego, jeśli go nie nadpiszą. Jedna ostra krawędź warta poznania przed pierwszym uruchomieniem: pole Max tokens w RAGFlow domyślnie wynosi 512, a jego własny tooltip ostrzega, że nieprawidłowa wartość powoduje błędy, więc wpisanie udokumentowanego okna modelu to część konfiguracji, nie optymalizacja.
Model type: chat
Model name: deepseek-v4-pro
Base url: https://api.apisrouter.com/v1
API-Key: sk-YOUR-APISROUTER-KEY
Max tokens: 128000
then: Set default models → LLM → deepseek-v4-proJak RAGFlow wiąże modele z pracą.
RAGFlow (infiniflow na GitHubie, około 85 tys. gwiazdek) to silnik RAG dla głębokich dokumentów: parsowanie PDF-ów i tabel świadome układu, chunking z uziemionymi cytowaniami, datasety, asystenci czatu i workflow agentów na wierzchu. Różne części tego pipeline'u wiążą się z różnymi slotami modeli, a wiązanie jest jawne. Modele czatu generują odpowiedzi. Modele embeddingu wektoryzują fragmenty do retrievalu. Modele rerank przekładają kandydatów, a modele img2txt opisują rysunki podczas parsowania. Dostawca OpenAI-API-Compatible może rejestrować modele dla tych typów indywidualnie, każde okno dialogowe Add LLM tworzy jedno wiązanie typu, identyfikatora, base url i klucza. Każdy zarejestrowany model czatu mówi standardowymi chat completions do base url z Model name jako stringiem przesyłanym na drucie, więc dowolny identyfikator obsługiwany przez bramkę jest ważny, niezależnie od dostawcy. Ten podział ma znaczenie operacyjne: przełączenie modelu odpowiedzi z gpt-5.5 na claude-sonnet-4-6 jest bezpieczne w każdej chwili, ale model embeddingu jest zespawany z Twoimi zaindeksowanymi wektorami. RAGFlow wymusza to kontrolą kompatybilności przy przełączaniu modeli embeddingu na datasecie, który już ma fragmenty, a praktyczna zasada jest prostsza: wybierz konfigurację embeddingu raz, a modele czatu traktuj jako warstwę, którą swobodnie dostrajasz.
Jeden klucz dla chińskich i zachodnich modeli razem.
Wdrożenia RAGFlow przechylają się w stronę dwujęzyczności: zespoły chińskiego pochodzenia przetwarzające bazy dokumentów w mieszanym języku i międzynarodowe zespoły, które konkretnie chcą chińskich modeli do chińskich dokumentów. Obsługiwane bezpośrednio, ta mieszanka jest bolesna, ponieważ DeepSeek, Zhipu, Moonshot i Alibaba rozliczają się osobno, a niektóre są niewygodne do opłacenia z zagranicy, podczas gdy Anthropic i OpenAI są niewygodne z drugiej strony. Przez jeden base url OpenAI-API-Compatible ta mieszanka to po prostu więcej okien dialogowych Add LLM: deepseek-v4-pro i glm-5.2 dla korpusów mocno chińskich, qwen3.7-max i kimi-k2.6 jako silne regionalne alternatywy, claude-sonnet-4-6 tam, gdzie najbardziej liczy się polerowanie odpowiedzi. Ten sam base url, ten sam klucz, identyfikatory prosto z katalogu. Dla zespołów w Azji ta sama trasa działa w odwrotnym kierunku: identyfikatory Claude i GPT stają się osiągalne na przedpłaconym saldzie bez zachodniej karty, co dla wielu sklepów RAGFlow jest różnicą między ewaluowaniem modelu a czytaniem o nim. Jest też ścieżka w momencie rozruchu warta poznania: service_conf.yaml.template przyjmuje blok user_default_llm (factory, api_key, base_url), więc świeże instalacje startują wstępnie okablowane. Dokumentacja RAGFlow wprost mówi, że po zalogowaniu konfiguracja odbywa się tylko na stronie Model providers, więc traktuj YAML jako provisioning przy pierwszym rozruchu, nie konfigurację na żywo.
user_default_llm:
factory: OpenAI-API-Compatible
api_key: sk-YOUR-APISROUTER-KEY
base_url: https://api.apisrouter.com/v1Dobór modeli dla pipeline'u dokumentów.
Jakość retrievalu ustala sufit, a model odpowiedzi decyduje, jak blisko się do niego zbliżysz, więc testuj A/B modele odpowiedzi na swoim prawdziwym korpusie: ten sam dataset, te same pytania, dwóch asystentów przypiętych do dwóch identyfikatorów, a wydatki per model w konsoli APIsRouter obok Twojej własnej oceny odpowiedzi.
- Uziemione odpowiadanie na pobranych fragmentach to praca input-heavy, gdzie błyszczą modele średniego poziomu: deepseek-v4-pro i glm-5.2 dobrze niosą odpowiedzi wymagające cytowania na dwujęzycznych korpusach.
- qwen3.7-max i kimi-k2.6 to regionalne ciężkie działa warte przetestowania, gdy odpowiedzi muszą brzmieć natywnie po chińsku; różnice jakości między chińskimi modelami widać bardziej w generowaniu niż w retrievalu.
- claude-sonnet-4-6 zasługuje na slot odpowiedzi tam, gdzie jakość syntezy jest produktem: streszczenia dla kadry zarządzającej, analiza umów, wszystko, co człowiek przekazuje dalej bez edycji.
- Workflow agentów wywołujące narzędzia potrzebują niezawodnego wywoływania funkcji; przetestuj najpierw ścieżkę agenta na claude-sonnet-4-6, a potem zobacz, który regionalny identyfikator jej dorównuje na Twoich flow.
- Max tokens jest per rejestracja, więc zarejestruj ten sam identyfikator dwukrotnie z różnymi limitami, jeśli jeden asystent potrzebuje długich odpowiedzi, a inny ciasnych.
Płatność za użycie · poniżej cen oficjalnych
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Cena oficjalna | Nasza cena |
|---|---|---|
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Qwen 3.7 Max | $2.50 / $7.50 per M | $2.50 / $7.50 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
Tryby awarii charakterystyczne dla RAGFlow.
Domyślne Max tokens to klasyk. Pozostawione na 512, długie odpowiedzi przycinają się albo dają błędy w sposób, który wygląda jak problemy z modelem; ustaw udokumentowany rozmiar kontekstu podczas rejestracji, jak ostrzega sam tooltip. Zarejestrowany model, który od razu daje błąd, to zwykle zapis Model name (musi dokładnie zgadzać się z listingiem /v1/models) albo Base url bez sufiksu /v1, ponieważ RAGFlow dokleja ścieżki tras do tego, co wpiszesz. Nic się nie dzieje po rejestracji to problem domyślnych: zarejestrowanie modelu go nie wybiera. Sprawdź Set default models i sprawdź ustawienia modelu per asystent, które nadpisują domyślne ustawienie workspace. Zamieszanie z embeddingiem zamyka listę. Jeśli wiążesz identyfikator embeddingu przez kompatybilnego dostawcę, potwierdź, że endpoint faktycznie go obsługuje przed indeksowaniem; a gdy dataset ma już fragmenty, zmiana jego modelu embeddingu jest bramkowana kontrolą podobieństwa i może wymagać reindeksowania od zera. Zmiany modelu czatu nie niosą takiego kosztu, dlatego dokładnie warstwa czatu jest tym, na czym powinieneś eksperymentować.
Kto kieruje RAGFlow przez bramkę.
- Dwujęzyczne zespoły dokumentowe mieszające DeepSeek, GLM, Qwen i Kimi z identyfikatorami Claude i GPT za jednym base url i jednym kluczem.
- Zespoły w Azji, które chcą odpowiedzi jakości Claude na przedpłaconym saldzie bez zachodniej karty, i zespoły zachodnie, które chcą chińskich modeli bez regionalnego rozliczenia.
- Self-hosterzy prowadzący RAGFlow dla wewnętrznych baz wiedzy, którzy chcą mieć wydatki chmurowe całego wdrożenia na jednym logu użycia.
- Twórcy porównujący modele odpowiedzi na stałym korpusie, gdzie każdy kandydat to jedno okno dialogowe Add LLM, a nie konto u dostawcy.
- Zespoły ops provisionujące świeże instalacje z service_conf.yaml.template z endpointem wstępnie okablowanym przy pierwszym rozruchu.
Zweryfikuj endpoint i debuguj pierwszy czat.
Odpytaj curlem listing modeli najpierw; pole Model name jest dowolnym tekstem, a kopiowanie identyfikatorów z listingu eliminuje najczęstszą awarię, zanim się zdarzy. Potem uruchom jedno chat completion na identyfikatorze, który planujesz zarejestrować. Wewnątrz RAGFlow zarejestruj model, ustaw go jako domyślny LLM i przetestuj w zwykłym asystencie czatu, zanim zaangażujesz datasety. Błędy uwierzytelniania wskazują na API-Key; not-found na Model name; błędy połączenia na Base url albo egress kontenera, ponieważ to serwer RAGFlow, nie Twoja przeglądarka, musi dosięgnąć endpointu. Przycięte albo zawodzące długie odpowiedzi wskazują z powrotem na Max tokens. Gdy czaty już płyną, konsola APIsRouter pokazuje model per żądanie, liczbę tokenów i wydatki. Ruch RAG jest zdominowany przez wejście, a log użycia to miejsce, gdzie widzisz, ile Twój korpus faktycznie kosztuje do odpytania, per model, per dzień, jedna strona dla chińskich i zachodnich identyfikatorów razem.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-pro",
"messages":[{"role":"user","content":"ping"}]}'Częste pytania
Jak dodać model OpenAI-API-Compatible w RAGFlow?
Kliknij swój awatar, otwórz Model providers, znajdź OpenAI-API-Compatible pod Models to be added i kliknij Add the model. Wypełnij Model type (chat), Model name (dokładny identyfikator z katalogu), Base url https://api.apisrouter.com/v1, API-Key i realną wartość Max tokens, a potem potwierdź OK.
Dlaczego moje odpowiedzi przycinają się albo dają błąd po dodaniu modelu?
Niemal zawsze Max tokens: RAGFlow domyślnie ustawia je na 512, a tooltip ostrzega, że nieprawidłowe wartości powodują błędy. Edytuj rejestrację modelu i wpisz udokumentowany rozmiar kontekstu modelu.
Czy RAGFlow może mieszać chińskie i zachodnie modele przez jednego dostawcę?
Tak. Każda rejestracja wysyła swój string Model name do tego samego base url, więc deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 i claude-sonnet-4-6 mogą wszystkie zostać zarejestrowane obok siebie i wybierane per asystent, rozliczane przez jeden klucz.
Czy modele czatu i embeddingu wiążą się osobno?
Tak. Każde okno dialogowe Add LLM rejestruje jeden model jednego typu, a Set default models przypisuje sloty domyślnego LLM i embeddingu niezależnie. Modele czatu można swobodnie zamieniać; modele embeddingu są związane z zaindeksowanymi wektorami i bramkowane kontrolą kompatybilności, gdy dataset ma już fragmenty.
Czy mogę wstępnie skonfigurować endpoint przed pierwszym rozruchem?
Tak, przez blok user_default_llm w docker/service_conf.yaml.template: factory OpenAI-API-Compatible, Twój api_key i base_url. RAGFlow czyta go przy pierwszym starcie; po zalogowaniu konfiguracja przenosi się wyłącznie na stronę Model providers.
Dlaczego mój zarejestrowany model nie jest używany?
Rejestracja i wybór to osobne kroki. Ustaw model jako domyślny LLM pod Set default models i sprawdź ustawienia modelu per asystent, które nadpisują domyślny. Jeśli nadal zawodzi, porównaj Model name z zapisem w listingu /v1/models.