RAGFlow-Chat auf einer OpenAI-API-Compatible-Base-URL betreiben.
Updated 2026-07-29
RAGFlow liefert genau dafür einen OpenAI-API-Compatible-Provider: füge jedes Modell mit seiner ID hinzu, https://api.apisrouter.com/v1 als base url, und einen Key. Claude-, GPT-, DeepSeek-, GLM-, Kimi- und Qwen-IDs bedienen dann deine Datasets, Chats und Agents von einem einzigen Endpoint.
Kurzantwort: das Modell auf der Seite Model providers hinzufügen.
Melde dich bei RAGFlow an, klick oben rechts auf dein Logo, und öffne Model providers. Unter Models to be added findest du die Karte OpenAI-API-Compatible und klickst auf Add the model. Setze im Add-LLM-Dialog Model type auf chat, gib die exakte Katalog-ID als Model name ein, trag https://api.apisrouter.com/v1 in Base url ein, füge deinen Key in API-Key ein, und setze Max tokens auf die reale Context-Size des Modells. Klick auf OK. Lass es dann etwas tun: öffne Set default models auf derselben Seite und wähle dein neues Modell als Default LLM. Chat-Assistants, Dataset-Question-Answering und Agent-Nodes lösen sich alle zu diesem Default auf, sofern sie ihn nicht überschreiben. Eine scharfe Kante vor dem ersten Run: RAGFlows Max-tokens-Feld defaultet auf 512, und der eigene Tooltip warnt, dass ein ungültiger Wert Fehler verursacht, also ist die Eingabe des dokumentierten Fensters des Modells Teil des Setups, keine Optimierung.
Model type: chat
Model name: deepseek-v4-pro
Base url: https://api.apisrouter.com/v1
API-Key: sk-YOUR-APISROUTER-KEY
Max tokens: 128000
then: Set default models → LLM → deepseek-v4-proWie RAGFlow Modelle an Arbeit bindet.
RAGFlow (infiniflow auf GitHub, rund 85.000 Stars) ist eine Deep-Document-RAG-Engine: layout-bewusstes Parsing von PDFs und Tabellen, Chunking mit verankerten Zitaten, Datasets, Chat-Assistants und Agent-Workflows obendrauf. Verschiedene Teile dieser Pipeline binden an verschiedene Model-Slots, und die Bindung ist explizit. Chat-Modelle generieren Antworten. Embedding-Modelle vektorisieren Chunks für Retrieval. Rerank-Modelle ordnen Kandidaten neu, und img2txt-Modelle beschreiben Abbildungen beim Parsen. Der OpenAI-API-Compatible-Provider kann Modelle für diese Typen einzeln registrieren, wobei jeder Add-LLM-Dialog eine Bindung aus Typ, ID, Base URL und Key erzeugt. Jedes registrierte Chat-Modell spricht Standard-Chat-Completions gegen die Base URL mit dem Model name als Wire-String, also ist jede vom Gateway bediente ID gültig, unabhängig vom Vendor. Diese Trennung zählt operativ: dein Antwortmodell von gpt-5.5 auf claude-sonnet-4-6 zu wechseln ist jederzeit sicher, aber das Embedding-Modell ist mit deinen indizierten Vektoren verschweißt. RAGFlow erzwingt das mit einem Kompatibilitäts-Check beim Wechsel des Embedding-Modells auf einem Dataset, das schon Chunks hat, und die praktische Regel ist einfacher: wähle das Embedding-Setup einmal, und behandle Chat-Modelle als die Schicht, die du frei tunst.
Ein Key für chinesische und westliche Modelle zusammen.
RAGFlow-Deployments neigen zu zweisprachig: chinesischsprachige Teams, die gemischtsprachige Dokumentenbasen verarbeiten, und internationale Teams, die gezielt chinesische Modelle für chinesische Dokumente wollen. Direkt bedient ist dieser Mix schmerzhaft, da DeepSeek, Zhipu, Moonshot und Alibaba jeweils separat abrechnen und manche aus dem Ausland umständlich zu bezahlen sind, während Anthropic und OpenAI aus der anderen Richtung umständlich sind. Über eine OpenAI-API-Compatible-Base-URL ist der Mix nur mehr Add-LLM-Dialoge: deepseek-v4-pro und glm-5.2 für chinesisch-lastige Korpora, qwen3.7-max und kimi-k2.6 als starke regionale Alternativen, claude-sonnet-4-6, wo Antwort-Politur am meisten zählt. Dieselbe Base URL, derselbe Key, IDs direkt aus dem Katalog. Für Teams in Asien funktioniert derselbe Weg umgekehrt: Claude- und GPT-IDs werden auf einem Prepaid-Guthaben ohne westliche Karte erreichbar, was für viele RAGFlow-Shops der Unterschied zwischen einem Modell testen und darüber lesen ist. Es gibt zudem einen Boot-Time-Pfad, den man kennen sollte: service_conf.yaml.template akzeptiert einen user_default_llm-Block (factory, api_key, base_url), sodass frische Installationen bereits vorverdrahtet hochkommen. RAGFlows Docs sind eindeutig, dass nach dem Login Konfiguration nur auf der Seite Model providers passiert, behandle die YAML also als First-Boot-Provisioning, nicht als Live-Config.
user_default_llm:
factory: OpenAI-API-Compatible
api_key: sk-YOUR-APISROUTER-KEY
base_url: https://api.apisrouter.com/v1Modelle für eine Dokumenten-Pipeline wählen.
Retrieval-Qualität setzt die Obergrenze, und das Antwortmodell entscheidet, wie nah du herankommst, teste also Antwortmodelle A/B an deinem echten Korpus: dasselbe Dataset, dieselben Fragen, zwei Assistants gepinnt auf zwei IDs, und die Per-Modell-Ausgaben in der APIsRouter-Konsole neben deinem eigenen Urteil zu den Antworten.
- Verankertes Antworten über abgerufene Chunks ist input-lastige Arbeit, wo Mid-Tier-Modelle glänzen: deepseek-v4-pro und glm-5.2 tragen zitatfolgende Antworten gut auf zweisprachigen Korpora.
- qwen3.7-max und kimi-k2.6 sind die regionalen Schwergewichte, die es zu testen lohnt, wenn Antworten nativ auf Chinesisch klingen müssen; Qualitätsunterschiede zwischen chinesischen Modellen zeigen sich stärker in der Generierung als im Retrieval.
- claude-sonnet-4-6 verdient sich den Antwort-Slot, wo Synthesequalität das Produkt ist, Executive Summaries, Vertragsanalyse, alles, was ein Mensch unbearbeitet weiterleitet.
- Agent-Workflows, die Tools aufrufen, brauchen verlässliches Function Calling; teste den Agent-Pfad zuerst auf claude-sonnet-4-6, und sieh dann, welche regionale ID auf deinen Flows mithält.
- Max tokens ist pro Registrierung, registriere also dieselbe ID zweimal mit unterschiedlichen Limits, wenn ein Assistant lange Antworten braucht und ein anderer knappe.
Nutzungsbasiert · unter offiziellem Preis
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modell | Offizieller Preis | Unser Preis |
|---|---|---|
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Qwen 3.7 Max | $2.50 / $7.50 per M | $2.50 / $7.50 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
Fehlerbilder speziell für RAGFlow.
Der Max-tokens-Default ist der Klassiker. Bei 512 belassen, kürzen oder scheitern lange Antworten auf eine Art, die wie Modellprobleme aussieht; setze beim Registrieren die dokumentierte Context Size, wie der Tooltip selbst warnt. Ein registriertes Modell, das sofort Fehler wirft, liegt meist an der Model-name-Schreibweise (sie muss exakt zur /v1/models-Liste passen) oder einer Base url ohne ihr /v1-Suffix, da RAGFlow Routenpfade an das anhängt, was du einträgst. Passiert nach der Registrierung nichts, ist das ein Defaults-Problem: ein Modell zu registrieren wählt es nicht aus. Prüf Set default models, und prüf Per-Assistant-Model-Einstellungen, die den Workspace-Default überschreiben. Embedding-Verwirrung rundet die Liste ab. Bindest du eine Embedding-ID über den kompatiblen Provider, bestätige, dass der Endpoint sie tatsächlich bedient, bevor du indizierst; und hat ein Dataset erst Chunks, ist das Ändern seines Embedding-Modells durch einen Ähnlichkeits-Check gesperrt und kann Neu-Indizierung von null erfordern. Chat-Modell-Änderungen tragen keine solche Kosten, genau weshalb die Chat-Schicht ist, wo du experimentieren solltest.
Wer RAGFlow über ein Gateway routet.
- Zweisprachige Dokumententeams, die DeepSeek, GLM, Qwen und Kimi mit Claude- und GPT-IDs hinter einer Base URL und einem Key mischen.
- Teams in Asien, die Claude-Qualität-Antworten auf einem Prepaid-Guthaben ohne westliche Karte wollen, und westliche Teams, die chinesische Modelle ohne regionales Billing wollen.
- Self-Hoster, die RAGFlow für interne Knowledge Bases betreiben und den gesamten Cloud-Spend des Deployments auf einem Nutzungslog wollen.
- Builder, die Antwortmodelle an einem festen Korpus vergleichen, wo jeder Kandidat ein Add-LLM-Dialog statt eines Vendor-Kontos ist.
- Ops-Teams, die frische Installationen aus service_conf.yaml.template mit vorverdrahtetem Endpoint beim ersten Boot provisionieren.
Endpoint verifizieren und den ersten Chat debuggen.
Curle zuerst die Modell-Liste; das Model-name-Feld ist Freitext, und IDs aus der Liste zu kopieren eliminiert den häufigsten Fehler, bevor er passiert. Führ dann eine Chat Completion gegen die ID aus, die du registrieren willst. Registriere in RAGFlow das Modell, setze es als Default LLM, und teste in einem einfachen Chat-Assistant, bevor du Datasets einbeziehst. Authentifizierungsfehler verweisen auf API-Key; Not-found auf Model name; Connection-Fehler auf Base url oder Container-Egress, da es der RAGFlow-Server, nicht dein Browser, ist, der den Endpoint erreichen muss. Gekürzte oder scheiternde lange Antworten verweisen zurück auf Max tokens. Sobald Chats laufen, zeigt die APIsRouter-Konsole Modell, Token-Zahlen und Ausgaben pro Anfrage. RAG-Traffic ist input-dominiert, und das Nutzungslog ist, wo du siehst, was dein Korpus eine Anfrage tatsächlich kostet, pro Modell, pro Tag, eine Seite für chinesische und westliche IDs zusammen.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-pro",
"messages":[{"role":"user","content":"ping"}]}'Häufige Fragen
Wie füge ich ein OpenAI-API-Compatible-Modell in RAGFlow hinzu?
Klick auf deinen Avatar, öffne Model providers, finde OpenAI-API-Compatible unter Models to be added, und klick auf Add the model. Füll Model type (chat), Model name (die exakte Katalog-ID), Base url https://api.apisrouter.com/v1, API-Key und einen echten Max-tokens-Wert, dann bestätige mit OK.
Warum kürzen oder scheitern meine Antworten nach dem Hinzufügen eines Modells?
Fast immer Max tokens: RAGFlow defaultet auf 512, und der Tooltip warnt, dass falsche Werte Fehler verursachen. Bearbeite die Modell-Registrierung und trag die dokumentierte Context Size des Modells ein.
Kann RAGFlow chinesische und westliche Modelle über einen Provider mischen?
Ja. Jede Registrierung schickt ihren Model-name-String an dieselbe Base URL, also können deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 und claude-sonnet-4-6 alle nebeneinander registriert und pro Assistant gewählt werden, abgerechnet über einen Key.
Binden Chat- und Embedding-Modelle separat?
Ja. Jeder Add-LLM-Dialog registriert ein Modell eines Typs, und Set default models weist die Default-LLM- und -Embedding-Slots unabhängig zu. Chat-Modelle lassen sich frei tauschen; Embedding-Modelle sind an indizierte Vektoren gebunden und durch einen Kompatibilitäts-Check gesperrt, sobald ein Dataset Chunks hat.
Kann ich den Endpoint vor dem ersten Boot vorkonfigurieren?
Ja, über den user_default_llm-Block in docker/service_conf.yaml.template: factory OpenAI-API-Compatible, dein api_key und base_url. RAGFlow liest ihn beim ersten Start; nach dem Login wandert Konfiguration nur noch auf die Seite Model providers.
Warum wird mein registriertes Modell nicht genutzt?
Registrierung und Auswahl sind getrennte Schritte. Setze das Modell unter Set default models als Default LLM, und prüf Per-Assistant-Model-Einstellungen, die den Default überschreiben. Scheitert es weiterhin, vergleiche Model name mit der /v1/models-Schreibweise.