Draai RAGFlow-chat op een OpenAI-API-Compatible base URL.
Updated 2026-07-29
RAGFlow levert precies hiervoor een OpenAI-API-Compatible provider: voeg elk model toe met zijn ID, https://api.apisrouter.com/v1 als base url, en één sleutel. Claude-, GPT-, DeepSeek-, GLM-, Kimi- en Qwen-ID's bedienen dan je datasets, chats en agents vanuit één endpoint.
Snel antwoord: voeg het model toe op de Model providers-pagina.
Log in bij RAGFlow, klik rechtsboven op je logo, en open Model providers. Zoek onder Models to be added de kaart OpenAI-API-Compatible en klik op Add the model. Zet in de Add LLM-dialoog Model type op chat, voer het exacte catalogus-ID in als Model name, plaats https://api.apisrouter.com/v1 in Base url, plak je sleutel in API-Key, en zet Max tokens op de echte contextgrootte van het model. Klik op OK. Zorg er dan voor dat het iets doet: open Set default models op dezelfde pagina en kies je nieuwe model als het standaard LLM. Chatassistenten, dataset-vraagbeantwoording, en agent-nodes herleiden zich allemaal naar die standaard tenzij ze hem overschrijven. Eén scherpe rand om te kennen vóór de eerste run: het Max tokens-veld van RAGFlow staat standaard op 512 en zijn eigen tooltip waarschuwt dat een ongeldige waarde fouten veroorzaakt, dus het gedocumenteerde venster van het model invoeren is onderdeel van de instelling, geen optimalisatie.
Model type: chat
Model name: deepseek-v4-pro
Base url: https://api.apisrouter.com/v1
API-Key: sk-YOUR-APISROUTER-KEY
Max tokens: 128000
then: Set default models → LLM → deepseek-v4-proHoe RAGFlow modellen aan werk bindt.
RAGFlow (infiniflow op GitHub, ruim 85K sterren) is een diep-document RAG-engine: layout-bewust parsen van PDF's en tabellen, knippen met gegronde citaties, datasets, chatassistenten, en agent-workflows erbovenop. Verschillende delen van die pipeline binden aan verschillende modelslots, en de binding is expliciet. Chatmodellen genereren antwoorden. Embeddingmodellen vectoriseren fragmenten voor retrieval. Rerankmodellen herordenen kandidaten, en img2txt-modellen beschrijven figuren tijdens het parsen. De OpenAI-API-Compatible provider kan modellen voor deze types individueel registreren, waarbij elke Add LLM-dialoog één binding van type, ID, base url, en sleutel aanmaakt. Elk geregistreerd chatmodel spreekt standaard chat completions tegen de base url met de Model name als wire-string, dus elk ID dat de gateway bedient is geldig, ongeacht leverancier. Die scheiding doet er operationeel toe: je antwoordmodel wisselen van gpt-5.5 naar claude-sonnet-4-6 is elke dag veilig, maar het embeddingmodel zit vastgeklonken aan je geïndexeerde vectoren. RAGFlow dwingt dit af met een compatibiliteitscontrole bij het wisselen van embeddingmodellen op een dataset die al fragmenten heeft, en de praktische regel is simpeler: kies de embedding-instelling eenmalig, en behandel chatmodellen als de laag die je vrij afstemt.
Eén sleutel voor Chinese en westerse modellen samen.
RAGFlow-deployments neigen tweetalig: Chinees-georiënteerde teams die meertalige documentbases verwerken, en internationale teams die specifiek Chinese modellen willen voor Chinese documenten. Direct bediend is die mix pijnlijk, aangezien DeepSeek, Zhipu, Moonshot, en Alibaba elk apart factureren en sommige lastig te betalen zijn vanuit het buitenland, terwijl Anthropic en OpenAI lastig zijn vanuit de andere richting. Via één OpenAI-API-Compatible base url is de mix gewoon meer Add LLM-dialogen: deepseek-v4-pro en glm-5.2 voor Chinees-zware corpora, qwen3.7-max en kimi-k2.6 als sterke regionale alternatieven, claude-sonnet-4-6 waar antwoordpolijsting het meest telt. Dezelfde base url, dezelfde sleutel, ID's rechtstreeks uit de catalogus. Voor teams in Azië werkt dezelfde route omgekeerd: Claude- en GPT-ID's worden bereikbaar op een vooruitbetaald saldo zonder westerse kaart, wat voor veel RAGFlow-shops het verschil is tussen een model evalueren en erover lezen. Er is ook een pad bij het opstarten dat het waard is om te kennen: service_conf.yaml.template accepteert een user_default_llm-blok (factory, api_key, base_url) zodat verse installaties al voorbekabeld opkomen. De documentatie van RAGFlow is expliciet dat na inloggen configuratie alleen op de Model providers-pagina gebeurt, dus behandel de YAML als eerste-boot-provisioning, geen live config.
user_default_llm:
factory: OpenAI-API-Compatible
api_key: sk-YOUR-APISROUTER-KEY
base_url: https://api.apisrouter.com/v1Modellen kiezen voor een documentpipeline.
Retrievalkwaliteit bepaalt het plafond en het antwoordmodel bepaalt hoe dicht je erbij komt, dus A/B-test antwoordmodellen op je echte corpus: dezelfde dataset, dezelfde vragen, twee assistenten vastgepind op twee ID's, en de uitgaven per model in de APIsRouter-console naast je eigen oordeel over de antwoorden.
- Gegrond antwoorden over opgehaalde fragmenten is input-zwaar werk waarin middenklasse-modellen schitteren: deepseek-v4-pro en glm-5.2 dragen citatievolgende antwoorden goed op tweetalige corpora.
- qwen3.7-max en kimi-k2.6 zijn de regionale zwaargewichten die het waard zijn om te testen wanneer antwoorden natuurlijk Chinees moeten lezen; kwaliteitsverschillen tussen Chinese modellen tonen zich meer in generatie dan in retrieval.
- claude-sonnet-4-6 verdient de antwoordslot waar synthesekwaliteit het product is, directiesamenvattingen, contractanalyse, alles wat een mens ongewijzigd doorstuurt.
- Agent-workflows die tools aanroepen hebben betrouwbare function calling nodig; test het agentpad eerst op claude-sonnet-4-6, en kijk dan welk regionaal ID daarmee overeenkomt op je flows.
- Max tokens is per registratie, dus registreer hetzelfde ID tweemaal met verschillende limieten als de ene assistent lange antwoorden nodig heeft en de andere krappe.
Betaal naar gebruik · onder officiële prijzen
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Officiële prijs | Onze prijs |
|---|---|---|
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Qwen 3.7 Max | $2.50 / $7.50 per M | $2.50 / $7.50 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
Faalmodi specifiek voor RAGFlow.
De Max tokens-standaard is de klassieker. Op 512 gelaten breken of falen lange antwoorden op manieren die aanvoelen als modelproblemen; stel de gedocumenteerde contextgrootte in bij registratie, zoals de tooltip zelf waarschuwt. Een geregistreerd model dat onmiddellijk fouten geeft, is meestal de spelling van Model name (het moet exact overeenkomen met de /v1/models-lijst) of een Base url zonder zijn /v1-suffix, aangezien RAGFlow routepaden toevoegt aan wat je invoert. Niets gebeurt na registratie is een standaardenprobleem: een model registreren selecteert het niet. Controleer Set default models, en controleer instellingen per assistent, die de workspace-standaard overschrijven. Embeddingverwarring rondt de lijst af. Als je een embedding-ID bindt via de compatibele provider, bevestig dan dat het endpoint het daadwerkelijk bedient voordat je indexeert; en zodra een dataset fragmenten heeft, is het wijzigen van zijn embeddingmodel gepoort door een gelijkenischeck en kan het herindexering vanaf nul vereisen. Chatmodelwijzigingen dragen geen dergelijke kosten, precies waarom de chatlaag is waar je moet experimenteren.
Wie routeert RAGFlow via een gateway.
- Tweetalige documentteams die DeepSeek, GLM, Qwen, en Kimi mixen met Claude- en GPT-ID's achter één base url en één sleutel.
- Teams in Azië die Claude-kwaliteit antwoorden willen op een vooruitbetaald saldo zonder westerse kaart, en westerse teams die Chinese modellen willen zonder regionale facturering.
- Self-hosters die RAGFlow draaien voor interne kennisbanken en de cloud-uitgaven van de hele deployment op één gebruikslogboek willen.
- Bouwers die antwoordmodellen vergelijken op een vast corpus, waar elke kandidaat één Add LLM-dialoog is in plaats van een leveranciersaccount.
- Ops-teams die verse installaties provisioneren vanuit service_conf.yaml.template met het endpoint al voorbekabeld bij eerste opstart.
Verifieer het endpoint en debug de eerste chat.
Curl eerst de modellenlijst; het Model name-veld is vrije tekst, en ID's kopiëren uit de lijst elimineert de meest voorkomende fout voordat hij gebeurt. Draai dan één chat completion tegen het ID dat je van plan bent te registreren. Registreer binnen RAGFlow het model, zet het als standaard LLM, en test in een gewone chatassistent voordat je datasets erbij betrekt. Authenticatiefouten wijzen naar API-Key; not-found naar Model name; verbindingsfouten naar Base url of container-egress, aangezien het de RAGFlow-server is, niet je browser, die het endpoint moet bereiken. Afgeknotte of falende lange antwoorden wijzen terug naar Max tokens. Zodra chats vloeien, toont de APIsRouter-console model per verzoek, tokenaantallen en uitgaven. RAG-verkeer is input-gedomineerd, en het gebruikslogboek is waar je ziet wat je corpus daadwerkelijk kost om te bevragen, per model, per dag, één pagina voor de Chinese en westerse ID's samen.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-pro",
"messages":[{"role":"user","content":"ping"}]}'Veelgestelde vragen
Hoe voeg ik een OpenAI-API-Compatible model toe in RAGFlow?
Klik op je avatar, open Model providers, zoek OpenAI-API-Compatible onder Models to be added, en klik op Add the model. Vul Model type (chat), Model name (het exacte catalogus-ID), Base url https://api.apisrouter.com/v1, API-Key, en een echte Max tokens-waarde in, bevestig dan met OK.
Waarom knippen of falen mijn antwoorden na het toevoegen van een model?
Bijna altijd Max tokens: RAGFlow zet het standaard op 512 en zijn tooltip waarschuwt dat onjuiste waarden fouten veroorzaken. Bewerk de modelregistratie en voer de gedocumenteerde contextgrootte van het model in.
Kan RAGFlow Chinese en westerse modellen mixen via één provider?
Ja. Elke registratie stuurt zijn Model name-string naar dezelfde base url, dus deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6, en claude-sonnet-4-6 kunnen allemaal naast elkaar worden geregistreerd en per assistent worden geselecteerd, gefactureerd via één sleutel.
Binden chat- en embeddingmodellen apart?
Ja. Elke Add LLM-dialoog registreert één model van één type, en Set default models wijst de standaard LLM- en embeddingslots onafhankelijk toe. Chatmodellen kunnen vrij worden gewisseld; embeddingmodellen zijn gebonden aan geïndexeerde vectoren en gepoort door een compatibiliteitscheck zodra een dataset fragmenten heeft.
Kan ik het endpoint vooraf configureren voor eerste opstart?
Ja, via het user_default_llm-blok in docker/service_conf.yaml.template: factory OpenAI-API-Compatible, je api_key, en base_url. RAGFlow leest het bij eerste opstart; na inloggen verhuist configuratie alleen naar de Model providers-pagina.
Waarom wordt mijn geregistreerde model niet gebruikt?
Registratie en selectie zijn aparte stappen. Zet het model als standaard LLM onder Set default models, en controleer instellingen per assistent, die de standaard overschrijven. Vergelijk anders Model name met de spelling in de /v1/models-lijst.