Patakbuhin ang chat ng RAGFlow sa isang OpenAI-API-Compatible base URL.

Updated 2026-07-29

May OpenAI-API-Compatible provider ang RAGFlow para eksakto rito: idagdag ang bawat model kasama ang id nito, https://api.apisrouter.com/v1 bilang base url, at isang key. Naglilingkod pagkatapos ang mga id ng Claude, GPT, DeepSeek, GLM, Kimi, at Qwen sa datasets, chats, at agents mo mula sa iisang endpoint.

Mabilisang sagot: idagdag ang model sa Model providers page.

Mag-log in sa RAGFlow, i-click ang logo mo sa kanang itaas, at buksan ang Model providers. Sa ilalim ng Models to be added, hanapin ang OpenAI-API-Compatible card at i-click ang Add the model. Sa Add LLM dialog, itakda ang Model type sa chat, i-type ang eksaktong id ng katalogo bilang Model name, ilagay ang https://api.apisrouter.com/v1 sa Base url, i-paste ang key mo sa API-Key, at itakda ang Max tokens sa tunay na context size ng model. I-click ang OK. Pagkatapos, gawin itong may ginagawa: buksan ang Set default models sa parehong page at piliin ang bago mong model bilang default LLM. Ire-resolve ng mga chat assistant, dataset question answering, at agent nodes ang lahat sa default na iyon maliban kung ini-override nila ito. Isang matalim na gilid na dapat malaman bago ang unang run: nagde-default sa 512 ang Max tokens field ng RAGFlow at binabalaan ng sariling tooltip nito na ang isang invalid na value ay nagdudulot ng mga error, kaya ang paglalagay ng naka-document na window ng model ay bahagi ng setup, hindi isang optimization.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Paano ikinakabit ng RAGFlow ang mga model sa trabaho.

Ang RAGFlow (infiniflow sa GitHub, humigit-kumulang 85K stars) ay isang deep-document na RAG engine: layout-aware na pagpars ng mga PDF at table, chunking na may naka-ground na citations, datasets, chat assistants, at agent workflows sa ibabaw nito. Iba't ibang bahagi ng pipeline na iyon ay nakakabit sa iba't ibang model slot, at malinaw ang binding. Nagge-generate ng mga sagot ang chat models. Ini-vectorize ng embedding models ang mga chunk para sa retrieval. Muling nag-aayos ng mga kandidato ang rerank models, at inilalarawan ng img2txt models ang mga figure sa panahon ng pagpars. Maaaring irehistro ng OpenAI-API-Compatible provider ang mga model para sa mga type na ito nang isa-isa, bawat Add LLM dialog na gumagawa ng isang binding ng type, id, base url, at key. Nagsasalita ang bawat na-register na chat model ng standard chat completions sa base url gamit ang Model name bilang wire string, kaya valid ang anumang id na si-serve ng gateway, anuman ang vendor. Mahalaga ang paghihiwalay na iyon sa operasyon: ligtas anumang araw ang paglipat ng answer model mula sa gpt-5.5 patungo sa claude-sonnet-4-6, pero nakakabit ang embedding model sa mga naka-index mong vector. Ipinapatupad ito ng RAGFlow gamit ang isang compatibility check kapag nagpapalit ng embedding models sa isang dataset na may mga chunk na, at mas simple ang praktikal na patakaran: piliin ang embedding setup nang isang beses, at ituring ang chat models bilang layer na malayang tinu-tune mo.

Isang key para sa Chinese at Western na mga model nang magkasama.

Kadalasang bilingual ang mga deployment ng RAGFlow: mga team na Chinese ang pinagmulan na nagpoproseso ng mixed-language na document bases, at mga international na team na partikular na gustong makuha ang mga Chinese na model para sa mga Chinese na dokumento. Kapag direktang si-serve, masakit ang pinaghalong iyon, dahil hiwalay ang bill ng DeepSeek, Zhipu, Moonshot, at Alibaba at awkward bayaran ang ilan mula sa abroad, habang awkward naman ang Anthropic at OpenAI sa kabilang direksyon. Sa pamamagitan ng isang OpenAI-API-Compatible na base url, ang pinaghalong iyon ay mas maraming Add LLM dialog na lamang: deepseek-v4-pro at glm-5.2 para sa mga Chinese-heavy na corpora, qwen3.7-max at kimi-k2.6 bilang malalakas na regional na alternatibo, claude-sonnet-4-6 kung saan pinakamahalaga ang pagkintab ng sagot. Parehong base url, parehong key, mga id mula mismo sa katalogo. Para sa mga team sa Asia, gumagana rin nang kabaliktaran ang parehong ruta: nagiging maaabot ang mga id ng Claude at GPT sa isang prepaid na balance nang walang Western card, na para sa maraming RAGFlow shop ay ang pagkakaiba sa pagitan ng pagsusuri ng isang model at pagbabasa lamang tungkol dito. May isa ring boot-time na path na karapat-dapat malaman: tumatanggap ang service_conf.yaml.template ng isang user_default_llm block (factory, api_key, base_url) kaya darating na paunang-kinabit ang mga sariwang install. Malinaw ang docs ng RAGFlow na pagkatapos mag-log in, nangyayari lamang ang configuration sa Model providers page, kaya ituring ang YAML bilang first-boot na probisyon, hindi live na config.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Pagpili ng mga model para sa isang document pipeline.

Ang retrieval quality ang nagtatakda ng kisame at ang answer model ang nagdedesisyon kung gaano ka kalapit dito, kaya A/B ang answer models sa tunay mong corpus: parehong dataset, parehong mga tanong, dalawang assistant na naka-pin sa dalawang id, at ang per-model na gastos sa APIsRouter console katabi ng sarili mong paghatol sa mga sagot.

  • Input-heavy na trabaho kung saan kumikinang ang mga mid-tier na model ang naka-ground na pagsagot sa retrieved chunks: pinapanatili ng deepseek-v4-pro at glm-5.2 na patag ang gastos per tanong sa mga bilingual na corpora.
  • Ang qwen3.7-max at kimi-k2.6 ang mga regional na heavyweight na karapat-dapat subukan kapag dapat mabasa nang natural sa Chinese ang mga sagot; mas malaki ang pagkakaiba ng kalidad sa mga Chinese model sa generation kaysa sa retrieval.
  • Kinikita ng claude-sonnet-4-6 ang answer slot kung saan ang kalidad ng synthesis ang produkto, executive summaries, pagsusuri ng kontrata, anumang ipapadala ng tao nang hindi na-edit.
  • Nangangailangan ng maaasahang function calling ang mga agent workflow na tumatawag ng mga tool; subukan muna ang agent path sa claude-sonnet-4-6, pagkatapos ay tingnan kung aling regional na id ang tumutugma dito sa mga flow mo.
  • Per-registration ang Max tokens, kaya i-register ang parehong id nang dalawang beses na may magkaibang limitasyon kung ang isang assistant ay nangangailangan ng mahahabang sagot at ang isa ay mahigpit.

Pay-as-you-go · mas mababa sa opisyal na presyo

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModelOpisyal na PresyoAming Presyo
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Mga failure mode na specific sa RAGFlow.

Klasiko ang default na Max tokens. Kapag naiwan sa 512, naputol o nagkaka-error ang mahahabang sagot sa paraang tila problema sa model; itakda ang naka-document na context size kapag ini-register, tulad ng babala mismo ng tooltip. Ang isang na-register na model na agad nagkaka-error ay karaniwang ang baybay ng Model name (dapat itong eksaktong tumugma sa listahan ng /v1/models) o isang Base url na kulang ang /v1 suffix, dahil ini-append ng RAGFlow ang mga route path sa inilagay mo. Problema sa defaults ang walang nangyayari pagkatapos ng pagpaparehistro: hindi pinipili ng pagpaparehistro ng isang model ito. Suriin ang Set default models, at suriin ang per-assistant na model settings, na nananalo laban sa default ng workspace. Kabahagi ng listahan ang kalituhan sa embedding. Kung ikinakabit mo ang isang embedding id sa pamamagitan ng compatible provider, kumpirmahin munang talagang si-serve ito ng endpoint bago mag-index; at kapag may mga chunk na ang isang dataset, ang pagpapalit ng embedding model nito ay hinaharangan ng isang similarity check at maaaring mangailangan ng muling pag-index mula sa zero. Walang gastos na ganito ang mga pagbabago sa chat model, kung kaya't ang chat layer ang lugar na dapat mong subukan.

Sino ang nagru-route ng RAGFlow sa pamamagitan ng isang gateway.

  • Mga bilingual na document team na pinaghahalo ang DeepSeek, GLM, Qwen, at Kimi sa mga id ng Claude at GPT sa likod ng isang base url at isang key.
  • Mga team sa Asia na gustong makuha ang Claude-quality na mga sagot sa isang prepaid na balance nang walang Western card, at mga Western na team na gustong makuha ang mga Chinese na model nang walang regional na billing.
  • Mga self-hoster na nagpapatakbo ng RAGFlow para sa internal na knowledge bases na gustong makuha sa isang usage log ang buong gastos sa cloud ng deployment.
  • Mga builder na naghahambing ng answer models sa isang fixed na corpus, kung saan ang bawat kandidato ay isang Add LLM dialog sa halip na vendor account.
  • Mga team ng ops na nagpoprobisyon ng mga sariwang install mula sa service_conf.yaml.template na paunang-kinabit na ang endpoint.

I-verify ang endpoint at i-debug ang unang chat.

I-curl muna ang models listing; libreng text ang field ng Model name, at ang pagkopya ng mga id mula sa listahan ay nag-aalis ng pinakakaraniwang kabiguan bago pa man ito mangyari. Pagkatapos, patakbuhin ang isang chat completion laban sa id na balak mong i-register. Sa loob ng RAGFlow, i-register ang model, itakda ito bilang default LLM, at mag-test sa isang plain na chat assistant bago isali ang mga dataset. Ang mga authentication error ay tumuturo sa API-Key; ang not-found sa Model name; ang mga connection error sa Base url o container egress, dahil ang RAGFlow server, hindi ang browser mo, ang dapat makaabot sa endpoint. Ang mga naputol o nabigong mahahabang sagot ay tumuturo pabalik sa Max tokens. Kapag dumadaloy na ang mga chat, ipinapakita ng APIsRouter console ang per-request na model, token counts, at gastos. Input-dominated ang traffic ng RAG, at ang usage log ang lugar kung saan mo makikita kung ano talaga ang gastos ng pag-query sa corpus mo, per model, per araw, isang pahina para sa Chinese at Western na id nang magkasama.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Mga madalas itanong

Paano ako magdadagdag ng OpenAI-API-Compatible na model sa RAGFlow?

I-click ang avatar mo, buksan ang Model providers, hanapin ang OpenAI-API-Compatible sa ilalim ng Models to be added, at i-click ang Add the model. Punan ang Model type (chat), Model name (ang eksaktong id ng katalogo), Base url na https://api.apisrouter.com/v1, API-Key, at isang tunay na value ng Max tokens, pagkatapos ay kumpirmahin gamit ang OK.

Bakit naputol o nagkaka-error ang mga sagot ko pagkatapos magdagdag ng model?

Halos palaging Max tokens: nagde-default ang RAGFlow sa 512 at binabalaan ng tooltip nito na ang mga maling value ay nagdudulot ng mga error. I-edit ang pagpaparehistro ng model at ilagay ang naka-document na context size ng model.

Maaari bang paghaluin ng RAGFlow ang mga Chinese at Western na model sa isang provider?

Oo. Ipinapadala ng bawat pagpaparehistro ang string ng Model name nito sa parehong base url, kaya maaaring magsalo sa isang tabi at mapili per assistant ang deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6, at claude-sonnet-4-6, bini-bill sa isang key.

Hiwalay ba nakakabit ang chat at embedding models?

Oo. Nagre-register ang bawat Add LLM dialog ng isang model ng isang type, at ini-assign ng Set default models ang default na LLM at embedding slots nang hiwalay. Malayang mapapalitan ang mga chat model; nakakabit ang mga embedding model sa naka-index na mga vector at hinaharangan ng isang compatibility check kapag may mga chunk na ang isang dataset.

Maaari ko bang paunang-i-configure ang endpoint bago ang unang boot?

Oo, sa pamamagitan ng user_default_llm block sa docker/service_conf.yaml.template: factory OpenAI-API-Compatible, ang api_key mo, at base_url. Binabasa ito ng RAGFlow sa unang startup; pagkatapos mag-log in, lumilipat ang configuration sa Model providers page lamang.

Bakit hindi ginagamit ang na-register kong model?

Hiwalay na hakbang ang pagpaparehistro at ang pagpili. Itakda ang model bilang default LLM sa ilalim ng Set default models, at suriin ang per-assistant na model settings, na nananalo laban sa default. Kung nabibigo pa rin, ihambing ang Model name laban sa baybay ng listahan ng /v1/models.