RAGFlow chat کو OpenAI-API-Compatible base URL پر چلائیں۔

Updated 2026-07-29

RAGFlow بالکل اسی کے لیے ایک OpenAI-API-Compatible provider ساتھ لاتا ہے: ہر model اس کی id، base url کے طور پر https://api.apisrouter.com/v1، اور ایک key کے ساتھ شامل کریں۔ Claude، GPT، DeepSeek، GLM، Kimi، اور Qwen ids پھر آپ کے datasets، chats، اور agents کو ایک ہی endpoint سے serve کرتی ہیں۔

فوری جواب: Model providers page پر model شامل کریں۔

RAGFlow میں لاگ ان کریں، اوپر دائیں طرف اپنے logo پر کلک کریں، اور Model providers کھولیں۔ Models to be added کے تحت، OpenAI-API-Compatible card تلاش کریں اور Add the model پر کلک کریں۔ Add LLM dialog میں، Model type کو chat پر سیٹ کریں، Model name میں exact کیٹلاگ id درج کریں، Base url میں https://api.apisrouter.com/v1 ڈالیں، API-Key میں اپنی key paste کریں، اور Max tokens کو model کی حقیقی context size پر سیٹ کریں۔ OK پر کلک کریں۔ پھر اسے کچھ کرنے دیں: اسی page پر Set default models کھولیں اور اپنے نئے model کو default LLM کے طور پر چنیں۔ Chat assistants، dataset question answering، اور agent nodes سب اسی default پر resolve ہوتے ہیں جب تک وہ اسے override نہ کریں۔ پہلی run سے پہلے جاننے کے قابل ایک نازک کنارہ: RAGFlow کا Max tokens field default طور پر 512 پر ہے اور اس کا اپنا tooltip warn کرتا ہے کہ ایک invalid value errors پیدا کرتی ہے، تو model کی documented window درج کرنا سیٹ اپ کا حصہ ہے، optimization نہیں۔

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

RAGFlow models کو کام سے کیسے bind کرتا ہے۔

RAGFlow (GitHub پر infiniflow، تقریباً 85K stars) ایک deep-document RAG engine ہے: PDFs اور tables کی layout-aware parsing، grounded citations والی chunking، datasets، chat assistants، اور اس کے اوپر agent workflows۔ اس pipeline کے مختلف حصے مختلف model slots سے bind ہوتے ہیں، اور یہ binding واضح ہے۔ Chat models جوابات پیدا کرتی ہیں۔ Embedding models retrieval کے لیے chunks کو vectorize کرتی ہیں۔ Rerank models candidates کو دوبارہ ترتیب دیتی ہیں، اور img2txt models parsing کے دوران figures بیان کرتی ہیں۔ OpenAI-API-Compatible provider ان types کے لیے models انفرادی طور پر register کر سکتا ہے، ہر Add LLM dialog type، id، base url، اور key کی ایک binding بناتا ہے۔ ہر registered chat model base url سے standard chat completions بولتی ہے جہاں Model name wire string ہو، تو gateway جو بھی id serve کرے وہ valid ہے، vendor سے قطع نظر۔ یہ تقسیم operationally اہم ہے: gpt-5.5 سے claude-sonnet-4-6 پر اپنا answer model بدلنا کسی بھی دن محفوظ ہے، مگر embedding model آپ کے indexed vectors سے welded ہے۔ RAGFlow اس بات کو ایک compatibility check کے ساتھ enforce کرتا ہے جب کسی ایسے dataset پر embedding model بدلا جائے جس میں پہلے سے chunks موجود ہوں، اور عملی rule سادہ ہے: embedding سیٹ اپ ایک بار چنیں، اور chat models کو اس layer کے طور پر treat کریں جسے آپ آزادی سے tune کریں۔

چینی اور مغربی models کے لیے ایک ساتھ ایک key۔

RAGFlow deployments زیادہ تر bilingual ہوتی ہیں: چینی-نژاد teams mixed-language document bases پروسیس کرتی ہیں، اور international teams خاص طور پر چینی documents کے لیے چینی models چاہتی ہیں۔ براہ راست serve کیا جائے تو، یہ mix تکلیف دہ ہے، کیونکہ DeepSeek، Zhipu، Moonshot، اور Alibaba ہر ایک الگ bill کرتے ہیں اور کچھ کو بیرون ملک سے pay کرنا مشکل ہے، جبکہ Anthropic اور OpenAI دوسری سمت سے مشکل ہیں۔ ایک OpenAI-API-Compatible base url کے ذریعے، mix صرف مزید Add LLM dialogs ہے: چینی-heavy corpora کے لیے deepseek-v4-pro اور glm-5.2، مضبوط regional alternates کے طور پر qwen3.7-max اور kimi-k2.6، جہاں answer polish سب سے زیادہ اہم ہو وہاں claude-sonnet-4-6۔ ایک ہی base url، ایک ہی key، ids سیدھی کیٹلاگ سے۔ ایشیا میں teams کے لیے وہی route الٹ سمت میں بھی کام کرتا ہے: Claude اور GPT ids ایک مغربی کارڈ کے بغیر prepaid balance پر قابلِ رسائی بن جاتی ہیں، جو بہت سی RAGFlow shops کے لیے کسی model کا evaluate کرنے اور اس کے بارے میں صرف پڑھنے کے درمیان فرق ہے۔ ایک boot-time راستہ بھی جاننے کے قابل ہے: service_conf.yaml.template ایک user_default_llm block (factory، api_key، base_url) قبول کرتا ہے تاکہ نئی installs پہلے سے wired ہو کر آئیں۔ RAGFlow کے docs واضح کہتے ہیں کہ لاگ ان کے بعد، configuration صرف Model providers page پر ہوتی ہے؛ تو YAML کو first-boot provisioning سمجھیں، live config نہیں۔

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Document pipeline کے لیے models چننا۔

Retrieval quality ceiling سیٹ کرتی ہے اور answer model فیصلہ کرتا ہے کہ آپ اس کے کتنے قریب پہنچتے ہیں، تو اپنے حقیقی corpus پر answer models کو A/B کریں: ایک ہی dataset، ایک ہی سوالات، دو ids پر pinned دو assistants، اور جوابات پر اپنے judgment کے ساتھ APIsRouter console میں per-model spend۔

  • Retrieved chunks پر grounded answering input-heavy کام ہے جہاں mid-tier models چمکتی ہیں: deepseek-v4-pro اور glm-5.2 bilingual corpora پر citation-following جوابات اچھی طرح اٹھاتی ہیں۔
  • qwen3.7-max اور kimi-k2.6 regional heavyweights ہیں جو ٹیسٹ کرنے کے قابل ہیں جب جوابات کو native چینی میں پڑھنا ضروری ہو؛ چینی models کے پار quality فرق retrieval سے زیادہ generation میں نظر آتا ہے۔
  • claude-sonnet-4-6 اس answer slot کا حق دار ہے جہاں synthesis quality ہی product ہو، executive summaries، contract analysis، ایسی کوئی بھی چیز جو کوئی انسان بغیر edit کے آگے forward کرے۔
  • Tool call کرنے والے agent workflows کو بھروسہ مند function calling چاہیے؛ پہلے agent path claude-sonnet-4-6 پر ٹیسٹ کریں، پھر دیکھیں کہ آپ کے flows پر کون سا regional id اس کا میچ کرتا ہے۔
  • Max tokens فی-registration ہے، تو ایک ہی id کو دو بار مختلف limits کے ساتھ register کریں اگر ایک assistant کو لمبے جوابات چاہئیں اور دوسری کو مختصر۔

استعمال کے مطابق ادائیگی · سرکاری قیمت سے کم

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ماڈلسرکاری قیمتہماری قیمت
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

RAGFlow سے مخصوص failure modes۔

Max tokens کا default classic ہے۔ 512 پر چھوڑا گیا، لمبے جوابات ایسے truncate یا error ہوتے ہیں جو model مسائل جیسے لگتے ہیں؛ register کرتے وقت documented context size سیٹ کریں، جیسا کہ tooltip خود warn کرتا ہے۔ ایک registered model جو فوراً error دے وہ عموماً دو چیزوں میں سے ایک ہے: ایک Model name spelling جو /v1/models listing سے میچ نہیں کرتی، یا ایک Base url جس کا /v1 suffix missing ہے، کیونکہ RAGFlow آپ کے درج کردہ URL میں route paths append کرتا ہے۔ Registration کے بعد کچھ نہ ہونا defaults کا مسئلہ ہے: کسی model کو register کرنا اسے select نہیں کرتا۔ Set default models چیک کریں، اور per-assistant model settings بھی چیک کریں، جو workspace default پر حاوی ہوتی ہیں۔ Embedding کی الجھن list مکمل کرتی ہے۔ اگر آپ compatible provider کے ذریعے ایک embedding id bind کریں، تو indexing سے پہلے تصدیق کریں کہ endpoint واقعی اسے serve کرتا ہے؛ اور ایک بار جب dataset میں chunks آ جائیں، اس کا embedding model بدلنا ایک similarity check سے gate ہوتا ہے اور صفر سے دوبارہ index کرنے کی ضرورت پڑ سکتی ہے۔ Chat model تبدیلیوں پر ایسا کوئی خرچہ نہیں، بالکل اسی وجہ سے chat layer وہ ہے جہاں آپ کو تجربہ کرنا چاہیے۔

RAGFlow کو gateway کے ذریعے کون route کرتا ہے۔

  • وہ bilingual document teams جو DeepSeek، GLM، Qwen، اور Kimi کو Claude اور GPT ids کے ساتھ ایک base url اور ایک key کے پیچھے ملاتی ہیں۔
  • وہ teams جو ایشیا میں ہیں اور مغربی کارڈ کے بغیر prepaid balance پر Claude-quality جوابات چاہتی ہیں، اور وہ مغربی teams جو regional billing کے بغیر چینی models چاہتی ہیں۔
  • وہ self-hosters جو internal knowledge bases کے لیے RAGFlow چلاتی ہیں اور جو پوری deployment کا cloud spend ایک ہی usage log پر چاہتی ہیں۔
  • وہ builders جو ایک fixed corpus پر answer models compare کرتے ہیں، جہاں ہر candidate ایک vendor account کی بجائے ایک Add LLM dialog ہے۔
  • وہ Ops teams جو service_conf.yaml.template سے نئی installs provision کرتی ہیں، endpoint first boot پر پہلے سے wired۔

Endpoint verify کریں اور پہلی chat debug کریں۔

پہلے models listing curl کریں؛ Model name field free text ہے، اور listing سے ids کاپی کرنا سب سے عام failure کو اس کے ہونے سے پہلے ختم کر دیتا ہے۔ پھر اس id کے خلاف جسے آپ register کرنے کا ارادہ رکھتے ہیں ایک chat completion چلائیں۔ RAGFlow کے اندر، model register کریں، اسے default LLM سیٹ کریں، اور datasets شامل کرنے سے پہلے ایک plain chat assistant میں ٹیسٹ کریں۔ Authentication errors API-Key کی طرف اشارہ کرتی ہیں؛ not-found کا مطلب Model name ہے؛ connection errors Base url یا container egress کی طرف اشارہ کرتی ہیں، کیونکہ endpoint تک پہنچنے والا RAGFlow server ہے، آپ کا browser نہیں۔ Truncated یا فیل ہونے والے لمبے جوابات واپس Max tokens کی طرف اشارہ کرتے ہیں۔ جب chats چلنے لگیں، APIsRouter console per-request model، token counts، اور spend دکھاتا ہے۔ RAG traffic input-dominated ہے، اور usage log وہی جگہ ہے جہاں آپ دیکھتے ہیں کہ آپ کے corpus کو query کرنا واقعی کیا لاگت رکھتا ہے، فی model، فی دن، چینی اور مغربی ids ایک ہی page پر ساتھ۔

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

عمومی سوالات

میں RAGFlow میں OpenAI-API-Compatible model کیسے شامل کروں؟

اپنے avatar پر کلک کریں، Model providers کھولیں، Models to be added کے تحت OpenAI-API-Compatible تلاش کریں، اور Add the model پر کلک کریں۔ Model type (chat)، Model name (exact کیٹلاگ id)، Base url https://api.apisrouter.com/v1، API-Key، اور ایک حقیقی Max tokens value بھریں، پھر OK سے تصدیق کریں۔

Model شامل کرنے کے بعد میرے جوابات کیوں truncate یا error ہوتے ہیں؟

تقریباً ہمیشہ Max tokens: RAGFlow اسے default طور پر 512 پر رکھتا ہے اور اس کا tooltip warn کرتا ہے کہ غلط values errors پیدا کرتی ہیں۔ Model registration edit کریں اور model کی documented context size درج کریں۔

کیا RAGFlow ایک provider کے ذریعے چینی اور مغربی models مکس کر سکتا ہے؟

جی ہاں۔ ہر registration اپنا Model name string ایک ہی base url کو بھیجتا ہے، تو deepseek-v4-pro، glm-5.2، qwen3.7-max، kimi-k2.6، اور claude-sonnet-4-6 سب ساتھ ساتھ register اور فی assistant select ہو سکتی ہیں، ایک key کے ذریعے bill شدہ۔

کیا chat اور embedding models الگ bind ہوتی ہیں؟

جی ہاں۔ ہر Add LLM dialog ایک type کی ایک model register کرتا ہے، اور Set default models default LLM اور embedding slots الگ الگ assign کرتا ہے۔ Chat models آزادی سے swap ہو سکتی ہیں؛ embedding models indexed vectors سے bound ہیں اور ایک بار dataset میں chunks آ جانے پر compatibility check سے gate ہوتی ہیں۔

کیا میں first boot سے پہلے endpoint pre-configure کر سکتا ہوں؟

جی ہاں، docker/service_conf.yaml.template میں user_default_llm block کے ذریعے: factory OpenAI-API-Compatible، آپ کی api_key، اور base_url۔ RAGFlow اسے first startup پر پڑھتا ہے؛ لاگ ان کے بعد، configuration صرف Model providers page پر منتقل ہو جاتی ہے۔

میرا registered model استعمال کیوں نہیں ہوتا؟

Registration اور selection الگ steps ہیں۔ Set default models کے تحت model کو default LLM سیٹ کریں، اور per-assistant model settings چیک کریں، جو default پر حاوی ہوتی ہیں۔ اگر پھر بھی فیل ہو، تو Model name کا /v1/models listing کی spelling سے موازنہ کریں۔