AnythingLLM को Generic OpenAI के through किसी भी model पर चलाएं।

Updated 2026-07-29

AnythingLLM का Generic OpenAI provider पूरे app को किसी भी OpenAI-compatible endpoint से connect करता है: Base URL https://api.apisrouter.com/v1, एक key, एक chat model id, और honest token limits। Claude, GPT, Gemini, और DeepSeek ids सभी qualify करते हैं, documents, agents, और chat के लिए एक जैसे।

Quick answer: LLM Preference में पांच fields।

AnythingLLM की settings खोलें, AI Providers के तहत LLM section में जाएं (जो screen historically LLM Preference titled थी), और provider list में Generic OpenAI ढूंढें। इसे select करने पर पांच fields दिखते हैं: Base URL, API Key, Chat Model Name, Token Context Window, और Max Tokens। इन्हें इस तरह भरें: Base URL https://api.apisrouter.com/v1 (/v1 इसी field में जाता है), आपकी key, और Chat Model Name में exact catalog id, उदाहरण के लिए claude-sonnet-4-6। फिर दो numbers: Token Context Window model की total window है और Max Tokens एक single response को cap करता है, तो दोनों guess करने की बजाय model की documentation से लें। Save करें, और हर वह workspace जो system default follow करता है अब gateway के through chat करता है। Docs इस provider को developer-focused इसलिए flag करते हैं क्योंकि यह आपके inputs पर भरोसा करता है; यह इसे इस्तेमाल करने के खिलाफ चेतावनी नहीं है, बस यह statement है कि पांच fields एक contract हैं।

Base URL:              https://api.apisrouter.com/v1
API Key:               sk-YOUR-APISROUTER-KEY
Chat Model Name:       claude-sonnet-4-6
Token Context Window:  200000
Max Tokens:            8192

Generic OpenAI provider असल में क्या drive करता है।

AnythingLLM (GitHub पर Mintplex Labs, लगभग 63K stars) all-in-one private document assistant है: workspaces जो आपकी files embed करते हैं, retrieved context में grounded chat, tool use वाले agents, desktop app और self-hosted server दोनों के रूप में उपलब्ध। ऊपर configure की गई LLM preference इस सबका default brain है। Requests आपके Base URL के against standard chat completions के तौर पर निकलती हैं जिसमें model string के तौर पर Chat Model Name होता है, तो vendor matter नहीं करता: एक Claude id उतना ही valid है जितना एक GPT id, और switch करने का मतलब है एक field edit करना। Workspaces system default को अपनी provider और model settings से override भी कर सकते हैं, यही वजह है कि एक deployment legal workspace के लिए claude-sonnet-4-6 और engineering के लिए gpt-5.5 चलाता है, बिना एक-दूसरे को जाने। दोनों token fields respect के लायक हैं क्योंकि AnythingLLM इन्हें context budget करने के लिए इस्तेमाल करता है। Context window value तय करती है कि हर request में कितना retrieved document text और chat history pack हो; इसे understate करें तो आपके carefully embedded documents अपने ही answers से trim हो जाते हैं, overstate करें तो requests model की real limit से टकराती हैं। यही field pair generic endpoints पर ज़्यादातर "RAG feels dumb" reports के पीछे है।

Embeddings एक अलग decision हैं।

AnythingLLM LLM preference को embedding preference से split करता है, और यह split load-bearing है। Chat model सवालों के जवाब देता है; embedder आपके documents को upload के समय vectors में बदलता है, और वो vectors persist होते हैं। Chat models बदलना free है, किसी भी दिन, per workspace। Embedder बदलना जो कुछ भी पहले से embedded है उसकी geometry invalidate करता है और आपके documents को re-embed करने की ज़रूरत पड़ती है। Practical setup: AnythingLLM एक built-in local embedder ship करता है जो offline काम करता है और कुछ खर्च नहीं करता, और कई deployments बस इसे रखे रहते हैं। अगर आप embedding preference को इसकी बजाय एक remote endpoint पर point करते हैं, तो अपना document base upload करने से पहले confirm करें कि specific embedding id वहां serve होती है, और उस choice को vector store से married मानें। Chat side पर जो freedom यह खरीदता है वही architecture का point है: embeddings settle होने के साथ, Generic OpenAI chat model एक low-stakes dial है। भारी summarization वाले एक महीने के लिए deepseek-v4-pro चलाएं, client work वाली एक quarter के लिए field को claude-sonnet-4-6 पर switch करें, और आपके documents के बारे में कुछ भी move करने की ज़रूरत नहीं है।

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactly

Document work के लिए models चुनना।

हर id एक ही key से bill होती है, तो comparison loop एक settings edit है: same workspace, same documents, हर candidate पर दो हफ्ते, और APIsRouter console में per-model spend, आपके answers के अपने judgment के साथ।

  • Retrieved chunks पर grounded QA input-heavy है: claude-haiku-4-5-20251001 और gemini-3.5-flash volume prices पर citation-following सवालों के अच्छे जवाब देते हैं।
  • claude-sonnet-4-6 वहां default का हक कमाता है जहां answers बिना edit हुए इंसानों तक जाते हैं: contract review, report drafting, कुछ भी जिसके consequences हों।
  • deepseek-v4-pro बड़े documents पर बने workspaces के लिए long-context workhorse है, जहां window और input pricing experience पर हावी रहती हैं।
  • Agent workspaces को भरोसेमंद tool calling चाहिए; agents को claude-sonnet-4-6 पर शुरू करें, फिर test करें कि क्या आपके असली flows पर एक lighter id टिकती है।
  • Per-workspace overrides को policy के तौर पर इस्तेमाल करें: default fast रहता है, और expensive id सिर्फ उन workspaces में रहती है जिनका काम उसका हक कमाता है।

जितना उपयोग उतना भुगतान · आधिकारिक मूल्य से कम

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

मॉडलआधिकारिक मूल्यहमारा मूल्य
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Haiku 4.5 20251001$1.00 / $5.00 per M$0.80 / $4.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
Gemini 3.5 Flash$1.50 / $9.00 per M$1.20 / $7.20 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

AnythingLLM के लिए specific failure modes।

Token fields subtle failures cause करते हैं। बहुत कम set किया गया context window चुपचाप retrieved context को truncate करता है, जो एक ऐसे model जैसा दिखता है जो आपके documents को ignore करता है; Chat Model Name के लिए documented window set करें। Model के लिए बहुत ज़्यादा set किया गया Max Tokens लंबे answers पर hard errors देता है; इसे उतना set करें जितना model output के लिए actually allow करता है। Hard errors ज़्यादा honest हैं। Authentication failures API Key field हैं। Model-not-found Chat Model Name का catalog spelling से drift करना है; field free text है और /v1/models listing source of truth है। Desktop app पर connection errors का मतलब आमतौर पर app और endpoint के बीच एक proxy या firewall है; Docker deployments पर, याद रखें आपके browser को नहीं बल्कि container को Base URL तक पहुंचना है। अगर chat काम करता है लेकिन कोई workspace expected से अलग behave करता है, उसकी override settings check करें; workspace-level provider settings system default पर jeette हैं, और भूला हुआ override वही classic "same question, different model" mystery है। Docs की developer-focused framing ऊपर सब कुछ summarize करती है: provider exactly वही करता है जो उसके पांच fields कहते हैं, न ज़्यादा न कम।

कौन AnythingLLM को एक gateway के through route करता है।

  • Teams जो private document assistants चलाती हैं और per model family vendor account के बिना frontier answer quality चाहती हैं।
  • Desktop users जो अपना personal document base Claude या GPT ids पर एक prepaid balance से point करते हैं, शुरू करने के लिए कोई card नहीं चाहिए।
  • Self-hosters जो built-in local embedder रखते हैं और remote chat को एक metered lane मानते हैं, per model एक usage log पर पढ़ा हुआ।
  • Workspace के हिसाब से segmented deployments, जहां per-workspace overrides plus per-key metering हर team को उसका अपना model और अपना bill देते हैं।
  • Builders जो एक fixed document base पर answer models compare करते हैं, जहां हर candidate एक migration नहीं बल्कि एक settings edit है।

Endpoint verify करें और पहले workspace chat को debug करें।

पहले models listing और एक chat completion curl करें, वह exact id इस्तेमाल करते हुए जो आप Chat Model Name में डालना चाहते हैं। दोनों pass होने पर, gateway वाला half proven है और बाकी हर symptom पांच fields में रहता है। फिर provider settings save करें और किसी ऐसे workspace में एक सवाल पूछें जिसमें एक document हो जिसे आप अच्छे से जानते हों। एक grounded, citing answer मतलब पूरी pipeline काम करती है। जो answer document को ignore करे वह context window value या workspace की अपनी retrieval settings की तरफ इशारा करता है। Hard errors cleanly map होती हैं: key, id spelling, Base URL shape। जब chats चलने लगें, APIsRouter console per-request model, token counts, और spend दिखाता है। Document QA retrieval के through input tokens multiply करता है, और usage log वह जगह है जहां आप सीखते हैं कि आपका document base actually per model, per day, और अगर split करें तो per workspace key क्वेरी करने में कितना खर्च करता है।

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

अक्सर पूछे जाने वाले प्रश्न

मैं AnythingLLM में custom Base URL कैसे set करूं?

Settings में AI Providers के तहत, LLM preference screen खोलें और provider list से Generic OpenAI चुनें। Base URL को https://api.apisrouter.com/v1 set करें, अपनी key add करें, Chat Model Name में exact catalog id डालें, और दोनों token fields model की documentation से भरें।

Token Context Window और Max Tokens क्या control करते हैं?

Context window AnythingLLM को बताती है कि यह प्रति request कितना retrieved text और history pack कर सकता है; Max Tokens एक single response को cap करता है। Window को understate करने से आपके documents answers से trim होते हैं, और दोनों में से किसी को भी overstate करने से requests बनती हैं जिन्हें model reject कर देता है।

क्या AnythingLLM Generic OpenAI के through Claude या DeepSeek चला सकता है?

हां। Provider Chat Model Name को standard chat completions पर Base URL को एक plain string के तौर पर भेजता है, तो claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash, और GPT ids सब काम करते हैं, एक field या per workspace edit करके switchable।

क्या chat model बदलने से मेरे embedded documents पर असर पड़ता है?

नहीं। Chat और embedding preferences अलग हैं; vectors persist रहते हैं और chat models freely swap होते हैं। सिर्फ embedder बदलने से existing vectors invalidate होते हैं और re-embedding करनी पड़ती है, यही वजह है कि कई deployments built-in local embedder रखते हैं और सिर्फ chat side tune करते हैं।

Docs page Generic OpenAI को developer-focused क्यों कहता है?

क्योंकि यह per-vendor presets ship करने की बजाय आपके inputs पर भरोसा करता है: गलत ids, URLs, या token values form से पकड़े जाने की बजाय runtime पर fail होती हैं। /v1/models से copy किए गए ids और model documentation से लिए गए limits के साथ, यह एक stable, first-class path है।

क्या अलग-अलग workspaces अलग-अलग models इस्तेमाल कर सकते हैं?

हां। Workspaces system default inherit करते हैं लेकिन अपनी chat settings में provider और model override कर सकते हैं, तो एक deployment default रूप में एक fast id चला सकता है और सिर्फ उन workspaces में claude-sonnet-4-6 pin कर सकता है जिनका काम उसका हक कमाता है।