Patakbuhin ang AnythingLLM sa anumang model sa pamamagitan ng Generic OpenAI.
Updated 2026-07-29
Ikinokonekta ng Generic OpenAI provider ng AnythingLLM ang buong app sa anumang OpenAI-compatible endpoint: Base URL na https://api.apisrouter.com/v1, isang key, isang chat model id, at tapat na token limits. Kwalipikado ang mga id ng Claude, GPT, Gemini, at DeepSeek, para sa documents, agents, at chat.
Mabilisang sagot: limang field sa LLM Preference.
Buksan ang settings ng AnythingLLM, pumunta sa LLM section sa ilalim ng AI Providers (ang screen na dating tinawag na LLM Preference), at hanapin ang Generic OpenAI sa listahan ng provider. Kapag pinili ito, may lilitaw na limang field: Base URL, API Key, Chat Model Name, Token Context Window, at Max Tokens. Punan ang mga ito nang ganito: Base URL na https://api.apisrouter.com/v1 (kasama ang /v1 sa field na ito), ang key mo, at ang eksaktong id ng katalogo sa Chat Model Name, halimbawa claude-sonnet-4-6. Pagkatapos ang dalawang numero: ang Token Context Window ang buong window ng model at ang Max Tokens ang naglilimita sa iisang response, kaya kunin ang dalawa mula sa dokumentasyon ng model sa halip na manghula. I-save, at bawat workspace na sumusunod sa system default ay nagcha-chat na sa pamamagitan ng gateway. Nilalabelan ng docs ang provider na ito bilang developer-focused dahil eksakto sa katiwala nito sa mga input mo; hindi iyan babala laban sa paggamit nito, kundi pahayag lamang na ang limang field ay isang kontrata.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Ano talaga ang dinadala ng Generic OpenAI provider.
Ang AnythingLLM (Mintplex Labs sa GitHub, humigit-kumulang 63K stars) ang all-in-one na private document assistant: mga workspace na nag-e-embed ng mga file mo, chat na naka-ground sa retrieved context, agents na may tool use, available bilang desktop app at self-hosted server. Ang LLM preference na na-configure sa itaas ang default na utak ng lahat ng ito. Umaalis ang mga request bilang standard chat completions laban sa Base URL mo gamit ang Chat Model Name bilang model string, kaya hindi mahalaga ang vendor: kasing-valid ng isang GPT id ang isang Claude id, at ang pagpalit ay isang pag-edit lamang ng isang field. Maaari ring i-override ng mga workspace ang system default gamit ang sarili nilang provider at model settings, kung paano nagpapatakbo ang isang deployment ng claude-sonnet-4-6 para sa legal workspace at gpt-5.5 para sa engineering nang hindi alam ng isa't isa. Karapat-dapat sumaklaw ang dalawang token field dahil ginagamit ito ng AnythingLLM para mag-budget ng context. Ang value ng context window ang nagpapasya kung gaano karaming retrieved document text at chat history ang mai-pack sa bawat request; kulangan ito at natrim ang maingat na na-embed mong mga dokumento sa labas ng sarili nilang mga sagot, sobrahan ito at tumatalbog ang mga request laban sa tunay na limitasyon ng model. Ito ang pares ng field sa likod ng karamihan ng "parang tanga ang RAG" na report sa mga generic na endpoint.
Hiwalay na desisyon ang mga embedding.
Hinihiwalay ng AnythingLLM ang LLM preference mula sa embedding preference, at load-bearing ang paghihiwalay na ito. Ang chat model ang sumasagot sa mga tanong; ang embedder ang gumagawa ng mga dokumento mo na vectors sa oras ng upload, at nananatili ang mga vector na iyon. Libre magpalit ng chat models, kahit anong araw, per workspace. Ang pagpalit ng embedders ay nagpapawalang-bisa sa geometry ng lahat ng na-embed na, at nangangahulugang muling pag-embed ng mga dokumento mo. Ang praktikal na setup: naglalakbay ang AnythingLLM na may built-in na local embedder na gumagana offline at walang gastos, at maraming deployment ang basta nagpapanatili nito. Kung ituturo mo ang embedding preference sa isang remote endpoint sa halip, kumpirmahin munang si-serve doon ang partikular na embedding id bago mag-upload ng document base mo, at ituring ang pagpiling iyon bilang ikinasal sa vector store. Ang kalayaang binibili nito sa panig ng chat ang punto ng architecture: kapag settled na ang embeddings, ang Generic OpenAI chat model ay isang low-stakes na dial. Patakbuhin ang deepseek-v4-pro sa loob ng isang buwan ng mabigat na summarization, palitan ang field sa claude-sonnet-4-6 para sa isang quarter ng client work, at walang kailangang gumalaw sa mga dokumento mo.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyPagpili ng mga model para sa document work.
Bawat id ay bini-bill sa parehong key, kaya ang comparison loop ay isang pag-edit ng settings: parehong workspace, parehong mga dokumento, dalawang linggo kada kandidato, at ang per-model na gastos sa APIsRouter console sa tabi ng sarili mong paghatol sa mga sagot.
- Ang grounded QA sa retrieved chunks ay input-heavy: sumasagot nang maayos sa mga tanong na sumusunod sa citation ang claude-haiku-4-5-20251001 at gemini-3.5-flash sa presyong pang-volume.
- Karapat-dapat maging default ang claude-sonnet-4-6 kung saan naipapadala ang mga sagot sa tao nang hindi na-edit: pagsusuri ng kontrata, pagdadraft ng report, anumang may kahihinatnan.
- Ang deepseek-v4-pro ang long-context na workhorse para sa mga workspace na binuo sa malalaking dokumento, kung saan naghahari ang window at input pricing sa karanasan.
- Kailangan ng mga agent workspace ng maaasahang tool calling; simulan ang mga agent sa claude-sonnet-4-6, pagkatapos ay subukan kung nananatiling matibay ang isang mas magaan na id sa tunay mong mga flow.
- Gamitin ang per-workspace overrides bilang patakaran: mananatiling mabilis ang default, at ang mamahaling id ay nananahan lamang sa mga workspace kung saan katwiran ang gawain.
Pay-as-you-go · mas mababa sa opisyal na presyo
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Opisyal na Presyo | Aming Presyo |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Mga failure mode na specific sa AnythingLLM.
Ang mga token field ang sanhi ng mga banayad na kabiguan. Ang isang context window na masyadong mababa ang itakda ay tahimik na nagti-trim ng retrieved context, na lumilitaw bilang isang model na hindi pinapansin ang mga dokumento mo; itakda ang naka-document na window para sa id sa Chat Model Name. Ang Max Tokens na masyadong mataas para sa model ay gumagawa ng hard errors sa mahahabang sagot; itakda ito sa kung ano talaga ang pinapayagan ng model para sa output. Mas tapat ang mga hard error. Ang mga authentication failure ay ang API Key field. Ang model-not-found ay ang Chat Model Name na lumihis sa baybay ng katalogo; libreng text ang field at ang listahan ng /v1/models ang pinagmumulan ng katotohanan. Ang mga connection error sa desktop app ay karaniwang nangangahulugan ng proxy o firewall sa pagitan ng app at ng endpoint; sa mga Docker deployment, tandaan na ang container ang dapat makaabot sa Base URL, hindi ang browser mo. Kung gumagana ang chat pero kumikilos nang iba ang isang workspace kaysa inaasahan mo, suriin ang override settings nito; nananalo ang workspace-level provider settings laban sa system default, at ang isang nakalimutang override ang klasikong misteryo ng "parehong tanong, ibang model." Buong buod ng lahat sa itaas ang developer-focused na framing ng docs: eksaktong ginagawa ng provider ang sinasabi ng limang field nito, wala nang iba.
Sino ang nagru-route ng AnythingLLM sa pamamagitan ng isang gateway.
- Mga team na nagpapatakbo ng private document assistants na gustong makuha ang frontier na kalidad ng sagot nang walang vendor account per model family.
- Mga desktop user na itinuturo ang personal na document base nila sa mga id ng Claude o GPT gamit ang prepaid na balance, walang kailangang card para magsimula.
- Mga self-hoster na nagpapanatili ng built-in na local embedder at itinuturing ang remote chat bilang tanging metered na lane, binabasa per model sa isang usage log.
- Mga deployment na hinati-hati per workspace, kung saan ang per-workspace overrides at per-key metering ay binibigyan ang bawat team ng sariling model at sariling bill.
- Mga builder na naghahambing ng answer models sa isang fixed na document base, kung saan ang bawat kandidato ay isang pag-edit lamang ng settings sa halip na migration.
I-verify ang endpoint at i-debug ang unang chat sa workspace.
I-curl muna ang models listing at isang chat completion, gamit ang eksaktong id na balak mong ilagay sa Chat Model Name. Kapag pumasa ang dalawa, napatunayan ang kalahati ng gateway at nasa limang field na lamang ang natitirang sintomas. Pagkatapos, i-save ang provider settings at magtanong ng isang tanong sa isang workspace na may dokumentong alam mo nang mabuti. Ang isang grounded, may-citation na sagot ay nangangahulugang gumagana ang buong pipeline. Ang isang sagot na hindi pinapansin ang dokumento ay tumuturo sa value ng context window o sa sariling retrieval settings ng workspace. Malinaw na nakakabit ang mga hard error: key, baybay ng id, hugis ng Base URL. Kapag dumadaloy na ang mga chat, ipinapakita ng APIsRouter console ang per-request na model, token counts, at gastos. Pinaparami ng Document QA ang input tokens sa pamamagitan ng retrieval, at ang usage log ang lugar kung saan mo malalaman kung ano talaga ang gastos ng pag-query sa document base mo, per model, per araw, at per workspace key kung hihiwalayin mo ang mga ito.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Mga madalas itanong
Paano ako magtatakda ng custom Base URL sa AnythingLLM?
Sa settings sa ilalim ng AI Providers, buksan ang LLM preference screen at piliin ang Generic OpenAI mula sa listahan ng provider. Itakda ang Base URL sa https://api.apisrouter.com/v1, idagdag ang key mo, ilagay ang eksaktong id ng katalogo sa Chat Model Name, at punan ang dalawang token field mula sa dokumentasyon ng model.
Ano ang kinokontrol ng Token Context Window at Max Tokens?
Sinasabihan ng context window ang AnythingLLM kung gaano karaming retrieved text at history ang maaari nitong i-pack per request; ang Max Tokens ang naglilimita sa iisang response. Ang pagpapababa nang sobra sa window ay nagti-trim ng mga dokumento mo sa labas ng mga sagot, at ang pagpapataas nang sobra sa alinman ay gumagawa ng mga request na tinatanggihan ng model.
Maaari bang patakbuhin ng AnythingLLM ang Claude o DeepSeek sa pamamagitan ng Generic OpenAI?
Oo. Ipinapadala ng provider ang Chat Model Name bilang plain string sa Base URL sa pamamagitan ng standard chat completions, kaya gumagana ang claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash, at mga GPT id, palitan sa pag-edit ng isang field o per workspace.
Naaapektuhan ba ang mga na-embed kong dokumento kapag pinalitan ko ang chat model?
Hindi. Hiwalay ang chat at embedding preferences; nananatili ang mga vector at libreng magpalit ng chat models. Ang pagpalit lamang ng embedder ang nagpapawalang-bisa sa umiiral na mga vector at pumipilit ng muling pag-embed, kaya't maraming deployment ang nagpapanatili ng built-in na local embedder at tinutugma lamang ang panig ng chat.
Bakit tinatawag ng docs page na developer-focused ang Generic OpenAI?
Dahil nagtitiwala ito sa mga input mo sa halip na maghatid ng per-vendor presets: nabibigo ang maling ids, URLs, o token values sa runtime sa halip na mahuli ng form. Kasama ang mga id na kinopya mula sa /v1/models at limitasyon mula sa dokumentasyon ng model, isa itong matatag, first-class na landas.
Maaari bang gumamit ng magkaibang model ang magkaibang workspace?
Oo. Nagmamana ang mga workspace ng system default pero maaaring i-override ang provider at model sa sarili nilang chat settings, kaya ang isang deployment ay maaaring magpatakbo ng mabilis na id bilang default at i-pin ang claude-sonnet-4-6 lamang sa mga workspace kung saan karapat-dapat ito.