Jalankan AnythingLLM pada mana-mana model melalui Generic OpenAI.
Updated 2026-07-29
Penyedia Generic OpenAI AnythingLLM menyambungkan keseluruhan app ke mana-mana endpoint serasi OpenAI: Base URL https://api.apisrouter.com/v1, satu kunci, satu id chat model, dan had token yang jujur. Id Claude, GPT, Gemini, dan DeepSeek semuanya layak, untuk dokumen, agent, dan sembang sama rata.
Jawapan pantas: lima medan dalam LLM Preference.
Buka settings AnythingLLM, pergi ke bahagian LLM di bawah AI Providers (skrin yang secara sejarahnya bertajuk LLM Preference), dan cari Generic OpenAI dalam senarai penyedia. Memilihnya mendedahkan lima medan: Base URL, API Key, Chat Model Name, Token Context Window, dan Max Tokens. Isikannya seperti berikut: Base URL https://api.apisrouter.com/v1 (/v1 tergolong dalam medan ini), kunci anda, dan id katalog yang tepat dalam Chat Model Name, contohnya claude-sonnet-4-6. Kemudian dua nombor itu: Token Context Window ialah tetingkap keseluruhan model dan Max Tokens mengehadkan satu respons, jadi ambil kedua-duanya daripada dokumentasi model dan bukan meneka. Simpan, dan setiap workspace yang mengikut lalai sistem kini bersembang melalui gateway. Dokumentasi menandakan penyedia ini sebagai developer-focused justeru kerana ia mempercayai input anda; itu bukan amaran menentang penggunaannya, cuma satu pernyataan bahawa lima medan itu adalah kontrak.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Apa yang sebenarnya digerakkan penyedia Generic OpenAI.
AnythingLLM (Mintplex Labs di GitHub, lebih kurang 63K bintang) ialah pembantu dokumen peribadi semua-dalam-satu: workspace yang meng-embed fail anda, sembang berasaskan konteks yang diambil, agent dengan penggunaan alat, tersedia sebagai app desktop dan pelayan self-hosted. LLM preference yang dikonfigurasikan di atas ialah otak lalai untuk kesemuanya. Permintaan keluar sebagai chat completions standard terhadap Base URL anda dengan Chat Model Name sebagai rentetan model, jadi vendor tidak penting: id Claude sah sama seperti id GPT, dan menukar bermaksud mengedit satu medan. Workspace juga boleh mengatasi lalai sistem dengan tetapan penyedia dan model sendiri, itulah cara satu deployment menjalankan claude-sonnet-4-6 untuk workspace undang-undang dan gpt-5.5 untuk kejuruteraan tanpa mana-mana pihak tahu tentang yang lain. Dua medan token itu wajar dihormati kerana AnythingLLM menggunakannya untuk membelanjakan konteks. Nilai tetingkap konteks memutuskan berapa banyak teks dokumen yang diambil dan sejarah sembang dimuatkan ke setiap permintaan; kurang nyatakan dan dokumen yang teliti di-embed anda dipotong keluar daripada jawapan sendiri, lebih nyatakan dan permintaan terlantun daripada had sebenar model. Inilah pasangan medan di sebalik kebanyakan laporan "RAG rasa bodoh" pada endpoint generik.
Embeddings adalah keputusan berasingan.
AnythingLLM memisahkan LLM preference daripada embedding preference, dan pemisahan itu adalah load-bearing. Chat model menjawab soalan; embedder menukar dokumen anda menjadi vektor pada masa muat naik, dan vektor itu berkekalan. Menukar chat model adalah percuma, bila-bila masa, per workspace. Menukar embedder membatalkan geometri segala yang sudah di-embed dan bermaksud meng-embed semula dokumen anda. Persediaan praktikal: AnythingLLM disertakan dengan embedder tempatan terbina dalam yang berfungsi offline dan tidak berkos apa-apa, dan banyak deployment hanya mengekalkannya. Jika anda mengarahkan embedding preference ke endpoint jauh sebaliknya, sahkan id embedding tertentu dilayani di sana sebelum memuat naik pangkalan dokumen anda, dan anggap pilihan itu terikat kepada vector store. Kebebasan yang dibeli ini pada sisi sembang adalah intipati seni bina: dengan embeddings sudah selesai, chat model Generic OpenAI ialah dail berisiko rendah. Jalankan deepseek-v4-pro sebulan untuk peringkasan berat, tukar medan itu ke claude-sonnet-4-6 untuk satu suku kerja klien, dan tiada apa tentang dokumen anda perlu berpindah.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyMemilih model untuk kerja dokumen.
Setiap id dibilkan melalui kunci yang sama, jadi gelung perbandingan adalah edit settings: workspace sama, dokumen sama, dua minggu pada setiap calon, dan perbelanjaan per-model dalam konsol APIsRouter bersebelahan penilaian anda sendiri terhadap jawapan.
- QA berasaskan serpihan yang diambil adalah berat input: claude-haiku-4-5-20251001 dan gemini-3.5-flash menjawab soalan mengikut petikan dengan baik pada harga volum.
- claude-sonnet-4-6 layak menjadi lalai di mana jawapan dihantar kepada manusia tanpa disunting: semakan kontrak, rangka laporan, apa sahaja yang mempunyai akibat.
- deepseek-v4-pro ialah kuda beban konteks-panjang untuk workspace yang dibina atas dokumen besar, di mana tetingkap dan harga input mendominasi pengalaman.
- Workspace agent memerlukan tool calling yang boleh dipercayai; mulakan agent pada claude-sonnet-4-6, kemudian uji sama ada id yang lebih ringan bertahan pada flow sebenar anda.
- Gunakan override per-workspace sebagai polisi: lalai kekal pantas, dan id yang mahal hanya wujud dalam workspace yang kerjanya mewajarkannya.
Bayar mengikut penggunaan · bawah harga rasmi
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Harga Rasmi | Harga Kami |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Mod kegagalan khusus AnythingLLM.
Medan token menyebabkan kegagalan yang halus. Tetingkap konteks yang ditetapkan terlalu rendah memotong konteks yang diambil secara senyap, yang muncul sebagai model yang mengabaikan dokumen anda; tetapkan tetingkap yang didokumentasikan untuk id dalam Chat Model Name. Max Tokens yang ditetapkan terlalu tinggi untuk model menghasilkan ralat keras pada jawapan panjang; tetapkan kepada apa yang model benar-benar benarkan untuk output. Ralat keras lebih jujur. Kegagalan pengesahan ialah medan API Key. Model-not-found ialah Chat Model Name yang tersasar daripada ejaan katalog; medan itu teks bebas dan senarai /v1/models ialah sumber kebenaran. Ralat sambungan pada app desktop biasanya bermaksud proksi atau firewall antara app dan endpoint; pada deployment Docker, ingat kontainer itulah yang perlu mencapai Base URL, bukan pelayar anda. Jika sembang berfungsi tetapi workspace berkelakuan berbeza daripada dijangka, semak tetapan overridenya; tetapan penyedia peringkat workspace menang atas lalai sistem, dan override yang terlupa ialah misteri klasik "soalan sama, model berbeza". Kerangka developer-focused dokumentasi merumuskan semua di atas: penyedia melakukan tepat apa yang dinyatakan lima medannya, tidak lebih tidak kurang.
Siapa yang menghalakan AnythingLLM melalui gateway.
- Pasukan yang menjalankan pembantu dokumen peribadi yang mahukan kualiti jawapan frontier tanpa akaun vendor setiap keluarga model.
- Pengguna desktop yang mengarahkan pangkalan dokumen peribadi mereka ke id Claude atau GPT pada baki prabayar, tiada kad diperlukan untuk bermula.
- Self-hoster yang mengekalkan embedder tempatan terbina dalam dan menganggap sembang jauh sebagai satu-satunya lorong terukur, dibaca per model pada satu log penggunaan.
- Deployment yang disegmenkan mengikut workspace, di mana override per-workspace ditambah pengukuran per-kunci memberi setiap pasukan model mereka sendiri dan bil mereka sendiri.
- Pembina yang membandingkan model jawapan atas pangkalan dokumen tetap, di mana setiap calon adalah satu edit settings dan bukan migrasi.
Sahkan endpoint dan nyahpepijat sembang workspace pertama.
Curl senarai model dan satu chat completion dahulu, menggunakan id tepat yang anda niat masukkan dalam Chat Model Name. Dengan kedua-duanya lulus, separuh gateway terbukti dan setiap simptom yang tinggal wujud dalam lima medan itu. Kemudian simpan tetapan penyedia dan tanya satu soalan dalam workspace dengan dokumen yang anda kenali dengan baik. Jawapan yang berasaskan dan memetik menunjukkan seluruh pipeline berfungsi. Jawapan yang mengabaikan dokumen menunjuk kepada nilai tetingkap konteks atau tetapan retrieval workspace sendiri. Ralat keras memetakan dengan bersih: kunci, ejaan id, bentuk Base URL. Sebaik sahaja sembang mengalir, konsol APIsRouter menunjukkan model per permintaan, kiraan token, dan perbelanjaan. QA dokumen menggandakan token input melalui retrieval, dan log penggunaan adalah tempat anda belajar berapa kos sebenar pangkalan dokumen anda untuk disoal, per model, per hari, dan per kunci workspace jika anda memisahkannya.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Soalan lazim
Bagaimana saya menetapkan Base URL custom dalam AnythingLLM?
Dalam settings di bawah AI Providers, buka skrin LLM preference dan pilih Generic OpenAI daripada senarai penyedia. Tetapkan Base URL kepada https://api.apisrouter.com/v1, tambah kunci anda, masukkan id katalog yang tepat dalam Chat Model Name, dan isikan kedua-dua medan token daripada dokumentasi model.
Apa yang dikawal oleh Token Context Window dan Max Tokens?
Tetingkap konteks memberitahu AnythingLLM berapa banyak teks dan sejarah yang diambil boleh dimuatkan per permintaan; Max Tokens mengehadkan satu respons. Kurang nyatakan tetingkap memotong dokumen anda daripada jawapan, dan lebih nyatakan mana-mana satu menghasilkan permintaan yang ditolak model.
Bolehkah AnythingLLM menjalankan Claude atau DeepSeek melalui Generic OpenAI?
Ya. Penyedia menghantar Chat Model Name sebagai rentetan biasa ke Base URL melalui chat completions standard, jadi claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash, dan id GPT semuanya berfungsi, boleh ditukar dengan mengedit satu medan atau per workspace.
Adakah menukar chat model menjejaskan dokumen saya yang di-embed?
Tidak. Chat dan embedding preference adalah berasingan; vektor berkekalan dan chat model ditukar secara bebas. Hanya menukar embedder membatalkan vektor sedia ada dan memaksa embedding semula, itulah sebab banyak deployment mengekalkan embedder tempatan terbina dalam dan hanya menala sisi sembang.
Mengapa halaman dokumentasi memanggil Generic OpenAI developer-focused?
Kerana ia mempercayai input anda dan bukan menghantar preset per-vendor: id, URL, atau nilai token yang salah gagal pada masa larian dan bukan ditangkap borang. Dengan id disalin daripada /v1/models dan had daripada dokumentasi model, ia adalah laluan stabil kelas pertama.
Bolehkah workspace berbeza menggunakan model berbeza?
Ya. Workspace mewarisi lalai sistem tetapi boleh mengatasi penyedia dan model dalam tetapan sembang mereka sendiri, jadi satu deployment boleh menjalankan id pantas secara lalai dan menyematkan claude-sonnet-4-6 hanya dalam workspace yang kerjanya berbaloi.