Запустіть AnythingLLM на будь-якій моделі через Generic OpenAI.
Updated 2026-07-29
Провайдер Generic OpenAI в AnythingLLM підключає весь застосунок до будь-якого OpenAI-сумісного ендпоінта: Base URL https://api.apisrouter.com/v1, один ключ, id чат-моделі й чесні токен-ліміти. Claude, GPT, Gemini і DeepSeek — усі підходять, як для документів, так і для агентів і чату.
Коротка відповідь: п'ять полів у LLM Preference.
Відкрийте налаштування AnythingLLM, перейдіть у розділ LLM під AI Providers (екран, який раніше називався LLM Preference), і знайдіть у списку провайдерів Generic OpenAI. Після вибору з'являються п'ять полів: Base URL, API Key, Chat Model Name, Token Context Window і Max Tokens. Заповніть їх так: Base URL https://api.apisrouter.com/v1 (/v1 належить саме цьому полю), ваш ключ, і точний id з каталогу в Chat Model Name, наприклад claude-sonnet-4-6. Далі два числа: Token Context Window — це загальне вікно моделі, а Max Tokens обмежує одну відповідь, тож беріть обидва значення з документації моделі, а не вгадуйте. Збережіть — і кожен робочий простір, що йде за системним замовчуванням, тепер спілкується через шлюз. Документація недарма позначає цього провайдера як орієнтованого на розробників: він довіряє вашим вхідним даним, і це не застереження проти використання, а лише констатація того, що п'ять полів — це контракт.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Що насправді керує провайдером Generic OpenAI.
AnythingLLM (Mintplex Labs на GitHub, приблизно 63 тис. зірок) — це універсальний приватний асистент для роботи з документами: робочі простори, що вбудовують ваші файли, чат, обґрунтований отриманим контекстом, агенти з використанням інструментів, доступний як десктопний застосунок і self-hosted сервер. Налаштований вище LLM preference — це мозок за замовчуванням для всього цього. Запити виходять як стандартні chat completions до вашого Base URL з Chat Model Name як рядком моделі, тож постачальник не має значення: id Claude настільки ж валідний, як і GPT, а перемикання — це редагування одного поля. Робочі простори також можуть перевизначити системне замовчування власними налаштуваннями провайдера й моделі, і саме так один деплой запускає claude-sonnet-4-6 для юридичного робочого простору та gpt-5.5 для інженерного, і жоден не знає про інший. Обидва токен-поля заслуговують на увагу, бо AnythingLLM використовує їх для бюджетування контексту. Значення контекстного вікна вирішує, скільки отриманого тексту документів та історії чату потрапляє в кожен запит; занизьте його — і ретельно вбудовані документи вирізаються з власних відповідей, завищте — і запити вдаряться об реальний ліміт моделі. Саме ця пара полів стоїть за більшістю скарг «RAG поводиться тупо» на загальних ендпоінтах.
Ембедінги — це окреме рішення.
AnythingLLM розділяє LLM preference і embedding preference, і цей поділ несе реальне навантаження. Чат-модель відповідає на питання; ембедер перетворює ваші документи на вектори під час завантаження, і ці вектори зберігаються. Зміна чат-моделі безкоштовна, будь-якого дня, для будь-якого робочого простору. Зміна ембедера скасовує геометрію всього вже вбудованого і означає повторне вбудовування документів. Практичне налаштування: AnythingLLM постачає вбудований локальний ембедер, який працює офлайн і нічого не коштує, і багато деплоїв просто залишають його. Якщо ви натомість спрямуєте embedding preference на віддалений ендпоінт, підтвердіть, що конкретний id ембедінга там обслуговується, перш ніж завантажувати базу документів, і ставтеся до цього вибору як до одруженого з векторним сховищем. Свобода, яку це дає на боці чату, — саме сенс цієї архітектури: коли ембедінги вирішені, чат-модель Generic OpenAI — це низькоризиковий перемикач. Запустіть deepseek-v4-pro на місяць інтенсивного підсумовування, перемкніть поле на claude-sonnet-4-6 на квартал клієнтської роботи — і жодних документів переміщувати не доведеться.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyВибір моделей для роботи з документами.
Кожен id оплачується через той самий ключ, тож цикл порівняння — це редагування налаштувань: той самий робочий простір, ті самі документи, два тижні на кожного кандидата, і витрати по моделях у консолі APIsRouter поруч із вашою власною оцінкою відповідей.
- Обґрунтоване QA над отриманими фрагментами — вхідно-важка робота: claude-haiku-4-5-20251001 і gemini-3.5-flash добре відповідають на питання із цитуванням джерел за об'ємними цінами.
- claude-sonnet-4-6 заслуговує на роль замовчування там, де відповіді йдуть до людей без редагування: перевірка контрактів, складання звітів, будь-що з наслідками.
- deepseek-v4-pro — робоча конячка для довгого контексту для робочих просторів, побудованих на великих документах, де вікно і ціна вхідних токенів визначають досвід.
- Робочі простори з агентами потребують надійного виклику інструментів; починайте агентів з claude-sonnet-4-6, потім перевірте, чи витримує легший id на ваших реальних сценаріях.
- Використовуйте перевизначення на рівні робочого простору як політику: замовчування залишається швидким, а дорогий id живе лише в тих просторах, чия робота це виправдовує.
Оплата за фактом · нижче офіційних цін
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Модель | Офіційна ціна | Наша ціна |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Збої, специфічні саме для AnythingLLM.
Токен-поля спричиняють найтонші збої. Занадто низьке контекстне вікно тихо обрізає отриманий контекст, що виглядає як модель, яка ігнорує ваші документи; встановіть задокументоване вікно для id у Chat Model Name. Max Tokens, встановлений занадто високо для моделі, дає жорсткі помилки на довгих відповідях; встановіть те, що модель реально дозволяє для виводу. Жорсткі помилки чесніші. Збої автентифікації — це поле API Key. Model-not-found — це Chat Model Name, що розійшовся з написанням у каталозі; поле вільнотекстове, а список /v1/models — джерело істини. Помилки з'єднання в десктопному застосунку зазвичай означають проксі чи файрвол між застосунком і ендпоінтом; у Docker-деплоях пам'ятайте, що саме контейнер має дістатися Base URL, а не ваш браузер. Якщо чат працює, а робочий простір поводиться інакше, ніж очікувалося, перевірте його налаштування перевизначення; налаштування провайдера на рівні робочого простору переважають системне замовчування, і забуте перевизначення — класична загадка «те саме питання, інша модель». Формулювання документації «орієнтований на розробників» підсумовує все вищесказане: провайдер робить рівно те, що кажуть п'ять полів, не більше й не менше.
Хто спрямовує AnythingLLM через шлюз.
- Команди, що запускають приватних асистентів для документів і хочуть якості відповідей рівня фронтиру без облікового запису постачальника на кожну родину моделей.
- Користувачі десктопу, що спрямовують особисту базу документів на id Claude чи GPT через передоплачений баланс, без картки для старту.
- Self-hosters, що залишають вбудований локальний ембедер і роблять віддалений чат єдиним вимірюваним каналом, видимим в одному лозі використання.
- Деплої, сегментовані за робочим простором, де перевизначення на рівні простору плюс вимірювання за ключем дають кожній команді свою модель і свій рахунок.
- Розробники, що порівнюють моделі відповідей на фіксованій базі документів, де кожен кандидат — це редагування налаштувань, а не міграція.
Перевірте ендпоінт і налагодьте перший чат робочого простору.
Спочатку зробіть curl до списку моделей і одного chat completion, використовуючи точний id, який плануєте вказати в Chat Model Name. Якщо обидва пройшли, половина роботи шлюзу доведена, і кожен подальший симптом живе в п'яти полях. Потім збережіть налаштування провайдера і поставте одне питання в робочому просторі з документом, який добре знаєте. Обґрунтована відповідь із цитуванням означає, що весь конвеєр працює. Відповідь, що ігнорує документ, вказує на значення контекстного вікна або на власні налаштування пошуку робочого простору. Жорсткі помилки мапляться чітко: ключ, написання id, форма Base URL. Щойно чати потечуть, консоль APIsRouter показує модель на запит, кількість токенів і витрати. QA документів множить вхідні токени через пошук, і лог використання — це те місце, де ви дізнаєтеся, скільки насправді коштує запит до вашої бази документів, по моделі, по дню і по ключу робочого простору, якщо ви їх розділили.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Поширені запитання
Як встановити кастомний Base URL в AnythingLLM?
У налаштуваннях під AI Providers відкрийте екран LLM preference і виберіть Generic OpenAI зі списку провайдерів. Встановіть Base URL на https://api.apisrouter.com/v1, додайте ваш ключ, впишіть точний id з каталогу в Chat Model Name і заповніть обидва токен-поля з документації моделі.
Що контролюють Token Context Window і Max Tokens?
Контекстне вікно каже AnythingLLM, скільки отриманого тексту й історії можна впакувати в запит; Max Tokens обмежує одну відповідь. Заниження вікна вирізає ваші документи з відповідей, а завищення будь-якого з них призводить до запитів, які модель відхиляє.
Чи може AnythingLLM запускати Claude або DeepSeek через Generic OpenAI?
Так. Провайдер надсилає Chat Model Name як звичайний рядок на Base URL через стандартні chat completions, тож claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash та id GPT — усі працюють, перемикаючись редагуванням одного поля або на рівні робочого простору.
Чи впливає зміна чат-моделі на мої вбудовані документи?
Ні. Налаштування чату й ембедінга незалежні; вектори зберігаються, а чат-моделі перемикаються вільно. Лише зміна ембедера скасовує наявні вектори й змушує повторно вбудовувати документи, тому багато деплоїв залишають вбудований локальний ембедер і налаштовують лише бік чату.
Чому сторінка документації називає Generic OpenAI орієнтованим на розробників?
Тому що він довіряє вашим вхідним даним замість постачання пресетів для кожного вендора: неправильні id, URL чи токен-значення падають під час виконання, а не відловлюються формою. З id, скопійованими з /v1/models, і лімітами з документації моделі, це стабільний, повноцінний шлях.
Чи можуть різні робочі простори використовувати різні моделі?
Так. Робочі простори успадковують системне замовчування, але можуть перевизначити провайдера й модель у власних налаштуваннях чату, тож один деплой може за замовчуванням використовувати швидкий id, а claude-sonnet-4-6 закріпити лише в тих просторах, чия робота це заслуговує.