Запустіть чат RAGFlow на OpenAI-API-Compatible base URL.

Updated 2026-07-29

RAGFlow постачається саме для цього з провайдером OpenAI-API-Compatible: додайте кожну модель з її id, https://api.apisrouter.com/v1 як base url і один ключ. Тоді id Claude, GPT, DeepSeek, GLM, Kimi і Qwen обслуговують ваші датасети, чати й агенти з одного ендпоінта.

Коротка відповідь: додайте модель на сторінці Model providers.

Увійдіть у RAGFlow, натисніть ваш логотип у правому верхньому куті й відкрийте Model providers. Під Models to be added знайдіть картку OpenAI-API-Compatible і натисніть Add the model. У діалозі Add LLM встановіть Model type на chat, введіть точний id з каталогу як Model name, вставте https://api.apisrouter.com/v1 у Base url, вставте ваш ключ в API-Key і встановіть Max tokens на реальний розмір контексту моделі. Натисніть OK. Потім змусьте це щось робити: відкрийте Set default models на тій самій сторінці й оберіть вашу нову модель як типову LLM. Чат-асистенти, відповідання на питання датасету й вузли агентів усі резолвляться до цієї типової моделі, якщо не перевизначені. Один гострий кут, який варто знати перед першим прогоном: поле Max tokens у RAGFlow за замовчуванням дорівнює 512, і власна підказка попереджає, що неправильне значення спричиняє помилки, тож введення задокументованого вікна моделі — частина налаштування, а не оптимізація.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Як RAGFlow прив'язує моделі до роботи.

RAGFlow (infiniflow на GitHub, приблизно 85 тис. зірок) — це RAG-двигун для глибокої роботи з документами: парсинг PDF і таблиць, чутливий до макета, розбивка на фрагменти з обґрунтованими цитуваннями, датасети, чат-асистенти й агентські workflow поверх усього цього. Різні частини цього конвеєра прив'язуються до різних слотів моделі, і прив'язка явна. Чат-моделі генерують відповіді. Моделі ембедінга векторизують фрагменти для пошуку. Моделі rerank перевпорядковують кандидатів, а моделі img2txt описують рисунки під час парсингу. Провайдер OpenAI-API-Compatible може реєструвати моделі для цих типів окремо, кожен діалог Add LLM створює одну прив'язку типу, id, base url і ключа. Кожна зареєстрована чат-модель говорить стандартними chat completions до base url з Model name як рядком дроту, тож будь-який id, який обслуговує шлюз, дійсний, незалежно від вендора. Цей поділ має операційне значення: перемикання вашої моделі відповіді з gpt-5.5 на claude-sonnet-4-6 безпечне будь-якого дня, але модель ембедінга приварена до ваших проіндексованих векторів. RAGFlow забезпечує це перевіркою сумісності при зміні моделі ембедінга на датасеті, що вже має фрагменти, і практичне правило простіше: оберіть налаштування ембедінга один раз і ставтеся до чат-моделей як до шару, який ви вільно налаштовуєте.

Один ключ для китайських і західних моделей разом.

Деплої RAGFlow схиляються до двомовності: команди китайського походження, що обробляють бази документів змішаною мовою, і міжнародні команди, які саме хочуть китайські моделі для китайських документів. При прямому підключенні цей мікс болючий, оскільки DeepSeek, Zhipu, Moonshot і Alibaba виставляють рахунки окремо, і деяким незручно платити з-за кордону, а Anthropic і OpenAI незручні у зворотному напрямку. Через один base url OpenAI-API-Compatible цей мікс — просто більше діалогів Add LLM: deepseek-v4-pro і glm-5.2 для корпусів з переважанням китайської, qwen3.7-max і kimi-k2.6 як сильні регіональні альтернативи, claude-sonnet-4-6 там, де полірування відповіді найважливіше. Той самий base url, той самий ключ, id прямо з каталогу. Для команд в Азії той самий маршрут працює у зворотному напрямку: id Claude і GPT стають доступними на передоплаченому балансі без західної картки, що для багатьох команд RAGFlow — різниця між оцінкою моделі й читанням про неї. Є ще й шлях налаштування при завантаженні, вартий уваги: service_conf.yaml.template приймає блок user_default_llm (factory, api_key, base_url), тож свіжі інсталяції запускаються вже підключеними. Документація RAGFlow прямо каже, що після входу конфігурація відбувається лише на сторінці Model providers, тож ставтеся до YAML як до налаштування при першому завантаженні, а не до живого конфігу.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Вибір моделей для конвеєра документів.

Якість пошуку встановлює стелю, а модель відповіді вирішує, наскільки близько ви до неї дістанетесь, тож проведіть A/B-тест моделей відповіді на вашому реальному корпусі: той самий датасет, ті самі питання, два асистенти, закріплені за двома id, і витрати по моделях у консолі APIsRouter поруч із вашою власною оцінкою відповідей.

  • Обґрунтоване відповідання над отриманими фрагментами — вхідно-важка робота, де сяють моделі середнього рівня: deepseek-v4-pro і glm-5.2 добре несуть відповіді з цитуванням на двомовних корпусах.
  • qwen3.7-max і kimi-k2.6 — регіональні важковаги, варті тестування, коли відповіді мають природно звучати китайською; різниця в якості між китайськими моделями проявляється в генерації більше, ніж у пошуку.
  • claude-sonnet-4-6 заслуговує на слот відповіді там, де якість синтезу — це продукт: виконавчі резюме, аналіз контрактів, будь-що, що людина переправляє без редагування.
  • Агентські workflow, що викликають інструменти, потребують надійного виклику функцій; спочатку протестуйте шлях агента на claude-sonnet-4-6, потім подивіться, який регіональний id відповідає йому на ваших флоу.
  • Max tokens — на кожну реєстрацію, тож зареєструйте той самий id двічі з різними лімітами, якщо одному асистенту потрібні довгі відповіді, а іншому — стислі.

Оплата за фактом · нижче офіційних цін

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

МодельОфіційна цінаНаша ціна
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Збої, специфічні саме для RAGFlow.

Типове значення Max tokens — класика. Залишене на 512, довгі відповіді обрізаються чи дають помилки способами, що виглядають як проблеми моделі; встановіть задокументований розмір контексту при реєстрації, як і попереджає сама підказка. Зареєстрована модель, що одразу дає помилку, зазвичай означає написання Model name (воно має точно збігатися зі списком /v1/models) чи Base url без суфікса /v1, оскільки RAGFlow додає шляхи маршруту до того, що ви вводите. Відсутність будь-якої дії після реєстрації — це проблема замовчувань: реєстрація моделі не обирає її. Перевірте Set default models і перевірте налаштування моделі по асистенту, які перевизначають замовчування робочого простору. Плутанина з ембедінгом завершує список. Якщо ви прив'язуєте id ембедінга через сумісного провайдера, підтвердіть, що ендпоінт справді обслуговує його, перш ніж індексувати; і щойно датасет має фрагменти, зміна його моделі ембедінга обмежена перевіркою схожості й може вимагати переіндексації з нуля. Зміни чат-моделі не несуть такої вартості, і саме тому шар чату — те місце, де варто експериментувати.

Хто спрямовує RAGFlow через шлюз.

  • Двомовні команди документів, що змішують DeepSeek, GLM, Qwen і Kimi з id Claude і GPT за одним base url і одним ключем.
  • Команди в Азії, що хочуть відповідей якості Claude на передоплаченому балансі без західної картки, і західні команди, що хочуть китайські моделі без регіонального білінгу.
  • Self-hosters, що запускають RAGFlow для внутрішніх баз знань і хочуть увесь хмарний бюджет деплою в одному лозі використання.
  • Розробники, що порівнюють моделі відповіді на фіксованому корпусі, де кожен кандидат — це один діалог Add LLM, а не обліковий запис вендора.
  • Ops-команди, що готують свіжі інсталяції через service_conf.yaml.template з ендпоінтом, підключеним заздалегідь при першому завантаженні.

Перевірте ендпоінт і налагодьте перший чат.

Спочатку зробіть curl до списку моделей; поле Model name вільнотекстове, і копіювання id зі списку усуває найпоширенішу проблему ще до того, як вона трапиться. Потім запустіть один chat completion проти id, який плануєте зареєструвати. Усередині RAGFlow зареєструйте модель, встановіть її типовою LLM і протестуйте у звичайному чат-асистенті, перш ніж залучати датасети. Помилки автентифікації вказують на API-Key; not-found — на Model name; помилки з'єднання — на Base url чи egress контейнера, оскільки саме сервер RAGFlow, а не ваш браузер, має дістатися ендпоінта. Обрізані чи невдалі довгі відповіді вказують назад на Max tokens. Щойно чати потечуть, консоль APIsRouter показує модель на запит, кількість токенів і витрати. RAG-трафік вхідно-домінований, і лог використання — те місце, де ви бачите, скільки насправді коштує запит до вашого корпусу, по моделі, по дню, китайські й західні id разом на одній сторінці.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Поширені запитання

Як додати модель OpenAI-API-Compatible у RAGFlow?

Натисніть на ваш аватар, відкрийте Model providers, знайдіть OpenAI-API-Compatible під Models to be added і натисніть Add the model. Заповніть Model type (chat), Model name (точний id з каталогу), Base url https://api.apisrouter.com/v1, API-Key і реальне значення Max tokens, потім підтвердіть через OK.

Чому мої відповіді обрізаються чи дають помилку після додавання моделі?

Майже завжди Max tokens: RAGFlow за замовчуванням встановлює 512, і підказка попереджає, що неправильні значення спричиняють помилки. Відредагуйте реєстрацію моделі й введіть задокументований розмір контексту моделі.

Чи може RAGFlow змішувати китайські й західні моделі через одного провайдера?

Так. Кожна реєстрація надсилає свій рядок Model name на той самий base url, тож deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 і claude-sonnet-4-6 можуть бути зареєстровані поруч і обрані по асистенту, оплачуючись через один ключ.

Чи прив'язуються чат-моделі й моделі ембедінга окремо?

Так. Кожен діалог Add LLM реєструє одну модель одного типу, а Set default models призначає типові слоти LLM і ембедінга незалежно. Чат-моделі можна вільно міняти; моделі ембедінга прив'язані до проіндексованих векторів і обмежені перевіркою сумісності, щойно датасет має фрагменти.

Чи можу я попередньо налаштувати ендпоінт до першого завантаження?

Так, через блок user_default_llm у docker/service_conf.yaml.template: factory OpenAI-API-Compatible, ваш api_key і base_url. RAGFlow читає його при першому запуску; після входу конфігурація переходить лише на сторінку Model providers.

Чому моя зареєстрована модель не використовується?

Реєстрація і вибір — окремі кроки. Встановіть модель типовою LLM під Set default models і перевірте налаштування моделі по асистенту, які перевизначають замовчування. Якщо все ще падає, порівняйте Model name зі списком /v1/models.