Запустите чат RAGFlow на OpenAI-API-Compatible base URL.

Updated 2026-07-29

RAGFlow поставляется с провайдером OpenAI-API-Compatible именно для этого: добавьте каждую модель с её id, https://api.apisrouter.com/v1 в качестве base url, и один ключ. Id Claude, GPT, DeepSeek, GLM, Kimi и Qwen затем обслуживают ваши датасеты, чаты и агентов с одного эндпоинта.

Короткий ответ: добавьте модель на странице Model providers.

Войдите в RAGFlow, нажмите на свой логотип в правом верхнем углу и откройте Model providers. В разделе Models to be added найдите карточку OpenAI-API-Compatible и нажмите Add the model. В диалоге Add LLM установите Model type в chat, введите точный id из каталога как Model name, впишите https://api.apisrouter.com/v1 в Base url, вставьте свой ключ в API-Key и установите Max tokens в реальный размер контекста модели. Нажмите OK. Затем заставьте это работать: откройте Set default models на той же странице и выберите свою новую модель как LLM по умолчанию. Чат-ассистенты, ответы на вопросы по датасетам и узлы агентов — все резолвятся в это умолчание, если не переопределены. Один острый угол, который стоит знать перед первым запуском: поле Max tokens в RAGFlow по умолчанию равно 512, и собственная подсказка предупреждает, что неверное значение вызывает ошибки, так что ввод задокументированного окна модели — это часть настройки, а не оптимизация.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Как RAGFlow привязывает модели к работе.

RAGFlow (infiniflow на GitHub, около 85K звёзд) — движок RAG для глубокой работы с документами: парсинг PDF и таблиц с учётом разметки, чанкинг с обоснованными цитатами, датасеты, чат-ассистенты и агентские workflow поверх всего этого. Разные части этого пайплайна привязываются к разным слотам моделей, и привязка явная. Чат-модели генерируют ответы. Модели эмбеддинга векторизуют чанки для retrieval. Модели rerank переупорядочивают кандидатов, а модели img2txt описывают фигуры во время парсинга. Провайдер OpenAI-API-Compatible может регистрировать модели для этих типов индивидуально, и каждый диалог Add LLM создаёт одну привязку типа, id, base url и ключа. Каждая зарегистрированная чат-модель говорит на стандартных chat completions с base url, со строкой Model name в качестве строки, идущей в запрос, так что любой id, который обслуживает шлюз, валиден, независимо от вендора. Это разделение важно операционно: переключение вашей модели ответа с gpt-5.5 на claude-sonnet-4-6 безопасно в любой день, но модель эмбеддинга приварена к вашим проиндексированным векторам. RAGFlow принудительно проверяет это совместимостью при переключении моделей эмбеддинга на датасете, который уже имеет чанки, и практическое правило проще: выберите настройку эмбеддинга один раз и относитесь к чат-моделям как к слою, который вы настраиваете свободно.

Один ключ для китайских и западных моделей вместе.

Деплои RAGFlow сильно склоняются к двуязычности: команды китайского происхождения, обрабатывающие базы документов со смешанным языком, и международные команды, которым конкретно нужны китайские модели для китайских документов. При прямом обслуживании такой микс мучителен, поскольку DeepSeek, Zhipu, Moonshot и Alibaba биллятся отдельно, и некоторых неудобно оплачивать из-за рубежа, тогда как Anthropic и OpenAI неудобны в обратном направлении. Через один base url OpenAI-API-Compatible этот микс — просто больше диалогов Add LLM: deepseek-v4-pro и glm-5.2 для корпусов с большой долей китайского, qwen3.7-max и kimi-k2.6 как сильные региональные альтернативы, claude-sonnet-4-6 там, где отточенность ответа важнее всего. Тот же base url, тот же ключ, id прямо из каталога. Для команд в Азии тот же маршрут работает в обратную сторону: id Claude и GPT становятся доступны на предоплаченном балансе без западной карты, что для многих контор на RAGFlow — разница между оценкой модели и чтением о ней. Есть также путь на этапе загрузки, о котором стоит знать: service_conf.yaml.template принимает блок user_default_llm (factory, api_key, base_url), так что свежие инсталляции поднимаются уже предварительно настроенными. Документация RAGFlow прямо говорит, что после логина настройка происходит только на странице Model providers, так что относитесь к YAML как к провижининг при первой загрузке, а не к живому конфигу.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Выбор моделей для пайплайна документов.

Качество retrieval задаёт потолок, а модель ответа решает, насколько близко вы к нему подберётесь, так что A/B-тестируйте модели ответа на своём реальном корпусе: тот же датасет, те же вопросы, два ассистента, закреплённых на двух id, и расходы по модели в консоли APIsRouter рядом с вашей собственной оценкой ответов.

  • Обоснованные ответы по извлечённым чанкам — это работа, требовательная к входным данным, где блистают модели среднего уровня: deepseek-v4-pro и glm-5.2 хорошо несут ответы с цитированием на двуязычных корпусах.
  • qwen3.7-max и kimi-k2.6 — региональные тяжеловесы, которых стоит протестировать, когда ответы должны звучать по-китайски естественно; различия в качестве между китайскими моделями проявляются сильнее в генерации, чем в retrieval.
  • claude-sonnet-4-6 заслуживает слота ответа там, где качество синтеза — это продукт: executive summary, анализ договоров, всё, что человек пересылает без редактирования.
  • Агентским workflow, вызывающим инструменты, нужен надёжный function calling; сначала протестируйте путь агента на claude-sonnet-4-6, затем посмотрите, какой региональный id сравнится с ним на ваших flow.
  • Max tokens задаётся на каждую регистрацию, так что зарегистрируйте один и тот же id дважды с разными лимитами, если одному ассистенту нужны длинные ответы, а другому — сжатые.

Оплата по факту · дешевле официальных цен

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

МодельОфициальная ценаНаша цена
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Сбои, специфичные именно для RAGFlow.

Умолчание Max tokens — классика. Оставленное на 512, оно обрезает длинные ответы или даёт ошибки, которые выглядят как проблемы модели; задавайте задокументированный размер контекста при регистрации, как и предупреждает сама подсказка. Зарегистрированная модель, которая сразу даёт ошибку, — это обычно написание Model name (оно должно точно совпадать с листингом /v1/models) или Base url без суффикса /v1, поскольку RAGFlow добавляет пути маршрута к тому, что вы ввели. Отсутствие какого-либо эффекта после регистрации — это проблема умолчаний: регистрация модели не выбирает её. Проверьте Set default models и проверьте настройки моделей по каждому ассистенту, которые переопределяют умолчание workspace. Путаница с эмбеддингом завершает список. Если вы привязываете id эмбеддинга через совместимого провайдера, убедитесь, что эндпоинт реально его обслуживает, прежде чем индексировать; и как только у датасета появляются чанки, смена его модели эмбеддинга закрыта проверкой на схожесть и может потребовать переиндексации с нуля. Смены чат-модели не несут такой стоимости, и именно поэтому слой чата — то место, где стоит экспериментировать.

Кто направляет RAGFlow через шлюз.

  • Двуязычные команды документов, смешивающие DeepSeek, GLM, Qwen и Kimi с id Claude и GPT за одним base url и одним ключом.
  • Команды в Азии, которым нужны ответы качества Claude на предоплаченном балансе без западной карты, и западные команды, которым нужны китайские модели без региональной оплаты.
  • Self-hosters, запускающие RAGFlow для внутренних баз знаний, которым нужны все облачные расходы деплоя в одном логе использования.
  • Разработчики, сравнивающие модели ответов на фиксированном корпусе, где каждый кандидат — это один диалог Add LLM, а не аккаунт у вендора.
  • Ops-команды, провижинящие свежие инсталляции из service_conf.yaml.template с эндпоинтом, предварительно настроенным при первой загрузке.

Проверьте эндпоинт и отладьте первый чат.

Сначала curl'ните листинг моделей; поле Model name — свободнотекстовое, и копирование id из листинга устраняет самый частый сбой до того, как он случится. Затем прогоните один chat completion против id, который планируете зарегистрировать. Внутри RAGFlow зарегистрируйте модель, установите её как default LLM и протестируйте в обычном чат-ассистенте, прежде чем подключать датасеты. Ошибки аутентификации указывают на API-Key; not-found — на Model name; ошибки подключения — на Base url или egress контейнера, так как до эндпоинта должен дотянуться сервер RAGFlow, а не ваш браузер. Обрезанные или падающие длинные ответы указывают обратно на Max tokens. Как только чаты начинают работать, консоль APIsRouter показывает модель на запрос, счётчики токенов и расходы. Трафик RAG доминирован входными данными, и лог использования — это место, где вы видите, во что реально обходится запрос к вашему корпусу, по модели, по дню, одна страница для китайских и западных id вместе.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Частые вопросы

Как добавить модель OpenAI-API-Compatible в RAGFlow?

Нажмите на аватар, откройте Model providers, найдите OpenAI-API-Compatible в разделе Models to be added и нажмите Add the model. Заполните Model type (chat), Model name (точный id из каталога), Base url https://api.apisrouter.com/v1, API-Key и реальное значение Max tokens, затем подтвердите нажатием OK.

Почему мои ответы обрезаются или дают ошибки после добавления модели?

Почти всегда Max tokens: RAGFlow по умолчанию ставит его в 512, и подсказка предупреждает, что неверные значения вызывают ошибки. Отредактируйте регистрацию модели и введите задокументированный размер контекста модели.

Может ли RAGFlow смешивать китайские и западные модели через одного провайдера?

Да. Каждая регистрация отправляет свою строку Model name на один и тот же base url, так что deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 и claude-sonnet-4-6 можно все зарегистрировать бок о бок и выбирать по ассистенту, тарифицируемые через один ключ.

Привязываются ли чат-модели и модели эмбеддинга раздельно?

Да. Каждый диалог Add LLM регистрирует одну модель одного типа, и Set default models назначает слоты default LLM и эмбеддинга независимо. Чат-модели можно менять свободно; модели эмбеддинга привязаны к проиндексированным векторам и закрыты проверкой совместимости, как только у датасета появляются чанки.

Могу ли я предварительно настроить эндпоинт до первой загрузки?

Да, через блок user_default_llm в docker/service_conf.yaml.template: factory OpenAI-API-Compatible, ваш api_key и base_url. RAGFlow читает его при первом запуске; после логина настройка переходит только на страницу Model providers.

Почему моя зарегистрированная модель не используется?

Регистрация и выбор — раздельные шаги. Установите модель как default LLM в Set default models и проверьте настройки моделей по каждому ассистенту, которые переопределяют умолчание. Если всё ещё не работает, сравните Model name с написанием в листинге /v1/models.