Ejecuta el chat de RAGFlow sobre una base url OpenAI-API-Compatible.

Updated 2026-07-29

RAGFlow incluye un proveedor OpenAI-API-Compatible exactamente para esto: añade cada modelo con su id, https://api.apisrouter.com/v1 como base url, y una clave. Los ids de Claude, GPT, DeepSeek, GLM, Kimi y Qwen sirven entonces tus datasets, chats y agentes desde un solo endpoint.

Respuesta rápida: añade el modelo en la página Model providers.

Inicia sesión en RAGFlow, haz clic en tu logo arriba a la derecha, y abre Model providers. Bajo Models to be added, busca la tarjeta OpenAI-API-Compatible y haz clic en Add the model. En el diálogo Add LLM, configura Model type a chat, introduce el id exacto del catálogo como Model name, pon https://api.apisrouter.com/v1 en Base url, pega tu clave en API-Key, y configura Max tokens al tamaño de contexto real del modelo. Haz clic en OK. Luego haz que haga algo: abre Set default models en la misma página y elige tu modelo nuevo como el LLM por defecto. Los asistentes de chat, el QA de datasets, y los nodos de agente se resuelven todos a ese valor por defecto a menos que lo anulen. Un punto delicado que conviene conocer antes de la primera ejecución: el campo Max tokens de RAGFlow tiene 512 por defecto y su propio tooltip advierte que un valor inválido causa errores, así que introducir la ventana documentada del modelo es parte de la configuración, no una optimización.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Cómo vincula RAGFlow los modelos al trabajo.

RAGFlow (infiniflow en GitHub, unas 85K estrellas) es un motor de RAG para documentos profundos: parseo consciente del diseño de PDFs y tablas, fragmentación con citas fundamentadas, datasets, asistentes de chat, y flujos de trabajo de agente por encima. Distintas partes de ese pipeline se vinculan a distintos slots de modelo, y el vínculo es explícito. Los modelos de chat generan respuestas. Los modelos de embedding vectorizan fragmentos para la recuperación. Los modelos de rerank reordenan candidatos, y los modelos img2txt describen figuras durante el parseo. El proveedor OpenAI-API-Compatible puede registrar modelos para estos tipos individualmente, y cada diálogo Add LLM crea un vínculo de tipo, id, base url y clave. Cada modelo de chat registrado habla chat completions estándar con la base url usando el Model name como el string de transmisión, así que funciona cualquier id que sirva el gateway, sin importar el proveedor. Esa separación importa operativamente: cambiar tu modelo de respuesta de gpt-5.5 a claude-sonnet-4-6 es seguro cualquier día, pero el modelo de embedding está soldado a tus vectores indexados. RAGFlow refuerza esto con una comprobación de compatibilidad al cambiar modelos de embedding en un dataset que ya tiene fragmentos, y la regla práctica es más simple: elige la configuración de embedding una vez, y trata los modelos de chat como la capa que ajustas libremente.

Una clave para modelos chinos y occidentales juntos.

Los despliegues de RAGFlow tienden a ser bilingües: equipos de origen chino que procesan bases de documentos multilingües, y equipos internacionales que específicamente quieren modelos chinos para documentos chinos. Servido directamente, esa mezcla es dolorosa, ya que DeepSeek, Zhipu, Moonshot y Alibaba facturan por separado y algunos son incómodos de pagar desde el extranjero, mientras que Anthropic y OpenAI son incómodos desde la dirección contraria. A través de una sola base url OpenAI-API-Compatible, la mezcla es solo más diálogos Add LLM: deepseek-v4-pro y glm-5.2 para corpus con mucho contenido chino, qwen3.7-max y kimi-k2.6 como alternativas regionales fuertes, claude-sonnet-4-6 donde el pulido de la respuesta importa más. Misma base url, misma clave, ids directos del catálogo. Para los equipos en Asia la misma ruta funciona al revés: los ids de Claude y GPT se vuelven alcanzables sobre un saldo prepago sin una tarjeta occidental, lo que para muchas tiendas de RAGFlow es la diferencia entre evaluar un modelo y leer sobre él. También hay una ruta en el momento de arranque que conviene conocer: service_conf.yaml.template acepta un bloque user_default_llm (factory, api_key, base_url) para que las instalaciones nuevas arranquen ya conectadas. La documentación de RAGFlow es explícita en que, tras iniciar sesión, la configuración ocurre solo en la página Model providers, así que trata el YAML como aprovisionamiento del primer arranque, no configuración en vivo.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Elegir modelos para un pipeline de documentos.

La calidad de recuperación pone el techo y el modelo de respuesta decide cuánto te acercas, así que haz A/B con modelos de respuesta sobre tu corpus real: mismo dataset, mismas preguntas, dos asistentes fijados a dos ids, y el gasto por modelo en la consola de APIsRouter junto a tu propio juicio sobre las respuestas.

  • Responder de forma fundamentada sobre fragmentos recuperados es trabajo pesado en entrada donde brillan los modelos de nivel medio: deepseek-v4-pro y glm-5.2 llevan bien respuestas que siguen citas en corpus bilingües.
  • qwen3.7-max y kimi-k2.6 son los pesos pesados regionales que merece la pena probar cuando las respuestas deben leerse de forma nativa en chino; las diferencias de calidad entre modelos chinos se notan más en la generación que en la recuperación.
  • claude-sonnet-4-6 se gana el slot de respuesta donde la calidad de síntesis es el producto, resúmenes ejecutivos, análisis de contratos, cualquier cosa que un humano reenvía sin editar.
  • Los flujos de trabajo de agente que llaman a herramientas necesitan function calling fiable; prueba la ruta de agente con claude-sonnet-4-6 primero, y luego mira qué id regional lo iguala en tus flujos.
  • Max tokens es por registro, así que registra el mismo id dos veces con límites distintos si un asistente necesita respuestas largas y otro necesita ajustadas.

Pago por uso · por debajo del precio oficial

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModeloPrecio oficialNuestro precio
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Modos de fallo específicos de RAGFlow.

El valor por defecto de Max tokens es el clásico. Dejado en 512, las respuestas largas se truncan o dan error de formas que parecen problemas de modelo; configura el tamaño de contexto documentado al registrar, tal como advierte el propio tooltip. Un modelo registrado que da error inmediatamente suele ser la ortografía de Model name (debe coincidir exactamente con el listado de /v1/models) o una Base url a la que le falta su sufijo /v1, ya que RAGFlow añade rutas a lo que introduces. Que no pase nada tras el registro es un problema de valores por defecto: registrar un modelo no lo selecciona. Revisa Set default models, y revisa los ajustes de modelo por asistente, que anulan el valor por defecto del workspace. La confusión de embedding completa la lista. Si vinculas un id de embedding a través del proveedor compatible, confirma que el endpoint realmente lo sirve antes de indexar; y una vez que un dataset tiene fragmentos, cambiar su modelo de embedding está bloqueado por una comprobación de similitud y puede requerir reindexar desde cero. Los cambios de modelo de chat no llevan ese coste, que es precisamente por qué la capa de chat es donde deberías experimentar.

Quién enruta RAGFlow a través de un gateway.

  • Equipos de documentos bilingües que mezclan DeepSeek, GLM, Qwen y Kimi con ids de Claude y GPT detrás de una base url y una clave.
  • Equipos en Asia que quieren respuestas con calidad Claude sobre un saldo prepago sin tarjeta occidental, y equipos occidentales que quieren modelos chinos sin facturación regional.
  • Autoalojadores que ejecutan RAGFlow para bases de conocimiento internas y quieren todo el gasto en la nube del despliegue en un solo log de uso.
  • Creadores que comparan modelos de respuesta sobre un corpus fijo, donde cada candidato es un diálogo Add LLM en lugar de una cuenta de proveedor.
  • Equipos de Ops que aprovisionan instalaciones nuevas desde service_conf.yaml.template con el endpoint ya conectado en el primer arranque.

Verifica el endpoint y depura el primer chat.

Haz curl al listado de modelos primero; el campo Model name es texto libre, y copiar ids desde el listado elimina el fallo más común antes de que ocurra. Luego ejecuta una chat completion contra el id que planeas registrar. Dentro de RAGFlow, registra el modelo, configúralo como LLM por defecto, y pruébalo en un asistente de chat simple antes de involucrar datasets. Los errores de autenticación apuntan a API-Key; no encontrado a Model name; errores de conexión a Base url o al egreso del contenedor, ya que es el servidor de RAGFlow, no tu navegador, el que debe alcanzar el endpoint. Las respuestas largas truncadas o fallidas apuntan de vuelta a Max tokens. Una vez que los chats fluyen, la consola de APIsRouter muestra el modelo por petición, el recuento de tokens y el gasto. El tráfico de RAG está dominado por la entrada, y el log de uso es donde ves lo que realmente cuesta consultar tu corpus, por modelo, por día, una sola página para los ids chinos y occidentales juntos.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Preguntas frecuentes

¿Cómo añado un modelo OpenAI-API-Compatible en RAGFlow?

Haz clic en tu avatar, abre Model providers, busca OpenAI-API-Compatible bajo Models to be added, y haz clic en Add the model. Rellena Model type (chat), Model name (el id exacto del catálogo), Base url https://api.apisrouter.com/v1, API-Key, y un valor real de Max tokens, y confirma con OK.

¿Por qué mis respuestas se truncan o dan error tras añadir un modelo?

Casi siempre Max tokens: RAGFlow lo configura por defecto en 512 y su tooltip advierte que valores incorrectos causan errores. Edita el registro del modelo e introduce el tamaño de contexto documentado del modelo.

¿Puede RAGFlow mezclar modelos chinos y occidentales a través de un proveedor?

Sí. Cada registro envía su string de Model name a la misma base url, así que deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 y claude-sonnet-4-6 pueden registrarse todos lado a lado y seleccionarse por asistente, facturados a través de una clave.

¿Los modelos de chat y embedding se vinculan por separado?

Sí. Cada diálogo Add LLM registra un modelo de un tipo, y Set default models asigna los slots de LLM y embedding por defecto de forma independiente. Los modelos de chat pueden cambiarse libremente; los modelos de embedding están atados a los vectores indexados y bloqueados por una comprobación de compatibilidad una vez que un dataset tiene fragmentos.

¿Puedo preconfigurar el endpoint antes del primer arranque?

Sí, a través del bloque user_default_llm en docker/service_conf.yaml.template: factory OpenAI-API-Compatible, tu api_key, y base_url. RAGFlow lo lee en el primer arranque; tras iniciar sesión, la configuración se mueve solo a la página Model providers.

¿Por qué mi modelo registrado no se usa?

Registro y selección son pasos separados. Configura el modelo como LLM por defecto bajo Set default models, y revisa los ajustes de modelo por asistente, que anulan el valor por defecto. Si sigue fallando, compara Model name contra la ortografía del listado de /v1/models.