Fai girare la chat di RAGFlow su una base url OpenAI-API-Compatible.
Updated 2026-07-29
RAGFlow include un provider OpenAI-API-Compatible pensato esattamente per questo: aggiungi ogni modello con il suo id, https://api.apisrouter.com/v1 come base url, e una chiave. Gli id Claude, GPT, DeepSeek, GLM, Kimi e Qwen servono così i tuoi dataset, chat e agenti da un unico endpoint.
Risposta rapida: aggiungi il modello nella pagina Model providers.
Accedi a RAGFlow, clicca sul tuo logo in alto a destra, e apri Model providers. Sotto Models to be added, trova la card OpenAI-API-Compatible e clicca Add the model. Nella finestra Add LLM, imposta Model type su chat, inserisci l'id esatto del catalogo come Model name, metti https://api.apisrouter.com/v1 in Base url, incolla la tua chiave in API-Key, e imposta Max tokens sulla dimensione reale del contesto del modello. Clicca OK. Poi falla funzionare davvero: apri Set default models sulla stessa pagina e scegli il tuo nuovo modello come LLM predefinito. Assistenti di chat, domande e risposte sui dataset, e nodi degli agenti si risolvono tutti su quel default a meno che non lo sovrascrivano. Uno spigolo tagliente da conoscere prima della prima esecuzione: il campo Max tokens di RAGFlow è predefinito a 512 e il suo stesso tooltip avverte che un valore non valido causa errori, quindi inserire la finestra documentata del modello è parte della configurazione, non un'ottimizzazione.
Model type: chat
Model name: deepseek-v4-pro
Base url: https://api.apisrouter.com/v1
API-Key: sk-YOUR-APISROUTER-KEY
Max tokens: 128000
then: Set default models → LLM → deepseek-v4-proCome RAGFlow collega i modelli al lavoro.
RAGFlow (infiniflow su GitHub, circa 85K stelle) è un motore RAG per documenti complessi: parsing consapevole del layout di PDF e tabelle, chunking con citazioni ancorate, dataset, assistenti di chat e flussi di lavoro ad agenti sopra a tutto questo. Parti diverse di quella pipeline si collegano a slot di modello diversi, e il collegamento è esplicito. I chat model generano le risposte. I modelli di embedding vettorizzano i chunk per il recupero. I modelli di rerank riordinano i candidati, e i modelli img2txt descrivono le figure durante il parsing. Il provider OpenAI-API-Compatible può registrare modelli per questi tipi individualmente, ogni finestra Add LLM crea un collegamento di tipo, id, base url e chiave. Ogni chat model registrato parla chat completions standard verso la base url con Model name come stringa sul filo, quindi qualsiasi id servito dal gateway è valido, indipendentemente dal fornitore. Quella separazione conta a livello operativo: passare il tuo modello di risposta da gpt-5.5 a claude-sonnet-4-6 è sicuro in qualsiasi momento, ma il modello di embedding è saldato ai tuoi vettori indicizzati. RAGFlow applica questo con un controllo di compatibilità quando cambi modello di embedding su un dataset che ha già chunk, e la regola pratica è più semplice: scegli una volta la configurazione degli embedding, e tratta i chat model come il livello che puoi regolare liberamente.
Una chiave per i modelli cinesi e occidentali insieme.
Le distribuzioni di RAGFlow tendono a essere bilingui: team di origine cinese che elaborano basi documentali multilingue, e team internazionali che vogliono specificamente modelli cinesi per documenti cinesi. Servito direttamente, quel mix è doloroso, dato che DeepSeek, Zhipu, Moonshot e Alibaba fatturano tutti separatamente e alcuni sono scomodi da pagare dall'estero, mentre Anthropic e OpenAI sono scomodi nella direzione opposta. Attraverso un'unica base url OpenAI-API-Compatible, il mix è solo più finestre Add LLM: deepseek-v4-pro e glm-5.2 per corpora a forte presenza cinese, qwen3.7-max e kimi-k2.6 come forti alternative regionali, claude-sonnet-4-6 dove la rifinitura della risposta conta di più. Stessa base url, stessa chiave, id direttamente dal catalogo. Per i team in Asia lo stesso percorso funziona al contrario: gli id Claude e GPT diventano raggiungibili su un saldo prepagato senza una carta occidentale, il che per molti utilizzatori di RAGFlow è la differenza tra valutare un modello e leggerne soltanto. C'è anche un percorso al primo avvio che vale la pena conoscere: service_conf.yaml.template accetta un blocco user_default_llm (factory, api_key, base_url) così le installazioni nuove partono già collegate. La documentazione di RAGFlow è esplicita nel dire che dopo il login, la configurazione avviene solo nella pagina Model providers, quindi tratta lo YAML come provisioning al primo avvio, non come configurazione live.
user_default_llm:
factory: OpenAI-API-Compatible
api_key: sk-YOUR-APISROUTER-KEY
base_url: https://api.apisrouter.com/v1Scegliere i modelli per una pipeline di documenti.
La qualità del recupero fissa il tetto e il modello di risposta decide quanto ti avvicini, quindi fai A/B testing dei modelli di risposta sul tuo corpus reale: stesso dataset, stesse domande, due assistenti fissati su due id, e la spesa per modello nella console di APIsRouter accanto al tuo giudizio delle risposte.
- Rispondere in modo ancorato su chunk recuperati è un lavoro ad alto consumo di input dove i modelli di livello medio brillano: deepseek-v4-pro e glm-5.2 gestiscono bene risposte che seguono le citazioni su corpora bilingue.
- qwen3.7-max e kimi-k2.6 sono i pesi massimi regionali da testare quando le risposte devono leggersi in modo nativo in cinese; le differenze di qualità tra modelli cinesi si vedono più nella generazione che nel recupero.
- claude-sonnet-4-6 merita lo slot di risposta dove la qualità della sintesi è il prodotto: riassunti esecutivi, analisi contrattuali, qualsiasi cosa che un umano inoltri senza modifiche.
- I flussi di lavoro ad agenti che chiamano strumenti hanno bisogno di function calling affidabile; testa prima il percorso agente su claude-sonnet-4-6, poi vedi quale id regionale lo eguaglia sui tuoi flussi.
- Max tokens è per singola registrazione, quindi registra lo stesso id due volte con limiti diversi se un assistente ha bisogno di risposte lunghe e un altro di risposte contenute.
Pagamento a consumo · sotto i prezzi ufficiali
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modello | Prezzo ufficiale | Il nostro prezzo |
|---|---|---|
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Qwen 3.7 Max | $2.50 / $7.50 per M | $2.50 / $7.50 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
Modalità di errore specifiche di RAGFlow.
Il default di Max tokens è il classico. Lasciato a 512, le risposte lunghe si troncano o generano errori in modi che sembrano problemi del modello; imposta la dimensione di contesto documentata al momento della registrazione, come lo stesso tooltip avverte. Un modello registrato che genera errori immediatamente di solito è l'ortografia di Model name (deve corrispondere esattamente all'elenco di /v1/models) oppure una Base url a cui manca il suffisso /v1, dato che RAGFlow appende i percorsi di route a ciò che inserisci. Nessun effetto dopo la registrazione è un problema di default: registrare un modello non lo seleziona. Controlla Set default models, e controlla le impostazioni di modello per singolo assistente, che sovrascrivono il default del workspace. La confusione sugli embedding completa l'elenco. Se colleghi un id di embedding tramite il provider compatibile, conferma che l'endpoint lo serva davvero prima di indicizzare; e una volta che un dataset ha chunk, cambiare il suo modello di embedding è vincolato da un controllo di similarità e può richiedere una re-indicizzazione da zero. I cambi di chat model non comportano alcun costo simile, il che è esattamente il motivo per cui il livello di chat è dove dovresti sperimentare.
Chi instrada RAGFlow tramite un gateway.
- Team di documenti bilingui che mescolano DeepSeek, GLM, Qwen e Kimi con id Claude e GPT dietro un'unica base url e una chiave.
- Team in Asia che vogliono risposte di qualità Claude su un saldo prepagato senza una carta occidentale, e team occidentali che vogliono modelli cinesi senza fatturazione regionale.
- Self-hoster che eseguono RAGFlow per basi di conoscenza interne e vogliono l'intera spesa cloud della distribuzione su un unico log di utilizzo.
- Builder che confrontano modelli di risposta su un corpus fisso, dove ogni candidato è una finestra Add LLM piuttosto che un account fornitore.
- Team ops che effettuano il provisioning di installazioni nuove da service_conf.yaml.template con l'endpoint già collegato al primo avvio.
Verifica l'endpoint e fai debug della prima chat.
Fai prima un curl sull'elenco dei modelli; il campo Model name è testo libero, e copiare gli id dall'elenco elimina il fallimento più comune prima che accada. Poi esegui una chat completion contro l'id che prevedi di registrare. Dentro RAGFlow, registra il modello, impostalo come LLM predefinito, e testalo in un assistente di chat semplice prima di coinvolgere i dataset. Gli errori di autenticazione indicano API-Key; non-trovato indica Model name; gli errori di connessione indicano Base url o l'egress del container, dato che è il server di RAGFlow, non il tuo browser, che deve raggiungere l'endpoint. Risposte lunghe troncate o fallite rimandano a Max tokens. Una volta che le chat scorrono, la console di APIsRouter mostra il modello per richiesta, i conteggi dei token e la spesa. Il traffico RAG è dominato dall'input, e il log di utilizzo è dove vedi quanto costa davvero interrogare il tuo corpus, per modello, per giorno, con gli id cinesi e occidentali su un'unica pagina.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-pro",
"messages":[{"role":"user","content":"ping"}]}'Domande frequenti
Come aggiungo un modello OpenAI-API-Compatible in RAGFlow?
Clicca sul tuo avatar, apri Model providers, trova OpenAI-API-Compatible sotto Models to be added, e clicca Add the model. Compila Model type (chat), Model name (l'id esatto del catalogo), Base url https://api.apisrouter.com/v1, API-Key, e un valore reale di Max tokens, poi conferma con OK.
Perché le mie risposte si troncano o generano errori dopo aver aggiunto un modello?
Quasi sempre Max tokens: RAGFlow lo imposta di default a 512 e il suo tooltip avverte che valori scorretti causano errori. Modifica la registrazione del modello e inserisci la dimensione di contesto documentata del modello.
RAGFlow può mescolare modelli cinesi e occidentali tramite un unico provider?
Sì. Ogni registrazione invia la sua stringa Model name alla stessa base url, quindi deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6 e claude-sonnet-4-6 possono essere registrati tutti fianco a fianco e selezionati per assistente, fatturati tramite una chiave.
I chat model e i modelli di embedding si collegano separatamente?
Sì. Ogni finestra Add LLM registra un modello di un tipo, e Set default models assegna gli slot LLM predefinito ed embedding in modo indipendente. I chat model si possono scambiare liberamente; i modelli di embedding sono legati ai vettori indicizzati e vincolati da un controllo di compatibilità una volta che un dataset ha chunk.
Posso pre-configurare l'endpoint prima del primo avvio?
Sì, tramite il blocco user_default_llm in docker/service_conf.yaml.template: factory OpenAI-API-Compatible, il tuo api_key, e base_url. RAGFlow lo legge al primo avvio; dopo il login, la configurazione si sposta solo nella pagina Model providers.
Perché il mio modello registrato non viene usato?
Registrazione e selezione sono passaggi separati. Imposta il modello come LLM predefinito sotto Set default models, e controlla le impostazioni di modello per singolo assistente, che sovrascrivono il default. Se continua a fallire, confronta Model name con l'ortografia dell'elenco di /v1/models.