Jalankan chat RAGFlow di base URL OpenAI-API-Compatible.

Updated 2026-07-29

RAGFlow menyediakan provider OpenAI-API-Compatible tepat untuk ini: tambahkan setiap model dengan id-nya, https://api.apisrouter.com/v1 sebagai base url, dan satu key. Id Claude, GPT, DeepSeek, GLM, Kimi, dan Qwen lalu melayani dataset, chat, dan agent Anda dari satu endpoint.

Jawaban singkat: tambahkan model di halaman Model providers.

Login ke RAGFlow, klik logo Anda di kanan atas, dan buka Model providers. Di bawah Models to be added, cari card OpenAI-API-Compatible dan klik Add the model. Di dialog Add LLM, set Model type ke chat, masukkan id katalog persis sebagai Model name, taruh https://api.apisrouter.com/v1 di Base url, tempel key Anda di API-Key, dan set Max tokens ke ukuran context asli model. Klik OK. Lalu buat itu melakukan sesuatu: buka Set default models di halaman yang sama dan pilih model baru Anda sebagai default LLM. Chat assistant, question answering dataset, dan node agent semuanya me-resolve ke default itu kecuali mereka meng-override-nya. Satu sisi tajam yang perlu diketahui sebelum run pertama: field Max tokens RAGFlow default ke 512 dan tooltip-nya sendiri memperingatkan bahwa nilai yang tidak valid menyebabkan error, jadi memasukkan window terdokumentasi model adalah bagian dari setup, bukan optimasi.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Bagaimana RAGFlow mengikat model ke pekerjaan.

RAGFlow (infiniflow di GitHub, sekitar 85K bintang) adalah mesin RAG dokumen-dalam: parsing PDF dan tabel yang sadar-layout, chunking dengan sitasi yang membumi, dataset, chat assistant, dan workflow agent di atasnya. Bagian berbeda dari pipeline itu terikat ke slot model yang berbeda, dan ikatannya eksplisit. Chat model menghasilkan jawaban. Embedding model mem-vektorisasi chunk untuk retrieval. Rerank model mengurutkan ulang kandidat, dan img2txt model mendeskripsikan gambar saat parsing. Provider OpenAI-API-Compatible bisa mendaftarkan model untuk tipe-tipe ini secara individual, setiap dialog Add LLM membuat satu ikatan tipe, id, base url, dan key. Setiap chat model terdaftar berbicara chat completions standar ke base url dengan Model name sebagai string wire, jadi id apa pun yang dilayani gateway valid, terlepas dari vendornya. Pemisahan itu penting secara operasional: mengganti model jawaban Anda dari gpt-5.5 ke claude-sonnet-4-6 aman kapan saja, tapi embedding model dilas ke vector terindeks Anda. RAGFlow menegakkan ini dengan pengecekan kompatibilitas saat mengganti embedding model pada dataset yang sudah punya chunk, dan aturan praktisnya lebih sederhana: pilih setup embedding sekali, dan perlakukan chat model sebagai lapisan yang bisa Anda setel bebas.

Satu key untuk model Mandarin dan Barat bersama.

Deployment RAGFlow condong dwibahasa: tim asal China yang memproses basis dokumen berbahasa campuran, dan tim internasional yang secara spesifik menginginkan model Mandarin untuk dokumen Mandarin. Dilayani langsung, campuran itu menyakitkan, karena DeepSeek, Zhipu, Moonshot, dan Alibaba masing-masing menagih terpisah dan sebagian canggung dibayar dari luar negeri, sementara Anthropic dan OpenAI canggung dari arah sebaliknya. Melalui satu base url OpenAI-API-Compatible, campurannya hanya lebih banyak dialog Add LLM: deepseek-v4-pro dan glm-5.2 untuk corpus Mandarin-berat, qwen3.7-max dan kimi-k2.6 sebagai alternatif regional yang kuat, claude-sonnet-4-6 di tempat kehalusan jawaban paling penting. Base url sama, key sama, id langsung dari katalog. Untuk tim di Asia rute yang sama berfungsi terbalik: id Claude dan GPT menjadi terjangkau dengan saldo prabayar tanpa kartu Barat, yang bagi banyak toko RAGFlow adalah bedanya antara mengevaluasi model dan sekadar membaca soal itu. Ada juga jalur boot-time yang layak diketahui: service_conf.yaml.template menerima blok user_default_llm (factory, api_key, base_url) sehingga instalasi baru muncul sudah terpasang. Dokumentasi RAGFlow eksplisit bahwa setelah login, konfigurasi hanya terjadi di halaman Model providers, jadi perlakukan YAML-nya sebagai provisioning first-boot, bukan config live.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Memilih model untuk pipeline dokumen.

Kualitas retrieval menetapkan plafonnya dan model jawaban memutuskan seberapa dekat Anda mendapatkannya, jadi A/B model jawaban pada corpus nyata Anda: dataset sama, pertanyaan sama, dua asisten yang di-pin ke dua id, dan pengeluaran per-model di konsol APIsRouter di sebelah penilaian Anda sendiri atas jawabannya.

  • Jawaban membumi atas chunk yang diambil adalah kerja input-heavy di mana model mid-tier bersinar: deepseek-v4-pro dan glm-5.2 membawa jawaban yang mengikuti sitasi dengan baik pada corpus dwibahasa.
  • qwen3.7-max dan kimi-k2.6 adalah kelas berat regional yang layak diuji saat jawaban harus terbaca natif dalam bahasa Mandarin; perbedaan kualitas antar model Mandarin lebih terlihat di generasi dibanding retrieval.
  • claude-sonnet-4-6 pantas mendapat slot jawaban di tempat kualitas sintesis adalah produknya, ringkasan eksekutif, analisis kontrak, apa pun yang diteruskan manusia tanpa diedit.
  • Workflow agent yang memanggil tool butuh function calling yang bisa diandalkan; uji jalur agent di claude-sonnet-4-6 dulu, lalu lihat id regional mana yang menandinginya di flow Anda.
  • Max tokens bersifat per-registrasi, jadi daftarkan id yang sama dua kali dengan batas berbeda jika satu asisten butuh jawaban panjang dan yang lain butuh yang ketat.

Bayar sesuai pemakaian · di bawah harga resmi

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModelHarga ResmiHarga Kami
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Mode kegagalan spesifik RAGFlow.

Default Max tokens adalah yang klasik. Dibiarkan di 512, jawaban panjang terpotong atau error dengan cara yang terlihat seperti masalah model; set ukuran context terdokumentasi saat mendaftarkan, seperti yang diperingatkan tooltip-nya sendiri. Model terdaftar yang error langsung biasanya adalah ejaan Model name (harus cocok persis dengan listing /v1/models) atau Base url yang kehilangan suffix /v1-nya, karena RAGFlow menambahkan path route ke apa yang Anda masukkan. Tidak ada yang terjadi setelah registrasi adalah masalah default: mendaftarkan model tidak memilihnya. Cek Set default models, dan cek pengaturan model per-asisten, yang meng-override default workspace. Kebingungan embedding melengkapi daftarnya. Jika Anda mengikat id embedding lewat provider compatible, konfirmasi endpoint benar-benar melayaninya sebelum mengindeks; dan setelah dataset punya chunk, mengubah embedding model-nya digerbangi pengecekan kesamaan dan mungkin butuh re-indexing dari nol. Perubahan chat model tidak membawa biaya seperti itu, itulah persis sebabnya lapisan chat adalah tempat Anda seharusnya bereksperimen.

Siapa yang merutekan RAGFlow melalui gateway.

  • Tim dokumen dwibahasa yang mencampur DeepSeek, GLM, Qwen, dan Kimi dengan id Claude dan GPT di balik satu base url dan satu key.
  • Tim di Asia yang menginginkan jawaban berkualitas Claude dengan saldo prabayar tanpa kartu Barat, dan tim Barat yang menginginkan model Mandarin tanpa billing regional.
  • Self-hoster yang menjalankan RAGFlow untuk knowledge base internal yang menginginkan seluruh pengeluaran cloud deployment di satu log penggunaan.
  • Builder yang membandingkan model jawaban pada corpus tetap, di mana setiap kandidat adalah satu dialog Add LLM alih-alih akun vendor.
  • Tim ops yang menyediakan instalasi baru dari service_conf.yaml.template dengan endpoint terpasang sejak first boot.

Verifikasi endpoint dan debug chat pertama.

Curl listing model dulu; field Model name adalah teks bebas, dan menyalin id dari listing menghilangkan kegagalan paling umum sebelum terjadi. Lalu jalankan satu chat completion terhadap id yang Anda rencanakan daftarkan. Di dalam RAGFlow, daftarkan modelnya, set sebagai default LLM, dan uji di chat assistant biasa sebelum melibatkan dataset. Error autentikasi menunjuk ke API-Key; not-found ke Model name; error koneksi ke Base url atau egress container, karena server RAGFlow-lah, bukan browser Anda, yang harus mencapai endpoint. Jawaban panjang yang terpotong atau gagal menunjuk kembali ke Max tokens. Setelah chat mengalir, konsol APIsRouter menunjukkan model per request, hitungan token, dan pengeluaran. Traffic RAG didominasi input, dan log penggunaan adalah tempat Anda melihat berapa biaya sebenarnya untuk meng-query corpus Anda, per model, per hari, satu halaman untuk id Mandarin dan Barat bersama.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Pertanyaan umum

Bagaimana cara menambahkan model OpenAI-API-Compatible di RAGFlow?

Klik avatar Anda, buka Model providers, cari OpenAI-API-Compatible di bawah Models to be added, dan klik Add the model. Isi Model type (chat), Model name (id katalog persis), Base url https://api.apisrouter.com/v1, API-Key, dan nilai Max tokens yang sesungguhan, lalu konfirmasi dengan OK.

Mengapa jawaban saya terpotong atau error setelah menambahkan model?

Hampir selalu Max tokens: RAGFlow men-default-kannya ke 512 dan tooltip-nya memperingatkan bahwa nilai yang salah menyebabkan error. Edit registrasi modelnya dan masukkan ukuran context terdokumentasi model.

Bisakah RAGFlow mencampur model Mandarin dan Barat melalui satu provider?

Ya. Setiap registrasi mengirim string Model name-nya ke base url yang sama, jadi deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6, dan claude-sonnet-4-6 semuanya bisa didaftarkan berdampingan dan dipilih per asisten, ditagih melalui satu key.

Apakah chat dan embedding model terikat terpisah?

Ya. Setiap dialog Add LLM mendaftarkan satu model dari satu tipe, dan Set default models menetapkan slot default LLM dan embedding secara independen. Chat model bisa ditukar bebas; embedding model terikat ke vector terindeks dan digerbangi pengecekan kompatibilitas setelah dataset punya chunk.

Bisakah saya mengonfigurasi endpoint sebelum first boot?

Ya, lewat blok user_default_llm di docker/service_conf.yaml.template: factory OpenAI-API-Compatible, api_key Anda, dan base_url. RAGFlow membacanya saat startup pertama; setelah login, konfigurasi berpindah hanya ke halaman Model providers.

Mengapa model terdaftar saya tidak terpakai?

Registrasi dan seleksi adalah langkah terpisah. Set model sebagai default LLM di bawah Set default models, dan cek pengaturan model per-asisten, yang meng-override default-nya. Jika masih gagal, bandingkan Model name terhadap ejaan listing /v1/models.