Chạy các agent của Warp bằng endpoint inference của riêng bạn.
Updated 2026-07-29
Warp hỗ trợ custom inference endpoint chính xác cho việc này: bất kỳ endpoint nào triển khai OpenAI Chat Completions API, gateway và model router được nêu rõ trong tài liệu. Trỏ nó vào https://api.apisrouter.com/v1 với một key, và các model định tuyến qua endpoint xuất hiện trong picker model của Warp mà không tiêu tốn Warp AI credit.
Câu trả lời nhanh: cài đặt, URL, key, model id.
Mở Settings của Warp và tìm "inference endpoint" để nhảy tới phần cấu hình. Nhập endpoint URL, https://api.apisrouter.com/v1, key APIsRouter của bạn làm credential, và model id hoặc các id bạn muốn định tuyến qua nó, ví dụ claude-sonnet-4-6 và gpt-5.6-sol. Sau khi lưu, các model đó xuất hiện trong picker model của Warp cạnh các lựa chọn tích hợp sẵn. Hành vi thanh toán mới là điểm mấu chốt: khi bạn chọn tường minh một model định tuyến qua endpoint từ picker, Warp định tuyến request qua endpoint của bạn thay vì tiêu tốn Warp AI credit, và chi phí rơi vào số dư gateway của bạn nơi bạn thấy được theo từng request. Tài liệu Warp mô tả luồng này như phản chiếu cấu hình Bring Your Own API Key của họ, nên nó sẽ quen thuộc nếu bạn từng cấu hình BYOK trước đây.
Endpoint URL: https://api.apisrouter.com/v1
Credential: sk-YOUR-APISROUTER-KEY
Model id(s): claude-sonnet-4-6
gpt-5.6-sol
then: select the endpoint-routed model
in Warp's model pickerCách Warp dùng endpoint.
Warp là terminal có tính agent: agent của nó soạn lệnh, giải thích lỗi, chạy các việc nhiều bước, và chỉnh sửa code ngay trong cửa sổ bạn đang làm việc. Tài liệu chính thức của Warp nói rõ yêu cầu: endpoint phải triển khai OpenAI Chat Completions API tại /v1/chat/completions, và bài đăng ra mắt của họ nêu tên model router và gateway hosted như các đích ngắm dự kiến, nên một gateway đa vendor là công dân hạng nhất ở đây, không phải một mẹo lách luật. Có hai ràng buộc có tài liệu đáng biết trước khi bắt đầu. Thứ nhất, endpoint phải truy cập được công khai: localhost, 127.0.0.1, và các URL mạng riêng bị từ chối ngay lúc cấu hình, điều này loại trừ việc trỏ Warp trực tiếp vào một inference server local nhưng không liên quan gì tới một gateway hosted. Thứ hai, chế độ chọn model Auto của Warp luôn tiêu tốn Warp credit ngay cả khi đã cấu hình endpoint tùy chỉnh; chỉ khi bạn chọn tường minh một model định tuyến qua endpoint từ picker thì request mới đi qua endpoint của bạn. Nếu chi tiêu của bạn không chuyển sang console gateway, hãy kiểm tra model nào phiên đó thực sự đã dùng. Tính khả dụng phụ thuộc gói: custom inference endpoint được cung cấp trên gói Free và các gói trả phí đủ điều kiện cho cá nhân và tổ chức từ mười người trở xuống, còn tổ chức lớn hơn cần tier Business hoặc Enterprise của Warp. Điều này lấy thẳng từ tài liệu Warp và có thể thay đổi phía họ.
Chọn model cho việc agent trong terminal.
Agent terminal tính phí khác chat: mỗi lần giải thích lệnh, thử lại, và tóm tắt output là một request mang theo context phiên. Vì usage định tuyến qua endpoint hiện trong console gateway theo từng request và từng model, một tuần dùng thực cho bạn một con số trung thực cho mỗi model ứng viên, tốt hơn đoán mò từ một trang giá, kể cả trang này.
- claude-sonnet-4-6 làm công cụ hàng ngày: sinh lệnh đáng tin cậy, tool use mạnh, phán đoán tốt trên các việc nhiều bước.
- gpt-5.6-sol cho việc nhanh phạm vi rõ ràng, nơi độ trễ mỗi lượt định hình cảm giác của terminal.
- claude-opus-4-7 cho các phiên khó: debug xuyên nhiều service, chuỗi điều tra dài, thay đổi hạ tầng cần được lý luận kỹ.
- gpt-5.5 là đối thủ tổng quát frontier để A/B với Claude trên chính workflow shell của bạn.
- deepseek-v4-pro là lựa chọn giá trị cho việc agent thường xuyên khối lượng lớn, nơi mức giá quan trọng hơn độ tinh xảo frontier.
Trả theo mức sử dụng · thấp hơn giá chính thức
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Mô hình | Giá chính thức | Giá của chúng tôi |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Opus 4.7 | $5.00 / $25.00 per M | $4.00 / $20.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| GPT-5.6 Sol | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Các lỗi thường gặp riêng của Warp.
Như thường lệ, hãy chứng minh phía gateway bằng hai lệnh curl, danh sách model và một chat completion, trước khi debug phía Warp. Nếu curl qua còn Warp thất bại, vấn đề nằm ở form cấu hình endpoint hoặc lựa chọn trong model picker, không ở đâu khác.
- Endpoint bị từ chối lúc lưu: Warp cố tình từ chối URL localhost và mạng riêng. Endpoint phải truy cập được công khai; một URL gateway hosted vượt qua kiểm tra này.
- Chi tiêu vẫn rơi vào Warp credit: phiên đang ở chế độ chọn model Auto, vốn luôn dùng Warp credit. Hãy chọn tường minh model định tuyến qua endpoint trong picker.
- Không tìm thấy model: id bạn gõ vào cấu hình endpoint không khớp catalog gateway. Copy id từ danh sách /v1/models từng byte một.
- Lỗi 401 từ endpoint: field credential đang giữ một key cũ hoặc bị cắt cụt. Curl danh sách model với cùng key để xác nhận bên ngoài Warp.
- Tính năng hoàn toàn không hiện ra: kiểm tra gói của bạn. Custom endpoint khả dụng cho cá nhân và tổ chức nhỏ trên gói Free và các gói trả phí đủ điều kiện; tổ chức lớn hơn cần Business hoặc Enterprise theo tài liệu Warp.
Ai định tuyến Warp qua một gateway.
- Lập trình viên muốn Claude phía sau agent của Warp trên một số dư trả trước, bắt đầu miễn phí và không cần thẻ.
- Người dùng agent nặng khi mức tiêu thụ Warp credit vượt gói, chuyển các lựa chọn model tường minh sang endpoint đo lường riêng của họ.
- Người mua sắm model so sánh các model coding trên workflow terminal thực, nơi mỗi ứng viên chỉ là thêm một id vào cấu hình endpoint.
- Đội nhóm mười người trở xuống chuẩn hóa trên một key gateway để terminal, editor, và agent CI dùng chung một nhật ký usage.
- Người đã chạy các công cụ khác qua một gateway và muốn Warp trên cùng key và console.
Xác minh endpoint và xác nhận định tuyến.
Chạy hai kiểm tra tiêu chuẩn với đúng key và id bạn đã cấu hình trong Warp. Cả hai qua nghĩa là gateway đã sẵn sàng và bất kỳ vấn đề còn lại nằm ở cài đặt Warp hoặc lựa chọn model. Sau đó chạy một việc agent thực trong Warp với model endpoint được chọn tường minh, và xác nhận request xuất hiện trong console APIsRouter với model và số token đúng như kỳ vọng. Chỉ một xác nhận đó bắt được ngay lỗi chế độ Auto, và từ đó console là ghi chép theo từng request về những gì terminal thực sự tiêu tốn.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Câu hỏi thường gặp
Làm sao để cấu hình custom inference endpoint trong Warp?
Mở Settings của Warp, tìm "inference endpoint", và nhập endpoint URL, credential của bạn, và các model id cần định tuyến qua nó. Với APIsRouter, URL là https://api.apisrouter.com/v1 và các model xuất hiện trong picker của Warp sau khi lưu.
Custom endpoint của Warp có hoạt động với gateway và model router không?
Có, nói rõ trong tài liệu. Tài liệu và bài đăng ra mắt của Warp nêu tên gateway và router tương thích OpenAI như các đích được hỗ trợ; yêu cầu là endpoint triển khai OpenAI Chat Completions API và truy cập được công khai.
Request định tuyến qua endpoint có dùng Warp AI credit của tôi không?
Không. Khi bạn chọn tường minh một model định tuyến qua endpoint, Warp định tuyến request qua endpoint của bạn và provider của bạn tính phí, không phải Warp credit. Ngoại lệ là chế độ chọn model Auto, luôn tiêu tốn Warp credit ngay cả khi đã cấu hình endpoint.
Vì sao Warp từ chối URL endpoint của tôi?
Warp từ chối localhost, 127.0.0.1, và các URL mạng riêng hoặc local khác ngay lúc cấu hình; endpoint phải truy cập được công khai. Một URL gateway hosted như https://api.apisrouter.com/v1 vượt qua kiểm tra này.
Gói Warp nào bao gồm custom inference endpoint?
Theo tài liệu Warp giữa 2026: gói Free và các gói trả phí đủ điều kiện cho cá nhân và tổ chức từ mười người trở xuống; tổ chức lớn hơn cần Warp Business hoặc Enterprise. Kiểm tra tài liệu hiện tại của Warp, vì việc gating theo gói là do họ quyết định thay đổi.
Tôi có thể chạy model Claude trong Warp theo cách này không?
Có. Thêm claude-sonnet-4-6 hoặc claude-opus-4-7 làm model id trong cấu hình endpoint và chọn chúng trong picker; gateway phục vụ chúng qua bề mặt tương thích OpenAI mà Warp mong đợi, trên cùng key với id GPT và DeepSeek.