자체 추론 엔드포인트로 Warp의 에이전트 구동하기.

Updated 2026-07-29

Warp는 정확히 이런 용도로 커스텀 추론 엔드포인트를 지원합니다: OpenAI Chat Completions API를 구현하는 어떤 엔드포인트든 가능하며, 게이트웨이와 모델 라우터도 명시적으로 포함됩니다. 키 하나로 https://api.apisrouter.com/v1로 연결하면, 엔드포인트로 라우팅된 모델이 Warp AI 크레딧을 소모하지 않고 Warp의 모델 피커에 나타납니다.

빠른 답: 설정, URL, 키, 모델 id.

Warp의 Settings를 열고 "inference endpoint"를 검색해 설정 화면으로 이동하세요. 엔드포인트 URL로 https://api.apisrouter.com/v1을, 자격 증명으로 여러분의 APIsRouter 키를, 그리고 그것을 통해 라우팅하고 싶은 모델 id(예: claude-sonnet-4-6과 gpt-5.6-sol)를 입력하세요. 저장하면, 그 모델들이 내장 옵션과 나란히 Warp의 모델 피커에 나타납니다. 핵심은 청구 방식입니다: 피커에서 엔드포인트로 라우팅된 모델을 명시적으로 선택하면, Warp는 자체 AI 크레딧을 소모하는 대신 요청을 여러분의 엔드포인트로 라우팅하며, 비용은 요청별로 확인할 수 있는 여러분의 게이트웨이 잔액에서 나갑니다. Warp 문서는 이 흐름을 자사의 Bring Your Own API Key 설정을 그대로 반영한 것이라고 설명하므로, BYOK를 설정해 본 적이 있다면 익숙하게 느껴질 것입니다.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Warp가 엔드포인트를 사용하는 방법.

Warp는 에이전틱 터미널입니다: 에이전트가 명령어 초안을 작성하고, 실패를 설명하고, 여러 단계의 작업을 실행하고, 여러분이 작업하는 바로 그 창에서 코드를 수정합니다. Warp 자체 문서는 요구사항을 명확히 밝힙니다: 엔드포인트는 /v1/chat/completions에서 OpenAI Chat Completions API를 구현해야 하며, 출시 게시물에서는 모델 라우터와 호스팅된 게이트웨이를 의도된 대상으로 명시하고 있습니다. 그래서 멀티 벤더 게이트웨이는 여기서 편법이 아니라 정식으로 지원되는 대상입니다. 시작하기 전에 알아둘 만한 문서화된 제약 두 가지가 있습니다. 첫째, 엔드포인트는 공개적으로 도달 가능해야 합니다: localhost, 127.0.0.1, 사설 네트워크 URL은 설정 시점에 거부되며, 이는 Warp를 로컬 추론 서버에 직접 연결하는 것을 막지만 호스팅된 게이트웨이에는 무관합니다. 둘째, Warp의 Auto 모델 선택은 커스텀 엔드포인트가 설정되어 있어도 항상 Warp 크레딧을 소모합니다. 피커에서 엔드포인트로 라우팅된 모델을 명시적으로 선택할 때만 여러분의 엔드포인트를 통해 라우팅됩니다. 지출이 게이트웨이 콘솔로 이동하지 않는다면, 세션이 실제로 어떤 모델을 썼는지 확인하세요. 제공 여부는 요금제에 따라 다릅니다: 커스텀 추론 엔드포인트는 개인과 10인 이하 조직의 경우 Free 및 해당되는 유료 요금제에서 제공되며, 더 큰 조직은 Warp의 Business나 Enterprise 티어가 필요합니다. 이는 Warp 문서에서 직접 가져온 내용이며 Warp 쪽 사정으로 바뀔 수 있습니다.

터미널 에이전트 작업을 위한 모델 선택.

터미널 에이전트는 채팅과 다르게 청구됩니다: 모든 명령어 설명, 재시도, 출력 요약이 세션 컨텍스트를 담은 요청입니다. 엔드포인트로 라우팅된 사용량은 요청별·모델별로 게이트웨이 콘솔에 기록되므로, 일주일간의 실제 사용이 각 후보 모델에 대한 정직한 숫자를 알려주며, 이는 이 페이지를 포함한 어떤 가격 페이지에서 추측하는 것보다 낫습니다.

  • 일상용으로는 claude-sonnet-4-6: 믿을 만한 명령어 생성, 강력한 툴 사용, 여러 단계 작업에서의 좋은 판단력.
  • gpt-5.6-sol은 턴당 지연 시간이 터미널의 체감을 좌우하는, 범위가 좁고 빠른 작업에 적합합니다.
  • claude-opus-4-7은 어려운 세션에 적합합니다: 여러 서비스에 걸친 디버깅, 긴 조사 체인, 신중하게 추론해야 할 인프라 변경.
  • gpt-5.5는 여러분의 실제 셸 워크플로우에서 Claude와 A/B 테스트해볼 만한 프론티어 제너럴리스트입니다.
  • deepseek-v4-pro는 완성도보다 요금이 더 중요한 대량의 반복적 에이전트 사용에 적합한 가성비 선택입니다.

사용한 만큼 지불 · 공식 요금보다 저렴

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

모델공식 요금저희 요금
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Warp 특유의 실패 패턴.

언제나처럼, Warp 쪽을 디버깅하기 전에 curl 명령 두 개 — 모델 목록과 chat completion 하나 — 로 게이트웨이 쪽을 먼저 검증하세요. curl은 성공하는데 Warp는 실패한다면, 문제는 엔드포인트 입력 폼이나 모델 피커 선택에 있을 뿐, 다른 곳에는 없습니다.

  • 저장 시점에 엔드포인트 거부: Warp는 설계상 localhost와 사설 네트워크 URL을 거부합니다. 엔드포인트는 공개적으로 도달 가능해야 하며, 호스팅된 게이트웨이 URL은 이 검사를 통과합니다.
  • 지출이 여전히 Warp 크레딧에서 나감: 세션이 항상 Warp 크레딧을 쓰는 Auto 모델 선택 상태입니다. 피커에서 엔드포인트로 라우팅된 모델을 명시적으로 선택하세요.
  • 모델을 찾을 수 없음: 엔드포인트 설정에 입력한 id가 게이트웨이 카탈로그와 일치하지 않습니다. /v1/models 목록에서 id를 한 글자도 틀리지 않게 복사하세요.
  • 엔드포인트에서 401: 자격 증명 필드에 오래되었거나 잘린 키가 들어 있습니다. 같은 키로 Warp 밖에서 모델 목록을 curl로 확인하세요.
  • 기능 자체가 보이지 않음: 요금제를 확인하세요. 커스텀 엔드포인트는 개인과 소규모 조직의 경우 Free 및 해당되는 유료 요금제에서 제공되며, Warp 문서에 따르면 더 큰 조직은 Business나 Enterprise가 필요합니다.

어떤 사람들이 게이트웨이를 통해 Warp를 쓰는가.

  • 카드 없이 무료로 시작해, 선불 잔액으로 Warp의 에이전트 뒤에 Claude를 두고 싶은 개발자.
  • Warp 크레딧 소모량이 요금제를 넘어선 헤비 에이전트 사용자 — 명시적 모델 선택을 자신의 종량제 엔드포인트로 옮기려는 경우.
  • 실제 터미널 워크플로우에서 코딩 모델을 비교하는 모델 쇼퍼 — 각 후보는 엔드포인트 설정에 id 하나를 더 추가하면 됩니다.
  • 터미널, 에디터, CI 에이전트가 하나의 사용량 로그를 공유하도록 게이트웨이 키 하나로 표준화하는 10인 이하의 팀.
  • 이미 다른 도구를 게이트웨이로 실행하고 있으며 Warp도 같은 키와 콘솔로 관리하고 싶은 사람들.

엔드포인트 검증 및 라우팅 확인.

Warp에 설정한 정확한 키와 id로 표준 검사 두 가지를 실행하세요. 둘 다 성공하면 게이트웨이는 준비된 것이며, 남은 문제는 Warp의 설정이나 모델 선택에 있습니다. 그다음 엔드포인트 모델을 명시적으로 선택한 상태로 Warp에서 실제 에이전트 작업을 하나 실행하고, 요청이 예상한 모델과 토큰 수로 APIsRouter 콘솔에 나타나는지 확인하세요. 이 확인 하나로 Auto 모드 함정을 즉시 잡아낼 수 있으며, 그 이후로는 콘솔이 터미널이 실제로 얼마나 쓰는지 보여주는 요청별 기록이 됩니다.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

자주 묻는 질문

Warp에서 커스텀 추론 엔드포인트는 어떻게 설정하나요?

Warp의 Settings를 열고 "inference endpoint"를 검색한 다음, 엔드포인트 URL, 자격 증명, 그것을 통해 라우팅할 모델 id를 입력하세요. APIsRouter의 경우 URL은 https://api.apisrouter.com/v1이며, 저장하면 모델이 Warp의 피커에 나타납니다.

Warp의 커스텀 엔드포인트가 게이트웨이와 모델 라우터와도 작동하나요?

네, 명시적으로 지원합니다. Warp의 문서와 출시 게시물은 OpenAI 호환 게이트웨이와 라우터를 지원 대상으로 명시합니다. 요구사항은 엔드포인트가 OpenAI Chat Completions API를 구현하고 공개적으로 도달 가능해야 한다는 것입니다.

엔드포인트로 라우팅된 요청이 제 Warp AI 크레딧을 쓰나요?

아니요. 엔드포인트로 라우팅된 모델을 명시적으로 선택하면, Warp는 요청을 여러분의 엔드포인트로 라우팅하고 Warp 크레딧이 아니라 여러분의 프로바이더가 비용을 청구합니다. 예외는 Auto 모델 선택으로, 엔드포인트가 설정되어 있어도 항상 Warp 크레딧을 소모합니다.

Warp가 제 엔드포인트 URL을 거부하는 이유는?

Warp는 설정 시점에 localhost, 127.0.0.1, 그 밖의 사설·로컬 네트워크 URL을 거부합니다. 엔드포인트는 공개적으로 도달 가능해야 합니다. https://api.apisrouter.com/v1 같은 호스팅된 게이트웨이 URL은 이 검사를 통과합니다.

어떤 Warp 요금제에 커스텀 추론 엔드포인트가 포함되나요?

2026년 중반 기준 Warp 문서에 따르면: 개인 사용자와 10인 이하 조직은 Free 및 해당되는 유료 요금제, 더 큰 조직은 Warp Business나 Enterprise가 필요합니다. 요금제 제한은 Warp 쪽에서 바꿀 수 있으므로 Warp의 최신 문서를 확인하세요.

이 방식으로 Warp에서 Claude 모델을 실행할 수 있나요?

네. 엔드포인트 설정에 claude-sonnet-4-6이나 claude-opus-4-7을 모델 id로 추가하고 피커에서 선택하세요. 게이트웨이는 Warp가 기대하는 OpenAI 호환 방식으로 이들을 제공하며, GPT와 DeepSeek id와 같은 키를 사용합니다.