Питайте агентов Warp от собственного inference-эндпоинта.

Updated 2026-07-29

Warp поддерживает кастомные inference-эндпоинты именно для этого: любой эндпоинт, реализующий OpenAI Chat Completions API, включая шлюзы и роутеры моделей. Укажите https://api.apisrouter.com/v1 с одним ключом — и модели, маршрутизируемые через эндпоинт, появятся в пикере моделей Warp, не расходуя кредиты Warp AI.

Короткий ответ: настройки, URL, ключ, ID моделей.

Откройте настройки Warp и найдите «inference endpoint», чтобы перейти к конфигурации. Введите URL эндпоинта, https://api.apisrouter.com/v1, свой ключ APIsRouter как учётные данные и ID модели или моделей, которые хотите через него направлять, например claude-sonnet-4-6 и gpt-5.6-sol. После сохранения эти модели появятся в пикере моделей Warp рядом со встроенными опциями. Поведение биллинга — вся суть: когда вы явно выбираете модель, маршрутизируемую через эндпоинт, из пикера, Warp направляет запрос через ваш эндпоинт вместо того, чтобы расходовать кредиты Warp AI, и стоимость ложится на баланс вашего шлюза, где вы можете видеть её по каждому запросу. Документация Warp описывает этот поток как зеркалирующий их настройку Bring Your Own API Key, так что если вы уже настраивали BYOK, это покажется знакомым.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Как Warp использует эндпоинт.

Warp — агентный терминал: его агенты составляют команды, объясняют сбои, запускают многошаговые задачи и редактируют код прямо из того окна, где вы работаете. Собственная документация Warp формулирует требование прямо: эндпоинт должен реализовывать OpenAI Chat Completions API по адресу /v1/chat/completions, а их пост о запуске называет роутеры моделей и хостед-шлюзы предполагаемыми целями, так что мультивендорный шлюз здесь — полноправный гражданин, а не хитрость. Два задокументированных ограничения стоит знать до начала. Во-первых, эндпоинт должен быть публично доступен: localhost, 127.0.0.1 и URL частных сетей отклоняются на этапе настройки, что исключает указание Warp прямо на локальный inference-сервер, но не имеет значения для хостед-шлюза. Во-вторых, автовыбор модели Warp (Auto) всегда расходует кредиты Warp даже при настроенном кастомном эндпоинте; только явный выбор модели, маршрутизируемой через эндпоинт, в пикере направляет запрос через ваш эндпоинт. Если ваши расходы не переходят в консоль шлюза, проверьте, какую модель реально использовала сессия. Доступность зависит от плана: кастомные inference-эндпоинты предлагаются на Free и подходящих платных планах для отдельных пользователей и организаций из десяти или менее человек, а более крупным организациям нужны тиры Warp Business или Enterprise. Это прямо из документации Warp и может измениться с их стороны.

Выбор моделей для работы агента в терминале.

Терминальные агенты тарифицируются иначе, чем чат: каждое объяснение команды, повтор и суммаризация вывода — это запрос, несущий контекст сессии. Поскольку использование через эндпоинт попадает в консоль шлюза по запросу и по модели, неделя реального использования даёт честное число на каждую модель-кандидата, что лучше, чем гадать по странице цен, включая эту.

  • claude-sonnet-4-6 как ежедневная модель: надёжная генерация команд, сильное использование инструментов, хорошее суждение на многошаговых задачах.
  • gpt-5.6-sol для быстрой точечной работы, где задержка на ход формирует ощущение от терминала.
  • claude-opus-4-7 для сложных сессий: отладка между сервисами, длинные цепочки расследования, изменения инфраструктуры, которые хочется продумать до конца.
  • gpt-5.5 как флагманский генералист для A/B-сравнения с Claude на ваших собственных сценариях работы в shell.
  • deepseek-v4-pro как бюджетный выбор для высокообъёмного рутинного использования агента, где важнее тариф, чем флагманский лоск.

Оплата по факту · дешевле официальных цен

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

МодельОфициальная ценаНаша цена
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Сбои, специфичные именно для Warp.

Как всегда, подтвердите половину со стороны шлюза двумя командами curl — листинг моделей и один chat completion — прежде чем отлаживать сторону Warp. Если curl проходит, а Warp падает, проблема в форме эндпоинта или в выборе модели в пикере, и больше нигде.

  • Эндпоинт отклонён при сохранении: Warp намеренно отказывает localhost и URL частных сетей. Эндпоинт должен быть публично доступен; URL хостед-шлюза проходит эту проверку.
  • Расходы всё ещё бьют по кредитам Warp: сессия на автовыборе модели (Auto), который всегда использует кредиты Warp. Явно выберите модель, маршрутизируемую через эндпоинт, в пикере.
  • Модель не найдена: ID, введённый в конфигурацию эндпоинта, не совпадает с каталогом шлюза. Копируйте ID из листинга /v1/models побайтово.
  • 401 от эндпоинта: поле учётных данных хранит устаревший или обрезанный ключ. Выполните curl к листингу моделей с тем же ключом, чтобы подтвердить снаружи Warp.
  • Функция вообще не видна: проверьте свой план. Кастомные эндпоинты доступны для отдельных пользователей и небольших организаций на Free и подходящих платных планах; более крупным организациям нужны Business или Enterprise согласно документации Warp.

Кто направляет Warp через шлюз.

  • Разработчики, желающие видеть Claude за агентами Warp на предоплаченном балансе, с бесплатным стартом и без карты.
  • Активные пользователи агента, чьё потребление кредитов Warp переросло их план, переносящие явный выбор модели на собственный тарифицируемый эндпоинт.
  • Покупатели моделей, сравнивающие модели для кода на реальных сценариях работы в терминале, где каждый кандидат — это ещё один ID в конфигурации эндпоинта.
  • Команды из десяти или менее человек, стандартизирующие один ключ шлюза, чтобы терминал, редактор и CI-агенты делили один лог использования.
  • Люди, уже запускающие другие инструменты через шлюз и желающие видеть Warp на том же ключе и в той же консоли.

Проверьте эндпоинт и подтвердите маршрутизацию.

Выполните две стандартные проверки с точным ключом и ID, которые вы настроили в Warp. Если обе проходят, шлюз готов, и любая оставшаяся проблема — в настройках Warp или выборе модели. Затем запустите одну реальную задачу агента в Warp с явно выбранной моделью эндпоинта и подтвердите, что запрос появился в консоли APIsRouter с ожидаемой моделью и счётчиками токенов. Одно это подтверждение сразу ловит подвох с режимом Auto, а дальше консоль становится вашей записью по каждому запросу о том, что реально тратит терминал.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Частые вопросы

Как настроить кастомный inference-эндпоинт в Warp?

Откройте настройки Warp, найдите «inference endpoint» и введите URL эндпоинта, свои учётные данные и ID моделей для маршрутизации через него. Для APIsRouter URL — это https://api.apisrouter.com/v1, и модели появятся в пикере Warp после сохранения.

Работает ли кастомный эндпоинт Warp со шлюзами и роутерами моделей?

Да, явно. Документация Warp и пост о запуске называют OpenAI-совместимые шлюзы и роутеры поддерживаемыми целями; требование — чтобы эндпоинт реализовывал OpenAI Chat Completions API и был публично доступен.

Используют ли запросы через эндпоинт мои кредиты Warp AI?

Нет. Когда вы явно выбираете модель, маршрутизируемую через эндпоинт, Warp направляет запрос через ваш эндпоинт, и его тарифицирует ваш провайдер, а не кредиты Warp. Исключение — автовыбор модели (Auto), который всегда расходует кредиты Warp даже при настроенном эндпоинте.

Почему Warp отклоняет URL моего эндпоинта?

Warp отказывает localhost, 127.0.0.1 и другим URL частных или локальных сетей на этапе настройки; эндпоинт должен быть публично доступен. URL хостед-шлюза вроде https://api.apisrouter.com/v1 проходит эту проверку.

На каких планах Warp доступны кастомные inference-эндпоинты?

Согласно документации Warp по состоянию на середину 2026 года: Free и подходящие платные планы для отдельных пользователей и организаций из десяти или менее человек; более крупным организациям нужны Warp Business или Enterprise. Проверяйте актуальную документацию Warp, поскольку условия по планам меняются на их стороне.

Можно ли так запускать модели Claude в Warp?

Да. Добавьте claude-sonnet-4-6 или claude-opus-4-7 как ID моделей в конфигурации эндпоинта и выберите их в пикере; шлюз обслуживает их через OpenAI-совместимую поверхность, которую ожидает Warp, на том же ключе, что и ID GPT и DeepSeek.