知识库章节 ▾

导航

▸ 从这里开始 按角色

类别

工具 52
词汇表 12

工具

Warp + JoinGonka Gateway — 在您端点上的终端代理

Warp 是一款已发展为智能代理开发环境的终端:内置的 Warp Agent 可以读取命令输出、编辑文件、运行构建,并管理从提示词到结果的任务。默认情况下,代理运行在 Warp 自家销售的模型上(消耗方案额度),而长期以来,仅在付费方案中才可以通过 OpenAI、Anthropic 或 Google 的密钥接入自己的推理服务。2026年5月20日,Warp 在免费方案中开放了 BYOK,并增加了 custom inference endpoint(自定义推理端点)功能,支持连接任何兼容 OpenAI Chat Completions 的服务。

使用第二种方式即可将 Warp 代理导向 JoinGonka Gateway:该网关通过 OpenAI 兼容的 API 提供去中心化 Gonka 网络模型,推理按网络实时价格计费,个人和小型团队无需消耗 Warp 积分。注册并确认邮箱后,账户将获得 3M 免费代币,足够在首次充值前用您自己的任务测试该代理。

以下是开始前所需的内容、Warp 表单中的填入值、如何验证请求是否经由网关、针对终端任务应选择哪种网络模型,以及关于请求路径的重要说明:Warp 处理该路径的方式与大多数工具不同。

所需准备:密钥、Warp 方案及公网地址

JoinGonka 密钥。 在网关注册,在仪表板中打开“API Keys”部分,点击“创建密钥”。密钥以 jg- 开头且仅显示一次,请务必立即保存。建议为 Warp 创建一个单独的密钥:这样在“使用记录”中,终端代理的消耗将显示为独立条目,而不会与其他工具混淆。

Warp 方案。 自定义端点不仅限于付费方案,条件取决于团队规模:

连接用户是否支持自定义端点Warp 积分扣除情况
单人开发者或 10 人以下公司 (Free, Build, Max 方案)支持,以上方案均可通过自定义端点进行推理时不扣除积分
10 人以上组织仅限 Business 或 Enterprise本地运行代理消耗 platform credits(以优惠费率支付 Warp 基础设施费用);推理费用本身支付给端点提供商

公网 HTTPS 地址。 这是 Warp 的一个容易被忽略的要求:请求不是由您机器上的应用程序发送,而是由 Warp 服务器发送,因此该地址必须能从互联网访问。表单会拒绝 localhost、127.0.0.1 和私有网络地址,且仅支持 https:// 协议。JoinGonka Gateway 是公网 HTTPS 服务,因此不需要 Warp 文档中建议用于本地模型的 ngrok 等隧道。

最新版应用程序。 自定义端点功能已包含在 2026年5月20日之后的稳定版本中,表单中的 API 架构选择功能出现在 2026年7月31日的版本中。如果表单中缺少 API schema 字段,请更新 Warp。

连接:添加自定义 endpoint 表单

所有配置都可以在应用界面里完成,不需要手动改文件。

  1. 打开 Settings,在设置搜索里输入 inference endpoint,Warp 就会跳到提供方密钥与自定义 endpoint 的设置区块(它位于 Warp Agent 设置页面)。
  2. 点击 Add custom endpoint,弹出表单。
  3. 按表格中的值填写各字段,然后点击 Add endpoint。
表单字段填写内容说明
API schemaOpenAI Chat Completions默认 schema:Warp 文档中描述的地址格式正是针对它。列表中还有 OpenAI Responses 和 Anthropic Messages
Endpoint nameJoinGonka任意名称——endpoint 在设置中就以这个名字显示
Endpoint URLhttps://gate.joingonka.ai/v1基础地址加上 /v1,与 Warp 文档中的示例一致
API keyjg-your-key仅保存在本机,存储在系统密钥库中
Model namedeepseek-ai/DeepSeek-V4-Flash-0731网关返回的精确模型标识符
Model alias (optional)DeepSeek V4 Flash用于模型切换器的简短名称

点击 + Add model 按钮可再添加一行。建议一次性把网络中的所有模型都加上,之后切换时就不用再回到设置里:deepseek-ai/DeepSeek-V4-Flash-0731、MiniMaxAI/MiniMax-M2.7 和 zai-org/GLM-5.3-Flash。最新列表始终可通过 GET https://gate.joingonka.ai/v1/models 获取。标识符请逐字符输入:表单只校验地址格式和字段是否填写,保存时不会发送测试请求,所以模型名里的拼写错误要等到与 agent 对话时才会暴露。

保存后,模型会出现在 agent 的模型切换器中。如果默认模型仍是 Warp 的某个模型,应用可能会主动提示更换——同意并选择你 endpoint 的模型即可。一个重要细节:切换器里的 Auto 选项始终运行在 Warp 的基础设施上并消耗其额度,即使你已经配置了自己的 endpoint。要让请求发到网关,必须在切换器中选中你列表里的具体模型。

验证:请求是否通过网关进行

在切换器中选择你的 endpoint 模型,然后给 agent 一个简短的任务,例如:“显示当前目录中最大的五个文件,并解释该命令。”agent 应先给出命令建议,在你允许后执行,并对输出做出说明。

现在打开网关控制台,进入“使用情况”部分。在“按密钥”区块中,你为 Warp 创建的密钥会显示请求数和最近一次调用时间;在“按模型”区块中,会显示所选模型。计数器在增长,说明 inference 正通过 JoinGonka Gateway 进行,而不是在消耗 Warp 额度。Warp 这一侧则会在与 agent 的对话中直接显示 token 消耗——显示名称就是你填在 alias 字段里的那些简短名称。

如果出了问题,原因通常能从返回内容中看出来:

看到什么意味着什么该怎么做
401、Invalid API key网关无法识别该密钥检查密钥是否以 jg- 开头、粘贴时有没有多余空格,以及在“API 密钥”部分是否处于启用状态;如有疑问,新建一个
404、Invalid URL (POST …)路径多了一段;错误信息会显示请求实际打到了哪里应为 /v1/chat/completions。/v1 重复了,或地址里混入了完整路径——请把 Endpoint URL 改成上表中的形式
405 Not Allowed,或返回 HTML 页面而不是响应地址里少了 /v1,请求没打到 API 上在地址末尾补上 /v1
429模型过载:高峰时段,网络中某个模型的容量可能被占满几秒后重试,或切换到相邻模型——这正是应该一次性配好所有模型的原因
请求能通过,但 Warp 额度在减少切换器里选的是 Auto 或 Warp 的模型路由器,而不是 endpoint 模型从自己的列表中选择一个具体模型
表单不接受该地址Warp 要求 https:// 和公网主机填写完整网关地址,并以 https:// 开头
模型“看不到”附上的图片网络中的模型是纯文本的:网关会把图片替换为文字标记涉及截图的任务,切换到视觉模型;处理命令和代码,继续用网络模型
云端运行时找不到 endpoint 的模型自己的 endpoint 只保存在本地,不会同步到 Cloud Agents用本地 agent 运行任务

会话中的第一次响应可能会延迟几秒:agent 会发送包含工具说明的大型系统提示词,而请求要先经过 Warp 的服务器,再到网络节点。之后对话就会快起来。

如何为终端代理选择模型

网络内所有模型的定价相同,因此选择取决于行为而非预算。终端代理需要大量读取(命令输出、日志、文件)并频繁调用工具;表中的所有模型均支持原生工具调用(tool calling)。

模型标识符上下文与输出Warp 中何时使用
DeepSeek V4 Flashdeepseek-ai/DeepSeek-V4-Flash-0731380K,输出高达 32768 tokens默认代理模型:适用于长会话、大型日志和 diff、跨文件修改。具有充足的上下文空间和网络中最大的输出限制
MiniMax M2.7MiniMaxAI/MiniMax-M2.7200K,输出高达 8192 tokens快速简短任务:查找命令、解析错误、修改配置
GLM-5.3 Flashzai-org/GLM-5.3-Flash390K,输出高达 8192 tokens推理模型:回复前先思考。适用于复杂的调试、迁移规划、解析陌生代码;回复速度较慢,部分输出限制用于推理过程

实用方案:DeepSeek V4 Flash 为主力模型,MiniMax M2.7 用于小任务,GLM-5.3 Flash 用于逻辑密集型而非体积密集型任务。切换仅需一秒,因为所有模型已预先配置在 endpoint 中,别名(alias)功能避免了长标识符带来的混淆。更多关于最常用模型的信息,请查看 DeepSeek V4 Flash 概览。

费用说明

终端代理的 token 消耗比普通聊天更高:对于每个请求,Warp 都会附加系统指令、对话上下文和工具描述,且一个任务包含多个回合。因此,这里的 token 价格比普通聊天更重要。

通过 JoinGonka Gateway,输入端每百万 token 价格为 $0.0069,输出端为 $0.021——所有网络模型价格一致,并从实时源同步至此页面。2026年9月的估算费用如下:

场景消耗量通过 Gateway 费用
单次任务:命令及输出解析数万 tokens几分钱的分数
一天的高强度代理工作3-7M tokens几分钱
每月日常工作~150M tokens一到两美元左右

对比三种支付 Warp 代理的方式:

方式谁计算推理 (inference)限制条件
Warp 模型Warp,通过套餐额度套餐每月的额度限制
BYOK:OpenAI、Anthropic 或 Google key模型供应商,按其定价供应商每百万 tokens 的价格
自定义 endpoint + JoinGonka Gateway网关:按 tokens 扣除余额仅余额限制:仪表板可见使用情况,无请求次数限制

对于个人及 10 人以下的小团队,Warp 在使用自定义 endpoint 时不收取额度费用——仅需支付网关的 token 费用。余额可在后台充值,并在后台查看每日及各模型的剩余余额与消耗明细。

请求路由与隐私:重要须知

对于大多数工具而言,自定义 endpoint 意味着“请求直接从我的机器发送到提供商”。但 Warp 不同:代理的执行部分运行在 Warp 服务器上,自定义 endpoint 只会更改最终目的地和密钥。根据 Warp 文档,请求路径如下:

  1. 应用程序从设备的安全存储中获取 endpoint 地址和密钥,并将其与您的 prompt 一起发送到 Warp 服务器。
  2. Warp 端的代理会组装完整的请求(包括系统指令、对话上下文、工具等),并使用该密钥调用您的 endpoint。
  3. 响应通过相同的服务器以流式传输方式返回给应用程序。

实际应用中的含义:

  • 密钥。 仅存储在设备上。它在每次请求时都会经过 Warp 服务器,但据 Warp 称,它不会存储在那里:它是即时使用并随后丢弃的。
  • Prompts 和响应。 它们通过 Warp 后端中转。Warp 声明不会使用这些内容进行训练,存储和分析受您账户的隐私和遥测设置约束。它无法将其适用于 Warp 模型本身的 ZDR 保证扩展到您的自定义 endpoint:提供商存储什么由提供商决定。
  • 网关侧。 JoinGonka Gateway 不会存储对话:响应后 prompts 和响应不会保留在网关上,仪表板中仅可见请求和 token 计数器。
  • 保留在 Warp 基础设施上的内容。 Auto 选项、自定义模型路由器、Codebase Context、Active AI 建议和云端代理——自定义 endpoint 不会影响这些功能。

如果通过第三方服务器的路径对您的任务不可接受,请使用直接从您的机器访问 endpoint 的代理,例如 Codex CLI 或 API 快速入门中的任何工具。Warp 本身在公告中承诺提供客户端选项:一个位于开源存储库中的轻量级 Rust 代理模块,它将在不通过 Warp 服务器路由的情况下连接到本地模型,并支持 Agent Client Protocol。从 2026 年 9 月 2 日的版本开始,endpoint 描述存储在应用程序和 Warp Agent CLI 通用的配置文件中;密钥不会进入此文件,而是保留在安全存储中。

Warp 通过“Add custom endpoint”表单连接到 JoinGonka Gateway:使用 OpenAI Chat Completions 方案,地址 https://gate.joingonka.ai/v1,jg- 密钥及网络模型标识符。对于个人用户和 10 人以下的小型团队,即使在免费套餐下也可以使用,且如果在切换开关中选择了模型 endpoint 而非 Auto,则不会消耗 Warp 的推理额度。Warp 的主要特点在于路由:对 endpoint 的请求由其服务器发送,因此地址必须公开,且 prompt 会通过 Warp 后端进行中转。对于终端任务,建议使用 DeepSeek V4 Flash;对于简单任务,使用 MiniMax M2.7;对于复杂逻辑,使用 GLM-5.3 Flash。

想了解更多?

探索其他章节或立即开始赚取 GNK。

获取密钥与免费 token →