Các phần cơ sở kiến thức ▾

Điều hướng

▸ Bắt đầu tại đây Theo vai trò

Danh mục

Công cụ 52
Bảng thuật ngữ 12

Công cụ

Warp + JoinGonka Gateway — agent terminal trên endpoint của riêng bạn

Warp — một terminal đã phát triển thành môi trường phát triển dựa trên tác nhân (agent): Warp Agent được tích hợp sẵn có thể đọc đầu ra của lệnh, chỉnh sửa tệp, khởi chạy bản dựng và quản lý tác vụ từ yêu cầu đến kết quả. Theo mặc định, agent hoạt động trên các mô hình do chính Warp bán — bằng tín dụng gói cước, và trước đây việc mang theo inference của riêng bạn chỉ có thể thực hiện được trên các gói trả phí và chỉ với khóa của OpenAI, Anthropic hoặc Google. Ngày 20 tháng 5 năm 2026, Warp đã mở BYOK trên gói miễn phí và thêm custom inference endpoint — khả năng kết nối bất kỳ dịch vụ nào hỗ trợ OpenAI Chat Completions.

Cách thứ hai này là cần thiết để điều hướng agent của Warp thông qua JoinGonka Gateway: gateway cung cấp các mô hình của mạng lưới phi tập trung Gonka thông qua API tương thích với OpenAI, inference được thanh toán theo giá thực tế của mạng lưới, và đối với các cá nhân hoặc nhóm nhỏ, tín dụng Warp sẽ không bị tiêu tốn cho việc này. Sau khi đăng ký và xác nhận địa chỉ, tài khoản của bạn sẽ nhận được 3M token miễn phí — đủ để thử nghiệm agent với các tác vụ của bạn trước khi nạp tiền lần đầu.

Dưới đây là những gì bạn cần chuẩn bị, các giá trị cần điền vào biểu mẫu của Warp, cách xác minh rằng các yêu cầu đang đi qua gateway, mô hình mạng lưới nào nên chọn cho các tác vụ terminal và những điều quan trọng cần biết về quy trình yêu cầu: tại Warp, quy trình này được thiết lập khác biệt so với hầu hết các công cụ khác.

Những gì bạn cần: khóa, gói Warp và địa chỉ công khai

Khóa JoinGonka. Đăng ký trên gateway, mở phần "API keys" trong bảng điều khiển và nhấp vào "Tạo khóa". Khóa bắt đầu bằng jg- và chỉ hiển thị một lần — hãy lưu lại ngay. Bạn nên tạo một khóa riêng cho Warp: như vậy trong phần "Sử dụng", chi phí của terminal agent sẽ được hiển thị trên một dòng riêng biệt, không lẫn với các công cụ khác.

Gói Warp. Endpoint của riêng bạn không chỉ khả dụng trên các gói trả phí — các điều kiện phụ thuộc vào quy mô nhóm:

Ai là người kết nốiEndpoint riêng có khả dụng khôngTín dụng Warp sẽ thế nào
Một lập trình viên hoặc công ty dưới 10 người (các gói Free, Build, Max)Có, khả dụng trên bất kỳ gói nào trong số nàyTín dụng không bị trừ cho inference qua endpoint riêng
Tổ chức trên 10 ngườiChỉ khả dụng trên gói Business hoặc EnterpriseViệc chạy agent cục bộ tiêu tốn platform credits — phí cơ sở hạ tầng của Warp với mức giá ưu đãi; bản thân inference được thanh toán cho nhà cung cấp endpoint

Địa chỉ HTTPS công khai. Đây là yêu cầu của Warp mà bạn có thể dễ dàng bỏ qua: các yêu cầu đến endpoint của bạn không được gửi bởi ứng dụng trên máy của bạn mà bởi các máy chủ của Warp, vì vậy địa chỉ bắt buộc phải truy cập được từ internet. localhost, 127.0.0.1 và các địa chỉ mạng riêng sẽ bị biểu mẫu từ chối, và chỉ chấp nhận giao thức https://. JoinGonka Gateway là một dịch vụ HTTPS công khai, vì vậy các đường hầm như ngrok, vốn được tài liệu của Warp khuyến nghị cho các mô hình cục bộ, không cần thiết ở đây.

Phiên bản ứng dụng mới nhất. Endpoint riêng đã được đưa vào bản dựng ổn định kể từ bản phát hành ngày 20 tháng 5 năm 2026, lựa chọn lược đồ API trong biểu mẫu đã xuất hiện trong bản phát hành ngày 31 tháng 7 năm 2026. Nếu trường API schema không hiển thị trong biểu mẫu — hãy cập nhật Warp.

Kết nối: biểu mẫu Add custom endpoint

Toàn bộ quá trình cấu hình đều thực hiện trong giao diện ứng dụng — không cần chỉnh sửa file thủ công.

  1. Mở Settings và gõ inference endpoint vào ô tìm kiếm cài đặt — Warp sẽ chuyển đến khối chứa khóa nhà cung cấp và endpoint riêng (nằm trong trang cài đặt Warp Agent).
  2. Nhấn Add custom endpoint — biểu mẫu sẽ mở ra.
  3. Điền các trường bằng giá trị từ bảng rồi nhấn Add endpoint.
Trường trong biểu mẫuNhập gìGiải thích
API schemaOpenAI Chat CompletionsLược đồ mặc định: tài liệu Warp mô tả định dạng địa chỉ chính cho lược đồ này. Trong danh sách còn có OpenAI Responses và Anthropic Messages
Endpoint nameJoinGonkaTên bất kỳ — endpoint hiển thị trong cài đặt dưới tên này
Endpoint URLhttps://gate.joingonka.ai/v1Địa chỉ cơ sở kèm /v1 — giống như ví dụ trong tài liệu Warp
API keyjg-your-keyChỉ lưu trên thiết bị, trong kho khóa của hệ thống
Model namedeepseek-ai/DeepSeek-V4-Flash-0731Mã định danh chính xác của model, đúng như cổng gateway trả về
Model alias (optional)DeepSeek V4 FlashTên ngắn dùng cho trình chuyển đổi model

Nút + Add model thêm dòng tiếp theo. Hãy tạo ngay tất cả model của mạng để sau đó chuyển đổi giữa chúng mà không cần quay lại cài đặt: deepseek-ai/DeepSeek-V4-Flash-0731, MiniMaxAI/MiniMax-M2.7 và zai-org/GLM-5.3-Flash. Danh sách cập nhật luôn có sẵn qua GET https://gate.joingonka.ai/v1/models. Hãy nhập mã định danh chính xác từng ký tự: biểu mẫu chỉ kiểm tra hình thức địa chỉ và mức độ điền đầy đủ của các trường, không thực hiện truy vấn thử khi lưu, nên chỉ một lỗi đánh máy trong tên model cũng sẽ lộ ra ngay trong cuộc hội thoại với agent.

Sau khi lưu, các model xuất hiện trong trình chuyển đổi model của agent. Nếu model mặc định vẫn là một trong các model của Warp, ứng dụng có thể tự đề nghị đổi — hãy đồng ý và chọn model từ endpoint của bạn. Một chi tiết quan trọng: các tùy chọn Auto trong trình chuyển đổi luôn chạy trên hạ tầng của Warp và tiêu tốn credit của họ, kể cả khi endpoint riêng đã được cấu hình. Để yêu cầu được gửi đến gateway, cần chọn một model cụ thể trong danh sách của bạn ở trình chuyển đổi.

Kiểm tra: liệu các yêu cầu có đang đi qua cổng kết nối không

Chọn model của endpoint bạn trong ô chuyển đổi và giao cho agent một task ngắn, ví dụ: "Hiển thị năm tệp lớn nhất trong thư mục hiện tại và giải thích lệnh". Agent sẽ đề xuất lệnh, thực thi lệnh đó khi bạn cho phép và nhận xét về output.

Bây giờ hãy mở dashboard của gateway, mục "Sử dụng". Trong khối "Theo key", key đã tạo cho Warp sẽ xuất hiện các request và thời gian truy cập gần nhất; trong khối "Theo model" là model đã chọn. Các bộ đếm tăng lên nghĩa là inference đang chạy qua JoinGonka Gateway chứ không phải bằng credit của Warp. Về phía Warp, mức tiêu thụ token hiển thị ngay trong hội thoại với agent — dưới những tên ngắn mà bạn đặt trong trường alias.

Nếu có gì đó không ổn, thường có thể đọc ra nguyên nhân từ phản hồi:

Hiện tượngNghĩa là gìCần làm gì
401, Invalid API keyGateway không nhận ra keyKiểm tra rằng key bắt đầu bằng jg-, được dán không có khoảng trắng và đang hoạt động trong mục "API key"; nếu nghi ngờ, hãy tạo key mới
404, Invalid URL (POST …)Đường dẫn bị ghép thừa một segment; trong nội dung lỗi, gateway hiển thị request đã đến đúng chỗ nàoKết quả đúng phải là /v1/chat/completions. Nếu /v1 bị lặp hoặc đường dẫn chứa cả path đầy đủ — hãy đưa Endpoint URL về dạng trong bảng trên
405 Not Allowed hoặc trang HTML thay vì phản hồiĐường dẫn thiếu /v1, request đã đi lệch khỏi APIThêm /v1 vào cuối đường dẫn
429Model bị quá tải: vào giờ cao điểm, năng lực của một model cụ thể trên mạng có thể đã được dùng hếtThử lại sau vài giây hoặc chuyển sang model bên cạnh — đó chính là lý do nên tạo tất cả cùng lúc
Request chạy được nhưng credit của Warp cứ vơi dầnTrong ô chuyển đổi đang chọn Auto hoặc bộ định tuyến model của Warp chứ không phải model của endpointChọn một model cụ thể trong danh sách của bạn
Form không nhận địa chỉWarp yêu cầu https:// và một host công khaiNhập đầy đủ địa chỉ gateway, bắt đầu bằng https://
Model "không thấy" ảnh đính kèmCác model của mạng là model văn bản: gateway thay thế hình ảnh bằng một ghi chú văn bảnVới các task có ảnh chụp màn hình, hãy chuyển sang model có thị giác; với lệnh và code, cứ dùng model của mạng
Không có model của endpoint khi chạy trên cloudEndpoint riêng được lưu cục bộ và không áp dụng cho Cloud AgentsHãy chạy task bằng agent cục bộ

Phản hồi đầu tiên trong phiên có thể đến chậm vài giây: agent gửi một system prompt lớn mô tả các công cụ, và request phải đi qua máy chủ Warp trước rồi mới đến node của mạng. Sau đó hội thoại sẽ nhanh hơn.

Chọn mô hình nào cho terminal agent

Giá của các mô hình trong mạng lưới là như nhau, vì vậy việc lựa chọn là về hành vi chứ không phải về ngân sách. Tác nhân terminal đọc rất nhiều (đầu ra lệnh, log, tệp) và liên tục gọi các công cụ; tất cả các mô hình trong bảng đều hỗ trợ native tool calling.

Mô hìnhĐịnh danhNgữ cảnh và phản hồiKhi nào nên chọn trong Warp
DeepSeek V4 Flashdeepseek-ai/DeepSeek-V4-Flash-0731380K, phản hồi tối đa 32768 tokensMô hình mặc định cho tác nhân: các phiên dài, log và diff lớn, chỉnh sửa trong nhiều tệp. Dư thừa ngữ cảnh và trần phản hồi lớn nhất trong mạng lưới
MiniMax M2.7MiniMaxAI/MiniMax-M2.7200K, phản hồi tối đa 8192 tokensCác tác vụ ngắn nhanh: tìm lệnh, phân tích lỗi, sửa cấu hình
GLM-5.3 Flashzai-org/GLM-5.3-Flash390K, phản hồi tối đa 8192 tokensMô hình Reasoning: suy luận trước khi phản hồi. Gỡ lỗi phức tạp, kế hoạch di chuyển, phân tích mã không xác định; phản hồi đến muộn hơn và một phần giới hạn phản hồi được dùng cho suy luận

Sơ đồ thực tế: DeepSeek V4 Flash là mô hình chính, MiniMax M2.7 cho các việc nhỏ, GLM-5.3 Flash khi tác vụ phụ thuộc vào logic chứ không phải khối lượng. Việc chuyển đổi chỉ mất một giây vì tất cả các mô hình đã được thiết lập trong endpoint, và các tên ngắn từ trường alias giúp không bị nhầm lẫn giữa các định danh dài. Chi tiết hơn về mô hình phổ biến nhất trong số đó có trong tổng quan về DeepSeek V4 Flash.

Chi phí là bao nhiêu

Mức tiêu thụ token của tác nhân trong terminal cao hơn so với trò chuyện: với mỗi yêu cầu, Warp thêm hướng dẫn hệ thống, ngữ cảnh đối thoại và mô tả công cụ, và một tác vụ bao gồm nhiều bước. Vì vậy, giá mỗi token ở đây quan trọng hơn so với giao tiếp thông thường.

Thông qua JoinGonka Gateway, token có giá $0.0069 cho một triệu đầu vào và $0.021 cho một triệu đầu ra — giá giống nhau cho tất cả các mô hình trong mạng lưới và được cập nhật trên trang này từ nguồn trực tiếp. Mức giá ước tính tính đến tháng 9 năm 2026:

Kịch bảnMức tiêu thụQua Gateway
Tác vụ đơn lẻ: lệnh và phân tích đầu ra của nóhàng chục nghìn tokenphần nghìn xu
Một ngày làm việc tích cực với tác nhân3-7M tokensvài xu
Một tháng làm việc hàng ngày~150M tokenskhoảng một đến hai đô la

Để so sánh — ba cách để trả phí cho tác nhân Warp:

Cách thứcAi tính toán inferenceĐiều gì bị hạn chế
Mô hình WarpWarp, theo tín dụng gói cướcDự trữ tín dụng hàng tháng của gói
BYOK: khóa OpenAI, Anthropic hoặc GoogleNhà cung cấp mô hình theo bảng giá của họGiá mỗi triệu token của nhà cung cấp
Endpoint của riêng bạn + JoinGonka GatewayCổng: theo token, từ số dưChỉ số dư: chi phí hiển thị trong bảng điều khiển, không có hạn ngạch về số lượng yêu cầu

Bản thân Warp không tính phí tín dụng cho cá nhân và nhóm dưới 10 người khi làm việc qua endpoint của riêng họ — bạn chỉ trả tiền cho token tại cổng. Số dư được nạp trong bảng điều khiển, nơi cũng hiển thị số dư còn lại và mức tiêu thụ theo ngày và theo mô hình.

Lộ trình yêu cầu và quyền riêng tư: những điều cần biết

Đối với hầu hết các công cụ, endpoint riêng đồng nghĩa với việc «yêu cầu đi trực tiếp từ máy của tôi đến nhà cung cấp». Với Warp thì khác: phần thực thi của agent chạy trên máy chủ Warp, và endpoint riêng chỉ thay đổi địa chỉ đích cuối cùng và khóa. Theo tài liệu của Warp, đường đi của yêu cầu như sau:

  1. Ứng dụng lấy địa chỉ endpoint và khóa từ bộ nhớ bảo mật trên thiết bị và gửi chúng đến máy chủ Warp cùng với prompt của bạn.
  2. Agent phía Warp tập hợp yêu cầu đầy đủ — các chỉ dẫn hệ thống, ngữ cảnh hội thoại, công cụ — và gọi endpoint của bạn với khóa đó.
  3. Phản hồi được trả về ứng dụng theo luồng (stream) thông qua các máy chủ đó.

Điều này có ý nghĩa gì trong thực tế:

  • Khóa. Chỉ được lưu trữ trên thiết bị. Nó đi qua máy chủ Warp trong mỗi yêu cầu, nhưng theo tuyên bố của Warp, nó không được lưu lại: nó được sử dụng ngay lập tức và sau đó bị loại bỏ.
  • Prompts và phản hồi. Đi qua backend của Warp. Warp tuyên bố rằng họ không sử dụng nội dung này để huấn luyện, còn việc lưu trữ và phân tích tuân theo cài đặt quyền riêng tư và đo lường từ xa trong tài khoản của bạn. Đảm bảo ZDR, vốn áp dụng cho các model của riêng Warp, không thể mở rộng cho endpoint riêng của bạn: nhà cung cấp nào quyết định điều gì được lưu trữ.
  • Phía cổng kết nối. JoinGonka Gateway không lưu trữ hội thoại: prompts và phản hồi không còn nằm trên cổng sau khi nhận phản hồi, trong bảng điều khiển chỉ thấy bộ đếm yêu cầu và token.
  • Những gì còn lại trên hạ tầng Warp. Các tùy chọn Auto, bộ định tuyến model tùy chỉnh, Codebase Context, gợi ý Active AI và cloud agents — endpoint riêng không ảnh hưởng đến chúng.

Nếu đường đi qua các máy chủ khác không chấp nhận được cho các tác vụ của bạn, hãy sử dụng một agent kết nối trực tiếp đến endpoint từ máy của bạn — ví dụ: Codex CLI hoặc bất kỳ công cụ nào từ hướng dẫn khởi động nhanh API. Bản thân Warp trong thông báo cũng hứa hẹn một tùy chọn phía client: một mô-đun agent nhẹ bằng Rust trong kho mã nguồn mở, sẽ kết nối với các model cục bộ mà không qua tuyến đường máy chủ Warp, và hỗ trợ Agent Client Protocol. Và kể từ bản phát hành ngày 2 tháng 9 năm 2026, mô tả endpoint được lưu trữ trong tệp cấu hình ở định dạng chung cho cả ứng dụng và Warp Agent CLI; các khóa không rơi vào tệp này và vẫn nằm trong bộ nhớ bảo mật.

Warp kết nối với JoinGonka Gateway thông qua biểu mẫu Add custom endpoint: lược đồ OpenAI Chat Completions, địa chỉ https://gate.joingonka.ai/v1, khóa jg- và các định danh mô hình của mạng. Đối với cá nhân và nhóm lên đến 10 người, tính năng này khả dụng ngay cả ở gói miễn phí và tín dụng Warp không bị trừ cho inference — nếu mô hình endpoint được chọn trong bộ chuyển đổi thay vì Auto. Đặc điểm chính của Warp là tuyến đường: các yêu cầu đến endpoint được gửi bởi máy chủ của nó, do đó địa chỉ phải là công khai và các prompt đi qua backend của Warp dưới dạng trung chuyển. Đối với các tác vụ terminal, hãy dùng DeepSeek V4 Flash, cho các tác vụ nhỏ — MiniMax M2.7, cho logic phức tạp — GLM-5.3 Flash.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Nhận khóa và token miễn phí →