Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Cursor + Gonka AI — LLM giá rẻ để viết mã
- Claude Code + Gonka AI — LLM cho thiết bị đầu cuối
- OpenClaw + Gonka AI — tác nhân AI giá cả phải chăng
- OpenCode: mô hình riêng trong terminal
- Continue.dev + Gonka AI — AI cho VS Code/JetBrains
- Cline + Gonka AI — tác nhân AI trong VS Code
- Aider + Gonka AI — lập trình cặp đôi với AI
- LangChain + Gonka AI — ứng dụng AI giá rẻ
- n8n + Gonka AI — tự động hóa với AI giá rẻ
- Open WebUI + Gonka AI — ChatGPT của riêng bạn
- LibreChat + Gonka AI — ChatGPT mã nguồn mở
- Hermes Agent + DeepSeek trên mạng Gonka — tác nhân tự hành giá rẻ
- Kilo Code + Gonka AI — Tác nhân AI trong VS Code
- Roo Code + Gonka AI — tác nhân AI tự động trong VS Code
- LlamaIndex + Gonka AI — Ứng dụng RAG giá rẻ
- PydanticAI + Gonka — các tác nhân AI có kiểu dữ liệu với chi phí thấp
- Vercel AI SDK + Gonka AI — Ứng dụng AI trên TypeScript giá rẻ
- TanStack AI + Gonka — Ứng dụng AI trên TypeScript giá rẻ
- Khởi động nhanh API — curl, Python, TypeScript
- JoinGonka Gateway — đánh giá đầy đủ
- Management Keys — SaaS trên Gonka
- API AI rẻ nhất: so sánh các nhà cung cấp 2026
- Cách mua token AI và API-key: 3 cách vào năm 2026
- Hết giới hạn yêu cầu Cursor Pro — phân tích và giải pháp thay thế giá rẻ
- Claude Code rẻ hơn — phân tích hóa đơn và chuyển đổi
- Cline tiêu tốn nhiều tiền — tại sao tác nhân lại tốn kém như vậy
- OpenClaw đắt đỏ — tại sao tác nhân đốt token và cách tiết kiệm
- OpenRouter: giải pháp thay thế giá rẻ — so sánh với JoinGonka Gateway
- Mô hình AI tốt nhất cho lập trình năm 2026: so sánh và giá cả
- Giải pháp thay thế GitHub Copilot giá rẻ không giới hạn
- Giải pháp thay thế Windsurf giá rẻ, không credit và không giới hạn
- API rẻ nhất cho AI agent năm 2026
- ZCode: suy luận GLM giá rẻ thay thế cho GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — endpoint của riêng bạn thay vì tín dụng
- GitHub Copilot BYOK — mô hình riêng thay vì hạn ngạch
- Zed + JoinGonka Gateway — inference giá rẻ trong trình soạn thảo
- Pi + JoinGonka Gateway — tác nhân terminal với suy luận giá rẻ
- Codex CLI: khóa riêng thay vì gói thuê bao
- DeepSeek Harness: nhà cung cấp của riêng bạn thông qua JoinGonka Gateway
- MiniMax Code: Đại lý MiniMax với khóa riêng thông qua Gonka
- Warp + JoinGonka Gateway — agent terminal trên endpoint của riêng bạn
- Trae + JoinGonka Gateway — các mô hình mạng Gonka trong AI-IDE
- Cherry Studio + JoinGonka Gateway — ứng dụng AI để bàn
- omp (Oh My Pi) + JoinGonka Gateway: agent với vai trò mô hình
- OpenHands + JoinGonka Gateway: đại lý trên endpoint của riêng bạn
- Qwen Code sau khi đóng qwen-oauth: làm việc qua JoinGonka Gateway
- Goose + JoinGonka Gateway: nhà cung cấp riêng và khóa trong keyring
- Crush + JoinGonka Gateway: tác nhân Charm trên các mô hình mạng lưới Gonka
- Zoo Code + JoinGonka Gateway: chuyển từ Roo Code sang các mô hình Gonka
- Kimi Code CLI: tác nhân Moonshot AI trên khóa riêng qua Gonka
- Factory Droid + JoinGonka Gateway: BYOK trên các mô hình mạng Gonka
- MiMo Code + JoinGonka Gateway: đại lý Xiaomi trên các mô hình mạng Gonka
Công cụ
Warp + JoinGonka Gateway — agent terminal trên endpoint của riêng bạn
Warp — một terminal đã phát triển thành môi trường phát triển dựa trên tác nhân (agent): Warp Agent được tích hợp sẵn có thể đọc đầu ra của lệnh, chỉnh sửa tệp, khởi chạy bản dựng và quản lý tác vụ từ yêu cầu đến kết quả. Theo mặc định, agent hoạt động trên các mô hình do chính Warp bán — bằng tín dụng gói cước, và trước đây việc mang theo inference của riêng bạn chỉ có thể thực hiện được trên các gói trả phí và chỉ với khóa của OpenAI, Anthropic hoặc Google. Ngày 20 tháng 5 năm 2026, Warp đã mở BYOK trên gói miễn phí và thêm custom inference endpoint — khả năng kết nối bất kỳ dịch vụ nào hỗ trợ OpenAI Chat Completions.
Cách thứ hai này là cần thiết để điều hướng agent của Warp thông qua JoinGonka Gateway: gateway cung cấp các mô hình của mạng lưới phi tập trung Gonka thông qua API tương thích với OpenAI, inference được thanh toán theo giá thực tế của mạng lưới, và đối với các cá nhân hoặc nhóm nhỏ, tín dụng Warp sẽ không bị tiêu tốn cho việc này. Sau khi đăng ký và xác nhận địa chỉ, tài khoản của bạn sẽ nhận được 3M token miễn phí — đủ để thử nghiệm agent với các tác vụ của bạn trước khi nạp tiền lần đầu.
Dưới đây là những gì bạn cần chuẩn bị, các giá trị cần điền vào biểu mẫu của Warp, cách xác minh rằng các yêu cầu đang đi qua gateway, mô hình mạng lưới nào nên chọn cho các tác vụ terminal và những điều quan trọng cần biết về quy trình yêu cầu: tại Warp, quy trình này được thiết lập khác biệt so với hầu hết các công cụ khác.
Những gì bạn cần: khóa, gói Warp và địa chỉ công khai
Khóa JoinGonka. Đăng ký trên gateway, mở phần "API keys" trong bảng điều khiển và nhấp vào "Tạo khóa". Khóa bắt đầu bằng jg- và chỉ hiển thị một lần — hãy lưu lại ngay. Bạn nên tạo một khóa riêng cho Warp: như vậy trong phần "Sử dụng", chi phí của terminal agent sẽ được hiển thị trên một dòng riêng biệt, không lẫn với các công cụ khác.
Gói Warp. Endpoint của riêng bạn không chỉ khả dụng trên các gói trả phí — các điều kiện phụ thuộc vào quy mô nhóm:
| Ai là người kết nối | Endpoint riêng có khả dụng không | Tín dụng Warp sẽ thế nào |
|---|---|---|
| Một lập trình viên hoặc công ty dưới 10 người (các gói Free, Build, Max) | Có, khả dụng trên bất kỳ gói nào trong số này | Tín dụng không bị trừ cho inference qua endpoint riêng |
| Tổ chức trên 10 người | Chỉ khả dụng trên gói Business hoặc Enterprise | Việc chạy agent cục bộ tiêu tốn platform credits — phí cơ sở hạ tầng của Warp với mức giá ưu đãi; bản thân inference được thanh toán cho nhà cung cấp endpoint |
Địa chỉ HTTPS công khai. Đây là yêu cầu của Warp mà bạn có thể dễ dàng bỏ qua: các yêu cầu đến endpoint của bạn không được gửi bởi ứng dụng trên máy của bạn mà bởi các máy chủ của Warp, vì vậy địa chỉ bắt buộc phải truy cập được từ internet. localhost, 127.0.0.1 và các địa chỉ mạng riêng sẽ bị biểu mẫu từ chối, và chỉ chấp nhận giao thức https://. JoinGonka Gateway là một dịch vụ HTTPS công khai, vì vậy các đường hầm như ngrok, vốn được tài liệu của Warp khuyến nghị cho các mô hình cục bộ, không cần thiết ở đây.
Phiên bản ứng dụng mới nhất. Endpoint riêng đã được đưa vào bản dựng ổn định kể từ bản phát hành ngày 20 tháng 5 năm 2026, lựa chọn lược đồ API trong biểu mẫu đã xuất hiện trong bản phát hành ngày 31 tháng 7 năm 2026. Nếu trường API schema không hiển thị trong biểu mẫu — hãy cập nhật Warp.
Kết nối: biểu mẫu Add custom endpoint
Toàn bộ quá trình cấu hình đều thực hiện trong giao diện ứng dụng — không cần chỉnh sửa file thủ công.
- Mở Settings và gõ
inference endpointvào ô tìm kiếm cài đặt — Warp sẽ chuyển đến khối chứa khóa nhà cung cấp và endpoint riêng (nằm trong trang cài đặt Warp Agent). - Nhấn Add custom endpoint — biểu mẫu sẽ mở ra.
- Điền các trường bằng giá trị từ bảng rồi nhấn Add endpoint.
| Trường trong biểu mẫu | Nhập gì | Giải thích |
|---|---|---|
| API schema | OpenAI Chat Completions | Lược đồ mặc định: tài liệu Warp mô tả định dạng địa chỉ chính cho lược đồ này. Trong danh sách còn có OpenAI Responses và Anthropic Messages |
| Endpoint name | JoinGonka | Tên bất kỳ — endpoint hiển thị trong cài đặt dưới tên này |
| Endpoint URL | https://gate.joingonka.ai/v1 | Địa chỉ cơ sở kèm /v1 — giống như ví dụ trong tài liệu Warp |
| API key | jg-your-key | Chỉ lưu trên thiết bị, trong kho khóa của hệ thống |
| Model name | deepseek-ai/DeepSeek-V4-Flash-0731 | Mã định danh chính xác của model, đúng như cổng gateway trả về |
| Model alias (optional) | DeepSeek V4 Flash | Tên ngắn dùng cho trình chuyển đổi model |
Nút + Add model thêm dòng tiếp theo. Hãy tạo ngay tất cả model của mạng để sau đó chuyển đổi giữa chúng mà không cần quay lại cài đặt: deepseek-ai/DeepSeek-V4-Flash-0731, MiniMaxAI/MiniMax-M2.7 và zai-org/GLM-5.3-Flash. Danh sách cập nhật luôn có sẵn qua GET https://gate.joingonka.ai/v1/models. Hãy nhập mã định danh chính xác từng ký tự: biểu mẫu chỉ kiểm tra hình thức địa chỉ và mức độ điền đầy đủ của các trường, không thực hiện truy vấn thử khi lưu, nên chỉ một lỗi đánh máy trong tên model cũng sẽ lộ ra ngay trong cuộc hội thoại với agent.
Sau khi lưu, các model xuất hiện trong trình chuyển đổi model của agent. Nếu model mặc định vẫn là một trong các model của Warp, ứng dụng có thể tự đề nghị đổi — hãy đồng ý và chọn model từ endpoint của bạn. Một chi tiết quan trọng: các tùy chọn Auto trong trình chuyển đổi luôn chạy trên hạ tầng của Warp và tiêu tốn credit của họ, kể cả khi endpoint riêng đã được cấu hình. Để yêu cầu được gửi đến gateway, cần chọn một model cụ thể trong danh sách của bạn ở trình chuyển đổi.
Kiểm tra: liệu các yêu cầu có đang đi qua cổng kết nối không
Chọn model của endpoint bạn trong ô chuyển đổi và giao cho agent một task ngắn, ví dụ: "Hiển thị năm tệp lớn nhất trong thư mục hiện tại và giải thích lệnh". Agent sẽ đề xuất lệnh, thực thi lệnh đó khi bạn cho phép và nhận xét về output.
Bây giờ hãy mở dashboard của gateway, mục "Sử dụng". Trong khối "Theo key", key đã tạo cho Warp sẽ xuất hiện các request và thời gian truy cập gần nhất; trong khối "Theo model" là model đã chọn. Các bộ đếm tăng lên nghĩa là inference đang chạy qua JoinGonka Gateway chứ không phải bằng credit của Warp. Về phía Warp, mức tiêu thụ token hiển thị ngay trong hội thoại với agent — dưới những tên ngắn mà bạn đặt trong trường alias.
Nếu có gì đó không ổn, thường có thể đọc ra nguyên nhân từ phản hồi:
| Hiện tượng | Nghĩa là gì | Cần làm gì |
|---|---|---|
401, Invalid API key | Gateway không nhận ra key | Kiểm tra rằng key bắt đầu bằng jg-, được dán không có khoảng trắng và đang hoạt động trong mục "API key"; nếu nghi ngờ, hãy tạo key mới |
404, Invalid URL (POST …) | Đường dẫn bị ghép thừa một segment; trong nội dung lỗi, gateway hiển thị request đã đến đúng chỗ nào | Kết quả đúng phải là /v1/chat/completions. Nếu /v1 bị lặp hoặc đường dẫn chứa cả path đầy đủ — hãy đưa Endpoint URL về dạng trong bảng trên |
405 Not Allowed hoặc trang HTML thay vì phản hồi | Đường dẫn thiếu /v1, request đã đi lệch khỏi API | Thêm /v1 vào cuối đường dẫn |
429 | Model bị quá tải: vào giờ cao điểm, năng lực của một model cụ thể trên mạng có thể đã được dùng hết | Thử lại sau vài giây hoặc chuyển sang model bên cạnh — đó chính là lý do nên tạo tất cả cùng lúc |
| Request chạy được nhưng credit của Warp cứ vơi dần | Trong ô chuyển đổi đang chọn Auto hoặc bộ định tuyến model của Warp chứ không phải model của endpoint | Chọn một model cụ thể trong danh sách của bạn |
| Form không nhận địa chỉ | Warp yêu cầu https:// và một host công khai | Nhập đầy đủ địa chỉ gateway, bắt đầu bằng https:// |
| Model "không thấy" ảnh đính kèm | Các model của mạng là model văn bản: gateway thay thế hình ảnh bằng một ghi chú văn bản | Với các task có ảnh chụp màn hình, hãy chuyển sang model có thị giác; với lệnh và code, cứ dùng model của mạng |
| Không có model của endpoint khi chạy trên cloud | Endpoint riêng được lưu cục bộ và không áp dụng cho Cloud Agents | Hãy chạy task bằng agent cục bộ |
Phản hồi đầu tiên trong phiên có thể đến chậm vài giây: agent gửi một system prompt lớn mô tả các công cụ, và request phải đi qua máy chủ Warp trước rồi mới đến node của mạng. Sau đó hội thoại sẽ nhanh hơn.
Chọn mô hình nào cho terminal agent
Giá của các mô hình trong mạng lưới là như nhau, vì vậy việc lựa chọn là về hành vi chứ không phải về ngân sách. Tác nhân terminal đọc rất nhiều (đầu ra lệnh, log, tệp) và liên tục gọi các công cụ; tất cả các mô hình trong bảng đều hỗ trợ native tool calling.
| Mô hình | Định danh | Ngữ cảnh và phản hồi | Khi nào nên chọn trong Warp |
|---|---|---|---|
| DeepSeek V4 Flash | deepseek-ai/DeepSeek-V4-Flash-0731 | 380K, phản hồi tối đa 32768 tokens | Mô hình mặc định cho tác nhân: các phiên dài, log và diff lớn, chỉnh sửa trong nhiều tệp. Dư thừa ngữ cảnh và trần phản hồi lớn nhất trong mạng lưới |
| MiniMax M2.7 | MiniMaxAI/MiniMax-M2.7 | 200K, phản hồi tối đa 8192 tokens | Các tác vụ ngắn nhanh: tìm lệnh, phân tích lỗi, sửa cấu hình |
| GLM-5.3 Flash | zai-org/GLM-5.3-Flash | 390K, phản hồi tối đa 8192 tokens | Mô hình Reasoning: suy luận trước khi phản hồi. Gỡ lỗi phức tạp, kế hoạch di chuyển, phân tích mã không xác định; phản hồi đến muộn hơn và một phần giới hạn phản hồi được dùng cho suy luận |
Sơ đồ thực tế: DeepSeek V4 Flash là mô hình chính, MiniMax M2.7 cho các việc nhỏ, GLM-5.3 Flash khi tác vụ phụ thuộc vào logic chứ không phải khối lượng. Việc chuyển đổi chỉ mất một giây vì tất cả các mô hình đã được thiết lập trong endpoint, và các tên ngắn từ trường alias giúp không bị nhầm lẫn giữa các định danh dài. Chi tiết hơn về mô hình phổ biến nhất trong số đó có trong tổng quan về DeepSeek V4 Flash.
Chi phí là bao nhiêu
Mức tiêu thụ token của tác nhân trong terminal cao hơn so với trò chuyện: với mỗi yêu cầu, Warp thêm hướng dẫn hệ thống, ngữ cảnh đối thoại và mô tả công cụ, và một tác vụ bao gồm nhiều bước. Vì vậy, giá mỗi token ở đây quan trọng hơn so với giao tiếp thông thường.
Thông qua JoinGonka Gateway, token có giá $0.0069 cho một triệu đầu vào và $0.021 cho một triệu đầu ra — giá giống nhau cho tất cả các mô hình trong mạng lưới và được cập nhật trên trang này từ nguồn trực tiếp. Mức giá ước tính tính đến tháng 9 năm 2026:
| Kịch bản | Mức tiêu thụ | Qua Gateway |
|---|---|---|
| Tác vụ đơn lẻ: lệnh và phân tích đầu ra của nó | hàng chục nghìn token | phần nghìn xu |
| Một ngày làm việc tích cực với tác nhân | 3-7M tokens | vài xu |
| Một tháng làm việc hàng ngày | ~150M tokens | khoảng một đến hai đô la |
Để so sánh — ba cách để trả phí cho tác nhân Warp:
| Cách thức | Ai tính toán inference | Điều gì bị hạn chế |
|---|---|---|
| Mô hình Warp | Warp, theo tín dụng gói cước | Dự trữ tín dụng hàng tháng của gói |
| BYOK: khóa OpenAI, Anthropic hoặc Google | Nhà cung cấp mô hình theo bảng giá của họ | Giá mỗi triệu token của nhà cung cấp |
| Endpoint của riêng bạn + JoinGonka Gateway | Cổng: theo token, từ số dư | Chỉ số dư: chi phí hiển thị trong bảng điều khiển, không có hạn ngạch về số lượng yêu cầu |
Bản thân Warp không tính phí tín dụng cho cá nhân và nhóm dưới 10 người khi làm việc qua endpoint của riêng họ — bạn chỉ trả tiền cho token tại cổng. Số dư được nạp trong bảng điều khiển, nơi cũng hiển thị số dư còn lại và mức tiêu thụ theo ngày và theo mô hình.
Lộ trình yêu cầu và quyền riêng tư: những điều cần biết
Đối với hầu hết các công cụ, endpoint riêng đồng nghĩa với việc «yêu cầu đi trực tiếp từ máy của tôi đến nhà cung cấp». Với Warp thì khác: phần thực thi của agent chạy trên máy chủ Warp, và endpoint riêng chỉ thay đổi địa chỉ đích cuối cùng và khóa. Theo tài liệu của Warp, đường đi của yêu cầu như sau:
- Ứng dụng lấy địa chỉ endpoint và khóa từ bộ nhớ bảo mật trên thiết bị và gửi chúng đến máy chủ Warp cùng với prompt của bạn.
- Agent phía Warp tập hợp yêu cầu đầy đủ — các chỉ dẫn hệ thống, ngữ cảnh hội thoại, công cụ — và gọi endpoint của bạn với khóa đó.
- Phản hồi được trả về ứng dụng theo luồng (stream) thông qua các máy chủ đó.
Điều này có ý nghĩa gì trong thực tế:
- Khóa. Chỉ được lưu trữ trên thiết bị. Nó đi qua máy chủ Warp trong mỗi yêu cầu, nhưng theo tuyên bố của Warp, nó không được lưu lại: nó được sử dụng ngay lập tức và sau đó bị loại bỏ.
- Prompts và phản hồi. Đi qua backend của Warp. Warp tuyên bố rằng họ không sử dụng nội dung này để huấn luyện, còn việc lưu trữ và phân tích tuân theo cài đặt quyền riêng tư và đo lường từ xa trong tài khoản của bạn. Đảm bảo ZDR, vốn áp dụng cho các model của riêng Warp, không thể mở rộng cho endpoint riêng của bạn: nhà cung cấp nào quyết định điều gì được lưu trữ.
- Phía cổng kết nối. JoinGonka Gateway không lưu trữ hội thoại: prompts và phản hồi không còn nằm trên cổng sau khi nhận phản hồi, trong bảng điều khiển chỉ thấy bộ đếm yêu cầu và token.
- Những gì còn lại trên hạ tầng Warp. Các tùy chọn Auto, bộ định tuyến model tùy chỉnh, Codebase Context, gợi ý Active AI và cloud agents — endpoint riêng không ảnh hưởng đến chúng.
Nếu đường đi qua các máy chủ khác không chấp nhận được cho các tác vụ của bạn, hãy sử dụng một agent kết nối trực tiếp đến endpoint từ máy của bạn — ví dụ: Codex CLI hoặc bất kỳ công cụ nào từ hướng dẫn khởi động nhanh API. Bản thân Warp trong thông báo cũng hứa hẹn một tùy chọn phía client: một mô-đun agent nhẹ bằng Rust trong kho mã nguồn mở, sẽ kết nối với các model cục bộ mà không qua tuyến đường máy chủ Warp, và hỗ trợ Agent Client Protocol. Và kể từ bản phát hành ngày 2 tháng 9 năm 2026, mô tả endpoint được lưu trữ trong tệp cấu hình ở định dạng chung cho cả ứng dụng và Warp Agent CLI; các khóa không rơi vào tệp này và vẫn nằm trong bộ nhớ bảo mật.
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Nhận khóa và token miễn phí →