지식 기반 섹션 ▾
기술
Qwen3-235B: 이전에 Gonka가 지원하던 모델
Qwen3-235B란 무엇인가
Qwen3-235B-A22B-Instruct-2507-FP8은 Alibaba Cloud의 Qwen 팀이 개발한 Qwen3 제품군의 대규모 언어 모델(LLM)입니다. 전체 이름은 다음과 같이 풀이됩니다: Qwen3 — 3세대 시리즈, 235B — 총 2,350억 개의 매개변수, A22B — 각 요청에 220억 개의 활성 매개변수, Instruct — 지침을 따르도록 훈련된 버전, 2507 — 2025년 7월 릴리스, FP8 — 메모리 최적화를 위한 8비트 양자화.
핵심 아키텍처 특징은 MoE(Mixture of Experts)입니다. 모든 토큰이 모든 매개변수를 통과하는 '밀집' 모델(GPT-5.5, Claude Sonnet 4.6)과 달리 MoE 모델은 각 요청에 대해 특정 '전문가' 하위 집합(신경망의 특수 블록)만 활성화합니다. Qwen3-235B의 경우 2,350억 개의 매개변수 중 각 토큰에 대해 220억 개, 즉 10% 미만이 활성화됩니다. 이는 220억 개 모델의 계산 비용으로 2,000억 개 이상의 매개변수 모델 수준의 품질을 제공합니다.
실질적으로 이는 다음과 같은 의미입니다. 이 모델은 속도에 비해 예상보다 똑똑합니다. 비슷한 품질의 밀집 모델보다 훨씬 빠르게 요청을 처리하며, 추론에 필요한 VRAM이 훨씬 적습니다. 이것이 바로 MoE가 2025-2026년 대규모 모델의 주류 아키텍처가 된 이유입니다.
Qwen3-235B의 컨텍스트 창은 131,072 토큰(약 100,000 단어)입니다. 이는 전체 책, 코드 베이스 또는 긴 법률 문서를 단일 요청으로 분석하기에 충분합니다. 이 모델은 한국어, 영어, 중국어, 아랍어, 힌디어 등 수십 개 언어를 포함하여 119개 언어를 지원하여 시장에서 가장 다국어 모델 중 하나입니다.
특성 및 벤치마크
Qwen3-235B는 대규모 클로즈드 및 오픈 모델들과 경쟁합니다. 주요 특성에 대한 비교는 다음과 같습니다:
| 모델 | 파라미터 | 컨텍스트 | MoE | Open Source | 가격 (100만 토큰당) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B 활성) | 131K | 네 | 네 (Apache 2.0) | $0.07+ (호스팅) |
| GPT-5.5 (OpenAI) | ~1.8T (추정) | 128K | 네 (추정) | 아니오 | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | 공개 안 됨 | 200K | 아니오 (추정) | 아니오 | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B 활성) | 1M | 네 | 네 (Llama License) | $0.20+ (호스팅) |
| DeepSeek-R1 (DeepSeek) | 671B (37B 활성) | 128K | 네 | 네 (MIT) | $0.55 |
Qwen3-235B는 대부분의 벤치마크에서 GPT-5.5 및 Claude Sonnet 4.6에 필적하는 품질 수준을 보여줍니다. 오픈 가중치 MoE 모델로서 독점 제품보다 훨씬 저렴합니다. MoE 아키텍처는 요청마다 파라미터의 일부만 활성화하여 연산 비용을 급격히 줄입니다. Gonka 네트워크는 현재의 모델인 Kimi K2.6 및 MiniMax M2.7에도 동일한 저렴한 분산형 inference 원칙을 적용하고 있으며, 이는 JoinGonka Gateway를 통해 100만 토큰당 $0.003(GPT-5.5 및 Claude보다 수천 배 저렴)으로 이용할 수 있습니다.
MMLU-Pro, HumanEval, MATH-500, GSM8K 벤치마크에서 이 모델은 상위 3위권 내의 오픈소스 모델로 자리 잡았으며, 수학적 추론(reasoning) 작업에서는 DeepSeek-R1의 뒤를 잇습니다. 코드 생성, 번역 및 지시 수행 작업에서 Qwen3-235B는 Llama 4 Maverick을 꾸준히 앞서며 Claude Sonnet 4.6과 대등한 성능을 보입니다.
Gonka가 Qwen3-235B를 활용한 방식
Qwen3-235B가 네트워크의 핵심 모델이었을 당시, 이 모델은 Gonka 네트워크 상에서 추론에 최적화된 DiLoCo 프로토콜을 통해 분산 실행되었습니다. FP8 형식의 전체 모델을 실행하려면 약 640 GB의 비디오 메모리(VRAM)가 필요하며, 단일 GPU(H100 80GB나 H200 141GB도 부족함)로는 불가능합니다. 따라서 모델은 여러 ML 노드 간에 레이어 단위로 분할(텐서 병렬화 + 파이프라인 병렬화)되었습니다.
실제로 Qwen3-235B는 각각 최소 40 GB VRAM을 탑재한 8~16개의 GPU 노드 클러스터에서 실행되었습니다. Transfer Agents가 요청을 적절한 클러스터로 라우팅하고, 각 노드의 vLLM이 모델의 일부를 처리한 후 결과를 집계하여 사용자에게 반환했습니다. 전체 과정은 수백 밀리초 내에 이루어져 사용자는 자신의 요청이 전 세계에 흩어진 수십 개의 GPU에서 처리된다는 것을 체감할 수 없었습니다. 이러한 분산 추론 원칙은 현재 네트워크에서 실행 중인 모델들에도 동일하게 적용됩니다.
중요한 기술적 세부 정보: Gonka는 서빙 엔진으로 vLLM을 사용합니다. vLLM은 PagedAttention(다수의 요청을 병렬 처리할 때 비디오 메모리 사용을 최적화하는 알고리즘)을 통해 고성능 텍스트 생성을 가능하게 하는 오픈 소스 프로젝트입니다. 이를 통해 네트워크는 품질 저하 없이 수천 명의 동시 사용자에게 서비스를 제공할 수 있습니다.
이 모델은 네이티브 툴 콜링(Tool Calling)을 지원하여 모델의 응답에서 직접 함수나 도구를 호출할 수 있습니다. 이 기능은 PR #767을 통해 Gonka에 추가되었으며, 툴 호출 감지를 위한 임계값은 0.958로 설정되었습니다. Qwen3-235B를 통해 개발자들은 단일 요청으로 외부 API, 데이터베이스 및 도구와 상호작용하는 AI 에이전트를 구축할 수 있었습니다. 툴 콜링 지원 기능은 현재 실운영 중인 모델들에서도 그대로 유지되고 있습니다.
Gonka 네트워크는 120개 이상의 ML 노드로 통합된 4,000개 이상의 GPU(H100, H200, A100, RTX 4090 등)를 보유하고 있습니다. 이는 AI 추론을 위한 세계 최대 규모의 분산 GPU 네트워크 중 하나이며, 예전에는 이 자원이 Qwen3-235B에 집중되었으나 현재는 네트워크의 현행 모델인 Kimi K2.6 및 MiniMax M2.7을 서비스하는 데 사용됩니다.
지금 Qwen3-235B를 사용해볼 수 있나요
직답: Gonka 네트워크를 통해서는 이제 사용할 수 없습니다. Qwen3-235B는 네트워크에서 제외되었으므로, Gateway를 통해 qwen3-235b-a22b 식별자로 호출할 수 없습니다. 모델이 오픈(Apache 2.0)되어 있기 때문에 스스로 실행하거나 다른 open-weights 호스팅 서비스를 통해 호출할 수 있습니다(예: OpenRouter, 100만 토큰당 약 $0.071/$0.100).
Gonka가 제공하는 그 저렴한 분산형 inference를 원하신다면, 현재 네트워크 모델들을 사용하면 됩니다. JoinGonka API Gateway를 통해 OpenAI 호환 API로 Kimi K2.6 및 MiniMax M2.7을 이용할 수 있습니다. OpenAI용으로 작성된 모든 코드는 URL, API 키, 모델명만 변경하면 변경 없이 그대로 작동합니다.
현재 모델에 대한 요청 예시:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE 아키텍처를 설명해줘"}]
}'비용: 100만 토큰당 $0.003은 GPT-5.5 ($5.00/1M) 대비 1,700배, Claude Sonnet 4.6 ($3.00/1M) 대비 1,000배 저렴합니다. 가입 시 테스트용으로 1,000만 토큰을 무료로 받을 수 있습니다.
Gateway는 인기 있는 개발 도구와 호환됩니다. Quick Start는 Python, Node.js, curl을 통한 연결 방법을 설명합니다. IDE 통합(Cursor, Continue, Cline, Aider, Claude Code)과 AI 에이전트 프레임워크(LangChain, n8n, LibreChat, Open WebUI)도 지원합니다.
빠른 시작 단계:
- gate.joingonka.ai에 가입(지갑 연결 또는 생성)
- 대시보드에서 API 키 발급
- 코드 내의
api.openai.com을gate.joingonka.ai/api로 대체 - 현재 네트워크 모델 지정 —
moonshotai/Kimi-K2.6또는MiniMaxAI/MiniMax-M2.7(전체 목록은GET /v1/models엔드포인트 참조)
하비 프로젝트 수준의 가격으로 제공되는 엔터프라이즈급 분산형 inference는 여전히 건재하며, Qwen3-235B는 단지 더 새로운 네트워크 모델들에게 자리를 내주었을 뿐입니다. 동일한 가격과 품질 조합은 이제 Kimi K2.6 및 MiniMax M2.7에서 작동합니다.