지식 기반 섹션 ▾

기술

Qwen3-235B: 이전에 Gonka가 지원하던 모델

Gonka 네트워크는 단순한 GPU 대여 서비스를 넘어 AI 모델 추론(inference)을 위한 인프라를 제공합니다. 오랫동안 네트워크의 유일한 메인 모델은 Alibaba Cloud가 개발한 Qwen3-235B-A22B-Instruct였습니다. 시간이 흐르며 네트워크는 멀티 모델 아키텍처로 전환되었고, Qwen3-235B는 네트워크에서 제외되었습니다. 현재 Gonka는 Moonshot AI의 Kimi K2.6, MiniMax M2.7, 그리고 DeepSeek V4 Flash를 서비스하고 있습니다. 본 글에서는 Qwen3-235B가 어떤 모델이었는지, Gonka 네트워크에서 어떤 역할을 했는지, 그리고 무엇으로 대체되었는지 설명합니다. 주목할 만한 오픈 소스 MoE 모델로서 여전히 유용한 지표로 활용되고 있습니다.

Qwen3-235B란 무엇인가

Qwen3-235B-A22B-Instruct-2507-FP8은 Alibaba Cloud의 Qwen 팀이 개발한 Qwen3 제품군의 대규모 언어 모델(LLM)입니다. 전체 이름은 다음과 같이 풀이됩니다: Qwen3 — 3세대 시리즈, 235B — 총 2,350억 개의 매개변수, A22B — 각 요청에 220억 개의 활성 매개변수, Instruct — 지침을 따르도록 훈련된 버전, 2507 — 2025년 7월 릴리스, FP8 — 메모리 최적화를 위한 8비트 양자화.

핵심 아키텍처 특징은 MoE(Mixture of Experts)입니다. 모든 토큰이 모든 매개변수를 통과하는 '밀집' 모델(GPT-5.5, Claude Sonnet 4.6)과 달리 MoE 모델은 각 요청에 대해 특정 '전문가' 하위 집합(신경망의 특수 블록)만 활성화합니다. Qwen3-235B의 경우 2,350억 개의 매개변수 중 각 토큰에 대해 220억 개, 즉 10% 미만이 활성화됩니다. 이는 220억 개 모델의 계산 비용으로 2,000억 개 이상의 매개변수 모델 수준의 품질을 제공합니다.

실질적으로 이는 다음과 같은 의미입니다. 이 모델은 속도에 비해 예상보다 똑똑합니다. 비슷한 품질의 밀집 모델보다 훨씬 빠르게 요청을 처리하며, 추론에 필요한 VRAM이 훨씬 적습니다. 이것이 바로 MoE가 2025-2026년 대규모 모델의 주류 아키텍처가 된 이유입니다.

Qwen3-235B의 컨텍스트 창은 131,072 토큰(약 100,000 단어)입니다. 이는 전체 책, 코드 베이스 또는 긴 법률 문서를 단일 요청으로 분석하기에 충분합니다. 이 모델은 한국어, 영어, 중국어, 아랍어, 힌디어 등 수십 개 언어를 포함하여 119개 언어를 지원하여 시장에서 가장 다국어 모델 중 하나입니다.

특성 및 벤치마크

Qwen3-235B는 주요 폐쇄형 및 개방형 모델들과 경쟁하는 성능을 갖추고 있습니다. 핵심 성능 비교는 다음과 같습니다:

모델파라미터컨텍스트MoEOpen Source가격 (1M 토큰당)
Qwen3-235B (Alibaba)235B (22B 활성)131K있음있음 (Apache 2.0)$0.07+ (호스팅)
GPT-5.5 (OpenAI)~1.8T (추정)128K있음 (예상)없음$5.00
Claude Sonnet 4.6 (Anthropic)공개 안 됨200K없음 (예상)없음$3.00
Llama 4 Maverick (Meta)400B (17B 활성)1M있음있음 (Llama License)$0.20+ (호스팅)
DeepSeek-R1 (DeepSeek)671B (37B 활성)128K있음있음 (MIT)$0.55

Qwen3-235B는 대부분의 벤치마크에서 GPT-5.5 및 Claude Sonnet 4.6에 견줄만한 품질 수준을 보여줍니다. 오픈 웨이트 MoE 모델로서, MoE 아키텍처가 요청당 일부 파라미터만 활성화하여 연산 비용을 획기적으로 낮추기 때문에 독점적인 대안 모델들보다 훨씬 저렴합니다. Gonka 네트워크는 이 저렴한 분산형 inference 원리를 현재 운영 중인 Kimi K2.6MiniMax M2.7 모델에 적용하고 있으며, JoinGonka Gateway를 통해 1M 토큰당 $0.0047(GPT-5.5나 Claude 대비 수백~수천 배 저렴)로 제공하고 있습니다.

MMLU-Pro, HumanEval, MATH-500, GSM8K 벤치마크에서 수학적 추론(reasoning) 과제에서는 DeepSeek-R1에 이어 3대 오픈 소스 모델에 속합니다. 코드 생성, 번역, 지시 사항 준수 과제에서는 Qwen3-235B가 Llama 4 Maverick을 꾸준히 앞서며 Claude Sonnet 4.6과 대등한 성능을 보입니다.

Gonka가 Qwen3-235B를 활용한 방식

Qwen3-235B가 네트워크의 핵심 모델이었을 당시, 이 모델은 Gonka 네트워크 상에서 추론을 위해 최적화된 DiLoCo 프로토콜을 통해 분산 실행되었습니다. FP8 형식의 전체 모델은 약 640GB의 비디오 메모리(VRAM)를 요구하며, 이는 H100 80GB나 H200 141GB와 같은 단일 GPU에는 담을 수 없는 크기입니다. 따라서 모델은 여러 ML 노드 간에 레이어별로 분할(tensor parallelism + pipeline parallelism)되어 운영되었습니다.

실제로 Qwen3-235B는 각각 최소 40GB VRAM을 갖춘 8~16개의 GPU 노드 클러스터에서 작동했습니다. Transfer Agent가 요청을 필요한 클러스터로 라우팅하고, 각 노드의 vLLM이 모델의 조각을 처리한 뒤 결과를 취합하여 사용자에게 반환합니다. 이 모든 과정은 수백 밀리초 내에 이루어져 사용자는 자신의 요청이 전 세계 수십 개의 GPU에 의해 처리되고 있음을 체감할 수 없었습니다. 이러한 분산 추론 원리는 현재 운용 중인 모델들에도 동일하게 적용됩니다.

중요한 기술적 상세: Gonka는 서빙 엔진으로 vLLM을 사용합니다. vLLM은 PagedAttention을 통해 고성능 텍스트 생성을 제공하는 오픈 소스 프로젝트로, 다수의 요청을 병렬 처리할 때 비디오 메모리 사용을 최적화하는 알고리즘입니다. 이를 통해 네트워크는 품질 저하 없이 수천 명의 동시 사용자에게 서비스를 제공할 수 있습니다.

이 모델은 네이티브 툴 콜링(tool calling)을 지원하여 모델 답변에서 직접 함수나 도구를 호출할 수 있습니다. 이 기능은 PR #767을 통해 Gonka에 추가되었으며, 툴 호출을 감지하기 위한 임계값은 0.958로 설정되었습니다. Qwen3-235B를 통해 개발자들은 외부 API, 데이터베이스 및 도구와 상호작용하는 AI 에이전트를 단일 요청으로 구축할 수 있었습니다. 툴 콜링 지원은 현재 네트워크 모델들에서도 유지되고 있습니다.

Gonka 네트워크는 120개 이상의 ML 노드로 결합된 4,000개 이상의 GPU(H100, H200, A100, RTX 4090 등)를 보유하고 있습니다. 이는 세계 최대 규모의 AI 추론용 분산 GPU 네트워크 중 하나이며, 과거에는 이 파워가 Qwen3-235B에 집중되었지만 오늘날에는 네트워크의 실질적인 현역 모델인 Kimi K2.6, MiniMax M2.7, DeepSeek V4 Flash를 서빙하고 있습니다.

지금 Qwen3-235B를 사용해볼 수 있나요

직접적인 답변: Gonka 네트워크를 통해서는 더 이상 불가능합니다. Qwen3-235B는 네트워크에서 제거되었으므로, 식별자 qwen3-235b-a22b를 사용하여 당사 Gateway를 통해 호출할 수 없습니다. 해당 모델은 오픈 소스(Apache 2.0)이므로, 직접 실행하거나 OpenRouter와 같은 타사 open-weights 모델 호스팅 서비스를 통해 여전히 접근할 수 있습니다(대략 1M 토큰당 $0.071/$0.100).

만약 Gonka를 찾는 이유인 저렴한 분산형 inference가 필요하다면, 이는 여전히 네트워크에서 작동 중인 다른 모델들을 통해 이용할 수 있습니다. JoinGonka API Gateway를 통해 Kimi K2.6, MiniMax M2.7 및 DeepSeek V4 Flash를 OpenAI 호환 API로 사용할 수 있습니다. OpenAI를 위해 작성된 모든 코드는 수정 없이 작동하며, URL, API 키, 모델명만 교체하면 됩니다.

작동 중인 모델에 대한 요청 예시:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "MoE 아키텍처에 대해 설명해줘"}]
  }'

비용: 100만 토큰당 $0.0047 — 이는 GPT-5.5($5.00/1M)보다 약 800배, Claude Sonnet 4.6($3.00/1M)보다 약 500배 저렴합니다. 가입 시 테스트용으로 무료 1.5M 토큰을 제공합니다.

Gateway는 대중적인 개발 도구와 호환됩니다. Quick Start에서 Python, Node.js, curl을 통한 연결 방법을 확인할 수 있습니다. 또한 Cursor, Continue, Cline, Aider, Claude Code와 같은 IDE 통합과 LangChain, n8n, LibreChat, Open WebUI 등 AI 에이전트 프레임워크를 지원합니다.

빠른 시작을 위한 단계:

  1. gate.joingonka.ai에 가입합니다(지갑을 연결하거나 새로 생성).
  2. Dashboard에서 API 키를 발급받습니다.
  3. 코드 내 api.openai.comgate.joingonka.ai/api로 교체합니다.
  4. 현재 네트워크 모델인 moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 또는 deepseek-ai/DeepSeek-V4-Flash-0731을 지정합니다(전체 목록은 GET /v1/models 엔드포인트 확인).

취미 프로젝트 수준의 가격으로 제공되는 엔터프라이즈급 분산형 inference는 계속 유지되며, Qwen3-235B는 단지 네트워크의 최신 모델들에게 자리를 내어준 것입니다. 동일한 가격 대비 성능을 이제 Kimi K2.6, MiniMax M2.7 및 DeepSeek V4 Flash에서 경험할 수 있습니다.

Qwen3-235B-A22B는 Alibaba Cloud에서 제공하는 2350억 파라미터(활성 파라미터 220억) 규모의 MoE 모델로, 초기 단계에서 분산형 AI inference를 위한 Gonka 네트워크의 핵심 모델이었습니다. MoE 아키텍처 덕분에 최고 수준의 독점 모델들과 동등한 성능을 훨씬 낮은 연산 비용으로 제공합니다. 현재 Qwen3-235B는 네트워크에서 제외되었으며, 현재 Gonka 모델은 Kimi K2.6, MiniMax M2.7, DeepSeek V4 Flash입니다. 이 모델들은 JoinGonka Gateway를 통해 OpenAI 호환 API로 1M 토큰당 $0.0047에 이용 가능합니다. Qwen3-235B 자체는 오픈 소스(Apache 2.0)로 공개되어 있으며, 타사 open-weights 모델 호스팅 서비스를 통해 이용할 수 있습니다.

더 자세히 알고 싶으세요?

다른 섹션을 탐색하거나 지금 GNK를 얻기 시작하세요.

Gonka 현행 모델 체험하기 →