テクノロジー

DiLoCo: Gonkaにおけるモデルの分散学習

GPT や Qwen のような大規模言語モデルは、超高速チャネルで接続された巨大な GPU クラスターでトレーニングされます。DiLoCo (Distributed Local Computation) はゲームのルールを変えます。単一のデータセンターなしで、通常のインターネット経由でそのようなモデルをトレーニングできるようにします。

分散学習が必要な理由

現代の AI モデルには、数百億のパラメーターが含まれています。このようなモデルをトレーニングするには、数百の GPU が同期して動作する必要があります。従来のアプローチは、すべての GPU を 1 つのデータセンターに集め、InfiniBand で接続することです。これは高価であり、規模を制限し、単一障害点を作成します。DiLoCo は、世界中のさまざまな場所にあるクラスター間でトレーニングを分散させることができます。

DiLoCoの仕組み

各 GPU クラスター(例:8xH100)は、AdamW オプティマイザーを使用してモデルをローカルでトレーニングします。約 1,000 ステップごとに、クラスターはグローバルオプティマイザー(Nesterov momentum)を介して互いに同期します。同期には最小限の帯域幅が必要です。通常のインターネットチャネルで十分です。これは、GPU がすべてのステップでデータを交換する古典的なアプローチとは根本的に異なります。

これがGonkaネットワークに何をもたらすか

DiLoCoのおかげで、Gonkaは世界中に分散したホストのGPUを使用して、300億から500億パラメータのモデルをトレーニングできます。単一のデータセンターは不要で、インターネットに接続された8つのGPUクラスタがあれば十分です。これにより、AIのトレーニングが真に分散化され、コミュニティ自身がトレーニングしたモデルへの道が開かれます。
DiLoCo は、インターネット経由で AI モデルをトレーニングする技術です。GPU クラスターは独立して動作し、同期はめったに行われないため、Gonka は集中化されたデータセンターなしでモデルをトレーニングできます。

もっと知りたいですか?

GNKエコノミーを学ぶか、今すぐ収益を上げ始めましょう。

こちらもご覧ください