powered by TechFeed
表示モード
主要ニュース

DeepSeekがNvidia互換APIでHuawei製GPU向けツールをオープンソース公開 — CUDA版との最大45倍のスター数格差が示す普及の壁

10月8日、Rahim Amirが「Huawei and DeepSeek release open source AI tools in a bid to lower Nvidia exposure」と題した記事を公開した。DeepSeekのCUDA版リポジトリが8,000〜10,000超のGitHubスターを集める一方、今回公開されたHuawei Ascend向け版は200〜500台にとどまる。この落差は「開発者の無関心」ではなく、ハードウェアへのアクセス自体が世界の大半の開発者に閉ざされているという構造的な現実を映している。

10月8日、Rahim Amirが「Huawei and DeepSeek release open source AI tools in a bid to lower Nvidia exposure」と題した記事を公開した。DeepSeekのCUDA版リポジトリが8,000〜10,000超のGitHubスターを集める一方、今回公開されたHuawei Ascend向け版は200〜500台にとどまる。この落差は「開発者の無関心」ではなく、ハードウェアへのアクセス自体が世界の大半の開発者に閉ざされているという構造的な現実を映している。


本質は「切り替えコストの削減」

DeepSeekが公開した新リポジトリは2つだ。行列積演算を担うDeepGEMM-Ascendと、Mixture-of-Experts(MoE)モデルが依存するall-to-all通信を処理するDeepEP-Ascendである。

MoE(Mixture-of-Experts)とは、入力ごとに一部の「専門家」サブネットワークだけを選択的に活性化するアーキテクチャで、全パラメータを毎回使う密なモデルと比べて計算効率が高い。DeepSeek自身のモデルもMoEを採用しており、GPU間の大規模な通信(all-to-all)が性能のボトルネックになりやすい。DeepEP-Ascendはその部分を担うライブラリだ。

この2つの設計に共通する特徴がある。DeepGEMM-AscendはCUDA版と同じPythonパッケージ名・API形状を維持しており、DeepEP-AscendもNvidia版とパブリックバッファのインターフェースを揃えている。つまり、ベンチマークで性能を誇示するのではなく、CUDAからAscendへの移行コストを下げることが設計の主眼だ。

NvidiaのCUDAエコシステムの堀(moat)は性能だけでなく、開発者が「乗り換えるには高すぎる」と感じるスイッチングコストにある。CUDAは2006年のリリース以来、GPU汎用計算の事実上の標準として定着しており、膨大なライブラリ・ツール・人材資産が積み上がっている。DeepSeekの公開はその構造に正面から切り込む試みである。


今回の公開内容の全体像

今回の発表には既存プロジェクトのアップデートも含まれていた。TileKernels、DeepSelect、FlashMLAの3つはすでに存在するプロジェクトへのAscend対応追加であり、完全に新規のリポジトリはDeepGEMM-AscendとDeepEP-Ascendの2つに限られる。

Bloombergが「中国版CUDAへの回答」と表現したTileLangについては、2025年1月にすでにオープンソース化されており、HuaweiのAscendアダプターは9月29日に外部リポジトリ「tilelang-ascend」として公開済みだ。TileLangはNvidiaのCUDAバックエンドもサポートしており、DeepSeek固有のツールというよりも、複数の中国製アクセラレータベンダーが静かに標準化を進めている共通抽象レイヤーという性格が強い。


動作要件は狭い

技術的な制約も見落とせない。

  • DeepGEMM-Ascend:Ascend 950シリーズ+CANN 9.20が必要
  • DeepEP-Ascend:Ascend 950シリコン+UBMEMコネクティビティが必要

CANNはHuaweiがAscendアクセラレータ向けに開発した独自のソフトウェアスタックで、NvidiaにおけるCUDAに相当するレイヤーだ。ただし後述するように、その成熟度はCUDAとは大きな開きがある。

対象となるのはHuawei社内のエンジニアと、当該シリコンにアクセスできる限られた中国のAIラボに絞られる。ベンチマークはプルーフ・オブ・コンセプト用のハードウェアキットで計測されたものであり、一般向けリリースではないとDeepSeek自身が認めている。


GitHubスターが示すアクセス格差の現実

コミュニティの反応は数字に如実に出ている。

リポジトリ スター数 フォーク数
DeepGEMM(CUDA版) 8,522 1,359
DeepGEMM-Ascend 515 39
DeepEP(CUDA版) 10,200超 —
DeepEP-Ascend 224 —

CUDA版との差は歴然としている。この数字を「開発者の関心の低さ」と読むのは正確ではない。エンジニアがAscend版に手を伸ばすには、まずハードウェアへのアクセスそのものが必要であり、Ascend 950シリーズは現時点で中国国内の限られた組織にしか流通していない。スター数の差は反応の温度差というより、リポジトリを試せるハードウェアを持つ人口の差をそのまま反映している。


Ascendのソフトウェアスタックへの不信感

ハードウェアの入手性以前に、ソフトウェア品質への信頼の問題もある。ChinaTalk(中国テクノロジー産業を専門に取材するニュースレター)がFinancial Timesを引いて伝えたところでは、Huawei社内の研究者がCANNを「使いにくく不安定」と評しており、中国の開発者からは910B上での作業を「落とし穴だらけの道」と称する声が上がっている。

Epoch AI(AIの進歩を定量的に追跡する独立系研究機関)の調査によれば、HuaweiはBaiduやTencentのような大口顧客にエンジニアチームを派遣し、CUDAで書かれた学習コードの移植と運用サポートを手動で行っているという。ベンダー側がマンパワーで移行を支援しなければ実用に耐えない、という実態がここに透けて見える。

フロンティアラボが自社のプロダクション環境で使ったカーネルをそのまま公開することは、ベンダーの公式ドキュメントをリアルなコードで補完する意味を持つ。ただしそのコードが動くのは、世界の多くの開発者がダウンロードすらできないファームウェア上の、特定の1チップファミリーのみという現実は変わらない。


詳細はHuawei and DeepSeek release open source AI tools in a bid to lower Nvidia exposureを参照していただきたい。