powered by TechFeed
表示モード
Apple

iPhoneで14B、Macなら最大1.6兆パラメータのLLMをローカル実行——Appleがデバイス別の推論上限を条件付きで公式公開

9月25日、Omar Sohailが「Apple Claims Its iPhones Can Run LLMs With 14B Active Parameters, With Its Macs Capable Of Supporting 1.6+ Trillion AI Models, Under Certain Conditions」と題した記事を公開した。AppleがiPhone・iPad・Macシリーズそれぞれでローカル実行可能なLLMの規模を公式に示したことについて詳しく紹介されている。iPhoneで14B、Macなら最大1.6兆パラメータ——Appleがオンデバイス推論の上限を公開Appleが、デバイス別にローカルで動作可能なLLM(大規模言語モデル)の目安を図表として公開した。クラウドAPIを使わずに手元のデバイスで推論を完結させる「ローカル推論」への関心が高まる中、ハードウェアメーカー側が公式に対応スペックを明示するのは珍しい動きだ。ただし、あくまで「一定の条件下(Under Certain Conditions)」における上限値であり、すべての構成・モデルで無条件に...

9月25日、Omar Sohailが「Apple Claims Its iPhones Can Run LLMs With 14B Active Parameters, With Its Macs Capable Of Supporting 1.6+ Trillion AI Models, Under Certain Conditions」と題した記事を公開した。AppleがiPhone・iPad・Macシリーズそれぞれでローカル実行可能なLLMの規模を公式に示したことについて詳しく紹介されている。

iPhoneで14B、Macなら最大1.6兆パラメータ——Appleがオンデバイス推論の上限を公開

Appleが、デバイス別にローカルで動作可能なLLM(大規模言語モデル)の目安を図表として公開した。クラウドAPIを使わずに手元のデバイスで推論を完結させる「ローカル推論」への関心が高まる中、ハードウェアメーカー側が公式に対応スペックを明示するのは珍しい動きだ。ただし、あくまで「一定の条件下(Under Certain Conditions)」における上限値であり、すべての構成・モデルで無条件に達成できるわけではない点に注意が必要だ。

デバイス別の対応パラメータ数

Appleが示した図表によると、各デバイスの対応規模は以下のとおりだ。

デバイス 最大ユニファイドメモリ メモリ帯域幅 対応LLMの規模(アクティブパラメータ数)
iPhone / iPad(16GB) 16GB 76GB/s 14B
MacBook Air / Mac mini 64GB 307GB/s 70B
MacBook Pro(上位モデル) 128GB — 120B
Mac Studio(M5 Ultra) 512GB 1.2TB/s 480B
Mac Studio 複数クラスタ構成 最大2TB以上 — 1.6兆(1.6T)

「アクティブパラメータ数(active parameters)」とは、MoE(Mixture of Experts)アーキテクチャにおいて推論時に実際に使用されるパラメータの数を指す。総パラメータ数よりも小さくなるケースが多く、同じ「1.6兆パラメータ」でも全パラメータを同時に使用するわけではない点は理解しておきたい。

iPhone向けの注目点:A20 Proはすでに仕様を超えている

iPhoneとiPadについて、Appleは16GB統合メモリと76GB/sのメモリ帯域幅をローカル推論の推奨スペックとして挙げている。ただし、すでに発表済みのA20 Proチップは115.2GB/sの帯域幅を持っており、この推奨値をすでに上回っている。つまり、次世代iPhoneでは14Bモデルをより快適に動かせる可能性がある。

Mac Studioで1.6兆パラメータは現実か——コストの壁

Mac StudioはM5 Ultra搭載時に最大512GBのユニファイドメモリと1.2TB/sのメモリ帯域幅を持ち、単体で480Bパラメータのモデルを動かせるとされる。さらに複数台をApple Silicon Interconnectで接続したクラスタ構成を組むことで、合計メモリを拡張し、最終的に1.6兆パラメータモデルの実行も可能とAppleは説明する。なお、元記事における具体的なクラスタ台数・合計メモリの記述については、情報ソースの段階で数字に揺れがあるため、正確な構成については元記事および一次情報を直接確認することを推奨する。

ただし、現実的なコストは無視できない。

  • M5 Ultra搭載Mac Studio(36コアCPU / 80コアGPU / 32コアNeural Engine / 1TB SSD)の価格:**$10,700**
  • 複数台クラスタ構成では台数に応じてコストが線形に増加し、4台構成で**$43,196**に達する
  • 1.6兆パラメータモデルを実行するために必要な構成では、単純計算で**$86,392**規模のコストになる

加えて、記事執筆時点でAppleのオンラインストアでは256GBメモリ搭載モデルのみが販売されており、米国内でも居住地によっては納期が15〜17週間に達するという状況だ。個人や小規模チームが気軽に試せる環境ではなく、大規模ローカル推論はエンタープライズ・研究機関向けの話題といえる。

情報として欠けているもの

Appleはデバイスごとの対応規模を示したものの、具体的にどのLLMを動かすべきか、また量子化(quantization)をどの程度適用すれば各デバイスで動作するかについては触れていない。量子化とはモデルの重みを低ビット精度で表現してメモリ使用量を削減する手法で、ローカル推論では事実上必須の技術だ。公式ガイドとしては情報が不完全であり、この点はエンジニアにとって物足りない内容といえる。

なお、本記事が参照している情報は、X(旧Twitter)上の@aaronp613によるポストを起点としており、Appleの公式ドキュメントや開発者向けページから直接引用されたものではない。Appleが図表を公開した正確な媒体・ページについては、元記事本文を通じて確認することを勧める。

詳細はApple Claims Its iPhones Can Run LLMs With 14B Active Parameters, With Its Macs Capable Of Supporting 1.6+ Trillion AI Models, Under Certain Conditionsを参照していただきたい。