9月20日、Omar Sohailが「Apple's A20 Pro Demonstrated To Be An On-Device AI Beast, Can Run A 27B Parameter Model At Double The Speed Of The iPhone 17 Pro's A19 Pro」と題した記事を公開した。AppleのA20 ProチップがiPhone 17 ProのA19 Proに比べて2倍の速度で270億パラメータモデルをオンデバイス実行できることを実証したデモンストレーションについて詳しく紹介されている。
iPhone 18 Proが27Bモデルをオフラインで動かす
エンジニアのAdrien Grondinが、iPhone 18 Pro上でBonsai 27B(270億パラメータのAIモデル)を動作させる様子をXに投稿した。トークン生成速度はiPhone 17 Proと比較して約2倍に達しており、同世代スマートフォンのオンデバイスAI性能の伸びとしては際立った数字だ。クラウドへの接続なしに270億パラメータ規模のモデルがスマートフォン単体で実用速度で動くという事実は、オンデバイスAIの到達点として注目に値する。
この性能向上を支えるのは、主に2つのハードウェア変更だ。
- デュアル16コアNeural Engine:Apple Silicon史上初の構成で、NPU向けワークロードにおけるピークスループットは、搭載する7コアGPUを上回る
- 12GB 96ビット LPDDR5X RAM:ユニファイドメモリ帯域幅は115.2GB/sに達し、iPhone 17 Proシリーズの構成を大きく超える
Bonsai 27Bが採用する1ビット量子化(モデルの重みを1ビット精度に極限まで圧縮し、ファイルサイズを劇的に削減する手法)により、Bonsai 27B自体はメモリ搭載量の少ないデバイスでも動作できる軽量さを実現している。12GBメモリと高帯域幅メモリを持つiPhone 18 Proでは、スロットルなしで快適に動作する。
トレードオフ:Bonsai 2は乗らない
ただし、手放しで喜べない側面もある。Bonsaiの後継モデルであるBonsai 2は2ビット量子化を採用しており、ファイルサイズがiPhone 18 Proのローカルストレージに収まらない。その結果、Bonsai 2をiPhone上で動かそうとすると性能劣化が生じる。
スマートフォン上でより高密度なAIモデルを実行するには、メモリ容量の拡大が不可欠だが、現時点ではiPhone 18 Proの12GBがボトルネックになっている。今後のApple製品でメモリ容量が増加すれば、より大きなモデルへの対応も視野に入る。
NPU特化ワークロードにおける推論性能の新基準
今回の数字で特に見逃せないのは、Neural EngineのピークスループットがSoC内の7コアGPUを上回るという点だ。ただし、これはNPU向けに最適化されたワークロードにおける比較であり、GPU全般の性能を否定するものではない点には留意が必要だ。
デュアル構成(合計32コア)のNeural Engineはオンデバイス推論に特化した設計であり、インターネット接続なしに大規模モデルを実用速度で動かすというユースケースを現実的なものにしている。
※編集部の考察:オンデバイスAIをめぐっては、QualcommがSnapdragon 8 Eliteで45 TOPSのNPU性能をアピールするなど、各社がNPU強化を競っている。Appleがデュアル構成という独自アプローチを採ったことは、この競争軸の中でも異色の判断と言える。また、AppleはiOS上のApple Intelligenceにおいて一部推論をオンデバイスで処理する方針を打ち出しており、今回のNeural Engine強化はその基盤強化とも合致する。
数字の整理
| 項目 | iPhone 17 Pro(A19 Pro) | iPhone 18 Pro(A20 Pro) |
|---|---|---|
| Neural Engine | 16コア | デュアル16コア(計32コア) |
| RAM | 不明/非公開 | 12GB 96ビット LPDDR5X |
| メモリ帯域幅 | 不明/非公開 | 115.2GB/s |
| Bonsai 27B 速度 | 基準 | 約2倍 |
iPhone 17 Pro側のRAMおよびメモリ帯域幅は元記事に記載がなく、現時点では非公開・不明扱いとなっている。




