Beatingによれば、GoogleはFrozen v2のAI推論チップを開発しており、Geminiのアーキテクチャの一部をハードウェアに直接組み込むことで、モデル実行中の計算とデータ移動にかかるオーバーヘッドを削減します。このチップは、Googleの最新のTPUよりも1ワットあたり最大6〜10倍多くのトークンを処理できる見込みで、配備は早ければ2028年までに予定されています。
この取り組みは、Googleのチップ不足が悪化している問題への対応を目的としており、すでにGoogle Cloudが外部顧客からの注文を断らざるを得なくなっています。Frozen v2はTPUと併用されます。TPUはさまざまなモデルをサポートする一方で、Frozen v2は柔軟性より効率を優先します。