D’après Beating, Google développe la puce d’inférence IA Frozen v2, qui intégrera une partie de l’architecture de Gemini directement dans le matériel afin de réduire la surcharge liée au calcul et au déplacement des données pendant l’exécution du modèle. La puce devrait traiter jusqu’à 6 à 10 fois plus de jetons par watt que le dernier TPU de Google, avec un déploiement prévu dès 2028 au plus tôt.
L’initiative vise à faire face à l’aggravation de la pénurie de puces chez Google, qui a déjà contraint Google Cloud à refuser des commandes de clients externes. Frozen v2 fonctionnera en parallèle avec les TPU ; tandis que les TPU prennent en charge différents modèles, Frozen v2 privilégie l’efficacité plutôt que la flexibilité.