Google veut graver l’architecture de Gemini dans des puces, et l’efficacité énergétique de l’inférence pourrait augmenter jusqu’à 10 fois

robot
Création du résumé en cours
ME AI 消消息, selon Beating 监测, Google serait en train de développer une puce d’inférence IA Frozen v2. Elle figerait directement dans la puce certaines parties de l’architecture de Gemini, afin de réduire les calculs et le transfert de données lors de l’exécution du modèle. En interne, on s’attend à ce qu’elle atteigne un nombre de tokens par watt de 6 à 10 fois celui des derniers TPU. Google prévoit un déploiement dès 2028 au plus tôt. Google espère l’utiliser pour atténuer la pénurie de puissance de calcul. Le manque a déjà forcé Google Cloud à refuser certaines commandes de clients externes. Frozen v2 coexistera en parallèle avec les TPU. Les TPU peuvent faire tourner différents modèles, tandis que Frozen v2 mise sur la flexibilité pour gagner en efficacité. C’est aussi un pari d’architecture. À l’avenir, si Gemini change fortement la conception de son socle, ces puces pourraient ne plus être utilisables. (Source : BlockBeats)
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
Aucun commentaire
  • Épinglé