đŸ€– Google prĂ©parerait une puce IA ultra-efficace pour Gemini

Restez toujours informé : suivez-nous avec Google (cliquez sur ☆)

Google prĂ©parerait une nouvelle puce pour serveurs visant Ă  exĂ©cuter ses modĂšles Gemini avec une consommation d’énergie plus faible, avec une augmentation de l'efficacitĂ© d'un facteur 6 Ă  10. L’information a Ă©tĂ© rĂ©vĂ©lĂ©e par The Information et reprise par Reuters. L’entreprise n’a pas encore annoncĂ© officiellement ce composant, dont le nom interne serait Frozen v2.

Les grands modĂšles d’intelligence artificielle demandent d’importantes capacitĂ©s de calcul, surtout au moment de produire une rĂ©ponse. Cette phase, appelĂ©e infĂ©rence, mobilise des processeurs spĂ©cialisĂ©s dans les centres de donnĂ©es. Son coĂ»t dĂ©pend notamment du nombre de requĂȘtes, de leur longueur et de l’efficacitĂ© du matĂ©riel.

Le projet consisterait Ă  intĂ©grer dans le silicium une partie fixe du fonctionnement de Gemini. Contrairement Ă  une puce trĂšs polyvalente, un accĂ©lĂ©rateur ainsi spĂ©cialisĂ© peut Ă©viter certains calculs ou transferts de donnĂ©es. Cela permettrait de rĂ©duire considĂ©rablement l’énergie nĂ©cessaire pour gĂ©nĂ©rer chaque unitĂ© de texte.

Cette promesse doit toutefois rester au conditionnel. Les informations publiĂ©es reposent sur des sources anonymes et Google n’a pas dĂ©taillĂ© l’architecture, les performances ou le calendrier de disponibilitĂ©. Les estimations Ă©voquĂ©es dans la presse ne constituent donc pas des rĂ©sultats vĂ©rifiĂ©s par l’entreprise.

Google dispose dĂ©jĂ  de ses propres TPU, des puces conçues pour l’apprentissage automatique. Frozen v2 s’inscrirait dans cette stratĂ©gie d’intĂ©gration matĂ©rielle, alors que les besoins en calcul pour l’IA gĂ©nĂ©rative augmentent rapidement. L’enjeu est technique, mais aussi Ă©conomique.

Un composant optimisĂ© pour un modĂšle prĂ©cis peut ĂȘtre trĂšs efficace, mais moins flexible qu’un processeur gĂ©nĂ©raliste. Toute Ă©volution majeure de Gemini pourrait imposer une nouvelle conception matĂ©rielle, et donc la production de nouvelles puces. C’est le compromis habituel entre performance spĂ©cialisĂ©e et capacitĂ© d’adaptation.

Si ce projet aboutit, son intĂ©rĂȘt se mesurera surtout Ă  l’échelle des centres de donnĂ©es. Une baisse de l’énergie utilisĂ©e par rĂ©ponse pourrait rĂ©duire les coĂ»ts de fonctionnement et libĂ©rer de la capacitĂ© de calcul pour des modĂšles plus performants.