Google prĂ©parerait une nouvelle puce pour serveurs visant Ă exĂ©cuter ses modĂšles Gemini avec une consommation dâĂ©nergie plus faible, avec une augmentation de l'efficacitĂ© d'un facteur 6 Ă 10. Lâinformation a Ă©tĂ© rĂ©vĂ©lĂ©e par The Information et reprise par Reuters. Lâentreprise nâa pas encore annoncĂ© officiellement ce composant, dont le nom interne serait Frozen v2.
Les grands modĂšles dâintelligence artificielle demandent dâimportantes capacitĂ©s de calcul, surtout au moment de produire une rĂ©ponse. Cette phase, appelĂ©e infĂ©rence, mobilise des processeurs spĂ©cialisĂ©s dans les centres de donnĂ©es. Son coĂ»t dĂ©pend notamment du nombre de requĂȘtes, de leur longueur et de lâefficacitĂ© du matĂ©riel.

Le projet consisterait Ă intĂ©grer dans le silicium une partie fixe du fonctionnement de Gemini. Contrairement Ă une puce trĂšs polyvalente, un accĂ©lĂ©rateur ainsi spĂ©cialisĂ© peut Ă©viter certains calculs ou transferts de donnĂ©es. Cela permettrait de rĂ©duire considĂ©rablement lâĂ©nergie nĂ©cessaire pour gĂ©nĂ©rer chaque unitĂ© de texte.
Cette promesse doit toutefois rester au conditionnel. Les informations publiĂ©es reposent sur des sources anonymes et Google nâa pas dĂ©taillĂ© lâarchitecture, les performances ou le calendrier de disponibilitĂ©. Les estimations Ă©voquĂ©es dans la presse ne constituent donc pas des rĂ©sultats vĂ©rifiĂ©s par lâentreprise.
Google dispose dĂ©jĂ de ses propres TPU, des puces conçues pour lâapprentissage automatique. Frozen v2 sâinscrirait dans cette stratĂ©gie dâintĂ©gration matĂ©rielle, alors que les besoins en calcul pour lâIA gĂ©nĂ©rative augmentent rapidement. Lâenjeu est technique, mais aussi Ă©conomique.
Un composant optimisĂ© pour un modĂšle prĂ©cis peut ĂȘtre trĂšs efficace, mais moins flexible quâun processeur gĂ©nĂ©raliste. Toute Ă©volution majeure de Gemini pourrait imposer une nouvelle conception matĂ©rielle, et donc la production de nouvelles puces. Câest le compromis habituel entre performance spĂ©cialisĂ©e et capacitĂ© dâadaptation.
Si ce projet aboutit, son intĂ©rĂȘt se mesurera surtout Ă lâĂ©chelle des centres de donnĂ©es. Une baisse de lâĂ©nergie utilisĂ©e par rĂ©ponse pourrait rĂ©duire les coĂ»ts de fonctionnement et libĂ©rer de la capacitĂ© de calcul pour des modĂšles plus performants.