Actualités du secteur

Pourquoi Google construit-il un cerveau sur mesure pour ses modèles d'IA ?

Google prévoit Frozen v2, une puce personnalisée intégrant la logique de l'IA Gemini pour une efficacité décuplée. Voici comment ce changement matériel impacte les coûts et la disponibilité de l'IA.
Pourquoi Google construit-il un cerveau sur mesure pour ses modèles d'IA ?

Chaque fois que vous demandez à une IA de résumer un long document ou de générer un morceau de code, un processus industriel silencieux s'enclenche. Les mots sur votre écran sont le produit final, mais les matières premières sont l'électricité et le silicium. Pour produire un seul paragraphe de texte, une ferme de serveurs située dans un endroit comme l'Iowa ou la Finlande consomme suffisamment d'énergie pour faire fonctionner un appareil ménager pendant plusieurs minutes. Ces serveurs reposent sur des puces qui agissent comme le pétrole brut numérique de notre époque, alimentant chaque requête de recherche et chaque réponse automatisée.

Actuellement, la demande pour ces matériaux numériques est si élevée que les lignes d'approvisionnement fléchissent. Google tente désormais de contourner ce goulot d'étranglement en modifiant fondamentalement le fonctionnement de son matériel. L'entreprise développe une nouvelle puce de serveur, nommée officieusement Frozen v2, qui intègre des éléments de son modèle d'IA Gemini directement dans le matériel physique. C'est une rupture avec le fonctionnement habituel des ordinateurs. Traditionnellement, une puce est un outil polyvalent qui exécute n'importe quel logiciel qu'on lui donne. Google construit maintenant une puce qui est, en quelque sorte, pré-formée pour s'adapter à la logique spécifique de sa propre IA.

le coût d'une pensée numérique

Pour comprendre pourquoi Google franchit cette étape, nous devons examiner l'efficacité d'un seul jeton (token) d'IA. Un jeton est approximativement l'équivalent d'un mot ou d'une partie de mot. Lorsqu'un modèle comme Gemini traite des informations, il déplace ces jetons à travers des couches de calculs mathématiques. Dans une configuration standard, le matériel dépense une quantité massive d'énergie simplement pour déplacer les données d'avant en arrière entre le processeur et la mémoire. Ce mouvement crée de la chaleur et consomme de l'électricité, ce qui se traduit par des coûts plus élevés pour l'entreprise et, à terme, pour l'utilisateur.

Google Cloud a récemment refusé des contrats de clients externes parce qu'il n'avait tout simplement pas assez de puissance de calcul pour tout le monde. Cette pénurie de capacité est une réalité industrielle que la plupart des utilisateurs ne voient jamais. Lorsqu'un fournisseur de cloud dit non à un contrat, c'est parce que ses centres de données sont physiquement pleins ou que ses factures d'énergie deviennent insoutenables. The Information rapporte que ces tensions internes sont ce qui a poussé le développement de Frozen v2. L'objectif est de fabriquer une puce six à dix fois plus efficace que les modèles actuels, sur la base du nombre de jetons servis par unité de puissance.

Concrètement, si Google peut fournir 10 fois plus de réponses d'IA avec la même quantité d'électricité, il résout deux problèmes à la fois. Cela réduit le coût astronomique de fonctionnement de Gemini et permet à l'entreprise de gérer plus d'utilisateurs sans construire dix fois plus de centres de données. Pour l'utilisateur moyen, cela pourrait faire la différence entre un outil d'IA gratuit et un outil caché derrière un mur de paiement de vingt dollars par mois.

le cloud atteint sa limite physique

Historiquement, les entreprises technologiques résolvaient les problèmes de vitesse en rendant les puces plus petites et en en installant davantage dans une seule pièce. Nous avons atteint un point où cette stratégie a des rendements décroissants. Les modèles d'IA modernes sont si vastes qu'ils nécessitent des milliers de puces travaillant en parfaite synchronisation. Si une puce est lente, tout le système attend.

Google utilise déjà ses propres unités de traitement de tenseur (TPU) pour une grande partie de son travail sur l'IA. Ce sont des puces spécialisées, mais elles restent assez flexibles pour exécuter de nombreux types de modèles différents. Frozen v2 est différent car il s'agit moins d'un outil polyvalent que d'un squelette spécialisé pour Gemini. En câblant des parties spécifiques du modèle directement dans le silicium, Google réduit le besoin pour la puce de « réfléchir » à la manière de traiter les données. Les instructions sont déjà là, gravées dans le matériel lui-même.

Cette approche comporte un compromis important. Si les ingénieurs modifient considérablement le modèle Gemini dans trois ans, une puce câblée pourrait devenir obsolète. C'est un pari risqué sur le fait que l'architecture actuelle de Gemini est la conception fondamentale pour la prochaine décennie. Les ingénieurs finalisent encore la quantité d'informations du modèle qui sera permanente dans le matériel, une décision qui déterminera la rigidité ou la flexibilité de la puce lorsqu'elle arrivera enfin en 2028.

comment frozen v2 change la donne des puces

Côté marché, cette initiative est une tentative claire de réduire la dépendance vis-à-vis de fournisseurs externes comme Nvidia. Bien que Google construise ses propres TPU, une grande partie du monde fonctionne encore sur les processeurs H100 et H200 de Nvidia. En créant une puce fondamentalement inséparable de son logiciel, Google crée une boucle fermée. Cela rend très difficile pour les concurrents d'égaler leur efficacité, car le concurrent n'a que le logiciel, tandis que Google possède le logiciel et le moteur spécialisé construit pour l'exécuter.

Caractéristique TPU Standard (Actuel) Frozen v2 (Projeté)
Fonction principale Entraînement et inférence IA générale Inférence optimisée spécifique à Gemini
Efficacité Référence 6x à 10x plus élevée par watt
Logique matérielle Définie par logiciel Éléments Gemini câblés
Calendrier de déploiement Actif 2028 et au-delà
Cas d'utilisation cible Support multi-modèles Services Gemini à haut volume

En regardant la situation globale, ce projet est une réponse à un marché volatil où tout le monde court après la même offre limitée de silicium. Les actions d'Alphabet ont augmenté de 3,3 % suite au rapport, ce qui montre que les investisseurs privilégient l'autosuffisance par-dessus tout en ce moment. Le marché reconnaît que l'entreprise disposant du matériel le plus efficace remporte la guerre des marges. S'il en coûte cinq cents à OpenAI pour répondre à une question et un demi-cent à Google, Google dispose d'un avantage systémique qu'il est presque impossible de surmonter par les seules mises à jour logicielles.

tracer le chemin du logiciel vers le matériel

En prenant du recul, nous pouvons voir comment cela affecte le cycle de vie d'un produit. Aux débuts d'une nouvelle technologie, le logiciel est rapide et le matériel est lent. Les développeurs modifient leur code chaque semaine, le matériel doit donc être une page blanche capable de s'adapter. À mesure qu'une technologie mûrit, le logiciel se stabilise sous une forme fixe. C'est à ce moment qu'il devient judicieux d'intégrer le logiciel dans le matériel.

Nous avons vu cela avec les jeux vidéo. Dans les années 1990, les ordinateurs utilisaient des processeurs généraux pour tout. Finalement, les entreprises ont créé des cartes graphiques (GPU) qui étaient câblées pour faire une seule chose : calculer des triangles et de la lumière. L'IA subit actuellement cette même transition. Frozen v2 est un signe émergent que l'IA n'est plus un projet logiciel expérimental. Elle devient un service public fondamental, comme l'électricité ou l'eau, où la priorité est la fourniture rentable à une échelle massive.

Curieusement, Bloomberg a récemment rapporté que Google avait dû retarder son dernier modèle Gemini car il n'atteignait pas les objectifs internes. Cela souligne les frictions de cette transition. Si le logiciel n'est pas encore parfait, le câbler dans une puce est une décision dangereuse. Le retard suggère que Google affine encore la « forme » de son IA avant de graver cette forme dans une production de silicium de plusieurs milliards de dollars. Une erreur dans la conception du matériel ne peut pas être corrigée par un correctif rapide ou une mise à jour du jour au lendemain.

la longue route vers 2028

Pour l'utilisateur moyen, 2028 semble être un long délai d'attente pour un chatbot plus rapide. Dans le monde du matériel industriel, quatre ans est un cycle de développement standard. Concevoir une puce, tester l'architecture et réserver du temps dans une usine de fabrication comme TSMC prend des années de préparation. Cela signifie que Google prend aujourd'hui des décisions concernant l'IA que vous utiliserez à la fin de la décennie.

Derrière le jargon, il s'agit de résilience. Google essaie de s'assurer que ses services restent disponibles même si les approvisionnements mondiaux en puces restent tendus. En fabriquant leur propre matériel spécialisé, ils sont moins vulnérables à la nature cyclique de l'industrie des semi-conducteurs. Ils construisent leur propre centrale électrique plutôt que d'acheter de l'électricité sur le réseau. Ce niveau d'intégration verticale est coûteux, mais il offre un niveau de contrôle qui manque à la plupart des autres entreprises technologiques.

Du point de vue du consommateur, vous ne verrez pas nécessairement un logo « Frozen v2 » sur votre téléphone ou dans votre navigateur. L'impact sera invisible. Vous remarquerez que Gemini répond plus vite, traite des documents plus longs sans ralentir, et propose peut-être des fonctionnalités plus avancées gratuitement. L'industrie lourde qui se déroule en arrière-plan — le coulage du silicium et l'optimisation des réseaux électriques — est ce qui rend possible l'expérience numérique légère.

ce que cela signifie pour votre abonnement mensuel

En fin de compte, le développement de Frozen v2 est un rappel que l'IA n'est pas seulement un phénomène numérique. C'est un phénomène physique. À mesure que les modèles deviennent plus complexes, le matériel doit devenir plus spécialisé pour suivre le rythme. C'est un passage pratique vers un avenir où nos appareils ne se contentent pas d'exécuter de l'IA, mais sont physiquement construits d'IA.

Pour l'instant, la meilleure façon de se préparer est d'observer comment ces outils sont intégrés dans vos habitudes quotidiennes. À mesure que l'efficacité s'améliore, l'IA passera probablement d'une boîte de discussion autonome à l'arrière-plan de chaque application que vous utilisez. Faites attention aux coûts. Si l'efficacité du matériel fait réellement un bond décuplé, nous devrions nous attendre à voir la tendance actuelle à la hausse des prix d'abonnement se stabiliser, voire s'inverser. Vous devriez rechercher des services capables de prouver qu'ils sont durables, car ce seront ceux qui survivront à la crise énergétique et capacitaire à venir. L'épine dorsale invisible d'Internet change, et le résultat sera un écosystème numérique plus rationalisé, bien que peut-être plus fermé.

Sources : The Information, Bloomberg News, Alphabet Investor Relations, Google Cloud Official Communications.

bg
bg
bg

On se retrouve de l'autre côté.

Notre solution de messagerie cryptée de bout en bout et de stockage en nuage constitue le moyen le plus puissant d'échanger des données en toute sécurité, garantissant ainsi la sûreté et la confidentialité de vos données.

/ Créer un compte gratuit