Publication

#HBMShortageBoostsAIChipPrices


Pénurie de HBM et hausse du coût des puces d’IA : pourquoi le véritable goulet d’étranglement est la mémoire
Quand on parle du coût de l’IA, la conversation commence généralement par le GPU. C’est le mauvais point de départ. En 2026, le composant le plus coûteux et le moins flexible d’un accélérateur d’IA n’est pas la puce logique située au centre du boîtier — c’est la mémoire empilée au-dessus. La mémoire à large bande passante, ou HBM, est passée du statut de détail technique à celui de principale contrainte de toute la chaîne d’approvisionnement du matériel d’IA, et les chiffres derrière cette évolution sont véritablement extraordinaires.
La HBM est constituée de puces DRAM empilées verticalement et reliées par des vias traversant le silicium, ce qui lui permet de transférer des données à des vitesses que la mémoire classique ne peut pas approcher. La plateforme Rubin de nouvelle génération de Nvidia embarque jusqu’à 288 Go de HBM4 avec une bande passante supérieure à 22 téraoctets par seconde, et la MI450 d’AMD va encore plus loin, jusqu’à 432 Go. Rien d’autre dans l’univers de la mémoire ne s’approche de cette combinaison de capacité et de bande passante, et rien d’autre ne peut la remplacer. Si un accélérateur n’a pas de HBM, il n’est pas commercialisé.
Le problème est que la HBM ne peut pas simplement être commandée à la hausse lorsque la demande augmente. Sa production consomme environ trois fois plus de surface de wafer que la DRAM classique pour la même quantité de données stockées, et le coût des wafers de HBM4 se situe autour de 7 000 à 8 000 dollars, soit trois à quatre fois celui de la DRAM standard. Chaque génération affiche également une prime de prix par rapport à la précédente, estimée à plus de 30 % par TrendForce, car les étapes d’empilement et de conditionnement avancé constituent un véritable goulet d’étranglement industriel. Seules trois entreprises comptent sur ce marché, et elles contrôlent ensemble environ 64 % des revenus mondiaux de la DRAM. L’une d’elles avait déjà vendu la totalité de sa capacité pour 2026 avant même le début de l’année.
C’est là que la mécanique de la pénurie devient claire. Selon TrendForce, la HBM représentait 23 % de la production totale de wafers DRAM en avril 2026, contre 19 % en 2025. Chaque wafer affecté à la HBM est un wafer qui ne produit plus de DDR5 pour les ordinateurs portables, les téléphones et les serveurs. La pénurie de mémoire ordinaire n’est donc pas un accident lié à la demande ; il s’agit d’une réallocation délibérée d’une capacité rare vers le produit le plus rentable jamais fabriqué par l’industrie. Quand on réoriente les meilleures lignes, les meilleurs ingénieurs et les équipements les plus récents vers un seul produit, tout le reste se tend par définition.
C’est dans les données de prix que cette situation cesse d’être abstraite. Au premier trimestre 2026, TrendForce a révisé les prix contractuels de la DRAM classique, qui devaient déjà augmenter fortement de 55 % à 60 % d’un trimestre sur l’autre, pour les porter à 90 % à 95 %, et certaines prévisions concernant la DRAM pour PC sont allées jusqu’à 105 % à 110 % sur un seul trimestre, ce qui signifie concrètement que les prix ont doublé en trois mois. La DRAM pour serveurs et appareils mobiles était prévue en hausse de 88 % à 93 %, la mémoire flash NAND de 55 % à 60 %, et les SSD pour entreprises de 53 % à 58 %. Le deuxième trimestre a apporté une nouvelle hausse de 58 % à 63 % d’un trimestre sur l’autre des prix contractuels de la DRAM classique, et le troisième trimestre est actuellement prévu en hausse supplémentaire de 13 % à 18 %. Certains analystes s’attendent à une nouvelle hausse de 30 % à 40 % au quatrième trimestre, ce qui porterait l’augmentation sur l’ensemble de l’année à environ 90 % à 100 %, voire davantage. Gartner prévoit une hausse de 47 % des prix de la DRAM sur l’ensemble de 2026 et une augmentation totale d’environ 130 % des coûts de la mémoire et du stockage d’ici la fin de l’année, sans réel soulagement avant la fin de 2027.
La HBM elle-même est encore plus extrême. Les prix d’approvisionnement de la HBM3E ont augmenté de près de 20 % avant même le début de 2026. Les prix au comptant se sont désormais découplés des prix contractuels d’une manière presque inédite dans cette industrie : un module HBM3E de 36 Go, qui se négocie normalement dans le cadre de contrats à long terme entre 300 et 400 dollars, a été proposé à près de 2 100 dollars sur le marché au comptant, soit une prime de quatre à cinq fois le prix habituel. Les négociations pour les contrats de HBM4 de 2027, entamées au deuxième trimestre 2026, devraient, selon TrendForce, produire des hausses mesurées en multiples plutôt qu’en pourcentages, et DigiTimes a rapporté que les prix de la HBM pourraient plus que doubler par rapport à leurs niveaux actuels d’ici 2027.
Le bilan de l’offre et de la demande confirme à quel point la situation est tendue. Les écarts entre l’offre et la demande prévus pour 2026 s’élèvent à 4,9 % pour la DRAM, 4,2 % pour la NAND et 5,1 % pour la HBM, le niveau le plus élevé depuis 2011. Même en supposant que 70 % des nouvelles capacités soient réorientées vers la HBM, le déficit de HBM pourrait encore se situer entre 50 % et 60 %. Les stocks racontent la même histoire sous un autre angle. Samsung et SK hynix, qui contrôlent ensemble environ 64 % des revenus mondiaux de la DRAM, ont vu leurs stocks de mémoire finie tomber sous dix jours d’approvisionnement au début de septembre 2026. Dix jours. Dans un cycle normal, un stock tampon mesuré en dizaines de semaines est considéré comme sain.
Ce coût se retrouve désormais dans le prix des systèmes, et pas seulement dans celui des composants. Nvidia a augmenté de plus de 15 % le prix de ses serveurs d’IA, en invoquant explicitement la pénurie de mémoire, et Intel a également relevé de plus de 15 % le prix de ses processeurs. Les délais de livraison de la HBM4 et de la DRAM avancée sont passés de huit à dix semaines à vingt à trente semaines, les commandes sur allocation étant devenues la norme. Les tarifs de location dans le cloud reflètent la même pression, un Nvidia B300 étant loué environ 9 dollars et 16 cents par heure à la demande, chiffre qui compte réellement pour les start-up et les chercheurs qui n’achètent jamais directement de matériel.
Les consommateurs paient eux aussi, et c’est la partie que la plupart des gens remarquent en premier. Un kit de mémoire DDR5-6000 de 32 Go vendu entre 110 et 140 dollars il y a un an se négociait autour de 392 dollars en août 2026, et les indicateurs font état d’une hausse d’environ 89 % des prix de la mémoire pour les jeux, avec des augmentations bien plus fortes pour certains composants. Le prix catalogue du module DDR5 de 32 Go de Samsung est passé de 149 dollars à 239 dollars, soit une hausse de 60 %. IDC prévoit une hausse de 10 % à 20 % des prix des PC, tablettes et smartphones d’ici la fin de 2026, TrendForce estime que les coûts de fabrication des ordinateurs portables grand public augmenteront de près de 40 %, les prévisions de production de smartphones ont été revues à la baisse, à -7 %, et les livraisons d’ordinateurs portables pourraient chuter de 10,1 % sur un an. Les fabricants d’appareils réagissent en gelant les spécifications, les téléphones haut de gamme plafonnant à 12 Go de mémoire simplement pour maintenir les prix.
Ma propre lecture de la situation est que la pénurie est structurelle plutôt que cyclique, et cette distinction est extrêmement importante. Les cycles normaux de la mémoire se corrigent en quatre à huit trimestres, car les capacités mises à l’arrêt redémarrent et les prix baissent. Celui-ci est différent pour trois raisons. Il faut deux à trois ans pour construire et homologuer de nouvelles usines, si bien que l’offre ne peut pas réagir dans le délai où la demande accélère. La transition de la HBM3E à la HBM4 consomme encore davantage de capacité par bit, car le nombre accru de couches et la complexité supérieure du conditionnement réduisent la production effective. Et la structure des incitations maintient activement la DRAM grand public sous tension, puisque les marges de la HBM sont bien supérieures à celles de la DDR5 standard. Une pénurie créée par un choix d’allocation ne se résout pas de la même manière qu’une pénurie créée par une surprise de la demande.
La deuxième chose à comprendre est que le goulet d’étranglement s’est déplacé. Les performances de l’IA sont de plus en plus limitées par la mémoire, ce qui signifie qu’un GPU disposant d’une puissance de calcul abondante mais d’une bande passante insuffisante reste inactif en attendant les données. Comme la HBM est le facteur limitant, ce qui détermine réellement le nombre d’accélérateurs produits au cours d’une année donnée est l’approvisionnement en mémoire, et non celui en transistors. C’est pourquoi les prix des puces d’IA sont, dans une large mesure, des prix de la mémoire déguisés. Cela explique également pourquoi les entreprises réputées pour leur fort pouvoir de fixation des prix répercutent leurs coûts sur les clients : elles ne peuvent pas faire apparaître une capacité qui n’existe pas.
Suivez l’argent et le schéma devient facile à lire. Les fabricants de mémoire enregistrent des marges records, les fournisseurs d’accélérateurs répercutent les coûts en aval, les hyperscalers absorbent une partie de la hausse et répercutent le reste sur les locataires du cloud, et les consommateurs paient le reliquat à travers les ordinateurs portables, les téléphones et les cartes graphiques, puisque la GDDR7 entre en concurrence pour les mêmes lignes de conditionnement avancé. Les entreprises qui gagnent de l’autre côté sont celles qui réduisent l’intensité mémoire elle-même, grâce à une meilleure quantification, à la parcimonie, à des puces d’inférence moins coûteuses et à l’efficacité logicielle. Chaque point de pourcentage de bande passante économisé vaut désormais plus qu’il y a deux ans.
Pour quiconque suit cette histoire comme un sujet de marché plutôt que comme un sujet technologique, quelques indicateurs méritent d’être surveillés, sans qu’aucun ne constitue un conseil en investissement. Les progrès du rendement de production de la HBM4 sont les plus importants, les rendements grimpant, selon certaines informations, vers 80 % avant la montée en production de Rubin par Nvidia. Le niveau de règlement des contrats de HBM pour 2027 donnera le ton à l’ensemble de la chaîne. Le fait que la hausse projetée de 13 % à 18 % de la DRAM au troisième trimestre se révèle être un plateau ou que le quatrième trimestre connaisse une nouvelle accélération indiquera si le sommet est atteint. Le nombre de jours de stocks chez Samsung et SK hynix, actuellement inférieur à dix, constitue le signal d’alerte précoce le plus clair. L’écart entre les prix au comptant et les prix contractuels est la mesure la plus honnête de la tension, car un resserrement de cet écart serait le premier signe réel de soulagement. Et les annonces de dépenses d’investissement dans les usines comptent, car les capacités engagées en 2026 et 2027 sont celles qui réinitialiseront les prix en 2028.
Il existe un contre-argument sérieux qui mérite sa place ici, car le fondement haussier de la rareté contient également les germes de son propre retournement. La mémoire est la partie la plus cyclique de la chaîne des semi-conducteurs, et chaque dollar de marge réalisé aujourd’hui finance des capacités qui arriveront demain. Si la croissance des dépenses d’investissement dans l’IA ralentit, même modestement, une grande quantité de nouveaux démarrages de production de wafers arrivera simultanément sur un marché planifié en pleine panique. L’avis de Gartner, selon lequel il n’y aura pas de réel soulagement avant la fin de 2027, et l’avertissement de SK hynix, pour qui la tension pourrait persister au-delà de 2030, se situent à une extrémité du spectre ; le schéma historique des booms de la mémoire, où la correction est rapide et brutale, se situe à l’autre. Garder ces deux possibilités à l’esprit est la seule position intellectuellement honnête.
Voici donc la phrase à retenir, débarrassée de l’essentiel : l’offre de HBM est limitée, la demande de puces d’IA continue d’augmenter, et cette combinaison fait grimper à la fois les coûts de production et les prix du marché dans toute la pile matérielle de l’IA. La conclusion plus profonde est que le déploiement de l’IA est désormais moins limité par les idées, et encore moins par la conception des puces, que par un composant dont la plupart des gens n’avaient jamais entendu parler il y a trois ans. Tant que la demande de calcul d’IA augmentera plus vite que le nombre de wafers mémoire pouvant être physiquement ajouté, cette rareté continuera de se manifester dans le prix de tout ce qui se trouve en aval, des accélérateurs de centres de données aux ordinateurs portables posés dans les rayons des magasins. Le mur de la mémoire n’est plus une métaphore. C’est un poste de coût.
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.


Ajouter un commentaire
Ajouter un commentaire

Commentaire
MamonTrader
il y a 2 heures
Première révision
Intéressant 👀
0Voir l'original