<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>DRAM Serveur on Korea Invest Insights</title><link>https://koreainvestinsights.com/fr/tags/dram-serveur/</link><description>Recent content in DRAM Serveur on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>fr</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Thu, 23 Jul 2026 08:44:15 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/fr/tags/dram-serveur/feed.xml" rel="self" type="application/rss+xml"/><item><title>Alphabet au T2 : Cloud +82% clôt le débat sur la demande, le FCF négatif ouvre celui du cash</title><link>https://koreainvestinsights.com/fr/post/alphabet-q2-2026-cloud-82-fcf-negative-memory-demand-2026-07-23/</link><pubDate>Thu, 23 Jul 2026 11:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/fr/post/alphabet-q2-2026-cloud-82-fcf-negative-memory-demand-2026-07-23/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;Contexte : dans &lt;a class="link" href="https://koreainvestinsights.com/fr/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/" &gt;Qui brûle tous ces tokens ?&lt;/a&gt;, nous écrivions que des chiffres avaient commencé à se rattacher à la demande finale, le dernier maillon faible du débat sur le CAPEX IA, et nous avions renvoyé le verdict à la saison des résultats autour du 30 juillet. La première copie notée est arrivée plus tôt que prévu. Alphabet a publié ses résultats du deuxième trimestre dans la nuit du 23 juillet, heure de Corée. Cet article synthétise en un seul texte deux notes d&amp;rsquo;analyse qui décortiquent ces mêmes résultats sous des angles différents. Pour résumer d&amp;rsquo;emblée la conclusion : le débat sur la demande est en pratique clos, et la scène du débat s&amp;rsquo;est déplacée vers le flux de trésorerie et le rendement du capital.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tldr"&gt;TL;DR
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Le chiffre d&amp;rsquo;affaires Cloud atteint 24,8 Mds USD, &lt;strong&gt;+82%&lt;/strong&gt; (consensus +64%), portant le taux de croissance à cinq trimestres consécutifs d&amp;rsquo;accélération : 32%, 34%, 48%, 63% et 82%. Le backlog est passé de 462 Mds USD à &lt;strong&gt;514 Mds USD&lt;/strong&gt;, en hausse nette de 52 Mds USD alors même que la reconnaissance de chiffre d&amp;rsquo;affaires s&amp;rsquo;accélère.&lt;/li&gt;
&lt;li&gt;La qualité de la demande compte davantage. Les clients Cloud existants dépensent en moyenne &lt;strong&gt;plus de 50% au-delà&lt;/strong&gt; de leur engagement initial, et le débit de l&amp;rsquo;API des modèles Gemini a atteint 22 Mds de tokens par minute, en hausse de 37,5% sur un seul trimestre. Faute de capacité, Alphabet a commencé, dès juin, à louer du compute IA &lt;strong&gt;auprès de SpaceX pour environ 920 M USD par mois&lt;/strong&gt;. Une scène inédite : un hyperscaler devenu acheteur net de compute.&lt;/li&gt;
&lt;li&gt;Au verso du même rapport, le FCF trimestriel est tombé à &lt;strong&gt;-5,9 Mds USD, le premier trimestre négatif de l&amp;rsquo;histoire du groupe&lt;/strong&gt;. Le CAPEX de 44,9 Mds USD a dépassé le flux de trésorerie d&amp;rsquo;exploitation de 39,1 Mds USD, et la guidance CAPEX 2026 a été relevée de 180-190 Mds USD à &lt;strong&gt;195-205 Mds USD&lt;/strong&gt;, avec une nouvelle hausse marquée annoncée pour 2027.&lt;/li&gt;
&lt;li&gt;Le jugement se divise en trois volets. La probabilité d&amp;rsquo;une falaise de demande IA après 2028 a encore baissé. Le retournement du FCF d&amp;rsquo;Alphabet est repoussé, non plus 2027, mais la fenêtre 2028-2029. Pour la mémoire, la vigueur de la demande en volume est reconfirmée, mais la persistance des prix et de la marge au pic reste une question distincte.&lt;/li&gt;
&lt;li&gt;Nous maintenons les probabilités du scénario de demande 45/35/20. Une nouvelle preuve empirique est toutefois venue étayer le scénario haussier à 35%, et ce rapport affaiblit le ralentissement précoce du CAPEX de la Big Tech qui constituait l&amp;rsquo;hypothèse centrale du scénario baissier à 20%. Le prochain relevé de notes viendra de Microsoft (30 juillet, heure de Corée) et d&amp;rsquo;Amazon (31 juillet).&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="thesis-callout"&gt;
&lt;div class="thesis-callout__label"&gt;Thèse principale&lt;/div&gt;
&lt;p&gt;Cloud +82% et le premier FCF trimestriel négatif de l&amp;rsquo;histoire sont les deux faces d&amp;rsquo;un même rapport. À la question de savoir si la demande est réelle, Alphabet a répondu par une consommation qui dépasse les engagements et par la location, à prix fort, des serveurs d&amp;rsquo;un tiers. En échange, la facture pour capter cette demande est arrivée plus tôt que prévu. Le critère de notation du marché est passé de l&amp;rsquo;existence de la demande au rendement du cash après amortissement, et pour l&amp;rsquo;investisseur en mémoire, ce rapport est un renfort pour les volumes, pas une garantie pour les marges.&lt;/p&gt;
&lt;/div&gt;
&lt;h2 id="1-dabord-les-chiffres--ce-qui-a-été-publié"&gt;1. D&amp;rsquo;abord les chiffres : ce qui a été publié
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Poste&lt;/th&gt;
 &lt;th&gt;T2 2026 réel&lt;/th&gt;
 &lt;th&gt;Base de comparaison&lt;/th&gt;
 &lt;th&gt;Verdict&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Chiffre d&amp;rsquo;affaires du groupe&lt;/td&gt;
 &lt;td&gt;119,8 Mds USD, +24%&lt;/td&gt;
 &lt;td&gt;Consensus environ 116,9 Mds USD&lt;/td&gt;
 &lt;td&gt;Au-dessus&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Chiffre d&amp;rsquo;affaires Google Cloud&lt;/td&gt;
 &lt;td&gt;24,8 Mds USD, +82%&lt;/td&gt;
 &lt;td&gt;Consensus 22,4 Mds USD, +64%&lt;/td&gt;
 &lt;td&gt;Largement au-dessus&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Résultat opérationnel Cloud&lt;/td&gt;
 &lt;td&gt;8,8 Mds USD (marge 35,6%)&lt;/td&gt;
 &lt;td&gt;Année précédente 2,8 Mds USD (marge 20,7%)&lt;/td&gt;
 &lt;td&gt;Amélioration&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Chiffre d&amp;rsquo;affaires Search&lt;/td&gt;
 &lt;td&gt;63,3 Mds USD, +17%&lt;/td&gt;
 &lt;td&gt;Consensus 63,4 Mds USD&lt;/td&gt;
 &lt;td&gt;Conforme&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Résultat opérationnel du groupe&lt;/td&gt;
 &lt;td&gt;40,8 Mds USD, +30% (marge 34,0%)&lt;/td&gt;
 &lt;td&gt;Marge sous le consensus&lt;/td&gt;
 &lt;td&gt;Mitigé&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BPA ajusté&lt;/td&gt;
 &lt;td&gt;environ 2,85 USD&lt;/td&gt;
 &lt;td&gt;Consensus environ 2,89 USD&lt;/td&gt;
 &lt;td&gt;Légèrement en dessous&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Flux de trésorerie d&amp;rsquo;exploitation&lt;/td&gt;
 &lt;td&gt;39,1 Mds USD&lt;/td&gt;
 &lt;td&gt;CAPEX 44,9 Mds USD&lt;/td&gt;
 &lt;td&gt;Inversion&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FCF trimestriel&lt;/td&gt;
 &lt;td&gt;-5,9 Mds USD&lt;/td&gt;
 &lt;td&gt;Trimestre précédent 10,1 Mds USD&lt;/td&gt;
 &lt;td&gt;Premier négatif de l&amp;rsquo;histoire&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Backlog Cloud&lt;/td&gt;
 &lt;td&gt;514 Mds USD&lt;/td&gt;
 &lt;td&gt;Trimestre précédent 462 Mds USD&lt;/td&gt;
 &lt;td&gt;+52 Mds USD&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Guidance CAPEX 2026&lt;/td&gt;
 &lt;td&gt;195-205 Mds USD&lt;/td&gt;
 &lt;td&gt;Précédemment 180-190 Mds USD&lt;/td&gt;
 &lt;td&gt;Relevée&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Fait : publication Alphabet · conférence de résultats]&lt;/p&gt;
&lt;p&gt;Les chiffres GAAP comportent un effet d&amp;rsquo;optique. Le BPA GAAP publié est de 9,11 USD et le résultat net de 112,1 Mds USD, en hausse de +298% sur un an, mais ce chiffre intègre une plus-value latente d&amp;rsquo;environ 99 Mds USD (avant impôt, soit environ 6,26 USD par action après impôt) sur des participations non cotées comme Anthropic et SpaceX. En retirant cette ligne sans rapport avec l&amp;rsquo;exploitation, le BPA réel ressort à environ 2,85 USD, légèrement sous les attentes du marché. Le chiffre d&amp;rsquo;affaires et le Cloud ont largement battu les attentes, mais la qualité du résultat n&amp;rsquo;était pas aussi solide que le chiffre en surface. [Fait : recalcul à partir de la publication]&lt;/p&gt;
&lt;h2 id="2-le-débat-sur-la-demande--pourquoi-il-est-en-pratique-clos"&gt;2. Le débat sur la demande : pourquoi il est en pratique clos
&lt;/h2&gt;&lt;p&gt;Le précédent article pointait le maillon faible de la demande finale et citait les 3 millions d&amp;rsquo;utilisateurs supplémentaires de Codex en trois jours comme première preuve empirique. Le rapport d&amp;rsquo;Alphabet y ajoute quatre nouvelles preuves.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;L&amp;rsquo;usage devance les contrats.&lt;/strong&gt; Le débit de l&amp;rsquo;API des modèles Gemini est passé de 16 Mds à 22 Mds de tokens par minute, en hausse de 37,5% sur un seul trimestre, et le nombre de développeurs mensuels a dépassé 9 millions. Les clients Cloud existants dépensent en moyenne plus de 50% au-delà de leur engagement initial, et l&amp;rsquo;écart de dépassement s&amp;rsquo;est creusé par rapport au trimestre précédent. Le rythme d&amp;rsquo;acquisition de nouveaux clients a doublé sur un an, et le volume de transactions sur la marketplace a été multiplié par sept. [Fait : lettre du CEO · conférence de résultats] L&amp;rsquo;hypothèse selon laquelle la demande ne reposerait que sur les contrats de long terme d&amp;rsquo;une poignée de laboratoires frontières est incompatible avec des données où la consommation réelle après signature dépasse l&amp;rsquo;engagement.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;La base de clients s&amp;rsquo;est élargie.&lt;/strong&gt; Au-delà de la demande liée au développement de modèles, comme le pré-entraînement à grande échelle de Gemini 4, cinq filières ont été présentées simultanément : l&amp;rsquo;inférence d&amp;rsquo;entreprise dans la finance, la pharmacie, la distribution, les télécoms et l&amp;rsquo;industrie, les charges BigQuery et sécurité, les services grand public comme le mode IA de la recherche et l&amp;rsquo;application Gemini, et enfin la vente externe de systèmes TPU livrés directement dans les data centers des clients. Environ 90% des entreprises du Fortune 100 utilisent Gemini Enterprise, et les clients Cloud traitant plus de 1 000 milliards de tokens par an sont désormais 500, contre plus de 2 000 pour ceux dépassant 100 milliards. [Fait : lettre du CEO]&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;L&amp;rsquo;offre continue de plafonner la croissance.&lt;/strong&gt; Le CFO a explicitement confirmé que l&amp;rsquo;environnement restait contraint côté offre. Pour combler les manques à court terme, le groupe loue à prix élevé de la capacité de data centers tiers, et il a expliqué qu&amp;rsquo;accepter environ six mois d&amp;rsquo;inefficacité valait la peine pour capter de grands clients. C&amp;rsquo;est dans ce prolongement qu&amp;rsquo;est tombée la plus grosse nouvelle de cette conférence : depuis juin, Alphabet a signé un contrat pour louer du compute IA auprès de SpaceX, pour environ 920 M USD par mois, soit environ 11 Mds USD en rythme annualisé. [Fait : conférence de résultats · presse] Que l&amp;rsquo;entreprise qui calcule le plus vite au monde loue les serveurs d&amp;rsquo;un tiers à prix fort constitue une preuve comportementale directement opposée à l&amp;rsquo;hypothèse d&amp;rsquo;une demande surestimée.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Le backlog a grossi même pendant sa propre reconnaissance en chiffre d&amp;rsquo;affaires.&lt;/strong&gt; Alors que le chiffre d&amp;rsquo;affaires Cloud du deuxième trimestre a progressé d&amp;rsquo;environ 23,8% par rapport au trimestre précédent, signe que de gros contrats se convertissent rapidement en chiffre d&amp;rsquo;affaires, le solde du backlog s&amp;rsquo;est encore renforcé de 52 Mds USD. Le backlog actuel représente environ 5,2 fois le chiffre d&amp;rsquo;affaires Cloud annualisé du deuxième trimestre, et la société a indiqué que plus de la moitié serait reconnue sous 24 mois. [Fait : publication · conférence de résultats] C&amp;rsquo;est une preuve solide de visibilité jusqu&amp;rsquo;en 2027. La concentration par client et la ventilation annuelle de la reconnaissance après 2028 ne sont toutefois pas divulguées. [Non vérifié : détail du backlog non divulgué]&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;objection tirée de l&amp;rsquo;efficacité a elle aussi perdu de sa force ce trimestre. Le coût par réponse du mode IA est tombé à son niveau le plus bas depuis le lancement, alors que le nombre d&amp;rsquo;utilisateurs et le volume de requêtes ont progressé encore plus vite. Le mode IA compte 1 Md d&amp;rsquo;utilisateurs mensuels, et l&amp;rsquo;application Gemini 950 M de MAU. La relation selon laquelle la hausse de l&amp;rsquo;usage dépasse la baisse du coût unitaire se vérifie donc aussi à l&amp;rsquo;échelle d&amp;rsquo;Alphabet, dans le même sens que l&amp;rsquo;effet Jevons observé avec Codex. [Inférence : relation efficacité-usage]&lt;/p&gt;
&lt;h2 id="3-le-débat-sur-le-cash--la-facture-est-arrivée-plus-tôt-que-prévu"&gt;3. Le débat sur le cash : la facture est arrivée plus tôt que prévu
&lt;/h2&gt;&lt;p&gt;À l&amp;rsquo;opposé de la demande, ce que ce rapport a confirmé, c&amp;rsquo;est l&amp;rsquo;ampleur et la durée de la dépense.&lt;/p&gt;
&lt;p&gt;Le CAPEX du deuxième trimestre, à 44,9 Mds USD, a doublé sur un an et dépassé le flux de trésorerie d&amp;rsquo;exploitation de 39,1 Mds USD ; l&amp;rsquo;intensité capitalistique trimestrielle (CAPEX/flux de trésorerie d&amp;rsquo;exploitation) atteint environ 115%. L&amp;rsquo;arithmétique est lourde elle aussi. Le CAPEX du premier semestre s&amp;rsquo;élevant à environ 80,6 Mds USD, atteindre le haut de la guidance annuelle à 205 Mds USD suppose de dépenser, au second semestre, une moyenne trimestrielle de 57,2-62,2 Mds USD, soit 27-38% de plus qu&amp;rsquo;au deuxième trimestre. Une reprise significative du FCF au second semestre 2026 et en 2027 est peu probable. [Inférence : arithmétique propre]&lt;/p&gt;
&lt;p&gt;Un indice sur 2027 est également apparu. Le CFO a maintenu sa perspective d&amp;rsquo;une forte hausse du CAPEX en 2027, et le consensus de marché se situe autour de 257 Mds USD. Le passage de 205 à 257 Mds USD représente un taux de croissance d&amp;rsquo;environ +25%. On reste sur une trajectoire de ralentissement, d&amp;rsquo;environ +76% cette année à environ +25% l&amp;rsquo;an prochain, et non pas encore sur un scénario de réaccélération vers les 300 Mds USD. [Fait : conférence de résultats · consensus] Cette distinction compte. Sur une trajectoire de ralentissement, l&amp;rsquo;ossature de la logique de retournement du FCF tient ; en cas de réaccélération, cette ossature s&amp;rsquo;effondre.&lt;/p&gt;
&lt;p&gt;Calculer une sensibilité pour 2028 permet de clarifier le critère de jugement. Le point de départ est le flux de trésorerie d&amp;rsquo;exploitation cumulé sur les douze derniers mois (TTM), actuellement à 185,7 Mds USD.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hypothèse de CAPEX 2028&lt;/th&gt;
 &lt;th&gt;OCF requis pour un FCF nul&lt;/th&gt;
 &lt;th&gt;Croissance annualisée d&amp;rsquo;OCF requise&lt;/th&gt;
 &lt;th&gt;OCF requis pour un FCF de 50 Mds USD&lt;/th&gt;
 &lt;th&gt;Croissance requise&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;200 Mds USD&lt;/td&gt;
 &lt;td&gt;200 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 3,8%&lt;/td&gt;
 &lt;td&gt;250 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 16,0%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;230 Mds USD&lt;/td&gt;
 &lt;td&gt;230 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 11,3%&lt;/td&gt;
 &lt;td&gt;280 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 22,8%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;250 Mds USD&lt;/td&gt;
 &lt;td&gt;250 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 16,0%&lt;/td&gt;
 &lt;td&gt;300 Mds USD&lt;/td&gt;
 &lt;td&gt;environ 27,1%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Inférence : sensibilité propre, pas une guidance de l&amp;rsquo;entreprise]&lt;/p&gt;
&lt;p&gt;Si le CAPEX se stabilise autour de 200 Mds USD en 2028, la reprise du FCF n&amp;rsquo;a rien d&amp;rsquo;insurmontable. S&amp;rsquo;il continue de grimper vers 230-250 Mds USD, il faudrait que le flux de trésorerie d&amp;rsquo;exploitation combiné du Cloud et de Search progresse de plus de 20% par an pour retrouver un FCF de niveau historique. Ce n&amp;rsquo;est pas un chiffre impossible si le Cloud maintient sa croissance de +82% et sa marge de 35,6% pendant un certain temps, mais l&amp;rsquo;amortissement, l&amp;rsquo;électricité, les loyers de capacité externe et un mix de ventes de matériel TPU à marge plus faible tirent dans le sens inverse.&lt;/p&gt;
&lt;p&gt;Le basculement du régime d&amp;rsquo;allocation du capital s&amp;rsquo;est lui aussi officialisé ce trimestre. Avec 242,5 Mds USD de cash et de titres négociables et 185,7 Mds USD de flux de trésorerie d&amp;rsquo;exploitation TTM, la solvabilité d&amp;rsquo;Alphabet n&amp;rsquo;est pas en soi un sujet de débat. Mais au deuxième trimestre, le groupe a levé environ 30,5 Mds USD en actions ordinaires, environ 19,1 Mds USD en actions préférentielles convertibles et environ 21,1 Mds USD en dette nette, sans aucun rachat d&amp;rsquo;actions. La dette est passée d&amp;rsquo;environ 16 Mds USD à environ 100 Mds USD en douze mois. [Fait : publication] Une entreprise qui finançait à la fois son CAPEX et ses rachats d&amp;rsquo;actions par son flux de trésorerie d&amp;rsquo;exploitation est devenue une entreprise qui arrête les rachats pour financer son CAPEX et mobilise même la dette et les fonds propres. Ce n&amp;rsquo;est pas un signal de risque de liquidité mais un signal de changement de régime d&amp;rsquo;allocation du capital, et le fait que le poids du financement repose davantage sur les actionnaires que sur le marché obligataire est un motif de réconfort du point de vue crédit.&lt;/p&gt;
&lt;h2 id="4-notation-des-trois-questions"&gt;4. Notation des trois questions
&lt;/h2&gt;&lt;p&gt;Face à ce rapport, voici comment se notent les trois questions.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;La demande IA se maintiendra-t-elle après 2028 ? La probabilité d&amp;rsquo;une falaise a encore baissé.&lt;/strong&gt; La demande se propage de l&amp;rsquo;entraînement vers l&amp;rsquo;inférence, les données, la sécurité et les usages d&amp;rsquo;entreprise, la consommation réelle dépasse les engagements, l&amp;rsquo;usage croît plus vite que les gains d&amp;rsquo;efficacité, l&amp;rsquo;essentiel du chiffre d&amp;rsquo;affaires de vente externe de TPU sera reconnu en 2027, et l&amp;rsquo;offre reste assez insuffisante pour exiger une forte hausse du CAPEX même en 2027. Il est plus exact de voir 2028 non pas comme le moment où la demande s&amp;rsquo;arrête, mais comme celui où la nouvelle capacité d&amp;rsquo;offre entre pleinement en service et passe à l&amp;rsquo;épreuve des faits.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Le FCF d&amp;rsquo;Alphabet va-t-il se retourner ? C&amp;rsquo;est possible, mais l&amp;rsquo;échéance a reculé.&lt;/strong&gt; Le croisement du FCF trimestriel est arrivé plus tôt que prévu initialement (début 2027), mais même en fixant de façon optimiste le flux de trésorerie d&amp;rsquo;exploitation 2027 à 230-240 Mds USD, un CAPEX de 257 Mds USD ramène le FCF annuel sous zéro. Le retour au positif suppose 2028, et seulement si la croissance du CAPEX 2028 retombe à un chiffre unique. Une forte réaccélération du FCF reste un scénario conditionnel pour la fenêtre 2028-2029.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Cela se traduit-il par des achats de mémoire durables ? Franchement positif pour les volumes, neutre pour les prix et les marges.&lt;/strong&gt; Nous décortiquons ce point dans la section suivante.&lt;/p&gt;
&lt;h2 id="5-traduction-en-mémoire--un-renfort-pour-les-volumes-pas-une-garantie-pour-les-marges"&gt;5. Traduction en mémoire : un renfort pour les volumes, pas une garantie pour les marges
&lt;/h2&gt;&lt;p&gt;Au deuxième trimestre, environ 60% du CAPEX d&amp;rsquo;infrastructure technique est allé aux serveurs, et 40% aux data centers et au réseau. L&amp;rsquo;investissement serveur englobe à la fois TPU, GPU, CPU, HBM, DRAM serveur, SSD et semi-conducteurs réseau. [Fait : conférence de résultats]&lt;/p&gt;
&lt;p&gt;Les éléments qui soutiennent la demande de HBM sont nets : la nouvelle génération de TPU et l&amp;rsquo;introduction du NVIDIA Vera Rubin, le pré-entraînement à grande échelle de Gemini 4, la hausse des volumes d&amp;rsquo;inférence d&amp;rsquo;entreprise, une architecture réseau de nouvelle génération reliant 1 M d&amp;rsquo;accélérateurs, et la vente externe de systèmes TPU dont l&amp;rsquo;essentiel sera reconnu à partir de 2027. Point important : même si le TPU maison remplace en partie les GPU NVIDIA, la demande de HBM ne disparaît pas, elle change seulement de canal d&amp;rsquo;achat, passant de la chaîne d&amp;rsquo;approvisionnement GPU à celle des systèmes TPU. En y ajoutant la location de compute auprès de tiers, le canal de demande de HBM et de DRAM serveur s&amp;rsquo;est élargi à trois filières : les data centers propriétaires, la vente externe de TPU et le compute loué. [Inférence : décomposition des canaux de demande]&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;argumentaire pour la DRAM serveur et l&amp;rsquo;eSSD s&amp;rsquo;est lui aussi étoffé avec ce rapport. Les agents IA ne se contentent pas des accélérateurs : ils font tourner le prétraitement, la gestion d&amp;rsquo;état, la sécurité et l&amp;rsquo;orchestration sur des serveurs CPU. Alphabet a mis en avant à la fois le CPU Axion et la hausse des charges de données et de sécurité. Le chiffre de 500 clients traitant plus de 1 000 milliards de tokens par an montre que la demande de stockage, qui s&amp;rsquo;étend aux logs, aux checkpoints, aux index de recherche et aux bases de données vectorielles, ne se limite pas à l&amp;rsquo;entraînement. [Fait : lettre du CEO] Le regain de tension sur la DRAM serveur observé dans l&amp;rsquo;article précédent (prévision de +13-18% sur les prix contractuels du T3, délais de livraison de 40 semaines) voit ainsi sa toile de fond côté demande reconfirmée par les résultats de la Big Tech.&lt;/p&gt;
&lt;p&gt;Cela dit, on ne doit pas relever les estimations de bénéfices 2028 des fabricants de mémoire sur la seule base de ce rapport. À mesure que les achats d&amp;rsquo;équipement s&amp;rsquo;envolent, la capacité d&amp;rsquo;offre de mémoire augmente elle aussi sur 2027-2029. L&amp;rsquo;expansion des puces maison réduit le pouvoir de fixation des prix de NVIDIA au niveau système, le coût d&amp;rsquo;inférence par réponse baisse rapidement, et si Alphabet commence à resserrer l&amp;rsquo;efficacité de son CAPEX, la pression à la baisse sur les prix des composants redescendra le long de la chaîne d&amp;rsquo;approvisionnement. Les prix élevés du HBM4 et de la génération suivante intègrent une prime de rareté de début de génération et de rendement, ce qui n&amp;rsquo;en fait pas une valeur permanente. En synthèse, voici ce que cela donne.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Poste&lt;/th&gt;
 &lt;th&gt;Jugement avant résultats&lt;/th&gt;
 &lt;th&gt;Jugement après résultats&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Demande de bits d&amp;rsquo;accélérateurs IA · HBM&lt;/td&gt;
 &lt;td&gt;Élevée&lt;/td&gt;
 &lt;td&gt;Très élevée&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Demande de DRAM serveur · eSSD&lt;/td&gt;
 &lt;td&gt;Moyenne-haute&lt;/td&gt;
 &lt;td&gt;Élevée&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Packaging avancé · réseau&lt;/td&gt;
 &lt;td&gt;Élevée&lt;/td&gt;
 &lt;td&gt;Très élevée&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Falaise de demande 2028&lt;/td&gt;
 &lt;td&gt;Probabilité faible&lt;/td&gt;
 &lt;td&gt;Probabilité encore plus faible&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Persistance de l&amp;rsquo;ASP mémoire&lt;/td&gt;
 &lt;td&gt;Incertaine&lt;/td&gt;
 &lt;td&gt;Incertaine&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Persistance de la marge au pic mémoire&lt;/td&gt;
 &lt;td&gt;Faible&lt;/td&gt;
 &lt;td&gt;Faible&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Reprise anticipée du FCF de la Big Tech&lt;/td&gt;
 &lt;td&gt;Moyenne&lt;/td&gt;
 &lt;td&gt;Plus faible&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Rendement marginal du capital du CAPEX&lt;/td&gt;
 &lt;td&gt;Non démontré&lt;/td&gt;
 &lt;td&gt;Partiellement démontré, vérification en cours&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Inférence : jugement de synthèse]&lt;/p&gt;
&lt;p&gt;Le risque pour les semi-conducteurs en 2028 n&amp;rsquo;est pas l&amp;rsquo;annulation de commandes, mais la normalisation de l&amp;rsquo;ASP et de la marge. Cela reste cohérent avec le scénario de demande 45/35/20. Ce rapport ajoute une preuve empirique de plus à l&amp;rsquo;argumentaire du scénario haussier à 35%, et affaiblit le ralentissement précoce du CAPEX de la Big Tech qui constituait l&amp;rsquo;hypothèse du scénario baissier à 20%. Les probabilités elles-mêmes seront mises à jour après vérification auprès de Microsoft et d&amp;rsquo;Amazon. Du point de vue de Samsung Electronics et de SK Hynix, c&amp;rsquo;est un rapport qui améliore le contexte de demande pour les négociations de prix du HBM 2027, qui débuteront au quatrième trimestre.&lt;/p&gt;
&lt;h2 id="6-réaction-du-cours-et-la-divergence-de-jugement-entre-les-deux-notes"&gt;6. Réaction du cours, et la divergence de jugement entre les deux notes
&lt;/h2&gt;&lt;p&gt;La réaction du marché résume bien la nature de cette phase. Le titre a d&amp;rsquo;abord chuté d&amp;rsquo;environ 2% en après-Bourse dès l&amp;rsquo;annonce, puis s&amp;rsquo;est brièvement redressé jusqu&amp;rsquo;à une légère hausse, avant de rechuter lorsque le relèvement du CAPEX est tombé pendant la conférence, portant le repli jusqu&amp;rsquo;à une fourchette de 3-5%. Au matin du 23 juillet, heure de Corée, le cours se situait autour de 342 USD, soit environ -1,5% par rapport à la clôture de la veille, à environ 347 USD. [Fait : données de marché] Sur un marché où battre le consensus est devenu la norme, c&amp;rsquo;est le CAPEX qui détermine la réaction : la règle de 2026 s&amp;rsquo;est vérifiée pour la cinquième fois. À l&amp;rsquo;inverse, que le repli soit resté aussi contenu face à une croissance de +82% est aussi un signal que le marché continue d&amp;rsquo;absorber la dépense tant que la croissance se prouve.&lt;/p&gt;
&lt;p&gt;Les deux notes qui ont servi de matière à cette synthèse tirent des conclusions différentes des mêmes faits. L&amp;rsquo;une a choisi de rester en suspens, au nom d&amp;rsquo;un critère de preuve structurelle. L&amp;rsquo;expression exacte n&amp;rsquo;est pas que le rendement du capital est démontré, mais qu&amp;rsquo;il est le plus susceptible de l&amp;rsquo;être, et elle a réservé son calcul d&amp;rsquo;objectif de cours face au FCF négatif, aux levées de capital et à l&amp;rsquo;annonce d&amp;rsquo;une nouvelle hausse en 2027. L&amp;rsquo;autre a maintenu un achat fondé sur le prix d&amp;rsquo;entrée. En posant l&amp;rsquo;hypothèse d&amp;rsquo;un cours déjà corrigé de 15% depuis son pic, elle propose un objectif à 12 mois de 430 USD, calculé en appliquant un multiple de 28-29x à un BPA 2027E hors plus-values d&amp;rsquo;environ 15 USD, avec une clause de révision : le calcul sera refait si le CAPEX 2027 se précise à l&amp;rsquo;approche des 300 Mds USD. [Fait : conclusions des deux notes]&lt;/p&gt;
&lt;p&gt;La différence entre les deux jugements ne tient pas à la perception des faits, mais à l&amp;rsquo;horizon et au critère retenus. Le point de vue structurel fait peser la charge de la preuve sur l&amp;rsquo;entreprise jusqu&amp;rsquo;à ce que le rendement du cash après amortissement soit confirmé en chiffres, tandis que le point de vue prix calcule dans quelle mesure ce risque est déjà intégré dans un cours déjà corrigé. Conformément au principe de ce blog, nous ne recommandons aucune direction particulière et présentons les deux cadres côte à côte, mais le dénominateur commun est clair. Dans un cas comme dans l&amp;rsquo;autre, la prochaine variable de jugement n&amp;rsquo;est plus la demande, mais le cash.&lt;/p&gt;
&lt;h2 id="7-grille-de-lecture--les-deux-prochaines-semaines-vont-trancher"&gt;7. Grille de lecture : les deux prochaines semaines vont trancher
&lt;/h2&gt;&lt;p&gt;Voici les cases que ce rapport a remplies et celles qu&amp;rsquo;il vient d&amp;rsquo;ouvrir.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;La part d&amp;rsquo;Alphabet dans le commentaire CAPEX de la Big Tech est désormais confirmée à la hausse. Restent la première guidance FY27 de Microsoft (conférence dans la nuit du 30 juillet, heure de Corée) et le taux de croissance d&amp;rsquo;AWS chez Amazon (nuit du 31 juillet). Si Alphabet a clos le débat sur la demande, ces deux publications trancheront le débat sur la marge et le FCF.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;indicateur de confirmation à la hausse est de savoir si la croissance du Cloud se maintient au-dessus de 50% sur les 2 à 4 prochains trimestres, et si la marge tient au-dessus de 30%. Si, une fois les contraintes d&amp;rsquo;offre levées, la croissance retombe sous 30%, il faudra recalculer la probabilité d&amp;rsquo;une surestimation de la demande.&lt;/li&gt;
&lt;li&gt;Nous surveillons si le backlog continue de croître net même après la reconnaissance de chiffre d&amp;rsquo;affaires. Une combinaison de baisse du backlog ou d&amp;rsquo;un simple allongement de la durée des contrats serait un signal de détérioration de la qualité des contrats.&lt;/li&gt;
&lt;li&gt;Le trimestre où le taux de croissance du flux de trésorerie d&amp;rsquo;exploitation TTM dépasse celui du CAPEX marquera le point de départ du retournement du FCF. À l&amp;rsquo;inverse, si le CAPEX 2028 dépasse 250 Mds USD sans que le flux de trésorerie d&amp;rsquo;exploitation suive, nous qualifierons cela de dégradation structurelle du FCF.&lt;/li&gt;
&lt;li&gt;Les points à vérifier côté efficacité du capital sont les suivants : de nouvelles levées d&amp;rsquo;actions ou de dette à grande échelle se poursuivent-elles, la location externe de type SpaceX se réduit-elle en 2027-2028, et la vente externe de TPU se convertit-elle en consommation Cloud récurrente.&lt;/li&gt;
&lt;li&gt;Le critère de discrimination côté mémoire ne change pas : le prix contractuel de la DRAM, et sa confirmation pour le T3 lors des conférences de résultats de Samsung Electronics et SK Hynix autour du 30 juillet.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;p&gt;Les titres mentionnés dans le texte sont des exemples destinés à l&amp;rsquo;analyse et ne constituent pas une recommandation d&amp;rsquo;achat ou de vente d&amp;rsquo;un titre particulier. La décision d&amp;rsquo;investissement et ses conséquences relèvent de la seule responsabilité de l&amp;rsquo;investisseur. Alphabet n&amp;rsquo;a fourni aucune guidance de CAPEX ni de chiffre d&amp;rsquo;affaires Cloud pour 2028, la répartition par client du backlog de 514 Mds USD, sa ventilation annuelle de reconnaissance et ses conditions d&amp;rsquo;annulation ne sont pas divulguées, et les volumes d&amp;rsquo;achat de HBM, de DRAM et de NAND ainsi que leur répartition par fournisseur ne font pas non plus l&amp;rsquo;objet d&amp;rsquo;une publication. La sensibilité du FCF 2028 et l&amp;rsquo;arithmétique du CAPEX du second semestre sont des estimations propres prenant pour point de départ les publications actuelles, non des prévisions de l&amp;rsquo;entreprise. L&amp;rsquo;ampleur avant impôt de la plus-value latente sur les participations non cotées et son effet après impôt par action, recalculés à partir des publications, peuvent comporter des écarts d&amp;rsquo;arrondi. L&amp;rsquo;objectif de cours de 430 USD est le calcul d&amp;rsquo;une des deux notes soumises à cette synthèse, et non un objectif de ce blog. Les cours et cotations sont établis à la date du matin du 23 juillet 2026, heure de Corée.&lt;/p&gt;
&lt;h3 id="articles-liés"&gt;Articles liés
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/" &gt;Qui brûle tous ces tokens ? La carte clients de NVIDIA, l&amp;rsquo;IA souveraine et les 9 millions de Codex commencent à répondre&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;La demande de mémoire pour l&amp;rsquo;IA dépassera-t-elle les attentes ? Lire les probabilités de surcroissance via les scénarios de demande et la carte de l&amp;rsquo;offre&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Deux mois de déclarations du président de SK Hynix Chey Tae-won : l&amp;rsquo;entreprise se renforce, le pic de marge est passé&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/semiconductor-bull-bear-four-clocks-capital-intensity-cycle-2026-07-17/" &gt;Le vrai débat des semi-conducteurs : quatre horloges physiques et une horloge boursière&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Qui brûle tous ces tokens ? La carte clients de NVIDIA, l'IA souveraine et les 9 millions de Codex commencent à répondre</title><link>https://koreainvestinsights.com/fr/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/</link><pubDate>Sun, 19 Jul 2026 19:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/fr/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;Contexte : dans &lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;La demande de mémoire pour l&amp;rsquo;IA dépassera-t-elle les attentes&lt;/a&gt;, nous avions pondéré la demande par probabilité selon un scénario de base à 45%, un scénario haussier à 35% et un scénario baissier à 20% ; dans &lt;a class="link" href="https://koreainvestinsights.com/fr/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Deux mois de déclarations du président de SK Hynix Chey Tae-won&lt;/a&gt;, nous avions lu les mots et les actes du plus haut niveau de l&amp;rsquo;offre. Le maillon faible qui restait, c&amp;rsquo;était la demande finale. Avec autant de GPU et de HBM déployés, qui va bien pouvoir brûler tous ces tokens ? Cet article documente la semaine où des chiffres ont commencé à répondre à cette question.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tldr"&gt;TL;DR
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Dans le chiffre d&amp;rsquo;affaires data center de NVIDIA, la part de l&amp;rsquo;hyperscale oscille autour de 50% depuis sept trimestres. Cette part ne s&amp;rsquo;est pas encore effondrée. Ce qui a changé, c&amp;rsquo;est la composition. Au trimestre février-avril 2026, &lt;strong&gt;le chiffre d&amp;rsquo;affaires non hyperscale (ACIE) de 37 Mds USD a atteint un quasi-équilibre avec les 38 Mds USD de l&amp;rsquo;hyperscale&lt;/strong&gt;, et le taux de croissance trimestriel s&amp;rsquo;est déjà inversé, 31% contre 12%. La prochaine publication pourrait voir la part elle-même basculer pour la première fois.&lt;/li&gt;
&lt;li&gt;Sur la même période, la croissance en glissement annuel du chiffre d&amp;rsquo;affaires data center a réaccéléré, de +56% à +66%, +75%, puis +92%. Que la part se maintienne alors que l&amp;rsquo;ensemble reprend de la vitesse signifie que &lt;strong&gt;la croissance incrémentale est tirée par l&amp;rsquo;extérieur de l&amp;rsquo;hyperscale&lt;/strong&gt;. NVIDIA a elle-même écrit, dans ses publications, que la croissance avait été menée par le reste de sa clientèle.&lt;/li&gt;
&lt;li&gt;Le chiffre d&amp;rsquo;affaires de l&amp;rsquo;IA souveraine a dépassé 30 Mds USD sur l&amp;rsquo;ensemble du FY2026, triplant par rapport à l&amp;rsquo;année précédente, et a encore progressé de plus de 80% en glissement annuel au trimestre suivant. C&amp;rsquo;est l&amp;rsquo;acheteur que le marché a manqué en ne regardant que les discours des hyperscalers.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;équipe semi-conducteurs de Meritz Securities a souligné, dans un rapport publié dimanche, l&amp;rsquo;entrée en phase active des achats souverains et le regain de tension sur l&amp;rsquo;offre de DRAM serveur depuis la mi-juillet. La prévision de TrendForce d&amp;rsquo;une hausse de +13-18% des prix contractuels de la DRAM serveur au T3, le témoignage du taïwanais Inventec sur des délais de 40 semaines, et les propos de Micron selon lesquels seuls 50-66% de la demande des clients clés peuvent être satisfaits, confirment ce constat de façon externe et croisée.&lt;/li&gt;
&lt;li&gt;Des chiffres sont aussi apparus côté demande finale. Codex, d&amp;rsquo;OpenAI, est passé de 1 million en février à plus de 5 millions fin mai, puis, juste après le lancement de GPT-5.6, de 6 millions le 12 juillet à 9 millions autour du 15 juillet, &lt;strong&gt;soit 3 millions d&amp;rsquo;utilisateurs supplémentaires en trois jours&lt;/strong&gt;. C&amp;rsquo;est le moment où l&amp;rsquo;unité de la demande bascule du nombre d&amp;rsquo;abonnés vers le temps d&amp;rsquo;exécution des agents.&lt;/li&gt;
&lt;li&gt;La conclusion n&amp;rsquo;est pas un relèvement hâtif des probabilités. C&amp;rsquo;est plutôt qu&amp;rsquo;avant de trancher sur une offre excédentaire, le moment est venu de revérifier si &lt;strong&gt;la demande n&amp;rsquo;a pas été dessinée de façon trop timide&lt;/strong&gt;, et que ce jugement sera rendu par la saison des résultats autour du 30 juillet et par la publication de NVIDIA fin août.&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="thesis-callout"&gt;
&lt;div class="thesis-callout__label"&gt;Thèse principale&lt;/div&gt;
&lt;p&gt;Le marché a douté de la durabilité du CAPEX IA en ne regardant que les discours de quatre géants de la tech. Pendant ce temps, dans les comptes de NVIDIA, le chiffre d&amp;rsquo;affaires non hyperscale a atteint la parité avec l&amp;rsquo;hyperscale, le chiffre d&amp;rsquo;affaires souverain a triplé en un an, et Codex a ajouté trois millions d&amp;rsquo;utilisateurs en trois jours. Tandis que le cours de bourse intégrait d&amp;rsquo;abord la peur d&amp;rsquo;une offre excédentaire, le socle de la demande accumulait des données réelles allant dans le sens inverse. Cette asymétrie est l&amp;rsquo;essence de cette phase de correction.&lt;/p&gt;
&lt;/div&gt;
&lt;h2 id="1-quelle-semaine--entre-limit-down-et-rapports-danalystes"&gt;1. Quelle semaine : entre limit-down et rapports d&amp;rsquo;analystes
&lt;/h2&gt;&lt;p&gt;Commençons par planter le décor. Le jeudi 16 juillet, sur le marché américain, l&amp;rsquo;indice des semi-conducteurs de Philadelphie (SOX) a chuté d&amp;rsquo;environ 4%, entrant en territoire de marché baissier avec un repli de plus de 20% depuis son sommet, tandis que le Nasdaq reculait de 1,47%. Le vendredi 17, le Nasdaq a encore cédé 1,40%, portant le repli hebdomadaire à 2,90%. [Fait : données de marché] Le même jour à Tokyo, Kioxia a plongé de 16,1%, touchant sa limite basse dès l&amp;rsquo;ouverture. Son cours est retombé de plus de moitié depuis son sommet du 22 juin, effaçant quelque 30 000 milliards JPY de capitalisation boursière. Le déclencheur direct a été le verdict d&amp;rsquo;un jury américain accordant à Viasat environ 229 M USD de dommages et intérêts pour violation de brevet, mais comme l&amp;rsquo;ont montré les chutes simultanées de TSMC (-7,29%), de l&amp;rsquo;ADR SK Hynix (-13,69%) et de SanDisk (-12,63%) lors de la même séance, l&amp;rsquo;essentiel tenait au désendettement de l&amp;rsquo;ensemble du rally de l&amp;rsquo;IA. [Fait : Nikkei, Korea Economic Daily]&lt;/p&gt;
&lt;p&gt;Le marché coréen a échappé à cette séance du vendredi : le 17 juillet était un jour férié, jour de la Constitution réintroduit comme jour chômé pour la première fois en 18 ans. Mais juste avant, il avait déjà essuyé de lourdes chutes : SK Hynix -15,37% et Samsung Electronics -10,70% le 13 juillet, puis SK Hynix -12,34% et Samsung Electronics -9,47% le 16 juillet. [Fait : données boursières] Le récit que le marché intègre dans les prix est clair : l&amp;rsquo;offre augmente, la Chine rattrape son retard, les bénéfices 2027 sont révisés à la baisse, et personne ne sait quand le CAPEX de la Big Tech va fléchir.&lt;/p&gt;
&lt;p&gt;Dans ce contexte, les analystes Kim Sun-woo, Yang Seung-su et Kim Dong-kwan, de l&amp;rsquo;équipe semi-conducteurs de Meritz Securities, ont publié dimanche des rapports coordonnés. Le moment de publication tient explicitement compte de la chute du vendredi et de l&amp;rsquo;affaire Kioxia. L&amp;rsquo;essentiel va dans le sens inverse : la demande de mémoire actuelle ne se limite pas aux hyperscalers, les achats du camp souverain, Moyen-Orient inclus, entrent en phase active, et la pénurie de DRAM serveur s&amp;rsquo;aggrave de nouveau depuis la mi-juillet. Leur contre-argument : la thèse qui tient pour acquis un assouplissement de la pénurie en 2028 n&amp;rsquo;a pas intégré cette demande dans son calcul. [Fait : synthèse du rapport de Meritz Securities, 2026-07-19]&lt;/p&gt;
&lt;p&gt;Plutôt que d&amp;rsquo;en rester à une joute verbale, nous découpons cette thèse en trois blocs vérifiables et les confrontons un à un aux données réelles : la composition de la clientèle de NVIDIA, les achats souverains, et l&amp;rsquo;usage final.&lt;/p&gt;
&lt;h2 id="2-la-carte-clients-de-nvidia--une-part-à-50-une-croissance-venue-de-lextérieur"&gt;2. La carte clients de NVIDIA : une part à 50%, une croissance venue de l&amp;rsquo;extérieur
&lt;/h2&gt;&lt;p&gt;Vérifions d&amp;rsquo;abord précisément l&amp;rsquo;affirmation selon laquelle la part des hyperscalers diminuerait. Voici, mises bout à bout, les formulations que NVIDIA publie chaque trimestre.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Trimestre fiscal&lt;/th&gt;
 &lt;th&gt;Période&lt;/th&gt;
 &lt;th&gt;CA data center&lt;/th&gt;
 &lt;th&gt;Glissement annuel&lt;/th&gt;
 &lt;th&gt;Part CSP majeurs · hyperscale (formulation officielle)&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;FY25 T3&lt;/td&gt;
 &lt;td&gt;08-10/2024&lt;/td&gt;
 &lt;td&gt;30,77 Mds USD&lt;/td&gt;
 &lt;td&gt;+112%&lt;/td&gt;
 &lt;td&gt;environ 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY25 T4&lt;/td&gt;
 &lt;td&gt;11/2024-01/2025&lt;/td&gt;
 &lt;td&gt;35,58 Mds USD&lt;/td&gt;
 &lt;td&gt;+93%&lt;/td&gt;
 &lt;td&gt;environ 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 T1&lt;/td&gt;
 &lt;td&gt;02-04/2025&lt;/td&gt;
 &lt;td&gt;39,11 Mds USD&lt;/td&gt;
 &lt;td&gt;+73%&lt;/td&gt;
 &lt;td&gt;un peu sous 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 T2&lt;/td&gt;
 &lt;td&gt;05-07/2025&lt;/td&gt;
 &lt;td&gt;41,10 Mds USD&lt;/td&gt;
 &lt;td&gt;+56%&lt;/td&gt;
 &lt;td&gt;environ 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 T3&lt;/td&gt;
 &lt;td&gt;08-10/2025&lt;/td&gt;
 &lt;td&gt;51,22 Mds USD&lt;/td&gt;
 &lt;td&gt;+66%&lt;/td&gt;
 &lt;td&gt;non divulgué&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 T4&lt;/td&gt;
 &lt;td&gt;11/2025-01/2026&lt;/td&gt;
 &lt;td&gt;62,31 Mds USD&lt;/td&gt;
 &lt;td&gt;+75%&lt;/td&gt;
 &lt;td&gt;un peu au-dessus de 50%, croissance tirée par le reste de la clientèle&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY27 T1&lt;/td&gt;
 &lt;td&gt;02-04/2026&lt;/td&gt;
 &lt;td&gt;75,2 Mds USD&lt;/td&gt;
 &lt;td&gt;+92%&lt;/td&gt;
 &lt;td&gt;Hyperscale 38 Mds USD (~50%) contre ACIE 37 Mds USD&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Fait : commentaire du CFO de NVIDIA · conférence de résultats]&lt;/p&gt;
&lt;p&gt;Deux constats apparaissent simultanément. Premièrement, &lt;strong&gt;le chiffre de part lui-même n&amp;rsquo;est jamais sorti de la bande des 50% en sept trimestres&lt;/strong&gt;. Le récit selon lequel les hyperscalers auraient déjà été relégués au second plan n&amp;rsquo;est pas corroboré par les données. Deuxièmement, la direction de la composition a pourtant clairement changé. La publication du FY26 T4 précisait que la croissance avait été tirée par le reste de la clientèle et que le chiffre d&amp;rsquo;affaires s&amp;rsquo;était diversifié, et à partir du FY27 T1, NVIDIA a commencé à ventiler le data center entre Hyperscale et ACIE (cloud IA, industrie, entreprise). Dès ce premier trimestre, ACIE a atteint 37 Mds USD, quasiment à hauteur des 38 Mds USD d&amp;rsquo;Hyperscale, et le taux de croissance trimestriel s&amp;rsquo;est inversé : &lt;strong&gt;ACIE +31% contre Hyperscale +12%&lt;/strong&gt;. Au sein d&amp;rsquo;ACIE, le chiffre d&amp;rsquo;affaires du cloud IA a plus que triplé en glissement annuel. Le CEO Jensen Huang a affirmé, lors de la conférence, qu&amp;rsquo;à long terme cette seconde catégorie croîtrait plus vite. [Fait : conférence de résultats]&lt;/p&gt;
&lt;p&gt;En superposant à cela la réaccélération du taux de croissance, le tableau se complète. La croissance en glissement annuel du chiffre d&amp;rsquo;affaires data center, après un point bas à +56% au FY26 T2, est remontée à +66%, +75%, puis +92%. Que la part se maintienne alors que la croissance globale accélère signifie, arithmétiquement, que &lt;strong&gt;plus de la moitié de l&amp;rsquo;incrément est désormais générée en dehors de l&amp;rsquo;hyperscale&lt;/strong&gt;. [Inférence : arithmétique des publications] Si cette tendance se poursuit ne serait-ce qu&amp;rsquo;un trimestre de plus, la publication du FY27 T2 fin août pourrait afficher, pour la première fois, un ACIE dépassant l&amp;rsquo;Hyperscale. À partir de cet instant, le cadre même consistant à juger la durabilité de la demande d&amp;rsquo;IA en ne regardant que les guidances de CAPEX des quatre géants de la tech deviendrait obsolète.&lt;/p&gt;
&lt;p&gt;Précisons une confusion possible. La concentration des clients directs dans le 10-Q (Client A 22%, Client B 14%) a au contraire augmenté, mais il s&amp;rsquo;agit d&amp;rsquo;un indicateur au niveau de la distribution, qui agrège les partenaires cartes, les OEM et les gros achats directs : un niveau différent de la diversification des utilisateurs finaux. [Fait : 10-K] Concentration de la distribution et élargissement de la demande finale sont deux phénomènes qui coexistent.&lt;/p&gt;
&lt;h2 id="3-ia-souveraine--lacheteur-que-le-marché-a-manqué-en-ne-regardant-que-les-discours"&gt;3. IA souveraine : l&amp;rsquo;acheteur que le marché a manqué en ne regardant que les discours
&lt;/h2&gt;&lt;p&gt;Le plus gros bloc de la demande non hyperscale, c&amp;rsquo;est le souverain. Le CFO de NVIDIA a indiqué que le chiffre d&amp;rsquo;affaires de l&amp;rsquo;IA souveraine au FY2026 avait plus que triplé en un an, &lt;strong&gt;franchissant les 30 Mds USD&lt;/strong&gt;. Le Canada, la France, les Pays-Bas, Singapour et le Royaume-Uni ont mené la charge ; au FY27 T1 encore, le chiffre d&amp;rsquo;affaires souverain a progressé de plus de 80% en glissement annuel, et l&amp;rsquo;infrastructure NVIDIA est désormais déployée dans quelque 40 pays cumulant environ 50 000 milliards USD de PIB. [Fait : conférence de résultats de NVIDIA]&lt;/p&gt;
&lt;p&gt;La réalité physique suit. HUMAIN, en Arabie saoudite, a finalisé un plan de déploiement pouvant aller jusqu&amp;rsquo;à 600 000 GPU NVIDIA sur trois ans et a déjà reçu un premier lot de 18 000 GB300. Aux Émirats arabes unis, Stargate UAE construit la phase 1 (200 MW) de son cluster de 1 GW avec une mise en service visée au T3 de cette année ; cette seule phase 1 accueillera jusqu&amp;rsquo;à 35 000 GB300, et l&amp;rsquo;opérateur G42 a obtenu l&amp;rsquo;autorisation d&amp;rsquo;exportation américaine à la mi-juillet. L&amp;rsquo;UE poursuit son programme de gigafactories IA doté de 20 Mds EUR, l&amp;rsquo;Inde vise 100 000 GPU publics d&amp;rsquo;ici la fin de l&amp;rsquo;année, et SoftBank au Japon cible une commercialisation de son cloud GPU souverain en octobre. [Fait : annonces des entreprises et des États concernés]&lt;/p&gt;
&lt;p&gt;Comment cela se traduit-il en mémoire ? Deux canaux sont déjà publics. Le programme mondial Stargate d&amp;rsquo;OpenAI a signé en octobre 2025 avec Samsung Electronics et SK Hynix une lettre d&amp;rsquo;intention (LOI) portant sur &lt;strong&gt;jusqu&amp;rsquo;à 900 000 wafers DRAM par mois&lt;/strong&gt;, un volume équivalent à environ 40% de la capacité mondiale de production de DRAM. La limite d&amp;rsquo;une LOI non contraignante demeure clairement posée. [Fait : presse, LOI] Et SK Hynix a officialisé en juin de cette année un partenariat pluriannuel HBM4 avec NVIDIA, couvrant la future génération Vera Rubin. [Fait : annonce de NVIDIA] Du côté des fonds souverains, la presse a continué de rapporter des rapprochements entre les capitaux émiratis, Mubadala, MGX, G42, Kazna, et le camp SK Hynix.&lt;/p&gt;
&lt;p&gt;Un vide doit être honnêtement laissé ouvert. Aucune nouvelle publication confirmant un achat direct massif de DRAM par un acteur souverain auprès de Samsung Electronics ou de SK Hynix n&amp;rsquo;a été identifiée en juin-juillet. [Non vérifié : contrat direct non divulgué] La demande de mémoire souveraine transite par les OEM serveurs et les intégrateurs système, si bien qu&amp;rsquo;elle se retrouve mélangée aux hyperscalers dans les publications clients des fabricants de mémoire. [Inférence : structure de distribution] Ce qui est invisible n&amp;rsquo;est pas la même chose que ce qui n&amp;rsquo;existe pas. Il n&amp;rsquo;existe aucun scénario où 600 000 GPU confirmés ne s&amp;rsquo;accompagneraient pas de mémoire ; la question n&amp;rsquo;est donc pas l&amp;rsquo;existence, mais la visibilité, en termes d&amp;rsquo;ampleur et de calendrier, dans les publications.&lt;/p&gt;
&lt;h2 id="4-le-regain-de-tension-sur-la-dram-serveur--la-thèse-de-meritz-et-les-données-externes"&gt;4. Le regain de tension sur la DRAM serveur : la thèse de Meritz et les données externes
&lt;/h2&gt;&lt;p&gt;Le regain de tension sur l&amp;rsquo;offre de DRAM serveur depuis la mi-juillet, pointé par l&amp;rsquo;équipe de Meritz, n&amp;rsquo;est pas une affirmation isolée de cette seule maison de courtage. Quatre observations externes pointent dans la même direction.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Donnée observée&lt;/th&gt;
 &lt;th&gt;Contenu&lt;/th&gt;
 &lt;th&gt;Source · date&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Prévision de prix contractuel&lt;/td&gt;
 &lt;td&gt;Prévision de +13-18% pour les prix contractuels de la DRAM serveur au T3. Impossible à répercuter sur les CSP américains liés par des contrats long terme (LTA), donc la hausse se concentre sur les clients hors LTA&lt;/td&gt;
 &lt;td&gt;TrendForce, 9/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Taux de croissance de l&amp;rsquo;offre&lt;/td&gt;
 &lt;td&gt;Croissance de l&amp;rsquo;offre bit RDIMM de 15-20% par an, inférieure à la hausse des expéditions de CPU. Constitution de stocks anticipés par les CSP qui anticipent une pénurie en 2027. Les modules migrent de 96/128 Go vers 32/64 Go&lt;/td&gt;
 &lt;td&gt;TrendForce, 9/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Délai de livraison&lt;/td&gt;
 &lt;td&gt;Délais de livraison de la DRAM serveur dépassant 40 semaines, prix en hausse d&amp;rsquo;environ 90% par rapport à fin 2025, validité des devis raccourcie à 1-30 jours&lt;/td&gt;
 &lt;td&gt;Propos d&amp;rsquo;Inventec rapportés, 16/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Témoignage d&amp;rsquo;un fournisseur&lt;/td&gt;
 &lt;td&gt;Capacité de ne satisfaire que 50-66% de la demande des clients clés, HBM déjà épuisée jusqu&amp;rsquo;en 2027, pénurie d&amp;rsquo;offre qui se prolongera au-delà de 2027&lt;/td&gt;
 &lt;td&gt;Conférence de résultats de Micron, juillet&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Fait : chaque source]&lt;/p&gt;
&lt;p&gt;Le niveau absolu des prix envoie lui aussi des signaux anormaux. Le prix contractuel fixe de la DRAM PC générique (DDR4 8 Gb) a atteint 21 USD en juin, un record depuis le début des relevés, et le prix spot dépasse le prix fixe de 72%. Des articles ont également rapporté que Samsung Electronics aurait notifié à ses clients chinois une hausse pouvant atteindre 20% des prix DRAM au T3. [Fait : presse sectorielle] Cette combinaison, une hausse des prix contractuels et une prime spot supérieure à 70%, signifie qu&amp;rsquo;une demande réelle en dehors du canal contractuel est prête à payer une surprime pour s&amp;rsquo;assurer des volumes en urgence. Ce ne sont pas les hyperscalers liés par des LTA, mais ceux qui se trouvent en dehors, à savoir le souverain, l&amp;rsquo;entreprise et les clouds de second rang, qui paient ce prix élevé. L&amp;rsquo;affirmation de TrendForce selon laquelle la hausse se concentre sur les clients hors LTA et celle de Meritz sur l&amp;rsquo;entrée en phase active des achats souverains sont deux expressions d&amp;rsquo;un même phénomène. [Inférence : lecture croisée]&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;analyste Kim Sun-woo va plus loin. Selon lui, le marché se méprend, enfermé dans un cadre étroit fait de contrats long terme sacrificiels et de révisions à la baisse pour 2027, et cette méprise devrait être rapidement dissipée par une série d&amp;rsquo;événements : exécution anticipée du retour aux actionnaires, partenariats incluant des prises de participation de la Big Tech. [Fait : argumentaire du rapport] Il ne s&amp;rsquo;agit pas d&amp;rsquo;un fait vérifié mais d&amp;rsquo;une prévision de la maison de courtage ; le critère de notation sera de vérifier si ces événements se concrétisent réellement pendant la saison des résultats de cette semaine. La direction reste néanmoins cohérente avec les mouvements observés dans l&amp;rsquo;article précédent : les fonds levés par le président de SK Hynix Chey Tae-won lors de l&amp;rsquo;introduction au Nasdaq, ses démarches de partenariat, et le contrat pluriannuel entre SK Hynix et NVIDIA.&lt;/p&gt;
&lt;h2 id="5-codex-à-9-millions--les-premiers-chiffres-de-la-demande-finale"&gt;5. Codex à 9 millions : les premiers chiffres de la demande finale
&lt;/h2&gt;&lt;p&gt;Dans le débat sur le CAPEX IA, le point le plus attaqué n&amp;rsquo;était pas l&amp;rsquo;infrastructure elle-même, mais son aboutissement : les data centers se construisent, mais les preuves que l&amp;rsquo;usage final augmente à due proportion restent minces. C&amp;rsquo;est précisément sur ce maillon faible que des chiffres notables commencent à apparaître.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Date&lt;/th&gt;
 &lt;th&gt;Nombre d&amp;rsquo;utilisateurs&lt;/th&gt;
 &lt;th&gt;Remarque&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Février 2026&lt;/td&gt;
 &lt;td&gt;1 M&lt;/td&gt;
 &lt;td&gt;Utilisateurs actifs de Codex seul&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;8 avril&lt;/td&gt;
 &lt;td&gt;3 M&lt;/td&gt;
 &lt;td&gt;Actifs hebdomadaires, réinitialisation des limites d&amp;rsquo;usage annoncée à chaque palier d'1 M&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;21 avril&lt;/td&gt;
 &lt;td&gt;4 M&lt;/td&gt;
 &lt;td&gt;+1 M en deux semaines&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Fin mai-début juin&lt;/td&gt;
 &lt;td&gt;Plus de 5 M&lt;/td&gt;
 &lt;td&gt;6x par rapport à février&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;9 juillet&lt;/td&gt;
 &lt;td&gt;Lancement officiel de GPT-5.6&lt;/td&gt;
 &lt;td&gt;3 variantes Sol, Terra, Luna ; Codex intégré à l&amp;rsquo;application de bureau ChatGPT&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;12 juillet&lt;/td&gt;
 &lt;td&gt;6 M&lt;/td&gt;
 &lt;td&gt;À partir de là, métrique combinée Codex + ChatGPT Work&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Autour du 15 juillet&lt;/td&gt;
 &lt;td&gt;9 M&lt;/td&gt;
 &lt;td&gt;+3 M en trois jours&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Fait : déclarations publiques des dirigeants d&amp;rsquo;OpenAI, presse]&lt;/p&gt;
&lt;p&gt;Deux réserves s&amp;rsquo;imposent, par honnêteté. Les chiffres postérieurs au 9 juillet ne représentent plus Codex seul mais une métrique combinée avec ChatGPT Work, ce qui rend une comparaison strictement continue avec la période précédente difficile. Et une extrapolation externe qui prolonge simplement le rythme de croissance de fin mai plaçait le franchissement des 10 millions en octobre, alors qu&amp;rsquo;en réalité le seuil de 9 millions a été atteint dès la mi-juillet. Précisons que cette ligne d&amp;rsquo;extrapolation n&amp;rsquo;est pas une projection officielle d&amp;rsquo;OpenAI. [Fait : vérification de la source de l&amp;rsquo;extrapolation] Même en tenant compte du changement de définition de l&amp;rsquo;indicateur, il reste qu&amp;rsquo;une accélération avançant la trajectoire attendue d&amp;rsquo;environ trois mois a été observée sur les trois jours qui ont suivi le lancement de GPT-5.6.&lt;/p&gt;
&lt;p&gt;Si Codex compte, ce n&amp;rsquo;est pas par l&amp;rsquo;ampleur du chiffre, mais par la nature de la demande. Codex est un produit qui convertit du temps de travail humain en temps d&amp;rsquo;inférence. L&amp;rsquo;agent peut travailler plus longtemps sans que l&amp;rsquo;humain reste connecté plus longtemps, et lorsqu&amp;rsquo;une seule personne fait tourner plusieurs tâches en parallèle, &lt;strong&gt;le volume de travail augmente plus vite que le nombre d&amp;rsquo;utilisateurs&lt;/strong&gt;. À partir de ce stade, l&amp;rsquo;unité de la demande n&amp;rsquo;est plus l&amp;rsquo;utilisateur actif mensuel, mais le temps d&amp;rsquo;exécution total des agents. C&amp;rsquo;est exactement la même structure que celle utilisée dans l&amp;rsquo;article précédent pour réécrire le plafond du modèle de demande de mémoire IA : nombre de charges de travail multiplié par la mémoire par charge de travail multiplié par la fréquence d&amp;rsquo;exécution.&lt;/p&gt;
&lt;p&gt;Le débat sur l&amp;rsquo;efficacité s&amp;rsquo;inverse ici aussi. OpenAI a elle-même indiqué que GPT-5.6 Sol était 54% plus efficace en tokens que la génération précédente. Le fait que les utilisateurs et l&amp;rsquo;usage aient explosé juste après la sortie d&amp;rsquo;un modèle moins coûteux par token constitue un cas empirique de l&amp;rsquo;hypothèse de Jevons dans le domaine des agents de codage : l&amp;rsquo;amélioration de l&amp;rsquo;efficacité ne réduit pas la demande de calcul, elle &lt;strong&gt;élargit le périmètre des tâches que l&amp;rsquo;on peut confier à l&amp;rsquo;IA&lt;/strong&gt;. [Inférence : effet Jevons] Ce qu&amp;rsquo;il faut regarder, ce n&amp;rsquo;est pas le taux de baisse du prix des tokens, mais le volume de travail que cette baisse de prix vient d&amp;rsquo;ouvrir.&lt;/p&gt;
&lt;h2 id="6-alors-comment-cela-se-traduit-il-en-mémoire-"&gt;6. Alors, comment cela se traduit-il en mémoire ?
&lt;/h2&gt;&lt;p&gt;De la retenue s&amp;rsquo;impose aussi. Le seul chiffre de 9 millions pour Codex ne saurait expliquer à lui seul le cycle mémoire. Pour que le nombre d&amp;rsquo;utilisateurs se traduise en demande de bits mémoire, il faut passer par quatre coefficients de conversion : le volume d&amp;rsquo;exécutions simultanées, la longueur du contexte, la capacité mémoire embarquée par accélérateur, et le taux de croissance de l&amp;rsquo;offre. [Inférence : modèle de demande] Si l&amp;rsquo;un seul de ces maillons est faible, l&amp;rsquo;indicateur médiatique et la demande réelle se dissocient.&lt;/p&gt;
&lt;p&gt;Mais en confrontant les variables haussières posées comme arguments du scénario à 35% dans l&amp;rsquo;article précédent sur les scénarios de demande aux données observées cette semaine, un alignement apparaît.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;L&amp;rsquo;élargissement de la base de la demande d&amp;rsquo;accélérateurs s&amp;rsquo;est vu confirmé par l&amp;rsquo;inversion du taux de croissance d&amp;rsquo;ACIE et le triplement du chiffre d&amp;rsquo;affaires souverain.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;inférence agentique permanente a produit ses premiers chiffres avec les 3 millions en trois jours de Codex et le changement d&amp;rsquo;unité de mesure.&lt;/li&gt;
&lt;li&gt;La diffusion au-delà du HBM s&amp;rsquo;est déjà manifestée dans les prix, avec la prévision de +13-18% sur les prix contractuels de la DRAM serveur, des délais de 40 semaines et une prime spot de 72%.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;hypothèse selon laquelle l&amp;rsquo;usage l&amp;rsquo;emporte sur l&amp;rsquo;efficacité a trouvé une confirmation empirique contre-intuitive dans l&amp;rsquo;explosion d&amp;rsquo;usage survenue juste après une amélioration de 54% de l&amp;rsquo;efficacité en tokens.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;L&amp;rsquo;implication pour le récit d&amp;rsquo;un assouplissement de l&amp;rsquo;offre en 2028 se joue aussi ici. La formule des tenants de l&amp;rsquo;assouplissement pose généralement le ralentissement de la croissance du CAPEX des hyperscalers comme plafond du taux de croissance de la demande. Or, si la moitié de la demande incrémentale commence à provenir de l&amp;rsquo;extérieur de ce périmètre, l&amp;rsquo;hypothèse même de plafond doit être recalculée. C&amp;rsquo;est exactement ce point que vise la contestation de Meritz. Nous ne modifions pas les probabilités dans l&amp;rsquo;immédiat. Nous conservons l&amp;rsquo;ossature 45% de base, 35% de dépassement, 20% de sous-performance, tout en actant que l&amp;rsquo;argumentaire haussier commence à recevoir des données réelles sur trois fronts distincts. La mise à jour des probabilités se fera lorsque le tableau de décision ci-dessous se sera rempli. [Inférence : gestion des scénarios]&lt;/p&gt;
&lt;h2 id="7-vérification-des-contre-arguments"&gt;7. Vérification des contre-arguments
&lt;/h2&gt;&lt;p&gt;Plus un argument paraît solide, plus il faut lui opposer son contraire.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;La qualité de la demande non hyperscale.&lt;/strong&gt; ACIE inclut les néoclouds. Les commandes de ces clouds de second rang, fragiles en coût du capital, sont les premières annulées dès que les taux d&amp;rsquo;intérêt et les conditions de financement se resserrent. L&amp;rsquo;inversion du taux de croissance ne garantit pas la durabilité de la demande.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;La volatilité politique du souverain.&lt;/strong&gt; Les projets nationaux sont exposés aux élections, aux budgets et aux restrictions à l&amp;rsquo;exportation. L&amp;rsquo;appel d&amp;rsquo;offres des gigafactories de l&amp;rsquo;UE a déjà été reporté à deux reprises, et les volumes du Moyen-Orient dépendent d&amp;rsquo;un seul interrupteur : l&amp;rsquo;autorisation d&amp;rsquo;exportation américaine.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Le piège des indicateurs.&lt;/strong&gt; Les 9 millions de Codex sont un chiffre publié juste après un changement de définition vers une métrique combinée, et le critère d&amp;rsquo;activité n&amp;rsquo;a pas été divulgué. La direction de la croissance est un fait observé, mais son ampleur n&amp;rsquo;est pas encore dissociée du marketing.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;L&amp;rsquo;autodestruction de la flambée des prix.&lt;/strong&gt; Le regain de tension sur la DRAM serveur est à la fois un argument haussier et, comme l&amp;rsquo;a montré le cas d&amp;rsquo;IBM, un risque : il grignote les budgets IT et crée un vide de demande après les achats anticipés. Le président Chey lui-même a averti qu&amp;rsquo;une surchauffe des prix pouvait détruire la demande.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;La distinction entre prévision et fait observé.&lt;/strong&gt; Les événements anticipés par Meritz (exécution anticipée du retour aux actionnaires, partenariats avec prise de participation de la Big Tech) restent des prévisions. S&amp;rsquo;ils ne se matérialisent pas, c&amp;rsquo;est la vision étroite qui aura eu raison.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="8-tableau-de-décision--quest-ce-qui-tranchera-la-réponse-"&gt;8. Tableau de décision : qu&amp;rsquo;est-ce qui tranchera la réponse ?
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Aux conférences de résultats de Samsung Electronics et SK Hynix, autour du 30 juillet, l&amp;rsquo;ampleur de la hausse des prix contractuels du T3 confirme-t-elle la fourchette de +13-18% de TrendForce, et des mentions des clients hors LTA et des volumes souverains apparaissent-elles ?&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;exécution anticipée du retour aux actionnaires de SK Hynix et les partenariats avec prise de participation se traduisent-ils en publications officielles ? C&amp;rsquo;est le critère de notation direct de la prévision de Meritz.&lt;/li&gt;
&lt;li&gt;Dans la publication du FY27 T2 de NVIDIA fin août, ACIE dépasse-t-il pour la première fois l&amp;rsquo;Hyperscale ? Si oui, l&amp;rsquo;élargissement de la base de demande cessera d&amp;rsquo;être un récit pour devenir un chiffre publié.&lt;/li&gt;
&lt;li&gt;Un contrat direct de mémoire d&amp;rsquo;origine souveraine, ou une commande de grande ampleur transitant par un OEM serveur, remonte-t-il au niveau des publications officielles ? La conversion de la LOI de Stargate en contrat contraignant est la première candidate.&lt;/li&gt;
&lt;li&gt;Les indicateurs d&amp;rsquo;usage de Codex et des agents concurrents commencent-ils à être publiés sur la base du temps d&amp;rsquo;exécution, au moment du franchissement des 10 millions ?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Le juge de paix ne change pas. Si les prix contractuels de la DRAM se retournent, tout ce récit de la demande sera rejeté par le marché ; s&amp;rsquo;ils tiennent, c&amp;rsquo;est la courbe de demande trop timidement tracée qui devra être redessinée.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;Les titres mentionnés dans cet article sont des exemples destinés à l&amp;rsquo;analyse et ne constituent pas une recommandation d&amp;rsquo;achat ou de vente d&amp;rsquo;un titre particulier. La décision d&amp;rsquo;investissement et sa responsabilité incombent à l&amp;rsquo;investisseur lui-même. Le rapport de Meritz Securities a été cité sous une forme reconstituée à partir de son essentiel ; la responsabilité du texte original des chiffres détaillés et des prévisions incombe à cette maison de courtage. Le nombre d&amp;rsquo;utilisateurs de Codex a changé de définition après le 9 juillet pour devenir une métrique combinée avec ChatGPT Work, rendant une comparaison stricte avec la période antérieure difficile, et la ligne d&amp;rsquo;extrapolation visant 10 millions en octobre n&amp;rsquo;est pas une projection officielle d&amp;rsquo;OpenAI. Aucun achat direct de mémoire par un acteur souverain n&amp;rsquo;a été confirmé par une publication officielle, et les volumes liés à Stargate en sont au stade d&amp;rsquo;une lettre d&amp;rsquo;intention non contraignante. Les cours, indices et données de prix sont fondés sur les informations publiques disponibles jusqu&amp;rsquo;au 17 juillet 2026 et n&amp;rsquo;intègrent pas les évolutions postérieures.&lt;/em&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id="articles-liés"&gt;Articles liés
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;La demande de mémoire pour l&amp;rsquo;IA dépassera-t-elle les attentes ? Lire les probabilités de surcroissance via les scénarios de demande et la carte de l&amp;rsquo;offre&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Deux mois de déclarations du président de SK Hynix Chey Tae-won : l&amp;rsquo;entreprise se renforce, le pic de marge est passé&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/semiconductor-bull-bear-four-clocks-capital-intensity-cycle-2026-07-17/" &gt;Le vrai débat des semi-conducteurs : quatre horloges physiques et une horloge boursière&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/fr/post/memory-fair-value-fcfe-terminal-samsung-hynix-micron-2026-07-17/" &gt;Les semi-conducteurs sont-ils cycliques et quelle est la juste valeur ? Valoriser Samsung, SK Hynix et Micron avec le FCFE et les bénéfices normalisés&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Kimi K3 Réinitialise la Courbe de Prix de l'IA : De Kimi Linear à HBM et la Stratégie des Grandes Tech</title><link>https://koreainvestinsights.com/fr/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</link><pubDate>Fri, 17 Jul 2026 12:31:36 +0900</pubDate><guid>https://koreainvestinsights.com/fr/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</guid><description>&lt;p&gt;Kimi K3 a été lancé le 16 juillet 2026 à 3 $ par million de tokens d&amp;rsquo;entrée non mis en cache et 15 $ par million de tokens de sortie. Ce n&amp;rsquo;est pas le positionnement ultra-bas prix habituel d&amp;rsquo;un challenger chinois. Ce tarif correspond à celui de Claude Sonnet 5 et se situe 40 % en dessous de GPT-5.6 Sol sur l&amp;rsquo;entrée et 50 % en dessous sur la sortie. Moonshot AI positionne K3 comme modèle d&amp;rsquo;entreprise de référence, non comme une solution de repli économique.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;architecture est conçue pour soutenir cette affirmation. K3 dispose de 2,8 billions de paramètres au total, mais n&amp;rsquo;active effectivement que 16 des 896 experts par token. Kimi Delta Attention contrôle le coût du contexte long, les Résidus d&amp;rsquo;Attention récupèrent sélectivement des représentations antérieures en profondeur, et l&amp;rsquo;entraînement avec conscience de la quantification utilise des poids MXFP4 avec des activations MXFP8. Moonshot recommande un supernœud d&amp;rsquo;au moins 64 accélérateurs.&lt;/p&gt;
&lt;p&gt;Cette combinaison crée un résultat semi-conducteur à double effet. La mémoire et le calcul par token peuvent diminuer tandis que le nombre d&amp;rsquo;institutions capables de déployer un modèle de classe frontière — et la quantité de travail qu&amp;rsquo;elles exécutent — peut augmenter. K3 est à la fois une technologie d&amp;rsquo;efficacité et une charge de travail d&amp;rsquo;infrastructure.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;Lectures connexes : &lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-token-value-memory-value-added-2026-07-09/" &gt;Valeur du token IA et capture de la valeur mémoire&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-token-futures-cost-per-token-korea-semiconductor-thesis-2026-05-30/" &gt;Futures sur tokens IA et coût par token&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/us-china-agentic-inference-stack-sram-opportunity-2026-07-09/" &gt;Divergence États-Unis–Chine dans l&amp;rsquo;infrastructure d&amp;rsquo;inférence agentique&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/hbm-2030-supply-demand-267eb-demand-model-crosscheck-2026-07-13/" &gt;Vérification croisée du modèle de pénurie HBM 2030&lt;/a&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="synthèse"&gt;Synthèse
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;K3 combine 2,8 billions de paramètres, une vision native et une fenêtre de contexte de 1M tokens. Ses produits et son API sont actifs, mais au 17 juillet, les poids complets, le rapport technique et la licence n&amp;rsquo;ont pas encore été publiés. La thèse des poids ouverts devra être vérifiée après la date limite du 27 juillet.&lt;/li&gt;
&lt;li&gt;Le score officiel GDPval-AA v2 de Moonshot est de 1 668, et non de 1 687. AA-Briefcase est à 1 548. BrowseComp à 91,2 utilise la compaction de contexte ; le résultat sans compaction sur le contexte 1M est de 90,4. Les résultats sont solides, mais les configurations mixtes et les évaluations réalisées par la société elle-même nécessitent une reproduction indépendante.&lt;/li&gt;
&lt;li&gt;Les affirmations de Kimi Linear concernant une réduction allant jusqu&amp;rsquo;à 75 % du cache KV et un débit de décodage théorique jusqu&amp;rsquo;à 6,3 fois plus élevé à 1M de contexte proviennent d&amp;rsquo;un modèle de recherche de 48B paramètres totaux et 3B actifs. Elles ne doivent pas être présentées comme des performances mesurées de l&amp;rsquo;API K3.&lt;/li&gt;
&lt;li&gt;K3 n&amp;rsquo;est pas un modèle à bas coût. Son prix correspond au tarif standard de Sonnet 5, est 50 % plus cher que la promotion de lancement temporaire de Sonnet, et moins cher que GPT-5.6 Sol. Étant donné que seul le mode de raisonnement maximal est actuellement disponible et que les tests indépendants montrent une utilisation élevée de tokens de sortie, le coût par tâche accomplie peut être moins attractif que ce que le tarif officiel laisse entendre.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;impact semi-conducteur oppose une réduction du calcul et du cache KV par requête à un déploiement plus large en auto-hébergement et une charge de travail totale accrue. La DRAM serveur et les SSD entreprise sont les bénéficiaires secondaires les plus nets, car le contexte agent de longue durée déborde de la HBM vers des niveaux de cache déconcentrés.&lt;/li&gt;
&lt;li&gt;La couche modèle et la couche cloud connaissent des économies opposées. La tarification des API d&amp;rsquo;OpenAI, Anthropic et Gemini subit une pression, tandis qu&amp;rsquo;Azure, AWS et Google Cloud peuvent monétiser K3 et d&amp;rsquo;autres modèles via le calcul, le stockage et le réseau. Meta doit défendre son leadership américain sur les poids ouverts.&lt;/li&gt;
&lt;li&gt;Les preuves du 27 juillet attendues sont : la licence, les poids complets, l&amp;rsquo;évaluation externe, le débit sur NVIDIA et AMD, la prise en charge des accélérateurs chinois, les tokens de sortie effectifs par tâche, la compatibilité vLLM et l&amp;rsquo;adoption dans les catalogues cloud.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img alt="Stratégie tarifaire de Kimi K3 et carte d’impact sur l’infrastructure IA" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://koreainvestinsights.com/images/posts/kimi-k3-pricing-infrastructure-impact-2026-07-17.png"&gt;
&lt;/p&gt;
&lt;h2 id="1-corriger-les-chiffres-avant-de-tirer-des-conclusions"&gt;1. Corriger les Chiffres Avant de Tirer des Conclusions
&lt;/h2&gt;&lt;p&gt;Plusieurs valeurs ont évolué au fil de la circulation du lancement sur les réseaux sociaux. Les chiffres officiels sont importants car certains écarts modifient l&amp;rsquo;interprétation pour l&amp;rsquo;investisseur.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Élément&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Valeur officielle&lt;/th&gt;
 &lt;th&gt;Interprétation pour l&amp;rsquo;investisseur&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Paramètres totaux&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2,8T&lt;/td&gt;
 &lt;td&gt;Taille totale du modèle, pas le calcul actif par token&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Routage d&amp;rsquo;experts&lt;/td&gt;
 &lt;td style="text-align: right"&gt;16 sur 896&lt;/td&gt;
 &lt;td&gt;MoE extrêmement sparse ; qualité du routage et communication deviennent des contraintes de premier ordre&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Contexte&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1M tokens&lt;/td&gt;
 &lt;td&gt;Utile pour les dépôts et la recherche, mais le coût par tâche dépend de la longueur de sortie et des hits de cache&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GDPval-AA v2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1 668&lt;/td&gt;
 &lt;td&gt;Le tableau officiel ne mentionne pas 1 687&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AA-Briefcase&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1 548&lt;/td&gt;
 &lt;td&gt;Au-dessus de GPT-5.6 Sol à 1 495, en dessous de Claude Fable 5 à 1 583&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp&lt;/td&gt;
 &lt;td style="text-align: right"&gt;91,2&lt;/td&gt;
 &lt;td&gt;Utilise la compaction à partir de 300K tokens&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp sans compaction&lt;/td&gt;
 &lt;td style="text-align: right"&gt;90,4&lt;/td&gt;
 &lt;td&gt;Le résultat le plus propre pour la revendication de contexte natif 1M&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Disponibilité produit&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Web, Work, Code et API actifs&lt;/td&gt;
 &lt;td&gt;Les tests commerciaux peuvent commencer maintenant&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Poids&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Promis pour le 27 juillet&lt;/td&gt;
 &lt;td&gt;Licence et artefacts complets non vérifiés au 17 juillet&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Effort de raisonnement&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Maximal uniquement&lt;/td&gt;
 &lt;td&gt;Les modes basse consommation ne sont pas encore disponibles&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Moonshot indique explicitement que K3 reste en retrait par rapport à Claude Fable 5 et GPT-5.6 Sol en termes d&amp;rsquo;expérience utilisateur globale. Parallèlement, il annonce des performances de niveau frontière en codage, travail de connaissance et benchmarks multimodaux. L&amp;rsquo;interprétation crédible n&amp;rsquo;est pas que la Chine a pris définitivement la tête. C&amp;rsquo;est qu&amp;rsquo;un modèle chinois a intégré la bande de performance immédiatement inférieure aux systèmes propriétaires les plus puissants, tout en promettant un contexte 1M et des poids téléchargeables.&lt;/p&gt;
&lt;p&gt;Le tableau de benchmarks ne constitue pas un tournoi contrôlé unique. K3 fonctionne avec l&amp;rsquo;effort de raisonnement maximal. Selon la tâche, les modèles utilisent Kimi Code, Claude Code ou Codex, et certains scores de concurrents correspondent aux meilleurs résultats obtenus sur différentes configurations ou importés depuis des classements externes. Une reproduction indépendante reste nécessaire.&lt;/p&gt;
&lt;p&gt;Néanmoins, Terminal-Bench 2.1 à 88,3, FrontierSWE à 81,2, SWE Marathon à 42,0, AutomationBench à 30,8, GPQA-Diamond à 93,5 et MMMU-Pro à 81,6 indiquent que K3 est conçu pour l&amp;rsquo;utilisation d&amp;rsquo;outils à long horizon et le codage, et pas seulement pour la conversation. Le signal le plus important est l&amp;rsquo;ensemble du package : capacité proche de la frontière, contexte 1M et poids ouverts promis.&lt;/p&gt;
&lt;h2 id="2-comment-un-modèle-de-28-billions-de-paramètres-devient-déployable"&gt;2. Comment un Modèle de 2,8 Billions de Paramètres Devient Déployable
&lt;/h2&gt;&lt;h3 id="21-les-paramètres-totaux-ne-sont-pas-des-paramètres-actifs"&gt;2.1 Les paramètres totaux ne sont pas des paramètres actifs
&lt;/h3&gt;&lt;p&gt;Calculer les 2,8T paramètres pour chaque token serait prohibitivement coûteux. Stable LatentMoE active effectivement 16 des 896 experts, soit environ 1,8 % du pool d&amp;rsquo;experts. Le rapport technique est nécessaire pour établir le nombre exact de paramètres actifs, mais les paramètres totaux ne correspondent clairement pas au calcul par token.&lt;/p&gt;
&lt;p&gt;Le MoE sparse déplace les goulots d&amp;rsquo;étranglement plutôt qu&amp;rsquo;il ne les supprime.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Ce qui s&amp;rsquo;améliore&lt;/th&gt;
 &lt;th&gt;Ce qui devient plus difficile&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Calcul actif par token&lt;/td&gt;
 &lt;td&gt;Qualité du routeur et équilibre des experts&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Calcul nécessaire pour un niveau de qualité cible&lt;/td&gt;
 &lt;td&gt;Communication entre accélérateurs&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Certains coûts d&amp;rsquo;inférence&lt;/td&gt;
 &lt;td&gt;Éviter les accélérateurs inactifs et les experts surchargés&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mise à l&amp;rsquo;échelle de la capacité du modèle&lt;/td&gt;
 &lt;td&gt;Maintenir l&amp;rsquo;ensemble complet des poids accessible&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;C&amp;rsquo;est pourquoi Moonshot recommande un supernœud de 64 accélérateurs ou plus. Même quand seul un petit sous-ensemble d&amp;rsquo;experts est actif, l&amp;rsquo;expert sélectionné n&amp;rsquo;est pas connu à l&amp;rsquo;avance et le modèle complet doit rester accessible. À quatre bits, 2,8T poids impliquent un minimum théorique d&amp;rsquo;environ 1 400 Go avant les échelles, métadonnées, tampons, cache et réplication. L&amp;rsquo;activation sparse réduit l&amp;rsquo;arithmétique mais ne supprime pas les exigences de résidence mémoire ou de tissu interconnexion.&lt;/p&gt;
&lt;h3 id="22-kimi-linear-répond-au-coût-du-contexte-long"&gt;2.2 Kimi Linear répond au coût du contexte long
&lt;/h3&gt;&lt;p&gt;L&amp;rsquo;article sur Kimi Linear est antérieur à K3 et évalue un modèle de recherche de 48B paramètres totaux, 3B actifs — pas K3 lui-même. Il combine Kimi Delta Attention avec la Multi-head Latent Attention complète dans un rapport 3:1.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;attention complète est performante pour la copie exacte et la récupération fine, mais le cache KV croît avec le contexte. L&amp;rsquo;attention linéaire compresse l&amp;rsquo;historique dans un état de taille fixe, réduisant la dépendance à la longueur de séquence, mais peut perdre des détails exacts. Kimi Linear utilise trois couches KDA suivies d&amp;rsquo;une couche d&amp;rsquo;attention complète pour équilibrer efficacité et expressivité.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Composant&lt;/th&gt;
 &lt;th&gt;Rôle&lt;/th&gt;
 &lt;th&gt;Compromis&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;KDA&lt;/td&gt;
 &lt;td&gt;Compresser le long historique dans un état de taille fixe&lt;/td&gt;
 &lt;td&gt;Peut affaiblir la copie exacte et la récupération fine&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;MLA complet&lt;/td&gt;
 &lt;td&gt;Restaure le rappel précis token à token&lt;/td&gt;
 &lt;td&gt;Le cache KV continue de croître avec le contexte&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Hybride 3:1&lt;/td&gt;
 &lt;td&gt;Équilibre efficacité et qualité&lt;/td&gt;
 &lt;td&gt;Nécessite des noyaux et un logiciel de service plus complexes&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;L&amp;rsquo;article rapporte jusqu&amp;rsquo;à 75 % de réduction du cache KV et jusqu&amp;rsquo;à 6,3x le débit de décodage théorique à 1M de contexte. Une comparaison mesurée dans l&amp;rsquo;analyse de complexité rapporte une accélération de 2,3x. Ces résultats établissent une direction, non des performances garanties de l&amp;rsquo;API K3.&lt;/p&gt;
&lt;p&gt;Pour les investisseurs, un cache KV réduit signifie davantage de requêtes simultanées par accélérateur. Cela rend également économiques des dépôts plus longs, plus de documents et des agents persistants. La mémoire par token peut diminuer tandis que le nombre total de tokens augmente.&lt;/p&gt;
&lt;h3 id="23-les-résidus-dattention-améliorent-lefficacité-en-profondeur"&gt;2.3 Les Résidus d&amp;rsquo;Attention améliorent l&amp;rsquo;efficacité en profondeur
&lt;/h3&gt;&lt;p&gt;Les connexions résiduelles standard continuent d&amp;rsquo;ajouter les sorties des couches précédentes. Dans les réseaux très profonds, les représentations utiles peuvent se diluer. Les Résidus d&amp;rsquo;Attention permettent à une couche de sélectionner les représentations antérieures dont elle a besoin. Block AttnRes regroupe les couches et conserve les représentations au niveau des blocs, réduisant la surcharge mémoire.&lt;/p&gt;
&lt;p&gt;La recherche de Moonshot indique qu&amp;rsquo;environ huit blocs récupèrent la plupart des gains, et Block AttnRes peut égaler une ligne de base entraînée avec environ 1,25x de calcul. Cela améliore l&amp;rsquo;efficacité du capital d&amp;rsquo;entraînement, mais ne réduit pas automatiquement la demande de centres de données. Une meilleure efficacité peut être réinvestie dans des modèles plus grands et des tâches plus longues.&lt;/p&gt;
&lt;h3 id="24-la-quantification-est-une-stratégie-de-portabilité-matérielle"&gt;2.4 La quantification est une stratégie de portabilité matérielle
&lt;/h3&gt;&lt;p&gt;K3 applique un entraînement avec conscience de la quantification dès le fine-tuning supervisé, en utilisant des poids MXFP4 et des activations MXFP8. Cela devrait mieux contrôler la perte de précision par rapport à une quantification agressive post-entraînement et faciliter le déploiement sur plusieurs plateformes matérielles.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;arène de noyaux de Moonshot comprenait NVIDIA H200 et un GPU à usage général d&amp;rsquo;un fournisseur alternatif. Le billet officiel ne mentionne pas de puce chinoise ni ne revendique une économie équivalente au H200. Ce qui est vérifié, c&amp;rsquo;est l&amp;rsquo;intention stratégique d&amp;rsquo;optimiser en dehors de NVIDIA autant que sur NVIDIA.&lt;/p&gt;
&lt;p&gt;Cela importe à la fois pour la Chine et les acheteurs mondiaux. La Chine a besoin de modèles de niveau frontière pouvant survivre à un accès restreint aux meilleurs systèmes NVIDIA. Les autres acheteurs souhaitent un pouvoir de négociation entre NVIDIA, AMD et les accélérateurs personnalisés.&lt;/p&gt;
&lt;h2 id="3-ce-que-la-grille-tarifaire-révèle"&gt;3. Ce que la Grille Tarifaire Révèle
&lt;/h2&gt;&lt;h3 id="31-k3-est-positionné-comme-modèle-de-référence"&gt;3.1 K3 est positionné comme modèle de référence
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Modèle&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Entrée mise en cache par 1M&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Entrée standard&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Sortie&lt;/th&gt;
 &lt;th&gt;Positionnement actuel&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Kimi K3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0,30&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Tarification de modèle principal de niveau frontière&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 promo de lancement&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Variable&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$10&lt;/td&gt;
 &lt;td&gt;Temporaire jusqu&amp;rsquo;au 31 août&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 standard&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Variable&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Même prix affiché que K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0,50&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$5&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$30&lt;/td&gt;
 &lt;td&gt;67 % plus cher en entrée et 100 % plus cher en sortie que K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;K3 est plus cher que la promotion actuelle de Sonnet 5. Le décrire comme universellement deux fois moins cher est inexact. La stratégie est plus lisible : s&amp;rsquo;aligner sur le niveau standard de Sonnet tout en étant moins cher que l&amp;rsquo;API frontière la plus onéreuse.&lt;/p&gt;
&lt;p&gt;Le tarif est à la fois un signal de confiance et une décision de monétisation. Moonshot n&amp;rsquo;accepte plus une remise profonde simplement pour acquérir de l&amp;rsquo;usage. Il revendique une position dans le segment des modèles d&amp;rsquo;entreprise par défaut.&lt;/p&gt;
&lt;h3 id="32-le-coût-par-tâche-accomplie-importe-plus-que-le-coût-par-token"&gt;3.2 Le coût par tâche accomplie importe plus que le coût par token
&lt;/h3&gt;&lt;p&gt;Les grilles tarifaires supposent une utilisation équivalente des tokens. Les agents diffèrent par leur longueur de planification, leurs appels d&amp;rsquo;outils, leurs reprises et leur verbosité. K3 n&amp;rsquo;expose actuellement que le raisonnement maximal. Artificial Analysis rapporte que K3 a utilisé environ 130 millions de tokens de sortie dans son évaluation de l&amp;rsquo;Intelligence Index, soit plus du double de la médiane des pairs d&amp;rsquo;environ 63 millions. Un token de sortie moins cher peut tout de même conduire à une tâche coûteuse.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Coût de la tâche = tokens d'entrée × tarif d'entrée + tokens de sortie × tarif de sortie + coût des outils et reprises&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Les acheteurs en entreprise surveilleront le taux de réussite des tâches, les tokens de sortie, le temps jusqu&amp;rsquo;au premier token, le débit, la fiabilité des outils, le taux de hit de cache et la stabilité des sessions. Moonshot indique que Mooncake offre plus de 90 % de hits de cache sur les charges de travail de codage, rendant l&amp;rsquo;entrée mise en cache dix fois moins chère que l&amp;rsquo;entrée non mise en cache. Si ce taux se maintient sur le trafic entreprise, l&amp;rsquo;économie effective de K3 s&amp;rsquo;améliore sensiblement.&lt;/p&gt;
&lt;h3 id="33-mooncake-déplace-la-demande-mémoire-vers-le-bas-de-la-hiérarchie"&gt;3.3 Mooncake déplace la demande mémoire vers le bas de la hiérarchie
&lt;/h3&gt;&lt;p&gt;Mooncake sépare les clusters de prefill et de décodage et répartit le cache KV entre CPU, DRAM et SSD plutôt que de tout conserver dans la HBM GPU. Son article rapporte jusqu&amp;rsquo;à 525 % de débit supplémentaire en simulation et 75 % de requêtes supplémentaires sur les charges de production.&lt;/p&gt;
&lt;p&gt;Cela explique pourquoi la demande mémoire IA s&amp;rsquo;étend au-delà de la HBM.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Accélérateur HBM → DRAM serveur → SSD entreprise → niveau de cache distant&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;KDA peut réduire le cache KV par requête, mais les agents persistants à 1M de contexte augmentent le volume total et la durée de rétention du cache. Les données chaudes restent en HBM et DRAM ; le contexte plus froid migre vers les SSD. L&amp;rsquo;efficacité peut affaiblir la thèse centrée sur HBM seule tout en renforçant la hiérarchie mémoire au sens large.&lt;/p&gt;
&lt;h2 id="4-les-poids-ouverts-chinois-progressent-vers-le-haut-de-la-pile-entreprise"&gt;4. Les Poids Ouverts Chinois Progressent Vers le Haut de la Pile Entreprise
&lt;/h2&gt;&lt;p&gt;OpenRouter rapporte que les modèles chinois ont dépassé les modèles américains en part de tokens sur sa plateforme début juin 2026, sur la base de plus de 450 billions de tokens de janvier au 14 juin. La part de DeepSeek est passée d&amp;rsquo;environ 9 % à 18 % et il est devenu le premier fournisseur à mi-mai.&lt;/p&gt;
&lt;p&gt;Le chemin d&amp;rsquo;adoption comporte trois étapes :&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Les modèles ouverts à bas coût prennent en charge les charges de travail de classification, de traduction et de test.&lt;/li&gt;
&lt;li&gt;De meilleures performances en codage et en agent s&amp;rsquo;emparent des flux de travail d&amp;rsquo;entreprise répétitifs.&lt;/li&gt;
&lt;li&gt;Une qualité proche de la frontière et un contexte d&amp;rsquo;un million de tokens entrent en concurrence pour le routage principal.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Le tarif de K3 est conçu pour la troisième étape. Il ne suit pas la stratégie des prix les plus agressifs. Il pratique un tarif d&amp;rsquo;API de niveau frontière tout en promettant des poids que les clouds, les gouvernements et les entreprises peuvent déployer eux-mêmes.&lt;/p&gt;
&lt;p&gt;Les API propriétaires et les poids ouverts accumulent des actifs stratégiques différents.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;API frontière propriétaire&lt;/th&gt;
 &lt;th&gt;Poids ouverts proches de la frontière&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Contrôle la meilleure expérience utilisateur et la capacité&lt;/td&gt;
 &lt;td&gt;Multiplie les voies de déploiement et les options matérielles&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Centralise les données d&amp;rsquo;usage&lt;/td&gt;
 &lt;td&gt;Permet aux entreprises de conserver leurs données et opérations&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Modifie la tarification et la politique de manière centralisée&lt;/td&gt;
 &lt;td&gt;Les fichiers publiés sont difficiles à retirer&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Le fournisseur de modèle capte la marge brute&lt;/td&gt;
 &lt;td&gt;Les fournisseurs de cloud, puces et applications se partagent la valeur&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Le modèle propriétaire le plus puissant peut rester numéro un tout en perdant des parts de tokens payants. Les entreprises peuvent router le travail répétitif vers des modèles de classe K3 et réserver les tâches juridiques, de conception et de recherche les plus complexes au modèle fermé de tête. Le mix de tokens payants et le prix mixte importent davantage que le classement dans les benchmarks.&lt;/p&gt;
&lt;h2 id="5-demande-semi-conducteurs--efficacité-et-diffusion-arrivent-ensemble"&gt;5. Demande Semi-conducteurs : Efficacité et Diffusion Arrivent Ensemble
&lt;/h2&gt;&lt;h3 id="51-nvidia--risque-defficacité-à-court-terme-élasticité-de-déploiement-à-moyen-terme"&gt;5.1 NVIDIA : risque d&amp;rsquo;efficacité à court terme, élasticité de déploiement à moyen terme
&lt;/h3&gt;&lt;p&gt;Le MoE sparse, KDA, la quantification et l&amp;rsquo;optimisation autonome des noyaux réduisent le temps GPU par tâche. La portabilité matérielle affaiblit également l&amp;rsquo;hypothèse que chaque charge de travail frontière doit rester sur CUDA. Ce sont des signaux de valorisation négatifs pour NVIDIA.&lt;/p&gt;
&lt;p&gt;Le côté positif est tout aussi important. Moonshot recommande au moins 64 accélérateurs pour K3 en auto-hébergement. Les poids publiés pourraient inciter les clouds, gouvernements, laboratoires et grandes entreprises à construire leurs propres clusters. La demande concentrée derrière une seule API se transforme en demande matérielle répartie dans de nombreux centres de données.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Demande totale d'accélérateurs = temps GPU réduit par tâche × charge de travail totale accrue × plus d'institutions en auto-hébergement&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Le premier terme est négatif ; les deux derniers sont positifs. K3 seul ne suffit pas à revoir à la baisse les estimations de bénéfices de NVIDIA, mais il ne suffit pas non plus pour supposer que chaque gain d&amp;rsquo;efficacité engendre davantage de demande GPU. L&amp;rsquo;élasticité de la charge de travail est la variable déterminante.&lt;/p&gt;
&lt;h3 id="52-amd--optionnalité-issue-du-choix-matériel"&gt;5.2 AMD : optionnalité issue du choix matériel
&lt;/h3&gt;&lt;p&gt;AMD bénéficie si la portabilité de MXFP4, MXFP8 et vLLM permet aux entreprises de dissocier le choix du modèle de celui de l&amp;rsquo;accélérateur. Un modèle ouvert proche de la frontière offre aux acheteurs une charge de travail réaliste sur laquelle tester des alternatives à NVIDIA.&lt;/p&gt;
&lt;p&gt;La preuve doit venir après la publication des poids. Les noyaux ROCm, la communication parallèle entre experts, le débit en contexte 1M et la stabilité sur 64 accélérateurs doivent être mesurés. L&amp;rsquo;avantage d&amp;rsquo;AMD ne se concrétise que si K3 démontre un coût par tâche réussie supérieur sur les systèmes MI.&lt;/p&gt;
&lt;h3 id="53-hbm--cache-par-requête-réduit-résidence-du-modèle-plus-large"&gt;5.3 HBM : cache par requête réduit, résidence du modèle plus large
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Couche de demande&lt;/th&gt;
 &lt;th&gt;Impact d&amp;rsquo;efficacité K3&lt;/th&gt;
 &lt;th&gt;Direction&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Résidence des poids&lt;/td&gt;
 &lt;td&gt;Un modèle de 2,8T doit rester rapidement accessible&lt;/td&gt;
 &lt;td&gt;Plus d&amp;rsquo;accélérateurs et de mémoire à haute bande passante&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cache KV par requête&lt;/td&gt;
 &lt;td&gt;KDA réduit la taille et la croissance du cache&lt;/td&gt;
 &lt;td&gt;Moins de capacité HBM par requête&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Utilisateurs et agents simultanés&lt;/td&gt;
 &lt;td&gt;Un coût réduit et un déploiement ouvert peuvent élargir les charges de travail&lt;/td&gt;
 &lt;td&gt;Plus de HBM et DRAM au total&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Les titres peuvent être négatifs pour SK hynix, Micron et Samsung car 75 % de cache KV en moins et 6,3x de débit semblent indiquer une intensité mémoire moindre. Ces chiffres appartiennent à un modèle de recherche Kimi Linear, pas à la production K3 mesurée. La HBM stocke également les poids, les activations, les tampons de communication et les lots — pas seulement le cache KV.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;équilibre à moyen terme est neutre à légèrement positif si les clusters auto-hébergés et les charges de travail agents croissent plus vite que l&amp;rsquo;efficacité. Il devient négatif si l&amp;rsquo;élasticité de la charge de travail est faible et si la compression s&amp;rsquo;améliore plus vite que l&amp;rsquo;usage.&lt;/p&gt;
&lt;h3 id="54-la-dram-serveur-et-les-ssd-entreprise-sont-les-bénéficiaires-secondaires-les-plus-nets"&gt;5.4 La DRAM serveur et les SSD entreprise sont les bénéficiaires secondaires les plus nets
&lt;/h3&gt;&lt;p&gt;Le contexte long et la réutilisation du cache ne peuvent pas rester entièrement en HBM. Une fois que le service sépare prefill et décodage et répartit le cache entre CPU, DRAM et SSD, la DRAM serveur et les SSD entreprise deviennent des actifs opérationnels pour l&amp;rsquo;inférence IA.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Samsung peut vendre HBM, DRAM serveur, SSD haute capacité, fonderie et packaging.&lt;/li&gt;
&lt;li&gt;SK hynix combine HBM et DRAM serveur avec les SSD entreprise Solidigm.&lt;/li&gt;
&lt;li&gt;Micron fournit HBM, DRAM data-center et SSD.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3 ne démontre pas que l&amp;rsquo;IA a besoin de moins de mémoire. Il montre que la mémoire IA devient hiérarchique. Les données les plus chaudes restent en HBM, le contexte conservé se trouve dans la DRAM serveur, et le cache plus froid migre vers les SSD entreprise. Les fournisseurs disposant d&amp;rsquo;une pile mémoire complète présentent une meilleure résilience qu&amp;rsquo;une thèse centrée sur un seul produit HBM.&lt;/p&gt;
&lt;h3 id="55-la-mise-en-réseau-et-le-silicium-personnalisé-sont-les-goulots-détranglement-cachés-du-moe"&gt;5.5 La mise en réseau et le silicium personnalisé sont les goulots d&amp;rsquo;étranglement cachés du MoE
&lt;/h3&gt;&lt;p&gt;Répartir 896 experts sur des accélérateurs crée des communications variables en fonction du routage des tokens. C&amp;rsquo;est pourquoi Moonshot insiste sur un entraînement parallèle équilibré des experts, des formes statiques et la suppression de la synchronisation hôte du chemin critique. Un fonctionnement efficace sur 64 accélérateurs ou plus nécessite un tissu d&amp;rsquo;interconnexion à haute bande passante, tant en montée qu&amp;rsquo;en sortie de charge.&lt;/p&gt;
&lt;p&gt;Cela est structurellement positif pour Broadcom, Marvell, le réseau NVIDIA, les interconnexions optiques et le silicium de commutation. Cela encourage également les ASIC d&amp;rsquo;inférence optimisés pour les modèles ouverts. L&amp;rsquo;exercice de conception de petites puces en 48 heures de K3 n&amp;rsquo;est pas un produit commercial, mais il illustre une co-conception modèle-matériel plus rapide.&lt;/p&gt;
&lt;h2 id="6-stratégie-des-grandes-entreprises-tech-américaines-et-transmission-en-bourse"&gt;6. Stratégie des Grandes Entreprises Tech Américaines et Transmission en Bourse
&lt;/h2&gt;&lt;h3 id="61-microsoft--pression-sur-léconomie-dopenai-hausse-de-lusage-azure"&gt;6.1 Microsoft : pression sur l&amp;rsquo;économie d&amp;rsquo;OpenAI, hausse de l&amp;rsquo;usage Azure
&lt;/h3&gt;&lt;p&gt;Microsoft est exposé à la propriété intellectuelle et à l&amp;rsquo;économie d&amp;rsquo;OpenAI ainsi qu&amp;rsquo;à l&amp;rsquo;infrastructure Azure. La mise à jour du partenariat d&amp;rsquo;avril 2026 maintient Microsoft comme partenaire cloud principal et étend une licence IP non exclusive jusqu&amp;rsquo;en 2032.&lt;/p&gt;
&lt;p&gt;K3 presse la couche modèle car le travail répétitif peut migrer des API OpenAI. Il peut soutenir la couche cloud si Azure héberge K3 comme infrastructure gérée ou auto-hébergée.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Couche Microsoft&lt;/th&gt;
 &lt;th&gt;Impact K3&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Part des revenus OpenAI&lt;/td&gt;
 &lt;td&gt;Négatif via le prix et le mix&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Copilot&lt;/td&gt;
 &lt;td&gt;Positif si les coûts de routage diminuent&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Azure AI&lt;/td&gt;
 &lt;td&gt;Positif si l&amp;rsquo;usage multi-modèles augmente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Silicium personnalisé et centres de données&lt;/td&gt;
 &lt;td&gt;Positif si l&amp;rsquo;optimisation des poids ouverts s&amp;rsquo;étend&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;L&amp;rsquo;impact boursier à court terme est neutre. La question à moyen terme est de savoir si Azure parvient à convertir la déflation du prix des modèles en usage et en marge Copilot.&lt;/p&gt;
&lt;h3 id="62-amazon--anthropic-et-aws-ont-des-économies-différentes"&gt;6.2 Amazon : Anthropic et AWS ont des économies différentes
&lt;/h3&gt;&lt;p&gt;Amazon est un investisseur majeur d&amp;rsquo;Anthropic et le fournisseur d&amp;rsquo;AWS, Bedrock, Trainium et Inferentia. K3 peut éroder le pouvoir de tarification de Claude et la valeur de la participation d&amp;rsquo;Amazon dans Anthropic. Si les entreprises font tourner K3 sur AWS, en revanche, l&amp;rsquo;usage d&amp;rsquo;EC2, Bedrock, du stockage, du réseau et de Trainium peut augmenter.&lt;/p&gt;
&lt;p&gt;La stratégie optimale d&amp;rsquo;Amazon est de maintenir la charge de travail sur AWS quel que soit le modèle gagnant. Si K3 arrive avec une licence permissive et un support Trainium efficace, AWS peut monétiser la diffusion d&amp;rsquo;un concurrent. L&amp;rsquo;impact boursier est neutre à modérément positif, bien que la concurrence sur les prix d&amp;rsquo;inférence puisse comprimer les marges cloud même si les revenus augmentent.&lt;/p&gt;
&lt;h3 id="63-alphabet--pression-sur-les-prix-gemini-défense-tpu-et-vertex"&gt;6.3 Alphabet : pression sur les prix Gemini, défense TPU et Vertex
&lt;/h3&gt;&lt;p&gt;Google contrôle un modèle, une puce, une plateforme de déploiement et la demande finale via Search, Ads et Workspace. Vertex Model Garden prend en charge les modèles propriétaires, tiers et ouverts.&lt;/p&gt;
&lt;p&gt;K3 presse les prix de l&amp;rsquo;API Gemini mais peut créer une demande de TPU et de Google Cloud. Un moindre coût des modèles réduit également la dépense des AI Overviews, de la génération publicitaire et des agents Workspace. L&amp;rsquo;impact boursier est neutre à positif car Google n&amp;rsquo;est pas uniquement un fournisseur de modèles. Le risque est que Gemini perde à la fois le leadership de performance et de prix, renchérissant le coût d&amp;rsquo;acquisition de clients cloud.&lt;/p&gt;
&lt;h3 id="64-meta--de-bénéficiaire-des-poids-ouverts-à-défenseur"&gt;6.4 Meta : de bénéficiaire des poids ouverts à défenseur
&lt;/h3&gt;&lt;p&gt;Meta a bénéficié de la diffusion des poids ouverts en commoditisant les API des concurrents et en réduisant ses propres coûts de recommandation, de publicité et de contenu. Si les laboratoires chinois publient en premier une capacité proche de la frontière et un contexte plus long, Meta risque de perdre sa position de référence dans l&amp;rsquo;écosystème américain des poids ouverts.&lt;/p&gt;
&lt;p&gt;K3 impose deux réponses : le prochain Llama doit concurrencer sur le contexte long, les outils agents et le coût de déploiement, et Meta doit fournir une alternative américaine fiable pour les entreprises et gouvernements réticents à déployer des poids chinois. L&amp;rsquo;impact sur les bénéfices à court terme est limité car la publicité génère les flux de trésorerie. Le risque stratégique est une moindre rentabilité des investissements en infrastructure IA et en écosystème développeur si Llama prend du retard.&lt;/p&gt;
&lt;h3 id="65-le-positionnement-de-marché-existant-importe-plus-quun-seul-lancement"&gt;6.5 Le positionnement de marché existant importe plus qu&amp;rsquo;un seul lancement
&lt;/h3&gt;&lt;p&gt;Du 22 juin au 16 juillet, avant que la majeure partie des preuves K3 puisse peser sur les échanges, le complexe IA américain avait déjà fortement divergé.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Entreprise&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Rendement&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Recul depuis le sommet de la période&lt;/th&gt;
 &lt;th&gt;Signal de positionnement&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+17,9 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,1 %&lt;/td&gt;
 &lt;td&gt;Flux de trésorerie publicitaires solides et attentes d&amp;rsquo;utilisation IA&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+9,2 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-1,2 %&lt;/td&gt;
 &lt;td&gt;Résilience cloud et logiciels&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+7,3 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,2 %&lt;/td&gt;
 &lt;td&gt;Attentes de reprise AWS et consommateur&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+1,4 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-5,5 %&lt;/td&gt;
 &lt;td&gt;Positionnement mixte search et cloud&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-0,6 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,1 %&lt;/td&gt;
 &lt;td&gt;Relativement résilient&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-4,5 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9,7 %&lt;/td&gt;
 &lt;td&gt;Optimisme sur l&amp;rsquo;IA personnalisée face à la pression sur les valorisations&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9,2 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-14,3 %&lt;/td&gt;
 &lt;td&gt;Optionnalité accélérateur alternatif avec forte volatilité&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29,6 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32,0 %&lt;/td&gt;
 &lt;td&gt;Correction après des attentes mémoire élevées&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Oracle&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29,1 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32,7 %&lt;/td&gt;
 &lt;td&gt;Tension entre croissance infrastructure IA et financement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Marvell&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-38,8 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-40,1 %&lt;/td&gt;
 &lt;td&gt;Fort déclassement dans la mise en réseau et le silicium personnalisé&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Ce ne sont pas des rendements causés par K3. Ils montrent les positions dans lesquelles K3 est arrivé. Un NVIDIA relativement résilient peut être plus sensible aux manchettes d&amp;rsquo;efficacité, tandis que Micron et Marvell déjà corrigés pourraient réagir plus fortement si les poids publiés créent une demande d&amp;rsquo;infrastructure vérifiable.&lt;/p&gt;
&lt;h2 id="7-carte-dimpact-par-entreprise"&gt;7. Carte d&amp;rsquo;Impact par Entreprise
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Entreprise ou couche&lt;/th&gt;
 &lt;th&gt;Signal à court terme&lt;/th&gt;
 &lt;th&gt;Trajectoire à moyen terme&lt;/th&gt;
 &lt;th&gt;Que faire maintenant&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td&gt;Pression sur la valorisation due à l&amp;rsquo;efficacité et la portabilité&lt;/td&gt;
 &lt;td&gt;Les clusters auto-hébergés de 64+ accélérateurs compensent l&amp;rsquo;efficacité&lt;/td&gt;
 &lt;td&gt;Surveiller l&amp;rsquo;élasticité de la charge de travail, ne pas modifier les estimations sur le seul lancement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td&gt;Optionnalité de déploiement alternatif&lt;/td&gt;
 &lt;td&gt;Avantage en part si l&amp;rsquo;économie ROCm est prouvée&lt;/td&gt;
 &lt;td&gt;Attendre le débit post-27 juillet&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom et Marvell&lt;/td&gt;
 &lt;td&gt;Complexe réseau déjà en déclassement&lt;/td&gt;
 &lt;td&gt;Le parallélisme d&amp;rsquo;experts MoE augmente la demande de tissu&lt;/td&gt;
 &lt;td&gt;Vérifier les commandes et la topologie réelle des clusters K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;SK hynix&lt;/td&gt;
 &lt;td&gt;Sensible aux manchettes d&amp;rsquo;efficacité du cache KV&lt;/td&gt;
 &lt;td&gt;Exposition à la hiérarchie HBM, DRAM serveur et SSD Solidigm&lt;/td&gt;
 &lt;td&gt;Valoriser la pile mémoire complète, pas HBM seul&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Samsung Electronics&lt;/td&gt;
 &lt;td&gt;Risque d&amp;rsquo;efficacité HBM plus position de rattrapage&lt;/td&gt;
 &lt;td&gt;Optionnalité HBM, DRAM serveur, SSD et fonderie&lt;/td&gt;
 &lt;td&gt;Portefeuille le plus large, exécution toujours nécessaire&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td&gt;Attentes élevées déjà corrigées&lt;/td&gt;
 &lt;td&gt;Exposition intégrée mémoire et stockage IA américaine&lt;/td&gt;
 &lt;td&gt;Surveiller le volume de déploiement versus la tarification&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td&gt;Pression sur le prix et le mix OpenAI&lt;/td&gt;
 &lt;td&gt;Effet de levier sur les coûts Azure et Copilot&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;usage cloud importe plus que la marge modèle&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td&gt;Pression sur la valeur de l&amp;rsquo;actif Anthropic&lt;/td&gt;
 &lt;td&gt;AWS, Bedrock et Trainium bénéficient du choix de modèle&lt;/td&gt;
 &lt;td&gt;La compensation interne la plus nette&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td&gt;Pression sur les prix Gemini&lt;/td&gt;
 &lt;td&gt;Avantages de coût TPU, Vertex et Search&lt;/td&gt;
 &lt;td&gt;La défense de la couche applicative reste solide&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td&gt;Pression sur le leadership américain des poids ouverts&lt;/td&gt;
 &lt;td&gt;Accélération de Llama ou écosystème ouvert plus large&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;impact stratégique dépasse l&amp;rsquo;impact sur les bénéfices à court terme&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Il n&amp;rsquo;y a pas suffisamment de preuves pour un nouvel appel d&amp;rsquo;achat ou de vente basé uniquement sur ce lancement. Les poids, la licence et le débit matériel externe ne sont pas disponibles. L&amp;rsquo;ordre de la preuve importe plus que la direction du récit.&lt;/p&gt;
&lt;h2 id="8-trois-scénarios"&gt;8. Trois Scénarios
&lt;/h2&gt;&lt;h3 id="scénario-de-base--modèle-solide-réévaluation-limitée"&gt;Scénario de base : modèle solide, réévaluation limitée
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 55 %. Les poids complets et une licence raisonnablement permissive arrivent le 27 juillet. Les résultats externes reproduisent 85 % à 95 % des performances officielles. K3 fonctionne sur NVIDIA et AMD, mais 64+ accélérateurs, le raisonnement maximal et une utilisation élevée des tokens de sortie maintiennent le déploiement onéreux.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Les API propriétaires subissent davantage de pression tarifaire sur le travail répétitif.&lt;/li&gt;
&lt;li&gt;Les clouds gagnent en hébergement K3 et en demande d&amp;rsquo;auto-déploiement.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;efficacité par token compense la charge de travail accrue.&lt;/li&gt;
&lt;li&gt;La HBM est neutre à légèrement positive.&lt;/li&gt;
&lt;li&gt;La DRAM serveur, les SSD entreprise et la mise en réseau sont positifs.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="scénario-haussier--les-poids-ouverts-entrent-dans-le-routage-entreprise-principal"&gt;Scénario haussier : les poids ouverts entrent dans le routage entreprise principal
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 25 %. La licence est proche de MIT, le support vLLM et SGLang est stable, et NVIDIA, AMD et les accélérateurs chinois affichent un débit élevé. L&amp;rsquo;évaluation externe confirme des performances immédiatement inférieures aux meilleurs modèles propriétaires. Les modes de raisonnement moins intensifs réduisent le coût par tâche. Les principaux clouds et passerelles d&amp;rsquo;entreprise ajoutent K3 au routage par défaut.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Le prix mixte et la part de tokens des modèles propriétaires diminuent.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;usage multi-modèles des hyperscalers augmente.&lt;/li&gt;
&lt;li&gt;Les clusters auto-servis augmentent la demande d&amp;rsquo;accélérateurs.&lt;/li&gt;
&lt;li&gt;HBM, mise en réseau, DRAM serveur et SSD entreprise bénéficient du volume de déploiement.&lt;/li&gt;
&lt;li&gt;Meta et les programmes américains de modèles ouverts accélèrent leurs investissements.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="scénario-baissier--les-poids-révèlent-un-écart-de-coût-et-de-qualité"&gt;Scénario baissier : les poids révèlent un écart de coût et de qualité
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 20 %. Les poids sont retardés ou restreints, les scores externes tombent en dessous du tableau officiel, les exigences de conservation de l&amp;rsquo;historique de réflexion et une proactivité excessive créent des échecs en entreprise, et le coût par tâche dépasse Sonnet 5 en raison du raisonnement maximal et de la verbosité. L&amp;rsquo;exigence de 64 accélérateurs limite l&amp;rsquo;auto-hébergement.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Moonshot pourrait devoir renoncer à la tarification de niveau frontière.&lt;/li&gt;
&lt;li&gt;Les API propriétaires conservent une prime d&amp;rsquo;expérience utilisateur et de fiabilité.&lt;/li&gt;
&lt;li&gt;La demande semi-conducteurs incrémentale reste limitée.&lt;/li&gt;
&lt;li&gt;Les estimations de bénéfices et de capex existantes reprennent le contrôle des cours boursiers.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="9-liste-de-vérification-du-27-juillet"&gt;9. Liste de Vérification du 27 Juillet
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Point de preuve&lt;/th&gt;
 &lt;th&gt;Signal fort&lt;/th&gt;
 &lt;th&gt;Signal faible&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Poids et licence&lt;/td&gt;
 &lt;td&gt;Publication complète dans les délais avec droits de modification commerciale&lt;/td&gt;
 &lt;td&gt;Retard, restrictions ou composants manquants&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Évaluation externe&lt;/td&gt;
 &lt;td&gt;Scores officiels largement reproduits sous une seule configuration&lt;/td&gt;
 &lt;td&gt;Fort écart par rapport au tableau de la société&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Coût par tâche&lt;/td&gt;
 &lt;td&gt;Modes de raisonnement moins intensifs et moins de tokens de sortie&lt;/td&gt;
 &lt;td&gt;Raisonnement maximal uniquement et verbosité persistante&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Débit NVIDIA&lt;/td&gt;
 &lt;td&gt;Parallélisme d&amp;rsquo;experts stable sur des nœuds de 64 accélérateurs&lt;/td&gt;
 &lt;td&gt;Goulots de tissu et faible utilisation&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Débit AMD&lt;/td&gt;
 &lt;td&gt;Avantage de coût sous ROCm et vLLM&lt;/td&gt;
 &lt;td&gt;Noyaux immatures ou perte de précision&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Accélérateurs chinois&lt;/td&gt;
 &lt;td&gt;Matériel nommé et débit mesuré&lt;/td&gt;
 &lt;td&gt;Seulement le libellé « GPU alternatif »&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mise en cache&lt;/td&gt;
 &lt;td&gt;Hits proches de 90 % sur le trafic entreprise&lt;/td&gt;
 &lt;td&gt;Forte baisse en dehors du codage&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Adoption cloud&lt;/td&gt;
 &lt;td&gt;Listings AWS, Azure, Google Cloud ou Oracle&lt;/td&gt;
 &lt;td&gt;Limité à quelques plateformes chinoises&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tarification compétitive&lt;/td&gt;
 &lt;td&gt;Baisses de prix standards ou remises de cache plus larges&lt;/td&gt;
 &lt;td&gt;Promotions temporaires uniquement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Commandes mémoire&lt;/td&gt;
 &lt;td&gt;Révisions à la hausse des volumes HBM, DRAM serveur et SSD&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;efficacité augmente tandis que les volumes stagnent&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="10-le-contre-argument-le-plus-fort"&gt;10. Le Contre-argument le Plus Fort
&lt;/h2&gt;&lt;p&gt;Le scénario baissier le plus solide est simple : la demande semi-conducteurs diminue si l&amp;rsquo;efficacité s&amp;rsquo;améliore plus vite que l&amp;rsquo;usage. La compression des modèles, l&amp;rsquo;attention linéaire, la quantification, la réutilisation du cache et les ASIC d&amp;rsquo;inférence pourraient traiter le même nombre de tâches utiles avec bien moins de GPU et de HBM. La concurrence des poids ouverts peut faire baisser les prix des API sans générer suffisamment de travail payant supplémentaire pour justifier le capex IA.&lt;/p&gt;
&lt;p&gt;Les preuves de ce résultat incluraient un ralentissement des revenus d&amp;rsquo;inférence malgré la baisse des prix, une utilisation plus élevée des accélérateurs mais moins de nouveaux clusters, une croissance des bits HBM inférieure aux gains d&amp;rsquo;efficacité des modèles, une faible conversion des backlogs cloud IA en revenus, et des entreprises utilisant des modèles ouverts uniquement pour réduire les coûts plutôt que pour créer de nouveaux flux de travail.&lt;/p&gt;
&lt;p&gt;Le scénario haussier exige que les baisses de prix débloquent de nouveaux travaux : codage à l&amp;rsquo;échelle des dépôts, automatisation de la recherche, montage vidéo, conception de puces et flux de travail précédemment non rentables. L&amp;rsquo;élasticité de la charge de travail par rapport à l&amp;rsquo;efficacité des modèles est le point de preuve commun pour l&amp;rsquo;investissement tant dans les accélérateurs que dans la HBM.&lt;/p&gt;
&lt;h2 id="11-conclusion"&gt;11. Conclusion
&lt;/h2&gt;&lt;p&gt;Kimi K3 ne prouve pas que la Chine a surpassé les modèles propriétaires américains les plus puissants. Moonshot reconnaît l&amp;rsquo;écart d&amp;rsquo;expérience utilisateur persistant. Au 17 juillet, les poids complets et le rapport technique ne sont pas disponibles, et un tableau de benchmarks aux configurations mixtes ne peut pas désigner un vainqueur.&lt;/p&gt;
&lt;p&gt;Il modifie cependant la structure du marché. Un modèle de 2,8T paramètres, contexte 1M, proche de la frontière est actif au tarif standard de Sonnet, avec des poids promis dans les dix jours. Les poids ouverts chinois passent du statut de substituts bon marché de second rang vers des charges de travail d&amp;rsquo;entreprise de premier plan.&lt;/p&gt;
&lt;p&gt;Pour les semi-conducteurs, l&amp;rsquo;événement représente davantage une réallocation de la demande qu&amp;rsquo;une destruction de la demande. KDA et la quantification réduisent la HBM et le temps GPU par requête. Le MoE sparse et les supernœuds de 64 accélérateurs augmentent la mémoire de résidence du modèle et le tissu interconnexion. Mooncake pousse le cache dans la DRAM serveur et les SSD entreprise. La thèse centrée sur HBM seule devient moins simple, tandis que la hiérarchie mémoire et le centre de données complets restent exposés à un déploiement plus large.&lt;/p&gt;
&lt;p&gt;Les grandes entreprises tech américaines font face au même clivage. Les API modèles absorbent la pression tarifaire ; les clouds et les applications absorbent le moindre coût des modèles. Microsoft, Amazon et Alphabet peuvent héberger K3 même si leurs modèles préférés perdent des parts. Meta doit défendre son rôle stratégique de référence américaine en matière de poids ouverts.&lt;/p&gt;
&lt;p&gt;Le 27 juillet, la preuve importante n&amp;rsquo;est pas l&amp;rsquo;existence d&amp;rsquo;un fichier de poids. C&amp;rsquo;est une licence permissive, une évaluation reproductible, un débit multi-matériel et un coût compétitif par tâche accomplie. Si ces conditions sont réunies, K3 devient un événement qui modifie à la fois la courbe de prix de l&amp;rsquo;IA et le chemin de la demande semi-conducteurs. Sinon, il reste un lancement de produit impressionnant plutôt qu&amp;rsquo;un changement de paradigme industriel.&lt;/p&gt;
&lt;h2 id="sources-et-limites"&gt;Sources et Limites
&lt;/h2&gt;&lt;p&gt;Matériaux primaires : &lt;a class="link" href="https://www.kimi.com/blog/kimi-k3" target="_blank" rel="noopener"
 &gt;Lancement de Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://platform.kimi.ai/docs/pricing/chat-k3" target="_blank" rel="noopener"
 &gt;Documentation API Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2510.26692" target="_blank" rel="noopener"
 &gt;Article Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://github.com/MoonshotAI/Kimi-Linear" target="_blank" rel="noopener"
 &gt;GitHub Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2603.15031" target="_blank" rel="noopener"
 &gt;Article Résidus d&amp;rsquo;Attention&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2407.00079" target="_blank" rel="noopener"
 &gt;Article Mooncake&lt;/a&gt;, &lt;a class="link" href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noopener"
 &gt;Tarification Claude Sonnet 5&lt;/a&gt;, &lt;a class="link" href="https://developers.openai.com/api/docs/models/gpt-5.6-sol" target="_blank" rel="noopener"
 &gt;Tarification GPT-5.6 Sol&lt;/a&gt;, &lt;a class="link" href="https://openrouter.ai/blog/insights/deepseek-v4-adoption/" target="_blank" rel="noopener"
 &gt;Analyse d&amp;rsquo;adoption des modèles OpenRouter&lt;/a&gt;, &lt;a class="link" href="https://blogs.microsoft.com/blog/2026/04/27/the-next-phase-of-the-microsoft-openai-partnership/" target="_blank" rel="noopener"
 &gt;Partenariat Microsoft-OpenAI&lt;/a&gt;, &lt;a class="link" href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-garden/explore-models" target="_blank" rel="noopener"
 &gt;Google Vertex Model Garden&lt;/a&gt;, et &lt;a class="link" href="https://www.aboutamazon.com/news/company-news/amazon-aws-anthropic-ai" target="_blank" rel="noopener"
 &gt;Partenariat Amazon-Anthropic&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;analyse de transmission semi-conducteurs et boursière est une inférence à partir de données publiques d&amp;rsquo;architecture, de service et de marché. Le nombre exact de paramètres actifs, la taille des poids, les conditions de licence, le débit sur AMD et les accélérateurs chinois, et le coût effectif par tâche en entreprise restent non vérifiés au 17 juillet. Cet article est destiné à des fins de recherche et d&amp;rsquo;information uniquement et ne constitue pas un conseil en investissement.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Disclaimer: For research and information purposes only. Not investment advice. Names cited are for analytical illustration; readers should perform their own due diligence and consult licensed advisors before any investment decision.&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>