<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Poids Ouverts on Korea Invest Insights</title><link>https://koreainvestinsights.com/fr/tags/poids-ouverts/</link><description>Recent content in Poids Ouverts on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>fr</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Fri, 17 Jul 2026 13:54:01 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/fr/tags/poids-ouverts/feed.xml" rel="self" type="application/rss+xml"/><item><title>Kimi K3 Réinitialise la Courbe de Prix de l'IA : De Kimi Linear à HBM et la Stratégie des Grandes Tech</title><link>https://koreainvestinsights.com/fr/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</link><pubDate>Fri, 17 Jul 2026 12:31:36 +0900</pubDate><guid>https://koreainvestinsights.com/fr/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</guid><description>&lt;p&gt;Kimi K3 a été lancé le 16 juillet 2026 à 3 $ par million de tokens d&amp;rsquo;entrée non mis en cache et 15 $ par million de tokens de sortie. Ce n&amp;rsquo;est pas le positionnement ultra-bas prix habituel d&amp;rsquo;un challenger chinois. Ce tarif correspond à celui de Claude Sonnet 5 et se situe 40 % en dessous de GPT-5.6 Sol sur l&amp;rsquo;entrée et 50 % en dessous sur la sortie. Moonshot AI positionne K3 comme modèle d&amp;rsquo;entreprise de référence, non comme une solution de repli économique.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;architecture est conçue pour soutenir cette affirmation. K3 dispose de 2,8 billions de paramètres au total, mais n&amp;rsquo;active effectivement que 16 des 896 experts par token. Kimi Delta Attention contrôle le coût du contexte long, les Résidus d&amp;rsquo;Attention récupèrent sélectivement des représentations antérieures en profondeur, et l&amp;rsquo;entraînement avec conscience de la quantification utilise des poids MXFP4 avec des activations MXFP8. Moonshot recommande un supernœud d&amp;rsquo;au moins 64 accélérateurs.&lt;/p&gt;
&lt;p&gt;Cette combinaison crée un résultat semi-conducteur à double effet. La mémoire et le calcul par token peuvent diminuer tandis que le nombre d&amp;rsquo;institutions capables de déployer un modèle de classe frontière — et la quantité de travail qu&amp;rsquo;elles exécutent — peut augmenter. K3 est à la fois une technologie d&amp;rsquo;efficacité et une charge de travail d&amp;rsquo;infrastructure.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;Lectures connexes : &lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-token-value-memory-value-added-2026-07-09/" &gt;Valeur du token IA et capture de la valeur mémoire&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/ai-token-futures-cost-per-token-korea-semiconductor-thesis-2026-05-30/" &gt;Futures sur tokens IA et coût par token&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/us-china-agentic-inference-stack-sram-opportunity-2026-07-09/" &gt;Divergence États-Unis–Chine dans l&amp;rsquo;infrastructure d&amp;rsquo;inférence agentique&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/fr/post/hbm-2030-supply-demand-267eb-demand-model-crosscheck-2026-07-13/" &gt;Vérification croisée du modèle de pénurie HBM 2030&lt;/a&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="synthèse"&gt;Synthèse
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;K3 combine 2,8 billions de paramètres, une vision native et une fenêtre de contexte de 1M tokens. Ses produits et son API sont actifs, mais au 17 juillet, les poids complets, le rapport technique et la licence n&amp;rsquo;ont pas encore été publiés. La thèse des poids ouverts devra être vérifiée après la date limite du 27 juillet.&lt;/li&gt;
&lt;li&gt;Le score officiel GDPval-AA v2 de Moonshot est de 1 668, et non de 1 687. AA-Briefcase est à 1 548. BrowseComp à 91,2 utilise la compaction de contexte ; le résultat sans compaction sur le contexte 1M est de 90,4. Les résultats sont solides, mais les configurations mixtes et les évaluations réalisées par la société elle-même nécessitent une reproduction indépendante.&lt;/li&gt;
&lt;li&gt;Les affirmations de Kimi Linear concernant une réduction allant jusqu&amp;rsquo;à 75 % du cache KV et un débit de décodage théorique jusqu&amp;rsquo;à 6,3 fois plus élevé à 1M de contexte proviennent d&amp;rsquo;un modèle de recherche de 48B paramètres totaux et 3B actifs. Elles ne doivent pas être présentées comme des performances mesurées de l&amp;rsquo;API K3.&lt;/li&gt;
&lt;li&gt;K3 n&amp;rsquo;est pas un modèle à bas coût. Son prix correspond au tarif standard de Sonnet 5, est 50 % plus cher que la promotion de lancement temporaire de Sonnet, et moins cher que GPT-5.6 Sol. Étant donné que seul le mode de raisonnement maximal est actuellement disponible et que les tests indépendants montrent une utilisation élevée de tokens de sortie, le coût par tâche accomplie peut être moins attractif que ce que le tarif officiel laisse entendre.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;impact semi-conducteur oppose une réduction du calcul et du cache KV par requête à un déploiement plus large en auto-hébergement et une charge de travail totale accrue. La DRAM serveur et les SSD entreprise sont les bénéficiaires secondaires les plus nets, car le contexte agent de longue durée déborde de la HBM vers des niveaux de cache déconcentrés.&lt;/li&gt;
&lt;li&gt;La couche modèle et la couche cloud connaissent des économies opposées. La tarification des API d&amp;rsquo;OpenAI, Anthropic et Gemini subit une pression, tandis qu&amp;rsquo;Azure, AWS et Google Cloud peuvent monétiser K3 et d&amp;rsquo;autres modèles via le calcul, le stockage et le réseau. Meta doit défendre son leadership américain sur les poids ouverts.&lt;/li&gt;
&lt;li&gt;Les preuves du 27 juillet attendues sont : la licence, les poids complets, l&amp;rsquo;évaluation externe, le débit sur NVIDIA et AMD, la prise en charge des accélérateurs chinois, les tokens de sortie effectifs par tâche, la compatibilité vLLM et l&amp;rsquo;adoption dans les catalogues cloud.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img alt="Stratégie tarifaire de Kimi K3 et carte d’impact sur l’infrastructure IA" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://koreainvestinsights.com/images/posts/kimi-k3-pricing-infrastructure-impact-2026-07-17.png"&gt;
&lt;/p&gt;
&lt;h2 id="1-corriger-les-chiffres-avant-de-tirer-des-conclusions"&gt;1. Corriger les Chiffres Avant de Tirer des Conclusions
&lt;/h2&gt;&lt;p&gt;Plusieurs valeurs ont évolué au fil de la circulation du lancement sur les réseaux sociaux. Les chiffres officiels sont importants car certains écarts modifient l&amp;rsquo;interprétation pour l&amp;rsquo;investisseur.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Élément&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Valeur officielle&lt;/th&gt;
 &lt;th&gt;Interprétation pour l&amp;rsquo;investisseur&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Paramètres totaux&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2,8T&lt;/td&gt;
 &lt;td&gt;Taille totale du modèle, pas le calcul actif par token&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Routage d&amp;rsquo;experts&lt;/td&gt;
 &lt;td style="text-align: right"&gt;16 sur 896&lt;/td&gt;
 &lt;td&gt;MoE extrêmement sparse ; qualité du routage et communication deviennent des contraintes de premier ordre&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Contexte&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1M tokens&lt;/td&gt;
 &lt;td&gt;Utile pour les dépôts et la recherche, mais le coût par tâche dépend de la longueur de sortie et des hits de cache&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GDPval-AA v2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1 668&lt;/td&gt;
 &lt;td&gt;Le tableau officiel ne mentionne pas 1 687&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AA-Briefcase&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1 548&lt;/td&gt;
 &lt;td&gt;Au-dessus de GPT-5.6 Sol à 1 495, en dessous de Claude Fable 5 à 1 583&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp&lt;/td&gt;
 &lt;td style="text-align: right"&gt;91,2&lt;/td&gt;
 &lt;td&gt;Utilise la compaction à partir de 300K tokens&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp sans compaction&lt;/td&gt;
 &lt;td style="text-align: right"&gt;90,4&lt;/td&gt;
 &lt;td&gt;Le résultat le plus propre pour la revendication de contexte natif 1M&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Disponibilité produit&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Web, Work, Code et API actifs&lt;/td&gt;
 &lt;td&gt;Les tests commerciaux peuvent commencer maintenant&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Poids&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Promis pour le 27 juillet&lt;/td&gt;
 &lt;td&gt;Licence et artefacts complets non vérifiés au 17 juillet&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Effort de raisonnement&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Maximal uniquement&lt;/td&gt;
 &lt;td&gt;Les modes basse consommation ne sont pas encore disponibles&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Moonshot indique explicitement que K3 reste en retrait par rapport à Claude Fable 5 et GPT-5.6 Sol en termes d&amp;rsquo;expérience utilisateur globale. Parallèlement, il annonce des performances de niveau frontière en codage, travail de connaissance et benchmarks multimodaux. L&amp;rsquo;interprétation crédible n&amp;rsquo;est pas que la Chine a pris définitivement la tête. C&amp;rsquo;est qu&amp;rsquo;un modèle chinois a intégré la bande de performance immédiatement inférieure aux systèmes propriétaires les plus puissants, tout en promettant un contexte 1M et des poids téléchargeables.&lt;/p&gt;
&lt;p&gt;Le tableau de benchmarks ne constitue pas un tournoi contrôlé unique. K3 fonctionne avec l&amp;rsquo;effort de raisonnement maximal. Selon la tâche, les modèles utilisent Kimi Code, Claude Code ou Codex, et certains scores de concurrents correspondent aux meilleurs résultats obtenus sur différentes configurations ou importés depuis des classements externes. Une reproduction indépendante reste nécessaire.&lt;/p&gt;
&lt;p&gt;Néanmoins, Terminal-Bench 2.1 à 88,3, FrontierSWE à 81,2, SWE Marathon à 42,0, AutomationBench à 30,8, GPQA-Diamond à 93,5 et MMMU-Pro à 81,6 indiquent que K3 est conçu pour l&amp;rsquo;utilisation d&amp;rsquo;outils à long horizon et le codage, et pas seulement pour la conversation. Le signal le plus important est l&amp;rsquo;ensemble du package : capacité proche de la frontière, contexte 1M et poids ouverts promis.&lt;/p&gt;
&lt;h2 id="2-comment-un-modèle-de-28-billions-de-paramètres-devient-déployable"&gt;2. Comment un Modèle de 2,8 Billions de Paramètres Devient Déployable
&lt;/h2&gt;&lt;h3 id="21-les-paramètres-totaux-ne-sont-pas-des-paramètres-actifs"&gt;2.1 Les paramètres totaux ne sont pas des paramètres actifs
&lt;/h3&gt;&lt;p&gt;Calculer les 2,8T paramètres pour chaque token serait prohibitivement coûteux. Stable LatentMoE active effectivement 16 des 896 experts, soit environ 1,8 % du pool d&amp;rsquo;experts. Le rapport technique est nécessaire pour établir le nombre exact de paramètres actifs, mais les paramètres totaux ne correspondent clairement pas au calcul par token.&lt;/p&gt;
&lt;p&gt;Le MoE sparse déplace les goulots d&amp;rsquo;étranglement plutôt qu&amp;rsquo;il ne les supprime.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Ce qui s&amp;rsquo;améliore&lt;/th&gt;
 &lt;th&gt;Ce qui devient plus difficile&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Calcul actif par token&lt;/td&gt;
 &lt;td&gt;Qualité du routeur et équilibre des experts&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Calcul nécessaire pour un niveau de qualité cible&lt;/td&gt;
 &lt;td&gt;Communication entre accélérateurs&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Certains coûts d&amp;rsquo;inférence&lt;/td&gt;
 &lt;td&gt;Éviter les accélérateurs inactifs et les experts surchargés&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mise à l&amp;rsquo;échelle de la capacité du modèle&lt;/td&gt;
 &lt;td&gt;Maintenir l&amp;rsquo;ensemble complet des poids accessible&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;C&amp;rsquo;est pourquoi Moonshot recommande un supernœud de 64 accélérateurs ou plus. Même quand seul un petit sous-ensemble d&amp;rsquo;experts est actif, l&amp;rsquo;expert sélectionné n&amp;rsquo;est pas connu à l&amp;rsquo;avance et le modèle complet doit rester accessible. À quatre bits, 2,8T poids impliquent un minimum théorique d&amp;rsquo;environ 1 400 Go avant les échelles, métadonnées, tampons, cache et réplication. L&amp;rsquo;activation sparse réduit l&amp;rsquo;arithmétique mais ne supprime pas les exigences de résidence mémoire ou de tissu interconnexion.&lt;/p&gt;
&lt;h3 id="22-kimi-linear-répond-au-coût-du-contexte-long"&gt;2.2 Kimi Linear répond au coût du contexte long
&lt;/h3&gt;&lt;p&gt;L&amp;rsquo;article sur Kimi Linear est antérieur à K3 et évalue un modèle de recherche de 48B paramètres totaux, 3B actifs — pas K3 lui-même. Il combine Kimi Delta Attention avec la Multi-head Latent Attention complète dans un rapport 3:1.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;attention complète est performante pour la copie exacte et la récupération fine, mais le cache KV croît avec le contexte. L&amp;rsquo;attention linéaire compresse l&amp;rsquo;historique dans un état de taille fixe, réduisant la dépendance à la longueur de séquence, mais peut perdre des détails exacts. Kimi Linear utilise trois couches KDA suivies d&amp;rsquo;une couche d&amp;rsquo;attention complète pour équilibrer efficacité et expressivité.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Composant&lt;/th&gt;
 &lt;th&gt;Rôle&lt;/th&gt;
 &lt;th&gt;Compromis&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;KDA&lt;/td&gt;
 &lt;td&gt;Compresser le long historique dans un état de taille fixe&lt;/td&gt;
 &lt;td&gt;Peut affaiblir la copie exacte et la récupération fine&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;MLA complet&lt;/td&gt;
 &lt;td&gt;Restaure le rappel précis token à token&lt;/td&gt;
 &lt;td&gt;Le cache KV continue de croître avec le contexte&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Hybride 3:1&lt;/td&gt;
 &lt;td&gt;Équilibre efficacité et qualité&lt;/td&gt;
 &lt;td&gt;Nécessite des noyaux et un logiciel de service plus complexes&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;L&amp;rsquo;article rapporte jusqu&amp;rsquo;à 75 % de réduction du cache KV et jusqu&amp;rsquo;à 6,3x le débit de décodage théorique à 1M de contexte. Une comparaison mesurée dans l&amp;rsquo;analyse de complexité rapporte une accélération de 2,3x. Ces résultats établissent une direction, non des performances garanties de l&amp;rsquo;API K3.&lt;/p&gt;
&lt;p&gt;Pour les investisseurs, un cache KV réduit signifie davantage de requêtes simultanées par accélérateur. Cela rend également économiques des dépôts plus longs, plus de documents et des agents persistants. La mémoire par token peut diminuer tandis que le nombre total de tokens augmente.&lt;/p&gt;
&lt;h3 id="23-les-résidus-dattention-améliorent-lefficacité-en-profondeur"&gt;2.3 Les Résidus d&amp;rsquo;Attention améliorent l&amp;rsquo;efficacité en profondeur
&lt;/h3&gt;&lt;p&gt;Les connexions résiduelles standard continuent d&amp;rsquo;ajouter les sorties des couches précédentes. Dans les réseaux très profonds, les représentations utiles peuvent se diluer. Les Résidus d&amp;rsquo;Attention permettent à une couche de sélectionner les représentations antérieures dont elle a besoin. Block AttnRes regroupe les couches et conserve les représentations au niveau des blocs, réduisant la surcharge mémoire.&lt;/p&gt;
&lt;p&gt;La recherche de Moonshot indique qu&amp;rsquo;environ huit blocs récupèrent la plupart des gains, et Block AttnRes peut égaler une ligne de base entraînée avec environ 1,25x de calcul. Cela améliore l&amp;rsquo;efficacité du capital d&amp;rsquo;entraînement, mais ne réduit pas automatiquement la demande de centres de données. Une meilleure efficacité peut être réinvestie dans des modèles plus grands et des tâches plus longues.&lt;/p&gt;
&lt;h3 id="24-la-quantification-est-une-stratégie-de-portabilité-matérielle"&gt;2.4 La quantification est une stratégie de portabilité matérielle
&lt;/h3&gt;&lt;p&gt;K3 applique un entraînement avec conscience de la quantification dès le fine-tuning supervisé, en utilisant des poids MXFP4 et des activations MXFP8. Cela devrait mieux contrôler la perte de précision par rapport à une quantification agressive post-entraînement et faciliter le déploiement sur plusieurs plateformes matérielles.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;arène de noyaux de Moonshot comprenait NVIDIA H200 et un GPU à usage général d&amp;rsquo;un fournisseur alternatif. Le billet officiel ne mentionne pas de puce chinoise ni ne revendique une économie équivalente au H200. Ce qui est vérifié, c&amp;rsquo;est l&amp;rsquo;intention stratégique d&amp;rsquo;optimiser en dehors de NVIDIA autant que sur NVIDIA.&lt;/p&gt;
&lt;p&gt;Cela importe à la fois pour la Chine et les acheteurs mondiaux. La Chine a besoin de modèles de niveau frontière pouvant survivre à un accès restreint aux meilleurs systèmes NVIDIA. Les autres acheteurs souhaitent un pouvoir de négociation entre NVIDIA, AMD et les accélérateurs personnalisés.&lt;/p&gt;
&lt;h2 id="3-ce-que-la-grille-tarifaire-révèle"&gt;3. Ce que la Grille Tarifaire Révèle
&lt;/h2&gt;&lt;h3 id="31-k3-est-positionné-comme-modèle-de-référence"&gt;3.1 K3 est positionné comme modèle de référence
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Modèle&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Entrée mise en cache par 1M&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Entrée standard&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Sortie&lt;/th&gt;
 &lt;th&gt;Positionnement actuel&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Kimi K3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0,30&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Tarification de modèle principal de niveau frontière&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 promo de lancement&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Variable&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$10&lt;/td&gt;
 &lt;td&gt;Temporaire jusqu&amp;rsquo;au 31 août&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 standard&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Variable&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Même prix affiché que K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0,50&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$5&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$30&lt;/td&gt;
 &lt;td&gt;67 % plus cher en entrée et 100 % plus cher en sortie que K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;K3 est plus cher que la promotion actuelle de Sonnet 5. Le décrire comme universellement deux fois moins cher est inexact. La stratégie est plus lisible : s&amp;rsquo;aligner sur le niveau standard de Sonnet tout en étant moins cher que l&amp;rsquo;API frontière la plus onéreuse.&lt;/p&gt;
&lt;p&gt;Le tarif est à la fois un signal de confiance et une décision de monétisation. Moonshot n&amp;rsquo;accepte plus une remise profonde simplement pour acquérir de l&amp;rsquo;usage. Il revendique une position dans le segment des modèles d&amp;rsquo;entreprise par défaut.&lt;/p&gt;
&lt;h3 id="32-le-coût-par-tâche-accomplie-importe-plus-que-le-coût-par-token"&gt;3.2 Le coût par tâche accomplie importe plus que le coût par token
&lt;/h3&gt;&lt;p&gt;Les grilles tarifaires supposent une utilisation équivalente des tokens. Les agents diffèrent par leur longueur de planification, leurs appels d&amp;rsquo;outils, leurs reprises et leur verbosité. K3 n&amp;rsquo;expose actuellement que le raisonnement maximal. Artificial Analysis rapporte que K3 a utilisé environ 130 millions de tokens de sortie dans son évaluation de l&amp;rsquo;Intelligence Index, soit plus du double de la médiane des pairs d&amp;rsquo;environ 63 millions. Un token de sortie moins cher peut tout de même conduire à une tâche coûteuse.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Coût de la tâche = tokens d'entrée × tarif d'entrée + tokens de sortie × tarif de sortie + coût des outils et reprises&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Les acheteurs en entreprise surveilleront le taux de réussite des tâches, les tokens de sortie, le temps jusqu&amp;rsquo;au premier token, le débit, la fiabilité des outils, le taux de hit de cache et la stabilité des sessions. Moonshot indique que Mooncake offre plus de 90 % de hits de cache sur les charges de travail de codage, rendant l&amp;rsquo;entrée mise en cache dix fois moins chère que l&amp;rsquo;entrée non mise en cache. Si ce taux se maintient sur le trafic entreprise, l&amp;rsquo;économie effective de K3 s&amp;rsquo;améliore sensiblement.&lt;/p&gt;
&lt;h3 id="33-mooncake-déplace-la-demande-mémoire-vers-le-bas-de-la-hiérarchie"&gt;3.3 Mooncake déplace la demande mémoire vers le bas de la hiérarchie
&lt;/h3&gt;&lt;p&gt;Mooncake sépare les clusters de prefill et de décodage et répartit le cache KV entre CPU, DRAM et SSD plutôt que de tout conserver dans la HBM GPU. Son article rapporte jusqu&amp;rsquo;à 525 % de débit supplémentaire en simulation et 75 % de requêtes supplémentaires sur les charges de production.&lt;/p&gt;
&lt;p&gt;Cela explique pourquoi la demande mémoire IA s&amp;rsquo;étend au-delà de la HBM.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Accélérateur HBM → DRAM serveur → SSD entreprise → niveau de cache distant&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;KDA peut réduire le cache KV par requête, mais les agents persistants à 1M de contexte augmentent le volume total et la durée de rétention du cache. Les données chaudes restent en HBM et DRAM ; le contexte plus froid migre vers les SSD. L&amp;rsquo;efficacité peut affaiblir la thèse centrée sur HBM seule tout en renforçant la hiérarchie mémoire au sens large.&lt;/p&gt;
&lt;h2 id="4-les-poids-ouverts-chinois-progressent-vers-le-haut-de-la-pile-entreprise"&gt;4. Les Poids Ouverts Chinois Progressent Vers le Haut de la Pile Entreprise
&lt;/h2&gt;&lt;p&gt;OpenRouter rapporte que les modèles chinois ont dépassé les modèles américains en part de tokens sur sa plateforme début juin 2026, sur la base de plus de 450 billions de tokens de janvier au 14 juin. La part de DeepSeek est passée d&amp;rsquo;environ 9 % à 18 % et il est devenu le premier fournisseur à mi-mai.&lt;/p&gt;
&lt;p&gt;Le chemin d&amp;rsquo;adoption comporte trois étapes :&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Les modèles ouverts à bas coût prennent en charge les charges de travail de classification, de traduction et de test.&lt;/li&gt;
&lt;li&gt;De meilleures performances en codage et en agent s&amp;rsquo;emparent des flux de travail d&amp;rsquo;entreprise répétitifs.&lt;/li&gt;
&lt;li&gt;Une qualité proche de la frontière et un contexte d&amp;rsquo;un million de tokens entrent en concurrence pour le routage principal.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Le tarif de K3 est conçu pour la troisième étape. Il ne suit pas la stratégie des prix les plus agressifs. Il pratique un tarif d&amp;rsquo;API de niveau frontière tout en promettant des poids que les clouds, les gouvernements et les entreprises peuvent déployer eux-mêmes.&lt;/p&gt;
&lt;p&gt;Les API propriétaires et les poids ouverts accumulent des actifs stratégiques différents.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;API frontière propriétaire&lt;/th&gt;
 &lt;th&gt;Poids ouverts proches de la frontière&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Contrôle la meilleure expérience utilisateur et la capacité&lt;/td&gt;
 &lt;td&gt;Multiplie les voies de déploiement et les options matérielles&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Centralise les données d&amp;rsquo;usage&lt;/td&gt;
 &lt;td&gt;Permet aux entreprises de conserver leurs données et opérations&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Modifie la tarification et la politique de manière centralisée&lt;/td&gt;
 &lt;td&gt;Les fichiers publiés sont difficiles à retirer&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Le fournisseur de modèle capte la marge brute&lt;/td&gt;
 &lt;td&gt;Les fournisseurs de cloud, puces et applications se partagent la valeur&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Le modèle propriétaire le plus puissant peut rester numéro un tout en perdant des parts de tokens payants. Les entreprises peuvent router le travail répétitif vers des modèles de classe K3 et réserver les tâches juridiques, de conception et de recherche les plus complexes au modèle fermé de tête. Le mix de tokens payants et le prix mixte importent davantage que le classement dans les benchmarks.&lt;/p&gt;
&lt;h2 id="5-demande-semi-conducteurs--efficacité-et-diffusion-arrivent-ensemble"&gt;5. Demande Semi-conducteurs : Efficacité et Diffusion Arrivent Ensemble
&lt;/h2&gt;&lt;h3 id="51-nvidia--risque-defficacité-à-court-terme-élasticité-de-déploiement-à-moyen-terme"&gt;5.1 NVIDIA : risque d&amp;rsquo;efficacité à court terme, élasticité de déploiement à moyen terme
&lt;/h3&gt;&lt;p&gt;Le MoE sparse, KDA, la quantification et l&amp;rsquo;optimisation autonome des noyaux réduisent le temps GPU par tâche. La portabilité matérielle affaiblit également l&amp;rsquo;hypothèse que chaque charge de travail frontière doit rester sur CUDA. Ce sont des signaux de valorisation négatifs pour NVIDIA.&lt;/p&gt;
&lt;p&gt;Le côté positif est tout aussi important. Moonshot recommande au moins 64 accélérateurs pour K3 en auto-hébergement. Les poids publiés pourraient inciter les clouds, gouvernements, laboratoires et grandes entreprises à construire leurs propres clusters. La demande concentrée derrière une seule API se transforme en demande matérielle répartie dans de nombreux centres de données.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Demande totale d'accélérateurs = temps GPU réduit par tâche × charge de travail totale accrue × plus d'institutions en auto-hébergement&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Le premier terme est négatif ; les deux derniers sont positifs. K3 seul ne suffit pas à revoir à la baisse les estimations de bénéfices de NVIDIA, mais il ne suffit pas non plus pour supposer que chaque gain d&amp;rsquo;efficacité engendre davantage de demande GPU. L&amp;rsquo;élasticité de la charge de travail est la variable déterminante.&lt;/p&gt;
&lt;h3 id="52-amd--optionnalité-issue-du-choix-matériel"&gt;5.2 AMD : optionnalité issue du choix matériel
&lt;/h3&gt;&lt;p&gt;AMD bénéficie si la portabilité de MXFP4, MXFP8 et vLLM permet aux entreprises de dissocier le choix du modèle de celui de l&amp;rsquo;accélérateur. Un modèle ouvert proche de la frontière offre aux acheteurs une charge de travail réaliste sur laquelle tester des alternatives à NVIDIA.&lt;/p&gt;
&lt;p&gt;La preuve doit venir après la publication des poids. Les noyaux ROCm, la communication parallèle entre experts, le débit en contexte 1M et la stabilité sur 64 accélérateurs doivent être mesurés. L&amp;rsquo;avantage d&amp;rsquo;AMD ne se concrétise que si K3 démontre un coût par tâche réussie supérieur sur les systèmes MI.&lt;/p&gt;
&lt;h3 id="53-hbm--cache-par-requête-réduit-résidence-du-modèle-plus-large"&gt;5.3 HBM : cache par requête réduit, résidence du modèle plus large
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Couche de demande&lt;/th&gt;
 &lt;th&gt;Impact d&amp;rsquo;efficacité K3&lt;/th&gt;
 &lt;th&gt;Direction&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Résidence des poids&lt;/td&gt;
 &lt;td&gt;Un modèle de 2,8T doit rester rapidement accessible&lt;/td&gt;
 &lt;td&gt;Plus d&amp;rsquo;accélérateurs et de mémoire à haute bande passante&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cache KV par requête&lt;/td&gt;
 &lt;td&gt;KDA réduit la taille et la croissance du cache&lt;/td&gt;
 &lt;td&gt;Moins de capacité HBM par requête&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Utilisateurs et agents simultanés&lt;/td&gt;
 &lt;td&gt;Un coût réduit et un déploiement ouvert peuvent élargir les charges de travail&lt;/td&gt;
 &lt;td&gt;Plus de HBM et DRAM au total&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Les titres peuvent être négatifs pour SK hynix, Micron et Samsung car 75 % de cache KV en moins et 6,3x de débit semblent indiquer une intensité mémoire moindre. Ces chiffres appartiennent à un modèle de recherche Kimi Linear, pas à la production K3 mesurée. La HBM stocke également les poids, les activations, les tampons de communication et les lots — pas seulement le cache KV.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;équilibre à moyen terme est neutre à légèrement positif si les clusters auto-hébergés et les charges de travail agents croissent plus vite que l&amp;rsquo;efficacité. Il devient négatif si l&amp;rsquo;élasticité de la charge de travail est faible et si la compression s&amp;rsquo;améliore plus vite que l&amp;rsquo;usage.&lt;/p&gt;
&lt;h3 id="54-la-dram-serveur-et-les-ssd-entreprise-sont-les-bénéficiaires-secondaires-les-plus-nets"&gt;5.4 La DRAM serveur et les SSD entreprise sont les bénéficiaires secondaires les plus nets
&lt;/h3&gt;&lt;p&gt;Le contexte long et la réutilisation du cache ne peuvent pas rester entièrement en HBM. Une fois que le service sépare prefill et décodage et répartit le cache entre CPU, DRAM et SSD, la DRAM serveur et les SSD entreprise deviennent des actifs opérationnels pour l&amp;rsquo;inférence IA.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Samsung peut vendre HBM, DRAM serveur, SSD haute capacité, fonderie et packaging.&lt;/li&gt;
&lt;li&gt;SK hynix combine HBM et DRAM serveur avec les SSD entreprise Solidigm.&lt;/li&gt;
&lt;li&gt;Micron fournit HBM, DRAM data-center et SSD.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3 ne démontre pas que l&amp;rsquo;IA a besoin de moins de mémoire. Il montre que la mémoire IA devient hiérarchique. Les données les plus chaudes restent en HBM, le contexte conservé se trouve dans la DRAM serveur, et le cache plus froid migre vers les SSD entreprise. Les fournisseurs disposant d&amp;rsquo;une pile mémoire complète présentent une meilleure résilience qu&amp;rsquo;une thèse centrée sur un seul produit HBM.&lt;/p&gt;
&lt;h3 id="55-la-mise-en-réseau-et-le-silicium-personnalisé-sont-les-goulots-détranglement-cachés-du-moe"&gt;5.5 La mise en réseau et le silicium personnalisé sont les goulots d&amp;rsquo;étranglement cachés du MoE
&lt;/h3&gt;&lt;p&gt;Répartir 896 experts sur des accélérateurs crée des communications variables en fonction du routage des tokens. C&amp;rsquo;est pourquoi Moonshot insiste sur un entraînement parallèle équilibré des experts, des formes statiques et la suppression de la synchronisation hôte du chemin critique. Un fonctionnement efficace sur 64 accélérateurs ou plus nécessite un tissu d&amp;rsquo;interconnexion à haute bande passante, tant en montée qu&amp;rsquo;en sortie de charge.&lt;/p&gt;
&lt;p&gt;Cela est structurellement positif pour Broadcom, Marvell, le réseau NVIDIA, les interconnexions optiques et le silicium de commutation. Cela encourage également les ASIC d&amp;rsquo;inférence optimisés pour les modèles ouverts. L&amp;rsquo;exercice de conception de petites puces en 48 heures de K3 n&amp;rsquo;est pas un produit commercial, mais il illustre une co-conception modèle-matériel plus rapide.&lt;/p&gt;
&lt;h2 id="6-stratégie-des-grandes-entreprises-tech-américaines-et-transmission-en-bourse"&gt;6. Stratégie des Grandes Entreprises Tech Américaines et Transmission en Bourse
&lt;/h2&gt;&lt;h3 id="61-microsoft--pression-sur-léconomie-dopenai-hausse-de-lusage-azure"&gt;6.1 Microsoft : pression sur l&amp;rsquo;économie d&amp;rsquo;OpenAI, hausse de l&amp;rsquo;usage Azure
&lt;/h3&gt;&lt;p&gt;Microsoft est exposé à la propriété intellectuelle et à l&amp;rsquo;économie d&amp;rsquo;OpenAI ainsi qu&amp;rsquo;à l&amp;rsquo;infrastructure Azure. La mise à jour du partenariat d&amp;rsquo;avril 2026 maintient Microsoft comme partenaire cloud principal et étend une licence IP non exclusive jusqu&amp;rsquo;en 2032.&lt;/p&gt;
&lt;p&gt;K3 presse la couche modèle car le travail répétitif peut migrer des API OpenAI. Il peut soutenir la couche cloud si Azure héberge K3 comme infrastructure gérée ou auto-hébergée.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Couche Microsoft&lt;/th&gt;
 &lt;th&gt;Impact K3&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Part des revenus OpenAI&lt;/td&gt;
 &lt;td&gt;Négatif via le prix et le mix&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Copilot&lt;/td&gt;
 &lt;td&gt;Positif si les coûts de routage diminuent&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Azure AI&lt;/td&gt;
 &lt;td&gt;Positif si l&amp;rsquo;usage multi-modèles augmente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Silicium personnalisé et centres de données&lt;/td&gt;
 &lt;td&gt;Positif si l&amp;rsquo;optimisation des poids ouverts s&amp;rsquo;étend&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;L&amp;rsquo;impact boursier à court terme est neutre. La question à moyen terme est de savoir si Azure parvient à convertir la déflation du prix des modèles en usage et en marge Copilot.&lt;/p&gt;
&lt;h3 id="62-amazon--anthropic-et-aws-ont-des-économies-différentes"&gt;6.2 Amazon : Anthropic et AWS ont des économies différentes
&lt;/h3&gt;&lt;p&gt;Amazon est un investisseur majeur d&amp;rsquo;Anthropic et le fournisseur d&amp;rsquo;AWS, Bedrock, Trainium et Inferentia. K3 peut éroder le pouvoir de tarification de Claude et la valeur de la participation d&amp;rsquo;Amazon dans Anthropic. Si les entreprises font tourner K3 sur AWS, en revanche, l&amp;rsquo;usage d&amp;rsquo;EC2, Bedrock, du stockage, du réseau et de Trainium peut augmenter.&lt;/p&gt;
&lt;p&gt;La stratégie optimale d&amp;rsquo;Amazon est de maintenir la charge de travail sur AWS quel que soit le modèle gagnant. Si K3 arrive avec une licence permissive et un support Trainium efficace, AWS peut monétiser la diffusion d&amp;rsquo;un concurrent. L&amp;rsquo;impact boursier est neutre à modérément positif, bien que la concurrence sur les prix d&amp;rsquo;inférence puisse comprimer les marges cloud même si les revenus augmentent.&lt;/p&gt;
&lt;h3 id="63-alphabet--pression-sur-les-prix-gemini-défense-tpu-et-vertex"&gt;6.3 Alphabet : pression sur les prix Gemini, défense TPU et Vertex
&lt;/h3&gt;&lt;p&gt;Google contrôle un modèle, une puce, une plateforme de déploiement et la demande finale via Search, Ads et Workspace. Vertex Model Garden prend en charge les modèles propriétaires, tiers et ouverts.&lt;/p&gt;
&lt;p&gt;K3 presse les prix de l&amp;rsquo;API Gemini mais peut créer une demande de TPU et de Google Cloud. Un moindre coût des modèles réduit également la dépense des AI Overviews, de la génération publicitaire et des agents Workspace. L&amp;rsquo;impact boursier est neutre à positif car Google n&amp;rsquo;est pas uniquement un fournisseur de modèles. Le risque est que Gemini perde à la fois le leadership de performance et de prix, renchérissant le coût d&amp;rsquo;acquisition de clients cloud.&lt;/p&gt;
&lt;h3 id="64-meta--de-bénéficiaire-des-poids-ouverts-à-défenseur"&gt;6.4 Meta : de bénéficiaire des poids ouverts à défenseur
&lt;/h3&gt;&lt;p&gt;Meta a bénéficié de la diffusion des poids ouverts en commoditisant les API des concurrents et en réduisant ses propres coûts de recommandation, de publicité et de contenu. Si les laboratoires chinois publient en premier une capacité proche de la frontière et un contexte plus long, Meta risque de perdre sa position de référence dans l&amp;rsquo;écosystème américain des poids ouverts.&lt;/p&gt;
&lt;p&gt;K3 impose deux réponses : le prochain Llama doit concurrencer sur le contexte long, les outils agents et le coût de déploiement, et Meta doit fournir une alternative américaine fiable pour les entreprises et gouvernements réticents à déployer des poids chinois. L&amp;rsquo;impact sur les bénéfices à court terme est limité car la publicité génère les flux de trésorerie. Le risque stratégique est une moindre rentabilité des investissements en infrastructure IA et en écosystème développeur si Llama prend du retard.&lt;/p&gt;
&lt;h3 id="65-le-positionnement-de-marché-existant-importe-plus-quun-seul-lancement"&gt;6.5 Le positionnement de marché existant importe plus qu&amp;rsquo;un seul lancement
&lt;/h3&gt;&lt;p&gt;Du 22 juin au 16 juillet, avant que la majeure partie des preuves K3 puisse peser sur les échanges, le complexe IA américain avait déjà fortement divergé.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Entreprise&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Rendement&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Recul depuis le sommet de la période&lt;/th&gt;
 &lt;th&gt;Signal de positionnement&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+17,9 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,1 %&lt;/td&gt;
 &lt;td&gt;Flux de trésorerie publicitaires solides et attentes d&amp;rsquo;utilisation IA&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+9,2 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-1,2 %&lt;/td&gt;
 &lt;td&gt;Résilience cloud et logiciels&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+7,3 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,2 %&lt;/td&gt;
 &lt;td&gt;Attentes de reprise AWS et consommateur&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+1,4 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-5,5 %&lt;/td&gt;
 &lt;td&gt;Positionnement mixte search et cloud&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-0,6 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3,1 %&lt;/td&gt;
 &lt;td&gt;Relativement résilient&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-4,5 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9,7 %&lt;/td&gt;
 &lt;td&gt;Optimisme sur l&amp;rsquo;IA personnalisée face à la pression sur les valorisations&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9,2 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-14,3 %&lt;/td&gt;
 &lt;td&gt;Optionnalité accélérateur alternatif avec forte volatilité&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29,6 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32,0 %&lt;/td&gt;
 &lt;td&gt;Correction après des attentes mémoire élevées&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Oracle&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29,1 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32,7 %&lt;/td&gt;
 &lt;td&gt;Tension entre croissance infrastructure IA et financement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Marvell&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-38,8 %&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-40,1 %&lt;/td&gt;
 &lt;td&gt;Fort déclassement dans la mise en réseau et le silicium personnalisé&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Ce ne sont pas des rendements causés par K3. Ils montrent les positions dans lesquelles K3 est arrivé. Un NVIDIA relativement résilient peut être plus sensible aux manchettes d&amp;rsquo;efficacité, tandis que Micron et Marvell déjà corrigés pourraient réagir plus fortement si les poids publiés créent une demande d&amp;rsquo;infrastructure vérifiable.&lt;/p&gt;
&lt;h2 id="7-carte-dimpact-par-entreprise"&gt;7. Carte d&amp;rsquo;Impact par Entreprise
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Entreprise ou couche&lt;/th&gt;
 &lt;th&gt;Signal à court terme&lt;/th&gt;
 &lt;th&gt;Trajectoire à moyen terme&lt;/th&gt;
 &lt;th&gt;Que faire maintenant&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td&gt;Pression sur la valorisation due à l&amp;rsquo;efficacité et la portabilité&lt;/td&gt;
 &lt;td&gt;Les clusters auto-hébergés de 64+ accélérateurs compensent l&amp;rsquo;efficacité&lt;/td&gt;
 &lt;td&gt;Surveiller l&amp;rsquo;élasticité de la charge de travail, ne pas modifier les estimations sur le seul lancement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td&gt;Optionnalité de déploiement alternatif&lt;/td&gt;
 &lt;td&gt;Avantage en part si l&amp;rsquo;économie ROCm est prouvée&lt;/td&gt;
 &lt;td&gt;Attendre le débit post-27 juillet&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom et Marvell&lt;/td&gt;
 &lt;td&gt;Complexe réseau déjà en déclassement&lt;/td&gt;
 &lt;td&gt;Le parallélisme d&amp;rsquo;experts MoE augmente la demande de tissu&lt;/td&gt;
 &lt;td&gt;Vérifier les commandes et la topologie réelle des clusters K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;SK hynix&lt;/td&gt;
 &lt;td&gt;Sensible aux manchettes d&amp;rsquo;efficacité du cache KV&lt;/td&gt;
 &lt;td&gt;Exposition à la hiérarchie HBM, DRAM serveur et SSD Solidigm&lt;/td&gt;
 &lt;td&gt;Valoriser la pile mémoire complète, pas HBM seul&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Samsung Electronics&lt;/td&gt;
 &lt;td&gt;Risque d&amp;rsquo;efficacité HBM plus position de rattrapage&lt;/td&gt;
 &lt;td&gt;Optionnalité HBM, DRAM serveur, SSD et fonderie&lt;/td&gt;
 &lt;td&gt;Portefeuille le plus large, exécution toujours nécessaire&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td&gt;Attentes élevées déjà corrigées&lt;/td&gt;
 &lt;td&gt;Exposition intégrée mémoire et stockage IA américaine&lt;/td&gt;
 &lt;td&gt;Surveiller le volume de déploiement versus la tarification&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td&gt;Pression sur le prix et le mix OpenAI&lt;/td&gt;
 &lt;td&gt;Effet de levier sur les coûts Azure et Copilot&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;usage cloud importe plus que la marge modèle&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td&gt;Pression sur la valeur de l&amp;rsquo;actif Anthropic&lt;/td&gt;
 &lt;td&gt;AWS, Bedrock et Trainium bénéficient du choix de modèle&lt;/td&gt;
 &lt;td&gt;La compensation interne la plus nette&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td&gt;Pression sur les prix Gemini&lt;/td&gt;
 &lt;td&gt;Avantages de coût TPU, Vertex et Search&lt;/td&gt;
 &lt;td&gt;La défense de la couche applicative reste solide&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td&gt;Pression sur le leadership américain des poids ouverts&lt;/td&gt;
 &lt;td&gt;Accélération de Llama ou écosystème ouvert plus large&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;impact stratégique dépasse l&amp;rsquo;impact sur les bénéfices à court terme&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Il n&amp;rsquo;y a pas suffisamment de preuves pour un nouvel appel d&amp;rsquo;achat ou de vente basé uniquement sur ce lancement. Les poids, la licence et le débit matériel externe ne sont pas disponibles. L&amp;rsquo;ordre de la preuve importe plus que la direction du récit.&lt;/p&gt;
&lt;h2 id="8-trois-scénarios"&gt;8. Trois Scénarios
&lt;/h2&gt;&lt;h3 id="scénario-de-base--modèle-solide-réévaluation-limitée"&gt;Scénario de base : modèle solide, réévaluation limitée
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 55 %. Les poids complets et une licence raisonnablement permissive arrivent le 27 juillet. Les résultats externes reproduisent 85 % à 95 % des performances officielles. K3 fonctionne sur NVIDIA et AMD, mais 64+ accélérateurs, le raisonnement maximal et une utilisation élevée des tokens de sortie maintiennent le déploiement onéreux.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Les API propriétaires subissent davantage de pression tarifaire sur le travail répétitif.&lt;/li&gt;
&lt;li&gt;Les clouds gagnent en hébergement K3 et en demande d&amp;rsquo;auto-déploiement.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;efficacité par token compense la charge de travail accrue.&lt;/li&gt;
&lt;li&gt;La HBM est neutre à légèrement positive.&lt;/li&gt;
&lt;li&gt;La DRAM serveur, les SSD entreprise et la mise en réseau sont positifs.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="scénario-haussier--les-poids-ouverts-entrent-dans-le-routage-entreprise-principal"&gt;Scénario haussier : les poids ouverts entrent dans le routage entreprise principal
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 25 %. La licence est proche de MIT, le support vLLM et SGLang est stable, et NVIDIA, AMD et les accélérateurs chinois affichent un débit élevé. L&amp;rsquo;évaluation externe confirme des performances immédiatement inférieures aux meilleurs modèles propriétaires. Les modes de raisonnement moins intensifs réduisent le coût par tâche. Les principaux clouds et passerelles d&amp;rsquo;entreprise ajoutent K3 au routage par défaut.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Le prix mixte et la part de tokens des modèles propriétaires diminuent.&lt;/li&gt;
&lt;li&gt;L&amp;rsquo;usage multi-modèles des hyperscalers augmente.&lt;/li&gt;
&lt;li&gt;Les clusters auto-servis augmentent la demande d&amp;rsquo;accélérateurs.&lt;/li&gt;
&lt;li&gt;HBM, mise en réseau, DRAM serveur et SSD entreprise bénéficient du volume de déploiement.&lt;/li&gt;
&lt;li&gt;Meta et les programmes américains de modèles ouverts accélèrent leurs investissements.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="scénario-baissier--les-poids-révèlent-un-écart-de-coût-et-de-qualité"&gt;Scénario baissier : les poids révèlent un écart de coût et de qualité
&lt;/h3&gt;&lt;p&gt;Probabilité subjective : 20 %. Les poids sont retardés ou restreints, les scores externes tombent en dessous du tableau officiel, les exigences de conservation de l&amp;rsquo;historique de réflexion et une proactivité excessive créent des échecs en entreprise, et le coût par tâche dépasse Sonnet 5 en raison du raisonnement maximal et de la verbosité. L&amp;rsquo;exigence de 64 accélérateurs limite l&amp;rsquo;auto-hébergement.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Moonshot pourrait devoir renoncer à la tarification de niveau frontière.&lt;/li&gt;
&lt;li&gt;Les API propriétaires conservent une prime d&amp;rsquo;expérience utilisateur et de fiabilité.&lt;/li&gt;
&lt;li&gt;La demande semi-conducteurs incrémentale reste limitée.&lt;/li&gt;
&lt;li&gt;Les estimations de bénéfices et de capex existantes reprennent le contrôle des cours boursiers.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="9-liste-de-vérification-du-27-juillet"&gt;9. Liste de Vérification du 27 Juillet
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Point de preuve&lt;/th&gt;
 &lt;th&gt;Signal fort&lt;/th&gt;
 &lt;th&gt;Signal faible&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Poids et licence&lt;/td&gt;
 &lt;td&gt;Publication complète dans les délais avec droits de modification commerciale&lt;/td&gt;
 &lt;td&gt;Retard, restrictions ou composants manquants&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Évaluation externe&lt;/td&gt;
 &lt;td&gt;Scores officiels largement reproduits sous une seule configuration&lt;/td&gt;
 &lt;td&gt;Fort écart par rapport au tableau de la société&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Coût par tâche&lt;/td&gt;
 &lt;td&gt;Modes de raisonnement moins intensifs et moins de tokens de sortie&lt;/td&gt;
 &lt;td&gt;Raisonnement maximal uniquement et verbosité persistante&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Débit NVIDIA&lt;/td&gt;
 &lt;td&gt;Parallélisme d&amp;rsquo;experts stable sur des nœuds de 64 accélérateurs&lt;/td&gt;
 &lt;td&gt;Goulots de tissu et faible utilisation&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Débit AMD&lt;/td&gt;
 &lt;td&gt;Avantage de coût sous ROCm et vLLM&lt;/td&gt;
 &lt;td&gt;Noyaux immatures ou perte de précision&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Accélérateurs chinois&lt;/td&gt;
 &lt;td&gt;Matériel nommé et débit mesuré&lt;/td&gt;
 &lt;td&gt;Seulement le libellé « GPU alternatif »&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mise en cache&lt;/td&gt;
 &lt;td&gt;Hits proches de 90 % sur le trafic entreprise&lt;/td&gt;
 &lt;td&gt;Forte baisse en dehors du codage&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Adoption cloud&lt;/td&gt;
 &lt;td&gt;Listings AWS, Azure, Google Cloud ou Oracle&lt;/td&gt;
 &lt;td&gt;Limité à quelques plateformes chinoises&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tarification compétitive&lt;/td&gt;
 &lt;td&gt;Baisses de prix standards ou remises de cache plus larges&lt;/td&gt;
 &lt;td&gt;Promotions temporaires uniquement&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Commandes mémoire&lt;/td&gt;
 &lt;td&gt;Révisions à la hausse des volumes HBM, DRAM serveur et SSD&lt;/td&gt;
 &lt;td&gt;L&amp;rsquo;efficacité augmente tandis que les volumes stagnent&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="10-le-contre-argument-le-plus-fort"&gt;10. Le Contre-argument le Plus Fort
&lt;/h2&gt;&lt;p&gt;Le scénario baissier le plus solide est simple : la demande semi-conducteurs diminue si l&amp;rsquo;efficacité s&amp;rsquo;améliore plus vite que l&amp;rsquo;usage. La compression des modèles, l&amp;rsquo;attention linéaire, la quantification, la réutilisation du cache et les ASIC d&amp;rsquo;inférence pourraient traiter le même nombre de tâches utiles avec bien moins de GPU et de HBM. La concurrence des poids ouverts peut faire baisser les prix des API sans générer suffisamment de travail payant supplémentaire pour justifier le capex IA.&lt;/p&gt;
&lt;p&gt;Les preuves de ce résultat incluraient un ralentissement des revenus d&amp;rsquo;inférence malgré la baisse des prix, une utilisation plus élevée des accélérateurs mais moins de nouveaux clusters, une croissance des bits HBM inférieure aux gains d&amp;rsquo;efficacité des modèles, une faible conversion des backlogs cloud IA en revenus, et des entreprises utilisant des modèles ouverts uniquement pour réduire les coûts plutôt que pour créer de nouveaux flux de travail.&lt;/p&gt;
&lt;p&gt;Le scénario haussier exige que les baisses de prix débloquent de nouveaux travaux : codage à l&amp;rsquo;échelle des dépôts, automatisation de la recherche, montage vidéo, conception de puces et flux de travail précédemment non rentables. L&amp;rsquo;élasticité de la charge de travail par rapport à l&amp;rsquo;efficacité des modèles est le point de preuve commun pour l&amp;rsquo;investissement tant dans les accélérateurs que dans la HBM.&lt;/p&gt;
&lt;h2 id="11-conclusion"&gt;11. Conclusion
&lt;/h2&gt;&lt;p&gt;Kimi K3 ne prouve pas que la Chine a surpassé les modèles propriétaires américains les plus puissants. Moonshot reconnaît l&amp;rsquo;écart d&amp;rsquo;expérience utilisateur persistant. Au 17 juillet, les poids complets et le rapport technique ne sont pas disponibles, et un tableau de benchmarks aux configurations mixtes ne peut pas désigner un vainqueur.&lt;/p&gt;
&lt;p&gt;Il modifie cependant la structure du marché. Un modèle de 2,8T paramètres, contexte 1M, proche de la frontière est actif au tarif standard de Sonnet, avec des poids promis dans les dix jours. Les poids ouverts chinois passent du statut de substituts bon marché de second rang vers des charges de travail d&amp;rsquo;entreprise de premier plan.&lt;/p&gt;
&lt;p&gt;Pour les semi-conducteurs, l&amp;rsquo;événement représente davantage une réallocation de la demande qu&amp;rsquo;une destruction de la demande. KDA et la quantification réduisent la HBM et le temps GPU par requête. Le MoE sparse et les supernœuds de 64 accélérateurs augmentent la mémoire de résidence du modèle et le tissu interconnexion. Mooncake pousse le cache dans la DRAM serveur et les SSD entreprise. La thèse centrée sur HBM seule devient moins simple, tandis que la hiérarchie mémoire et le centre de données complets restent exposés à un déploiement plus large.&lt;/p&gt;
&lt;p&gt;Les grandes entreprises tech américaines font face au même clivage. Les API modèles absorbent la pression tarifaire ; les clouds et les applications absorbent le moindre coût des modèles. Microsoft, Amazon et Alphabet peuvent héberger K3 même si leurs modèles préférés perdent des parts. Meta doit défendre son rôle stratégique de référence américaine en matière de poids ouverts.&lt;/p&gt;
&lt;p&gt;Le 27 juillet, la preuve importante n&amp;rsquo;est pas l&amp;rsquo;existence d&amp;rsquo;un fichier de poids. C&amp;rsquo;est une licence permissive, une évaluation reproductible, un débit multi-matériel et un coût compétitif par tâche accomplie. Si ces conditions sont réunies, K3 devient un événement qui modifie à la fois la courbe de prix de l&amp;rsquo;IA et le chemin de la demande semi-conducteurs. Sinon, il reste un lancement de produit impressionnant plutôt qu&amp;rsquo;un changement de paradigme industriel.&lt;/p&gt;
&lt;h2 id="sources-et-limites"&gt;Sources et Limites
&lt;/h2&gt;&lt;p&gt;Matériaux primaires : &lt;a class="link" href="https://www.kimi.com/blog/kimi-k3" target="_blank" rel="noopener"
 &gt;Lancement de Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://platform.kimi.ai/docs/pricing/chat-k3" target="_blank" rel="noopener"
 &gt;Documentation API Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2510.26692" target="_blank" rel="noopener"
 &gt;Article Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://github.com/MoonshotAI/Kimi-Linear" target="_blank" rel="noopener"
 &gt;GitHub Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2603.15031" target="_blank" rel="noopener"
 &gt;Article Résidus d&amp;rsquo;Attention&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2407.00079" target="_blank" rel="noopener"
 &gt;Article Mooncake&lt;/a&gt;, &lt;a class="link" href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noopener"
 &gt;Tarification Claude Sonnet 5&lt;/a&gt;, &lt;a class="link" href="https://developers.openai.com/api/docs/models/gpt-5.6-sol" target="_blank" rel="noopener"
 &gt;Tarification GPT-5.6 Sol&lt;/a&gt;, &lt;a class="link" href="https://openrouter.ai/blog/insights/deepseek-v4-adoption/" target="_blank" rel="noopener"
 &gt;Analyse d&amp;rsquo;adoption des modèles OpenRouter&lt;/a&gt;, &lt;a class="link" href="https://blogs.microsoft.com/blog/2026/04/27/the-next-phase-of-the-microsoft-openai-partnership/" target="_blank" rel="noopener"
 &gt;Partenariat Microsoft-OpenAI&lt;/a&gt;, &lt;a class="link" href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-garden/explore-models" target="_blank" rel="noopener"
 &gt;Google Vertex Model Garden&lt;/a&gt;, et &lt;a class="link" href="https://www.aboutamazon.com/news/company-news/amazon-aws-anthropic-ai" target="_blank" rel="noopener"
 &gt;Partenariat Amazon-Anthropic&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;analyse de transmission semi-conducteurs et boursière est une inférence à partir de données publiques d&amp;rsquo;architecture, de service et de marché. Le nombre exact de paramètres actifs, la taille des poids, les conditions de licence, le débit sur AMD et les accélérateurs chinois, et le coût effectif par tâche en entreprise restent non vérifiés au 17 juillet. Cet article est destiné à des fins de recherche et d&amp;rsquo;information uniquement et ne constitue pas un conseil en investissement.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Disclaimer: For research and information purposes only. Not investment advice. Names cited are for analytical illustration; readers should perform their own due diligence and consult licensed advisors before any investment decision.&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>