<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>DRAM Máy Chủ on Korea Invest Insights</title><link>https://koreainvestinsights.com/vi/tags/dram-m%C3%A1y-ch%E1%BB%A7/</link><description>Recent content in DRAM Máy Chủ on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>vi</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Thu, 23 Jul 2026 08:44:15 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/vi/tags/dram-m%C3%A1y-ch%E1%BB%A7/feed.xml" rel="self" type="application/rss+xml"/><item><title>Quý 2 của Alphabet: Cloud +82% khép lại tranh luận về cầu, FCF âm mở ra tranh luận về tiền mặt</title><link>https://koreainvestinsights.com/vi/post/alphabet-q2-2026-cloud-82-fcf-negative-memory-demand-2026-07-23/</link><pubDate>Thu, 23 Jul 2026 11:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/vi/post/alphabet-q2-2026-cloud-82-fcf-negative-memory-demand-2026-07-23/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;Bối cảnh: Bài viết trước &lt;a class="link" href="https://koreainvestinsights.com/vi/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/" &gt;Ai đốt hết số token đó?&lt;/a&gt; đã viết rằng mắt xích yếu cuối cùng trong tranh luận CAPEX AI, tức cầu cuối cùng, đã bắt đầu có con số đi kèm, và để việc phán định lại cho mùa báo cáo kết quả kinh doanh quanh ngày 30/7. Bảng điểm đầu tiên đã đến sớm hơn dự kiến. Alphabet công bố kết quả kinh doanh quý 2 vào rạng sáng 23/7 giờ Hàn Quốc. Bài viết này tổng hợp hai ghi chú phân tích mổ xẻ cùng một kết quả kinh doanh từ hai góc độ khác nhau thành một bài duy nhất. Nói trước kết luận, tranh luận về phía cầu về cơ bản đã kết thúc, và sân khấu tranh luận đã chuyển sang dòng tiền và lợi nhuận trên vốn.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tldr"&gt;TL;DR
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Doanh thu Google Cloud đạt 24,8 tỷ USD, &lt;strong&gt;+82%&lt;/strong&gt; (đồng thuận +64%), đánh dấu năm quý liên tiếp tăng tốc theo chuỗi 32% → 34% → 48% → 63% → 82%. Backlog tăng ròng 52 tỷ USD, từ 462 tỷ USD lên &lt;strong&gt;514 tỷ USD&lt;/strong&gt;, ngay cả khi lượng doanh thu được ghi nhận cũng đang lớn dần.&lt;/li&gt;
&lt;li&gt;Chất lượng của cầu còn quan trọng hơn. Khách hàng Cloud hiện hữu đang chi tiêu vượt mức cam kết ban đầu trung bình &lt;strong&gt;hơn 50%&lt;/strong&gt;, còn lưu lượng API mô hình Gemini tăng lên 22 tỷ token/phút từ 16 tỷ, tăng 37,5% chỉ trong một quý. Vì nguồn cung không đủ, từ tháng 6 Alphabet đã bắt đầu trả &lt;strong&gt;khoảng 920 triệu USD mỗi tháng cho SpaceX&lt;/strong&gt; để thuê compute AI. Đây là cảnh tượng chưa từng có khi một hyperscaler trở thành bên mua ròng compute.&lt;/li&gt;
&lt;li&gt;Ở mặt sau của cùng kết quả kinh doanh đó, FCF theo quý ghi nhận &lt;strong&gt;-5,9 tỷ USD, lần đầu tiên âm trong lịch sử&lt;/strong&gt;. CAPEX 44,9 tỷ USD đã vượt qua OCF 39,1 tỷ USD, và hướng dẫn CAPEX 2026 được nâng lại từ 180-190 tỷ USD lên &lt;strong&gt;195-205 tỷ USD&lt;/strong&gt;, đồng thời báo hiệu mức tăng lớn trong năm 2027.&lt;/li&gt;
&lt;li&gt;Phán đoán chia làm ba. Khả năng xảy ra vách đá nhu cầu AI sau năm 2028 đã thấp hơn. Điểm đảo chiều FCF của Alphabet bị đẩy lùi từ năm 2027 sang giai đoạn 2028-2029. Với bộ nhớ, sức mạnh nhu cầu về khối lượng được tái xác nhận, nhưng tính bền vững của giá và biên lợi nhuận đỉnh vẫn là vấn đề riêng biệt.&lt;/li&gt;
&lt;li&gt;Chúng tôi giữ nguyên xác suất kịch bản cầu cơ sở 45%, vượt trội 35%, dưới kỳ vọng 20%. Tuy nhiên, đã có thêm một nhánh bằng chứng thực đo củng cố cho kịch bản vượt trội 35%, còn tiền đề cốt lõi của kịch bản dưới kỳ vọng 20%, tức việc CAPEX Big Tech giảm tốc sớm, đã yếu đi sau bản in kết quả kinh doanh này. Lần chấm điểm tiếp theo là Microsoft (rạng sáng 30/7 giờ Hàn Quốc) và Amazon (31/7).&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="thesis-callout"&gt;
&lt;div class="thesis-callout__label"&gt;Luận điểm chính&lt;/div&gt;
&lt;p&gt;Cloud +82% và FCF theo quý lần đầu tiên âm trong lịch sử là hai mặt của cùng một kết quả kinh doanh. Trước câu hỏi liệu cầu có thực hay không, Alphabet đã trả lời bằng mức sử dụng vượt cam kết và hành động thuê cả server của người khác với giá cao hơn. Đổi lại, hóa đơn để đón nhận nhu cầu đó đã đến sớm hơn dự kiến. Tiêu chí chấm điểm của thị trường giờ đã chuyển từ sự tồn tại của cầu sang lợi nhuận tiền mặt sau khấu hao, và với nhà đầu tư bộ nhớ, kết quả kinh doanh này là viện binh cho khối lượng chứ không phải bảo chứng cho biên lợi nhuận.&lt;/p&gt;
&lt;/div&gt;
&lt;h2 id="1-trước-tiên-là-các-con-số-điều-gì-đã-được-công-bố"&gt;1. Trước tiên là các con số: điều gì đã được công bố
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hạng mục&lt;/th&gt;
 &lt;th&gt;Thực tế Q2/26&lt;/th&gt;
 &lt;th&gt;Cơ sở so sánh&lt;/th&gt;
 &lt;th&gt;Phán định&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Doanh thu toàn công ty&lt;/td&gt;
 &lt;td&gt;119,8 tỷ USD, +24%&lt;/td&gt;
 &lt;td&gt;Đồng thuận khoảng 116,9 tỷ USD&lt;/td&gt;
 &lt;td&gt;Vượt&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Doanh thu Google Cloud&lt;/td&gt;
 &lt;td&gt;24,8 tỷ USD, +82%&lt;/td&gt;
 &lt;td&gt;Đồng thuận 22,4 tỷ USD, +64%&lt;/td&gt;
 &lt;td&gt;Vượt mạnh&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Lợi nhuận hoạt động Cloud&lt;/td&gt;
 &lt;td&gt;8,8 tỷ USD (biên 35,6%)&lt;/td&gt;
 &lt;td&gt;Năm trước 2,8 tỷ USD (biên 20,7%)&lt;/td&gt;
 &lt;td&gt;Cải thiện&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Doanh thu Tìm kiếm&lt;/td&gt;
 &lt;td&gt;63,3 tỷ USD, +17%&lt;/td&gt;
 &lt;td&gt;Đồng thuận 63,4 tỷ USD&lt;/td&gt;
 &lt;td&gt;Phù hợp&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Lợi nhuận hoạt động toàn công ty&lt;/td&gt;
 &lt;td&gt;40,8 tỷ USD, +30% (biên 34,0%)&lt;/td&gt;
 &lt;td&gt;Biên thấp hơn đồng thuận&lt;/td&gt;
 &lt;td&gt;Trái chiều&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;EPS điều chỉnh&lt;/td&gt;
 &lt;td&gt;Khoảng 2,85 USD&lt;/td&gt;
 &lt;td&gt;Đồng thuận khoảng 2,89 USD&lt;/td&gt;
 &lt;td&gt;Thấp hơn nhẹ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Dòng tiền hoạt động (OCF)&lt;/td&gt;
 &lt;td&gt;39,1 tỷ USD&lt;/td&gt;
 &lt;td&gt;CAPEX 44,9 tỷ USD&lt;/td&gt;
 &lt;td&gt;Đảo chiều&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FCF theo quý&lt;/td&gt;
 &lt;td&gt;-5,9 tỷ USD&lt;/td&gt;
 &lt;td&gt;Quý trước 10,1 tỷ USD&lt;/td&gt;
 &lt;td&gt;Lần đầu âm trong lịch sử&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Backlog Cloud&lt;/td&gt;
 &lt;td&gt;514 tỷ USD&lt;/td&gt;
 &lt;td&gt;Quý trước 462 tỷ USD&lt;/td&gt;
 &lt;td&gt;+52 tỷ USD&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Hướng dẫn CAPEX 2026&lt;/td&gt;
 &lt;td&gt;195-205 tỷ USD&lt;/td&gt;
 &lt;td&gt;Trước đó 180-190 tỷ USD&lt;/td&gt;
 &lt;td&gt;Nâng lại&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Thực tế: công bố và earnings call của Alphabet]&lt;/p&gt;
&lt;p&gt;Các con số GAAP có ảo giác quang học. EPS GAAP công bố là 9,11 USD, lợi nhuận ròng 112,1 tỷ USD, +298% so với cùng kỳ, nhưng trong đó có khoảng 99 tỷ USD lãi đánh giá lại (trước thuế, tương đương khoảng 6,26 USD/cổ phiếu sau thuế) từ các cổ phần chưa niêm yết tại Anthropic và SpaceX. Sau khi loại bỏ khoản mục không liên quan đến hoạt động kinh doanh này, EPS thực chất khoảng 2,85 USD, thấp hơn nhẹ so với kỳ vọng thị trường. Doanh thu và Cloud thắng lớn, nhưng chất lượng lợi nhuận không mạnh bằng con số bề mặt. [Thực tế: tính toán lại từ công bố]&lt;/p&gt;
&lt;h2 id="2-tranh-luận-về-cầu-vì-sao-có-thể-coi-là-đã-kết-thúc"&gt;2. Tranh luận về cầu: vì sao có thể coi là đã kết thúc
&lt;/h2&gt;&lt;p&gt;Bài viết trước đã chỉ ra mắt xích yếu của cầu cuối cùng, lấy con số 3 triệu người dùng Codex thêm trong ba ngày làm bằng chứng thực đo đầu tiên. Bản in kết quả kinh doanh của Alphabet đã chồng thêm bốn nhánh bằng chứng thực đo lên trên đó.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Mức sử dụng đang vượt trước hợp đồng.&lt;/strong&gt; Lưu lượng API mô hình Gemini tăng từ 16 tỷ token/phút lên 22 tỷ token/phút, tăng 37,5% chỉ trong một quý, còn số nhà phát triển hàng tháng đã vượt 9 triệu người. Khách hàng Cloud hiện hữu đang chi tiêu trung bình hơn 50% so với cam kết ban đầu, và mức vượt này còn lớn hơn quý trước. Tốc độ thu hút khách hàng mới gấp đôi năm trước, khối lượng giao dịch marketplace gấp bảy lần. [Thực tế: thư CEO, earnings call] Giả thuyết cho rằng cầu chỉ dựa vào hợp đồng dài hạn của một số ít phòng thí nghiệm tiên phong không tương thích với dữ liệu cho thấy mức tiêu thụ thực tế sau hợp đồng đã vượt cam kết.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Nơi phát sinh cầu đã mở rộng.&lt;/strong&gt; Bên cạnh cầu phát triển mô hình như tiền huấn luyện quy mô lớn cho Gemini 4, năm nhánh đã được trình bày đồng thời: suy luận doanh nghiệp trong tài chính, dược phẩm, bán lẻ, viễn thông, sản xuất; khối lượng công việc BigQuery và bảo mật; các dịch vụ tiêu dùng như AI Mode trong Tìm kiếm và app Gemini; và cả doanh số bán ngoài hệ thống TPU cung cấp trực tiếp cho trung tâm dữ liệu của khách hàng. Khoảng 90% doanh nghiệp Fortune 100 dùng Gemini Enterprise, có 500 khách hàng cloud xử lý trên 1 nghìn tỷ token mỗi năm, và hơn 2.000 khách hàng xử lý trên 100 tỷ token. [Thực tế: thư CEO]&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Nguồn cung vẫn đang giới hạn tốc độ tăng trưởng.&lt;/strong&gt; CFO khẳng định môi trường vẫn bị hạn chế về nguồn cung. Alphabet đang thuê công suất trung tâm dữ liệu bên thứ ba với giá cao để bù đắp phần thiếu hụt ngắn hạn, và giải thích rằng việc chấp nhận khoảng 6 tháng kém hiệu quả là xứng đáng để giữ được khách hàng lớn. Nối tiếp mạch đó là tin lớn nhất của cuộc gọi lần này. Từ tháng 6, Alphabet đã ký hợp đồng thuê compute AI từ SpaceX với giá khoảng 920 triệu USD mỗi tháng, quy đổi theo năm khoảng 11 tỷ USD. [Thực tế: earnings call, báo chí] Việc công ty tính toán nhanh nhạy nhất thế giới lại đi thuê server của người khác với giá cao hơn là bằng chứng hành vi đối lập trực diện với giả thuyết cầu bị thổi phồng.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Backlog vẫn tăng ngay cả khi đang được ghi nhận.&lt;/strong&gt; Doanh thu Cloud quý 2 tăng khoảng 23,8% so với quý trước, cho thấy các hợp đồng lớn đang chuyển hóa nhanh thành doanh thu, nhưng số dư backlog vẫn tăng thêm 52 tỷ USD. Backlog hiện tại gấp khoảng 5,2 lần doanh thu Cloud quy đổi theo năm của quý 2, và công ty cho biết hơn một nửa sẽ được ghi nhận trong vòng 24 tháng. [Thực tế: công bố, earnings call] Đây là bằng chứng mạnh cho tầm nhìn đến năm 2027. Tuy nhiên, độ tập trung khách hàng và số tiền ghi nhận theo từng năm từ 2028 trở đi chưa được công bố. [Chưa xác minh: chi tiết backlog chưa công bố]&lt;/p&gt;
&lt;p&gt;Lập luận phản bác về hiệu quả hóa cũng mất sức trong quý này. Chi phí trên mỗi phản hồi của AI Mode đã giảm xuống mức thấp nhất kể từ khi ra mắt, nhưng số người dùng và khối lượng truy vấn lại tăng nhanh hơn. AI Mode có 1 tỷ người dùng hàng tháng, app Gemini có 950 triệu MAU. Mối quan hệ mà mức sử dụng tăng nhanh hơn mức giảm chi phí trên mỗi đơn vị đã được xác nhận ngay cả ở quy mô của Alphabet, cùng hướng với mô hình Jevons đã thấy ở Codex. [Suy luận: quan hệ hiệu quả-mức sử dụng]&lt;/p&gt;
&lt;h2 id="3-tranh-luận-về-tiền-mặt-hóa-đơn-đến-sớm-hơn-dự-kiến"&gt;3. Tranh luận về tiền mặt: hóa đơn đến sớm hơn dự kiến
&lt;/h2&gt;&lt;p&gt;Ở phía đối diện với cầu, điều mà kết quả kinh doanh lần này đã xác định chắc chắn là quy mô và thời hạn của chi tiêu.&lt;/p&gt;
&lt;p&gt;CAPEX quý 2 đạt 44,9 tỷ USD, gấp đôi năm trước, vượt qua OCF 39,1 tỷ USD, và cường độ vốn theo quý (CAPEX/OCF) khoảng 115%. Phần số học cũng nặng nề không kém. CAPEX nửa đầu năm khoảng 80,6 tỷ USD, nên để chạm mức trần hướng dẫn cả năm 205 tỷ USD, nửa cuối năm cần chi trung bình mỗi quý 57,2-62,2 tỷ USD, tức nhiều hơn quý 2 khoảng 27-38%. Khả năng FCF phục hồi đáng kể trong nửa cuối 2026 và năm 2027 là thấp. [Suy luận: tính toán riêng]&lt;/p&gt;
&lt;p&gt;Đầu mối cho năm 2027 cũng đã xuất hiện. CFO giữ nguyên dự báo CAPEX 2027 sẽ tăng mạnh, còn đồng thuận thị trường khoảng 257 tỷ USD. Lộ trình từ 205 tỷ USD lên 257 tỷ USD tương ứng mức tăng khoảng +25%. Đây là lộ trình giảm tốc từ khoảng +76% năm nay xuống +25% năm sau, chứ chưa phải kịch bản tái tăng tốc lên mức 300 tỷ USD. [Thực tế: earnings call, đồng thuận] Sự phân biệt này quan trọng. Nếu là lộ trình giảm tốc, khung logic của điểm đảo chiều FCF vẫn còn nguyên; nếu tái tăng tốc, chính khung logic đó sẽ sụp đổ.&lt;/p&gt;
&lt;p&gt;Nếu tính trước độ nhạy cho năm 2028, tiêu chí phán định sẽ trở nên rõ ràng hơn. Điểm xuất phát là OCF lũy kế 12 tháng hiện tại, 185,7 tỷ USD.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Giả định CAPEX 2028&lt;/th&gt;
 &lt;th&gt;OCF cần để FCF = 0&lt;/th&gt;
 &lt;th&gt;CAGR OCF cần thiết&lt;/th&gt;
 &lt;th&gt;OCF cần để FCF đạt 50 tỷ USD&lt;/th&gt;
 &lt;th&gt;Tốc độ tăng cần thiết&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;200 tỷ USD&lt;/td&gt;
 &lt;td&gt;200 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 3,8%&lt;/td&gt;
 &lt;td&gt;250 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 16,0%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;230 tỷ USD&lt;/td&gt;
 &lt;td&gt;230 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 11,3%&lt;/td&gt;
 &lt;td&gt;280 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 22,8%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;250 tỷ USD&lt;/td&gt;
 &lt;td&gt;250 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 16,0%&lt;/td&gt;
 &lt;td&gt;300 tỷ USD&lt;/td&gt;
 &lt;td&gt;Khoảng 27,1%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Suy luận: độ nhạy tự tính, không phải hướng dẫn của công ty]&lt;/p&gt;
&lt;p&gt;Nếu CAPEX ổn định quanh mức 200 tỷ USD vào năm 2028, việc FCF phục hồi không khó. Nếu tiếp tục tăng lên 230-250 tỷ USD, OCF gộp của Cloud và Tìm kiếm phải tăng hơn 20%/năm thì mới quay lại mức FCF trước đây. Nếu Cloud +82% và biên 35,6% được duy trì trong một thời gian, đây không phải con số bất khả thi, nhưng khấu hao, chi phí điện, tiền thuê ngoài, và cơ cấu bán phần cứng TPU biên thấp hơn đang đè theo hướng ngược lại.&lt;/p&gt;
&lt;p&gt;Sự chuyển đổi trong cơ chế phân bổ vốn cũng đã chính thức hóa trong quý này. Alphabet là công ty có 242,5 tỷ USD tiền mặt và chứng khoán khả mại, OCF 12 tháng 185,7 tỷ USD, nên khả năng thanh toán tự thân không phải là điều đáng tranh cãi. Tuy nhiên, trong quý 2 công ty đã huy động khoảng 30,5 tỷ USD cổ phiếu phổ thông, khoảng 19,1 tỷ USD cổ phiếu ưu đãi chuyển đổi, và khoảng 21,1 tỷ USD nợ ròng, đồng thời không mua lại cổ phiếu quỹ. Nợ đã tăng từ khoảng 16 tỷ USD lên khoảng 100 tỷ USD chỉ trong 12 tháng. [Thực tế: công bố] Từ một công ty từng dùng OCF để trang trải cả CAPEX lẫn mua lại cổ phiếu, Alphabet đã chuyển thành công ty dừng mua lại để dồn cho CAPEX, thậm chí huy động cả nợ lẫn vốn cổ phần. Đây không phải tín hiệu rủi ro thanh khoản mà là tín hiệu cho thấy cơ chế phân bổ vốn đã thay đổi, và điều an ủi từ góc nhìn tín dụng là trọng lượng huy động đang nghiêng về phía cổ đông hơn là thị trường trái phiếu.&lt;/p&gt;
&lt;h2 id="4-chấm-điểm-ba-câu-hỏi"&gt;4. Chấm điểm ba câu hỏi
&lt;/h2&gt;&lt;p&gt;Trước kết quả kinh doanh này, việc chấm điểm ba câu hỏi cho ra kết quả như sau.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Cầu AI có duy trì sau năm 2028 không. Khả năng xảy ra vách đá đã thấp hơn.&lt;/strong&gt; Cầu đang lan tỏa từ huấn luyện sang suy luận, dữ liệu, bảo mật và công việc doanh nghiệp; mức tiêu thụ thực tế vượt cam kết; mức sử dụng tăng nhanh hơn cải thiện hiệu quả; phần lớn doanh thu bán ngoài TPU dự kiến ghi nhận vào năm 2027; và nguồn cung vẫn thiếu đến mức năm 2027 vẫn phải tăng mạnh CAPEX. Nhìn nhận chính xác là năm 2028 không phải thời điểm cầu kết thúc, mà là thời điểm năng lực cung mới chính thức vận hành và bước lên bàn kiểm chứng.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;FCF của Alphabet có đảo chiều không. Có thể, nhưng thời điểm bị đẩy lùi.&lt;/strong&gt; Điểm giao cắt FCF theo quý đã đến sớm hơn dự kiến ban đầu (đầu năm 2027), nhưng dù đặt OCF 2027 lạc quan ở mức 230-240 tỷ USD, với CAPEX 257 tỷ USD thì FCF cả năm vẫn ở mức 0 trở xuống. Việc quay lại có lãi chỉ thành lập vào năm 2028, và chỉ khi tốc độ tăng CAPEX 2028 giảm xuống mức một chữ số. Sự tái tăng tốc mạnh của FCF là kịch bản có điều kiện cho giai đoạn 2028-2029.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Điều này có dẫn đến việc mua bộ nhớ liên tục không. Tích cực mạnh về khối lượng, trung lập về giá và biên lợi nhuận.&lt;/strong&gt; Mổ xẻ ở phần tiếp theo.&lt;/p&gt;
&lt;h2 id="5-dịch-sang-bộ-nhớ-viện-binh-cho-khối-lượng-không-phải-bảo-chứng-cho-biên-lợi-nhuận"&gt;5. Dịch sang bộ nhớ: viện binh cho khối lượng, không phải bảo chứng cho biên lợi nhuận
&lt;/h2&gt;&lt;p&gt;Khoảng 60% CAPEX hạ tầng kỹ thuật quý 2 dành cho máy chủ, 40% cho trung tâm dữ liệu và mạng. Đầu tư máy chủ bao gồm cả TPU, GPU, CPU, HBM, DRAM máy chủ, SSD và chất bán dẫn mạng. [Thực tế: earnings call]&lt;/p&gt;
&lt;p&gt;Các hạng mục hỗ trợ cầu HBM khá rõ ràng. Đó là thế hệ TPU mới và việc đưa vào NVIDIA Vera Rubin, tiền huấn luyện quy mô lớn cho Gemini 4, khối lượng suy luận doanh nghiệp tăng, kiến trúc mạng thế hệ mới kết nối 1 triệu bộ gia tốc, và doanh số bán ngoài hệ thống TPU sẽ được ghi nhận đầy đủ từ năm 2027. Điều quan trọng là dù TPU tự phát triển thay thế một phần GPU NVIDIA, cầu HBM không biến mất mà chỉ chuyển kênh mua từ chuỗi cung ứng GPU sang chuỗi cung ứng hệ thống TPU. Nếu cộng thêm cả việc thuê compute từ bên thứ ba, kênh cầu của HBM và DRAM máy chủ đã mở rộng thành ba nhánh: trung tâm dữ liệu tự có, TPU bán ngoài, và compute đi thuê. [Suy luận: phân rã kênh cầu]&lt;/p&gt;
&lt;p&gt;Luận cứ cho DRAM máy chủ và eSSD cũng dày thêm sau bản in này. AI agent không chỉ dùng bộ gia tốc mà còn chạy tiền xử lý, quản lý trạng thái, bảo mật và điều phối trên server CPU. Alphabet đã nhấn mạnh cùng lúc cả CPU Axion lẫn khối lượng công việc dữ liệu và bảo mật đang tăng. Con số 500 khách hàng xử lý trên 1 nghìn tỷ token mỗi năm cho thấy nhu cầu lưu trữ dẫn đến log, checkpoint, chỉ mục tìm kiếm và cơ sở dữ liệu vector không chỉ giới hạn ở huấn luyện. [Thực tế: thư CEO] Nền tảng phía cầu của việc DRAM máy chủ tái siết chặt (giá hợp đồng quý 3 dự báo +13-18%, thời gian giao hàng 40 tuần) đã thấy ở bài viết trước, nay được tái xác nhận qua kết quả kinh doanh Big Tech.&lt;/p&gt;
&lt;p&gt;Dù vậy, không nên chỉ dựa vào kết quả kinh doanh này để nâng ước tính lợi nhuận 2028 của các công ty bộ nhớ. Khi mua sắm thiết bị tăng vọt, năng lực cung bộ nhớ cũng sẽ tăng trong giai đoạn 2027-2029. Việc mở rộng chip tự phát triển làm giảm quyền định giá của NVIDIA trong hệ thống, chi phí suy luận trên mỗi phản hồi đang giảm nhanh, và khi Alphabet bắt đầu siết chặt hiệu quả CAPEX, áp lực giảm giá linh kiện sẽ truyền xuống dọc theo chuỗi cung ứng. Giá cao của HBM4 và HBM thế hệ tiếp theo bao gồm cả phần bù khan hiếm đầu thế hệ và phần bù hiệu suất, nên không phải giá trị vĩnh viễn. Tổng hợp lại như sau.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hạng mục&lt;/th&gt;
 &lt;th&gt;Phán đoán trước kết quả kinh doanh&lt;/th&gt;
 &lt;th&gt;Phán đoán sau kết quả kinh doanh&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Cầu bit AI accelerator, HBM&lt;/td&gt;
 &lt;td&gt;Cao&lt;/td&gt;
 &lt;td&gt;Rất cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cầu DRAM máy chủ, eSSD&lt;/td&gt;
 &lt;td&gt;Khá cao&lt;/td&gt;
 &lt;td&gt;Cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Đóng gói tiên tiến, mạng&lt;/td&gt;
 &lt;td&gt;Cao&lt;/td&gt;
 &lt;td&gt;Rất cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Vách đá cầu năm 2028&lt;/td&gt;
 &lt;td&gt;Khả năng thấp&lt;/td&gt;
 &lt;td&gt;Khả năng thấp hơn nữa&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tính bền vững của ASP bộ nhớ&lt;/td&gt;
 &lt;td&gt;Không chắc chắn&lt;/td&gt;
 &lt;td&gt;Không chắc chắn&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Duy trì biên lợi nhuận đỉnh bộ nhớ&lt;/td&gt;
 &lt;td&gt;Thấp&lt;/td&gt;
 &lt;td&gt;Thấp&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Big Tech phục hồi FCF sớm&lt;/td&gt;
 &lt;td&gt;Trung bình&lt;/td&gt;
 &lt;td&gt;Thấp hơn&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Lợi nhuận trên vốn gia tăng của CAPEX&lt;/td&gt;
 &lt;td&gt;Chưa được chứng minh&lt;/td&gt;
 &lt;td&gt;Chứng minh một phần, tiếp tục kiểm chứng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Suy luận: phán đoán tổng hợp]&lt;/p&gt;
&lt;p&gt;Rủi ro của bán dẫn năm 2028 không phải là hủy đơn hàng mà là việc ASP và biên lợi nhuận trở về mức bình thường. Điều này phù hợp với kịch bản cầu 45/35/20. Bản in lần này đã chồng thêm một bằng chứng thực đo cho luận cứ vượt trội 35%, đồng thời làm yếu đi tiền đề CAPEX Big Tech giảm tốc sớm vốn là nền tảng của kịch bản dưới kỳ vọng 20%. Bản thân xác suất sẽ được cập nhật sau khi xác nhận thêm cả Microsoft và Amazon. Từ góc nhìn Samsung Electronics và SK Hynix, đây là bản in giúp cải thiện nền tảng cầu cho cuộc đàm phán giá HBM hướng tới năm 2027 sẽ bắt đầu từ quý 4.&lt;/p&gt;
&lt;h2 id="6-phản-ứng-giá-cổ-phiếu-và-sự-khác-biệt-phán-đoán-giữa-hai-ghi-chú"&gt;6. Phản ứng giá cổ phiếu, và sự khác biệt phán đoán giữa hai ghi chú
&lt;/h2&gt;&lt;p&gt;Phản ứng thị trường tóm gọn tính chất của giai đoạn này. Ngay sau công bố, cổ phiếu mở đầu phiên ngoài giờ giảm khoảng 2%, có lúc phục hồi lên gần tham chiếu, rồi bị đẩy lùi khi CAPEX được nâng lên trong cuộc gọi, khiến mức giảm nới rộng lên khoảng 3-5%. Tính đến sáng 23/7 giờ Hàn Quốc, giá cổ phiếu quanh mức 342 USD, thấp hơn khoảng 1,5% so với giá đóng cửa phiên trước khoảng 347 USD. [Thực tế: dữ liệu thị trường] Quy luật của năm 2026, rằng chính CAPEX chứ không phải việc vượt kỳ vọng lợi nhuận mới quyết định phản ứng trong một thị trường nơi vượt kỳ vọng đã trở thành mặc định, lại lặp lại lần thứ năm. Đọc theo chiều ngược lại, việc mức giảm chỉ dừng ở mức này trước mức tăng trưởng +82% cũng là tín hiệu cho thấy chừng nào tăng trưởng còn được chứng minh, thị trường vẫn sẽ tiêu hóa được chi tiêu.&lt;/p&gt;
&lt;p&gt;Hai ghi chú làm chất liệu tổng hợp đã đưa ra kết luận khác nhau từ cùng một sự thật. Một ghi chú chọn tạm hoãn theo tiêu chí chứng minh cấu trúc. Cách diễn đạt chính xác không phải là lợi nhuận trên vốn đã được chứng minh, mà là khả năng được chứng minh đang cao nhất, và ghi chú này bảo lưu việc đưa ra mục tiêu giá trước FCF âm, việc huy động vốn, và cảnh báo tăng CAPEX năm 2027. Ghi chú còn lại giữ khuyến nghị mua theo giá vào lệnh. Ghi chú này đưa ra mục tiêu 12 tháng 430 USD, dựa trên giả định mức điều chỉnh 15% so với đỉnh, áp dụng hệ số 28-29 lần cho EPS 2027 khoảng 15 USD (loại trừ lãi đánh giá lại), kèm điều kiện rút lại là sẽ tính lại nếu CAPEX 2027 được lượng hóa gần mức 300 tỷ USD. [Thực tế: kết luận của hai ghi chú]&lt;/p&gt;
&lt;p&gt;Sự khác biệt giữa hai phán đoán không nằm ở nhận thức sự thật mà ở thời gian biểu và tiêu chí. Góc nhìn cấu trúc đặt gánh nặng chứng minh lên công ty cho đến khi lợi nhuận tiền mặt sau khấu hao được xác nhận bằng con số cụ thể, còn góc nhìn định giá tính toán xem rủi ro đó đã được phản ánh bao nhiêu vào mức giá đã điều chỉnh. Theo nguyên tắc của blog này, chúng tôi không khuyến nghị một hướng cụ thể mà trình bày song song cả hai khung, nhưng mẫu số chung là rõ ràng. Dù theo hướng nào, biến số phán định tiếp theo không phải là cầu mà là tiền mặt.&lt;/p&gt;
&lt;h2 id="7-bảng-phán-định-hai-tuần-tới-sẽ-quyết-định"&gt;7. Bảng phán định: hai tuần tới sẽ quyết định
&lt;/h2&gt;&lt;p&gt;Dưới đây là tổng hợp những ô đã được lấp đầy và những ô mới mở ra sau kết quả kinh doanh lần này.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Phần bình luận CAPEX Big Tech thuộc về Alphabet đã được xác định là nâng lên. Điều còn lại là hướng dẫn FY27 đầu tiên của Microsoft (cuộc gọi rạng sáng 30/7 giờ Hàn Quốc) và tốc độ tăng trưởng AWS của Amazon (rạng sáng 31/7). Nếu Alphabet đã kết thúc tranh luận về cầu, thì hai công ty này sẽ phân định tranh luận về biên lợi nhuận và FCF.&lt;/li&gt;
&lt;li&gt;Việc tốc độ tăng trưởng Cloud có duy trì trên 50% trong 2-4 quý tới hay không, và biên lợi nhuận có trụ trên 30% hay không, là chỉ báo xác nhận cho kịch bản thượng. Nếu sau khi hạn chế cung được nới lỏng mà tốc độ tăng trưởng tụt xuống dưới 30%, cần tính lại khả năng cầu bị ước tính quá mức.&lt;/li&gt;
&lt;li&gt;Cần theo dõi liệu backlog có tiếp tục tăng ròng sau khi ghi nhận doanh thu hay không. Tổ hợp backlog giảm hoặc chỉ có thời hạn hợp đồng kéo dài tăng lên là tín hiệu chất lượng hợp đồng suy giảm.&lt;/li&gt;
&lt;li&gt;Quý mà tốc độ tăng OCF theo cơ sở 12 tháng vượt qua tốc độ tăng CAPEX chính là điểm khởi đầu của đảo chiều FCF. Ngược lại, nếu CAPEX 2028 vượt 250 tỷ USD trong khi OCF không theo kịp, sẽ được phán định là tổn hại FCF mang tính cấu trúc.&lt;/li&gt;
&lt;li&gt;Việc có tiếp tục phát hành cổ phiếu hoặc huy động nợ quy mô lớn hay không, việc thuê ngoài kiểu SpaceX có thu hẹp trong giai đoạn 2027-2028 hay không, và việc bán ngoài TPU có dẫn đến tiêu dùng Cloud lặp lại hay không, là các hạng mục xác nhận phía hiệu quả vốn.&lt;/li&gt;
&lt;li&gt;Yếu tố phân định phía bộ nhớ không đổi. Đó là giá hợp đồng DRAM, và việc xác nhận giá hợp đồng quý 3 trong các cuộc gọi của Samsung Electronics và SK Hynix quanh ngày 30/7.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;p&gt;Các cổ phiếu được nhắc đến trong bài là ví dụ minh họa cho phân tích, không phải khuyến nghị mua hay bán một cổ phiếu cụ thể nào. Trách nhiệm đối với quyết định đầu tư và kết quả của nó thuộc về nhà đầu tư. Alphabet chưa đưa ra hướng dẫn CAPEX năm 2028 và doanh thu Cloud; tỷ trọng theo khách hàng, số tiền ghi nhận theo năm và điều kiện hủy của backlog 514 tỷ USD chưa được công bố; khối lượng mua cùng tỷ trọng theo nhà cung cấp của HBM, DRAM, NAND cũng không thuộc diện công bố. Độ nhạy FCF năm 2028 và phần số học CAPEX nửa cuối năm là ước tính riêng lấy công bố hiện tại làm điểm xuất phát, không phải dự báo của công ty. Quy mô trước thuế của lãi đánh giá lại cổ phần chưa niêm yết và tác động sau thuế trên mỗi cổ phiếu có thể có chênh lệch làm tròn do được tính lại từ công bố gốc. Mục tiêu giá 430 USD là tính toán của một trong hai ghi chú nguồn được tổng hợp, không phải mục tiêu giá của blog này. Giá cổ phiếu và diễn biến thị trường được tính đến sáng ngày 23/7/2026 theo giờ Hàn Quốc (KST).&lt;/p&gt;
&lt;h3 id="bài-viết-liên-quan"&gt;Bài viết liên quan
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/" &gt;Ai đốt hết số token đó? Bản đồ khách hàng NVIDIA, AI chủ quyền và 9 triệu người dùng Codex bắt đầu trả lời&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;Nhu cầu bộ nhớ AI có vượt kỳ vọng không? Đọc xác suất tăng trưởng vượt trội qua kịch bản cầu và bản đồ cung&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Hai tháng phát ngôn của Chủ tịch SK Hynix Chey Tae-won: công ty mạnh lên, đỉnh biên lợi nhuận đã qua&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/semiconductor-bull-bear-four-clocks-capital-intensity-cycle-2026-07-17/" &gt;Tranh luận thực sự trong ngành bán dẫn: bốn chiếc đồng hồ vật lý và một chiếc đồng hồ giá cổ phiếu&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Ai đốt hết số token đó? Bản đồ khách hàng NVIDIA, AI chủ quyền và 9 triệu người dùng Codex bắt đầu trả lời</title><link>https://koreainvestinsights.com/vi/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/</link><pubDate>Sun, 19 Jul 2026 19:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/vi/post/who-burns-the-tokens-nvidia-sovereign-codex-2026-07-19/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;Bối cảnh: Bài viết trước &lt;a class="link" href="https://koreainvestinsights.com/vi/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;Nhu cầu bộ nhớ AI có vượt kỳ vọng không?&lt;/a&gt; đã xác suất hóa cầu thành kịch bản cơ sở 45%, vượt trội 35%, dưới kỳ vọng 20%, còn &lt;a class="link" href="https://koreainvestinsights.com/vi/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Hai tháng phát ngôn của Chủ tịch SK Hynix Chey Tae-won&lt;/a&gt; đã đọc lời nói và hành động của người đứng đầu cao nhất bên cung. Mắt xích yếu còn lại là cầu cuối cùng. GPU và HBM được lắp đặt nhiều đến vậy, thì rốt cuộc ai sẽ đốt hết số token đó? Bài viết này ghi lại một tuần mà câu hỏi đó bắt đầu có con số đi kèm.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tldr"&gt;TL;DR
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Tỷ trọng hyperscale trong doanh thu trung tâm dữ liệu của NVIDIA vẫn quanh mức 50% suốt bảy quý liên tiếp. Tỷ trọng chưa sụp đổ. Điều thay đổi là cơ cấu. Trong quý 2-4/2026, &lt;strong&gt;doanh thu ngoài hyperscale (ACIE) đạt 37 tỷ USD, gần như cân bằng với 38 tỷ USD của hyperscale&lt;/strong&gt;, còn tốc độ tăng trưởng theo quý đã đảo chiều thành 31% so với 12%. Ở lần công bố tiếp theo, chính tỷ trọng có thể đảo chiều lần đầu tiên.&lt;/li&gt;
&lt;li&gt;Cùng giai đoạn đó, tốc độ tăng trưởng doanh thu trung tâm dữ liệu so với cùng kỳ năm trước đã tái tăng tốc từ +56% lên +66%, +75%, rồi +92%. Tỷ trọng được giữ nguyên trong khi toàn bộ tốc độ lại nhanh lên có nghĩa là &lt;strong&gt;phần tăng trưởng gia tăng đang được dẫn dắt bởi nhóm khách hàng ngoài hyperscale&lt;/strong&gt;. Chính NVIDIA đã ghi trong tài liệu công bố rằng tăng trưởng do nhóm khách hàng còn lại dẫn dắt.&lt;/li&gt;
&lt;li&gt;Doanh thu AI chủ quyền trong cả năm tài chính 2026 vượt 30 tỷ USD, gấp ba lần năm trước, và ở quý gần nhất cũng tăng hơn 80% so với cùng kỳ. Đây là nhóm khách hàng mà thị trường đã bỏ lỡ vì chỉ nhìn vào miệng của các hyperscaler.&lt;/li&gt;
&lt;li&gt;Nhóm bán dẫn của Meritz Securities trong báo cáo công bố Chủ nhật đã chỉ ra việc mua sắm chủ quyền đang bước vào giai đoạn thực chất và tình trạng thiếu cung DRAM máy chủ tái diễn nghiêm trọng từ giữa tháng 7. Dự báo giá hợp đồng DRAM máy chủ quý 3 tăng +13-18% của TrendForce, lời chứng thực về thời gian giao hàng hơn 40 tuần của Inventec (Đài Loan), và phát biểu của Micron rằng chỉ đáp ứng được 50-66% nhu cầu của khách hàng chính, đều xác nhận chéo điều này từ bên ngoài.&lt;/li&gt;
&lt;li&gt;Ở phía cầu cuối cùng cũng đã có con số. Codex của OpenAI tăng từ 1 triệu vào tháng 2 lên 5 triệu vào cuối tháng 5, rồi từ 6 triệu vào ngày 12/7 (ngay sau khi GPT-5.6 ra mắt) lên 9 triệu vào khoảng ngày 15/7, tức &lt;strong&gt;thêm 3 triệu người dùng chỉ trong ba ngày&lt;/strong&gt;. Đây là giai đoạn đơn vị đo cầu chuyển từ số người dùng đăng ký sang thời gian thực thi của agent.&lt;/li&gt;
&lt;li&gt;Kết luận không phải là vội vàng nâng xác suất. Trước khi bàn đến dư cung, đây là lúc cần kiểm chứng lại xem &lt;strong&gt;liệu chúng ta có đang vẽ đường cầu quá thận trọng hay không&lt;/strong&gt;, và phán định đó sẽ do mùa báo cáo kết quả kinh doanh quanh ngày 30/7 và công bố của NVIDIA cuối tháng 8 đưa ra.&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="thesis-callout"&gt;
&lt;div class="thesis-callout__label"&gt;Luận điểm chính&lt;/div&gt;
&lt;p&gt;Thị trường đã nghi ngờ tính bền vững của CAPEX AI trong khi chỉ nhìn vào miệng của bốn Big Tech. Trong lúc đó, trên sổ sách của NVIDIA, doanh thu ngoài hyperscale đã đạt điểm cân bằng với hyperscale, doanh thu chủ quyền tăng gấp ba trong một năm, và Codex thêm 3 triệu người dùng chỉ trong ba ngày. Trong khi giá cổ phiếu phản ánh trước nỗi sợ dư cung, thì nền tảng cầu lại đang tích lũy bằng chứng thực đo theo chiều ngược lại. Sự bất đối xứng này chính là bản chất của đợt điều chỉnh lần này.&lt;/p&gt;
&lt;/div&gt;
&lt;h2 id="1-một-tuần-như-thế-nào-giữa-giá-sàn-và-báo-cáo"&gt;1. Một tuần như thế nào: giữa giá sàn và báo cáo
&lt;/h2&gt;&lt;p&gt;Trước tiên, hãy xác nhận bối cảnh sân khấu. Vào thứ Năm ngày 16/7, thị trường Mỹ chứng kiến chỉ số bán dẫn Philadelphia (SOX) lao dốc khoảng 4%, rơi vào vùng thị trường giá xuống (bear market) hơn 20% so với đỉnh, còn Nasdaq giảm 1,47%. Sang thứ Sáu ngày 17/7, Nasdaq giảm thêm 1,40%, khiến mức giảm trong tuần lên tới 2,90%. [Thực tế: dữ liệu thị trường] Cùng ngày tại Tokyo, cổ phiếu Kioxia chạm giá sàn ngay sau khi mở cửa, lao dốc 16,1%. Giá cổ phiếu đã xuống dưới một nửa so với đỉnh ngày 22/6, và khoảng 30 nghìn tỷ JPY vốn hóa thị trường đã bốc hơi. Nguyên nhân trực tiếp là phán quyết bồi thường bằng sáng chế khoảng 229 triệu USD cho Viasat mà bồi thẩm đoàn Mỹ đã công nhận, nhưng bản chất là làn sóng giảm đòn bẩy (deleveraging) trên toàn bộ đà tăng AI, thể hiện qua việc TSMC -7,29%, ADR SK Hynix -13,69%, và SanDisk -12,63% cùng lao dốc trong phiên đó. [Thực tế: báo Nikkei, Hankyung]&lt;/p&gt;
&lt;p&gt;Thị trường Hàn Quốc đã tránh được ngày thứ Sáu này, vì 17/7 là ngày nghỉ lễ Chế Hiến (Jeheonjeol), được tái chỉ định thành ngày nghỉ lần đầu tiên sau 18 năm. Nhưng ngay trước đó, thị trường đã trải qua các đợt lao dốc mạnh: ngày 13/7 SK Hynix -15,37%, Samsung Electronics -10,70%, và ngày 16/7 SK Hynix -12,34%, Samsung Electronics -9,47%. [Thực tế: dữ liệu sàn giao dịch] Câu chuyện mà thị trường đang đưa vào giá là rõ ràng. Nguồn cung đang tăng, Trung Quốc đang đuổi kịp, lợi nhuận năm 2027 đang bị hạ dự báo, và không ai biết khi nào CAPEX của Big Tech sẽ hạ nhiệt.&lt;/p&gt;
&lt;p&gt;Trong bối cảnh này, vào Chủ nhật, các báo cáo của các nhà phân tích Kim Sun-woo, Yang Seung-su và Kim Dong-kwan thuộc nhóm bán dẫn Meritz Securities đã lần lượt được công bố. Thời điểm phát hành cho thấy rõ họ ý thức trực diện về đợt lao dốc ngày thứ Sáu và sự cố Kioxia. Nội dung cốt lõi đi theo hướng ngược lại. Hiện tại nhu cầu bộ nhớ không chỉ đến từ các hyperscaler, việc mua sắm của khối chủ quyền bao gồm cả Trung Đông đang bước vào giai đoạn thực chất, và tình trạng thiếu cung DRAM máy chủ đang tái diễn nghiêm trọng từ giữa tháng 7. Đây là sự phản bác nhắm vào góc nhìn coi việc nới lỏng thiếu hụt năm 2028 là điều hiển nhiên mà không tính đến nhu cầu này. [Thực tế: tóm tắt báo cáo Meritz Securities, 19/7/2026]&lt;/p&gt;
&lt;p&gt;Thay vì để đây là một cuộc tranh cãi bằng lời, chúng tôi tách lập luận này thành ba mảnh có thể kiểm chứng và đối chiếu từng phần với bằng chứng thực đo: cơ cấu khách hàng của NVIDIA, hoạt động mua sắm của khối chủ quyền, và mức sử dụng cuối cùng.&lt;/p&gt;
&lt;h2 id="2-bản-đồ-khách-hàng-nvidia-tỷ-trọng-vẫn-50-tăng-trưởng-đến-từ-bên-ngoài"&gt;2. Bản đồ khách hàng NVIDIA: tỷ trọng vẫn 50%, tăng trưởng đến từ bên ngoài
&lt;/h2&gt;&lt;p&gt;Trước tiên, hãy xác nhận chính xác mệnh đề cho rằng tỷ trọng của các hyperscaler đang thu nhỏ lại. Khi đặt các câu công bố theo từng quý của NVIDIA theo chuỗi thời gian, bức tranh như sau.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Quý tài chính&lt;/th&gt;
 &lt;th&gt;Giai đoạn&lt;/th&gt;
 &lt;th&gt;Doanh thu DC&lt;/th&gt;
 &lt;th&gt;So với cùng kỳ&lt;/th&gt;
 &lt;th&gt;Tỷ trọng CSP lớn/hyperscale (theo công bố)&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;FY25 Q3&lt;/td&gt;
 &lt;td&gt;8-10/2024&lt;/td&gt;
 &lt;td&gt;30,77 tỷ USD&lt;/td&gt;
 &lt;td&gt;+112%&lt;/td&gt;
 &lt;td&gt;khoảng 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY25 Q4&lt;/td&gt;
 &lt;td&gt;11/2024-1/2025&lt;/td&gt;
 &lt;td&gt;35,58 tỷ USD&lt;/td&gt;
 &lt;td&gt;+93%&lt;/td&gt;
 &lt;td&gt;khoảng 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 Q1&lt;/td&gt;
 &lt;td&gt;2-4/2025&lt;/td&gt;
 &lt;td&gt;39,11 tỷ USD&lt;/td&gt;
 &lt;td&gt;+73%&lt;/td&gt;
 &lt;td&gt;hơi dưới 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 Q2&lt;/td&gt;
 &lt;td&gt;5-7/2025&lt;/td&gt;
 &lt;td&gt;41,10 tỷ USD&lt;/td&gt;
 &lt;td&gt;+56%&lt;/td&gt;
 &lt;td&gt;khoảng 50%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 Q3&lt;/td&gt;
 &lt;td&gt;8-10/2025&lt;/td&gt;
 &lt;td&gt;51,22 tỷ USD&lt;/td&gt;
 &lt;td&gt;+66%&lt;/td&gt;
 &lt;td&gt;không công bố&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY26 Q4&lt;/td&gt;
 &lt;td&gt;11/2025-1/2026&lt;/td&gt;
 &lt;td&gt;62,31 tỷ USD&lt;/td&gt;
 &lt;td&gt;+75%&lt;/td&gt;
 &lt;td&gt;hơi trên 50%, tăng trưởng do nhóm khách hàng còn lại dẫn dắt&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;FY27 Q1&lt;/td&gt;
 &lt;td&gt;2-4/2026&lt;/td&gt;
 &lt;td&gt;75,2 tỷ USD&lt;/td&gt;
 &lt;td&gt;+92%&lt;/td&gt;
 &lt;td&gt;Hyperscale 38 tỷ USD (khoảng 50%) so với ACIE 37 tỷ USD&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Thực tế: bình luận CFO NVIDIA, hội nghị kết quả kinh doanh]&lt;/p&gt;
&lt;p&gt;Hai điều hiện ra cùng lúc. Thứ nhất, &lt;strong&gt;bản thân con số tỷ trọng chưa từng rời khỏi dải 50% suốt bảy quý liên tiếp&lt;/strong&gt;. Câu chuyện cho rằng các hyperscaler đã bị đẩy lùi không phải là bằng chứng thực đo. Thứ hai, dù vậy hướng đi của cơ cấu đã thay đổi rõ rệt. Công bố FY26 Q4 nêu rõ tăng trưởng do nhóm khách hàng còn lại dẫn dắt và doanh thu đã đa dạng hóa, còn từ FY27 Q1, NVIDIA bắt đầu công bố trung tâm dữ liệu tách thành hyperscale và ACIE (AI cloud, công nghiệp, doanh nghiệp). Ngay trong quý đầu tiên đó, ACIE đạt 37 tỷ USD, gần bám sát 38 tỷ USD của hyperscale, còn tốc độ tăng trưởng theo quý đã đảo chiều thành &lt;strong&gt;ACIE +31% so với hyperscale +12%&lt;/strong&gt;. Doanh thu AI cloud bên trong ACIE đã vượt gấp ba lần so với cùng kỳ năm trước. CEO Jensen Huang khẳng định trong hội nghị rằng về dài hạn, nhóm thứ hai này sẽ tăng trưởng nhanh hơn. [Thực tế: hội nghị kết quả kinh doanh]&lt;/p&gt;
&lt;p&gt;Chồng thêm sự tái tăng tốc của tốc độ tăng trưởng lên đây thì bức tranh sẽ hoàn chỉnh. Tốc độ tăng trưởng doanh thu trung tâm dữ liệu so với cùng kỳ đã chạm đáy ở mức +56% tại FY26 Q2, rồi leo trở lại lên +66%, +75%, và +92%. Việc tỷ trọng được giữ nguyên trong khi toàn bộ tốc độ tăng trưởng lại nhanh lên, về mặt số học có nghĩa là &lt;strong&gt;hơn một nửa phần tăng trưởng gia tăng đang được tạo ra bởi nhóm ngoài hyperscale&lt;/strong&gt;. [Suy luận: tính toán số học từ công bố] Chỉ cần xu hướng này tiếp diễn thêm một quý nữa, công bố FY27 Q2 vào cuối tháng 8 sẽ ghi nhận con số ACIE vượt qua hyperscale lần đầu tiên. Kể từ khoảnh khắc đó, chính khung phán đoán tính bền vững của nhu cầu AI chỉ bằng cách nhìn vào hướng dẫn CAPEX của bốn Big Tech sẽ trở nên lỗi thời.&lt;/p&gt;
&lt;p&gt;Cần làm rõ một điểm dễ nhầm lẫn. Độ tập trung khách hàng trực tiếp trong báo cáo 10-Q (khách hàng A 22%, khách hàng B 14%) thực ra lại tăng lên, nhưng đây là chỉ số ở tầng phân phối tổng hợp các đối tác bo mạch, OEM và các đơn mua trực tiếp quy mô lớn, nên thuộc một tầng khác với sự đa dạng hóa của người dùng cuối. [Thực tế: 10-K] Hai hiện tượng, phân phối tập trung và cầu cuối cùng mở rộng, cùng tồn tại song song.&lt;/p&gt;
&lt;h2 id="3-ai-chủ-quyền-nhóm-khách-hàng-mà-thị-trường-bỏ-lỡ-vì-chỉ-nhìn-vào-miệng"&gt;3. AI chủ quyền: nhóm khách hàng mà thị trường bỏ lỡ vì chỉ nhìn vào miệng
&lt;/h2&gt;&lt;p&gt;Khối lượng lớn nhất trong nhu cầu ngoài hyperscale chính là khối chủ quyền. CFO của NVIDIA cho biết doanh thu AI chủ quyền trong FY2026 đã &lt;strong&gt;vượt mốc 30 tỷ USD&lt;/strong&gt;, hơn gấp ba lần năm trước. Canada, Pháp, Hà Lan, Singapore và Anh dẫn đầu, còn ở FY27 Q1 doanh thu chủ quyền cũng tăng hơn 80% so với cùng kỳ, và hạ tầng của NVIDIA hiện đã được lắp đặt tại khoảng 40 quốc gia với tổng GDP lên tới 50 nghìn tỷ USD. [Thực tế: hội nghị kết quả kinh doanh NVIDIA]&lt;/p&gt;
&lt;p&gt;Thực thể vật lý cũng đã hình thành. HUMAIN của Ả Rập Saudi đã chốt kế hoạch triển khai tối đa 600.000 GPU NVIDIA trong 3 năm, và đã nhận lô hàng đầu 18.000 GB300. Stargate UAE của UAE đang xây dựng giai đoạn 1 công suất 200MW của cụm 1GW, với mục tiêu vận hành trong quý 3 năm nay, riêng giai đoạn 1 sẽ có tối đa 35.000 GB300, còn đơn vị vận hành G42 đã nhận được giấy phép xuất khẩu của Mỹ vào giữa tháng 7. EU đang triển khai chương trình AI Gigafactory trị giá 20 tỷ EUR, Ấn Độ đặt mục tiêu 100.000 GPU công cộng vào cuối năm, còn SoftBank của Nhật Bản đặt mục tiêu thương mại hóa dịch vụ đám mây GPU chủ quyền vào tháng 10. [Thực tế: công bố của từng công ty, từng quốc gia]&lt;/p&gt;
&lt;p&gt;Điều này kết nối với bộ nhớ như thế nào? Đã có hai con đường được công khai. Chương trình Stargate toàn cầu của OpenAI đã ký kết thư ý định (LOI) với Samsung Electronics và SK Hynix vào tháng 10/2025, với quy mô &lt;strong&gt;tối đa 900.000 wafer DRAM mỗi tháng&lt;/strong&gt;, tương đương khoảng 40% năng lực sản xuất DRAM toàn cầu. Giới hạn của việc đây chỉ là thư ý định không có tính ràng buộc vẫn còn nguyên. [Thực tế: báo chí, LOI] Và SK Hynix vào tháng 6 năm nay đã chính thức hóa quan hệ đối tác HBM4 nhiều năm với NVIDIA, kéo dài xuyên suốt thế hệ Vera Rubin kế tiếp. [Thực tế: công bố của NVIDIA] Ở phía các quỹ đầu tư quốc gia, liên tục có các báo cáo về sự hợp tác giữa nguồn vốn UAE (Mubadala, MGX, G42, Kazna) và phía SK Hynix.&lt;/p&gt;
&lt;p&gt;Cũng có một khoảng trống cần để lại một cách trung thực. Không có công bố mới nào trong tháng 6-7 xác nhận việc chủ thể chủ quyền trực tiếp mua khối lượng lớn DRAM từ Samsung Electronics hay SK Hynix. [Chưa xác minh: hợp đồng trực tiếp chưa công bố] Vì nhu cầu bộ nhớ của khối chủ quyền đi qua các OEM máy chủ và nhà cung cấp hệ thống, nên trong công bố khách hàng của các hãng bộ nhớ, nó bị trộn lẫn với hyperscaler. [Suy luận: cấu trúc phân phối] Không nhìn thấy khác với không tồn tại. Vì không có kịch bản nào mà 600.000 GPU đã được xác định lại không đi kèm bộ nhớ, nên vấn đề không nằm ở việc có tồn tại hay không, mà ở mức độ hiển thị trong công bố về quy mô và thời điểm.&lt;/p&gt;
&lt;h2 id="4-dram-máy-chủ-căng-trở-lại-lập-luận-của-meritz-và-bằng-chứng-thực-đo-bên-ngoài"&gt;4. DRAM máy chủ căng trở lại: lập luận của Meritz và bằng chứng thực đo bên ngoài
&lt;/h2&gt;&lt;p&gt;Tình trạng thiếu cung DRAM máy chủ tái diễn nghiêm trọng từ giữa tháng 7 mà nhóm Meritz chỉ ra không phải là lập luận đơn phương của riêng công ty chứng khoán này. Bốn bằng chứng thực đo từ bên ngoài đều chỉ cùng một hướng.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Bằng chứng thực đo&lt;/th&gt;
 &lt;th&gt;Nội dung&lt;/th&gt;
 &lt;th&gt;Nguồn, thời điểm&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Dự báo giá hợp đồng&lt;/td&gt;
 &lt;td&gt;Giá hợp đồng DRAM máy chủ quý 3 dự báo tăng +13-18%. Không thể tăng đối với CSP Mỹ bị ràng buộc bởi hợp đồng dài hạn (LTA), nên mức tăng tập trung vào khách hàng phi-LTA&lt;/td&gt;
 &lt;td&gt;TrendForce, 9/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tốc độ tăng cung&lt;/td&gt;
 &lt;td&gt;Tốc độ tăng cung bit RDIMM ở mức 15-20%/năm, không theo kịp tốc độ tăng xuất xưởng CPU. CSP tích trữ tồn kho trước vì dự đoán thiếu hụt năm 2027. Module dịch chuyển xuống từ 96/128GB về 32/64GB&lt;/td&gt;
 &lt;td&gt;TrendForce, 9/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Thời gian giao hàng&lt;/td&gt;
 &lt;td&gt;Thời gian giao hàng DRAM máy chủ vượt 40 tuần, giá tăng khoảng 90% so với cuối năm 2025, thời hạn hiệu lực báo giá rút ngắn còn 1-30 ngày&lt;/td&gt;
 &lt;td&gt;Phát biểu của Inventec, 16/7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Lời chứng thực nhà cung cấp&lt;/td&gt;
 &lt;td&gt;Chỉ có thể đáp ứng 50-66% nhu cầu của khách hàng chính, HBM đã bán hết đến hết năm 2027, tình trạng thiếu cung kéo dài đến sau năm 2027&lt;/td&gt;
 &lt;td&gt;Hội nghị kết quả kinh doanh Micron, tháng 7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Thực tế: từng nguồn]&lt;/p&gt;
&lt;p&gt;Mức giá tuyệt đối cũng đã phát ra tín hiệu bất thường. Giá giao dịch cố định của DRAM PC phổ thông (DDR4 8Gb) đạt 21 USD vào tháng 6, mức cao kỷ lục kể từ khi bắt đầu thống kê, còn giá giao ngay cao hơn giá cố định tới 72%. Cũng có báo cáo cho biết Samsung Electronics đã thông báo cho khách hàng Trung Quốc rằng sẽ tăng giá DRAM tối đa 20% trong quý 3. [Thực tế: báo chí ngành] Trong giai đoạn giá hợp đồng đang tăng, sự kết hợp mức phí bảo hiểm giao ngay vượt 70% cho thấy có nhu cầu thực sự tồn tại bên ngoài kênh hợp đồng, sẵn sàng trả giá cao để có ngay hàng gấp. Không phải các hyperscaler bị ràng buộc bởi LTA, mà chính nhóm bên ngoài đó, tức khối chủ quyền, doanh nghiệp và đám mây hạng hai, mới là bên trả mức giá đắt đỏ. Câu nói của TrendForce rằng mức tăng tập trung vào khách hàng phi-LTA và câu nói của Meritz rằng việc mua sắm chủ quyền đang bước vào giai đoạn thực chất là hai cách diễn đạt của cùng một hiện tượng. [Suy luận: diễn giải chéo]&lt;/p&gt;
&lt;p&gt;Nhà phân tích Kim Sun-woo tiến thêm một bước nữa ở đây. Ông cho rằng thị trường đang bị mắc kẹt trong khung nhìn hẹp về hợp đồng dài hạn mang tính hy sinh và việc hạ dự báo lợi nhuận năm 2027, dẫn đến hiểu lầm, và dự báo rằng sự hiểu lầm này sẽ nhanh chóng được xóa bỏ khi các sự kiện như thực hiện sớm việc hoàn trả cổ đông và các quan hệ đối tác bao gồm đầu tư cổ phần từ Big Tech lần lượt diễn ra. [Thực tế: lập luận trong báo cáo] Đây không phải là sự thật đã được kiểm chứng mà là dự báo của công ty chứng khoán, nên tiêu chí chấm điểm là liệu nó có được xác nhận bằng các sự kiện thực tế trong mùa báo cáo kết quả kinh doanh tuần này hay không. Tuy nhiên, hướng đi này nhất quán với động thái huy động vốn niêm yết Nasdaq và các quan hệ đối tác của Chủ tịch SK Hynix Chey Tae-won đã đề cập trong bài viết trước, cũng như hợp đồng nhiều năm giữa SK Hynix và NVIDIA.&lt;/p&gt;
&lt;h2 id="5-codex-9-triệu-những-con-số-về-cầu-cuối-cùng-bắt-đầu-xuất-hiện"&gt;5. Codex 9 triệu: những con số về cầu cuối cùng bắt đầu xuất hiện
&lt;/h2&gt;&lt;p&gt;Điểm bị công kích nhiều nhất trong tranh luận CAPEX AI không phải là hạ tầng, mà là phần cuối của nó. Bằng chứng cho thấy mức sử dụng cuối cùng đang tăng tương xứng với tốc độ xây dựng trung tâm dữ liệu vẫn còn yếu. Ở mắt xích yếu này, những con số đáng chú ý đã bắt đầu xuất hiện.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Thời điểm&lt;/th&gt;
 &lt;th&gt;Số người dùng&lt;/th&gt;
 &lt;th&gt;Ghi chú&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Tháng 2/2026&lt;/td&gt;
 &lt;td&gt;1 triệu&lt;/td&gt;
 &lt;td&gt;Người dùng hoạt động riêng của Codex&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;8/4&lt;/td&gt;
 &lt;td&gt;3 triệu&lt;/td&gt;
 &lt;td&gt;Hoạt động hàng tuần, tuyên bố đặt lại giới hạn sử dụng mỗi mốc 1 triệu người&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;21/4&lt;/td&gt;
 &lt;td&gt;4 triệu&lt;/td&gt;
 &lt;td&gt;Thêm 1 triệu chỉ trong 2 tuần&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cuối tháng 5 - đầu tháng 6&lt;/td&gt;
 &lt;td&gt;Vượt 5 triệu&lt;/td&gt;
 &lt;td&gt;Gấp 6 lần so với tháng 2&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;9/7&lt;/td&gt;
 &lt;td&gt;GPT-5.6 ra mắt chính thức&lt;/td&gt;
 &lt;td&gt;3 phiên bản Sol, Terra, Luna; Codex tích hợp với ChatGPT desktop&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;12/7&lt;/td&gt;
 &lt;td&gt;6 triệu&lt;/td&gt;
 &lt;td&gt;Từ đây chỉ số là gộp Codex + ChatGPT Work&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Khoảng 15/7&lt;/td&gt;
 &lt;td&gt;9 triệu&lt;/td&gt;
 &lt;td&gt;Tăng 3 triệu chỉ trong ba ngày&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;[Thực tế: phát biểu công khai của ban lãnh đạo OpenAI, báo chí]&lt;/p&gt;
&lt;p&gt;Cần nêu hai lưu ý để đảm bảo công bằng. Con số sau ngày 9/7 không còn là riêng Codex mà là chỉ số gộp với ChatGPT Work, nên khó so sánh liên tục một cách nghiêm ngặt với giai đoạn trước đó. Và theo ngoại suy bên ngoài dựa trên việc kéo dài nguyên tốc độ tăng trưởng cuối tháng 5, thời điểm đạt 10 triệu người dùng được tính là tháng 10, nhưng thực tế đã đạt 9 triệu vào giữa tháng 7. Cũng cần nói rõ đường ngoại suy này không phải là dự báo chính thức của OpenAI. [Thực tế: xác minh nguồn ngoại suy] Ngay cả khi tính đến việc thay đổi định nghĩa chỉ số, sự thật vẫn còn đó là một cú tăng tốc rút ngắn đường dự kiến khoảng ba tháng đã được thực đo chỉ trong ba ngày ngay sau khi GPT-5.6 ra mắt.&lt;/p&gt;
&lt;p&gt;Lý do Codex quan trọng không phải là độ lớn của con số mà là bản chất của cầu. Codex là sản phẩm chuyển đổi thời gian làm việc của con người thành thời gian suy luận. Con người không cần kết nối lâu hơn nhưng agent vẫn có thể làm việc lâu hơn, và khi một người chạy song song nhiều tác vụ, &lt;strong&gt;khối lượng công việc tăng nhanh hơn số người dùng&lt;/strong&gt;. Từ giai đoạn này, đơn vị đo cầu không còn là số người dùng hoạt động hàng tháng mà là tổng thời gian thực thi của agent. Đây chính xác là cấu trúc giống với việc bài viết trước đã viết lại giới hạn trên của mô hình cầu bộ nhớ AI thành số khối lượng công việc nhân với bộ nhớ trên mỗi khối lượng công việc nhân với tần suất thực thi.&lt;/p&gt;
&lt;p&gt;Cuộc tranh luận về hiệu quả cũng bị đảo ngược ở đây. Chính OpenAI cho biết GPT-5.6 Sol cải thiện hiệu quả token hơn 54% so với thế hệ trước. Việc người dùng và mức sử dụng bùng nổ ngay sau khi mô hình có chi phí trên mỗi token thấp hơn ra mắt là một trường hợp thực đo của giả thuyết Jevons, trong đó ở lĩnh vực agent lập trình, cải thiện hiệu quả không làm giảm nhu cầu tính toán mà &lt;strong&gt;mở rộng phạm vi công việc có thể giao cho AI&lt;/strong&gt;. [Suy luận: hiệu ứng Jevons] Điều cần nhìn không phải là tốc độ giảm giá token, mà là khối lượng công việc mà việc giảm giá đó vừa mở ra.&lt;/p&gt;
&lt;h2 id="6-vậy-điều-này-chuyển-hóa-thành-gì-cho-bộ-nhớ"&gt;6. Vậy điều này chuyển hóa thành gì cho bộ nhớ
&lt;/h2&gt;&lt;p&gt;Cũng cần sự tiết chế. Không thể giải thích toàn bộ chu kỳ bộ nhớ chỉ bằng một con số 9 triệu người dùng Codex. Để số người dùng chuyển hóa thành nhu cầu bit bộ nhớ, nó phải đi qua bốn hệ số chuyển đổi: khối lượng thực thi đồng thời, độ dài ngữ cảnh, dung lượng bộ nhớ trang bị trên mỗi bộ tăng tốc, và tốc độ tăng cung. [Suy luận: mô hình cầu] Chỉ cần một trong số này yếu đi, chỉ số gây chú ý và cầu thực sự sẽ tách rời nhau.&lt;/p&gt;
&lt;p&gt;Tuy nhiên, khi đối chiếu các biến số tăng đã dựng lên làm luận cứ cho kịch bản vượt trội 35% trong bài viết kịch bản cầu trước đó với bằng chứng thực đo tuần này, có thể thấy chúng thẳng hàng với nhau.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Sự mở rộng nền tảng cầu bộ tăng tốc đã có bằng chứng thực đo qua việc đảo chiều tốc độ tăng trưởng ACIE và doanh thu chủ quyền tăng gấp ba.&lt;/li&gt;
&lt;li&gt;Suy luận thường trực của agent đã có con số đầu tiên qua mức tăng 3 triệu trong ba ngày của Codex và sự chuyển đổi đơn vị chỉ số.&lt;/li&gt;
&lt;li&gt;Sự lan tỏa ra ngoài HBM đã hiện diện trong giá qua dự báo giá hợp đồng DRAM máy chủ +13-18%, thời gian giao hàng 40 tuần, và mức phí bảo hiểm giao ngay 72%.&lt;/li&gt;
&lt;li&gt;Giả thuyết mức sử dụng thắng hiệu quả đã có bằng chứng thực đo phản trực giác là mức sử dụng bùng nổ ngay sau khi hiệu quả token cải thiện 54%.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Ý nghĩa đối với câu chuyện nới lỏng nguồn cung năm 2028 cũng phân nhánh từ đây. Công thức của phe nới lỏng phần lớn đặt việc tăng trưởng CAPEX của hyperscaler chững lại làm giới hạn trên cho tốc độ tăng trưởng cầu. Nhưng nếu một nửa cầu gia tăng bắt đầu đến từ bên ngoài nhóm đó, thì chính giả định về giới hạn trên này cần được tính toán lại. Đây chính xác là điểm mà sự phản bác của Meritz nhắm tới. Chúng tôi không thay đổi xác suất ngay lập tức. Chúng tôi giữ nguyên khung xác suất cơ sở 45%, vượt trội 35%, dưới kỳ vọng 20%, nhưng ghi nhận sự thật rằng luận cứ cho phía vượt trội đã bắt đầu có bằng chứng thực đo ở ba nhánh. Việc cập nhật xác suất sẽ được thực hiện khi bảng phán định dưới đây được lấp đầy. [Suy luận: vận hành kịch bản]&lt;/p&gt;
&lt;h2 id="7-kiểm-tra-phản-biện"&gt;7. Kiểm tra phản biện
&lt;/h2&gt;&lt;p&gt;Luận cứ càng có vẻ mạnh, chúng tôi càng cần dựng lên phía đối lập.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Chất lượng của cầu ngoài hyperscale.&lt;/strong&gt; ACIE bao gồm cả neocloud. Đơn hàng của các đám mây hạng hai vốn dễ tổn thương về chi phí vốn là loại cầu bị hủy đầu tiên khi lãi suất và môi trường huy động vốn thắt chặt. Việc tốc độ tăng trưởng đảo chiều không đảm bảo cả độ bền của cầu.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Biến động chính trị của khối chủ quyền.&lt;/strong&gt; Các dự án cấp quốc gia bị lung lay bởi bầu cử, ngân sách và quy định xuất khẩu. Chương trình Gigafactory của EU đã hai lần bị lùi thời hạn gọi thầu, còn khối lượng ở Trung Đông phụ thuộc vào một công tắc duy nhất là giấy phép xuất khẩu của Mỹ.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Bẫy chỉ số.&lt;/strong&gt; Con số 9 triệu của Codex là con số ngay sau khi định nghĩa chỉ số thay đổi thành chỉ số gộp, và tiêu chí xác định trạng thái hoạt động cũng chưa được công bố. Hướng tăng trưởng là thực đo, nhưng độ lớn vẫn chưa tách khỏi yếu tố marketing.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Sự tự hủy hoại của việc giá tăng vọt.&lt;/strong&gt; Tình trạng DRAM máy chủ căng trở lại vừa là luận cứ tăng giá, vừa là rủi ro ăn mòn ngân sách CNTT như trường hợp của IBM, tạo ra khoảng trống cầu sau đợt mua trước. Chính Chủ tịch Chey đã cảnh báo về việc giá tăng quá nóng sẽ phá hủy nhu cầu.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Phân biệt giữa dự báo và thực đo.&lt;/strong&gt; Dự báo sự kiện của Meritz (thực hiện sớm việc hoàn trả cổ đông, quan hệ đối tác đầu tư cổ phần từ Big Tech) vẫn còn là dự báo. Nếu không thành hiện thực, góc nhìn hẹp của thị trường sẽ hóa ra là đúng.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="8-bảng-phán-định-điều-gì-sẽ-chốt-câu-trả-lời"&gt;8. Bảng phán định: điều gì sẽ chốt câu trả lời
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Liệu mức tăng giá hợp đồng quý 3 trong hội nghị kết quả kinh doanh của Samsung Electronics và SK Hynix quanh ngày 30/7 có xác nhận dải +13-18% của TrendForce hay không, và liệu có xuất hiện đề cập đến khách hàng phi-LTA cùng khối lượng chủ quyền hay không.&lt;/li&gt;
&lt;li&gt;Liệu việc thực hiện sớm hoàn trả cổ đông của SK Hynix và các quan hệ đối tác dạng đầu tư cổ phần có xuất hiện dưới dạng công bố thực tế hay không. Đây là hạng mục chấm điểm trực tiếp cho dự báo của Meritz.&lt;/li&gt;
&lt;li&gt;Liệu ACIE có vượt qua hyperscale lần đầu tiên trong công bố FY27 Q2 của NVIDIA vào cuối tháng 8 hay không. Nếu vượt qua, sự mở rộng nền tảng cầu sẽ không còn là câu chuyện mà trở thành con số công bố chính thức.&lt;/li&gt;
&lt;li&gt;Liệu hợp đồng bộ nhớ trực tiếp từ khối chủ quyền hoặc các đơn hàng lớn qua OEM máy chủ có được nâng lên cấp độ công bố hay không. Việc thư ý định Stargate có chuyển đổi thành hợp đồng có tính ràng buộc hay không là ứng viên đầu tiên.&lt;/li&gt;
&lt;li&gt;Liệu chỉ số sử dụng của Codex và các agent cạnh tranh có bắt đầu được công bố theo tiêu chí thời gian thực thi cùng với việc vượt mốc 10 triệu hay không.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Yếu tố phán định vẫn không đổi. Nếu giá hợp đồng DRAM quay đầu giảm, toàn bộ câu chuyện cầu này sẽ bị thị trường bác bỏ; nếu giá được duy trì, đường cầu vốn được vẽ quá thận trọng sẽ phải được vẽ lại.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;Các cổ phiếu được đề cập trong bài là ví dụ minh họa cho phân tích, không phải khuyến nghị mua hay bán cổ phiếu cụ thể. Trách nhiệm đối với quyết định đầu tư và kết quả của nó thuộc về nhà đầu tư. Báo cáo của Meritz Securities được trích dẫn sau khi tái cấu trúc lại nội dung cốt lõi, trách nhiệm về số liệu chi tiết và dự báo trong văn bản gốc thuộc về công ty chứng khoán đó. Số người dùng Codex đã đổi định nghĩa thành chỉ số gộp với ChatGPT Work kể từ sau ngày 9/7 nên khó so sánh nghiêm ngặt với giai đoạn trước đó, và đường ngoại suy đạt 10 triệu vào tháng 10 không phải là dự báo chính thức của OpenAI. Việc mua trực tiếp bộ nhớ của các chủ thể chủ quyền chưa được xác nhận qua công bố, và khối lượng liên quan đến Stargate vẫn đang ở giai đoạn thư ý định không có tính ràng buộc. Dữ liệu giá cổ phiếu, chỉ số và giá cả dựa trên tài liệu công khai tính đến ngày 17/7/2026 và chưa phản ánh biến động sau thời điểm đó.&lt;/p&gt;
&lt;h3 id="bài-viết-liên-quan"&gt;Bài viết liên quan
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/ai-memory-demand-exceed-expectations-supply-map-2026-07-18/" &gt;Nhu cầu bộ nhớ AI có vượt kỳ vọng không? Đọc xác suất tăng trưởng vượt trội qua kịch bản cầu và bản đồ cung&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/chey-tae-won-mental-model-sk-hynix-q-margin-signal-2026-07-19/" &gt;Hai tháng phát ngôn của Chủ tịch SK Hynix Chey Tae-won: công ty mạnh lên, đỉnh biên lợi nhuận đã qua&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/semiconductor-bull-bear-four-clocks-capital-intensity-cycle-2026-07-17/" &gt;Tranh luận thực sự trong ngành bán dẫn: bốn chiếc đồng hồ vật lý và một chiếc đồng hồ giá cổ phiếu&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://koreainvestinsights.com/vi/post/memory-fair-value-fcfe-terminal-samsung-hynix-micron-2026-07-17/" &gt;Bán dẫn có mang tính chu kỳ không và giá hợp lý là bao nhiêu? Định giá Samsung, SK Hynix và Micron bằng FCFE và lợi nhuận chuẩn hóa&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Kimi K3 Tái Định Hình Đường Cong Giá AI: Từ Kimi Linear đến HBM và Chiến Lược Big Tech</title><link>https://koreainvestinsights.com/vi/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</link><pubDate>Fri, 17 Jul 2026 12:31:36 +0900</pubDate><guid>https://koreainvestinsights.com/vi/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</guid><description>&lt;p&gt;Kimi K3 ra mắt ngày 16 tháng 7 năm 2026 với giá $3 cho mỗi triệu token đầu vào chưa được cache và $15 cho mỗi triệu token đầu ra. Đây không phải chiến lược định giá siêu rẻ quen thuộc của một đối thủ Trung Quốc. Mức giá này ngang bằng Claude Sonnet 5 theo giá chuẩn, thấp hơn 40% so với GPT-5.6 Sol về đầu vào và thấp hơn 50% về đầu ra. Moonshot AI đang định vị K3 như một mô hình doanh nghiệp chủ lực, không phải lựa chọn tiết kiệm dự phòng.&lt;/p&gt;
&lt;p&gt;Kiến trúc được thiết kế để hỗ trợ tuyên bố đó. K3 có tổng cộng 2.8 nghìn tỷ tham số nhưng thực tế chỉ kích hoạt 16 trong số 896 chuyên gia cho mỗi token. Kimi Delta Attention kiểm soát chi phí của ngữ cảnh dài, Attention Residuals chọn lọc thu hồi các biểu diễn trước đó xuyên suốt chiều sâu mạng, và quá trình huấn luyện nhận thức lượng tử hóa sử dụng trọng số MXFP4 với kích hoạt MXFP8. Moonshot khuyến nghị một supernode với ít nhất 64 bộ tăng tốc.&lt;/p&gt;
&lt;p&gt;Sự kết hợp đó tạo ra một kết quả bán dẫn hai chiều. Bộ nhớ và tính toán trên mỗi token có thể giảm trong khi số lượng tổ chức có thể triển khai mô hình cấp tiên tiến, và khối lượng công việc họ vận hành, có thể tăng. K3 vừa là công nghệ hiệu quả vừa là khối lượng công việc hạ tầng.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;Đọc thêm: &lt;a class="link" href="https://koreainvestinsights.com/vi/post/ai-token-value-memory-value-added-2026-07-09/" &gt;Giá trị token AI và thu giữ giá trị bộ nhớ&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/vi/post/ai-token-futures-cost-per-token-korea-semiconductor-thesis-2026-05-30/" &gt;Hợp đồng tương lai token AI và chi phí trên mỗi token&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/vi/post/us-china-agentic-inference-stack-sram-opportunity-2026-07-09/" &gt;Phân kỳ Mỹ-Trung trong hạ tầng suy luận agentic&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/vi/post/hbm-2030-supply-demand-267eb-demand-model-crosscheck-2026-07-13/" &gt;Kiểm chứng chéo mô hình thiếu hụt HBM 2030&lt;/a&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tóm-tắt-điều-hành"&gt;Tóm Tắt Điều Hành
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;K3 kết hợp 2.8T tham số, thị giác tích hợp và cửa sổ ngữ cảnh 1 triệu token. Sản phẩm và API đã hoạt động, nhưng tính đến ngày 17 tháng 7, toàn bộ trọng số, báo cáo kỹ thuật và giấy phép vẫn chưa được phát hành. Luận điểm open-weight phải được xác minh sau thời hạn ngày 27 tháng 7.&lt;/li&gt;
&lt;li&gt;Điểm GDPval-AA v2 chính thức của Moonshot là 1.668, không phải 1.687. AA-Briefcase là 1.548. BrowseComp 91.2 sử dụng nén ngữ cảnh; kết quả ngữ cảnh 1M không nén là 90.4. Kết quả mạnh, nhưng bộ đánh giá hỗn hợp và đánh giá do công ty tự thực hiện đòi hỏi sao chép độc lập.&lt;/li&gt;
&lt;li&gt;Tuyên bố của Kimi Linear về KV cache thấp hơn tới 75% và thông lượng giải mã lý thuyết cao hơn tới 6.3 lần tại ngữ cảnh 1M đến từ một mô hình nghiên cứu 48B tổng, 3B kích hoạt. Không nên trình bày đây là hiệu suất API K3 đo được thực tế.&lt;/li&gt;
&lt;li&gt;K3 không phải mô hình giá rẻ. Nó ngang bằng giá chuẩn của Sonnet 5, đắt hơn 50% so với chương trình khuyến mãi ra mắt tạm thời của Sonnet, và rẻ hơn GPT-5.6 Sol. Vì hiện tại chỉ có chế độ suy luận tối đa và các kiểm tra độc lập cho thấy lượng token đầu ra cao, chi phí trên mỗi tác vụ hoàn thành có thể kém hấp dẫn hơn so với bảng giá.&lt;/li&gt;
&lt;li&gt;Tác động bán dẫn đặt tính toán và KV cache thấp hơn trên mỗi yêu cầu đối lập với nhiều triển khai tự lưu trữ hơn và khối lượng công việc tổng lớn hơn. DRAM máy chủ và SSD doanh nghiệp là những người hưởng lợi bậc hai rõ ràng nhất vì ngữ cảnh agent tồn tại lâu tràn từ HBM xuống các tầng cache phân tán.&lt;/li&gt;
&lt;li&gt;Lớp mô hình và lớp đám mây trải nghiệm kinh tế đối nghịch. Giá API của OpenAI, Anthropic và Gemini chịu áp lực, trong khi Azure, AWS và Google Cloud có thể kiếm tiền từ K3 và các mô hình khác thông qua tính toán, lưu trữ và mạng. Meta phải bảo vệ vị trí dẫn đầu open-weight của Mỹ.&lt;/li&gt;
&lt;li&gt;Các bằng chứng quan trọng ngày 27 tháng 7 là giấy phép, toàn bộ trọng số, đánh giá bên ngoài, thông lượng trên NVIDIA và AMD, hỗ trợ trên bộ tăng tốc Trung Quốc, token đầu ra thực tế trên mỗi tác vụ, tương thích vLLM và áp dụng vào danh mục đám mây.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img alt="Chiến lược giá Kimi K3 và bản đồ tác động hạ tầng AI" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://koreainvestinsights.com/images/posts/kimi-k3-pricing-infrastructure-impact-2026-07-17.png"&gt;
&lt;/p&gt;
&lt;h2 id="1-hiệu-chỉnh-các-con-số-trước-khi-rút-ra-kết-luận"&gt;1. Hiệu Chỉnh Các Con Số Trước Khi Rút Ra Kết Luận
&lt;/h2&gt;&lt;p&gt;Nhiều con số đã thay đổi khi thông tin ra mắt lan truyền qua mạng xã hội. Các giá trị chính thức quan trọng vì một số khác biệt làm thay đổi cách diễn giải đầu tư.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Hạng mục&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Giá trị chính thức&lt;/th&gt;
 &lt;th&gt;Diễn giải đầu tư&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Tổng tham số&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2.8T&lt;/td&gt;
 &lt;td&gt;Kích thước mô hình tổng, không phải tính toán kích hoạt trên mỗi token&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Định tuyến chuyên gia&lt;/td&gt;
 &lt;td style="text-align: right"&gt;16 trên 896&lt;/td&gt;
 &lt;td&gt;MoE cực thưa; chất lượng định tuyến và giao tiếp trở thành ràng buộc bậc nhất&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Ngữ cảnh&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1M token&lt;/td&gt;
 &lt;td&gt;Hữu ích cho kho mã và nghiên cứu, nhưng chi phí tác vụ phụ thuộc vào độ dài đầu ra và tỷ lệ cache hit&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GDPval-AA v2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.668&lt;/td&gt;
 &lt;td&gt;Bảng chính thức không hiển thị 1.687&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AA-Briefcase&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.548&lt;/td&gt;
 &lt;td&gt;Cao hơn GPT-5.6 Sol ở mức 1.495, thấp hơn Claude Fable 5 ở mức 1.583&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp&lt;/td&gt;
 &lt;td style="text-align: right"&gt;91.2&lt;/td&gt;
 &lt;td&gt;Sử dụng nén bắt đầu từ 300K token&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp không nén&lt;/td&gt;
 &lt;td style="text-align: right"&gt;90.4&lt;/td&gt;
 &lt;td&gt;Kết quả sạch hơn cho tuyên bố ngữ cảnh 1M gốc&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Sẵn sàng sản phẩm&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Web, Work, Code và API hoạt động&lt;/td&gt;
 &lt;td&gt;Có thể bắt đầu kiểm tra thương mại ngay&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Trọng số&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Cam kết trước ngày 27 tháng 7&lt;/td&gt;
 &lt;td&gt;Giấy phép và toàn bộ artifacts chưa được xác minh tính đến ngày 17 tháng 7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Chế độ suy luận&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Chỉ có tối đa&lt;/td&gt;
 &lt;td&gt;Các chế độ chi phí thấp chưa có&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Moonshot nêu rõ rằng K3 vẫn thua Claude Fable 5 và GPT-5.6 Sol về trải nghiệm người dùng tổng thể. Đồng thời, họ báo cáo hiệu suất cấp tiên tiến trong lập mã, công việc tri thức và các điểm chuẩn đa phương thức. Cách diễn giải đáng tin cậy không phải là Trung Quốc đã dẫn đầu một cách dứt khoát. Đó là một mô hình Trung Quốc đã gia nhập dải hiệu suất ngay dưới các hệ thống độc quyền mạnh nhất trong khi hứa hẹn ngữ cảnh 1M và trọng số có thể tải xuống.&lt;/p&gt;
&lt;p&gt;Bảng điểm chuẩn không phải một giải đấu kiểm soát duy nhất. K3 chạy ở mức suy luận tối đa. Tùy thuộc vào tác vụ, các mô hình sử dụng Kimi Code, Claude Code hoặc Codex, và một số điểm của đối thủ là kết quả tốt nhất trên các bộ đánh giá hoặc được nhập từ bảng xếp hạng bên ngoài. Sao chép độc lập vẫn cần thiết.&lt;/p&gt;
&lt;p&gt;Tuy nhiên, Terminal-Bench 2.1 ở mức 88.3, FrontierSWE ở mức 81.2, SWE Marathon ở mức 42.0, AutomationBench ở mức 30.8, GPQA-Diamond ở mức 93.5 và MMMU-Pro ở mức 81.6 cho thấy K3 được thiết kế cho công việc sử dụng công cụ dài hạn và lập mã, không chỉ đơn thuần là trò chuyện. Tín hiệu quan trọng hơn là gói tổng thể: năng lực gần tiên tiến, ngữ cảnh 1M và cam kết open weights.&lt;/p&gt;
&lt;h2 id="2-làm-thế-nào-một-mô-hình-28t-trở-nên-có-thể-triển-khai"&gt;2. Làm Thế Nào Một Mô Hình 2.8T Trở Nên Có Thể Triển Khai
&lt;/h2&gt;&lt;h3 id="21-tổng-tham-số-không-phải-tham-số-kích-hoạt"&gt;2.1 Tổng tham số không phải tham số kích hoạt
&lt;/h3&gt;&lt;p&gt;Tính toán tất cả 2.8T tham số cho mỗi token sẽ cực kỳ tốn kém. Stable LatentMoE thực tế kích hoạt 16 trong số 896 chuyên gia, tức khoảng 1.8% nhóm chuyên gia. Báo cáo kỹ thuật cần thiết để xác lập số lượng tham số kích hoạt chính xác, nhưng rõ ràng tổng tham số không bằng tính toán trên mỗi token.&lt;/p&gt;
&lt;p&gt;MoE thưa dịch chuyển thay vì loại bỏ các nút thắt cổ chai.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Điều gì cải thiện&lt;/th&gt;
 &lt;th&gt;Điều gì trở nên khó hơn&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Tính toán kích hoạt trên mỗi token&lt;/td&gt;
 &lt;td&gt;Chất lượng bộ định tuyến và cân bằng chuyên gia&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tính toán cần thiết cho mục tiêu chất lượng&lt;/td&gt;
 &lt;td&gt;Giao tiếp giữa các bộ tăng tốc&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Một số chi phí suy luận&lt;/td&gt;
 &lt;td&gt;Tránh bộ tăng tốc nhàn rỗi và chuyên gia nóng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mở rộng năng lực mô hình&lt;/td&gt;
 &lt;td&gt;Giữ toàn bộ tập trọng số luôn truy cập được&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Đây là lý do Moonshot khuyến nghị một supernode với 64 bộ tăng tốc trở lên. Ngay cả khi chỉ một tập nhỏ chuyên gia được kích hoạt, chuyên gia được chọn không được biết trước và toàn bộ mô hình phải luôn truy cập được. Ở bốn bit, 2.8T trọng số ngụ ý tối thiểu lý thuyết khoảng 1.4 TB trước scales, metadata, buffer, cache và sao chép. Kích hoạt thưa giảm số học nhưng không loại bỏ yêu cầu bộ nhớ lưu trú mô hình hay hạ tầng fabric.&lt;/p&gt;
&lt;h3 id="22-kimi-linear-giải-quyết-chi-phí-ngữ-cảnh-dài"&gt;2.2 Kimi Linear giải quyết chi phí ngữ cảnh dài
&lt;/h3&gt;&lt;p&gt;Bài báo Kimi Linear có trước K3 và đánh giá một mô hình nghiên cứu 48B tổng, 3B kích hoạt, không phải K3. Nó kết hợp Kimi Delta Attention với Multi-head Latent Attention đầy đủ theo tỷ lệ 3:1.&lt;/p&gt;
&lt;p&gt;Attention đầy đủ mạnh về sao chép chính xác và truy xuất chi tiết, nhưng KV cache tăng theo ngữ cảnh. Linear attention nén lịch sử thành một trạng thái kích thước cố định, giảm sự phụ thuộc vào độ dài chuỗi, nhưng có thể mất chi tiết chính xác. Kimi Linear sử dụng ba lớp KDA theo sau một lớp attention đầy đủ để cân bằng hiệu quả và khả năng biểu đạt.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Thành phần&lt;/th&gt;
 &lt;th&gt;Vai trò&lt;/th&gt;
 &lt;th&gt;Đánh đổi&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;KDA&lt;/td&gt;
 &lt;td&gt;Nén lịch sử dài thành trạng thái kích thước cố định&lt;/td&gt;
 &lt;td&gt;Có thể làm yếu sao chép chính xác và truy xuất chi tiết&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Full MLA&lt;/td&gt;
 &lt;td&gt;Khôi phục nhớ lại token-to-token chính xác&lt;/td&gt;
 &lt;td&gt;KV cache vẫn tăng theo ngữ cảnh&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Hybrid 3:1&lt;/td&gt;
 &lt;td&gt;Cân bằng hiệu quả và chất lượng&lt;/td&gt;
 &lt;td&gt;Yêu cầu kernel và phần mềm phục vụ phức tạp hơn&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Bài báo báo cáo KV cache thấp hơn tới 75% và thông lượng giải mã lý thuyết cao hơn tới 6.3 lần tại ngữ cảnh 1M. Một so sánh đo lường trong phân tích độ phức tạp báo cáo tăng tốc 2.3 lần. Những kết quả này xác lập hướng đi, không phải hiệu suất API K3 được đảm bảo.&lt;/p&gt;
&lt;p&gt;Đối với nhà đầu tư, KV cache thấp hơn nghĩa là nhiều yêu cầu đồng thời hơn trên mỗi bộ tăng tốc. Nó cũng làm cho các kho mã lớn hơn, nhiều tài liệu hơn và agent liên tục trở nên kinh tế. Bộ nhớ trên mỗi token có thể giảm trong khi tổng token tăng.&lt;/p&gt;
&lt;h3 id="23-attention-residuals-cải-thiện-hiệu-quả-theo-chiều-sâu"&gt;2.3 Attention Residuals cải thiện hiệu quả theo chiều sâu
&lt;/h3&gt;&lt;p&gt;Các kết nối residual chuẩn tiếp tục cộng thêm đầu ra lớp trước đó. Trong các mạng rất sâu, các biểu diễn hữu ích có thể bị pha loãng. Attention Residuals cho phép một lớp chọn các biểu diễn trước đó mà nó cần. Block AttnRes nhóm các lớp và giữ lại các biểu diễn cấp khối, giảm overhead bộ nhớ.&lt;/p&gt;
&lt;p&gt;Nghiên cứu của Moonshot cho thấy khoảng tám khối phục hồi phần lớn lợi ích, và Block AttnRes có thể khớp một đường cơ sở được huấn luyện với khoảng 1.25 lần tính toán. Điều này cải thiện hiệu quả vốn đầu tư huấn luyện, nhưng không tự động giảm nhu cầu trung tâm dữ liệu. Hiệu quả tốt hơn có thể được tái đầu tư vào các mô hình lớn hơn và tác vụ dài hơn.&lt;/p&gt;
&lt;h3 id="24-lượng-tử-hóa-là-chiến-lược-khả-chuyển-phần-cứng"&gt;2.4 Lượng tử hóa là chiến lược khả chuyển phần cứng
&lt;/h3&gt;&lt;p&gt;K3 áp dụng huấn luyện nhận thức lượng tử hóa từ giai đoạn tinh chỉnh có giám sát trở đi, sử dụng trọng số MXFP4 và kích hoạt MXFP8. Điều này nên kiểm soát mất mát độ chính xác tốt hơn so với lượng tử hóa sau huấn luyện tích cực và giúp triển khai trên nhiều nền tảng phần cứng dễ dàng hơn.&lt;/p&gt;
&lt;p&gt;Vũ đài kernel của Moonshot bao gồm NVIDIA H200 và GPU đa dụng từ nhà cung cấp thay thế. Bài đăng chính thức không nêu tên chip Trung Quốc hay tuyên bố kinh tế ngang H200. Điều được xác minh là ý định chiến lược tối ưu hóa bên ngoài NVIDIA cũng như trên NVIDIA.&lt;/p&gt;
&lt;p&gt;Điều đó quan trọng cho cả Trung Quốc lẫn người mua toàn cầu. Trung Quốc cần các mô hình cấp tiên tiến có thể tồn tại khi tiếp cận các hệ thống NVIDIA hàng đầu bị hạn chế. Những người mua khác muốn sức mạnh đàm phán giữa NVIDIA, AMD và bộ tăng tốc tùy chỉnh.&lt;/p&gt;
&lt;h2 id="3-bảng-giá-tiết-lộ-điều-gì"&gt;3. Bảng Giá Tiết Lộ Điều Gì
&lt;/h2&gt;&lt;h3 id="31-k3-được-định-giá-như-mô-hình-chủ-lực"&gt;3.1 K3 được định giá như mô hình chủ lực
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Mô hình&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Đầu vào cached/1M&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Đầu vào chuẩn&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Đầu ra&lt;/th&gt;
 &lt;th&gt;Định vị hiện tại&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Kimi K3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0.30&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Định giá mô hình chủ lực tiên tiến&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 khuyến mãi ra mắt&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Khác nhau&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$10&lt;/td&gt;
 &lt;td&gt;Tạm thời đến hết ngày 31 tháng 8&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 chuẩn&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Khác nhau&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$15&lt;/td&gt;
 &lt;td&gt;Giá headline giống K3&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$0.50&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$5&lt;/td&gt;
 &lt;td style="text-align: right"&gt;$30&lt;/td&gt;
 &lt;td&gt;Cao hơn K3 67% về đầu vào và 100% về đầu ra&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;K3 đắt hơn so với chương trình khuyến mãi hiện tại của Sonnet 5. Mô tả nó là nửa giá theo nghĩa phổ quát là không chính xác. Chiến lược rõ ràng hơn là ngang bằng với tầng chuẩn của Sonnet trong khi thấp hơn API tiên tiến đắt nhất.&lt;/p&gt;
&lt;p&gt;Mức giá vừa là tín hiệu tự tin vừa là quyết định kiếm tiền. Moonshot không còn chấp nhận giảm giá sâu chỉ để có lượng sử dụng. Họ đang tuyên bố một vị trí trong tầng mô hình mặc định doanh nghiệp.&lt;/p&gt;
&lt;h3 id="32-chi-phí-trên-mỗi-tác-vụ-hoàn-thành-quan-trọng-hơn-chi-phí-trên-mỗi-token"&gt;3.2 Chi phí trên mỗi tác vụ hoàn thành quan trọng hơn chi phí trên mỗi token
&lt;/h3&gt;&lt;p&gt;Bảng giá giả định lượng token bằng nhau. Các agent khác nhau về độ dài lập kế hoạch, lời gọi công cụ, thử lại và độ dài văn bản. K3 hiện tại chỉ cung cấp suy luận tối đa. Artificial Analysis báo cáo K3 sử dụng khoảng 130 triệu token đầu ra trong đánh giá Intelligence Index, gấp hơn hai lần trung vị đồng đẳng khoảng 63 triệu. Token đầu ra rẻ hơn vẫn có thể dẫn đến tác vụ hoàn thành tốn kém.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Chi phí tác vụ = token đầu vào × giá đầu vào + token đầu ra × giá đầu ra + chi phí công cụ và thử lại&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Người mua doanh nghiệp sẽ theo dõi tỷ lệ thành công tác vụ, token đầu ra, thời gian đến token đầu tiên, thông lượng, độ tin cậy công cụ, tỷ lệ cache hit và độ ổn định phiên. Moonshot cho biết Mooncake đạt hơn 90% cache hit trên khối lượng công việc lập mã, giúp đầu vào cached chỉ bằng một phần mười giá chưa cache. Nếu tỷ lệ đó duy trì trên lưu lượng doanh nghiệp, kinh tế thực tế của K3 cải thiện đáng kể.&lt;/p&gt;
&lt;h3 id="33-mooncake-dịch-chuyển-nhu-cầu-bộ-nhớ-xuống-thấp-hơn-trong-hệ-thống-phân-cấp"&gt;3.3 Mooncake dịch chuyển nhu cầu bộ nhớ xuống thấp hơn trong hệ thống phân cấp
&lt;/h3&gt;&lt;p&gt;Mooncake tách cụm prefill và decode và phân tán KV cache qua CPU, DRAM và SSD thay vì giữ mọi thứ trong HBM GPU. Bài báo của nó báo cáo thông lượng cao hơn tới 525% trong mô phỏng và nhiều hơn 75% yêu cầu trên khối lượng công việc thực tế.&lt;/p&gt;
&lt;p&gt;Điều này giải thích tại sao nhu cầu bộ nhớ AI mở rộng ra ngoài HBM.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;HBM bộ tăng tốc → DRAM máy chủ → SSD doanh nghiệp → tầng cache từ xa&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;KDA có thể giảm KV cache trên mỗi yêu cầu, nhưng các agent ngữ cảnh 1M liên tục làm tăng tổng khối lượng cache và thời gian lưu giữ. Dữ liệu nóng ở lại trong HBM và DRAM; ngữ cảnh lạnh hơn chuyển sang SSD. Hiệu quả có thể làm mềm luận điểm chỉ dựa vào HBM trong khi tăng cường hệ thống phân cấp bộ nhớ và trung tâm dữ liệu đầy đủ.&lt;/p&gt;
&lt;h2 id="4-open-weights-trung-quốc-di-chuyển-lên-ngăn-xếp-doanh-nghiệp"&gt;4. Open Weights Trung Quốc Di Chuyển Lên Ngăn Xếp Doanh Nghiệp
&lt;/h2&gt;&lt;p&gt;OpenRouter báo cáo rằng các mô hình Trung Quốc đã vượt qua mô hình Mỹ về tỷ lệ token trên nền tảng của họ vào đầu tháng 6 năm 2026, dựa trên hơn 450 nghìn tỷ token từ tháng 1 đến ngày 14 tháng 6. Thị phần của DeepSeek tăng từ khoảng 9% lên 18% và trở thành nhà cung cấp hàng đầu vào giữa tháng 5.&lt;/p&gt;
&lt;p&gt;Con đường áp dụng có ba giai đoạn:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Các mô hình mở giá thấp tiếp nhận khối lượng công việc phân loại, dịch thuật và kiểm thử.&lt;/li&gt;
&lt;li&gt;Hiệu suất lập mã và agent tốt hơn tiếp nhận quy trình công việc doanh nghiệp lặp đi lặp lại.&lt;/li&gt;
&lt;li&gt;Chất lượng gần tiên tiến và ngữ cảnh triệu token cạnh tranh cho định tuyến chủ lực.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Giá của K3 được thiết kế cho giai đoạn thứ ba. Nó không theo chiến lược giá thấp nhất. Nó tính phí API cấp tiên tiến trong khi hứa hẹn trọng số mà đám mây, chính phủ và doanh nghiệp có thể tự triển khai.&lt;/p&gt;
&lt;p&gt;API độc quyền và open weights tích lũy các tài sản chiến lược khác nhau.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;API tiên tiến độc quyền&lt;/th&gt;
 &lt;th&gt;Open weights gần tiên tiến&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Kiểm soát UX và năng lực tốt nhất&lt;/td&gt;
 &lt;td&gt;Nhân rộng các tuyến triển khai và lựa chọn phần cứng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Tập trung hóa dữ liệu sử dụng&lt;/td&gt;
 &lt;td&gt;Cho phép doanh nghiệp giữ dữ liệu và vận hành&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Thay đổi giá và chính sách tập trung&lt;/td&gt;
 &lt;td&gt;Các file đã phát hành khó rút lại&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Nhà cung cấp mô hình thu biên độ gộp&lt;/td&gt;
 &lt;td&gt;Đám mây, chip và nhà cung cấp ứng dụng chia sẻ giá trị&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Mô hình độc quyền mạnh nhất có thể vẫn đứng đầu trong khi mất thị phần token trả phí. Doanh nghiệp có thể định tuyến công việc lặp đi lặp lại sang các mô hình loại K3 và dành riêng các tác vụ pháp lý, thiết kế và nghiên cứu khó nhất cho mô hình đóng hàng đầu. Tỷ lệ token trả phí hỗn hợp và giá bình quân quan trọng hơn thứ hạng bảng xếp hạng.&lt;/p&gt;
&lt;h2 id="5-nhu-cầu-bán-dẫn-hiệu-quả-và-khuếch-tán-đến-cùng-lúc"&gt;5. Nhu Cầu Bán Dẫn: Hiệu Quả và Khuếch Tán Đến Cùng Lúc
&lt;/h2&gt;&lt;h3 id="51-nvidia-rủi-ro-hiệu-quả-ngắn-hạn-đàn-hồi-triển-khai-trung-hạn"&gt;5.1 NVIDIA: rủi ro hiệu quả ngắn hạn, đàn hồi triển khai trung hạn
&lt;/h3&gt;&lt;p&gt;Sparse MoE, KDA, lượng tử hóa và tối ưu hóa kernel tự động giảm thời gian GPU trên mỗi tác vụ. Khả năng di chuyển phần cứng cũng làm yếu giả định rằng mọi khối lượng công việc tiên tiến phải ở lại trên CUDA. Đó là những tín hiệu định giá tiêu cực cho NVIDIA.&lt;/p&gt;
&lt;p&gt;Mặt tích cực cũng quan trọng không kém. Moonshot khuyến nghị ít nhất 64 bộ tăng tốc cho K3 tự lưu trữ. Các trọng số được phát hành có thể thúc đẩy đám mây, chính phủ, phòng thí nghiệm và doanh nghiệp lớn xây dựng cụm của riêng họ. Nhu cầu tập trung sau một API trở thành nhu cầu phần cứng trải rộng nhiều trung tâm dữ liệu.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Tổng nhu cầu bộ tăng tốc = thời gian GPU thấp hơn/tác vụ × khối lượng công việc tổng cao hơn × nhiều tổ chức tự lưu trữ hơn&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;Hạng tử đầu tiên âm; hai hạng tử cuối dương. K3 một mình không đủ để cắt giảm ước tính thu nhập NVIDIA, nhưng cũng không đủ để giả định mọi cải thiện hiệu quả đều tạo thêm nhu cầu GPU. Đàn hồi khối lượng công việc là biến quyết định.&lt;/p&gt;
&lt;h3 id="52-amd-quyền-chọn-từ-lựa-chọn-phần-cứng"&gt;5.2 AMD: quyền chọn từ lựa chọn phần cứng
&lt;/h3&gt;&lt;p&gt;AMD hưởng lợi nếu MXFP4, MXFP8 và khả năng di chuyển vLLM cho phép doanh nghiệp tách lựa chọn mô hình khỏi lựa chọn bộ tăng tốc. Một mô hình mở gần tiên tiến cung cấp cho người mua một khối lượng công việc thực tế để kiểm tra các lựa chọn thay thế NVIDIA.&lt;/p&gt;
&lt;p&gt;Bằng chứng phải đến sau khi có trọng số. Kernel ROCm, giao tiếp song song chuyên gia, thông lượng ngữ cảnh 1M và độ ổn định 64 bộ tăng tốc cần được đo lường. Tiềm năng tăng của AMD chỉ tăng nếu K3 chứng minh chi phí vượt trội trên mỗi tác vụ thành công trên các hệ thống MI.&lt;/p&gt;
&lt;h3 id="53-hbm-cache-thấp-hơn-trên-mỗi-yêu-cầu-lưu-trú-mô-hình-lớn-hơn"&gt;5.3 HBM: cache thấp hơn trên mỗi yêu cầu, lưu trú mô hình lớn hơn
&lt;/h3&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Lớp nhu cầu&lt;/th&gt;
 &lt;th&gt;Tác động hiệu quả K3&lt;/th&gt;
 &lt;th&gt;Hướng&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Lưu trú trọng số&lt;/td&gt;
 &lt;td&gt;Mô hình 2.8T phải luôn truy cập nhanh&lt;/td&gt;
 &lt;td&gt;Nhiều bộ tăng tốc và bộ nhớ băng thông cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;KV cache mỗi yêu cầu&lt;/td&gt;
 &lt;td&gt;KDA giảm kích thước và tốc độ tăng cache&lt;/td&gt;
 &lt;td&gt;Ít dung lượng HBM hơn mỗi yêu cầu&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Người dùng và agent đồng thời&lt;/td&gt;
 &lt;td&gt;Chi phí thấp hơn và triển khai mở có thể mở rộng khối lượng công việc&lt;/td&gt;
 &lt;td&gt;Nhiều HBM và DRAM tổng hơn&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Các tiêu đề có thể tiêu cực cho SK hynix, Micron và Samsung vì KV cache thấp hơn 75% và thông lượng tăng 6.3 lần nghe có vẻ như cường độ bộ nhớ thấp hơn. Những con số đó thuộc về mô hình nghiên cứu Kimi Linear, không phải sản xuất K3 đo được. HBM cũng lưu trữ trọng số, kích hoạt, bộ đệm giao tiếp và batch, không chỉ KV cache.&lt;/p&gt;
&lt;p&gt;Cân bằng trung hạn là trung tính đến tích cực nếu các cụm tự lưu trữ và khối lượng công việc agent tăng nhanh hơn hiệu quả. Nó trở nên tiêu cực nếu đàn hồi khối lượng công việc yếu và nén cải thiện nhanh hơn mức sử dụng.&lt;/p&gt;
&lt;h3 id="54-dram-máy-chủ-và-ssd-doanh-nghiệp-là-người-hưởng-lợi-bậc-hai-rõ-ràng-nhất"&gt;5.4 DRAM máy chủ và SSD doanh nghiệp là người hưởng lợi bậc hai rõ ràng nhất
&lt;/h3&gt;&lt;p&gt;Ngữ cảnh dài và tái sử dụng cache không thể ở hoàn toàn trong HBM. Khi phục vụ tách prefill và decode và tràn cache qua CPU, DRAM và SSD, DRAM máy chủ và SSD doanh nghiệp trở thành tài sản vận hành cho suy luận AI.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Samsung có thể bán HBM, DRAM máy chủ, SSD dung lượng cao, xưởng đúc và đóng gói.&lt;/li&gt;
&lt;li&gt;SK hynix kết hợp HBM và DRAM máy chủ với SSD doanh nghiệp Solidigm.&lt;/li&gt;
&lt;li&gt;Micron cung cấp HBM, DRAM trung tâm dữ liệu và SSD.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3 không cho thấy AI cần ít bộ nhớ hơn. Nó cho thấy bộ nhớ AI đang trở thành phân cấp. Dữ liệu nóng nhất ở trong HBM, ngữ cảnh được lưu giữ trong DRAM máy chủ, và cache lạnh hơn chuyển sang SSD doanh nghiệp. Các nhà cung cấp có ngăn xếp bộ nhớ đầy đủ có khả năng phục hồi lớn hơn so với luận điểm HBM đơn sản phẩm.&lt;/p&gt;
&lt;h3 id="55-mạng-và-silicon-tùy-chỉnh-là-nút-thắt-moe-ẩn"&gt;5.5 Mạng và silicon tùy chỉnh là nút thắt MoE ẩn
&lt;/h3&gt;&lt;p&gt;Phân tán 896 chuyên gia qua các bộ tăng tốc tạo ra giao tiếp biến đổi tùy thuộc vào định tuyến token. Đây là lý do Moonshot nhấn mạnh huấn luyện song song chuyên gia cân bằng, các hình dạng tĩnh và loại bỏ đồng bộ hóa host khỏi đường hành trình quan trọng. Vận hành hiệu quả qua 64 bộ tăng tốc trở lên đòi hỏi fabric mở rộng băng thông cao theo chiều dọc và chiều ngang.&lt;/p&gt;
&lt;p&gt;Điều đó có cấu trúc tích cực cho Broadcom, Marvell, mạng NVIDIA, kết nối quang và silicon switch. Nó cũng khuyến khích ASIC suy luận được tối ưu hóa cho các mô hình mở. Bài tập thiết kế chip nhỏ 48 giờ của K3 không phải sản phẩm thương mại, nhưng minh họa thiết kế đồng thời mô hình-phần cứng nhanh hơn.&lt;/p&gt;
&lt;h2 id="6-chiến-lược-big-tech-mỹ-và-truyền-dẫn-cổ-phiếu"&gt;6. Chiến Lược Big Tech Mỹ và Truyền Dẫn Cổ Phiếu
&lt;/h2&gt;&lt;h3 id="61-microsoft-áp-lực-kinh-tế-openai-tăng-sử-dụng-azure"&gt;6.1 Microsoft: áp lực kinh tế OpenAI, tăng sử dụng Azure
&lt;/h3&gt;&lt;p&gt;Microsoft sở hữu tiếp xúc với IP và kinh tế OpenAI cũng như hạ tầng Azure. Bản cập nhật quan hệ đối tác tháng 4 năm 2026 giữ Microsoft là đối tác đám mây chính và gia hạn giấy phép IP không độc quyền đến năm 2032.&lt;/p&gt;
&lt;p&gt;K3 gây áp lực lên lớp mô hình vì công việc lặp đi lặp lại có thể rời khỏi API OpenAI. Nó có thể hỗ trợ lớp đám mây nếu Azure lưu trữ K3 như hạ tầng được quản lý hoặc tự lưu trữ.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Lớp Microsoft&lt;/th&gt;
 &lt;th&gt;Tác động K3&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Chia sẻ doanh thu OpenAI&lt;/td&gt;
 &lt;td&gt;Tiêu cực qua giá và tỷ lệ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Copilot&lt;/td&gt;
 &lt;td&gt;Tích cực nếu chi phí định tuyến giảm&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Azure AI&lt;/td&gt;
 &lt;td&gt;Tích cực nếu sử dụng đa mô hình tăng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Silicon tùy chỉnh và trung tâm dữ liệu&lt;/td&gt;
 &lt;td&gt;Tích cực nếu tối ưu hóa open-weight mở rộng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Tác động cổ phiếu ngắn hạn là trung tính. Câu hỏi trung hạn là liệu Azure có chuyển đổi được giảm phát giá mô hình thành tăng trưởng sử dụng và biên độ Copilot hay không.&lt;/p&gt;
&lt;h3 id="62-amazon-anthropic-và-aws-có-kinh-tế-khác-nhau"&gt;6.2 Amazon: Anthropic và AWS có kinh tế khác nhau
&lt;/h3&gt;&lt;p&gt;Amazon là nhà đầu tư lớn vào Anthropic và nhà cung cấp AWS, Bedrock, Trainium và Inferentia. K3 có thể giảm sức mạnh định giá của Claude và giá trị cổ phần Anthropic của Amazon. Tuy nhiên, nếu doanh nghiệp chạy K3 trên AWS, EC2, Bedrock, lưu trữ, mạng và sử dụng Trainium có thể tăng.&lt;/p&gt;
&lt;p&gt;Chiến lược tối ưu của Amazon là giữ khối lượng công việc trên AWS bất kể mô hình nào thắng. Nếu K3 đến với giấy phép cho phép và hỗ trợ Trainium hiệu quả, AWS có thể kiếm tiền từ sự khuếch tán của đối thủ cạnh tranh. Tác động cổ phiếu là trung tính đến tích cực vừa phải, mặc dù cạnh tranh giá suy luận có thể giảm biên độ đám mây ngay cả khi doanh thu tăng.&lt;/p&gt;
&lt;h3 id="63-alphabet-áp-lực-giá-gemini-phòng-thủ-tpu-và-vertex"&gt;6.3 Alphabet: áp lực giá Gemini, phòng thủ TPU và Vertex
&lt;/h3&gt;&lt;p&gt;Google kiểm soát mô hình, chip, nền tảng triển khai và nhu cầu cuối qua Search, Ads và Workspace. Vertex Model Garden hỗ trợ các mô hình của bên thứ nhất, bên thứ ba và mã nguồn mở.&lt;/p&gt;
&lt;p&gt;K3 gây áp lực giá API Gemini nhưng có thể tạo nhu cầu TPU và Google Cloud. Chi phí mô hình thấp hơn cũng giảm chi phí AI Overviews, tạo quảng cáo và agent Workspace. Tác động cổ phiếu là trung tính đến tích cực vì Google không chỉ là nhà cung cấp mô hình. Rủi ro là Gemini mất cả vị trí dẫn đầu về hiệu suất lẫn giá, làm tăng chi phí thu hút khách hàng đám mây.&lt;/p&gt;
&lt;h3 id="64-meta-từ-người-hưởng-lợi-open-weight-đến-người-bảo-vệ"&gt;6.4 Meta: từ người hưởng lợi open-weight đến người bảo vệ
&lt;/h3&gt;&lt;p&gt;Meta hưởng lợi từ sự khuếch tán open-weight bằng cách hàng hóa hóa API của đối thủ và giảm chi phí đề xuất, quảng cáo và nội dung của chính mình. Nếu các phòng thí nghiệm Trung Quốc phát hành năng lực gần tiên tiến và ngữ cảnh dài hơn trước, Meta có nguy cơ mất vị trí là hệ sinh thái open-weight Mỹ chuẩn mực.&lt;/p&gt;
&lt;p&gt;K3 buộc hai phản ứng: Llama tiếp theo phải cạnh tranh về ngữ cảnh dài, công cụ agent và chi phí triển khai, và Meta phải cung cấp một lựa chọn thay thế Mỹ đáng tin cậy cho các doanh nghiệp và chính phủ không muốn triển khai trọng số Trung Quốc. Tác động thu nhập ngắn hạn hạn chế vì quảng cáo thúc đẩy dòng tiền. Rủi ro chiến lược là lợi nhuận thấp hơn trên đầu tư hạ tầng AI và hệ sinh thái nhà phát triển nếu Llama tụt lại phía sau.&lt;/p&gt;
&lt;h3 id="65-định-vị-thị-trường-hiện-tại-quan-trọng-hơn-một-lần-ra-mắt"&gt;6.5 Định vị thị trường hiện tại quan trọng hơn một lần ra mắt
&lt;/h3&gt;&lt;p&gt;Từ ngày 22 tháng 6 đến ngày 16 tháng 7, trước khi phần lớn bằng chứng K3 có thể ảnh hưởng đến giao dịch, tổ hợp AI Mỹ đã phân kỳ mạnh mẽ.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Công ty&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Lợi nhuận&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Sụt giảm từ đỉnh giai đoạn&lt;/th&gt;
 &lt;th&gt;Tín hiệu định vị&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+17.9%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.1%&lt;/td&gt;
 &lt;td&gt;Kỳ vọng dòng tiền quảng cáo mạnh và sử dụng AI&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+9.2%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-1.2%&lt;/td&gt;
 &lt;td&gt;Khả năng phục hồi đám mây và phần mềm&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+7.3%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.2%&lt;/td&gt;
 &lt;td&gt;Kỳ vọng phục hồi AWS và tiêu dùng&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+1.4%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-5.5%&lt;/td&gt;
 &lt;td&gt;Định vị tìm kiếm và đám mây hỗn hợp&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-0.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.1%&lt;/td&gt;
 &lt;td&gt;Tương đối phục hồi&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-4.5%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9.7%&lt;/td&gt;
 &lt;td&gt;Lạc quan AI tùy chỉnh gặp áp lực định giá&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9.2%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-14.3%&lt;/td&gt;
 &lt;td&gt;Quyền chọn bộ tăng tốc thay thế với biến động cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32.0%&lt;/td&gt;
 &lt;td&gt;Điều chỉnh sau kỳ vọng bộ nhớ cao&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Oracle&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29.1%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32.7%&lt;/td&gt;
 &lt;td&gt;Căng thẳng giữa tăng trưởng hạ tầng AI và tài chính&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Marvell&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-38.8%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-40.1%&lt;/td&gt;
 &lt;td&gt;Định giá lại nghiêm trọng trong mạng và silicon tùy chỉnh&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Đây không phải lợi nhuận do K3 gây ra. Chúng cho thấy các vị thế mà K3 đến. NVIDIA tương đối phục hồi có thể nhạy cảm hơn với các tiêu đề hiệu quả, trong khi Micron và Marvell đã điều chỉnh sẵn có thể phản ứng mạnh hơn nếu các trọng số được phát hành tạo ra nhu cầu hạ tầng có thể xác minh.&lt;/p&gt;
&lt;h2 id="7-bản-đồ-tác-động-theo-công-ty"&gt;7. Bản Đồ Tác Động Theo Công Ty
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Công ty hoặc lớp&lt;/th&gt;
 &lt;th&gt;Tín hiệu ngắn hạn&lt;/th&gt;
 &lt;th&gt;Hướng đi trung hạn&lt;/th&gt;
 &lt;th&gt;Cần làm gì bây giờ&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td&gt;Áp lực định giá từ hiệu quả và khả năng di chuyển&lt;/td&gt;
 &lt;td&gt;Cụm 64+ bộ tăng tốc tự lưu trữ bù đắp hiệu quả&lt;/td&gt;
 &lt;td&gt;Theo dõi đàn hồi khối lượng công việc, không thay đổi ước tính chỉ từ việc ra mắt&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td&gt;Quyền chọn triển khai thay thế&lt;/td&gt;
 &lt;td&gt;Tăng thị phần nếu kinh tế ROCm được chứng minh&lt;/td&gt;
 &lt;td&gt;Chờ thông lượng sau ngày 27 tháng 7&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom và Marvell&lt;/td&gt;
 &lt;td&gt;Tổ hợp mạng đang định giá lại&lt;/td&gt;
 &lt;td&gt;Song song chuyên gia MoE tăng nhu cầu fabric&lt;/td&gt;
 &lt;td&gt;Xác minh đơn hàng và topology cụm K3 thực tế&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;SK hynix&lt;/td&gt;
 &lt;td&gt;Nhạy cảm với tiêu đề hiệu quả KV cache&lt;/td&gt;
 &lt;td&gt;HBM, DRAM máy chủ và tiếp xúc hệ thống phân cấp SSD Solidigm&lt;/td&gt;
 &lt;td&gt;Định giá ngăn xếp bộ nhớ đầy đủ, không chỉ HBM&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Samsung Electronics&lt;/td&gt;
 &lt;td&gt;Rủi ro hiệu quả HBM cộng vị thế bắt kịp&lt;/td&gt;
 &lt;td&gt;Quyền chọn HBM, DRAM máy chủ, SSD và xưởng đúc&lt;/td&gt;
 &lt;td&gt;Danh mục rộng nhất, vẫn cần thực thi&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td&gt;Kỳ vọng cao đã được điều chỉnh&lt;/td&gt;
 &lt;td&gt;Tiếp xúc bộ nhớ và lưu trữ AI Mỹ tích hợp&lt;/td&gt;
 &lt;td&gt;Theo dõi khối lượng triển khai so với định giá&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td&gt;Áp lực giá và tỷ lệ OpenAI&lt;/td&gt;
 &lt;td&gt;Đòn bẩy chi phí Azure và Copilot&lt;/td&gt;
 &lt;td&gt;Sử dụng đám mây quan trọng hơn biên độ mô hình&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td&gt;Áp lực giá trị tài sản Anthropic&lt;/td&gt;
 &lt;td&gt;AWS, Bedrock và Trainium hưởng lợi từ lựa chọn mô hình&lt;/td&gt;
 &lt;td&gt;Bù đắp nội bộ rõ ràng nhất&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td&gt;Áp lực giá Gemini&lt;/td&gt;
 &lt;td&gt;TPU, Vertex và lợi ích chi phí Search&lt;/td&gt;
 &lt;td&gt;Phòng thủ lớp ứng dụng vẫn mạnh&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td&gt;Áp lực vị trí dẫn đầu open-weight Mỹ&lt;/td&gt;
 &lt;td&gt;Tăng tốc Llama hoặc hệ sinh thái mở rộng hơn&lt;/td&gt;
 &lt;td&gt;Tác động chiến lược vượt quá tác động thu nhập ngắn hạn&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Chưa đủ bằng chứng cho lời khuyên mua hoặc bán mới chỉ từ đợt ra mắt này. Trọng số, giấy phép và thông lượng phần cứng bên ngoài vẫn chưa có. Thứ tự bằng chứng quan trọng hơn hướng của câu chuyện.&lt;/p&gt;
&lt;h2 id="8-ba-kịch-bản"&gt;8. Ba Kịch Bản
&lt;/h2&gt;&lt;h3 id="kịch-bản-cơ-sở-mô-hình-mạnh-tái-định-giá-hạn-chế"&gt;Kịch bản cơ sở: mô hình mạnh, tái định giá hạn chế
&lt;/h3&gt;&lt;p&gt;Xác suất chủ quan: 55%. Trọng số đầy đủ và giấy phép đủ cho phép đến trước ngày 27 tháng 7. Kết quả bên ngoài tái tạo 85% đến 95% hiệu suất chính thức. K3 chạy trên NVIDIA và AMD, nhưng 64+ bộ tăng tốc, suy luận tối đa và sử dụng token đầu ra cao giữ triển khai đắt đỏ.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;API độc quyền đối mặt thêm áp lực giá trên công việc lặp đi lặp lại.&lt;/li&gt;
&lt;li&gt;Đám mây đạt được hosting K3 và nhu cầu tự triển khai.&lt;/li&gt;
&lt;li&gt;Hiệu quả trên mỗi token bù đắp khối lượng công việc cao hơn.&lt;/li&gt;
&lt;li&gt;HBM trung tính đến tích cực vừa phải.&lt;/li&gt;
&lt;li&gt;DRAM máy chủ, SSD doanh nghiệp và mạng tích cực.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="kịch-bản-tăng-open-weights-gia-nhập-định-tuyến-doanh-nghiệp-chủ-lực"&gt;Kịch bản tăng: open weights gia nhập định tuyến doanh nghiệp chủ lực
&lt;/h3&gt;&lt;p&gt;Xác suất chủ quan: 25%. Giấy phép gần MIT, hỗ trợ vLLM và SGLang ổn định, và NVIDIA, AMD và bộ tăng tốc Trung Quốc cho thấy thông lượng mạnh. Đánh giá bên ngoài xác nhận hiệu suất ngay dưới các mô hình độc quyền hàng đầu. Các chế độ suy luận thấp hơn giảm chi phí tác vụ. Các đám mây lớn và cổng doanh nghiệp thêm K3 vào định tuyến mặc định.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Giá hỗn hợp mô hình độc quyền và thị phần token giảm.&lt;/li&gt;
&lt;li&gt;Sử dụng đa mô hình của hyperscaler tăng.&lt;/li&gt;
&lt;li&gt;Các cụm tự phục vụ làm tăng nhu cầu bộ tăng tốc.&lt;/li&gt;
&lt;li&gt;HBM, mạng, DRAM máy chủ và SSD doanh nghiệp hưởng lợi từ khối lượng triển khai.&lt;/li&gt;
&lt;li&gt;Meta và các chương trình mô hình mở Mỹ tăng tốc đầu tư.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="kịch-bản-giảm-trọng-số-tiết-lộ-khoảng-cách-chi-phí-và-chất-lượng"&gt;Kịch bản giảm: trọng số tiết lộ khoảng cách chi phí và chất lượng
&lt;/h3&gt;&lt;p&gt;Xác suất chủ quan: 20%. Trọng số bị trì hoãn hoặc bị hạn chế, điểm bên ngoài thấp hơn bảng chính thức, yêu cầu preserved-thinking-history và tính chủ động quá mức tạo ra thất bại doanh nghiệp, và chi phí tác vụ vượt quá Sonnet 5 do suy luận tối đa và dài dòng. Yêu cầu 64 bộ tăng tốc hạn chế tự lưu trữ.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Moonshot có thể phải rút lui khỏi định giá tiên tiến.&lt;/li&gt;
&lt;li&gt;API độc quyền giữ lại phần bù UX và độ tin cậy.&lt;/li&gt;
&lt;li&gt;Nhu cầu bán dẫn gia tăng vẫn hạn chế.&lt;/li&gt;
&lt;li&gt;Ước tính thu nhập và capex hiện tại lấy lại quyền kiểm soát giá cổ phiếu.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="9-danh-sách-kiểm-tra-xác-minh-ngày-27-tháng-7"&gt;9. Danh Sách Kiểm Tra Xác Minh Ngày 27 Tháng 7
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Điểm bằng chứng&lt;/th&gt;
 &lt;th&gt;Tín hiệu mạnh&lt;/th&gt;
 &lt;th&gt;Tín hiệu yếu&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Trọng số và giấy phép&lt;/td&gt;
 &lt;td&gt;Phát hành đầy đủ đúng hạn với quyền sửa đổi thương mại&lt;/td&gt;
 &lt;td&gt;Trì hoãn, hạn chế hoặc thiếu thành phần&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Đánh giá bên ngoài&lt;/td&gt;
 &lt;td&gt;Điểm chính thức được tái tạo rộng rãi dưới một bộ đánh giá&lt;/td&gt;
 &lt;td&gt;Giảm lớn so với bảng công ty&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Chi phí trên mỗi tác vụ&lt;/td&gt;
 &lt;td&gt;Các chế độ suy luận thấp hơn và ít token đầu ra hơn&lt;/td&gt;
 &lt;td&gt;Chỉ có suy luận tối đa và dài dòng liên tục&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Thông lượng NVIDIA&lt;/td&gt;
 &lt;td&gt;Song song chuyên gia ổn định trên node 64 bộ tăng tốc&lt;/td&gt;
 &lt;td&gt;Nút thắt fabric và sử dụng thấp&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Thông lượng AMD&lt;/td&gt;
 &lt;td&gt;Lợi thế chi phí dưới ROCm và vLLM&lt;/td&gt;
 &lt;td&gt;Kernel chưa trưởng thành hoặc mất mát độ chính xác&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Bộ tăng tốc Trung Quốc&lt;/td&gt;
 &lt;td&gt;Phần cứng được đặt tên và thông lượng đo được&lt;/td&gt;
 &lt;td&gt;Chỉ có ngôn ngữ &amp;ldquo;GPU thay thế&amp;rdquo;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Caching&lt;/td&gt;
 &lt;td&gt;Gần 90% hit trên lưu lượng doanh nghiệp&lt;/td&gt;
 &lt;td&gt;Giảm mạnh ngoài lập mã&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Áp dụng đám mây&lt;/td&gt;
 &lt;td&gt;Đăng trong danh mục AWS, Azure, Google Cloud hoặc Oracle&lt;/td&gt;
 &lt;td&gt;Giới hạn ở một vài nền tảng Trung Quốc&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Giá cạnh tranh&lt;/td&gt;
 &lt;td&gt;Cắt giảm giá chuẩn hoặc giảm giá cache rộng hơn&lt;/td&gt;
 &lt;td&gt;Chỉ có khuyến mãi tạm thời&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Đơn hàng bộ nhớ&lt;/td&gt;
 &lt;td&gt;Điều chỉnh tăng khối lượng HBM, DRAM máy chủ và SSD&lt;/td&gt;
 &lt;td&gt;Hiệu quả tăng trong khi khối lượng đình trệ&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="10-lập-luận-phản-biện-mạnh-nhất"&gt;10. Lập Luận Phản Biện Mạnh Nhất
&lt;/h2&gt;&lt;p&gt;Kịch bản giảm mạnh nhất rất đơn giản: nhu cầu bán dẫn giảm nếu hiệu quả cải thiện nhanh hơn mức sử dụng. Nén mô hình, linear attention, lượng tử hóa, tái sử dụng cache và ASIC suy luận có thể xử lý cùng số lượng tác vụ hữu ích với ít GPU hơn và HBM ít hơn nhiều. Cạnh tranh open-weight có thể giảm giá API mà không tạo ra đủ công việc trả phí gia tăng để biện minh cho capex AI.&lt;/p&gt;
&lt;p&gt;Bằng chứng cho kết quả đó sẽ bao gồm doanh thu suy luận chậm hơn dù giá giảm, sử dụng bộ tăng tốc cao hơn nhưng ít cụm mới hơn, tăng trưởng bit HBM dưới cải tiến hiệu quả mô hình, chuyển đổi yếu từ backlog AI đám mây thành doanh thu, và doanh nghiệp sử dụng mô hình mở chỉ để cắt giảm chi phí thay vì tạo ra quy trình công việc mới.&lt;/p&gt;
&lt;p&gt;Kịch bản tăng đòi hỏi giảm giá mở khóa công việc mới: lập mã quy mô kho lưu trữ, tự động hóa nghiên cứu, chỉnh sửa video, thiết kế chip và các quy trình công việc trước đây không kinh tế. Đàn hồi khối lượng công việc so với hiệu quả mô hình là điểm bằng chứng chung cho cả đầu tư vào bộ tăng tốc lẫn HBM.&lt;/p&gt;
&lt;h2 id="11-kết-luận"&gt;11. Kết Luận
&lt;/h2&gt;&lt;p&gt;Kimi K3 không chứng minh Trung Quốc đã vượt qua các mô hình độc quyền Mỹ mạnh nhất. Moonshot thừa nhận khoảng cách UX còn lại. Tính đến ngày 17 tháng 7, toàn bộ trọng số và báo cáo kỹ thuật chưa có, và một bảng điểm chuẩn bộ đánh giá hỗn hợp không thể tuyên bố người chiến thắng.&lt;/p&gt;
&lt;p&gt;Nó thay đổi cấu trúc thị trường. Một mô hình 2.8T, ngữ cảnh 1M, gần tiên tiến đang hoạt động ở giá chuẩn của Sonnet, với trọng số được hứa hẹn trong mười ngày. Open weights Trung Quốc đang chuyển từ các lựa chọn thay thế cấp hai giá rẻ sang khối lượng công việc doanh nghiệp chủ lực.&lt;/p&gt;
&lt;p&gt;Đối với bán dẫn, sự kiện này là tái phân bổ nhu cầu nhiều hơn là phá hủy nhu cầu. KDA và lượng tử hóa giảm HBM và thời gian GPU trên mỗi yêu cầu. Sparse MoE và supernode 64 bộ tăng tốc tăng bộ nhớ lưu trú mô hình và fabric. Mooncake đẩy cache vào DRAM máy chủ và SSD doanh nghiệp. Câu chuyện chỉ HBM trở nên kém đơn giản hơn, trong khi hệ thống phân cấp bộ nhớ và trung tâm dữ liệu đầy đủ vẫn tiếp xúc với triển khai rộng rãi hơn.&lt;/p&gt;
&lt;p&gt;Big Tech Mỹ đối mặt với sự phân chia tương tự. API mô hình hấp thụ áp lực giá; đám mây và ứng dụng hấp thụ chi phí mô hình thấp hơn. Microsoft, Amazon và Alphabet có thể lưu trữ K3 ngay cả khi các mô hình ưa thích của họ mất thị phần. Meta phải bảo vệ vai trò chiến lược là tiêu chuẩn open-weight Mỹ đáng tin cậy.&lt;/p&gt;
&lt;p&gt;Vào ngày 27 tháng 7, bằng chứng quan trọng không phải là sự tồn tại của file trọng số. Đó là giấy phép cho phép, đánh giá có thể tái tạo, thông lượng đa phần cứng và chi phí cạnh tranh trên mỗi tác vụ hoàn thành. Nếu những điều kiện đó được đáp ứng, K3 trở thành sự kiện thay đổi cả đường cong giá AI lẫn hướng đi nhu cầu bán dẫn. Nếu không, nó vẫn là một đợt ra mắt sản phẩm ấn tượng thay vì một lần đặt lại ngành.&lt;/p&gt;
&lt;h2 id="nguồn-và-giới-hạn"&gt;Nguồn và Giới Hạn
&lt;/h2&gt;&lt;p&gt;Tài liệu gốc: &lt;a class="link" href="https://www.kimi.com/blog/kimi-k3" target="_blank" rel="noopener"
 &gt;Ra mắt Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://platform.kimi.ai/docs/pricing/chat-k3" target="_blank" rel="noopener"
 &gt;Tài liệu API Kimi K3&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2510.26692" target="_blank" rel="noopener"
 &gt;Bài báo Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://github.com/MoonshotAI/Kimi-Linear" target="_blank" rel="noopener"
 &gt;GitHub Kimi Linear&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2603.15031" target="_blank" rel="noopener"
 &gt;Bài báo Attention Residuals&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2407.00079" target="_blank" rel="noopener"
 &gt;Bài báo Mooncake&lt;/a&gt;, &lt;a class="link" href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noopener"
 &gt;Giá Claude Sonnet 5&lt;/a&gt;, &lt;a class="link" href="https://developers.openai.com/api/docs/models/gpt-5.6-sol" target="_blank" rel="noopener"
 &gt;Giá GPT-5.6 Sol&lt;/a&gt;, &lt;a class="link" href="https://openrouter.ai/blog/insights/deepseek-v4-adoption/" target="_blank" rel="noopener"
 &gt;Phân tích áp dụng mô hình OpenRouter&lt;/a&gt;, &lt;a class="link" href="https://blogs.microsoft.com/blog/2026/04/27/the-next-phase-of-the-microsoft-openai-partnership/" target="_blank" rel="noopener"
 &gt;Quan hệ đối tác Microsoft-OpenAI&lt;/a&gt;, &lt;a class="link" href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-garden/explore-models" target="_blank" rel="noopener"
 &gt;Google Vertex Model Garden&lt;/a&gt;, và &lt;a class="link" href="https://www.aboutamazon.com/news/company-news/amazon-aws-anthropic-ai" target="_blank" rel="noopener"
 &gt;Quan hệ đối tác Amazon-Anthropic&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Phân tích truyền dẫn bán dẫn và cổ phiếu là suy luận từ kiến trúc công khai, dữ liệu phục vụ và thị trường. Số tham số kích hoạt chính xác, kích thước trọng số, điều khoản giấy phép, thông lượng AMD và bộ tăng tốc Trung Quốc, và chi phí doanh nghiệp thực tế trên mỗi tác vụ hoàn thành vẫn chưa có tính đến ngày 17 tháng 7. Bài viết này chỉ dành cho mục đích nghiên cứu và thông tin, không phải lời khuyên đầu tư.&lt;/p&gt;
&lt;p&gt;&lt;em&gt;Disclaimer: For research and information purposes only. Not investment advice. Names cited are for analytical illustration; readers should perform their own due diligence and consult licensed advisors before any investment decision.&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>