<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>推理 on Korea Invest Insights</title><link>https://koreainvestinsights.com/zh/tags/%E6%8E%A8%E7%90%86/</link><description>Recent content in 推理 on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>zh</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Fri, 11 Sep 2026 12:49:57 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/zh/tags/%E6%8E%A8%E7%90%86/feed.xml" rel="self" type="application/rss+xml"/><item><title>办公任务可能带来下一轮令牌需求：Astra的进步如何转化为韩国上市公司利润</title><link>https://koreainvestinsights.com/zh/post/astra-office-agent-token-demand-korean-equities-2026-09-11/</link><pubDate>Fri, 11 Sep 2026 12:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/zh/post/astra-office-agent-token-demand-korean-equities-2026-09-11/</guid><description>&lt;p&gt;9月3日发布的GPT-6 Astra，以及9月10日公布的金融工作与数据分析产品，共同指向AI竞争问题的变化：重点开始从单次回答的质量，转向系统能否持续执行受托任务，直到完成。OpenAI的金融产品连接数据、来源和企业文档模板，数据分析产品则连接内部信息与访问权限。&lt;sup id="fnref:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:3"&gt;&lt;a href="#fn:3" class="footnote-ref" role="doc-noteref"&gt;3&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;这可能使开发者较早采用的高强度使用方式，扩展至更广泛的办公职能。但产品发布不等于令牌需求已经爆发。把办公人员数量乘以一个开发者的令牌消耗，也不是可靠的市场预测。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;投资论点是有条件的：更好的电脑操作与长时间执行能力，若能减少人工干预，就可能增加真正被委托给AI的工作。韩国股票投资者随后需要辨别，哪些企业能把新增需求转化为存储芯片销量和价格、电力设备订单，或持续的软件利润。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="编程较早具备了执行与验证相连的环境"&gt;编程较早具备了执行与验证相连的环境
&lt;/h2&gt;&lt;p&gt;软件开发有可读取的代码仓库、可执行的工具，以及用来检查结果的测试。系统可以修改程序、检查失败原因，然后重试。这并不意味着所有软件成果都容易验证。更有限的解释是，相比信息分散的办公流程，开发环境更容易先把执行与评估连接起来。&lt;/p&gt;
&lt;p&gt;2026年4月公开的一项编程智能体研究发现，不同模型和执行路径的令牌消耗差异很大，甚至重复执行同一任务也会出现显著差异。更多支出并不总能换来更高准确率。这也是不能直接把开发者使用量外推到所有办公人员的原因。&lt;sup id="fnref:4"&gt;&lt;a href="#fn:4" class="footnote-ref" role="doc-noteref"&gt;4&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;办公流程存在另一类阻力：邮件里的承诺、客户系统中的状态、Excel计算和内部制度，可能分别存放在不同系统。回答正确，不能抵消错误更新业务记录的后果。只有把权限和审批也接入流程，回答才可能变成真正完成的工作。&lt;/p&gt;
&lt;p&gt;因此，“编程之后是办公”不是指前一个市场结束后，后一个才开始。二者早已重叠。这里的判断是，非开发岗位的重复使用强度，可能成为下一阶段增长来源。&lt;/p&gt;
&lt;h2 id="电脑操作扩大覆盖范围持续执行改变委托的经济性"&gt;电脑操作扩大覆盖范围，持续执行改变委托的经济性
&lt;/h2&gt;&lt;p&gt;电脑操作能力是读取屏幕、点击控件和输入信息。长时间任务执行能力则是跨步骤保持目标和证据、从错误中恢复，并检查结果。前者扩大可处理的流程范围，后者降低人一直在旁监督的负担。&lt;/p&gt;
&lt;p&gt;二者可以相互强化。点击准确却在第十步忘记目标，仍然难以委托；能够长期推理，却需要人把每个结果转录到业务系统，也仍有明显限制。这是经济层面的解释，不是关于模型架构的已验证数学定律。&lt;/p&gt;
&lt;p&gt;公开评测改善与企业生产环境的采用证据，需要分开理解。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;公开指标&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Astra&lt;/th&gt;
 &lt;th style="text-align: right"&gt;GPT-5.6 Sol&lt;/th&gt;
 &lt;th&gt;应如何解读&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;AutomationBench&lt;/td&gt;
 &lt;td style="text-align: right"&gt;41.4%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;18.1%&lt;/td&gt;
 &lt;td&gt;特定自动化评测的改善，不是全部办公工作的自动化比例&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OSWorld 2.0部分得分&lt;/td&gt;
 &lt;td style="text-align: right"&gt;72.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;65.7%&lt;/td&gt;
 &lt;td&gt;离线子集上的部分评分，不是完全无人执行的成功概率&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OSWorld延迟模拟&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40分钟&lt;/td&gt;
 &lt;td style="text-align: right"&gt;75分钟&lt;/td&gt;
 &lt;td&gt;特定评测条件下的时间，不是企业实测节省的工时&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;来源：OpenAI。OSWorld采用v2026.08.08离线子集。评测设置和工具环境可能不同于实际服务，执行环境的改进也会影响结果。&lt;sup id="fnref1:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;每一步可靠性的小幅改善，可能明显扩大可委托任务的范围。例如，假设50个独立步骤全部成功才算完成，每步成功率98%时，总成功概率为0.98的50次方，约36.4%；每步99.5%时则约77.8%。真实错误存在相关性，也有检查点、重试和恢复，所以这些数字仅说明累积效应，不能当作Astra的企业任务成功率。&lt;/p&gt;
&lt;p&gt;企业也不应把所有流程都设计成屏幕点击。有稳定的程序接口，也就是API时，通常应优先使用，再用视觉操作补上无法连接的部分。机会在于不必更换所有旧系统，也能连接原本断开的工作环节。&lt;/p&gt;
&lt;h2 id="模型能力开始与数据接入和运行基础设施结合"&gt;模型能力开始与数据接入和运行基础设施结合
&lt;/h2&gt;&lt;p&gt;9月10日发布的ChatGPT Financial Services尝试把金融数据与文档工作，连接到企业模板和管理控制。数据分析产品则连接获准使用的数据与业务背景。这说明高性能模型本身并不足够，访问能力与结果验证也必须到位。&lt;sup id="fnref1:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref1:3"&gt;&lt;a href="#fn:3" class="footnote-ref" role="doc-noteref"&gt;3&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Agents API公开测试版提供上下文管理、工具执行和多智能体协调的运行基础设施。如果企业不必分别搭建持久运行环境，把模型进步转化为付费任务的成本就可能下降。公开测试和功能说明可以确认，但所有客户的总支出与部署回报仍需另行验证。&lt;sup id="fnref:5"&gt;&lt;a href="#fn:5" class="footnote-ref" role="doc-noteref"&gt;5&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;较早形成重复使用的市场，可能并不是所有办公岗位的完全无人化。资料比较、销售准备、定期报告、费用核对等边界清晰且结果可检查的任务，更可能先进入日常流程。付款、具有约束力的合同以及人事决策，因错误损失更大，应保留适当的人工授权。&lt;/p&gt;
&lt;h2 id="一句简短指令背后可能是长链条计算"&gt;一句简短指令，背后可能是长链条计算
&lt;/h2&gt;&lt;p&gt;“比较三家供应商，准备下一次会议资料”只有一句话。但执行时需要查找邮件和报价、统一交易条件、制作表格、核对数据与来源、套用公司模板。发现缺失信息后，还可能重新运行其中部分步骤。&lt;/p&gt;
&lt;p&gt;最终回答很短，并不意味着模型调用很少。检索材料、工具返回值、中间检查和修改都会消耗令牌。令牌是模型处理输入与输出的单位，不是用户提问次数或句子数量。&lt;/p&gt;
&lt;p&gt;Anthropic在2025年6月表示，在其自身研究系统的数据中，智能体通常使用约为普通对话4倍的令牌，多智能体系统约为15倍。这是特定公司和系统的比较，并非企业工作通用的倍数。但它提供了一个实际机制：当对话变成可执行的任务时，消耗强度可能明显提高。&lt;sup id="fnref:6"&gt;&lt;a href="#fn:6" class="footnote-ref" role="doc-noteref"&gt;6&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;可持续增长不应来自低效地反复做同一件事，而应来自原本因准备成本过高而没有开展的工作，例如更多客户定制方案、更频繁的库存核对或更全面的竞争研究。单纯增加失败重试，不能证明客户愿意长期付费。&lt;/p&gt;
&lt;h2 id="实际委托频率比办公人口总量更重要"&gt;实际委托频率，比办公人口总量更重要
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;月度令牌＝目标员工数×实际使用比例×每位活跃用户每天委托任务数×工作日数×每项任务累计令牌。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;每项任务的累计量包括所有模型调用的输入和输出、重试及检查，也包括额外智能体产生的调用。此后再乘智能体数量或重试倍数，会重复计算。&lt;/p&gt;
&lt;p&gt;以下敏感性分析固定为同一家拥有1,000名员工的组织，每月22个工作日。所有数字都是假设，不是客户观测值，也不是2027年的市场预测。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;替代使用状态&lt;/th&gt;
 &lt;th style="text-align: right"&gt;活跃比例&lt;/th&gt;
 &lt;th style="text-align: right"&gt;每日使用&lt;/th&gt;
 &lt;th style="text-align: right"&gt;每次对话或任务累计令牌&lt;/th&gt;
 &lt;th style="text-align: right"&gt;月度总量&lt;/th&gt;
 &lt;th style="text-align: right"&gt;相对对话基准&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;对话基准&lt;/td&gt;
 &lt;td style="text-align: right"&gt;20%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;10次提问&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2,000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;8,800万&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.0倍&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;有限委托&lt;/td&gt;
 &lt;td style="text-align: right"&gt;30%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1项任务&lt;/td&gt;
 &lt;td style="text-align: right"&gt;20,000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.32亿&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.5倍&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;常规委托&lt;/td&gt;
 &lt;td style="text-align: right"&gt;50%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3项任务&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40,000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;13.2亿&lt;/td&gt;
 &lt;td style="text-align: right"&gt;15.0倍&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;广泛委托&lt;/td&gt;
 &lt;td style="text-align: right"&gt;70%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;5项任务&lt;/td&gt;
 &lt;td style="text-align: right"&gt;80,000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;61.6亿&lt;/td&gt;
 &lt;td style="text-align: right"&gt;70.0倍&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;基准计算为1,000×20%×10×22×2,000＝88,000,000令牌。常规委托为1,000×50%×3×22×40,000＝1,320,000,000。各行代表相互替代的状态，不是应全部加到基准之上的新增需求。一次对话与一项完成的工作，产出也并不相同。&lt;/p&gt;
&lt;p&gt;15倍不是依靠用户数量增加15倍，而是活跃用户增加2.5倍，同时每人每日令牌由2万增至12万，即6倍。反过来，如果采用仅停留在每天做一次摘要，增长幅度就会小得多。&lt;/p&gt;
&lt;p&gt;非开发人员更多，并不能直接证明其需求何时超过编程。采用率、委托频率和单任务强度都必须达到一定水平。分类时还要避免把业务用户生成的代码、开发者完成的文档工作重复统计。&lt;/p&gt;
&lt;h2 id="每项任务056美元的例子说明的是经济门槛"&gt;每项任务0.56美元的例子，说明的是经济门槛
&lt;/h2&gt;&lt;p&gt;Astra Standard公开API价格为每百万输入令牌10美元、每百万输出令牌50美元。假设一项不使用缓存的任务累计消耗36,000个输入令牌和4,000个输出令牌。&lt;sup id="fnref2:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;模型费用＝36,000÷1,000,000×10美元＋4,000÷1,000,000×50美元＝0.56美元。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;4,000个输出令牌是全部调用中计费输出的总量，不是最终报告长度。如果推理令牌作为输出计费，也必须计入。缓存、更便宜模型的分流和额外工具费用都会改变真实账单。&lt;/p&gt;
&lt;p&gt;常规委托情景产生500位用户×3项任务×22天＝每月33,000项任务。按上述成本计算，月模型费用为18,480美元，每位活跃用户36.96美元。浏览器运行、数据许可、系统集成、安全、培训和故障处理均未包含。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;委托净收益＝已实现的人力节省或新增商业价值－模型和工具费用－人工检查与返工－错误损失－分摊的运营与集成费用。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;假设一项低风险、产出等价的工作由人完成需要30分钟，每小时经济价值50美元，原成本为25美元。使用AI后检查需要5分钟，失败的20%任务全部重做，则期望返工时间为6分钟。人工成本约9.17美元，加模型费用后约9.73美元，留下约15.27美元来覆盖其他费用与错误损失。80%的成功率只是此例假设，并非来自评测分数。&lt;/p&gt;
&lt;p&gt;如果检查需要25分钟，同样条件下成本升至约26.39美元。推理便宜也无法挽救任务经济性。节省时间更不自动等于工资现金支出下降，必须通过人员重新配置、增加产出或避免追加招聘才能实现。&lt;/p&gt;
&lt;p&gt;因此，长时间执行能力最重要的指标，不是智能体可以持续运行多久，而是每项完成任务还需要多少人工干预时间。&lt;/p&gt;
&lt;h2 id="令牌账单计算和存储不是同一个量"&gt;令牌、账单、计算和存储不是同一个量
&lt;/h2&gt;&lt;p&gt;把15倍令牌直接换成15倍半导体需求，会跳过多次转换。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;指标&lt;/th&gt;
 &lt;th&gt;衡量内容&lt;/th&gt;
 &lt;th&gt;与令牌增长偏离的原因&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;逻辑令牌&lt;/td&gt;
 &lt;td&gt;全部调用的输入输出&lt;/td&gt;
 &lt;td&gt;重复使用的输入也可能计入总量&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;真实账单&lt;/td&gt;
 &lt;td&gt;按输入、缓存、输出价格计算的支出&lt;/td&gt;
 &lt;td&gt;折扣、订阅、小模型改变实现价格&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;物理计算&lt;/td&gt;
 &lt;td&gt;实际执行的运算&lt;/td&gt;
 &lt;td&gt;架构、模型大小、复用和效率不同&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;内存与存储&lt;/td&gt;
 &lt;td&gt;模型、工作状态和资料的容量与带宽&lt;/td&gt;
 &lt;td&gt;取决于并发、上下文长度、保留时间和存储层次&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;固定任务构成作示例，逻辑令牌增加15倍，而每令牌计算量下降80%，则计算需求是3倍；若每令牌下降95%，则需求是0.75倍。计算分别为15×0.20与15×0.05。这是敏感性演示，不是工程进步预测。&lt;/p&gt;
&lt;p&gt;更低成本可以带来更多使用，但不保证总支出增长。其他条件相同时，数量增长必须足以抵消单价下降。价格降低后新增的工作，与原有任务所需计算量下降，需要同时考虑。&lt;/p&gt;
&lt;p&gt;并发也应单独观察。同样的日使用量，如果集中在上班时段，会要求更大容量；把容忍延迟的工作安排到夜间批处理，则可能提高现有设备利用率，推迟新建投资。智能体数量乘以24小时，并不会自动产生新需求。&lt;/p&gt;
&lt;h2 id="存储投资应看层次分工而不只是hbm"&gt;存储投资应看层次分工，而不只是HBM
&lt;/h2&gt;&lt;p&gt;AI除了保存模型权重，还会保留此前上下文的中间计算结果。可复用的注意力状态通常称为KV缓存。长时间任务和大量并发用户，可能提高保存位置与读取速度的重要性。&lt;/p&gt;
&lt;p&gt;但并非所有状态都必须一直放在昂贵的高带宽内存HBM里。英伟达2026年3月公布的STX与CMX，提出额外的上下文存储层，既扩展可访问上下文，也提高现有GPU使用效率。厂商的性能数字取决于具体配置，不等于全行业的实测效率提升。&lt;sup id="fnref:7"&gt;&lt;a href="#fn:7" class="footnote-ref" role="doc-noteref"&gt;7&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;HyMCache研究7月首次提交，8月修订后标题为A CXL Memory Rack for Multi-Turn LLM Serving，探索通过DRAM与SSD组合保存可复用状态。其中一项比较以部分性能损失换取大幅减少DRAM。它是研究结果，不是大规模商用证明，但足以反驳令牌与某一种存储产品必然同比增长的简单推断。&lt;sup id="fnref:8"&gt;&lt;a href="#fn:8" class="footnote-ref" role="doc-noteref"&gt;8&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;对韩国投资者有意义的假设，不是HBM消失与HBM必然暴增之间二选一，而是高速HBM、服务器DRAM和大容量企业级SSD如何分工，以及供应商如何在各层获取利润。令牌量也不等于存档文档量：反复读取同一资料，会增加逻辑令牌，却未必增加原始数据存储。&lt;/p&gt;
&lt;h2 id="韩国上市公司有四种不同的利润传导路径"&gt;韩国上市公司有四种不同的利润传导路径
&lt;/h2&gt;&lt;p&gt;下面是按业务关联度组织的研究顺序，不是考虑当前股价后的买入排名。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;公司&lt;/th&gt;
 &lt;th&gt;办公智能体需求关联&lt;/th&gt;
 &lt;th&gt;利润兑现需要验证&lt;/th&gt;
 &lt;th&gt;削弱论点的条件&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;SK海力士（000660）&lt;/td&gt;
 &lt;td&gt;HBM、服务器DRAM、企业级SSD&lt;/td&gt;
 &lt;td&gt;产品销量、均价、高端占比及投资后现金流&lt;/td&gt;
 &lt;td&gt;客户效率抵消数量增长，或供给扩张压低价格&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;三星电子（005930）&lt;/td&gt;
 &lt;td&gt;三种存储产品的广泛覆盖&lt;/td&gt;
 &lt;td&gt;客户量产、良率、产品组合及其他业务损益&lt;/td&gt;
 &lt;td&gt;技术进步无法转成盈利量产，其他业务亏损扩大&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;LS ELECTRIC（010120）&lt;/td&gt;
 &lt;td&gt;数据中心配电和电力设备&lt;/td&gt;
 &lt;td&gt;签约订单、交付、订单转收入、项目利润和回款&lt;/td&gt;
 &lt;td&gt;只提高现有设备利用率，新建延误或取消&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;三星SDS（018260）&lt;/td&gt;
 &lt;td&gt;企业数据集成、智能体运行与管控、工作平台&lt;/td&gt;
 &lt;td&gt;付费重复使用、续约、扣除模型成本后利润、外部客户&lt;/td&gt;
 &lt;td&gt;模型转售和集成人工吸收新增收入&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="sk海力士关注hbm以外的增长也保留周期判断"&gt;SK海力士：关注HBM以外的增长，也保留周期判断
&lt;/h3&gt;&lt;p&gt;SK海力士8月26日的产品介绍同时展示了HBM、服务器DRAM和企业级SSD。这意味着面对更细分的存储层次，企业拥有多个参与途径。但展示一款产品，不代表所有产品会在同一时期贡献同等规模收入。&lt;sup id="fnref:9"&gt;&lt;a href="#fn:9" class="footnote-ref" role="doc-noteref"&gt;9&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;应追踪产品级数量与价格，而非只看被冠以AI名称的收入总额。HBM增长时，如果服务器DRAM或NAND价格转弱，整体结果仍会不同。经营现金流也需要扣除资本支出与营运资金需求后再判断。&lt;/p&gt;
&lt;p&gt;它是这条投资论点的直接研究对象，但直接受益不等于低估。如果供给优势已经充分反映在预期中，行业景气也可能对应较低股票回报。&lt;/p&gt;
&lt;h3 id="三星电子广泛覆盖与业务抵消同时存在"&gt;三星电子：广泛覆盖与业务抵消同时存在
&lt;/h3&gt;&lt;p&gt;三星在7月30日公布二季度业绩时，把下半年智能体AI发展与服务器DRAM、企业级SSD及HBM需求联系起来。这证明供应商也在提出类似的需求假设，但它仍是管理层展望，而非对未来供需的独立验证。&lt;sup id="fnref:10"&gt;&lt;a href="#fn:10" class="footnote-ref" role="doc-noteref"&gt;10&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;多种存储产品提供不同增长通道，但股东利润取决于客户认证后的盈利量产、良率和产品组合。其他半导体与消费产品业务，也会影响合并结果。&lt;/p&gt;
&lt;p&gt;因此，不应把Astra发布直接加到盈利模型中。先要判断已有AI支出预期之外到底增加多少需求，再看它改变销量、价格还是利润率。对既有订单的新叙事，不是新增利润。&lt;/p&gt;
&lt;h3 id="ls-electric投资订单和建设而非每个令牌的收费权"&gt;LS ELECTRIC：投资订单和建设，而非每个令牌的收费权
&lt;/h3&gt;&lt;p&gt;8月24日，LS ELECTRIC公布北美AI数据中心电力设备合同扩额，修订后总额约2,309亿韩元。这是调整后的合同总额，不是可全额叠加在原订单上的新增金额。数据中心业务联系有实际合同支持，但该合同早于Astra发布，不能归因于Astra。&lt;sup id="fnref:11"&gt;&lt;a href="#fn:11" class="footnote-ref" role="doc-noteref"&gt;11&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;如果办公推理只是提高现有基础设施利用率，新的电力设备订单不会立即增加。持续需求必须转化为获得融资、能够接入电力的建设。高融资成本和工程延期，可以与有利的长期需求前景并存。&lt;/p&gt;
&lt;p&gt;验证顺序是新订单、在手订单转化为收入、项目利润、现金回款。若把企业当成每处理一个令牌就收取一次费用的商业模式，会忽略设备行业的时间差和执行风险。&lt;/p&gt;
&lt;h3 id="三星sds承担运行责任比转售模型更重要"&gt;三星SDS：承担运行责任比转售模型更重要
&lt;/h3&gt;&lt;p&gt;三星SDS将FabriX描述为连接多个模型与企业系统，并支持智能体创建、运行和治理的平台。Brity Copilot则把AI接入邮件与会议。企业数据、访问权限和运行责任，使其可能参与办公AI普及。&lt;sup id="fnref:12"&gt;&lt;a href="#fn:12" class="footnote-ref" role="doc-noteref"&gt;12&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:13"&gt;&lt;a href="#fn:13" class="footnote-ref" role="doc-noteref"&gt;13&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;与此同时，前沿模型厂商也直接扩展企业产品和数据连接。简单的聊天窗口或模型访问权转售，可能遭遇价格竞争。更有防御力的业务，可能是处理旧系统例外、权限、审计记录和故障，并获得反复续约。&lt;sup id="fnref2:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref1:5"&gt;&lt;a href="#fn:5" class="footnote-ref" role="doc-noteref"&gt;5&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;付费使用增加，不保证股东利润增加；如果模型成本和集成人工增长更快，利润反而承压。投资者需要外部客户的重复合同、部署后的留存，以及扣除推理成本的利润率。本文核查的产品资料，不足以推算独立AI业务的利润率。&lt;/p&gt;
&lt;h2 id="行业判断正确股票仍可能下跌"&gt;行业判断正确，股票仍可能下跌
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;股价变化倍数＝每股收益变化倍数×估值倍数变化。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;如果每股收益增长30%，市盈率却从20倍降至15倍，则股价为1.30×15÷20＝原来的0.975倍，下跌2.5%。这是计算示例，不是任何列举公司的当前估值，并假定收益口径和预测期间一致。&lt;/p&gt;
&lt;p&gt;不能把存储行业最好季度的利润乘以四，就视为永久盈利能力。应考虑供给增长、价格正常化、折旧、投资和现金流。设备合同总额不是即时利润，软件收入也应扣除转售成本。&lt;/p&gt;
&lt;p&gt;本文并非逐只股票核实当日价格与市场盈利预测的完整估值报告，因此不编造目标价或买入价。实际买入需要反推当前企业价值隐含的增长，再判断新增订单与重复使用能否超过这些预期。&lt;/p&gt;
&lt;p&gt;优先研究存储供应商的理由，是不用押注某个办公应用获胜，也能参与多个模型的普及。但模型客户的多元化，不等于存储周期风险分散。同时持有韩国两大厂商，仍面临共同的AI资本支出与存储价格风险。&lt;/p&gt;
&lt;h2 id="从2026年第四季度开始看重复使用和人工介入"&gt;从2026年第四季度开始，看重复使用和人工介入
&lt;/h2&gt;&lt;p&gt;观察窗口设为2026年第四季度与2027年第一季度。这是研究安排，不是保证采用将在该时段发生的预测。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;观察对象&lt;/th&gt;
 &lt;th&gt;强化论点的证据&lt;/th&gt;
 &lt;th&gt;应下调判断的证据&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;非开发岗位付费使用&lt;/td&gt;
 &lt;td&gt;同一采用群体中，重复任务和付费使用持续增加&lt;/td&gt;
 &lt;td&gt;新账户增加，但试用后活跃下降&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;单任务经济性&lt;/td&gt;
 &lt;td&gt;每项完成工作需要的检查与返工减少&lt;/td&gt;
 &lt;td&gt;验证时间接近原本手工完成时间&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;实际基础设施负荷&lt;/td&gt;
 &lt;td&gt;缓存与模型分流之后，计算或上下文存储需求仍增加&lt;/td&gt;
 &lt;td&gt;逻辑令牌增长，物理资源使用停滞&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;韩国存储企业&lt;/td&gt;
 &lt;td&gt;意外新增订单改变产品销量、价格与利润&lt;/td&gt;
 &lt;td&gt;老订单换标签，库存上升、价格下跌&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;电力设备与企业软件&lt;/td&gt;
 &lt;td&gt;订单转现金、续约与利润率改善&lt;/td&gt;
 &lt;td&gt;建设延期、低利润转售、一次性实施占主导&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;如果两个季度后仍无法证明非开发岗位反复使用及单任务经济性，就应推迟“下一轮需求即将到来”的时间判断。如果采用增加，但效率改进抵消硬件需求，软件采用论点可以保留，半导体受益强度则应降低。安全事故导致权限收缩，或长期依赖人工救场，也都是重要反证。&lt;/p&gt;
&lt;p&gt;Astra可能扩大的，是完成任务的市场，而非更长回答的市场。韩国股票的买入依据，出现在这种可能性形成反复支出，并兑现为超出股价既有预期的企业现金流时。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;资料核查截至2026年9月11日。产品及公司披露属于发布方陈述，与独立生产环境验证相区分。令牌、成本和股价敏感性均为作者假设示例，不构成针对个人情况的投资建议。&lt;/p&gt;
&lt;h3 id="来源"&gt;来源
&lt;/h3&gt;&lt;div class="footnotes" role="doc-endnotes"&gt;
&lt;hr&gt;
&lt;ol&gt;
&lt;li id="fn:1"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;GPT-6 Astra&lt;/a&gt;，2026年9月；评测条件与Standard API价格。&amp;#160;&lt;a href="#fnref:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref2:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:2"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/introducing-chatgpt-financial-services/" target="_blank" rel="noopener"
 &gt;ChatGPT Financial Services&lt;/a&gt;，2026年9月10日。&amp;#160;&lt;a href="#fnref:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref2:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:3"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/put-data-to-work/" target="_blank" rel="noopener"
 &gt;Put data to work&lt;/a&gt;，2026年9月10日。&amp;#160;&lt;a href="#fnref:3" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:3" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:4"&gt;
&lt;p&gt;Bai等, &lt;a class="link" href="https://arxiv.org/abs/2604.22750v2" target="_blank" rel="noopener"
 &gt;How Do AI Agents Spend Your Money?&lt;/a&gt;，首次提交2026年4月24日，4月29日修订。采用摘要证据，不外推全部办公任务。&amp;#160;&lt;a href="#fnref:4" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:5"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/introducing-the-agents-api/" target="_blank" rel="noopener"
 &gt;Agents API&lt;/a&gt;，2026年9月10日。&amp;#160;&lt;a href="#fnref:5" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:5" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:6"&gt;
&lt;p&gt;Anthropic, &lt;a class="link" href="https://www.anthropic.com/engineering/multi-agent-research-system" target="_blank" rel="noopener"
 &gt;How we built our multi-agent research system&lt;/a&gt;，2025年6月13日。&amp;#160;&lt;a href="#fnref:6" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:7"&gt;
&lt;p&gt;NVIDIA, &lt;a class="link" href="https://nvidianews.nvidia.com/news/nvidia-launches-bluefield-4-stx-storage-architecture-with-broad-industry-adoption" target="_blank" rel="noopener"
 &gt;BlueField-4 STX&lt;/a&gt;，2026年3月16日。&amp;#160;&lt;a href="#fnref:7" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:8"&gt;
&lt;p&gt;Jang等, &lt;a class="link" href="https://arxiv.org/abs/2607.18141v3" target="_blank" rel="noopener"
 &gt;A CXL Memory Rack for Multi-Turn LLM Serving&lt;/a&gt;，首次提交7月20日，v3为2026年8月5日。研究不等于商业采用。&amp;#160;&lt;a href="#fnref:8" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:9"&gt;
&lt;p&gt;SK hynix, &lt;a class="link" href="https://news.skhynix.com/en/dtf-2026/" target="_blank" rel="noopener"
 &gt;DTF 2026&lt;/a&gt;，2026年8月26日。&amp;#160;&lt;a href="#fnref:9" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:10"&gt;
&lt;p&gt;Samsung, &lt;a class="link" href="https://news.samsung.com/global/samsung-electronics-announces-second-quarter-2026-results" target="_blank" rel="noopener"
 &gt;2026年第二季度业绩&lt;/a&gt;，2026年7月30日。&amp;#160;&lt;a href="#fnref:10" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:11"&gt;
&lt;p&gt;LS ELECTRIC, &lt;a class="link" href="https://www.ls-electric.com/ko/pr/news/view/401457?b_date=&amp;amp;e_date=&amp;amp;k_type=both&amp;amp;k_word=&amp;amp;page=1&amp;amp;rowsPerPage=10&amp;amp;visiblePage=10" target="_blank" rel="noopener"
 &gt;电力设备合同公告&lt;/a&gt;，2026年8月24日；修订后总额，并非全部新增。&amp;#160;&lt;a href="#fnref:11" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:12"&gt;
&lt;p&gt;Samsung SDS, &lt;a class="link" href="https://www.samsungsds.com/kr/ai-fabrix/fabrix.html" target="_blank" rel="noopener"
 &gt;FabriX&lt;/a&gt;，2026年9月11日查阅。&amp;#160;&lt;a href="#fnref:12" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:13"&gt;
&lt;p&gt;Samsung SDS, &lt;a class="link" href="https://www.samsungsds.com/kr/ai-agent/ai-agent.html" target="_blank" rel="noopener"
 &gt;AI Agent&lt;/a&gt;，2026年9月11日查阅。&amp;#160;&lt;a href="#fnref:13" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/div&gt;</description></item><item><title>Astra之后：循环Transformer如何改变AI基础设施的成本计算</title><link>https://koreainvestinsights.com/zh/post/astra-loop-transformers-inference-economics-2026-09-08/</link><pubDate>Tue, 08 Sep 2026 18:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/zh/post/astra-loop-transformers-inference-economics-2026-09-08/</guid><description>&lt;p&gt;让小模型反复通过同一个神经网络，能否解决更难的问题？Lablup首席执行官申正奎在其&lt;a class="link" href="https://www.facebook.com/jeongkyu.shin/posts/pfbid02jm4iibHsgU11P7gY8e4SZKtKYNNdtHF6wdTQK2EdyDeTMEwxiDvHnHyhyAKphLml" target="_blank" rel="noopener"
 &gt;讨论Astra与循环Transformer的Facebook文章&lt;/a&gt;中重新提出了这个问题。架构问题的背后，是一个很实际的基础设施决策：需要购买多少加速器和内存，又该如何运行它们。&lt;/p&gt;
&lt;p&gt;公开研究已经展示了一种变化：在存储的权重保持不变时，反复执行共享计算模块，可以提高模型解决问题的能力。但重复计算需要时间和能源。模型更小，并不自动意味着服务更便宜。&lt;/p&gt;
&lt;p&gt;这是一篇由申正奎的文章引发、结合原始论文与模型卡撰写的独立分析。对于原文对Astra的解读和公开证实的事实，需要分别看待。下文的产业影响属于附带条件的分析，资料核查日期为2026年9月8日。&lt;/p&gt;
&lt;h2 id="astra的成绩并未披露其内部架构"&gt;Astra的成绩并未披露其内部架构
&lt;/h2&gt;&lt;p&gt;OpenAI在9月3日发布的公告确认了GPT-6 Astra的推出及能力提升。然而，本次查阅的&lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;发布公告&lt;/a&gt;和&lt;a class="link" href="https://deploymentsafety.openai.com/gpt-6-astra" target="_blank" rel="noopener"
 &gt;系统卡&lt;/a&gt;没有公开循环Transformer架构、递归次数，或总参数量与激活参数量。&lt;/p&gt;
&lt;p&gt;因此，不能把Astra与Huginn式设计的联系当作已确认事实。原文中的10T与1T规模说法，以及有关AGI的引述，也不作为这次分析的前提。仅凭性能提高，无法确定模型内部究竟采用了什么结构。&lt;/p&gt;
&lt;p&gt;循环研究仍然值得关注。公开模型已经尝试将存储参数的容量与推理时投入的计算分开调整。无需依赖前沿模型尚未公开的设计，这一方向本身就可以接受检验。&lt;/p&gt;
&lt;h2 id="存储更多与计算更久是两种不同选择"&gt;存储更多与计算更久是两种不同选择
&lt;/h2&gt;&lt;p&gt;参数是在训练中调整的数值权重。扩大模型通常会增加需要存储的数据。混合专家模型MoE根据输入选择部分专家模块，目的是让执行时的计算量相对于模型总容量保持较低水平。&lt;/p&gt;
&lt;p&gt;MoE并非始于Switch Transformer。&lt;a class="link" href="https://arxiv.org/abs/1701.06538" target="_blank" rel="noopener"
 &gt;2017年的稀疏门控MoE论文&lt;/a&gt;更早出现，而&lt;a class="link" href="https://arxiv.org/abs/2101.03961" target="_blank" rel="noopener"
 &gt;2021年的Switch Transformer&lt;/a&gt;简化了大规模训练与路由。总参数量更大，也不必然表示网络层数更多。&lt;/p&gt;
&lt;p&gt;思维链CoT生成中间推理词元，为后续计算扩展上下文。循环模型则把内部状态再次送入共享权重的模块。其区别在于，中间计算不必每一步都转成一个词。两种方法也可以结合使用，不要求彼此取代。&lt;/p&gt;
&lt;p&gt;比较各自增加了什么，有助于理解成本差异。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;方法&lt;/th&gt;
 &lt;th&gt;增加的资源&lt;/th&gt;
 &lt;th&gt;可能产生的成本&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;扩大模型&lt;/td&gt;
 &lt;td&gt;权重或专家容量&lt;/td&gt;
 &lt;td&gt;存储、激活计算、通信&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;思维链&lt;/td&gt;
 &lt;td&gt;中间推理词元&lt;/td&gt;
 &lt;td&gt;生成时间、上下文与缓存&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;循环深度&lt;/td&gt;
 &lt;td&gt;通过共享模块的次数&lt;/td&gt;
 &lt;td&gt;重复计算、延迟、状态管理&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是概念上的区分。实际经济性必须在相同准确率、输入长度和硬件条件下测量，不能仅根据结构名称判断。&lt;/p&gt;
&lt;h2 id="先思考再回答的研究采用不同机制"&gt;先思考再回答的研究采用不同机制
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2310.02226" target="_blank" rel="noopener"
 &gt;Pause tokens&lt;/a&gt;在回答前提供额外计算机会。&lt;a class="link" href="https://arxiv.org/abs/2403.09629" target="_blank" rel="noopener"
 &gt;Quiet-STaR&lt;/a&gt;训练模型生成有助于预测后续词元的中间理由。名称中的“安静”不应被理解为已经证明模型采用了非语言的连续状态推理。&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2412.06769" target="_blank" rel="noopener"
 &gt;Coconut&lt;/a&gt;把最后的隐藏状态直接反馈为下一个输入，而不是先将其转成词语。这一方法探索在表达成语言之前，如何在内部表示中保留多种可能性。它并不是人类意识或持续运行的自主思考的证据。&lt;/p&gt;
&lt;p&gt;循环深度研究包括&lt;a class="link" href="https://arxiv.org/abs/1807.03819" target="_blank" rel="noopener"
 &gt;2018年的Universal Transformer&lt;/a&gt;。它重复同一变换，并能为不同位置分配不同计算量。真正的难点是训练出有用的重复：共享模块必须处理不同阶段的状态，而多执行一次也应改善结果。层间角色冲突提供了一种直观解释，但不是解释所有失败的普遍法则。&lt;/p&gt;
&lt;h2 id="复制层与共享同一组权重并不相同"&gt;复制层与共享同一组权重并不相同
&lt;/h2&gt;&lt;p&gt;Upstage的&lt;a class="link" href="https://arxiv.org/abs/2312.15166" target="_blank" rel="noopener"
 &gt;SOLAR 10.7B&lt;/a&gt;提出深度扩展DUS：复制已有层，删除其中一部分，连接成更深的模型，再继续训练。最初相同的副本会在训练后形成不同权重，最终模型存储的参数也会增加。&lt;/p&gt;
&lt;p&gt;循环模型则持续共享同一组权重。DUS利用已有训练成果构建更深的模型；循环方法增加执行深度，却不要求存储权重同比例增加。把两者都视为同一种节省内存技术，会导致成本计算出错。&lt;/p&gt;
&lt;h2 id="huginn与ouro的数字必须连同比较条件一起阅读"&gt;Huginn与Ouro的数字必须连同比较条件一起阅读
&lt;/h2&gt;&lt;p&gt;Geiping及其合作者的&lt;a class="link" href="https://arxiv.org/abs/2502.05171" target="_blank" rel="noopener"
 &gt;Huginn研究&lt;/a&gt;区分输入处理、循环核心与输出处理。核心通过多次执行优化内部状态。研究人员用800B词元训练了一个3.5B参数模型，并报告随着循环计算增加，推理任务的表现得到改善。&lt;/p&gt;
&lt;p&gt;论文摘要中的50B需要谨慎解读。它描述的是：性能改善可以持续到相当于50B参数的计算负载。它没有保证所有任务上都能达到50B模型的质量，也没有保证以相同成本获得这种质量。少量权重承担更多计算是研究成果，服务经济性则需要单独实测。&lt;/p&gt;
&lt;p&gt;ByteDance及其合作者在2025年10月公开了&lt;a class="link" href="https://arxiv.org/abs/2510.25741" target="_blank" rel="noopener"
 &gt;Ouro&lt;/a&gt;。论文涉及1.4B和2.6B的模型系列，并在不同基准上报告了与最大12B模型的比较。不过，&lt;a class="link" href="https://huggingface.co/ByteDance/Ouro-1.4B" target="_blank" rel="noopener"
 &gt;Ouro-1.4B官方模型卡&lt;/a&gt;把这个具体模型描述为达到常规3至4B模型的表现。声称1.4B始终能够取代12B，会夸大这一比较。&lt;/p&gt;
&lt;p&gt;阅读参数量时，还应同时记录训练数据量、循环次数及评测任务。推理阶段看起来高效，也可能建立在大量预训练投入之上。&lt;/p&gt;
&lt;h2 id="存储权重减少并不意味着内存瓶颈消失"&gt;存储权重减少并不意味着内存瓶颈消失
&lt;/h2&gt;&lt;p&gt;考虑一个用于说明的计算：3.5B参数，每个占2字节，仅权重就需要约7GB。反复使用同一组权重，不会让其存储需求随循环次数成倍增长。这只是算术示例，并非Huginn实际GPU总内存占用的测量结果。&lt;/p&gt;
&lt;p&gt;推理总内存还包括复用先前上下文的KV缓存、中间状态及运行工作区。&lt;a class="link" href="https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/" target="_blank" rel="noopener"
 &gt;NVIDIA的推理优化说明&lt;/a&gt;也将权重和KV缓存区分为主要内存组成。上下文越长、并发请求越多，缓存压力就越大。能否在循环步骤之间共享缓存，取决于具体设计。&lt;/p&gt;
&lt;p&gt;权重复用也不等于数据传输减少。如果权重无法持续留在快速片上内存中，下一次循环可能仍需从HBM重新读取。重复计算可能同时增加带宽需求。因此，在查看内存层级和实现代码之前，不能宣称循环会让HBM变得不必要。&lt;/p&gt;
&lt;h2 id="提前退出的节省必须由软件真正实现"&gt;提前退出的节省必须由软件真正实现
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2507.10524" target="_blank" rel="noopener"
 &gt;Mixture-of-Recursions（MoR）&lt;/a&gt;按词元调整递归深度，并围绕在当前深度仍然活跃的词元管理计算和缓存。其目标是把计算分配给更难的词元，避免在简单词元上继续投入资源。&lt;/p&gt;
&lt;p&gt;实际服务环境会让这个问题更复杂。不同请求需要的循环次数不同，可能降低批处理效率。调度器必须让其他任务及时利用提前完成的请求所释放的资源。这是从架构推导出的运行挑战，不是某个商业产品已公布的实测结果。&lt;/p&gt;
&lt;p&gt;Ouro模型卡给出了具体例子。模型支持提前退出，但卡片指出vLLM不支持这一功能，而会执行配置的完整循环次数。模型架构具备的能力，不会自动成为推理服务引擎已经实现的功能。&lt;/p&gt;
&lt;p&gt;这也为评估Lablup等AI基础设施软件公司提供了具体问题：平台能否混合处理循环深度不同的任务、复用缓存，并在相同质量下减少完成时间和能源成本？这些是评估商业机会的问题，并非断言Lablup已经支持相关功能，或已经由此获得收入增长。&lt;/p&gt;
&lt;h2 id="韩国半导体同时面临资源节省与使用量扩大的可能"&gt;韩国半导体同时面临资源节省与使用量扩大的可能
&lt;/h2&gt;&lt;p&gt;下表是循环模型获得更广泛采用时的条件情景，不是盈利预测。&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;条件&lt;/th&gt;
 &lt;th&gt;可能的产业影响&lt;/th&gt;
 &lt;th&gt;需要的证据&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;同等质量所需权重和缓存减少&lt;/td&gt;
 &lt;td&gt;单次请求的内存压力下降&lt;/td&gt;
 &lt;td&gt;同等上下文和并发条件下的内存实测&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;困难问题使用更多循环&lt;/td&gt;
 &lt;td&gt;加速器运行时间和能源需求增加&lt;/td&gt;
 &lt;td&gt;每项成功任务的GPU时间与能耗&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;成本下降促进使用量增长&lt;/td&gt;
 &lt;td&gt;基础设施总需求稳定或增加&lt;/td&gt;
 &lt;td&gt;客户实际用量与采购计划&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;循环和缓存管理降低批处理效率&lt;/td&gt;
 &lt;td&gt;商业化延后&lt;/td&gt;
 &lt;td&gt;相同延迟目标下的吞吐量&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对于Samsung Electronics和SK hynix等内存供应商，总需求同时取决于每次请求的资源消耗和请求总数。效率提升可能促进采用，但不能假定新增用量必然超过节省的资源。仅凭本次分析，不足以调整HBM需求或相关公司的盈利预测。&lt;/p&gt;
&lt;p&gt;更有意义的比较单位，是完成一项成功任务的成本。即使基准分数较高，如果重复计算过慢、重试频繁，实际成本仍可能上升。反过来，如果额外计算充分提高首次成功率，总成本也可能下降。&lt;/p&gt;
&lt;h2 id="下一步应检验任务成本而不只是参数量"&gt;下一步应检验任务成本，而不只是参数量
&lt;/h2&gt;&lt;p&gt;检验循环模型的产业价值，需要在相同准确率下比较总内存、完成时间、能源和并发吞吐量。不仅要看简单问题的平均值，也要看最慢一部分请求的延迟。如果增加循环不再改善质量，或批处理效率损失超过资源节省，商业化的理由就会减弱。&lt;/p&gt;
&lt;p&gt;未来如果Astra披露更多架构信息，就可以重新判断它是否属于这条研究路线。在此之前，已经可以确认的变化是：基础设施规划除了考虑存储模型的大小，还必须考虑每个问题应计算多久、何时停止。把这种灵活性转化为实际成本下降，是硬件与软件需要共同通过的检验。&lt;/p&gt;</description></item></channel></rss>