9月3日发布的GPT-6 Astra,以及9月10日公布的金融工作与数据分析产品,共同指向AI竞争问题的变化:重点开始从单次回答的质量,转向系统能否持续执行受托任务,直到完成。OpenAI的金融产品连接数据、来源和企业文档模板,数据分析产品则连接内部信息与访问权限。123
这可能使开发者较早采用的高强度使用方式,扩展至更广泛的办公职能。但产品发布不等于令牌需求已经爆发。把办公人员数量乘以一个开发者的令牌消耗,也不是可靠的市场预测。
投资论点是有条件的:更好的电脑操作与长时间执行能力,若能减少人工干预,就可能增加真正被委托给AI的工作。韩国股票投资者随后需要辨别,哪些企业能把新增需求转化为存储芯片销量和价格、电力设备订单,或持续的软件利润。
编程较早具备了执行与验证相连的环境
软件开发有可读取的代码仓库、可执行的工具,以及用来检查结果的测试。系统可以修改程序、检查失败原因,然后重试。这并不意味着所有软件成果都容易验证。更有限的解释是,相比信息分散的办公流程,开发环境更容易先把执行与评估连接起来。
2026年4月公开的一项编程智能体研究发现,不同模型和执行路径的令牌消耗差异很大,甚至重复执行同一任务也会出现显著差异。更多支出并不总能换来更高准确率。这也是不能直接把开发者使用量外推到所有办公人员的原因。4
办公流程存在另一类阻力:邮件里的承诺、客户系统中的状态、Excel计算和内部制度,可能分别存放在不同系统。回答正确,不能抵消错误更新业务记录的后果。只有把权限和审批也接入流程,回答才可能变成真正完成的工作。
因此,“编程之后是办公”不是指前一个市场结束后,后一个才开始。二者早已重叠。这里的判断是,非开发岗位的重复使用强度,可能成为下一阶段增长来源。
电脑操作扩大覆盖范围,持续执行改变委托的经济性
电脑操作能力是读取屏幕、点击控件和输入信息。长时间任务执行能力则是跨步骤保持目标和证据、从错误中恢复,并检查结果。前者扩大可处理的流程范围,后者降低人一直在旁监督的负担。
二者可以相互强化。点击准确却在第十步忘记目标,仍然难以委托;能够长期推理,却需要人把每个结果转录到业务系统,也仍有明显限制。这是经济层面的解释,不是关于模型架构的已验证数学定律。
公开评测改善与企业生产环境的采用证据,需要分开理解。
| 公开指标 | Astra | GPT-5.6 Sol | 应如何解读 |
|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | 特定自动化评测的改善,不是全部办公工作的自动化比例 |
| OSWorld 2.0部分得分 | 72.6% | 65.7% | 离线子集上的部分评分,不是完全无人执行的成功概率 |
| OSWorld延迟模拟 | 40分钟 | 75分钟 | 特定评测条件下的时间,不是企业实测节省的工时 |
来源:OpenAI。OSWorld采用v2026.08.08离线子集。评测设置和工具环境可能不同于实际服务,执行环境的改进也会影响结果。1
每一步可靠性的小幅改善,可能明显扩大可委托任务的范围。例如,假设50个独立步骤全部成功才算完成,每步成功率98%时,总成功概率为0.98的50次方,约36.4%;每步99.5%时则约77.8%。真实错误存在相关性,也有检查点、重试和恢复,所以这些数字仅说明累积效应,不能当作Astra的企业任务成功率。
企业也不应把所有流程都设计成屏幕点击。有稳定的程序接口,也就是API时,通常应优先使用,再用视觉操作补上无法连接的部分。机会在于不必更换所有旧系统,也能连接原本断开的工作环节。
模型能力开始与数据接入和运行基础设施结合
9月10日发布的ChatGPT Financial Services尝试把金融数据与文档工作,连接到企业模板和管理控制。数据分析产品则连接获准使用的数据与业务背景。这说明高性能模型本身并不足够,访问能力与结果验证也必须到位。23
Agents API公开测试版提供上下文管理、工具执行和多智能体协调的运行基础设施。如果企业不必分别搭建持久运行环境,把模型进步转化为付费任务的成本就可能下降。公开测试和功能说明可以确认,但所有客户的总支出与部署回报仍需另行验证。5
较早形成重复使用的市场,可能并不是所有办公岗位的完全无人化。资料比较、销售准备、定期报告、费用核对等边界清晰且结果可检查的任务,更可能先进入日常流程。付款、具有约束力的合同以及人事决策,因错误损失更大,应保留适当的人工授权。
一句简短指令,背后可能是长链条计算
“比较三家供应商,准备下一次会议资料”只有一句话。但执行时需要查找邮件和报价、统一交易条件、制作表格、核对数据与来源、套用公司模板。发现缺失信息后,还可能重新运行其中部分步骤。
最终回答很短,并不意味着模型调用很少。检索材料、工具返回值、中间检查和修改都会消耗令牌。令牌是模型处理输入与输出的单位,不是用户提问次数或句子数量。
Anthropic在2025年6月表示,在其自身研究系统的数据中,智能体通常使用约为普通对话4倍的令牌,多智能体系统约为15倍。这是特定公司和系统的比较,并非企业工作通用的倍数。但它提供了一个实际机制:当对话变成可执行的任务时,消耗强度可能明显提高。6
可持续增长不应来自低效地反复做同一件事,而应来自原本因准备成本过高而没有开展的工作,例如更多客户定制方案、更频繁的库存核对或更全面的竞争研究。单纯增加失败重试,不能证明客户愿意长期付费。
实际委托频率,比办公人口总量更重要
月度令牌=目标员工数×实际使用比例×每位活跃用户每天委托任务数×工作日数×每项任务累计令牌。
每项任务的累计量包括所有模型调用的输入和输出、重试及检查,也包括额外智能体产生的调用。此后再乘智能体数量或重试倍数,会重复计算。
以下敏感性分析固定为同一家拥有1,000名员工的组织,每月22个工作日。所有数字都是假设,不是客户观测值,也不是2027年的市场预测。
| 替代使用状态 | 活跃比例 | 每日使用 | 每次对话或任务累计令牌 | 月度总量 | 相对对话基准 |
|---|---|---|---|---|---|
| 对话基准 | 20% | 10次提问 | 2,000 | 8,800万 | 1.0倍 |
| 有限委托 | 30% | 1项任务 | 20,000 | 1.32亿 | 1.5倍 |
| 常规委托 | 50% | 3项任务 | 40,000 | 13.2亿 | 15.0倍 |
| 广泛委托 | 70% | 5项任务 | 80,000 | 61.6亿 | 70.0倍 |
基准计算为1,000×20%×10×22×2,000=88,000,000令牌。常规委托为1,000×50%×3×22×40,000=1,320,000,000。各行代表相互替代的状态,不是应全部加到基准之上的新增需求。一次对话与一项完成的工作,产出也并不相同。
15倍不是依靠用户数量增加15倍,而是活跃用户增加2.5倍,同时每人每日令牌由2万增至12万,即6倍。反过来,如果采用仅停留在每天做一次摘要,增长幅度就会小得多。
非开发人员更多,并不能直接证明其需求何时超过编程。采用率、委托频率和单任务强度都必须达到一定水平。分类时还要避免把业务用户生成的代码、开发者完成的文档工作重复统计。
每项任务0.56美元的例子,说明的是经济门槛
Astra Standard公开API价格为每百万输入令牌10美元、每百万输出令牌50美元。假设一项不使用缓存的任务累计消耗36,000个输入令牌和4,000个输出令牌。1
模型费用=36,000÷1,000,000×10美元+4,000÷1,000,000×50美元=0.56美元。
4,000个输出令牌是全部调用中计费输出的总量,不是最终报告长度。如果推理令牌作为输出计费,也必须计入。缓存、更便宜模型的分流和额外工具费用都会改变真实账单。
常规委托情景产生500位用户×3项任务×22天=每月33,000项任务。按上述成本计算,月模型费用为18,480美元,每位活跃用户36.96美元。浏览器运行、数据许可、系统集成、安全、培训和故障处理均未包含。
委托净收益=已实现的人力节省或新增商业价值-模型和工具费用-人工检查与返工-错误损失-分摊的运营与集成费用。
假设一项低风险、产出等价的工作由人完成需要30分钟,每小时经济价值50美元,原成本为25美元。使用AI后检查需要5分钟,失败的20%任务全部重做,则期望返工时间为6分钟。人工成本约9.17美元,加模型费用后约9.73美元,留下约15.27美元来覆盖其他费用与错误损失。80%的成功率只是此例假设,并非来自评测分数。
如果检查需要25分钟,同样条件下成本升至约26.39美元。推理便宜也无法挽救任务经济性。节省时间更不自动等于工资现金支出下降,必须通过人员重新配置、增加产出或避免追加招聘才能实现。
因此,长时间执行能力最重要的指标,不是智能体可以持续运行多久,而是每项完成任务还需要多少人工干预时间。
令牌、账单、计算和存储不是同一个量
把15倍令牌直接换成15倍半导体需求,会跳过多次转换。
| 指标 | 衡量内容 | 与令牌增长偏离的原因 |
|---|---|---|
| 逻辑令牌 | 全部调用的输入输出 | 重复使用的输入也可能计入总量 |
| 真实账单 | 按输入、缓存、输出价格计算的支出 | 折扣、订阅、小模型改变实现价格 |
| 物理计算 | 实际执行的运算 | 架构、模型大小、复用和效率不同 |
| 内存与存储 | 模型、工作状态和资料的容量与带宽 | 取决于并发、上下文长度、保留时间和存储层次 |
固定任务构成作示例,逻辑令牌增加15倍,而每令牌计算量下降80%,则计算需求是3倍;若每令牌下降95%,则需求是0.75倍。计算分别为15×0.20与15×0.05。这是敏感性演示,不是工程进步预测。
更低成本可以带来更多使用,但不保证总支出增长。其他条件相同时,数量增长必须足以抵消单价下降。价格降低后新增的工作,与原有任务所需计算量下降,需要同时考虑。
并发也应单独观察。同样的日使用量,如果集中在上班时段,会要求更大容量;把容忍延迟的工作安排到夜间批处理,则可能提高现有设备利用率,推迟新建投资。智能体数量乘以24小时,并不会自动产生新需求。
存储投资应看层次分工,而不只是HBM
AI除了保存模型权重,还会保留此前上下文的中间计算结果。可复用的注意力状态通常称为KV缓存。长时间任务和大量并发用户,可能提高保存位置与读取速度的重要性。
但并非所有状态都必须一直放在昂贵的高带宽内存HBM里。英伟达2026年3月公布的STX与CMX,提出额外的上下文存储层,既扩展可访问上下文,也提高现有GPU使用效率。厂商的性能数字取决于具体配置,不等于全行业的实测效率提升。7
HyMCache研究7月首次提交,8月修订后标题为A CXL Memory Rack for Multi-Turn LLM Serving,探索通过DRAM与SSD组合保存可复用状态。其中一项比较以部分性能损失换取大幅减少DRAM。它是研究结果,不是大规模商用证明,但足以反驳令牌与某一种存储产品必然同比增长的简单推断。8
对韩国投资者有意义的假设,不是HBM消失与HBM必然暴增之间二选一,而是高速HBM、服务器DRAM和大容量企业级SSD如何分工,以及供应商如何在各层获取利润。令牌量也不等于存档文档量:反复读取同一资料,会增加逻辑令牌,却未必增加原始数据存储。
韩国上市公司有四种不同的利润传导路径
下面是按业务关联度组织的研究顺序,不是考虑当前股价后的买入排名。
| 公司 | 办公智能体需求关联 | 利润兑现需要验证 | 削弱论点的条件 |
|---|---|---|---|
| SK海力士(000660) | HBM、服务器DRAM、企业级SSD | 产品销量、均价、高端占比及投资后现金流 | 客户效率抵消数量增长,或供给扩张压低价格 |
| 三星电子(005930) | 三种存储产品的广泛覆盖 | 客户量产、良率、产品组合及其他业务损益 | 技术进步无法转成盈利量产,其他业务亏损扩大 |
| LS ELECTRIC(010120) | 数据中心配电和电力设备 | 签约订单、交付、订单转收入、项目利润和回款 | 只提高现有设备利用率,新建延误或取消 |
| 三星SDS(018260) | 企业数据集成、智能体运行与管控、工作平台 | 付费重复使用、续约、扣除模型成本后利润、外部客户 | 模型转售和集成人工吸收新增收入 |
SK海力士:关注HBM以外的增长,也保留周期判断
SK海力士8月26日的产品介绍同时展示了HBM、服务器DRAM和企业级SSD。这意味着面对更细分的存储层次,企业拥有多个参与途径。但展示一款产品,不代表所有产品会在同一时期贡献同等规模收入。9
应追踪产品级数量与价格,而非只看被冠以AI名称的收入总额。HBM增长时,如果服务器DRAM或NAND价格转弱,整体结果仍会不同。经营现金流也需要扣除资本支出与营运资金需求后再判断。
它是这条投资论点的直接研究对象,但直接受益不等于低估。如果供给优势已经充分反映在预期中,行业景气也可能对应较低股票回报。
三星电子:广泛覆盖与业务抵消同时存在
三星在7月30日公布二季度业绩时,把下半年智能体AI发展与服务器DRAM、企业级SSD及HBM需求联系起来。这证明供应商也在提出类似的需求假设,但它仍是管理层展望,而非对未来供需的独立验证。10
多种存储产品提供不同增长通道,但股东利润取决于客户认证后的盈利量产、良率和产品组合。其他半导体与消费产品业务,也会影响合并结果。
因此,不应把Astra发布直接加到盈利模型中。先要判断已有AI支出预期之外到底增加多少需求,再看它改变销量、价格还是利润率。对既有订单的新叙事,不是新增利润。
LS ELECTRIC:投资订单和建设,而非每个令牌的收费权
8月24日,LS ELECTRIC公布北美AI数据中心电力设备合同扩额,修订后总额约2,309亿韩元。这是调整后的合同总额,不是可全额叠加在原订单上的新增金额。数据中心业务联系有实际合同支持,但该合同早于Astra发布,不能归因于Astra。11
如果办公推理只是提高现有基础设施利用率,新的电力设备订单不会立即增加。持续需求必须转化为获得融资、能够接入电力的建设。高融资成本和工程延期,可以与有利的长期需求前景并存。
验证顺序是新订单、在手订单转化为收入、项目利润、现金回款。若把企业当成每处理一个令牌就收取一次费用的商业模式,会忽略设备行业的时间差和执行风险。
三星SDS:承担运行责任比转售模型更重要
三星SDS将FabriX描述为连接多个模型与企业系统,并支持智能体创建、运行和治理的平台。Brity Copilot则把AI接入邮件与会议。企业数据、访问权限和运行责任,使其可能参与办公AI普及。1213
与此同时,前沿模型厂商也直接扩展企业产品和数据连接。简单的聊天窗口或模型访问权转售,可能遭遇价格竞争。更有防御力的业务,可能是处理旧系统例外、权限、审计记录和故障,并获得反复续约。25
付费使用增加,不保证股东利润增加;如果模型成本和集成人工增长更快,利润反而承压。投资者需要外部客户的重复合同、部署后的留存,以及扣除推理成本的利润率。本文核查的产品资料,不足以推算独立AI业务的利润率。
行业判断正确,股票仍可能下跌
股价变化倍数=每股收益变化倍数×估值倍数变化。
如果每股收益增长30%,市盈率却从20倍降至15倍,则股价为1.30×15÷20=原来的0.975倍,下跌2.5%。这是计算示例,不是任何列举公司的当前估值,并假定收益口径和预测期间一致。
不能把存储行业最好季度的利润乘以四,就视为永久盈利能力。应考虑供给增长、价格正常化、折旧、投资和现金流。设备合同总额不是即时利润,软件收入也应扣除转售成本。
本文并非逐只股票核实当日价格与市场盈利预测的完整估值报告,因此不编造目标价或买入价。实际买入需要反推当前企业价值隐含的增长,再判断新增订单与重复使用能否超过这些预期。
优先研究存储供应商的理由,是不用押注某个办公应用获胜,也能参与多个模型的普及。但模型客户的多元化,不等于存储周期风险分散。同时持有韩国两大厂商,仍面临共同的AI资本支出与存储价格风险。
从2026年第四季度开始,看重复使用和人工介入
观察窗口设为2026年第四季度与2027年第一季度。这是研究安排,不是保证采用将在该时段发生的预测。
| 观察对象 | 强化论点的证据 | 应下调判断的证据 |
|---|---|---|
| 非开发岗位付费使用 | 同一采用群体中,重复任务和付费使用持续增加 | 新账户增加,但试用后活跃下降 |
| 单任务经济性 | 每项完成工作需要的检查与返工减少 | 验证时间接近原本手工完成时间 |
| 实际基础设施负荷 | 缓存与模型分流之后,计算或上下文存储需求仍增加 | 逻辑令牌增长,物理资源使用停滞 |
| 韩国存储企业 | 意外新增订单改变产品销量、价格与利润 | 老订单换标签,库存上升、价格下跌 |
| 电力设备与企业软件 | 订单转现金、续约与利润率改善 | 建设延期、低利润转售、一次性实施占主导 |
如果两个季度后仍无法证明非开发岗位反复使用及单任务经济性,就应推迟“下一轮需求即将到来”的时间判断。如果采用增加,但效率改进抵消硬件需求,软件采用论点可以保留,半导体受益强度则应降低。安全事故导致权限收缩,或长期依赖人工救场,也都是重要反证。
Astra可能扩大的,是完成任务的市场,而非更长回答的市场。韩国股票的买入依据,出现在这种可能性形成反复支出,并兑现为超出股价既有预期的企业现金流时。
资料核查截至2026年9月11日。产品及公司披露属于发布方陈述,与独立生产环境验证相区分。令牌、成本和股价敏感性均为作者假设示例,不构成针对个人情况的投资建议。
来源
OpenAI, GPT-6 Astra,2026年9月;评测条件与Standard API价格。 ↩︎ ↩︎ ↩︎
OpenAI, ChatGPT Financial Services,2026年9月10日。 ↩︎ ↩︎ ↩︎
OpenAI, Put data to work,2026年9月10日。 ↩︎ ↩︎
Bai等, How Do AI Agents Spend Your Money?,首次提交2026年4月24日,4月29日修订。采用摘要证据,不外推全部办公任务。 ↩︎
OpenAI, Agents API,2026年9月10日。 ↩︎ ↩︎
Anthropic, How we built our multi-agent research system,2025年6月13日。 ↩︎
NVIDIA, BlueField-4 STX,2026年3月16日。 ↩︎
Jang等, A CXL Memory Rack for Multi-Turn LLM Serving,首次提交7月20日,v3为2026年8月5日。研究不等于商业采用。 ↩︎
Samsung, 2026年第二季度业绩,2026年7月30日。 ↩︎