<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Kimi Delta Attention on Korea Invest Insights</title><link>https://koreainvestinsights.com/ko/tags/kimi-delta-attention/</link><description>Recent content in Kimi Delta Attention on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>ko</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Fri, 17 Jul 2026 13:54:01 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/ko/tags/kimi-delta-attention/feed.xml" rel="self" type="application/rss+xml"/><item><title>Kimi K3가 바꾼 AI 가격표: Kimi Linear부터 HBM·빅테크 전략까지</title><link>https://koreainvestinsights.com/ko/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</link><pubDate>Fri, 17 Jul 2026 12:31:36 +0900</pubDate><guid>https://koreainvestinsights.com/ko/post/kimi-k3-linear-api-pricing-semiconductor-big-tech-impact-2026-07-17/</guid><description>&lt;p&gt;2026년 7월 16일 공개된 Kimi K3의 API 가격은 입력 100만 토큰당 3달러, 출력 15달러다. 중국 모델이 시장에 들어올 때 익숙했던 초저가 전략이 아니다. Claude Sonnet 5의 정상가와 같고, GPT-5.6 Sol보다는 입력 40%, 출력 50% 낮다. 문샷AI는 K3를 절약용 보조 모델이 아니라 기업의 주력 호출을 받는 프런티어 모델로 내놓았다.&lt;/p&gt;
&lt;p&gt;모델 구조는 가격 전략을 뒷받침한다. 총 파라미터는 2.8조개지만 토큰마다 896개 전문가 가운데 16개만 활성화한다. 긴 문맥에서는 Kimi Delta Attention(KDA)이 KV 캐시 증가를 억제하고, Attention Residuals(AttnRes)는 깊은 층에서 앞선 표현을 골라 불러온다. 학습 단계부터 MXFP4 가중치와 MXFP8 활성값을 적용했다. 문샷AI가 64개 이상 가속기를 묶은 슈퍼노드를 권장한다는 사실까지 놓으면 결론은 한 방향이 아니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;토큰 하나에 필요한 메모리와 연산은 줄지만, 배포 가능한 프런티어 모델의 수와 사용량은 늘 수 있다.&lt;/strong&gt; K3는 반도체 수요를 없애는 효율화 기술이면서 동시에 더 많은 기관이 대형 모델을 직접 돌리게 만드는 인프라 수요다.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;연결해서 읽을 글: &lt;a class="link" href="https://koreainvestinsights.com/ko/post/ai-token-value-memory-value-added-2026-07-09/" &gt;AI 토큰 가치와 메모리 부가가치&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/ko/post/ai-token-futures-cost-per-token-korea-semiconductor-thesis-2026-05-30/" &gt;AI 토큰 선물과 토큰당 비용&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/ko/post/us-china-agentic-inference-stack-sram-opportunity-2026-07-09/" &gt;미국과 중국의 에이전트 추론 인프라 분화&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/ko/post/hbm-2030-supply-demand-267eb-demand-model-crosscheck-2026-07-13/" &gt;2030년 HBM 수급 모델 교차검증&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/ko/page/korea-semiconductor-hbm-kospi-hub/" &gt;AI HBM 허브&lt;/a&gt; / &lt;a class="link" href="https://koreainvestinsights.com/ko/page/exclusive-analysis-hub/" &gt;단독 분석 허브&lt;/a&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="tldr"&gt;TL;DR
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;K3는 2.8조 파라미터, 네이티브 비전, 100만 토큰 문맥을 내세웠다. 다만 7월 17일 현재 API와 제품은 열렸지만 전체 가중치와 기술 보고서, 라이선스는 아직 나오지 않았다. 진정한 오픈웨이트 확산은 7월 27일 이후 검증해야 한다.&lt;/li&gt;
&lt;li&gt;문샷AI 공식값은 GDPval-AA v2 1,668점, AA-Briefcase 1,548점이다. BrowseComp 91.2점은 문맥 압축을 쓴 결과이고, 100만 토큰을 압축 없이 쓴 값은 90.4점이다. 강한 결과지만 평가 도구가 모델마다 다르고 일부 값은 자체 측정이라 외부 재현이 필요하다.&lt;/li&gt;
&lt;li&gt;Kimi Linear 논문의 75% KV 캐시 절감과 100만 토큰에서 최대 6.3배 디코딩 처리량은 48B 연구 모델의 결과다. 이를 K3의 실측 성능으로 그대로 옮기면 안 된다. K3가 KDA를 쓴다는 사실과 Kimi Linear의 연구 결과는 연결되지만 같은 숫자는 아니다.&lt;/li&gt;
&lt;li&gt;K3의 가격은 저가 공세가 아니다. Sonnet 5 정상가와 같고, 현재 Sonnet 5 출시 할인보다 50% 비싸며, GPT-5.6 Sol보다는 낮다. 최대 추론 강도가 고정돼 있고 독립 평가에서 출력 토큰이 많은 편이어서 실제 작업당 비용은 표면 가격보다 높아질 수 있다.&lt;/li&gt;
&lt;li&gt;반도체 영향은 단기적으로 NVIDIA와 HBM의 효율 우려, 중기적으로 가속기·네트워크·HBM·서버 DRAM·eSSD의 배포량 증가가 맞선다. 가장 선명한 2차 수혜는 장기 에이전트의 캐시를 받는 서버 DRAM과 엔터프라이즈 SSD다.&lt;/li&gt;
&lt;li&gt;미국 빅테크에는 모델 계층과 클라우드 계층의 효과가 반대다. OpenAI·Anthropic·Gemini API는 가격 압력을 받지만 Azure·AWS·Google Cloud는 K3를 포함한 다중 모델 사용량에서 매출을 얻을 수 있다. Meta는 미국 오픈웨이트 주도권을 방어해야 한다.&lt;/li&gt;
&lt;li&gt;7월 27일 확인할 것은 가중치 파일 하나가 아니다. 라이선스, 외부 벤치마크, NVIDIA·AMD·중국 가속기별 처리량, 실제 작업당 출력 토큰, vLLM 호환성, 클라우드 등록 여부가 주가 방향을 가른다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img alt="Kimi K3 가격 전략과 AI 인프라 영향 지도" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://koreainvestinsights.com/images/posts/kimi-k3-pricing-infrastructure-impact-2026-07-17.png"&gt;
&lt;/p&gt;
&lt;h2 id="1-먼저-바로잡아야-할-수치"&gt;1. 먼저 바로잡아야 할 수치
&lt;/h2&gt;&lt;p&gt;공식 발표와 2차 전파 과정에서 숫자가 조금씩 달라졌다. 투자 판단에 영향을 주는 차이는 아래와 같다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;항목&lt;/th&gt;
 &lt;th style="text-align: right"&gt;공식 확인값&lt;/th&gt;
 &lt;th&gt;해석&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;총 파라미터&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2.8조&lt;/td&gt;
 &lt;td&gt;총 모델 크기다. 토큰당 실제 활성량과 같지 않다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;전문가 구조&lt;/td&gt;
 &lt;td style="text-align: right"&gt;896개 중 16개 활성&lt;/td&gt;
 &lt;td&gt;매우 희소한 MoE다. 통신과 라우팅이 중요해진다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;문맥 길이&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100만 토큰&lt;/td&gt;
 &lt;td&gt;긴 코드베이스·조사 작업에 유리하지만 실제 비용은 출력량과 캐시 적중률에 좌우된다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GDPval-AA v2&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1,668&lt;/td&gt;
 &lt;td&gt;사용자 입력의 1,687이 아니라 공식표는 1,668이다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AA-Briefcase&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1,548&lt;/td&gt;
 &lt;td&gt;GPT-5.6 Sol 1,495보다 높고 Claude Fable 5 1,583보다 낮다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp&lt;/td&gt;
 &lt;td style="text-align: right"&gt;91.2&lt;/td&gt;
 &lt;td&gt;30만 토큰에서 문맥 압축을 시작한 결과다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;BrowseComp 무압축&lt;/td&gt;
 &lt;td style="text-align: right"&gt;90.4&lt;/td&gt;
 &lt;td&gt;100만 토큰 문맥을 별도 관리 없이 쓴 값이다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;출시 상태&lt;/td&gt;
 &lt;td style="text-align: right"&gt;Kimi.com·Work·Code·API 사용 가능&lt;/td&gt;
 &lt;td&gt;제품은 이미 열렸다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;가중치&lt;/td&gt;
 &lt;td style="text-align: right"&gt;7월 27일까지 공개 예고&lt;/td&gt;
 &lt;td&gt;7월 17일 현재 라이선스와 전체 파일은 미확인이다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;추론 강도&lt;/td&gt;
 &lt;td style="text-align: right"&gt;현재 &lt;code&gt;max&lt;/code&gt;만 지원&lt;/td&gt;
 &lt;td&gt;낮은 비용 모드가 아직 없어 작업당 비용이 커질 수 있다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;문샷AI는 K3가 Claude Fable 5와 GPT-5.6 Sol의 전체 사용자 경험에는 아직 미치지 못한다고 직접 적었다. 동시에 코딩, 지식노동, 시각 이해의 여러 평가에서 나머지 비교 모델을 앞섰다고 주장한다. 이 표현은 과장과 겸손을 섞은 마케팅 문구가 아니라 현재 위치를 비교적 정확히 보여준다. 최고점 두 모델과의 격차는 남았지만, 바로 아래 성능대에 중국 모델이 들어왔다는 주장이다.&lt;/p&gt;
&lt;p&gt;평가 방식은 조심해서 읽어야 한다. 공식표의 K3 결과는 최대 추론 강도로 측정됐다. 과제에 따라 Kimi Code, Claude Code, Codex 등 서로 다른 에이전트 도구를 썼고, 다른 모델의 점수는 각 도구에서 가장 잘 나온 값이나 외부 리더보드 값을 가져온 경우가 있다. 같은 시험지와 같은 실행기에서 한 번에 측정한 단일 대회가 아니다.&lt;/p&gt;
&lt;p&gt;그래도 신호는 충분히 강하다. Terminal-Bench 2.1 88.3, FrontierSWE 81.2, SWE Marathon 42.0, AutomationBench 30.8, GPQA-Diamond 93.5, MMMU-Pro 81.6은 K3가 긴 도구 사용과 코딩을 겨냥했다는 점을 뒷받침한다. K3는 프런티어 바로 아래 성능을 100만 토큰과 오픈웨이트 예정 구조로 묶었다.&lt;/p&gt;
&lt;h2 id="2-28조-파라미터는-왜-가능한가"&gt;2. 2.8조 파라미터는 왜 가능한가
&lt;/h2&gt;&lt;h3 id="21-총량과-활성량을-분리해야-한다"&gt;2.1 총량과 활성량을 분리해야 한다
&lt;/h3&gt;&lt;p&gt;2.8조 파라미터를 전부 매 토큰마다 계산하면 비용이 감당하기 어렵다. K3는 Stable LatentMoE와 결합해 896개 전문가 가운데 16개를 활성화한다. 전체 전문가의 약 1.8%다. 정확한 활성 파라미터 수는 기술 보고서가 나와야 알 수 있지만, 총량 2.8조가 곧 토큰당 2.8조 연산을 뜻하지 않는다는 점은 분명하다.&lt;/p&gt;
&lt;p&gt;희소 MoE는 계산을 아끼는 대신 다른 비용을 만든다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;절감되는 것&lt;/th&gt;
 &lt;th&gt;새로 커지는 병목&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;토큰당 활성 연산&lt;/td&gt;
 &lt;td&gt;전문가 라우팅의 정확도&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;동일 품질에 필요한 계산량&lt;/td&gt;
 &lt;td&gt;전문가가 여러 가속기에 흩어질 때의 통신&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;일부 추론 비용&lt;/td&gt;
 &lt;td&gt;전문가 편중과 가속기 유휴시간&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;모델 확장 비용&lt;/td&gt;
 &lt;td&gt;가중치 전체를 올려둘 메모리와 노드 관리&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;문샷AI가 64개 이상 가속기를 묶은 슈퍼노드를 권장한 이유가 여기에 있다. 전문가를 적게 켜더라도 어느 전문가가 선택될지 모르기 때문에 가중치 전체는 빠르게 접근 가능한 곳에 있어야 한다. MXFP4로 단순 환산하면 2.8조 가중치의 이론적 최소 저장량은 약 1.4TB다. 실제 배포에는 스케일 값, 메타데이터, 캐시, 중복 저장, 통신 버퍼가 추가된다. 희소 활성화는 연산량을 줄이지만 모델 상주 메모리와 가속기 간 연결을 없애지 않는다.&lt;/p&gt;
&lt;h3 id="22-kimi-linear가-푸는-것은-문맥-길이의-비용이다"&gt;2.2 Kimi Linear가 푸는 것은 문맥 길이의 비용이다
&lt;/h3&gt;&lt;p&gt;Kimi Linear 논문은 K3 공개보다 앞서 나온 연구다. 논문의 연구 모델은 총 48B, 활성 3B 규모이며 K3 자체가 아니다. 구조는 Kimi Delta Attention과 전통적인 전체 어텐션을 3대 1로 섞는다.&lt;/p&gt;
&lt;p&gt;전체 어텐션은 과거 토큰을 세밀하게 다시 찾는 데 강하지만 문맥이 길어질수록 KV 캐시가 커진다. 선형 어텐션은 과거 정보를 고정 크기 상태로 압축해 문맥 길이에 따른 메모리 증가를 줄인다. 그러나 정확한 복사, 특정 위치 검색, 세밀한 회상에는 약해질 수 있다. Kimi Linear는 선형층 세 개 뒤에 전체 어텐션층 하나를 두어 두 장점을 절충한다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;기술&lt;/th&gt;
 &lt;th&gt;맡는 역할&lt;/th&gt;
 &lt;th&gt;한계&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;KDA&lt;/td&gt;
 &lt;td&gt;긴 문맥을 고정 크기 상태로 압축해 KV 캐시 증가를 억제&lt;/td&gt;
 &lt;td&gt;정확한 복사와 세밀한 검색에서 손실 가능&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;전체 MLA&lt;/td&gt;
 &lt;td&gt;필요한 구간에서 토큰 간 정밀 비교와 회상을 보완&lt;/td&gt;
 &lt;td&gt;문맥 길이에 따라 캐시 비용 증가&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;3:1 하이브리드&lt;/td&gt;
 &lt;td&gt;효율과 표현력을 절충&lt;/td&gt;
 &lt;td&gt;시스템 구현과 커널 최적화가 복잡해짐&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;논문은 최대 75% KV 캐시 절감, 100만 토큰에서 최대 6.3배의 이론적 디코딩 처리량을 제시한다. 복잡도 분석 구간의 실측 비교에서는 2.3배 속도 향상도 보고한다. 이 숫자는 연구 모델과 특정 시스템 조건의 결과다. K3가 KDA를 채택했다고 해서 K3 API가 언제나 6.3배 빠르다고 말할 수는 없다.&lt;/p&gt;
&lt;p&gt;투자자에게 중요한 변화는 방향이다. 긴 문맥을 쓸 때 HBM 안에 보관해야 하는 요청별 KV 캐시가 줄면 같은 가속기로 더 많은 동시 요청을 처리할 수 있다. 반대로 문맥 비용이 내려가면 기업은 더 긴 코드, 더 많은 문서, 더 오래 지속되는 에이전트를 사용한다. 토큰당 메모리는 줄고 총 토큰은 늘 수 있다.&lt;/p&gt;
&lt;h3 id="23-attention-residuals는-깊이의-정보-손실을-줄인다"&gt;2.3 Attention Residuals는 깊이의 정보 손실을 줄인다
&lt;/h3&gt;&lt;p&gt;일반적인 잔차 연결은 모든 이전 층의 출력을 계속 더한다. 층이 깊어질수록 오래된 표현과 최근 표현이 균일하게 섞여 중요한 정보가 희석될 수 있다. AttnRes는 현재 층이 앞선 표현 가운데 필요한 것을 골라 가져오게 한다.&lt;/p&gt;
&lt;p&gt;모든 층을 그대로 보관하면 메모리가 커진다. Block AttnRes는 여러 층을 블록으로 묶고 블록 단위 표현만 남긴다. 공식 연구는 약 8개 블록으로 대부분의 성능 개선을 회수하고, 기준 모델이 1.25배 계산량을 쓴 것과 비슷한 스케일링 효율을 얻었다고 보고한다.&lt;/p&gt;
&lt;p&gt;이 기술은 HBM 수요를 직접 줄이는 기능이라기보다 같은 학습 계산에서 더 많은 성능을 얻는 기능이다. 모델 학습의 자본 효율은 좋아진다. 하지만 성능 개선이 다시 더 큰 모델과 더 긴 작업으로 재투자되면 데이터센터 총수요는 줄지 않는다.&lt;/p&gt;
&lt;h3 id="24-양자화는-중국산-칩-하나를-위한-기술이-아니다"&gt;2.4 양자화는 중국산 칩 하나를 위한 기술이 아니다
&lt;/h3&gt;&lt;p&gt;K3는 지도학습 미세조정 단계부터 MXFP4 가중치와 MXFP8 활성값을 넣는 양자화 인지 학습을 적용했다. 배포 후 급하게 4비트로 줄이는 방식보다 정확도 손실을 통제하기 쉽고, 서로 다른 하드웨어에서 같은 수치 형식을 지원할 여지가 커진다.&lt;/p&gt;
&lt;p&gt;공식 발표의 커널 아레나는 NVIDIA H200과 “다른 공급자의 범용 GPU”를 포함한다. 공식 문서가 특정 중국산 칩 이름을 밝히지는 않았다. 따라서 K3가 어느 중국 가속기에서 H200과 같은 효율을 냈다고 단정하면 안 된다. 확인된 사실은 문샷AI가 비NVIDIA 하드웨어의 커널 최적화 능력까지 같은 시험에 넣었다는 것이다.&lt;/p&gt;
&lt;p&gt;그 자체로 전략은 분명하다. 중국의 프런티어급 모델은 NVIDIA가 부족해도 배포할 수 있어야 한다. 미국·유럽·중동의 사용자는 NVIDIA, AMD, 자체 가속기 가운데 비용이 낮은 곳을 선택하고 싶어 한다. K3는 모델을 특정 칩에 고정하기보다 여러 하드웨어가 경쟁할 수 있는 상태를 목표로 한다.&lt;/p&gt;
&lt;h2 id="3-가격표가-말하는-문샷ai의-자리"&gt;3. 가격표가 말하는 문샷AI의 자리
&lt;/h2&gt;&lt;h3 id="31-k3는-저가-대체재가-아니다"&gt;3.1 K3는 저가 대체재가 아니다
&lt;/h3&gt;&lt;p&gt;2026년 7월 17일 공개 가격을 같은 단위로 놓으면 다음과 같다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;모델&lt;/th&gt;
 &lt;th style="text-align: right"&gt;캐시 입력 100만 토큰&lt;/th&gt;
 &lt;th style="text-align: right"&gt;일반 입력&lt;/th&gt;
 &lt;th style="text-align: right"&gt;출력&lt;/th&gt;
 &lt;th&gt;현재 해석&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Kimi K3&lt;/td&gt;
 &lt;td style="text-align: right"&gt;0.30달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;15달러&lt;/td&gt;
 &lt;td&gt;프런티어 주력 모델 가격&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 출시 할인&lt;/td&gt;
 &lt;td style="text-align: right"&gt;별도 조건&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;10달러&lt;/td&gt;
 &lt;td&gt;8월 31일까지 한시 할인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Claude Sonnet 5 정상가&lt;/td&gt;
 &lt;td style="text-align: right"&gt;별도 조건&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;15달러&lt;/td&gt;
 &lt;td&gt;K3와 같은 기본 가격&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
 &lt;td style="text-align: right"&gt;0.50달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;5달러&lt;/td&gt;
 &lt;td style="text-align: right"&gt;30달러&lt;/td&gt;
 &lt;td&gt;K3보다 입력 67%, 출력 100% 비쌈&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;K3는 Sonnet 5의 한시 할인보다 비싸다. “동급 성능을 절반 가격에 제공한다”는 설명은 GPT-5.6 Sol과 비교한 출력 가격에는 맞지만 전체 경쟁 구도에는 맞지 않는다. 더 정확한 해석은 &lt;strong&gt;Sonnet의 정상가에 맞추고, 가장 비싼 프런티어 모델보다 낮게 책정했다&lt;/strong&gt;는 것이다.&lt;/p&gt;
&lt;p&gt;가격은 자신감의 표시이면서 수익화 장치다. 직전 세대처럼 싸게 사용자를 모으는 대신, 성능 비교표에서 프런티어 층에 들어온 만큼 단가도 올렸다. 문샷AI가 노리는 자리는 실패해도 싼 보조 모델이 아니라 기업 호출의 기본값이다.&lt;/p&gt;
&lt;h3 id="32-토큰-가격보다-작업-한-건의-비용을-봐야-한다"&gt;3.2 토큰 가격보다 작업 한 건의 비용을 봐야 한다
&lt;/h3&gt;&lt;p&gt;API 가격표는 토큰 수가 같다는 가정에서만 비교된다. 에이전트는 모델에 따라 계획 길이, 도구 호출 횟수, 재시도, 출력 verbosity가 다르다. K3는 현재 최대 추론 강도가 고정돼 있다. 독립 평가업체 Artificial Analysis의 K3 측정에서는 지능 지수 평가에 사용한 출력 토큰이 1억3,000만개로 동급 중앙값 6,300만개의 두 배를 넘었다. 같은 일을 더 길게 푼다면 출력 단가가 낮아도 작업당 비용은 높을 수 있다.&lt;/p&gt;
&lt;p&gt;간단한 식은 다음과 같다.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;작업당 비용 = 입력 토큰 × 입력 단가 + 출력 토큰 × 출력 단가 + 도구·재시도 비용&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;예를 들어 두 모델의 출력 단가가 2배 차이 나더라도 싼 모델이 출력 토큰을 2배 쓰고 재시도를 더 많이 하면 절감은 사라진다. 기업 구매자는 벤치마크 점수보다 다음 지표를 본다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;운영 지표&lt;/th&gt;
 &lt;th&gt;왜 중요한가&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;작업 성공률&lt;/td&gt;
 &lt;td&gt;실패한 싼 호출은 다시 실행해야 한다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;작업당 출력 토큰&lt;/td&gt;
 &lt;td&gt;출력은 입력보다 비싸다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;첫 토큰 지연과 처리속도&lt;/td&gt;
 &lt;td&gt;에이전트 병렬 실행 수와 사용자 경험을 결정한다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;도구 호출 성공률&lt;/td&gt;
 &lt;td&gt;긴 작업에서 작은 오류가 전체 비용을 키운다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;캐시 적중률&lt;/td&gt;
 &lt;td&gt;K3는 캐시 입력이 일반 입력의 10분의 1 가격이다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;중간 전환 안정성&lt;/td&gt;
 &lt;td&gt;K3는 사고 이력을 보존하지 않으면 품질이 불안정할 수 있다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;문샷AI는 Mooncake 기반 공식 API에서 코딩 작업의 캐시 적중률이 90%를 넘는다고 주장한다. 반복되는 코드베이스와 시스템 프롬프트를 캐시에 올리면 입력 단가는 크게 낮아진다. 이 주장이 실제 기업 트래픽에서도 재현되면 K3 가격 경쟁력은 표면 가격보다 좋아진다.&lt;/p&gt;
&lt;h3 id="33-mooncake는-메모리와-스토리지-수요의-위치를-바꾼다"&gt;3.3 Mooncake는 메모리와 스토리지 수요의 위치를 바꾼다
&lt;/h3&gt;&lt;p&gt;Mooncake는 문샷AI의 추론 서빙 구조다. 입력을 처리하는 prefill 클러스터와 토큰을 생성하는 decode 클러스터를 나누고, KV 캐시를 GPU HBM에만 두지 않고 CPU, 서버 DRAM, SSD에 분산한다. 논문은 시뮬레이션에서 최대 525% 처리량, 실제 작업에서 75% 더 많은 요청을 처리했다고 보고한다.&lt;/p&gt;
&lt;p&gt;이 구조는 AI 메모리 수요가 HBM 하나로 끝나지 않는 이유를 보여준다.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;가속기 HBM → 서버 DRAM → 엔터프라이즈 SSD → 원격 캐시 계층&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;KDA가 요청별 KV 캐시를 줄여도 100만 토큰 에이전트가 늘면 캐시의 총량과 보존 기간은 커진다. 자주 쓰는 데이터는 HBM과 DRAM에, 덜 자주 쓰는 데이터는 SSD에 남는다. AI 추론 효율화가 HBM만의 이야기를 약하게 할 수는 있지만, 서버 DRAM과 eSSD를 포함한 메모리 계층 전체의 중요성은 오히려 커진다.&lt;/p&gt;
&lt;h2 id="4-중국-오픈웨이트가-기업의-기본값을-노린다"&gt;4. 중국 오픈웨이트가 기업의 기본값을 노린다
&lt;/h2&gt;&lt;p&gt;K3 하나만 보면 사건의 크기를 놓친다. OpenRouter는 2026년 6월 초 자사 플랫폼에서 중국 모델의 토큰 점유율이 미국 모델을 넘어섰다고 집계했다. 표본은 1월부터 6월 14일까지 450조 토큰이 넘는다. DeepSeek의 점유율은 약 9%에서 18%로 늘었고, 5월 중순 이후 가장 많이 사용된 공급자가 됐다.&lt;/p&gt;
&lt;p&gt;이 흐름은 세 단계로 진행된다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;저가 오픈모델이 테스트, 번역, 분류 같은 하위 작업을 가져간다.&lt;/li&gt;
&lt;li&gt;코딩과 에이전트 성능이 올라가며 기업의 반복 작업을 가져간다.&lt;/li&gt;
&lt;li&gt;프런티어 바로 아래 성능과 100만 토큰 문맥을 확보하면 주력 모델 호출까지 경쟁한다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;K3의 가격은 세 번째 단계에 맞춰져 있다. GLM 계열처럼 극단적으로 싼 가격으로 아래층을 넓히는 전략과 다르다. Sonnet 정상가를 받으면서 가중치를 공개해 클라우드·국가·기업이 직접 운영할 수 있게 하려는 구조다.&lt;/p&gt;
&lt;p&gt;닫힌 API와 오픈웨이트는 서로 다른 자산을 쌓는다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;닫힌 프런티어 API&lt;/th&gt;
 &lt;th&gt;오픈웨이트 프런티어 근접 모델&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;최신 성능과 사용자 경험을 통제&lt;/td&gt;
 &lt;td&gt;배포 경로와 하드웨어 선택이 빠르게 늘어남&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;모델 사용 데이터가 공급자에게 집중&lt;/td&gt;
 &lt;td&gt;기업이 데이터와 운영을 내부에 보관 가능&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;가격과 정책을 중앙에서 변경&lt;/td&gt;
 &lt;td&gt;파일이 공개되면 회수하기 어려움&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;매출총이익을 모델 사업자가 가져감&lt;/td&gt;
 &lt;td&gt;클라우드·칩·응용회사가 가치 일부를 가져감&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;미국의 최상위 모델이 계속 1위를 지켜도 유료 호출의 몫은 줄 수 있다. 기업은 실패 비용이 낮은 반복 작업을 K3 같은 모델에 보내고, 가장 어려운 설계·법률·연구 작업만 최상위 닫힌 모델에 보낼 수 있다. 프런티어 모델의 순위보다 &lt;strong&gt;유료 토큰의 혼합 단가와 호출 비중&lt;/strong&gt;이 손익을 결정한다.&lt;/p&gt;
&lt;h2 id="5-반도체-수요-효율화와-확산이-동시에-온다"&gt;5. 반도체 수요: 효율화와 확산이 동시에 온다
&lt;/h2&gt;&lt;h3 id="51-nvidia-단기-효율-우려-중기-배포량-탄성"&gt;5.1 NVIDIA: 단기 효율 우려, 중기 배포량 탄성
&lt;/h3&gt;&lt;p&gt;K3는 NVIDIA에 두 개의 반대 신호를 준다.&lt;/p&gt;
&lt;p&gt;부정적 신호는 분명하다. 희소 MoE, KDA, 양자화, 커널 자동 최적화는 같은 작업에 필요한 GPU 시간을 줄인다. 대체 가속기에서 커널을 맞추려는 설계는 CUDA의 독점 지위를 약하게 만든다. “프런티어 근접 성능을 더 적은 계산과 여러 칩에서 낼 수 있다”는 문장은 NVIDIA 멀티플에 부담이다.&lt;/p&gt;
&lt;p&gt;긍정적 신호도 크다. 2.8조 파라미터 모델을 직접 돌리려면 64개 이상 가속기 슈퍼노드가 권장된다. 가중치가 공개되면 중국 밖의 클라우드, 정부, 연구소, 대기업이 자체 서빙을 시작할 수 있다. API 한 곳에서 처리되던 수요가 여러 데이터센터의 장비 주문으로 바뀐다.&lt;/p&gt;
&lt;p&gt;NVIDIA 수요를 결정하는 식은 다음에 가깝다.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;총 가속기 수요 = 작업당 GPU 시간 감소 × 전체 작업량 증가 × 자체 배포 기관 수 증가&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;첫 항은 음수, 뒤의 두 항은 양수다. 가격이 내려갈 때 사용량이 얼마나 늘어나는지가 결론을 가른다. K3 한 건만으로 NVIDIA 실적 추정치를 낮출 근거는 부족하다. 다만 GPU 효율 개선이 곧바로 GPU 수요 증가로 이어진다는 단순 강세론도 검증이 필요하다.&lt;/p&gt;
&lt;h3 id="52-amd-하드웨어-선택권이-생길-때의-옵션"&gt;5.2 AMD: 하드웨어 선택권이 생길 때의 옵션
&lt;/h3&gt;&lt;p&gt;AMD에는 상대적으로 긍정적인 구조다. K3가 MXFP4·MXFP8과 vLLM 호환을 통해 여러 가속기에서 돌아가면, 기업은 NVIDIA 외 선택지를 시험할 수 있다. 프런티어 근접 오픈웨이트는 하드웨어 구매자가 특정 모델 공급자와 특정 칩 공급자를 분리할 수 있게 한다.&lt;/p&gt;
&lt;p&gt;그러나 가중치 공개 전에는 옵션일 뿐이다. ROCm 커널, 전문가 병렬 통신, 100만 토큰 처리량, 64개 이상 클러스터 안정성이 실제로 확인돼야 한다. AMD의 수혜는 “열린 모델이 많아졌다”가 아니라 “K3가 MI 계열에서 비용 대비 처리량을 입증했다”는 데이터가 나올 때 커진다.&lt;/p&gt;
&lt;h3 id="53-hbm-요청당-캐시는-줄고-모델-상주량은-커진다"&gt;5.3 HBM: 요청당 캐시는 줄고 모델 상주량은 커진다
&lt;/h3&gt;&lt;p&gt;HBM 영향은 세 층으로 나눠야 한다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;층&lt;/th&gt;
 &lt;th&gt;K3 효율화의 영향&lt;/th&gt;
 &lt;th&gt;수요 방향&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;가중치 상주&lt;/td&gt;
 &lt;td&gt;2.8조 모델 전체를 빠르게 접근해야 함&lt;/td&gt;
 &lt;td&gt;HBM·가속기 수 증가 요인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;요청별 KV 캐시&lt;/td&gt;
 &lt;td&gt;KDA가 캐시 크기와 문맥 증가율을 낮춤&lt;/td&gt;
 &lt;td&gt;요청당 HBM 용량 감소 요인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;동시 사용자·에이전트 수&lt;/td&gt;
 &lt;td&gt;비용 하락과 오픈 배포로 사용량 확대 가능&lt;/td&gt;
 &lt;td&gt;총 HBM·DRAM 수요 증가 요인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;SK하이닉스·마이크론·삼성전자에는 단기 헤드라인이 부정적으로 읽힐 수 있다. 75% KV 캐시 절감과 6.3배 처리량 같은 숫자는 메모리 집약도를 낮추는 것처럼 보이기 때문이다. 그러나 그 숫자는 Kimi Linear 연구 모델의 특정 조건이며, K3 전체 실측이 아니다. 또 HBM은 KV 캐시만 담지 않는다. 모델 가중치, 활성값, 통신 버퍼, 배치 처리도 HBM을 사용한다.&lt;/p&gt;
&lt;p&gt;중기 결론은 중립에서 긍정 쪽이다. 프런티어 근접 오픈웨이트가 기업과 국가의 자체 클러스터를 늘리고, 에이전트 작업량이 효율 개선보다 빠르게 늘면 총 HBM 수요는 증가한다. 반대로 호출량 탄성이 약하고 모델 압축 속도가 더 빠르면 HBM 장기 수요 추정치는 낮아진다.&lt;/p&gt;
&lt;h3 id="54-서버-dram과-essd-가장-명확한-2차-수혜"&gt;5.4 서버 DRAM과 eSSD: 가장 명확한 2차 수혜
&lt;/h3&gt;&lt;p&gt;긴 문맥과 캐시 재사용은 모든 데이터를 HBM에 둘 수 없게 한다. Mooncake처럼 prefill과 decode를 나누고 캐시를 CPU·DRAM·SSD로 분산하면 서버 DRAM과 엔터프라이즈 SSD가 AI 추론의 운영 자산이 된다.&lt;/p&gt;
&lt;p&gt;이 경로는 한국 메모리 기업에도 중요하다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;삼성전자: HBM뿐 아니라 서버 DRAM, 고용량 eSSD, 파운드리와 패키징을 함께 공급할 수 있다.&lt;/li&gt;
&lt;li&gt;SK하이닉스: HBM 리더십에 서버 DRAM과 Solidigm eSSD가 붙는다.&lt;/li&gt;
&lt;li&gt;마이크론: HBM과 데이터센터 DRAM·SSD를 함께 제공한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;K3가 보여준 것은 “HBM을 덜 쓴다”가 아니라 &lt;strong&gt;AI 메모리가 계층화된다&lt;/strong&gt;는 점이다. 가장 뜨거운 데이터는 HBM, 오래 유지할 문맥은 서버 DRAM, 재사용 가능성이 낮은 캐시는 eSSD로 이동한다. HBM 단일 품목보다 메모리 계층 전체를 가진 기업이 방어력이 높다.&lt;/p&gt;
&lt;h3 id="55-네트워크와-맞춤형-칩-희소-moe의-숨은-병목"&gt;5.5 네트워크와 맞춤형 칩: 희소 MoE의 숨은 병목
&lt;/h3&gt;&lt;p&gt;전문가 896개를 여러 가속기에 나누면 어떤 토큰이 어느 전문가로 갈지에 따라 통신량이 달라진다. 문샷AI가 정적 형태와 호스트 동기화 제거, 완전 균형 전문가 병렬 학습을 강조한 이유다. 64개 이상 가속기에서 모델을 효율적으로 돌리려면 고대역폭 scale-up·scale-out 네트워크가 필요하다.&lt;/p&gt;
&lt;p&gt;이 구조는 Broadcom, Marvell, NVIDIA 네트워킹, 광통신과 스위치 실리콘에 긍정적이다. 장기적으로는 K3 같은 오픈 모델에 맞춘 추론 ASIC을 설계하려는 수요도 늘 수 있다. 문샷AI가 K3로 작은 추론 칩을 48시간 동안 설계했다는 사례는 아직 상업 칩이 아니지만, 모델과 하드웨어의 공동 최적화가 빨라지는 방향은 보여준다.&lt;/p&gt;
&lt;h2 id="6-미국-빅테크의-ai-전략과-주가-경로"&gt;6. 미국 빅테크의 AI 전략과 주가 경로
&lt;/h2&gt;&lt;h3 id="61-microsoft-openai-경제성-압박-azure-사용량-확대"&gt;6.1 Microsoft: OpenAI 경제성 압박, Azure 사용량 확대
&lt;/h3&gt;&lt;p&gt;Microsoft는 OpenAI와의 관계에서 두 자산을 가진다. 모델 IP와 수익 배분, 그리고 Azure라는 인프라다. 2026년 4월 발표된 새 협력 구조에서도 Microsoft는 주요 클라우드 파트너 지위를 유지하고 IP 사용권은 2032년까지 비독점으로 이어진다.&lt;/p&gt;
&lt;p&gt;K3는 모델 계층에는 부담이다. 기업이 반복 작업을 오픈웨이트로 돌리면 OpenAI API의 평균 단가와 호출 비중이 낮아질 수 있다. 반면 Azure가 K3를 관리형 서비스나 자체 배포 인프라로 받으면 계산·스토리지·네트워크 매출은 남는다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Microsoft 계층&lt;/th&gt;
 &lt;th&gt;K3 영향&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;OpenAI 수익 배분&lt;/td&gt;
 &lt;td&gt;가격과 호출 혼합비에 부정적&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Copilot&lt;/td&gt;
 &lt;td&gt;라우팅 비용을 낮출 수 있어 긍정적&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Azure AI&lt;/td&gt;
 &lt;td&gt;다중 모델 사용량이 늘면 긍정적&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;자체 가속기·데이터센터&lt;/td&gt;
 &lt;td&gt;오픈웨이트 최적화 수요가 늘면 긍정적&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;주가에는 단기 중립, 중기에는 Azure가 모델 가격 하락을 얼마나 사용량과 Copilot 마진으로 바꾸는지가 중요하다. 모델 1등의 독점가치가 낮아져도 클라우드가 사용량을 흡수하면 손익은 방어된다.&lt;/p&gt;
&lt;h3 id="62-amazon-anthropic-지분과-aws의-이해가-다르다"&gt;6.2 Amazon: Anthropic 지분과 AWS의 이해가 다르다
&lt;/h3&gt;&lt;p&gt;Amazon은 Anthropic의 주요 투자자이자 AWS·Bedrock·Trainium·Inferentia 공급자다. K3가 Claude 호출을 대체하면 Anthropic의 가격 결정력과 Amazon의 투자자산 가치에는 부담이다. 하지만 기업이 K3를 AWS에서 돌리면 EC2, Bedrock, 스토리지, 네트워크, Trainium 사용량은 늘 수 있다.&lt;/p&gt;
&lt;p&gt;Amazon의 최적 전략은 한 모델의 승리를 고집하는 것이 아니라 고객이 어떤 모델을 고르든 AWS에 남게 하는 것이다. K3 가중치가 허용적인 라이선스로 나오고 Trainium에서 효율적으로 돌면 AWS는 경쟁 모델의 확산에서도 돈을 벌 수 있다.&lt;/p&gt;
&lt;p&gt;주가 영향은 중립에서 소폭 긍정이다. Anthropic 가치 하락 위험보다 AWS가 다중 모델 추론의 시장을 넓히는 효과가 더 클 수 있다. 단, 오픈모델의 가격 경쟁이 클라우드 추론 마진까지 낮추면 매출 성장과 이익률이 엇갈린다.&lt;/p&gt;
&lt;h3 id="63-alphabet-gemini-가격-압력과-tpuvertex의-방어력"&gt;6.3 Alphabet: Gemini 가격 압력과 TPU·Vertex의 방어력
&lt;/h3&gt;&lt;p&gt;Google은 Gemini라는 모델, TPU라는 칩, Vertex AI라는 배포 플랫폼, 검색·광고라는 최종 수요를 모두 가진다. Vertex Model Garden은 Google 모델뿐 아니라 제3자 모델과 오픈모델을 배포할 수 있다.&lt;/p&gt;
&lt;p&gt;K3는 Gemini API 가격에는 부담이지만 TPU와 Google Cloud에는 기회다. KDA와 희소 MoE가 TPU에서 잘 작동하면 Google은 경쟁 모델을 자사 인프라로 흡수할 수 있다. 모델 비용이 낮아지면 AI Overviews, 광고 생성, Workspace 에이전트의 원가도 내려간다.&lt;/p&gt;
&lt;p&gt;주가에는 중립에서 긍정이다. Google은 모델 판매만으로 돈을 버는 회사가 아니다. K3가 모델을 범용 부품으로 만들수록 검색·광고·업무 배포를 장악한 사업자의 협상력이 커질 수 있다. 반대로 Gemini가 성능과 가격에서 동시에 밀리면 클라우드 신규 고객 확보 비용은 높아진다.&lt;/p&gt;
&lt;h3 id="64-meta-오픈웨이트의-수혜자에서-방어자로"&gt;6.4 Meta: 오픈웨이트의 수혜자에서 방어자로
&lt;/h3&gt;&lt;p&gt;Meta는 오픈웨이트 확산의 대표 수혜자였다. 모델을 무료에 가깝게 풀어 경쟁사의 API 가격을 낮추고, 자체 추천·광고·콘텐츠 비용을 줄이는 전략이다. 중국 모델이 프런티어 근접 성능과 더 큰 문맥을 먼저 공개하면 Meta는 미국 오픈 진영의 기준점이라는 지위를 잃을 수 있다.&lt;/p&gt;
&lt;p&gt;K3는 Meta에 두 가지 요구를 한다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;다음 Llama가 성능만이 아니라 긴 문맥, 에이전트 도구, 배포 비용에서 경쟁해야 한다.&lt;/li&gt;
&lt;li&gt;미국 기업과 정부가 중국 가중치 사용을 꺼릴 때 대체할 신뢰 가능한 미국 오픈모델을 제공해야 한다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;주가 영향은 단기 제한적이다. Meta의 현금흐름은 광고가 만든다. 중기에는 자체 모델이 뒤처질 경우 AI 인프라 투자 효율과 개발자 생태계의 가치가 낮아질 수 있다. 반대로 K3가 오픈웨이트 수요 자체를 키우면 Meta의 기존 전략이 옳았다는 증거가 된다.&lt;/p&gt;
&lt;h3 id="65-nvidiaoracle까지-포함한-현재-위치"&gt;6.5 NVIDIA·Oracle까지 포함한 현재 위치
&lt;/h3&gt;&lt;p&gt;K3 발표 직전 시장은 이미 AI 인프라 안에서도 크게 갈라져 있었다. 2026년 6월 22일 종가부터 7월 16일 종가까지 미국 현지 데이터 기준 수익률은 다음과 같다. 이 기간 대부분은 K3 발표 전이므로 K3의 결과가 아니라 &lt;strong&gt;발표를 받아들이는 시장의 기존 포지션&lt;/strong&gt;이다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;종목&lt;/th&gt;
 &lt;th style="text-align: right"&gt;6월 22일~7월 16일&lt;/th&gt;
 &lt;th style="text-align: right"&gt;기간 고점 대비&lt;/th&gt;
 &lt;th&gt;해석&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+17.9%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.1%&lt;/td&gt;
 &lt;td&gt;광고 현금흐름과 AI 활용 기대가 견조&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+9.2%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-1.2%&lt;/td&gt;
 &lt;td&gt;클라우드·소프트웨어 방어력&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+7.3%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.2%&lt;/td&gt;
 &lt;td&gt;AWS와 소비 회복 기대&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td style="text-align: right"&gt;+1.4%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-5.5%&lt;/td&gt;
 &lt;td&gt;검색·클라우드 혼합&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-0.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-3.1%&lt;/td&gt;
 &lt;td&gt;대형주 중 상대적으로 견조&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-4.5%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9.7%&lt;/td&gt;
 &lt;td&gt;맞춤형 AI 칩 기대와 가격 부담&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-9.2%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-14.3%&lt;/td&gt;
 &lt;td&gt;대안 가속기 기대는 있으나 변동성 확대&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32.0%&lt;/td&gt;
 &lt;td&gt;메모리 기대가 높아진 뒤 조정&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Oracle&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-29.1%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-32.7%&lt;/td&gt;
 &lt;td&gt;AI 인프라 투자와 자금 부담의 충돌&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Marvell&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-38.8%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;-40.1%&lt;/td&gt;
 &lt;td&gt;네트워크·맞춤형 칩 기대의 급격한 디레이팅&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;K3는 이미 조정받은 메모리·네트워크 종목 위에 올라온 효율화 뉴스다. 그래서 단기 주가 반응은 산업 수요보다 포지션에 더 민감할 수 있다. NVIDIA처럼 상대적으로 버틴 종목은 효율 우려에 흔들릴 수 있고, Micron·Marvell처럼 이미 크게 빠진 종목은 가중치 공개 후 실제 인프라 수요가 확인되면 반등 탄성이 커질 수 있다.&lt;/p&gt;
&lt;h2 id="7-종목별-영향-지도"&gt;7. 종목별 영향 지도
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;기업·축&lt;/th&gt;
 &lt;th&gt;단기 신호&lt;/th&gt;
 &lt;th&gt;중기 경로&lt;/th&gt;
 &lt;th&gt;현재 판단&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA&lt;/td&gt;
 &lt;td&gt;효율화·대체 하드웨어 서사로 멀티플 부담&lt;/td&gt;
 &lt;td&gt;64개 이상 가속기 자체 배포가 수요를 보완&lt;/td&gt;
 &lt;td&gt;실적 추정치 변경보다 사용량 탄성 확인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD&lt;/td&gt;
 &lt;td&gt;비NVIDIA 배포 기대&lt;/td&gt;
 &lt;td&gt;ROCm 처리량이 증명되면 점유율 옵션&lt;/td&gt;
 &lt;td&gt;7월 27일 이후 벤치마크 대기&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Broadcom·Marvell&lt;/td&gt;
 &lt;td&gt;AI 네트워크 디레이팅 중&lt;/td&gt;
 &lt;td&gt;MoE 전문가 병렬과 슈퍼노드 통신 수요&lt;/td&gt;
 &lt;td&gt;네트워크 주문과 K3 클러스터 구조 확인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;SK하이닉스&lt;/td&gt;
 &lt;td&gt;KV 캐시 절감 숫자에 민감&lt;/td&gt;
 &lt;td&gt;HBM·서버 DRAM·Solidigm eSSD 계층 수혜&lt;/td&gt;
 &lt;td&gt;HBM 단일 논리보다 메모리 계층으로 평가&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;삼성전자&lt;/td&gt;
 &lt;td&gt;HBM 효율 우려와 HBM 추격 지위&lt;/td&gt;
 &lt;td&gt;HBM·서버 DRAM·eSSD·파운드리 묶음 옵션&lt;/td&gt;
 &lt;td&gt;가장 넓은 포트폴리오, 실행 확인 필요&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Micron&lt;/td&gt;
 &lt;td&gt;높은 기대 뒤 조정, 효율 뉴스 부담&lt;/td&gt;
 &lt;td&gt;미국 AI 메모리와 DRAM·SSD 통합 수혜&lt;/td&gt;
 &lt;td&gt;공급·가격보다 배포량 탄성 확인&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Microsoft&lt;/td&gt;
 &lt;td&gt;OpenAI 호출 단가 압력&lt;/td&gt;
 &lt;td&gt;Azure·Copilot 원가 개선&lt;/td&gt;
 &lt;td&gt;모델 마진보다 클라우드 사용량이 중요&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Amazon&lt;/td&gt;
 &lt;td&gt;Anthropic 가치에는 부담&lt;/td&gt;
 &lt;td&gt;AWS·Bedrock·Trainium은 다중 모델 수혜&lt;/td&gt;
 &lt;td&gt;상쇄 구조가 가장 명확&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Alphabet&lt;/td&gt;
 &lt;td&gt;Gemini 가격 압력&lt;/td&gt;
 &lt;td&gt;TPU·Vertex·검색 원가 절감&lt;/td&gt;
 &lt;td&gt;응용 계층 방어력 우세&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Meta&lt;/td&gt;
 &lt;td&gt;미국 오픈모델 주도권 압박&lt;/td&gt;
 &lt;td&gt;Llama 재가속 또는 오픈 생태계 확대 수혜&lt;/td&gt;
 &lt;td&gt;광고 실적 영향은 아직 제한적&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;현재 단계에서 이 뉴스만으로 새 매수·매도 판단을 만들기는 이르다. 가중치와 라이선스가 없고, 외부 하드웨어별 처리량도 없다. 주식에는 구조적 방향보다 확인 순서가 중요하다.&lt;/p&gt;
&lt;h2 id="8-세-가지-시나리오"&gt;8. 세 가지 시나리오
&lt;/h2&gt;&lt;h3 id="기본-시나리오-강한-모델-제한적-재평가"&gt;기본 시나리오: 강한 모델, 제한적 재평가
&lt;/h3&gt;&lt;p&gt;확률 감각 55%다. 7월 27일까지 가중치와 비교적 허용적인 라이선스가 나오고, 외부 평가에서 공식 성능의 85~95%가 재현된다. NVIDIA와 AMD에서 배포가 가능하지만 64개 이상 가속기, 최대 추론 강도, 많은 출력 토큰 때문에 비용은 여전히 높다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;닫힌 API: 반복 업무의 가격 압력 확대&lt;/li&gt;
&lt;li&gt;클라우드: K3 등록과 자체 배포 수요 증가&lt;/li&gt;
&lt;li&gt;반도체: 토큰당 효율 개선과 총사용량 증가가 상쇄&lt;/li&gt;
&lt;li&gt;HBM: 중립에서 소폭 긍정&lt;/li&gt;
&lt;li&gt;서버 DRAM·eSSD·네트워크: 긍정&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="강세-시나리오-오픈웨이트가-기업-주력층으로-진입"&gt;강세 시나리오: 오픈웨이트가 기업 주력층으로 진입
&lt;/h3&gt;&lt;p&gt;확률 감각 25%다. MIT에 가까운 라이선스, 안정적인 vLLM·SGLang 지원, NVIDIA·AMD·중국 가속기에서 높은 처리량이 확인된다. 외부 평가에서 Fable 5와 GPT-5.6 Sol 바로 아래 성능이 반복되고, 낮은 추론 강도 모드가 추가돼 작업당 비용도 내려간다. 주요 클라우드와 기업 AI 게이트웨이가 K3를 기본 라우팅 후보로 넣는다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;닫힌 모델 사업자: API 혼합 단가와 호출 점유율 하락&lt;/li&gt;
&lt;li&gt;하이퍼스케일러: 멀티모델 클라우드 사용량 증가&lt;/li&gt;
&lt;li&gt;가속기: 자체 서빙 클러스터 증가&lt;/li&gt;
&lt;li&gt;HBM·네트워크·서버 DRAM·eSSD: 총배포량 증가의 직접 수혜&lt;/li&gt;
&lt;li&gt;미국 오픈모델: Meta와 미국 연구 프로젝트의 대응 투자 확대&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="약세-시나리오-가중치-공개-뒤-비용과-품질의-간격-확인"&gt;약세 시나리오: 가중치 공개 뒤 비용과 품질의 간격 확인
&lt;/h3&gt;&lt;p&gt;확률 감각 20%다. 가중치 공개가 늦어지거나 라이선스가 제한적이고, 외부 평가가 공식 점수보다 낮다. 사고 이력 보존 문제와 과도한 자율 행동이 기업 운영에서 장애가 된다. 최대 추론 강도와 긴 출력 때문에 작업당 비용이 Sonnet 5보다 높고, 64개 이상 가속기 요구가 자체 배포를 제한한다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;문샷AI: 프런티어 가격 전략 후퇴 가능&lt;/li&gt;
&lt;li&gt;닫힌 API: 사용자 경험과 안정성 프리미엄 유지&lt;/li&gt;
&lt;li&gt;반도체: K3 자체의 추가 수요는 제한적&lt;/li&gt;
&lt;li&gt;주가: 효율화 충격보다 기존 실적과 CAPEX가 다시 중심이 됨&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="9-7월-27일-이후-확인표"&gt;9. 7월 27일 이후 확인표
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;확인 항목&lt;/th&gt;
 &lt;th&gt;강한 신호&lt;/th&gt;
 &lt;th&gt;약한 신호&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;가중치·라이선스&lt;/td&gt;
 &lt;td&gt;기한 내 전체 공개, 상업 이용과 수정 허용&lt;/td&gt;
 &lt;td&gt;공개 지연, 사용 제한, 핵심 구성 누락&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;외부 평가&lt;/td&gt;
 &lt;td&gt;동일 실행기에서 공식값 근접&lt;/td&gt;
 &lt;td&gt;자체표 대비 큰 하락&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;실제 작업당 비용&lt;/td&gt;
 &lt;td&gt;낮은 추론 강도 추가, 출력 토큰 감소&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;max&lt;/code&gt; 고정과 긴 출력 지속&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;NVIDIA 처리량&lt;/td&gt;
 &lt;td&gt;64개 노드에서 안정적 전문가 병렬&lt;/td&gt;
 &lt;td&gt;통신 병목과 낮은 가동률&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;AMD 처리량&lt;/td&gt;
 &lt;td&gt;ROCm·vLLM에서 비용 우위&lt;/td&gt;
 &lt;td&gt;커널 미성숙과 정확도 손실&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;중국 가속기&lt;/td&gt;
 &lt;td&gt;공급자와 실측 처리량 공개&lt;/td&gt;
 &lt;td&gt;“대체 GPU” 표현만 유지&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;캐시&lt;/td&gt;
 &lt;td&gt;기업 트래픽에서 90% 안팎 적중&lt;/td&gt;
 &lt;td&gt;코딩 외 업무에서 적중률 급락&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;클라우드 채택&lt;/td&gt;
 &lt;td&gt;AWS·Azure·Google Cloud·Oracle 등록&lt;/td&gt;
 &lt;td&gt;소수 중국 플랫폼에 머묾&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;가격 대응&lt;/td&gt;
 &lt;td&gt;경쟁사 정상가 인하 또는 캐시 할인 확대&lt;/td&gt;
 &lt;td&gt;한시 프로모션만 유지&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;메모리 주문&lt;/td&gt;
 &lt;td&gt;HBM·서버 DRAM·eSSD 물량 상향&lt;/td&gt;
 &lt;td&gt;효율 개선만 반영되고 물량 정체&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="10-반대-논리와-폐기-조건"&gt;10. 반대 논리와 폐기 조건
&lt;/h2&gt;&lt;p&gt;가장 강한 반대 논리는 단순하다. &lt;strong&gt;효율이 사용량보다 빨리 좋아지면 반도체 수요는 줄어든다.&lt;/strong&gt; 모델 압축, 선형 어텐션, 양자화, 캐시 재사용, 추론 ASIC이 동시에 발전하면 같은 수의 유용한 작업을 훨씬 적은 GPU와 HBM으로 처리할 수 있다. 오픈웨이트 경쟁이 API 가격을 떨어뜨려도 기업의 유료 작업량이 충분히 늘지 않으면 전체 AI 매출과 설비투자 수익률이 낮아진다.&lt;/p&gt;
&lt;p&gt;이 반대 논리가 맞다는 증거는 다음과 같다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;토큰 가격이 내려가는데 전체 추론 매출 성장률도 둔화한다.&lt;/li&gt;
&lt;li&gt;가속기 이용률은 오르지만 신규 클러스터 주문은 줄어든다.&lt;/li&gt;
&lt;li&gt;HBM 비트 출하 증가율이 모델 효율 개선 속도보다 낮다.&lt;/li&gt;
&lt;li&gt;클라우드 사업자의 AI backlog가 매출로 전환되지 않는다.&lt;/li&gt;
&lt;li&gt;기업이 오픈모델을 비용 절감에만 쓰고 새 업무를 만들지 않는다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;반대로 K3 강세 논리가 성립하려면 가격 하락이 더 많은 작업을 만들어야 한다. 긴 코드베이스 분석, 연구 자동화, 영상 편집, 칩 설계처럼 기존에는 비용 때문에 못 하던 작업이 상용 트래픽으로 바뀌어야 한다. 모델의 효율보다 사용량의 탄성이 큰지 확인하는 것이 HBM과 가속기 투자의 공통 검증점이다.&lt;/p&gt;
&lt;h2 id="11-최종-판단"&gt;11. 최종 판단
&lt;/h2&gt;&lt;p&gt;Kimi K3는 중국이 미국의 최상위 닫힌 모델을 완전히 따라잡았다는 증거가 아니다. 문샷AI도 사용자 경험의 격차를 인정한다. 7월 17일 현재 전체 가중치와 기술 보고서도 없다. 자체 벤치마크와 서로 다른 실행기를 섞은 비교표만으로 승자를 확정할 수 없다.&lt;/p&gt;
&lt;p&gt;그럼에도 시장 구조는 바뀌었다. 2.8조 파라미터, 100만 토큰, 프런티어 근접 성능을 가진 모델이 Sonnet 정상가로 API에 들어왔고, 열흘 안에 가중치까지 공개하겠다고 예고했다. 중국 오픈웨이트는 싸지만 한 단계 낮은 모델이 아니라 기업 주력 호출을 노리는 상품으로 올라왔다.&lt;/p&gt;
&lt;p&gt;반도체에는 수요 파괴보다 수요 재배치에 가깝다. KDA와 양자화는 요청당 HBM과 GPU 시간을 줄인다. 희소 MoE와 64개 가속기 슈퍼노드는 모델 상주 메모리와 네트워크를 키운다. Mooncake는 캐시를 서버 DRAM과 eSSD로 내려보낸다. 따라서 HBM만 떼어 보면 효율 우려가 생기지만, 메모리 계층과 데이터센터 전체로 보면 배포량 증가의 수혜가 남는다.&lt;/p&gt;
&lt;p&gt;미국 빅테크의 손익도 같은 방식으로 갈린다. 모델 API는 가격 압력을 받고, 클라우드와 응용 소프트웨어는 낮아진 모델 원가를 흡수한다. Microsoft·Amazon·Alphabet은 자사 모델이 밀리더라도 클라우드에서 K3 사용량을 받을 수 있다. Meta는 미국 오픈웨이트의 기준점이라는 전략적 지위를 방어해야 한다.&lt;/p&gt;
&lt;p&gt;7월 27일에는 순위표보다 배포 파일을 봐야 한다. 라이선스가 넓고, 외부 평가가 재현되며, 여러 가속기에서 비용 대비 처리량이 확인되면 K3는 중국 모델 한 건이 아니라 AI 가격표와 반도체 수요 경로를 함께 바꾸는 사건이 된다. 반대로 가중치, 라이선스, 작업당 비용 가운데 하나라도 막히면 이번 발표는 강한 제품 출시로 남고 산업 구조 변화까지 이어지지는 않는다.&lt;/p&gt;
&lt;h2 id="근거와-한계"&gt;근거와 한계
&lt;/h2&gt;&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;구분&lt;/th&gt;
 &lt;th&gt;내용&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;[Fact]&lt;/td&gt;
 &lt;td&gt;K3 공식 발표, API 가격, 벤치마크 표, 한계, 64개 이상 가속기 권장 사양은 문샷AI 자료를 기준으로 했다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;[Fact]&lt;/td&gt;
 &lt;td&gt;Kimi Linear의 75% KV 캐시 절감과 6.3배 수치는 48B/3B 연구 모델의 논문 결과다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;[Fact]&lt;/td&gt;
 &lt;td&gt;Sonnet 5 출시 할인과 정상가, GPT-5.6 Sol 가격은 각 회사 공식 가격표를 사용했다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;[Inference]&lt;/td&gt;
 &lt;td&gt;HBM·서버 DRAM·eSSD·네트워크 영향은 공개 아키텍처와 서빙 구조를 바탕으로 한 수요 경로 분석이다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;[Blocked]&lt;/td&gt;
 &lt;td&gt;K3 전체 활성 파라미터, 실제 가중치 크기, 라이선스, AMD·중국 가속기 실측, 기업 트래픽 작업당 비용은 아직 확인되지 않았다&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;주요 자료: &lt;a class="link" href="https://www.kimi.com/blog/kimi-k3" target="_blank" rel="noopener"
 &gt;Kimi K3 공식 발표&lt;/a&gt;, &lt;a class="link" href="https://platform.kimi.ai/docs/pricing/chat-k3" target="_blank" rel="noopener"
 &gt;Kimi K3 API 문서&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2510.26692" target="_blank" rel="noopener"
 &gt;Kimi Linear 논문&lt;/a&gt;, &lt;a class="link" href="https://github.com/MoonshotAI/Kimi-Linear" target="_blank" rel="noopener"
 &gt;Kimi Linear GitHub&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2603.15031" target="_blank" rel="noopener"
 &gt;Attention Residuals 논문&lt;/a&gt;, &lt;a class="link" href="https://arxiv.org/abs/2407.00079" target="_blank" rel="noopener"
 &gt;Mooncake 논문&lt;/a&gt;, &lt;a class="link" href="https://www.anthropic.com/news/claude-sonnet-5" target="_blank" rel="noopener"
 &gt;Claude Sonnet 5 가격&lt;/a&gt;, &lt;a class="link" href="https://developers.openai.com/api/docs/models/gpt-5.6-sol" target="_blank" rel="noopener"
 &gt;GPT-5.6 Sol 가격&lt;/a&gt;, &lt;a class="link" href="https://openrouter.ai/blog/insights/deepseek-v4-adoption/" target="_blank" rel="noopener"
 &gt;OpenRouter 오픈모델 사용량 분석&lt;/a&gt;, &lt;a class="link" href="https://blogs.microsoft.com/blog/2026/04/27/the-next-phase-of-the-microsoft-openai-partnership/" target="_blank" rel="noopener"
 &gt;Microsoft·OpenAI 협력 구조&lt;/a&gt;, &lt;a class="link" href="https://cloud.google.com/vertex-ai/generative-ai/docs/model-garden/explore-models" target="_blank" rel="noopener"
 &gt;Google Vertex Model Garden&lt;/a&gt;, &lt;a class="link" href="https://www.aboutamazon.com/news/company-news/amazon-aws-anthropic-ai" target="_blank" rel="noopener"
 &gt;Amazon·Anthropic 협력&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;K3는 가중치와 기술 보고서가 공개되기 전 단계다. 7월 27일 이후 라이선스와 외부 평가 결과에 따라 결론이 달라질 수 있다.&lt;/p&gt;</description></item></channel></rss>