<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI on Korea Invest Insights</title><link>https://koreainvestinsights.com/ko/tags/ai/</link><description>Recent content in AI on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>ko</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Tue, 08 Sep 2026 22:02:51 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/ko/tags/ai/feed.xml" rel="self" type="application/rss+xml"/><item><title>아스트라 이후, 루프 트랜스포머가 바꾸는 AI 인프라의 계산법</title><link>https://koreainvestinsights.com/ko/post/astra-loop-transformers-inference-economics-2026-09-08/</link><pubDate>Tue, 08 Sep 2026 18:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/ko/post/astra-loop-transformers-inference-economics-2026-09-08/</guid><description>&lt;p&gt;같은 신경망을 여러 번 통과하면, 작은 모델도 더 어려운 문제를 풀 수 있을까요. 신정규 래블업 대표는 &lt;a class="link" href="https://www.facebook.com/jeongkyu.shin/posts/pfbid02jm4iibHsgU11P7gY8e4SZKtKYNNdtHF6wdTQK2EdyDeTMEwxiDvHnHyhyAKphLml" target="_blank" rel="noopener"
 &gt;페이스북 글 「아스트라 이후: 루프 트랜스포머가 바꾸는 것들」&lt;/a&gt;에서 이 오래된 질문을 다시 꺼냈습니다. AI를 키우는 방법에 관한 질문이지만, 그 끝에는 GPU와 메모리를 얼마나 사고 어떻게 운영할 것인가가 있습니다.&lt;/p&gt;
&lt;p&gt;공개 연구가 보여주는 변화는 분명합니다. 모델에 저장하는 가중치 수를 고정하고도, 같은 계산 블록을 반복 실행해 문제 해결 능력을 높일 수 있습니다. 다만 반복에는 시간과 전력이 듭니다. 작은 모델이라는 이유만으로 서비스 비용까지 낮아지는 것은 아닙니다.&lt;/p&gt;
&lt;p&gt;자료 확인 기준일: 2026년 9월 8일. 신 대표의 원문을 계기로 작성한 독립 해설이며, 아래 산업 전망은 공개 연구에서 도출한 조건부 분석입니다.&lt;/p&gt;
&lt;h2 id="아스트라의-성과와-내부-설계는-구분해야-합니다"&gt;아스트라의 성과와 내부 설계는 구분해야 합니다
&lt;/h2&gt;&lt;p&gt;OpenAI의 9월 3일자 공식 발표는 GPT-6 Astra의 출시와 성능 향상을 확인해 줍니다. 그러나 확인한 &lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;발표문&lt;/a&gt;과 &lt;a class="link" href="https://deploymentsafety.openai.com/gpt-6-astra" target="_blank" rel="noopener"
 &gt;시스템 카드&lt;/a&gt;에는 루프 트랜스포머 채택, 반복 횟수, 전체 및 활성 파라미터 수가 공개돼 있지 않습니다.&lt;/p&gt;
&lt;p&gt;따라서 아스트라가 Huginn 계열 구조를 채택했다는 설명은 이 글에서 확인된 사실로 사용하지 않습니다. 원문에 등장하는 10T·1T 규모와 AGI 관련 인용도 같은 이유로 산업 분석의 전제에서 제외합니다. 성능이 높아졌다는 결과만으로 내부 설계를 역추론하기는 어렵습니다.&lt;/p&gt;
&lt;p&gt;그래도 루프 연구를 볼 이유는 충분합니다. 공개 모델만으로도 가중치의 크기와 추론에 쓰는 계산량을 따로 조절하는 시도가 확인됩니다. 특정 프론티어 모델의 비공개 설계에 기대지 않고도 검토할 수 있는 변화입니다.&lt;/p&gt;
&lt;h2 id="더-많이-저장하는-것과-더-오래-계산하는-것은-다릅니다"&gt;더 많이 저장하는 것과 더 오래 계산하는 것은 다릅니다
&lt;/h2&gt;&lt;p&gt;모델의 파라미터는 학습하면서 조정한 숫자입니다. 보통 모델을 키우면 저장할 숫자도 늘어납니다. MoE는 여러 전문가 모듈 가운데 일부를 입력에 따라 선택해, 전체 용량에 비해 적은 계산으로 실행하려는 방식입니다.&lt;/p&gt;
&lt;p&gt;MoE의 기원을 Switch Transformer 하나로 설명하는 것은 정확하지 않습니다. &lt;a class="link" href="https://arxiv.org/abs/1701.06538" target="_blank" rel="noopener"
 &gt;2017년 희소 MoE 연구&lt;/a&gt;가 앞서 있고, &lt;a class="link" href="https://arxiv.org/abs/2101.03961" target="_blank" rel="noopener"
 &gt;2021년 Switch Transformer&lt;/a&gt;는 라우팅과 학습을 단순화해 규모를 키운 연구입니다. 전체 파라미터가 늘었다고 반드시 층수가 깊어진 것도 아닙니다.&lt;/p&gt;
&lt;p&gt;사고사슬(CoT)은 중간 풀이를 토큰으로 생성하면서 다음 계산의 문맥을 늘립니다. 루프 방식은 같은 가중치를 가진 블록에 내부 상태를 다시 넣습니다. 중간 계산을 매번 단어로 확정하지 않아도 된다는 차이가 있습니다. 두 방법을 함께 쓰는 설계도 가능하므로 서로를 대체해야 하는 관계는 아닙니다.&lt;/p&gt;
&lt;p&gt;무엇을 늘리는지 비교하면 혼동이 줄어듭니다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;접근&lt;/th&gt;
 &lt;th&gt;추가하는 것&lt;/th&gt;
 &lt;th&gt;부담이 생기는 지점&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;모델 확대&lt;/td&gt;
 &lt;td&gt;가중치 또는 전문가 용량&lt;/td&gt;
 &lt;td&gt;저장 공간, 활성 계산, 통신&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;사고사슬&lt;/td&gt;
 &lt;td&gt;중간 풀이 토큰&lt;/td&gt;
 &lt;td&gt;생성 시간, 문맥과 캐시&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;반복 깊이&lt;/td&gt;
 &lt;td&gt;같은 블록을 통과하는 횟수&lt;/td&gt;
 &lt;td&gt;반복 연산, 지연, 상태 관리&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;이 비교는 개념 구분입니다. 실제 비용 우열은 같은 정확도, 입력 길이, 하드웨어 조건에서 측정해야 합니다.&lt;/p&gt;
&lt;h2 id="말을-줄이는-연구도-내부-작동은-서로-다릅니다"&gt;말을 줄이는 연구도 내부 작동은 서로 다릅니다
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2310.02226" target="_blank" rel="noopener"
 &gt;Pause tokens&lt;/a&gt;는 답변 전에 추가 계산 기회를 줍니다. &lt;a class="link" href="https://arxiv.org/abs/2403.09629" target="_blank" rel="noopener"
 &gt;Quiet-STaR&lt;/a&gt;는 다음 토큰 예측을 돕는 중간 근거를 생성하도록 학습합니다. 조용히 생각한다는 이름을 쓰지만, 이를 곧바로 비언어적 잠재 상태 추론과 같다고 볼 수는 없습니다.&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2412.06769" target="_blank" rel="noopener"
 &gt;Coconut&lt;/a&gt;은 마지막 은닉 상태를 단어로 바꾸지 않고 다음 입력으로 되먹입니다. 문장으로 쓰기 전에 여러 가능성을 내부 표현으로 유지하려는 접근입니다. 이 결과를 인간의 의식이나 항상 켜져 있는 자율적 사고의 증거로 확대할 근거는 없습니다.&lt;/p&gt;
&lt;p&gt;반복 깊이의 계보에는 &lt;a class="link" href="https://arxiv.org/abs/1807.03819" target="_blank" rel="noopener"
 &gt;2018년 Universal Transformer&lt;/a&gt;가 있습니다. 같은 변환을 반복하면서 입력 위치별로 계산량을 달리하는 발상입니다. 어려움은 반복 자체보다 학습에 있습니다. 공유 블록은 서로 다른 단계의 상태를 처리해야 하고, 추가 반복이 유용한 개선으로 이어지도록 학습돼야 합니다. 층마다 역할이 충돌한다는 설명은 직관을 주지만, 모든 실패를 설명하는 단일 법칙은 아닙니다.&lt;/p&gt;
&lt;h2 id="복사해서-늘린-층과-같은-가중치의-반복은-다릅니다"&gt;복사해서 늘린 층과 같은 가중치의 반복은 다릅니다
&lt;/h2&gt;&lt;p&gt;업스테이지의 &lt;a class="link" href="https://arxiv.org/abs/2312.15166" target="_blank" rel="noopener"
 &gt;SOLAR 10.7B&lt;/a&gt;는 기존 모델의 층을 복사하고 일부를 제거해 더 깊게 연결한 뒤 추가 학습하는 DUS를 제시했습니다. 출발점이 같은 복사본이어도 학습이 진행되면 서로 다른 가중치를 갖습니다. 최종 모델에 저장할 파라미터도 늘어납니다.&lt;/p&gt;
&lt;p&gt;반복 모델은 동일한 가중치를 계속 공유한다는 점에서 다릅니다. DUS는 기존 학습 결과를 활용해 더 깊은 모델을 만드는 방법이고, 루프는 저장 용량을 크게 늘리지 않고 실행 깊이를 늘리는 방법입니다. 둘을 같은 메모리 절감 기술로 묶으면 비용 계산이 어긋납니다.&lt;/p&gt;
&lt;h2 id="huginn과-ouro의-숫자는-비교-조건까지-읽어야-합니다"&gt;Huginn과 Ouro의 숫자는 비교 조건까지 읽어야 합니다
&lt;/h2&gt;&lt;p&gt;Geiping 등의 &lt;a class="link" href="https://arxiv.org/abs/2502.05171" target="_blank" rel="noopener"
 &gt;Huginn 연구&lt;/a&gt;는 입력 처리, 반복 코어, 출력 부분을 나눴습니다. 가운데 코어를 여러 차례 실행하며 내부 상태를 다듬습니다. 연구진은 3.5B 파라미터 모델을 800B 토큰으로 학습했고, 반복 계산을 늘릴 때 추론 과제 성능이 개선된다고 보고했습니다.&lt;/p&gt;
&lt;p&gt;초록의 50B는 특히 주의해야 합니다. 표현은 50B 파라미터에 해당하는 계산 부하까지 성능 개선을 관찰했다는 뜻입니다. 모든 과제에서 50B 모델과 같은 품질을 달성했다거나, 같은 비용으로 그 성능을 얻었다는 보장은 아닙니다. 작은 가중치로 더 많은 계산을 쓴다는 연구 결과와 서비스 경제성은 별도로 확인해야 합니다.&lt;/p&gt;
&lt;p&gt;바이트댄스 등의 &lt;a class="link" href="https://arxiv.org/abs/2510.25741" target="_blank" rel="noopener"
 &gt;Ouro 연구&lt;/a&gt;는 2025년 10월 공개됐습니다. 논문은 1.4B와 2.6B 모델군을 설명하며 여러 벤치마크에서 최대 12B 모델까지 비교합니다. 그런데 &lt;a class="link" href="https://huggingface.co/ByteDance/Ouro-1.4B" target="_blank" rel="noopener"
 &gt;Ouro-1.4B 공식 모델 카드&lt;/a&gt;는 해당 모델을 일반적인 3~4B 모델 성능에 대응한다고 소개합니다. 이를 1.4B가 언제나 12B를 대체한다는 주장으로 옮기면 비교 범위를 과장합니다.&lt;/p&gt;
&lt;p&gt;연구를 읽을 때는 파라미터 수 옆에 학습 데이터량, 반복 횟수, 비교 과제를 함께 적어야 합니다. 추론 단계에서 효율이 좋아 보여도 많은 사전학습 자원이 투입됐을 수 있습니다.&lt;/p&gt;
&lt;h2 id="가중치를-덜-저장해도-메모리-병목은-남습니다"&gt;가중치를 덜 저장해도 메모리 병목은 남습니다
&lt;/h2&gt;&lt;p&gt;산술 예를 들어 보겠습니다. 3.5B 파라미터를 하나당 2바이트로 저장하면 가중치 자체는 약 7GB입니다. 같은 가중치를 여러 번 사용한다고 이 저장량이 반복 횟수만큼 늘지는 않습니다. 이는 설명을 위한 계산이며 Huginn의 실제 전체 GPU 메모리 측정값이 아닙니다.&lt;/p&gt;
&lt;p&gt;전체 추론 메모리에는 이전 문맥을 재사용하는 KV 캐시와 중간 상태, 실행용 공간도 들어갑니다. &lt;a class="link" href="https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/" target="_blank" rel="noopener"
 &gt;NVIDIA의 추론 최적화 설명&lt;/a&gt; 역시 가중치와 KV 캐시를 주요 메모리 항목으로 구분합니다. 문맥 길이와 동시에 처리하는 요청 수가 늘면 캐시 부담이 커집니다. 반복 단계 사이에서 캐시를 어떻게 공유하는지도 설계에 달려 있습니다.&lt;/p&gt;
&lt;p&gt;가중치 재사용과 데이터 이동 절감도 같은 말이 아닙니다. 같은 가중치가 GPU의 빠른 내부 메모리에 계속 머무르지 못하면 다음 반복에서 HBM에서 다시 읽어야 합니다. 반복 계산이 늘면서 대역폭 부담이 함께 늘 수도 있습니다. 실제 메모리 계층과 실행 코드를 보기 전에는 루프가 HBM을 불필요하게 만든다고 결론 내릴 수 없습니다.&lt;/p&gt;
&lt;h2 id="소프트웨어가-반복을-줄여-줘야-비용이-줄어듭니다"&gt;소프트웨어가 반복을 줄여 줘야 비용이 줄어듭니다
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2507.10524" target="_blank" rel="noopener"
 &gt;Mixture-of-Recursions(MoR)&lt;/a&gt;는 토큰마다 필요한 반복 깊이를 달리하고, 해당 단계에서 활성화된 토큰 중심으로 계산과 캐시를 관리합니다. 쉬운 토큰에 쓰지 않은 계산을 어려운 토큰에 배분하려는 설계입니다.&lt;/p&gt;
&lt;p&gt;배포 환경에서는 이 선택이 더 까다로워집니다. 요청마다 필요한 반복 횟수가 다르면 한꺼번에 처리하던 작업 묶음의 효율이 떨어질 수 있습니다. 일찍 끝난 요청의 자원을 다른 작업이 바로 쓰도록 배치와 스케줄러가 따라가야 합니다. 이것은 구조에서 예상되는 운영 과제이지 특정 제품의 성능 측정 결과는 아닙니다.&lt;/p&gt;
&lt;p&gt;Ouro 모델 카드는 이 차이를 구체적으로 보여줍니다. 모델 자체에는 조기 종료 기능이 있지만, 확인한 카드에서는 vLLM이 이를 지원하지 않아 설정된 반복 횟수를 모두 실행한다고 설명합니다. 연구 모델의 기능이 추론 엔진에 그대로 구현되는 것은 아닙니다.&lt;/p&gt;
&lt;p&gt;따라서 래블업 같은 AI 인프라 소프트웨어 기업에 물어볼 질문도 구체적입니다. 반복 깊이가 다른 작업을 섞어 처리할 수 있는지, 캐시를 재사용할 수 있는지, 같은 품질에서 완료 시간과 전력비가 줄어드는지입니다. 이는 사업 기회를 평가할 질문이며 래블업의 지원 기능이나 매출 증가를 확인한 진술은 아닙니다.&lt;/p&gt;
&lt;h2 id="한국-반도체에는-수요-감소와-사용량-확대가-함께-열려-있습니다"&gt;한국 반도체에는 수요 감소와 사용량 확대가 함께 열려 있습니다
&lt;/h2&gt;&lt;p&gt;아래는 실적 전망이 아니라 루프 모델이 널리 채택될 경우의 조건부 시나리오입니다.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;조건&lt;/th&gt;
 &lt;th&gt;가능한 산업 영향&lt;/th&gt;
 &lt;th&gt;확인할 증거&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;같은 품질에 필요한 가중치와 캐시가 감소&lt;/td&gt;
 &lt;td&gt;요청당 메모리 부담 완화&lt;/td&gt;
 &lt;td&gt;동일 문맥·동시 요청 수의 메모리 실측&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;어려운 문제에 반복 계산을 더 투입&lt;/td&gt;
 &lt;td&gt;가속기 사용시간과 전력 부담 증가&lt;/td&gt;
 &lt;td&gt;성공한 작업당 GPU 시간·전력&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;비용 하락으로 사용량이 증가&lt;/td&gt;
 &lt;td&gt;총 인프라 수요 유지 또는 확대&lt;/td&gt;
 &lt;td&gt;고객의 실제 사용량과 구매 계획&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;반복·캐시 관리가 배치 효율을 악화&lt;/td&gt;
 &lt;td&gt;연구 성과의 상용화 지연&lt;/td&gt;
 &lt;td&gt;동일 지연 목표에서 처리량 비교&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;삼성전자·SK하이닉스 같은 메모리 공급자의 총수요를 보려면 요청당 자원 감소와 전체 요청 증가를 함께 봐야 합니다. 효율 개선이 수요 확대를 유도할 가능성은 있지만, 그 크기가 절감분을 반드시 넘어선다고 가정할 수는 없습니다. 이 글만으로 HBM 수요나 특정 종목의 이익 전망을 조정할 근거는 부족합니다.&lt;/p&gt;
&lt;p&gt;더 유용한 비교 단위는 성공한 작업 하나를 끝내는 비용입니다. 벤치마크 점수가 높아도 반복 지연이 길고 재시도가 많으면 운영 비용은 올라갑니다. 반대로 조금 더 계산해 첫 시도 성공률이 높아지면 전체 비용은 줄 수 있습니다.&lt;/p&gt;
&lt;h2 id="다음-검증은-파라미터-수보다-작업-비용입니다"&gt;다음 검증은 파라미터 수보다 작업 비용입니다
&lt;/h2&gt;&lt;p&gt;루프 모델의 산업적 가능성을 확인하려면 같은 정확도에서 전체 메모리, 완료 시간, 전력, 동시 처리량을 비교해야 합니다. 쉬운 질문의 평균뿐 아니라 오래 걸리는 요청의 지연도 봐야 합니다. 반복을 늘려도 품질이 더 좋아지지 않거나, 배치 효율 손실이 절감분보다 크다면 상용화 논거는 약해집니다.&lt;/p&gt;
&lt;p&gt;아스트라의 내부 구조가 추가 공개되면 이번 연구 계보와의 연결을 다시 판단할 수 있습니다. 그전에도 확인할 변화는 있습니다. 저장할 모델의 크기만으로 AI 인프라를 계산하던 방식에, 문제마다 얼마나 오래 계산하고 언제 멈출 것인가라는 변수가 더해졌습니다. 그 변수를 실제 비용 절감으로 바꾸는 능력이 하드웨어와 소프트웨어를 함께 평가할 기준이 됩니다.&lt;/p&gt;</description></item></channel></rss>