<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Inferencia on Korea Invest Insights</title><link>https://koreainvestinsights.com/es/tags/inferencia/</link><description>Recent content in Inferencia on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>es</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Fri, 11 Sep 2026 12:39:15 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/es/tags/inferencia/feed.xml" rel="self" type="application/rss+xml"/><item><title>El trabajo de oficina podría impulsar la próxima ola de tokens: Astra y los beneficios de las empresas coreanas</title><link>https://koreainvestinsights.com/es/post/astra-office-agent-token-demand-korean-equities-2026-09-11/</link><pubDate>Fri, 11 Sep 2026 12:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/es/post/astra-office-agent-token-demand-korean-equities-2026-09-11/</guid><description>&lt;p&gt;GPT-6 Astra, presentado el 3 de septiembre, y los productos financieros y de análisis de datos anunciados el 10 de septiembre sugieren un cambio en la competencia de la IA. La pregunta pasa de la calidad de una respuesta a la capacidad de mantener una tarea delegada hasta terminarla. La oferta financiera de OpenAI conecta información, fuentes y plantillas empresariales; la de datos conecta información interna y permisos.&lt;sup id="fnref:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:3"&gt;&lt;a href="#fn:3" class="footnote-ref" role="doc-noteref"&gt;3&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Esto podría extender el uso intensivo asociado a los desarrolladores al trabajo de oficina. Pero un lanzamiento no demuestra una explosión de consumo. Multiplicar el número de empleados administrativos por los tokens de un desarrollador tampoco constituye una previsión defendible.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;La tesis es condicional: una mejor interacción con el ordenador y una ejecución prolongada más fiable pueden reducir la intervención humana y aumentar las tareas realmente delegadas. El inversor en acciones coreanas debe identificar quién convierte esa demanda en ventas y precios de memoria, pedidos de equipos eléctricos o beneficios recurrentes de software.&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="la-programación-disponía-de-ejecución-y-comprobación"&gt;La programación disponía de ejecución y comprobación
&lt;/h2&gt;&lt;p&gt;El desarrollo ofrece repositorios que leer, herramientas que ejecutar y pruebas para contrastar el resultado. Es posible modificar un programa, examinar el fallo y repetir el proceso. Esto no significa que todo resultado informático sea fácil de verificar. La interpretación más limitada es que resultaba relativamente sencillo conectar ejecución y evaluación en un entorno de desarrollo.&lt;/p&gt;
&lt;p&gt;Un estudio de agentes de programación publicado en abril de 2026 encontró grandes diferencias de consumo entre modelos y trayectorias, incluso al repetir la misma tarea. Gastar más no mejoraba sistemáticamente la precisión. Por eso tampoco conviene extrapolar ese consumo a todos los trabajadores de oficina.&lt;sup id="fnref:4"&gt;&lt;a href="#fn:4" class="footnote-ref" role="doc-noteref"&gt;4&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;En la oficina, una promesa por correo, el estado de un cliente, una fórmula de Excel y una norma interna pueden estar separados. Una respuesta correcta no compensa una modificación incorrecta del registro. Hay que incorporar permisos y aprobaciones para convertir una respuesta en trabajo terminado.&lt;/p&gt;
&lt;p&gt;«Después de la programación» no implica que un mercado empiece cuando termina el otro. Ya se solapan. La hipótesis es que la intensidad del uso recurrente en funciones no técnicas podría convertirse en el próximo motor de crecimiento.&lt;/p&gt;
&lt;h2 id="el-ordenador-amplía-el-alcance-la-continuidad-cambia-la-economía"&gt;El ordenador amplía el alcance; la continuidad cambia la economía
&lt;/h2&gt;&lt;p&gt;Usar un ordenador significa interpretar pantallas, pulsar controles e introducir datos. Ejecutar tareas prolongadas exige conservar objetivos y evidencias, recuperarse de errores y comprobar el resultado. La primera capacidad amplía los procesos accesibles; la segunda reduce la necesidad de vigilancia continua.&lt;/p&gt;
&lt;p&gt;Ambas se refuerzan. Pulsar correctamente no sirve si el agente pierde el objetivo en el décimo paso. Razonar durante mucho tiempo tampoco basta si una persona debe trasladar cada resultado al sistema empresarial. Es una interpretación económica, no una propiedad matemática demostrada de la arquitectura del modelo.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Evaluación publicada&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Astra&lt;/th&gt;
 &lt;th style="text-align: right"&gt;GPT-5.6 Sol&lt;/th&gt;
 &lt;th&gt;Interpretación válida&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;AutomationBench&lt;/td&gt;
 &lt;td style="text-align: right"&gt;41,4%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;18,1%&lt;/td&gt;
 &lt;td&gt;Mejora en una evaluación de automatización, no porcentaje de todo el trabajo de oficina automatizado&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OSWorld 2.0, puntuación parcial&lt;/td&gt;
 &lt;td style="text-align: right"&gt;72,6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;65,7%&lt;/td&gt;
 &lt;td&gt;Crédito parcial en un subconjunto sin conexión, no probabilidad de ejecución totalmente autónoma&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Simulación de latencia de OSWorld&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 minutos&lt;/td&gt;
 &lt;td style="text-align: right"&gt;75 minutos&lt;/td&gt;
 &lt;td&gt;Tiempo bajo condiciones específicas, no ahorro laboral observado en empresas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Fuente: OpenAI. OSWorld utiliza el subconjunto sin conexión v2026.08.08. La configuración y las herramientas pueden diferir del servicio real; también importa la mejora del entorno de ejecución.&lt;sup id="fnref1:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La fiabilidad por paso puede tener efectos acumulativos. En un ejemplo que exige acertar 50 pasos independientes, una fiabilidad del 98% produce una probabilidad total de 0,98 elevado a 50, aproximadamente el 36,4%. Con el 99,5%, alcanza el 77,8%. Los errores reales están correlacionados y existen comprobaciones y reintentos. Es una ilustración, no una estimación del éxito de Astra en empresas.&lt;/p&gt;
&lt;p&gt;Tampoco es deseable hacerlo todo mediante clics. Cuando existe una interfaz de programación estable, una API, suele ser preferible; la interacción visual puede cubrir los huecos. La oportunidad consiste en conectar procesos sin sustituir todos los sistemas heredados.&lt;/p&gt;
&lt;h2 id="la-capacidad-empieza-a-integrarse-con-datos-y-operación"&gt;La capacidad empieza a integrarse con datos y operación
&lt;/h2&gt;&lt;p&gt;ChatGPT Financial Services, anunciado el 10 de septiembre, intenta conectar datos financieros y documentos con plantillas y controles de cada empresa. El producto de análisis conecta datos autorizados y contexto empresarial. Ambos muestran que el modelo por sí solo no resuelve el acceso ni la validación.&lt;sup id="fnref1:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref1:3"&gt;&lt;a href="#fn:3" class="footnote-ref" role="doc-noteref"&gt;3&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La beta pública de Agents API proporciona infraestructura para gestionar contexto, ejecutar herramientas y coordinar agentes. Evitar que cada compañía tenga que construir por su cuenta la ejecución persistente podría abaratar la conversión de capacidad técnica en tareas de pago. Están verificados el anuncio y las funciones descritas, no el gasto agregado de los clientes ni su rentabilidad.&lt;sup id="fnref:5"&gt;&lt;a href="#fn:5" class="footnote-ref" role="doc-noteref"&gt;5&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La primera oportunidad probablemente no sea sustituir sin supervisión todos los puestos. Comparar documentos, preparar visitas comerciales, elaborar informes periódicos y conciliar gastos son tareas delimitadas y comprobables. Pagos, contratos vinculantes y decisiones laborales deben mantener autorizaciones humanas adecuadas por el coste de un error.&lt;/p&gt;
&lt;h2 id="una-instrucción-corta-puede-generar-mucho-cálculo"&gt;Una instrucción corta puede generar mucho cálculo
&lt;/h2&gt;&lt;p&gt;«Compare tres proveedores y prepare la próxima reunión» es una frase. Ejecutarla exige localizar correos y ofertas, homogeneizar condiciones, crear tablas, verificar cifras y fuentes y aplicar una plantilla. Si falta información, una parte del proceso debe repetirse.&lt;/p&gt;
&lt;p&gt;La respuesta final puede ser breve mientras el modelo realiza numerosas llamadas. Los documentos consultados, los resultados de herramientas y las revisiones consumen tokens. Estos son unidades de entrada y salida del modelo, no un recuento de preguntas o frases.&lt;/p&gt;
&lt;p&gt;Anthropic comunicó en junio de 2025 que, en los datos de su sistema de investigación, los agentes consumían aproximadamente cuatro veces los tokens de una conversación y los sistemas multiagente unas quince veces. No es un multiplicador universal para el trabajo empresarial. Sí aporta evidencia del mecanismo que convierte una conversación en ejecución mucho más intensiva.&lt;sup id="fnref:6"&gt;&lt;a href="#fn:6" class="footnote-ref" role="doc-noteref"&gt;6&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La oportunidad sostenible no consiste en tardar más haciendo ineficientemente lo mismo. Consiste en realizar tareas antes descartadas por su coste: propuestas específicas para más clientes, conciliaciones más frecuentes o investigación competitiva más amplia. Los bucles de reintentos sin valor no demuestran disposición a pagar.&lt;/p&gt;
&lt;h2 id="la-frecuencia-de-delegación-importa-más-que-la-plantilla-total"&gt;La frecuencia de delegación importa más que la plantilla total
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;Tokens mensuales = empleados elegibles × proporción de usuarios activos × tareas diarias delegadas por usuario × días laborables × tokens acumulados por tarea.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;El total por tarea incluye todas las llamadas, entradas, salidas, comprobaciones y reintentos. También incluye las llamadas de agentes adicionales. Volver a multiplicarlo por el número de agentes o los reintentos duplicaría el cálculo.&lt;/p&gt;
&lt;p&gt;La siguiente sensibilidad mantiene una organización de 1.000 empleados y 22 días laborables. Son supuestos, no observaciones de clientes ni previsiones para 2027.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Estado alternativo&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Usuarios activos&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Actividad diaria&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Tokens por interacción/tarea&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Total mensual&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Frente a la base&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Conversación de referencia&lt;/td&gt;
 &lt;td style="text-align: right"&gt;20%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;10 preguntas&lt;/td&gt;
 &lt;td style="text-align: right"&gt;2.000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;88 millones&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1,0 veces&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Delegación limitada&lt;/td&gt;
 &lt;td style="text-align: right"&gt;30%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1 tarea&lt;/td&gt;
 &lt;td style="text-align: right"&gt;20.000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;132 millones&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1,5 veces&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Delegación habitual&lt;/td&gt;
 &lt;td style="text-align: right"&gt;50%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3 tareas&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40.000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1.320 millones&lt;/td&gt;
 &lt;td style="text-align: right"&gt;15,0 veces&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Delegación amplia&lt;/td&gt;
 &lt;td style="text-align: right"&gt;70%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;5 tareas&lt;/td&gt;
 &lt;td style="text-align: right"&gt;80.000&lt;/td&gt;
 &lt;td style="text-align: right"&gt;6.160 millones&lt;/td&gt;
 &lt;td style="text-align: right"&gt;70,0 veces&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;La base es 1.000 × 20% × 10 × 22 × 2.000 = 88.000.000 tokens. La delegación habitual es 1.000 × 50% × 3 × 22 × 40.000 = 1.320.000.000. Son estados alternativos, no incrementos que sumar a la base. Una conversación y una tarea terminada tampoco producen el mismo resultado.&lt;/p&gt;
&lt;p&gt;Las 15 veces combinan 2,5 veces más usuarios activos y seis veces más tokens diarios por usuario: de 20.000 a 120.000. No requieren multiplicar por quince la plantilla. Si la adopción se limita a un resumen diario, la expansión será mucho menor.&lt;/p&gt;
&lt;p&gt;Una población no técnica más grande no demuestra cuándo su demanda superará la de programación. La adopción, la frecuencia y el consumo por tarea deben ser suficientes. Además, no debe contarse dos veces el código generado por un usuario de negocio y la documentación creada por un desarrollador.&lt;/p&gt;
&lt;h2 id="el-ejemplo-de-056-dólares-muestra-el-umbral-económico"&gt;El ejemplo de 0,56 dólares muestra el umbral económico
&lt;/h2&gt;&lt;p&gt;Astra Standard cuesta públicamente 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida. Supongamos una tarea sin caché con 36.000 tokens de entrada y 4.000 de salida.&lt;sup id="fnref2:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;Coste del modelo = 36.000 / 1.000.000 × 10 dólares + 4.000 / 1.000.000 × 50 dólares = 0,56 dólares.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Los 4.000 tokens de salida son el total facturable de todas las llamadas, no la longitud del informe final. Si el razonamiento se factura como salida, también debe incluirse. Caché, modelos más baratos y tarifas de herramientas cambian el importe real.&lt;/p&gt;
&lt;p&gt;El escenario habitual genera 500 usuarios × 3 tareas × 22 días = 33.000 tareas mensuales. Con esa hipótesis, el gasto en modelos sería de 18.480 dólares mensuales, o 36,96 por usuario activo. Quedan fuera navegador, licencias de datos, integración, seguridad, formación y resolución de incidentes.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;Valor neto de delegar = ahorro laboral realizado o valor comercial adicional − modelos y herramientas − revisión y repetición humana − pérdidas por errores − costes operativos y de integración asignados.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Supongamos una tarea de bajo riesgo y resultado equivalente que una persona termina en 30 minutos, con un valor horario de 50 dólares: el coste original es de 25 dólares. Si la IA requiere cinco minutos de revisión y el 20% de las tareas fallidas se rehace desde cero, la repetición esperada añade seis minutos. El coste humano es de unos 9,17 dólares; con el modelo asciende a 9,73. Quedan aproximadamente 15,27 dólares para otros costes y errores. El éxito del 80% es un supuesto, no una lectura de las evaluaciones.&lt;/p&gt;
&lt;p&gt;Si revisar exige 25 minutos, el coste esperado asciende a 26,39 dólares. Una inferencia barata no salva la operación. El tiempo ahorrado tampoco reduce automáticamente la nómina: debe materializarse en reasignación, mayor producción o contrataciones evitadas.&lt;/p&gt;
&lt;p&gt;La métrica decisiva no es cuánto tiempo puede seguir funcionando un agente, sino cuánta intervención humana necesita por tarea terminada.&lt;/p&gt;
&lt;h2 id="tokens-facturación-cálculo-y-memoria-no-son-equivalentes"&gt;Tokens, facturación, cálculo y memoria no son equivalentes
&lt;/h2&gt;&lt;p&gt;Convertir 15 veces más tokens en 15 veces más demanda de semiconductores omite varias transformaciones.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Medida&lt;/th&gt;
 &lt;th&gt;Qué recoge&lt;/th&gt;
 &lt;th&gt;Por qué puede divergir&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Tokens lógicos&lt;/td&gt;
 &lt;td&gt;Entradas y salidas de todas las llamadas&lt;/td&gt;
 &lt;td&gt;Una entrada reutilizada puede seguir apareciendo en el total&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Factura real&lt;/td&gt;
 &lt;td&gt;Gasto con tarifas de entrada, caché y salida&lt;/td&gt;
 &lt;td&gt;Descuentos, suscripciones y modelos económicos alteran el precio realizado&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cálculo físico&lt;/td&gt;
 &lt;td&gt;Operaciones efectivamente realizadas&lt;/td&gt;
 &lt;td&gt;Arquitectura, tamaño, reutilización y eficiencia difieren&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Memoria y almacenamiento&lt;/td&gt;
 &lt;td&gt;Capacidad y ancho de banda para modelos, estados y datos&lt;/td&gt;
 &lt;td&gt;Importan concurrencia, contexto, retención y nivel de almacenamiento&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Manteniendo fija la composición del trabajo, 15 veces más tokens con una reducción del 80% del cálculo por token implican tres veces más cálculo. Si la reducción es del 95%, implican 0,75 veces: 15 × 0,20 y 15 × 0,05. Son sensibilidades, no previsiones de progreso técnico.&lt;/p&gt;
&lt;p&gt;Un menor coste puede aumentar el uso sin aumentar el gasto total. En igualdad de condiciones, el volumen debe crecer lo suficiente para compensar la caída del precio unitario. Hay que comparar los nuevos usos habilitados con el menor cálculo necesario para las tareas existentes.&lt;/p&gt;
&lt;p&gt;También importa la concurrencia. Un mismo volumen diario exige más capacidad si se concentra al comenzar la jornada. Agrupar tareas nocturnas que toleran demora puede mejorar utilización y posponer construcción. Multiplicar agentes por 24 horas no crea demanda automáticamente.&lt;/p&gt;
&lt;h2 id="la-tesis-de-memoria-abarca-varios-niveles"&gt;La tesis de memoria abarca varios niveles
&lt;/h2&gt;&lt;p&gt;Los sistemas conservan los pesos del modelo y resultados intermedios del contexto anterior. El estado reutilizable de atención suele denominarse caché KV. Las tareas largas y los usuarios simultáneos pueden aumentar la importancia de dónde se guarda y cómo se recupera.&lt;/p&gt;
&lt;p&gt;No todo debe permanecer en la costosa memoria de alto ancho de banda, HBM. Los anuncios de STX y CMX de NVIDIA, en marzo de 2026, plantean un nivel adicional de almacenamiento de contexto. Buscan ampliar el contexto accesible y aprovechar mejor las GPU existentes. Sus mejoras de rendimiento dependen de la configuración; no son una medición de toda la industria.&lt;sup id="fnref:7"&gt;&lt;a href="#fn:7" class="footnote-ref" role="doc-noteref"&gt;7&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;HyMCache, presentado en julio y revisado en agosto con el título A CXL Memory Rack for Multi-Turn LLM Serving, combina DRAM y SSD para reutilizar estados. Una comparación sacrificó parte del rendimiento a cambio de usar mucha menos DRAM. Es investigación, no prueba de adopción comercial masiva, pero contradice la extrapolación uno a uno entre tokens y un producto concreto de memoria.&lt;sup id="fnref:8"&gt;&lt;a href="#fn:8" class="footnote-ref" role="doc-noteref"&gt;8&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La hipótesis útil no es elegir entre desaparición o explosión garantizada de HBM. Es observar cómo HBM rápida, DRAM de servidor y SSD empresariales de alta capacidad reparten el trabajo y permiten capturar valor. Los tokens tampoco equivalen a documentos almacenados: releer un archivo aumenta el consumo lógico sin aumentar necesariamente los datos originales guardados.&lt;/p&gt;
&lt;h2 id="cuatro-mecanismos-de-beneficios-en-la-bolsa-coreana"&gt;Cuatro mecanismos de beneficios en la bolsa coreana
&lt;/h2&gt;&lt;p&gt;Este mapa organiza la investigación por exposición, no por atractivo de compra al precio actual.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Empresa&lt;/th&gt;
 &lt;th&gt;Exposición&lt;/th&gt;
 &lt;th&gt;Prueba de conversión en beneficios&lt;/th&gt;
 &lt;th&gt;Condición adversa&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;SK hynix (000660)&lt;/td&gt;
 &lt;td&gt;HBM, DRAM de servidor y SSD empresariales&lt;/td&gt;
 &lt;td&gt;Volumen, precio medio, mezcla premium y caja tras inversiones&lt;/td&gt;
 &lt;td&gt;La eficiencia compensa el volumen o una mayor oferta reduce precios&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Samsung Electronics (005930)&lt;/td&gt;
 &lt;td&gt;Amplia exposición a esos tres niveles&lt;/td&gt;
 &lt;td&gt;Producción para clientes, rendimientos, mezcla y resultados de otras divisiones&lt;/td&gt;
 &lt;td&gt;El avance técnico no se convierte en volumen rentable o aumentan pérdidas ajenas a memoria&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;LS ELECTRIC (010120)&lt;/td&gt;
 &lt;td&gt;Distribución eléctrica y equipos para centros de datos&lt;/td&gt;
 &lt;td&gt;Pedidos firmados, entregas, conversión de cartera, margen y cobro&lt;/td&gt;
 &lt;td&gt;Se utilizan instalaciones existentes o se retrasan/cancelan proyectos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Samsung SDS (018260)&lt;/td&gt;
 &lt;td&gt;Integración, operación, controles y plataformas empresariales&lt;/td&gt;
 &lt;td&gt;Uso recurrente pagado, renovación y beneficio tras costes de modelos&lt;/td&gt;
 &lt;td&gt;La reventa y el trabajo de integración absorben el ingreso&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="sk-hynix-ampliar-la-mirada-más-allá-de-hbm"&gt;SK hynix: ampliar la mirada más allá de HBM
&lt;/h3&gt;&lt;p&gt;La presentación del 26 de agosto de SK hynix incluyó HBM, DRAM de servidor y SSD empresariales. Esta cartera ofrece varias vías ante una jerarquía de memoria más diferenciada. Exhibir un producto no demuestra que todos generen el mismo ingreso al mismo tiempo.&lt;sup id="fnref:9"&gt;&lt;a href="#fn:9" class="footnote-ref" role="doc-noteref"&gt;9&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Importan los volúmenes y precios por producto, no una cifra agregada etiquetada como IA. Más HBM no explica todo si se debilitan DRAM de servidor o NAND. La caja operativa debe analizarse después de inversión y capital circulante.&lt;/p&gt;
&lt;p&gt;Es un candidato directo para investigar esta tesis, pero exposición directa no significa infravaloración. Una industria favorable puede dar rendimientos pobres si la ventaja de oferta ya está descontada.&lt;/p&gt;
&lt;h3 id="samsung-electronics-amplitud-con-efectos-que-se-compensan"&gt;Samsung Electronics: amplitud con efectos que se compensan
&lt;/h3&gt;&lt;p&gt;En sus resultados del 30 de julio, Samsung relacionó la perspectiva del segundo semestre para agentes con DRAM de servidor, SSD empresariales y HBM. Un proveedor está formulando una hipótesis parecida; sigue siendo una previsión de la dirección, no una demostración independiente del futuro.&lt;sup id="fnref:10"&gt;&lt;a href="#fn:10" class="footnote-ref" role="doc-noteref"&gt;10&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;La amplitud de memoria ofrece varias vías de exposición. El beneficio depende de producir rentablemente tras la cualificación del cliente, del rendimiento de fabricación y de la mezcla. Otros semiconductores y productos de consumo también influyen en el resultado consolidado.&lt;/p&gt;
&lt;p&gt;No debe sumarse el lanzamiento de Astra directamente a la previsión de beneficios. Hay que aislar la demanda adicional respecto al gasto en IA ya previsto y su efecto sobre volumen, precio o margen. Una nueva narración sobre pedidos existentes no constituye beneficio incremental.&lt;/p&gt;
&lt;h3 id="ls-electric-pedidos-y-construcción-no-regalías-por-token"&gt;LS ELECTRIC: pedidos y construcción, no regalías por token
&lt;/h3&gt;&lt;p&gt;El 24 de agosto, LS ELECTRIC anunció la ampliación de un contrato norteamericano para equipos de un centro de datos de IA, hasta aproximadamente 230.900 millones de wones. Es el importe total modificado, no un pedido íntegramente adicional al anterior. Verifica la conexión empresarial, pero precede al anuncio de Astra y no puede atribuirse a él.&lt;sup id="fnref:11"&gt;&lt;a href="#fn:11" class="footnote-ref" role="doc-noteref"&gt;11&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Si la inferencia de oficina solo eleva la utilización de instalaciones existentes, los pedidos eléctricos no aumentarán inmediatamente. La demanda persistente debe transformarse en construcción financiada y con acceso a electricidad. Tipos altos y retrasos pueden coexistir con una perspectiva favorable a largo plazo.&lt;/p&gt;
&lt;p&gt;Se deben comprobar pedidos, conversión de cartera en ingresos, beneficios de proyecto y cobros. Valorar la compañía como si cobrara cada vez que se procesa un token ignora el desfase y el riesgo de ejecución.&lt;/p&gt;
&lt;h3 id="samsung-sds-responsabilidad-operativa-frente-a-simple-reventa"&gt;Samsung SDS: responsabilidad operativa frente a simple reventa
&lt;/h3&gt;&lt;p&gt;Samsung SDS presenta FabriX como plataforma que conecta modelos y sistemas, permitiendo crear, operar y gobernar agentes. Brity Copilot incorpora IA al correo y las reuniones. Datos, permisos y responsabilidad operativa ofrecen exposición plausible a la adopción de oficina.&lt;sup id="fnref:12"&gt;&lt;a href="#fn:12" class="footnote-ref" role="doc-noteref"&gt;12&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref:13"&gt;&lt;a href="#fn:13" class="footnote-ref" role="doc-noteref"&gt;13&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Los propios proveedores de modelos amplían productos empresariales y conexiones. Una ventana de chat o el acceso revendido pueden sufrir presión de precios. La defensa competitiva parece más probable al resolver excepciones de sistemas heredados, permisos, auditoría e incidentes con contratos renovables.&lt;sup id="fnref2:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;sup id="fnref1:5"&gt;&lt;a href="#fn:5" class="footnote-ref" role="doc-noteref"&gt;5&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
&lt;p&gt;Un mayor uso pagado no asegura más beneficio si crecen antes los costes del modelo y la integración. Se requieren contratos externos recurrentes, retención después de implantar y márgenes tras inferencia. Los materiales revisados no acreditan un margen independiente del negocio de IA.&lt;/p&gt;
&lt;h2 id="acertar-con-la-industria-no-asegura-acertar-con-la-acción"&gt;Acertar con la industria no asegura acertar con la acción
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;Factor del precio de la acción = factor del beneficio por acción × factor del múltiplo de valoración.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Si el beneficio por acción aumenta un 30% pero el PER baja de 20 a 15 veces, el precio queda en 1,30 × 15 / 20 = 0,975: pierde un 2,5%. Son números ilustrativos, no valoraciones actuales. Se presupone la misma definición y horizonte del beneficio.&lt;/p&gt;
&lt;p&gt;No conviene multiplicar por cuatro el mejor trimestre de memoria y considerarlo permanente. Hay que normalizar precios, oferta, depreciación, inversiones y caja. El valor de un contrato de equipos no es beneficio inmediato, y los ingresos de software deben descontar la reventa.&lt;/p&gt;
&lt;p&gt;Este artículo no verifica exhaustivamente cotizaciones y consenso del día para cada empresa. No inventa objetivos ni niveles de entrada. Comprar exige calcular qué crecimiento descuenta el valor empresarial y si nuevos pedidos y repetición superan esa expectativa.&lt;/p&gt;
&lt;p&gt;La memoria merece investigación temprana porque permite exposición a varios modelos sin elegir una única aplicación ganadora. Sin embargo, diversificar entre proveedores de modelos no diversifica el ciclo de memoria. Poseer ambos grandes fabricantes coreanos conserva el riesgo común de inversión en IA y precios de memoria.&lt;/p&gt;
&lt;h2 id="desde-el-cuarto-trimestre-observar-repetición-e-intervención"&gt;Desde el cuarto trimestre, observar repetición e intervención
&lt;/h2&gt;&lt;p&gt;El cuarto trimestre de 2026 y el primero de 2027 constituyen una ventana de observación, no un calendario de adopción garantizado.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Observación&lt;/th&gt;
 &lt;th&gt;Refuerza la tesis&lt;/th&gt;
 &lt;th&gt;Obliga a rebajarla&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Uso pagado no técnico&lt;/td&gt;
 &lt;td&gt;Más tareas recurrentes dentro de la misma cohorte&lt;/td&gt;
 &lt;td&gt;Más cuentas, pero caída tras las pruebas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Economía por tarea&lt;/td&gt;
 &lt;td&gt;Menor revisión y repetición por resultado terminado&lt;/td&gt;
 &lt;td&gt;Verificar tarda casi tanto como hacer el trabajo&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Infraestructura física&lt;/td&gt;
 &lt;td&gt;Más cálculo o almacenamiento de contexto después de caché y selección de modelos&lt;/td&gt;
 &lt;td&gt;Suben tokens lógicos, no recursos físicos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Memoria coreana&lt;/td&gt;
 &lt;td&gt;Pedidos adicionales inesperados cambian volumen, precio y beneficio&lt;/td&gt;
 &lt;td&gt;Se renombra demanda antigua; crecen inventarios y bajan precios&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Equipos y software&lt;/td&gt;
 &lt;td&gt;Pedidos convertidos en caja, mejores renovaciones y márgenes&lt;/td&gt;
 &lt;td&gt;Retrasos, reventa de bajo margen e implantación puntual&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Si durante dos trimestres no se demuestra repetición no técnica ni economía unitaria, debe retrasarse la expectativa de la siguiente ola. Si la adopción crece pero la eficiencia compensa el hardware, puede mantenerse la tesis de software y reducirse la de semiconductores. Incidentes de seguridad que restrinjan permisos o una dependencia persistente de rescates humanos también la debilitan.&lt;/p&gt;
&lt;p&gt;Astra puede ampliar el mercado de tareas terminadas más que el de respuestas largas. La oportunidad de compra en Corea aparece cuando la posibilidad se convierte en gasto recurrente y caja por encima de lo ya descontado.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;Información comprobada al 11 de septiembre de 2026. Se distinguen afirmaciones empresariales de validación independiente. Los escenarios de consumo, costes y cotización son supuestos del autor. No es asesoramiento personalizado.&lt;/p&gt;
&lt;h3 id="fuentes"&gt;Fuentes
&lt;/h3&gt;&lt;div class="footnotes" role="doc-endnotes"&gt;
&lt;hr&gt;
&lt;ol&gt;
&lt;li id="fn:1"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;GPT-6 Astra&lt;/a&gt;, septiembre de 2026; condiciones de evaluación y precios Standard.&amp;#160;&lt;a href="#fnref:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref2:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:2"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/introducing-chatgpt-financial-services/" target="_blank" rel="noopener"
 &gt;ChatGPT Financial Services&lt;/a&gt;, 10-09-2026.&amp;#160;&lt;a href="#fnref:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref2:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:3"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/put-data-to-work/" target="_blank" rel="noopener"
 &gt;Put data to work&lt;/a&gt;, 10-09-2026.&amp;#160;&lt;a href="#fnref:3" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:3" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:4"&gt;
&lt;p&gt;Bai y otros, &lt;a class="link" href="https://arxiv.org/abs/2604.22750v2" target="_blank" rel="noopener"
 &gt;How Do AI Agents Spend Your Money?&lt;/a&gt;, presentado el 24-04 y revisado el 29-04-2026. Evidencia del resumen, sin generalización a toda oficina.&amp;#160;&lt;a href="#fnref:4" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:5"&gt;
&lt;p&gt;OpenAI, &lt;a class="link" href="https://openai.com/index/introducing-the-agents-api/" target="_blank" rel="noopener"
 &gt;Agents API&lt;/a&gt;, 10-09-2026.&amp;#160;&lt;a href="#fnref:5" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&amp;#160;&lt;a href="#fnref1:5" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:6"&gt;
&lt;p&gt;Anthropic, &lt;a class="link" href="https://www.anthropic.com/engineering/multi-agent-research-system" target="_blank" rel="noopener"
 &gt;How we built our multi-agent research system&lt;/a&gt;, 13-06-2025.&amp;#160;&lt;a href="#fnref:6" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:7"&gt;
&lt;p&gt;NVIDIA, &lt;a class="link" href="https://nvidianews.nvidia.com/news/nvidia-launches-bluefield-4-stx-storage-architecture-with-broad-industry-adoption" target="_blank" rel="noopener"
 &gt;BlueField-4 STX&lt;/a&gt;, 16-03-2026.&amp;#160;&lt;a href="#fnref:7" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:8"&gt;
&lt;p&gt;Jang y otros, &lt;a class="link" href="https://arxiv.org/abs/2607.18141v3" target="_blank" rel="noopener"
 &gt;A CXL Memory Rack for Multi-Turn LLM Serving&lt;/a&gt;, presentado el 20-07; v3 del 05-08-2026. Investigación, no adopción comercial.&amp;#160;&lt;a href="#fnref:8" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:9"&gt;
&lt;p&gt;SK hynix, &lt;a class="link" href="https://news.skhynix.com/en/dtf-2026/" target="_blank" rel="noopener"
 &gt;DTF 2026&lt;/a&gt;, 26-08-2026.&amp;#160;&lt;a href="#fnref:9" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:10"&gt;
&lt;p&gt;Samsung, &lt;a class="link" href="https://news.samsung.com/global/samsung-electronics-announces-second-quarter-2026-results" target="_blank" rel="noopener"
 &gt;Resultados del segundo trimestre de 2026&lt;/a&gt;, 30-07-2026.&amp;#160;&lt;a href="#fnref:10" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:11"&gt;
&lt;p&gt;LS ELECTRIC, &lt;a class="link" href="https://www.ls-electric.com/ko/pr/news/view/401457?b_date=&amp;amp;e_date=&amp;amp;k_type=both&amp;amp;k_word=&amp;amp;page=1&amp;amp;rowsPerPage=10&amp;amp;visiblePage=10" target="_blank" rel="noopener"
 &gt;Contrato de equipos eléctricos&lt;/a&gt;, 24-08-2026; total modificado, no importe totalmente adicional.&amp;#160;&lt;a href="#fnref:11" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:12"&gt;
&lt;p&gt;Samsung SDS, &lt;a class="link" href="https://www.samsungsds.com/kr/ai-fabrix/fabrix.html" target="_blank" rel="noopener"
 &gt;FabriX&lt;/a&gt;, consulta del 11-09-2026.&amp;#160;&lt;a href="#fnref:12" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:13"&gt;
&lt;p&gt;Samsung SDS, &lt;a class="link" href="https://www.samsungsds.com/kr/ai-agent/ai-agent.html" target="_blank" rel="noopener"
 &gt;AI Agent&lt;/a&gt;, consulta del 11-09-2026.&amp;#160;&lt;a href="#fnref:13" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/div&gt;</description></item><item><title>Después de Astra: Cómo los Transformers en Bucle Cambian la Economía de la Infraestructura de IA</title><link>https://koreainvestinsights.com/es/post/astra-loop-transformers-inference-economics-2026-09-08/</link><pubDate>Tue, 08 Sep 2026 18:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/es/post/astra-loop-transformers-inference-economics-2026-09-08/</guid><description>&lt;p&gt;¿Puede un modelo pequeño resolver problemas más complejos pasando repetidamente por la misma red neuronal? El CEO de Lablup, Jeongkyu Shin, retoma esta pregunta en su &lt;a class="link" href="https://www.facebook.com/jeongkyu.shin/posts/pfbid02jm4iibHsgU11P7gY8e4SZKtKYNNdtHF6wdTQK2EdyDeTMEwxiDvHnHyhyAKphLml" target="_blank" rel="noopener"
 &gt;ensayo de Facebook sobre los transformers en bucle tras Astra&lt;/a&gt;. Detrás de la cuestión arquitectónica hay una decisión de infraestructura: cuántos aceleradores y cuánta memoria adquirir, y cómo operarlos.&lt;/p&gt;
&lt;p&gt;La investigación pública demuestra que un modelo puede mejorar la resolución de problemas manteniendo sus pesos almacenados intactos, ejecutando repetidamente un bloque computacional compartido. Pero la repetición consume tiempo y energía. Un modelo más pequeño no implica automáticamente un servicio más barato.&lt;/p&gt;
&lt;p&gt;Este es un análisis independiente motivado por el ensayo de Shin, complementado con artículos originales y tarjetas de modelo. Separamos la interpretación del ensayo sobre Astra de los hechos públicamente establecidos, y tratamos las implicaciones para la industria como análisis condicional. Las fuentes fueron verificadas el 8 de septiembre de 2026.&lt;/p&gt;
&lt;h2 id="los-resultados-de-astra-no-revelan-su-arquitectura"&gt;Los resultados de Astra no revelan su arquitectura
&lt;/h2&gt;&lt;p&gt;El anuncio de OpenAI del 3 de septiembre confirma el lanzamiento de GPT-6 Astra y sus mejoras de capacidad. Sin embargo, el &lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;anuncio&lt;/a&gt; y la &lt;a class="link" href="https://deploymentsafety.openai.com/gpt-6-astra" target="_blank" rel="noopener"
 &gt;tarjeta del sistema&lt;/a&gt; aquí revisados no revelan una arquitectura de transformer en bucle, el número de recursiones ni los recuentos totales y activos de parámetros.&lt;/p&gt;
&lt;p&gt;Por tanto, no tratamos la conexión entre Astra y un diseño al estilo Huginn como un hecho establecido. Las afirmaciones sobre tamaños de 10T/1T del ensayo y la cita sobre AGI también quedan excluidas de las premisas de este análisis. Un mejor rendimiento por sí solo no permite identificar la arquitectura interna.&lt;/p&gt;
&lt;p&gt;Aun así, hay razones sólidas para examinar la recurrencia. Los modelos públicos ya muestran intentos de variar la capacidad de parámetros almacenados y el cómputo de inferencia de forma independiente. Ese desarrollo puede evaluarse sin depender del diseño no revelado de un modelo de frontera.&lt;/p&gt;
&lt;h2 id="almacenar-más-y-computar-más-tiempo-son-decisiones-distintas"&gt;Almacenar más y computar más tiempo son decisiones distintas
&lt;/h2&gt;&lt;p&gt;Los parámetros son los pesos numéricos ajustados durante el entrenamiento. Ampliar un modelo generalmente aumenta la cantidad almacenada. La Mezcla de Expertos, o MoE, selecciona algunos módulos expertos para cada entrada, con el objetivo de ejecutar menos cómputo en relación con la capacidad total del modelo.&lt;/p&gt;
&lt;p&gt;MoE no surgió únicamente con Switch Transformer. El &lt;a class="link" href="https://arxiv.org/abs/1701.06538" target="_blank" rel="noopener"
 &gt;artículo de MoE con puertas dispersas de 2017&lt;/a&gt; precedió a &lt;a class="link" href="https://arxiv.org/abs/2101.03961" target="_blank" rel="noopener"
 &gt;Switch Transformer en 2021&lt;/a&gt;, que simplificó el enrutamiento y el entrenamiento a escala. Un recuento total mayor de parámetros tampoco implica necesariamente más capas.&lt;/p&gt;
&lt;p&gt;La cadena de pensamiento (CoT) genera tokens intermedios que extienden el contexto para el cómputo posterior. Un modelo en bucle pasa su estado interno de nuevo a través de un bloque con pesos compartidos. El cómputo intermedio no tiene que convertirse en una palabra en cada paso. Estos enfoques también pueden combinarse.&lt;/p&gt;
&lt;p&gt;Comparar lo que aporta cada enfoque aclara el compromiso.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Enfoque&lt;/th&gt;
 &lt;th&gt;Qué aumenta&lt;/th&gt;
 &lt;th&gt;Coste potencial&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modelo más grande&lt;/td&gt;
 &lt;td&gt;Pesos o capacidad de expertos&lt;/td&gt;
 &lt;td&gt;Almacenamiento, cómputo activo, comunicación&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Cadena de pensamiento&lt;/td&gt;
 &lt;td&gt;Tokens de razonamiento intermedio&lt;/td&gt;
 &lt;td&gt;Tiempo de generación, contexto y caché&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Profundidad recurrente&lt;/td&gt;
 &lt;td&gt;Pasadas a través de un bloque compartido&lt;/td&gt;
 &lt;td&gt;Cómputo repetido, latencia, gestión de estado&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Esta es una comparación conceptual. La economía real requiere mediciones a precisión, longitud de entrada y condiciones de hardware equivalentes.&lt;/p&gt;
&lt;h2 id="la-investigación-sobre-pensar-antes-de-hablar-utiliza-mecanismos-distintos"&gt;La investigación sobre pensar antes de hablar utiliza mecanismos distintos
&lt;/h2&gt;&lt;p&gt;Los &lt;a class="link" href="https://arxiv.org/abs/2310.02226" target="_blank" rel="noopener"
 &gt;tokens de pausa&lt;/a&gt; proporcionan cómputo adicional antes de dar una respuesta. &lt;a class="link" href="https://arxiv.org/abs/2403.09629" target="_blank" rel="noopener"
 &gt;Quiet-STaR&lt;/a&gt; aprende a generar razonamientos intermedios que ayudan a predecir los tokens siguientes. Su nombre no debe interpretarse como prueba de que utiliza razonamiento continuo no verbal en estado continuo.&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2412.06769" target="_blank" rel="noopener"
 &gt;Coconut&lt;/a&gt; retroalimenta el estado oculto final como entrada sin convertirlo en una palabra. Explora la posibilidad de retener alternativas en una representación interna antes de comprometerse con el lenguaje. Esto no es evidencia de conciencia humana ni de pensamiento autónomo continuamente activo.&lt;/p&gt;
&lt;p&gt;La investigación sobre profundidad recurrente incluye el &lt;a class="link" href="https://arxiv.org/abs/1807.03819" target="_blank" rel="noopener"
 &gt;Universal Transformer de 2018&lt;/a&gt;, que repite una transformación y puede asignar cómputo de forma diferente entre posiciones. La dificultad está en entrenar una repetición útil: un bloque compartido debe manejar estados de diferentes etapas, y otra pasada debe mejorar el resultado. Los roles de capa en conflicto son una intuición útil, no una explicación universal para cada fallo.&lt;/p&gt;
&lt;h2 id="copiar-capas-es-distinto-a-compartir-los-mismos-pesos"&gt;Copiar capas es distinto a compartir los mismos pesos
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2312.15166" target="_blank" rel="noopener"
 &gt;SOLAR 10.7B&lt;/a&gt; de Upstage introdujo el escalado de profundidad, o DUS: copiar capas existentes, eliminar algunas, conectarlas en un modelo más profundo y continuar el entrenamiento. Las copias que comienzan siendo idénticas pueden desarrollar pesos distintos. El modelo resultante almacena más parámetros.&lt;/p&gt;
&lt;p&gt;Un modelo recurrente sigue compartiendo los mismos pesos. DUS reutiliza el entrenamiento previo para construir un modelo más profundo; el bucle aumenta la profundidad de ejecución sin una expansión correspondiente en los pesos almacenados. Tratar ambas técnicas como la misma técnica de ahorro de memoria conduce a un modelo de costes incorrecto.&lt;/p&gt;
&lt;h2 id="leer-los-números-de-huginn-y-ouro-con-sus-condiciones-de-comparación"&gt;Leer los números de Huginn y Ouro con sus condiciones de comparación
&lt;/h2&gt;&lt;p&gt;La &lt;a class="link" href="https://arxiv.org/abs/2502.05171" target="_blank" rel="noopener"
 &gt;investigación Huginn&lt;/a&gt; de Geiping y colaboradores separa el procesamiento de entrada, un núcleo recurrente y el procesamiento de salida. El núcleo refina el estado interno mediante ejecución repetida. Los autores entrenaron un modelo de 3.500 millones de parámetros con 800.000 millones de tokens e informaron de una mejora en el rendimiento en tareas de razonamiento al aumentar el cómputo recurrente.&lt;/p&gt;
&lt;p&gt;La cifra de 50B del resumen requiere atención. Describe mejoras hasta una carga computacional equivalente a 50.000 millones de parámetros. No garantiza la calidad de un modelo de 50B en cada tarea, ni que dicha calidad se obtenga al mismo coste. Un conjunto pequeño de pesos que utiliza más cómputo es un resultado de investigación; la economía del servicio requiere medición por separado.&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2510.25741" target="_blank" rel="noopener"
 &gt;Ouro&lt;/a&gt;, de ByteDance y colaboradores, se publicó en octubre de 2025. El artículo abarca una familia de modelos de 1.400 y 2.600 millones de parámetros e informa de comparaciones con modelos de hasta 12.000 millones en distintos benchmarks. Sin embargo, la &lt;a class="link" href="https://huggingface.co/ByteDance/Ouro-1.4B" target="_blank" rel="noopener"
 &gt;tarjeta oficial del modelo Ouro-1.4B&lt;/a&gt; describe ese modelo particular como equivalente a modelos convencionales de 3 a 4B. Afirmar que 1.4B siempre reemplaza a 12B sería exagerar la comparación.&lt;/p&gt;
&lt;p&gt;Los recuentos de parámetros deben leerse junto con los datos de entrenamiento, los recuentos de recurrencia y las tareas de evaluación. La aparente eficiencia de inferencia también puede ser consecuencia de una inversión sustancial en preentrenamiento.&lt;/p&gt;
&lt;h2 id="menos-pesos-almacenados-no-eliminan-los-cuellos-de-botella-de-memoria"&gt;Menos pesos almacenados no eliminan los cuellos de botella de memoria
&lt;/h2&gt;&lt;p&gt;Consideremos un cálculo ilustrativo. Almacenar 3.500 millones de parámetros a 2 bytes cada uno requiere aproximadamente 7 GB para los pesos. El uso repetido de esos pesos no multiplica su requisito de almacenamiento por el número de recursiones. Esto es aritmética, no una medición del uso total de memoria GPU de Huginn.&lt;/p&gt;
&lt;p&gt;La memoria total de inferencia también incluye la caché KV utilizada para reutilizar el contexto previo, los estados intermedios y el espacio de trabajo de ejecución. La &lt;a class="link" href="https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/" target="_blank" rel="noopener"
 &gt;guía de optimización de inferencia de NVIDIA&lt;/a&gt; distingue los pesos y la caché KV como los principales componentes de memoria. Los contextos más largos y un mayor número de solicitudes concurrentes aumentan la presión sobre la caché. Si las cachés pueden compartirse entre pasos recurrentes depende del diseño.&lt;/p&gt;
&lt;p&gt;La reutilización de pesos también es diferente a reducir el movimiento de datos. Si los pesos no pueden permanecer en la memoria rápida en chip, otra pasada puede requerir leerlos de HBM de nuevo. La repetición puede incrementar la demanda de ancho de banda junto con el cómputo. Sin examinar la jerarquía de memoria y la implementación, no se puede declarar que el bucle sea la razón por la que HBM se vuelve innecesario.&lt;/p&gt;
&lt;h2 id="el-software-debe-materializar-los-ahorros-de-la-salida-anticipada"&gt;El software debe materializar los ahorros de la salida anticipada
&lt;/h2&gt;&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2507.10524" target="_blank" rel="noopener"
 &gt;Mixture-of-Recursions (MoR)&lt;/a&gt; varía la profundidad recursiva por token y gestiona el cómputo y el almacenamiento en caché en torno a los tokens aún activos a una profundidad determinada. El objetivo es dirigir el cómputo hacia los tokens más difíciles en lugar de gastarlo en los sencillos.&lt;/p&gt;
&lt;p&gt;El servicio hace esto más difícil. Los distintos requisitos de recurrencia entre solicitudes pueden reducir la eficiencia del procesamiento por lotes. Los planificadores necesitan dejar que otro trabajo use los recursos liberados al completarse antes. Este es un desafío operativo anticipado, no un resultado medido para un producto comercial concreto.&lt;/p&gt;
&lt;p&gt;La tarjeta del modelo Ouro ofrece un ejemplo concreto. El modelo admite salida anticipada, pero la tarjeta indica que vLLM no admite esta función y en su lugar ejecuta el número completo de recursiones configurado. Una capacidad arquitectónica no se implementa automáticamente en un motor de servicio.&lt;/p&gt;
&lt;p&gt;Esto plantea preguntas concretas para empresas de software de infraestructura de IA como Lablup: ¿puede la plataforma procesar en lotes trabajos con distintas profundidades de recurrencia, reutilizar cachés y reducir el tiempo de finalización y el coste energético con calidad equivalente? Estas son preguntas para evaluar una oportunidad, no afirmaciones de que Lablup ya admita esas funciones o haya demostrado crecimiento de ingresos gracias a ellas.&lt;/p&gt;
&lt;h2 id="los-semiconductores-coreanos-enfrentan-tanto-el-ahorro-de-recursos-como-la-expansión-del-uso"&gt;Los semiconductores coreanos enfrentan tanto el ahorro de recursos como la expansión del uso
&lt;/h2&gt;&lt;p&gt;Los siguientes son escenarios condicionales para una adopción más amplia de modelos en bucle, no previsiones de resultados.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Condición&lt;/th&gt;
 &lt;th&gt;Posible efecto en la industria&lt;/th&gt;
 &lt;th&gt;Evidencia necesaria&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Menos pesos y menos caché con calidad equivalente&lt;/td&gt;
 &lt;td&gt;Menor presión de memoria por solicitud&lt;/td&gt;
 &lt;td&gt;Memoria medida con contexto y concurrencia iguales&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Más recurrencia en problemas difíciles&lt;/td&gt;
 &lt;td&gt;Mayor demanda de tiempo de acelerador y energía&lt;/td&gt;
 &lt;td&gt;Tiempo de GPU y energía por tarea completada con éxito&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Menor coste amplía el uso&lt;/td&gt;
 &lt;td&gt;Demanda de infraestructura agregada estable o mayor&lt;/td&gt;
 &lt;td&gt;Uso real de clientes y planes de compra&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;La recurrencia y la gestión de caché reducen la eficiencia del procesamiento por lotes&lt;/td&gt;
 &lt;td&gt;Comercialización retrasada&lt;/td&gt;
 &lt;td&gt;Rendimiento al mismo objetivo de latencia&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Para los proveedores de memoria como Samsung Electronics y SK hynix, la demanda agregada depende tanto de los recursos por solicitud como del número de solicitudes. La eficiencia puede estimular la adopción, pero no puede asumirse que ese crecimiento supere los ahorros. Este análisis por sí solo no es suficiente para revisar las previsiones de demanda de HBM ni los pronósticos de beneficios de las empresas.&lt;/p&gt;
&lt;p&gt;Una comparación más útil es el coste de completar una tarea exitosa. Las puntuaciones altas en benchmarks pueden seguir siendo costosas si la repetición lleva demasiado tiempo o los reintentos son frecuentes. Por el contrario, el cómputo adicional puede reducir el coste total si mejora lo suficiente el éxito en el primer intento.&lt;/p&gt;
&lt;h2 id="la-próxima-prueba-es-el-coste-por-tarea-no-el-recuento-de-parámetros"&gt;La próxima prueba es el coste por tarea, no el recuento de parámetros
&lt;/h2&gt;&lt;p&gt;Verificar el caso industrial requiere comparar la memoria total, el tiempo de finalización, la energía y el rendimiento concurrente con precisión equivalente. La latencia en cola importa tanto como los promedios para las preguntas sencillas. Si más recurrencia deja de mejorar la calidad, o las pérdidas por procesamiento en lotes superan los ahorros de recursos, el argumento de comercialización se debilita.&lt;/p&gt;
&lt;p&gt;Una mayor divulgación arquitectónica podría establecer si Astra pertenece a esta línea de investigación. Mientras tanto, un cambio verificable permanece: la planificación de infraestructura debe considerar cuánto tiempo calcular sobre cada problema y cuándo detenerse, junto con el tamaño del modelo almacenado. Convertir esa flexibilidad en costes reales más bajos es una prueba conjunta de hardware y software.&lt;/p&gt;</description></item></channel></rss>