<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Lablup on Korea Invest Insights</title><link>https://koreainvestinsights.com/fr/tags/lablup/</link><description>Recent content in Lablup on Korea Invest Insights</description><generator>Hugo -- gohugo.io</generator><language>fr</language><copyright>koreainvestinsights.com · @korea_invest_insights</copyright><lastBuildDate>Tue, 08 Sep 2026 22:02:51 +0900</lastBuildDate><atom:link href="https://koreainvestinsights.com/fr/tags/lablup/feed.xml" rel="self" type="application/rss+xml"/><item><title>Après Astra : comment les transformeurs en boucle bouleversent l'économie de l'infrastructure IA</title><link>https://koreainvestinsights.com/fr/post/astra-loop-transformers-inference-economics-2026-09-08/</link><pubDate>Tue, 08 Sep 2026 18:00:00 +0900</pubDate><guid>https://koreainvestinsights.com/fr/post/astra-loop-transformers-inference-economics-2026-09-08/</guid><description>&lt;p&gt;Un petit modèle peut-il résoudre des problèmes plus complexes en traversant plusieurs fois le même réseau de neurones ? Jeongkyu Shin, PDG de Lablup, reprend cette question dans son &lt;a class="link" href="https://www.facebook.com/jeongkyu.shin/posts/pfbid02jm4iibHsgU11P7gY8e4SZKtKYNNdtHF6wdTQK2EdyDeTMEwxiDvHnHyhyAKphLml" target="_blank" rel="noopener"
 &gt;essai Facebook sur les transformeurs en boucle après Astra&lt;/a&gt;. Derrière la question architecturale se cache une décision d&amp;rsquo;infrastructure : combien d&amp;rsquo;accélérateurs et quelle quantité de mémoire acheter, et comment les exploiter.&lt;/p&gt;
&lt;p&gt;La recherche publique montre qu&amp;rsquo;un modèle peut améliorer sa capacité de résolution tout en conservant des poids fixes, en exécutant de manière répétée un bloc de calcul partagé. Mais la répétition consomme du temps et de l&amp;rsquo;énergie. Un modèle plus petit ne signifie pas automatiquement un service moins coûteux.&lt;/p&gt;
&lt;p&gt;Il s&amp;rsquo;agit d&amp;rsquo;une analyse indépendante suscitée par l&amp;rsquo;essai de Shin, complétée par des articles originaux et des fiches de modèles. Nous distinguons l&amp;rsquo;interprétation d&amp;rsquo;Astra avancée dans l&amp;rsquo;essai des faits publiquement établis, et traitons les implications industrielles comme une analyse conditionnelle. Les sources ont été vérifiées le 8 septembre 2026.&lt;/p&gt;
&lt;h2 id="les-résultats-dastra-ne-divulguent-pas-son-architecture"&gt;Les résultats d&amp;rsquo;Astra ne divulguent pas son architecture
&lt;/h2&gt;&lt;p&gt;L&amp;rsquo;annonce d&amp;rsquo;OpenAI du 3 septembre confirme le lancement de GPT-6 Astra et ses améliorations de performance. Cependant, &lt;a class="link" href="https://openai.com/index/gpt-6-astra/" target="_blank" rel="noopener"
 &gt;l&amp;rsquo;annonce&lt;/a&gt; et la &lt;a class="link" href="https://deploymentsafety.openai.com/gpt-6-astra" target="_blank" rel="noopener"
 &gt;fiche système&lt;/a&gt; examinées ici ne divulguent ni une architecture de type transformeur en boucle, ni le nombre de récurrences, ni le total des paramètres actifs.&lt;/p&gt;
&lt;p&gt;Nous ne considérons donc pas le lien entre Astra et une conception de type Huginn comme un fait établi. Les affirmations de taille 10T/1T figurant dans l&amp;rsquo;essai, ainsi que la citation sur l&amp;rsquo;AGI, sont également exclues des prémisses de cette analyse. De meilleures performances seules ne permettent pas d&amp;rsquo;identifier l&amp;rsquo;architecture interne.&lt;/p&gt;
&lt;p&gt;Il existe néanmoins une bonne raison d&amp;rsquo;étudier la récurrence. Des modèles publics montrent déjà des tentatives de dissocier la capacité en paramètres stockés et la quantité de calcul à l&amp;rsquo;inférence. Cette évolution peut être évaluée sans s&amp;rsquo;appuyer sur la conception non divulguée d&amp;rsquo;un modèle de frontière.&lt;/p&gt;
&lt;h2 id="stocker-davantage-et-calculer-plus-longtemps-sont-deux-choix-distincts"&gt;Stocker davantage et calculer plus longtemps sont deux choix distincts
&lt;/h2&gt;&lt;p&gt;Les paramètres sont les poids numériques ajustés lors de l&amp;rsquo;entraînement. Agrandir un modèle augmente généralement la quantité stockée. Le Mixture of Experts, ou MoE, sélectionne certains modules experts pour chaque entrée, dans le but d&amp;rsquo;exécuter moins de calcul relativement à la capacité totale du modèle.&lt;/p&gt;
&lt;p&gt;Le MoE ne tire pas son origine du seul Switch Transformer. Le &lt;a class="link" href="https://arxiv.org/abs/1701.06538" target="_blank" rel="noopener"
 &gt;papier sur le MoE à gating clairsemé de 2017&lt;/a&gt; a précédé le &lt;a class="link" href="https://arxiv.org/abs/2101.03961" target="_blank" rel="noopener"
 &gt;Switch Transformer de 2021&lt;/a&gt;, qui a simplifié le routage et l&amp;rsquo;entraînement à grande échelle. Un nombre total de paramètres plus élevé ne signifie pas nécessairement plus de couches.&lt;/p&gt;
&lt;p&gt;Le raisonnement par chaîne de pensée (CoT) génère des tokens intermédiaires qui étendent le contexte pour les calculs ultérieurs. Un modèle en boucle fait repasser son état interne à travers un bloc à poids partagés. Le calcul intermédiaire n&amp;rsquo;a pas besoin d&amp;rsquo;être converti en mot à chaque étape. Ces approches peuvent également être combinées.&lt;/p&gt;
&lt;p&gt;Comparer ce qu&amp;rsquo;apporte chaque approche permet de clarifier les arbitrages.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Approche&lt;/th&gt;
 &lt;th&gt;Ce qui augmente&lt;/th&gt;
 &lt;th&gt;Coût potentiel&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Modèle plus grand&lt;/td&gt;
 &lt;td&gt;Poids ou capacité des experts&lt;/td&gt;
 &lt;td&gt;Stockage, calcul actif, communication&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Chaîne de pensée&lt;/td&gt;
 &lt;td&gt;Tokens de raisonnement intermédiaire&lt;/td&gt;
 &lt;td&gt;Temps de génération, contexte et cache&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Profondeur récurrente&lt;/td&gt;
 &lt;td&gt;Passages à travers un bloc partagé&lt;/td&gt;
 &lt;td&gt;Calcul répété, latence, gestion d&amp;rsquo;état&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Il s&amp;rsquo;agit d&amp;rsquo;une comparaison conceptuelle. L&amp;rsquo;économie réelle nécessite des mesures à précision, longueur d&amp;rsquo;entrée et conditions matérielles équivalentes.&lt;/p&gt;
&lt;h2 id="la-recherche-sur--réfléchir-avant-de-répondre--utilise-des-mécanismes-distincts"&gt;La recherche sur « réfléchir avant de répondre » utilise des mécanismes distincts
&lt;/h2&gt;&lt;p&gt;Les &lt;a class="link" href="https://arxiv.org/abs/2310.02226" target="_blank" rel="noopener"
 &gt;pause tokens&lt;/a&gt; fournissent un calcul supplémentaire avant une réponse. &lt;a class="link" href="https://arxiv.org/abs/2403.09629" target="_blank" rel="noopener"
 &gt;Quiet-STaR&lt;/a&gt; apprend à générer des raisonnements intermédiaires qui aident à prédire les tokens suivants. Son nom ne doit pas être lu comme la preuve qu&amp;rsquo;il recourt à un raisonnement non verbal en état continu.&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2412.06769" target="_blank" rel="noopener"
 &gt;Coconut&lt;/a&gt; réinjecte l&amp;rsquo;état caché final en entrée sans le convertir en mot. Ce mécanisme explore la conservation de possibilités dans une représentation interne avant de s&amp;rsquo;engager dans le langage. Ce n&amp;rsquo;est pas une preuve de conscience humaine ni d&amp;rsquo;une pensée autonome en fonctionnement continu.&lt;/p&gt;
&lt;p&gt;La recherche sur la profondeur récurrente inclut le &lt;a class="link" href="https://arxiv.org/abs/1807.03819" target="_blank" rel="noopener"
 &gt;Universal Transformer de 2018&lt;/a&gt;, qui répète une transformation et peut allouer le calcul différemment selon les positions. La difficulté réside dans l&amp;rsquo;entraînement d&amp;rsquo;une répétition utile : un bloc partagé doit gérer des états issus d&amp;rsquo;étapes différentes, et un passage supplémentaire doit améliorer le résultat. Des rôles de couches conflictuels constituent une intuition utile, et non une explication universelle de chaque échec.&lt;/p&gt;
&lt;h2 id="copier-des-couches-diffère-du-partage-des-mêmes-poids"&gt;Copier des couches diffère du partage des mêmes poids
&lt;/h2&gt;&lt;p&gt;Le &lt;a class="link" href="https://arxiv.org/abs/2312.15166" target="_blank" rel="noopener"
 &gt;SOLAR 10.7B&lt;/a&gt; d&amp;rsquo;Upstage a introduit le depth up-scaling, ou DUS : copier des couches existantes, en supprimer certaines, les assembler en un modèle plus profond et poursuivre l&amp;rsquo;entraînement. Des copies initialement identiques peuvent développer des poids différents. Le modèle résultant stocke davantage de paramètres.&lt;/p&gt;
&lt;p&gt;Un modèle récurrent continue de partager les mêmes poids. Le DUS réutilise l&amp;rsquo;entraînement antérieur pour construire un modèle plus profond ; la mise en boucle augmente la profondeur d&amp;rsquo;exécution sans expansion correspondante des poids stockés. Traiter les deux comme la même technique d&amp;rsquo;économie de mémoire conduit à un modèle de coût erroné.&lt;/p&gt;
&lt;h2 id="lisez-les-chiffres-de-huginn-et-douro-avec-leurs-conditions-de-comparaison"&gt;Lisez les chiffres de Huginn et d&amp;rsquo;Ouro avec leurs conditions de comparaison
&lt;/h2&gt;&lt;p&gt;La &lt;a class="link" href="https://arxiv.org/abs/2502.05171" target="_blank" rel="noopener"
 &gt;recherche Huginn&lt;/a&gt; de Geiping et ses collègues sépare le traitement de l&amp;rsquo;entrée, un noyau récurrent et le traitement de la sortie. Le noyau affine l&amp;rsquo;état interne par exécutions répétées. Les auteurs ont entraîné un modèle de 3,5 milliards de paramètres sur 800 milliards de tokens et ont rapporté une amélioration des performances sur les tâches de raisonnement à mesure que le calcul récurrent augmentait.&lt;/p&gt;
&lt;p&gt;Le chiffre de 50B dans le résumé appelle à la prudence. Il décrit des améliorations jusqu&amp;rsquo;à une charge computationnelle équivalente à 50 milliards de paramètres. Il ne garantit pas la qualité d&amp;rsquo;un modèle de 50B sur chaque tâche, ni que cette qualité soit obtenue au même coût. Un petit ensemble de poids utilisant davantage de calcul est un résultat de recherche ; l&amp;rsquo;économie de service nécessite des mesures séparées.&lt;/p&gt;
&lt;p&gt;&lt;a class="link" href="https://arxiv.org/abs/2510.25741" target="_blank" rel="noopener"
 &gt;Ouro&lt;/a&gt;, issu de ByteDance et de collaborateurs, a été publié en octobre 2025. Le papier couvre une famille de modèles de 1,4B et 2,6B paramètres et rapporte des comparaisons avec des modèles allant jusqu&amp;rsquo;à 12B sur différents benchmarks. La &lt;a class="link" href="https://huggingface.co/ByteDance/Ouro-1.4B" target="_blank" rel="noopener"
 &gt;fiche officielle du modèle Ouro-1.4B&lt;/a&gt; indique cependant que ce modèle particulier est à la hauteur des modèles conventionnels de 3 à 4B. Affirmer que 1,4B remplace systématiquement 12B serait exagérer la comparaison.&lt;/p&gt;
&lt;p&gt;Les nombres de paramètres doivent être lus conjointement avec les données d&amp;rsquo;entraînement, le nombre de récurrences et les tâches d&amp;rsquo;évaluation. L&amp;rsquo;efficience apparente à l&amp;rsquo;inférence peut également faire suite à un investissement substantiel en pré-entraînement.&lt;/p&gt;
&lt;h2 id="moins-de-poids-stockés-nélimine-pas-les-goulots-détranglement-mémoire"&gt;Moins de poids stockés n&amp;rsquo;élimine pas les goulots d&amp;rsquo;étranglement mémoire
&lt;/h2&gt;&lt;p&gt;Considérons un calcul illustratif. Stocker 3,5 milliards de paramètres à 2 octets chacun nécessite environ 7 Go pour les poids. L&amp;rsquo;utilisation répétée de ces poids ne multiplie pas leur besoin de stockage par le nombre de récurrences. C&amp;rsquo;est de l&amp;rsquo;arithmétique, pas une mesure de l&amp;rsquo;utilisation totale de mémoire GPU de Huginn.&lt;/p&gt;
&lt;p&gt;La mémoire totale à l&amp;rsquo;inférence comprend également le cache KV utilisé pour réutiliser le contexte antérieur, les états intermédiaires et l&amp;rsquo;espace de travail d&amp;rsquo;exécution. Le &lt;a class="link" href="https://developer.nvidia.com/blog/mastering-llm-techniques-inference-optimization/" target="_blank" rel="noopener"
 &gt;guide d&amp;rsquo;optimisation de l&amp;rsquo;inférence de NVIDIA&lt;/a&gt; distingue les poids et le cache KV comme principaux composants mémoire. Des contextes plus longs et davantage de requêtes concurrentes augmentent la pression sur le cache. La possibilité de partager les caches entre étapes récurrentes dépend de la conception.&lt;/p&gt;
&lt;p&gt;La réutilisation des poids est également distincte d&amp;rsquo;une réduction des mouvements de données. Si les poids ne peuvent pas rester en mémoire rapide sur puce, un nouveau passage peut nécessiter de les relire depuis la HBM. La répétition peut accroître la demande en bande passante en plus du calcul. Sans examiner la hiérarchie mémoire et l&amp;rsquo;implémentation, il est impossible d&amp;rsquo;affirmer que la mise en boucle rend la HBM superflue.&lt;/p&gt;
&lt;h2 id="le-logiciel-doit-concrétiser-les-économies-issues-de-la-sortie-anticipée"&gt;Le logiciel doit concrétiser les économies issues de la sortie anticipée
&lt;/h2&gt;&lt;p&gt;Le &lt;a class="link" href="https://arxiv.org/abs/2507.10524" target="_blank" rel="noopener"
 &gt;Mixture-of-Recursions (MoR)&lt;/a&gt; fait varier la profondeur récursive par token et gère le calcul et la mise en cache autour des tokens encore actifs à une profondeur donnée. L&amp;rsquo;objectif est de diriger le calcul vers les tokens plus difficiles plutôt que de le dépenser sur les tokens faciles.&lt;/p&gt;
&lt;p&gt;Le service en production complique les choses. Des exigences de récurrence différentes entre requêtes peuvent réduire l&amp;rsquo;efficacité du batching. Les ordonnanceurs doivent permettre à d&amp;rsquo;autres tâches d&amp;rsquo;utiliser les ressources libérées par l&amp;rsquo;achèvement anticipé. Il s&amp;rsquo;agit d&amp;rsquo;un défi opérationnel anticipé, pas d&amp;rsquo;un résultat mesuré pour un produit commercial particulier.&lt;/p&gt;
&lt;p&gt;La fiche du modèle Ouro en offre un exemple concret. Le modèle prend en charge la sortie anticipée, mais la fiche indique que vLLM ne supporte pas cette fonctionnalité et exécute à la place le nombre complet de récurrences configuré. Une capacité architecturale n&amp;rsquo;est pas automatiquement implémentée dans un moteur de service.&lt;/p&gt;
&lt;p&gt;Cela soulève des questions précises pour les entreprises d&amp;rsquo;infrastructure logicielle IA telles que Lablup : la plateforme peut-elle grouper des tâches avec des profondeurs de récurrence différentes, réutiliser les caches et réduire le temps de complétion et la consommation énergétique à qualité équivalente ? Ce sont des questions pour évaluer une opportunité, pas des affirmations que Lablup supporte déjà ces fonctionnalités ou a démontré une croissance de ses revenus grâce à elles.&lt;/p&gt;
&lt;h2 id="les-semi-conducteurs-coréens-font-face-à-la-fois-à-des-économies-de-ressources-et-à-une-expansion-des-usages"&gt;Les semi-conducteurs coréens font face à la fois à des économies de ressources et à une expansion des usages
&lt;/h2&gt;&lt;p&gt;Les éléments suivants sont des scénarios conditionnels pour une adoption plus large des modèles en boucle, et non des prévisions de résultats.&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Condition&lt;/th&gt;
 &lt;th&gt;Effet sectoriel possible&lt;/th&gt;
 &lt;th&gt;Preuve nécessaire&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Moins de poids et moins de cache à qualité équivalente&lt;/td&gt;
 &lt;td&gt;Moindre pression mémoire par requête&lt;/td&gt;
 &lt;td&gt;Mémoire mesurée à contexte et concurrence égaux&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Plus de récurrence sur les problèmes difficiles&lt;/td&gt;
 &lt;td&gt;Plus de temps accélérateur et d&amp;rsquo;énergie demandés&lt;/td&gt;
 &lt;td&gt;Temps GPU et énergie par tâche réussie&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Un coût plus bas élargit les usages&lt;/td&gt;
 &lt;td&gt;Demande agrégée d&amp;rsquo;infrastructure stable ou plus élevée&lt;/td&gt;
 &lt;td&gt;Données réelles d&amp;rsquo;usage et plans d&amp;rsquo;achat des clients&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Récurrence et gestion du cache réduisent l&amp;rsquo;efficacité du batching&lt;/td&gt;
 &lt;td&gt;Commercialisation retardée&lt;/td&gt;
 &lt;td&gt;Débit à la même cible de latence&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Pour les fournisseurs de mémoire tels que Samsung Electronics et SK hynix, la demande agrégée dépend à la fois des ressources par requête et du nombre de requêtes. L&amp;rsquo;efficience peut stimuler l&amp;rsquo;adoption, mais il ne faut pas supposer que cette croissance dépassera les économies réalisées. Cette seule analyse est insuffisante pour réviser les prévisions de demande de HBM ou les prévisions de résultats des entreprises.&lt;/p&gt;
&lt;p&gt;Une comparaison plus pertinente est le coût de réalisation d&amp;rsquo;une tâche réussie. Des scores élevés sur les benchmarks peuvent rester coûteux si la répétition prend trop de temps ou si les nouvelles tentatives sont fréquentes. À l&amp;rsquo;inverse, un calcul supplémentaire peut réduire le coût total s&amp;rsquo;il améliore suffisamment le taux de succès au premier essai.&lt;/p&gt;
&lt;h2 id="le-prochain-test-porte-sur-le-coût-par-tâche-pas-sur-le-nombre-de-paramètres"&gt;Le prochain test porte sur le coût par tâche, pas sur le nombre de paramètres
&lt;/h2&gt;&lt;p&gt;Valider le cas industriel nécessite de comparer la mémoire totale, le temps de complétion, l&amp;rsquo;énergie et le débit concurrent à précision équivalente. La latence de queue compte autant que les moyennes pour les questions simples. Si davantage de récurrence cesse d&amp;rsquo;améliorer la qualité, ou si les pertes de batching dépassent les économies de ressources, le cas de commercialisation s&amp;rsquo;affaiblit.&lt;/p&gt;
&lt;p&gt;De nouvelles divulgations architecturales pourraient établir si Astra appartient à cette lignée de recherche. En attendant, un changement vérifiable demeure : la planification d&amp;rsquo;infrastructure doit considérer la durée de calcul allouée à chaque problème et le moment où s&amp;rsquo;arrêter, au même titre que la taille du modèle stocké. Transformer cette flexibilité en coûts réels réduits est un test conjoint du matériel et du logiciel.&lt;/p&gt;</description></item></channel></rss>