|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Petit modèle, récursif, apprentissage automatique : moins c'est plus ?
Oct 20, 2025 at 02:31 am
Explorer la tendance des modèles minuscules et récursifs dans l'apprentissage automatique, en se concentrant sur TRM et ses implications en termes d'efficacité et de performances.

The world of machine learning is constantly evolving, with researchers always seeking ways to improve performance and efficiency. Lately, there's been buzz around 'Tiny model, recursive, machine learning' approaches. Let's dive into what's shaking in this field.
Le monde de l’apprentissage automatique est en constante évolution, les chercheurs cherchant toujours des moyens d’améliorer les performances et l’efficacité. Dernièrement, il y a eu un buzz autour des approches de « modèle minuscule, récursif, d'apprentissage automatique ». Plongeons dans ce qui bouge dans ce domaine.
The Rise of Tiny Recursive Models
L'essor des petits modèles récursifs
The recent work on TRM (Tiny Recursive Model) is questioning the necessity of complexity. TRM contains 5M-19M parameters, versus 27M in HRM. These models represent a fascinating shift towards simplicity and efficiency, challenging the conventional wisdom that bigger is always better.
Les travaux récents sur le TRM (Tiny Recursive Model) questionnent la nécessité de la complexité. TRM contient 5 M à 19 M de paramètres, contre 27 M dans HRM. Ces modèles représentent un changement fascinant vers la simplicité et l’efficacité, remettant en question l’idée reçue selon laquelle plus grand est toujours mieux.
TRM: A Closer Look
TRM : un examen plus approfondi
TRM simplifies the recursive process, designed with one small network, which is essentially a standard transformer block: [self-attention, norm, MLP, norm]. The model is designed so that there’s one small network, which is essentially a standard transformer block: [self-attention, norm, MLP, norm]. In the original idea, there were 4 such blocks (but after experiments they came to 2).
TRM simplifie le processus récursif, conçu avec un petit réseau, qui est essentiellement un bloc de transformateur standard : [auto-attention, norme, MLP, norme]. Le modèle est conçu de telle sorte qu'il existe un petit réseau, qui est essentiellement un bloc de transformateur standard : [auto-attention, norme, MLP, norme]. Dans l'idée originale, il y avait 4 blocs de ce type (mais après expériences, ils sont arrivés à 2).
At the input, it has three elements: input (x), latent (z), and prediction (y); they’re all summed into one value. The basic iteration, analogous to the L module in HRM, generates a latent value (z, also denoted in the recursion formula as z_L) at the layer output, and the updated z goes back to the module input, where it now adds to input (x) not as zero. The output-prediction (y, also denoted in the formula as z_H) is also added, but since it hasn’t been updated, it doesn’t change anything.
En entrée, il comporte trois éléments : entrée (x), latent (z) et prédiction (y) ; ils sont tous résumés en une seule valeur. L'itération de base, analogue au module L dans HRM, génère une valeur latente (z, également désignée dans la formule de récursion par z_L) à la sortie de la couche, et le z mis à jour retourne à l'entrée du module, où il s'ajoute désormais à l'entrée (x) non pas comme zéro. La prédiction de sortie (y, également notée z_H dans la formule) est également ajoutée, mais comme elle n'a pas été mise à jour, cela ne change rien.
Key Insights and Performance
Informations clés et performances
TRM achieves higher numbers than HRM: 74.7%/87.4% (attention version/MLP version) versus 55% for Sudoku, 85.3% (attention version, MLP version gives 0) versus 74.5% for Maze, 44.6%/29.6% (attn/MLP) versus 40.3% for ARC-AGI-1 and 7.8%/2.4% (attn/MLP) versus 5.0% for ARC-AGI-2. The experiments don’t look very expensive; runtime from <24 hours to about three days maximum on 4*H100 according to the repo.
TRM obtient des chiffres plus élevés que HRM : 74,7%/87,4% (version attention/version MLP) contre 55% pour Sudoku, 85,3% (version attention, version MLP donne 0) contre 74,5% pour Maze, 44,6%/29,6% (attn/MLP) contre 40,3% pour ARC-AGI-1 et 7,8%/2,4% (attn/MLP) contre 5,0 % pour ARC-AGI-2. Les expériences ne semblent pas très coûteuses ; durée d'exécution de <24 heures à environ trois jours maximum sur 4*H100 selon le repo.
My Two Cents
Mes deux cents
While the theoretical underpinnings of why these recursions work so well might not be fully understood yet, the empirical results are hard to ignore. TRM's architectural inventiveness, as opposed to eternal model scaling, is a breath of fresh air. It would be interesting how it would be with dataset scaling.
Même si les fondements théoriques expliquant pourquoi ces récursions fonctionnent si bien ne sont peut-être pas encore entièrement compris, les résultats empiriques sont difficiles à ignorer. L'inventivité architecturale de TRM, par opposition à la mise à l'échelle éternelle des modèles, est une bouffée d'air frais. Il serait intéressant de savoir comment cela se passerait avec la mise à l'échelle des ensembles de données.
Looking Ahead
Regarder vers l'avenir
The journey of 'Tiny model, recursive, machine learning' is just beginning. There's a lot more to explore. So, let's keep an eye on these tiny titans and see where they take us next. Good recursions to everyone!
Le voyage du « petit modèle, récursif, apprentissage automatique » ne fait que commencer. Il y a beaucoup plus à explorer. Alors gardons un œil sur ces petits titans et voyons où ils nous mèneront ensuite. Bonnes récursions à tous !
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
- Le comité de la Chambre fait avancer le projet de loi sur la réserve Bitcoin sur 20 ans : un aperçu de l'avenir des actifs numériques américains
- Sep 21, 2026 at 12:05 pm
- Un comité de la Chambre des représentants des États-Unis a décidé d'établir une réserve de Bitcoin sur 20 ans et un stock d'actifs numériques plus large, signalant un changement à long terme dans la politique fédérale en matière de cryptographie.
-
- Le Trésor américain condamne la bourse iranienne BitBank avec des sanctions concernant les prétendus transferts de Bitcoin du CGRI
- Sep 21, 2026 at 04:05 am
- Le département du Trésor américain a sanctionné l'échange crypto iranien BitBank, alléguant son implication dans l'acheminement de Bitcoin vers le CGRI. Cette action resserre l’étau sur l’infrastructure des actifs numériques de l’Iran.
-
- Crypto Crossroads : la meilleure crypto à acheter au milieu de la réglementation de la SEC et de la montée de Pepeto
- Sep 21, 2026 at 04:05 am
- Au milieu de l'évolution des réglementations de la SEC, un nouvel acteur, Pepeto, émerge comme un potentiel « meilleur crypto à acheter », offrant des outils innovants et des opportunités de pré-inscription, contrastant avec les géants établis et les pièces de monnaie en voie de disparition.
-
- Prix du Bitcoin : le rebond spectaculaire et son carrefour
- Sep 21, 2026 at 03:55 am
- Bitcoin a connu un rebond spectaculaire, dépassant les 80 000 dollars, mais se heurte à une résistance critique à 82 000 dollars dans un contexte de vents contraires géopolitiques et d'un signal technique de refroidissement. Peut-il tenir bon ?
-
- Un attaquant, plusieurs jetons : à l'intérieur de la faille Fetch.ai - Une minute à New York
- Sep 20, 2026 at 08:05 pm
- La faille Fetch.ai, initialement considérée comme un vol de jetons FET de 1,5 million de dollars, s'est transformée en une saga multi-jetons impliquant NTX, AGIX et WMTX, le total des avoirs des attaquants dépassant désormais 17 millions de dollars. Cet incident met en évidence la différence cruciale entre les jetons volés et les jetons nouvellement créés, révélant des implications de sécurité plus profondes au-delà des pertes financières initiales.
-
- MultiversX arrête le réseau principal : démêler l'incident de « état invalide »
- Sep 20, 2026 at 08:05 pm
- MultiversX a récemment suspendu son réseau principal en raison d'un attaquant exploitant une faille d'atomicité, conduisant à un « état invalide » et déclenchant un effort de récupération complexe pour garantir l'intégrité du réseau et la confiance des utilisateurs.
-
- Bitcoin, Altcoins et crypto-monnaie : une poussée du marché motivée par la réglementation et l'innovation, pas seulement par les mèmes
- Sep 20, 2026 at 08:05 pm
- Le bond inattendu du Bitcoin au-delà de 80 000 $ a déclenché un rallye cryptographique plus large, alimenté par des mesures réglementaires astucieuses et une évolution nette vers des altcoins dotés d'une véritable utilité et de véritables sources de revenus. Ce n’est plus le marché de la cryptographie de votre grand-mère.
-
- Prédiction de prix Dash : la crypto-monnaie DASH atteindra-t-elle bientôt 100 $ ?
- Sep 20, 2026 at 08:05 pm
- Dash (DASH) présente une structure technique haussière, gagnant 10 % cette semaine. Avec des niveaux de résistance clés en vue, une trajectoire vers 100 $ semble plausible, soutenue par des fondamentaux solides.
-
- Les experts se prononcent : le rôle futur du XRP en tant qu'infrastructure de monnaie numérique et les hausses potentielles des prix
- Sep 20, 2026 at 08:05 pm
- Des analyses et discussions récentes entre experts en cryptographie mettent en évidence le potentiel du XRP en tant qu'infrastructure fondamentale de monnaie numérique et spéculent sur des augmentations de prix significatives, suscitant un débat parmi les détenteurs de XRP.

































