Capitalisation boursière: $2.1911T 0.49%
Volume(24h): $55.4855B -3.53%
  • Capitalisation boursière: $2.1911T 0.49%
  • Volume(24h): $55.4855B -3.53%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.1911T 0.49%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

Andrej Karpathy estime que les LLM rendront redondants les cadres d'apprentissage en profondeur comme PyTorch

Sep 17, 2024 at 04:04 pm

Les LLM deviennent la solution par défaut à de nombreux problèmes auxquels les entreprises et les chercheurs sont confrontés. Même lorsqu'il s'agit de domaines autres que la langue et le texte, les gens ont expérimenté les LLM pour deviner et prédire le prochain jeton, ce qui suscite une conversation intéressante sur la nécessité d'autres outils comme PyTorch, car les LLM peuvent faire tout le travail à l'avenir. .

Andrej Karpathy estime que les LLM rendront redondants les cadres d'apprentissage en profondeur comme PyTorch

The rapid advancement of large language models (LLMs) has sparked a discussion about their potential to replace other tools, such as deep learning frameworks like PyTorch, for a wide range of problems.

L'évolution rapide des grands modèles de langage (LLM) a suscité une discussion sur leur potentiel à remplacer d'autres outils, tels que les frameworks d'apprentissage en profondeur comme PyTorch, pour un large éventail de problèmes.

LLMs are typically designed to predict the next token in a sequence, whether that sequence consists of words, images, or other types of information. This next token prediction framework can be applied to a diverse set of problems, extending beyond text.

Les LLM sont généralement conçus pour prédire le jeton suivant dans une séquence, que cette séquence soit constituée de mots, d'images ou d'autres types d'informations. Ce prochain cadre de prédiction de jetons peut être appliqué à un ensemble diversifié de problèmes, s’étendant au-delà du texte.

Andrej Karpathy suggests that deep learning frameworks, like PyTorch and its counterparts, might be overly general for the majority of problems in the future.

Andrej Karpathy suggère que les frameworks d'apprentissage profond, comme PyTorch et ses homologues, pourraient être trop généraux pour la majorité des problèmes à l'avenir.

LLMs have evolved beyond their initial specialization in language. The term “language” is used historically because these models were first trained to predict the next word in a sentence. However, LLMs can work on any kind of data that’s broken down into small pieces, called tokens.

Les LLM ont évolué au-delà de leur spécialisation initiale en langue. Le terme « langage » est utilisé historiquement parce que ces modèles ont d’abord été entraînés pour prédire le mot suivant dans une phrase. Cependant, les LLM peuvent travailler sur tout type de données décomposées en petits morceaux, appelés jetons.

Imagine LLMs as a super-smart guessing game. If you’re building a car, a house, or an animal using Legos, you’re just putting blocks together. LLMs don’t care if the tokens (blocks) represent words, images, or even molecules—they just focus on predicting what the next block should be based on what’s already there.

Imaginez les LLM comme un jeu de devinettes ultra intelligent. Si vous construisez une voiture, une maison ou un animal avec des Legos, vous assemblez simplement des blocs. Les LLM ne se soucient pas de savoir si les jetons (blocs) représentent des mots, des images ou même des molécules : ils se concentrent simplement sur la prédiction de ce que devrait être le prochain bloc en fonction de ce qui existe déjà.

For example, protein prediction models like AlphaFold and ESMFold are built on top of generative language models. Calling such intricate models LLMs might be limiting.

Par exemple, les modèles de prédiction de protéines comme AlphaFold et ESMFold sont construits sur des modèles de langage génératif. Appeler des modèles aussi complexes LLM peut être limitatif.

Karpathy further highlights that the term “language” might be leading people to believe that LLMs are limited to text applications, which is not the case.

Karpathy souligne en outre que le terme « langage » pourrait laisser croire que les LLM se limitent aux applications textuelles, ce qui n'est pas le cas.

“I don’t think this is true but I think it’s half true,” Karpathy said in response to a thread about LLMs being able to handle almost all types of problems.

"Je ne pense pas que ce soit vrai, mais je pense que c'est à moitié vrai", a déclaré Karpathy en réponse à un fil de discussion sur la capacité des LLM à gérer presque tous les types de problèmes.

“Probably the name should change.”

"Le nom devrait probablement changer."

“Definitely needs a new name. ‘Multimodal LLM’ is extra silly, as the first word contradicts the third word,” replied Elon Musk in the same thread.

« Il a définitivement besoin d’un nouveau nom. « Multimodal LLM » est extrêmement idiot, car le premier mot contredit le troisième mot », a répondu Elon Musk dans le même fil de discussion.

Meanwhile, Yann LeCun is more concerned about why this doesn’t make sense for all the types of problems.

Yann LeCun, quant à lui, s'inquiète davantage de savoir pourquoi cela n'a pas de sens pour tous les types de problèmes.

“It only works with discretized outputs (discrete symbols) and only makes sense with symbol sequences with a natural order (not images). Text, DNA, proteins, musical scores, etc. are discrete or easily discretized,” said LeCun.

« Cela ne fonctionne qu'avec des sorties discrétisées (symboles discrets) et n'a de sens qu'avec des séquences de symboles avec un ordre naturel (pas d'images). Le texte, l'ADN, les protéines, les partitions musicales, etc. sont discrets ou facilement discrétisés », a déclaré LeCun.

For something like images, which are continuous and don’t naturally have a strict sequence of discrete symbols (each pixel doesn’t follow a clear ‘order’ like text), LLMs don’t work as naturally. To use an LLM for images, you would first need to somehow convert the image into discrete chunks (like dividing the image into small patches), but this doesn’t follow the same natural order that exists in text or DNA.

Pour quelque chose comme les images, qui sont continues et n'ont pas naturellement une séquence stricte de symboles discrets (chaque pixel ne suit pas un « ordre » clair comme le texte), les LLM ne fonctionnent pas aussi naturellement. Pour utiliser un LLM pour les images, vous devez d'abord convertir l'image en morceaux discrets (comme diviser l'image en petits morceaux), mais cela ne suit pas le même ordre naturel qui existe dans le texte ou l'ADN.

Agreeing with Karpathy, and a little with LeCun, Gary Marcus said that statistical modelling of token streams works well if reasoning or planning isn’t required.

D'accord avec Karpathy et un peu avec LeCun, Gary Marcus a déclaré que la modélisation statistique des flux de jetons fonctionne bien si un raisonnement ou une planification n'est pas nécessaire.

Last month, Eliezer Yudkowsky also said that predicting the next token can solve almost all the well-posed problems.

Le mois dernier, Eliezer Yudkowsky a également déclaré que prédire le prochain jeton pouvait résoudre presque tous les problèmes bien posés.

“literally any well-posed problem is isomorphic to ‘predict the next token of the answer’,” he said.

« Littéralement, tout problème bien posé est isomorphe pour « prédire le prochain élément de réponse » », a-t-il déclaré.

“Throwing an LLM at it”

«Lancer un LLM dessus»

The idea that many problems can be reduced to a token-stream prediction model is intriguing, especially since domains like images, audio, and even molecules can be broken down into sequences of tokens. This suggests that a unified approach like LLMs could handle diverse tasks, reducing the need for highly specialised architectures, such as PyTorch.

L’idée selon laquelle de nombreux problèmes peuvent être réduits à un modèle de prédiction de flux de jetons est intrigante, d’autant plus que des domaines tels que les images, l’audio et même les molécules peuvent être décomposés en séquences de jetons. Cela suggère qu'une approche unifiée comme les LLM pourrait gérer diverses tâches, réduisant ainsi le besoin d'architectures hautement spécialisées, telles que PyTorch.

However, frameworks like PyTorch provide more than just flexibility in creating neural network models. They allow for a variety of deep learning operations that aren’t necessarily relevant for LLMs but are critical for other areas like reinforcement learning, generative models, and non-sequential tasks.

Cependant, les frameworks comme PyTorch offrent plus qu'une simple flexibilité dans la création de modèles de réseaux neuronaux. Ils permettent une variété d'opérations d'apprentissage en profondeur qui ne sont pas nécessairement pertinentes pour les LLM mais sont essentielles pour d'autres domaines tels que l'apprentissage par renforcement, les modèles génératifs et les tâches non séquentielles.

While it’s true that LLMs could dominate many applications, not every problem is best framed as “next token prediction.” We may see a simplification or specialization of deep learning frameworks to accommodate the increasing dominance of LLM-based models. Still, the complete redundancy of frameworks like PyTorch might be too extreme of a prediction.

S'il est vrai que les LLM pourraient dominer de nombreuses applications, tous les problèmes ne sont pas mieux définis comme une « prédiction du prochain jeton ». Nous pourrions assister à une simplification ou à une spécialisation des cadres d’apprentissage profond pour s’adapter à la domination croissante des modèles basés sur le LLM. Néanmoins, la redondance complète de frameworks comme PyTorch pourrait être une prédiction trop extrême.

OpenAI’s newest model o1 gives a sense of why LLMs would be able to solve a lot of problems outside of the realm that is currently considered achievable. With the reasoning tokens in place, the model can go beyond just ‘predicting’ the next token and giving reasons for why it did so.

Le dernier modèle o1 d'OpenAI donne une idée de la raison pour laquelle les LLM seraient capables de résoudre de nombreux problèmes en dehors du domaine actuellement considéré comme réalisable. Avec les jetons de raisonnement en place, le modèle peut aller au-delà de la simple « prévision » du prochain jeton et donner les raisons pour lesquelles il l'a fait.

PyTorch and similar frameworks may not become redundant but could evolve to become more focused on token-based models, while still offering tools for more diverse problems outside that paradigm.

PyTorch et les frameworks similaires ne deviendront peut-être pas redondants, mais pourraient évoluer pour se concentrer davantage sur des modèles basés sur des jetons, tout en offrant des outils pour des problèmes plus divers en dehors de ce paradigme.

Though, currently only in language or text format, the capabilities might extend beyond it soon. Calling LLMs as LLMs might be underrepresenting their capabilities. Moreover, “it just predicts the next token” is a thought-terminating cliche.

Cependant, actuellement uniquement au format langue ou texte, les capacités pourraient bientôt s'étendre au-delà. Appeler les LLM comme LLM pourrait sous-représenter leurs capacités. De plus, « cela prédit simplement le prochain jeton » est un cliché qui met fin à la réflexion.

Source primaire:analyticsindiamag

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Aug 06, 2026