|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Faiblesse du LLM révélée : les « jetons Glitch » nuisent à la précision du modèle
May 14, 2024 at 10:27 am
La tokenisation, une étape essentielle dans la formation de grands modèles de langage (LLM), peut introduire des « jetons de problème » causés par un désalignement entre le tokenizer et les ensembles de données de formation du modèle. Pour résoudre ce problème, les chercheurs proposent une approche automatisée pour détecter les jetons sous-entraînés à l'aide d'une analyse de poids intégrée. En analysant les disparités matricielles d'intégration, la méthode identifie les jetons nécessitant une formation supplémentaire, améliorant ainsi considérablement la précision et la robustesse du LLM dans les applications de traitement du langage naturel.

Under-Trained Tokens: A Hidden Vulnerability in Large Language Models
Jetons sous-entraînés : une vulnérabilité cachée dans les grands modèles de langage
Introduction
Introduction
Tokenization, the process of decomposing text into manageable units known as tokens, serves as the foundation for training and operating large language models (LLMs). While effective tokenization yields significant performance enhancements, it becomes problematic when tokens within the model's vocabulary are underrepresented or completely absent in the training data, giving rise to the phenomenon of 'glitch tokens.' These tokens, upon encountering new input data, can destabilize the model, leading to unpredictable and erroneous outputs.
La tokenisation, le processus de décomposition du texte en unités gérables appelées jetons, sert de base à la formation et à l'exploitation de grands modèles linguistiques (LLM). Bien qu'une tokenisation efficace entraîne des améliorations significatives des performances, elle devient problématique lorsque les jetons du vocabulaire du modèle sont sous-représentés ou complètement absents dans les données d'entraînement, donnant lieu au phénomène de « jetons de problème ». Ces jetons, lorsqu'ils rencontrent de nouvelles données d'entrée, peuvent déstabiliser le modèle, conduisant à des sorties imprévisibles et erronées.
Discrepancies in Tokenization Training
Écarts dans la formation à la tokenisation
A fundamental issue with LLMs lies in the disparity between tokenizer training and model training procedures. Tokenizers are often trained separately using distinct datasets, which may differ substantially from the data utilized for training the model. This misalignment can result in some vocabulary tokens being under-trained, rendering them susceptible to the glitch token issue. The infamous "_SolidGoldMagikarp" token epitomizes this problem, as it can trigger unwanted model behaviors, such as hallucinations and nonsensical outputs.
Un problème fondamental avec les LLM réside dans la disparité entre la formation des tokenizers et les procédures de formation des modèles. Les tokeniseurs sont souvent formés séparément à l'aide d'ensembles de données distincts, qui peuvent différer considérablement des données utilisées pour former le modèle. Ce désalignement peut entraîner un sous-apprentissage de certains jetons de vocabulaire, ce qui les rend vulnérables au problème des jetons de problème. Le tristement célèbre jeton « _SolidGoldMagikarp » incarne ce problème, car il peut déclencher des comportements indésirables du modèle, tels que des hallucinations et des sorties absurdes.
Conventional Glitch Token Identification Methods
Méthodes conventionnelles d’identification des jetons Glitch
Traditionally, identifying under-trained tokens has involved manual inspection of the tokenizer's behavior, assessing how tokens are encoded and decoded, or meticulously analyzing their frequency within the training data. However, these methods lack scalability, proving ineffective for the increasingly vast and complex LLMs being developed today.
Traditionnellement, l'identification des jetons sous-entraînés impliquait une inspection manuelle du comportement du tokenizer, une évaluation de la manière dont les jetons sont codés et décodés, ou une analyse méticuleuse de leur fréquence dans les données d'entraînement. Cependant, ces méthodes manquent d’évolutivité et se révèlent inefficaces pour les LLM de plus en plus vastes et complexes développés aujourd’hui.
A Novel Approach: Leveraging Embedding Weights
Une nouvelle approche : tirer parti des pondérations intégrées
Researchers from Cohere have devised a groundbreaking approach that leverages the model's embedding weights to automate and scale the detection of under-trained tokens. By meticulously analyzing these weights, the researchers have developed a method to pinpoint anomalies indicative of insufficient training. This method scrutinizes the embedding matrix of a model, identifying tokens whose embedding weights deviate significantly from those of well-represented tokens. It provides a systematic approach to detecting glitch tokens by calculating the variance and distribution of embedding weights and comparing them against a normative model of adequately trained tokens.
Les chercheurs de Cohere ont conçu une approche révolutionnaire qui exploite les poids d'intégration du modèle pour automatiser et étendre la détection des jetons sous-entraînés. En analysant minutieusement ces poids, les chercheurs ont développé une méthode permettant d'identifier les anomalies révélatrices d'un entraînement insuffisant. Cette méthode examine la matrice d'intégration d'un modèle, identifiant les jetons dont les poids d'intégration s'écartent considérablement de ceux des jetons bien représentés. Il fournit une approche systématique pour détecter les jetons de problème en calculant la variance et la distribution des poids d'intégration et en les comparant à un modèle normatif de jetons correctement formés.
Experimental Validation
Validation expérimentale
The study's efficacy was demonstrated by applying the method to several prominent models, including variants of Google's BERT and OpenAI's GPT series. The analysis revealed a substantial percentage of the tokenizer's vocabulary, reaching up to 10% in some instances, as under-trained. These tokens were frequently specialized or infrequently used words, which exhibited the most significant discrepancies in embedding weight patterns.
L'efficacité de l'étude a été démontrée en appliquant la méthode à plusieurs modèles importants, notamment des variantes des séries BERT de Google et GPT d'OpenAI. L'analyse a révélé qu'un pourcentage substantiel du vocabulaire du tokenizer, atteignant jusqu'à 10 % dans certains cas, est sous-formé. Ces jetons étaient des mots fréquemment spécialisés ou rarement utilisés, qui présentaient les écarts les plus significatifs dans l'intégration des modèles de poids.
Implications for LLM Development and Maintenance
Implications pour le développement et la maintenance du LLM
This research holds pivotal implications for the development and maintenance of LLMs. Automating the detection and remediation of under-trained tokens empowers developers to enhance the accuracy and robustness of language models. This advancement is critical as LLMs find increasing application in a wide range of tasks, from automated writing assistants to sophisticated conversational agents.
Cette recherche a des implications cruciales pour le développement et la maintenance des LLM. L'automatisation de la détection et de la correction des jetons sous-entraînés permet aux développeurs d'améliorer la précision et la robustesse des modèles de langage. Cette avancée est essentielle car les LLM trouvent de plus en plus d'applications dans un large éventail de tâches, depuis les assistants d'écriture automatisés jusqu'aux agents conversationnels sophistiqués.
Conclusion
Conclusion
This research uncovers a critical vulnerability in LLM training and presents a scalable solution to combat this issue. Adopting automated methods for detecting under-trained tokens enables more robust training processes, ensuring that all tokens within a model's vocabulary are adequately prepared for real-world scenarios. By rectifying this vulnerability, this research significantly improves the efficacy and reliability of language models, paving the way for more trustworthy and effective natural language processing tools.
Cette recherche révèle une vulnérabilité critique dans la formation LLM et présente une solution évolutive pour lutter contre ce problème. L'adoption de méthodes automatisées pour détecter les jetons sous-entraînés permet des processus de formation plus robustes, garantissant que tous les jetons du vocabulaire d'un modèle sont correctement préparés pour les scénarios du monde réel. En corrigeant cette vulnérabilité, cette recherche améliore considérablement l'efficacité et la fiabilité des modèles de langage, ouvrant la voie à des outils de traitement du langage naturel plus fiables et plus efficaces.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
-
- Consensus 2026 Miami : Web3, Blockchain, Crypto-monnaie, NFT, Metaverse, conférence, 5 mai — Là où Wall Street rencontre la frontière numérique
- May 01, 2026 at 11:27 pm
- Miami vibre à l'approche du Consensus 2026 le 5 mai, mettant en avant le Web3, la blockchain, la crypto, les NFT et le passage du métaverse du battage médiatique à la réalité institutionnelle et durable.
-
- La Fed maintient ses taux stables, déclenchant une baisse du prix du Bitcoin dans un contexte de tensions géopolitiques
- May 01, 2026 at 04:04 am
- La décision de la Réserve fédérale de maintenir les taux d'intérêt, associée au conflit au Moyen-Orient, a un impact sur le prix du Bitcoin. Analyse des tendances récentes et des réactions du marché.
-
- Les mineurs de Bitcoin électrifient le réseau : l'acquisition d'une usine à gaz dans l'Ohio ouvre une nouvelle ère pour l'or numérique
- Apr 30, 2026 at 10:38 pm
- L’industrie minière du Bitcoin connaît une transformation significative, avec des acteurs majeurs développant de manière agressive leurs opérations et acquérant stratégiquement des actifs énergétiques comme les usines à gaz de l’Ohio pour solidifier leur avenir dans l’économie numérique.
-
- Le jeton MEGA de MegaETH arrive dans la Big Apple : définition de nouveaux critères de performance pour la blockchain en temps réel
- Apr 30, 2026 at 09:11 pm
- Le MEGA Token de MegaETH a été officiellement lancé, validant sa vision de la blockchain « en temps réel » avec un modèle de distribution axé sur les performances et une adoption rapide du stablecoin USDM.
-
- La pente glissante de Solana : les prévisions de prix indiquent une perte de résistance et de nouvelles baisses potentielles
- Apr 30, 2026 at 09:08 pm
- Solana a du mal à briser la résistance clé, signalant un potentiel de baisse. Des refus répétés entre 86 et 88 dollars, associés à une tendance à court terme brisée, laissent présager des objectifs aussi bas que 67 dollars, voire 40 dollars, alors que les vendeurs gardent le contrôle. Les investisseurs doivent surveiller de près les niveaux de support critiques.
-
- BTC, pétrole, bénéfices : la géopolitique alimente le brut, le dérapage des cryptos, les triomphes et les essais de la technologie
- Apr 30, 2026 at 04:51 pm
- Les marchés mondiaux sont en tourbillon : le BTC chute alors que le pétrole atteint des sommets pluriannuels en raison des tensions géopolitiques, tandis que les géants de la technologie affichent des bénéfices mitigés, révélant un paysage financier complexe.
-
- Le nouveau rythme de New York : les systèmes de jalonnement, l'USD1 et la gouvernance conduisent la prochaine vague de crypto
- Apr 30, 2026 at 03:02 pm
- Des événements lucratifs générant 1 USD aux modèles de gouvernance robustes, la sphère crypto regorge d'innovations qui remodèlent la façon dont nous interagissons avec les actifs numériques, en nous concentrant sur l'engagement à long terme et l'utilité du stablecoin.
-
- OKX dévoile le protocole de paiement des agents : inaugurant une nouvelle ère de transactions IA
- Apr 30, 2026 at 02:53 pm
- OKX lance son Agent Payments Protocol (APP), une norme ouverte pour le commerce piloté par l'IA, permettant aux agents de gérer des cycles économiques complets. Explorez les implications pour les transactions IA et les paiements agents.

































