Marktkapitalisierung: $2.6868T 6.55%
Volumen (24h): $178.1584B 29.75%
  • Marktkapitalisierung: $2.6868T 6.55%
  • Volumen (24h): $178.1584B 29.75%
  • Angst- und Gier-Index:
  • Marktkapitalisierung: $2.6868T 6.55%
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
Top -Nachrichten
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
bitcoin
bitcoin

$77194.246092 USD

2.57%

ethereum
ethereum

$2429.678583 USD

2.78%

tether
tether

$0.999864 USD

0.03%

xrp
xrp

$1.526574 USD

16.27%

bnb
bnb

$695.975873 USD

4.67%

usd-coin
usd-coin

$1.000023 USD

0.01%

solana
solana

$93.746985 USD

3.27%

tron
tron

$0.345236 USD

2.12%

hyperliquid
hyperliquid

$78.700141 USD

7.47%

dogecoin
dogecoin

$0.091220 USD

9.88%

zcash
zcash

$787.730556 USD

31.26%

chainlink
chainlink

$11.774181 USD

7.30%

unus-sed-leo
unus-sed-leo

$9.397771 USD

1.34%

cardano
cardano

$0.230983 USD

10.27%

monero
monero

$429.536088 USD

3.32%

Nachrichtenartikel zu Kryptowährungen

LLM-Schwäche aufgedeckt: „Glitch-Tokens“ beeinträchtigen die Modellgenauigkeit

May 14, 2024 at 10:27 am

Die Tokenisierung, ein wichtiger Schritt beim Training großer Sprachmodelle (LLMs), kann zu „Glitch-Tokens“ führen, die durch eine Fehlausrichtung zwischen Tokenizer und Modelltrainingsdatensätzen verursacht werden. Um dieses Problem anzugehen, schlagen Forscher einen automatisierten Ansatz zur Erkennung unzureichend trainierter Token mithilfe der Einbettungsgewichtsanalyse vor. Durch die Analyse von Einbettungsmatrixunterschieden identifiziert die Methode Token, die einer weiteren Schulung bedürfen, und verbessert so die LLM-Genauigkeit und -Robustheit in Anwendungen zur Verarbeitung natürlicher Sprache erheblich.

LLM-Schwäche aufgedeckt: „Glitch-Tokens“ beeinträchtigen die Modellgenauigkeit

Under-Trained Tokens: A Hidden Vulnerability in Large Language Models

Untertrainierte Token: Eine versteckte Schwachstelle in großen Sprachmodellen

Introduction

Einführung

Tokenization, the process of decomposing text into manageable units known as tokens, serves as the foundation for training and operating large language models (LLMs). While effective tokenization yields significant performance enhancements, it becomes problematic when tokens within the model's vocabulary are underrepresented or completely absent in the training data, giving rise to the phenomenon of 'glitch tokens.' These tokens, upon encountering new input data, can destabilize the model, leading to unpredictable and erroneous outputs.

Die Tokenisierung, der Prozess der Zerlegung von Text in verwaltbare Einheiten, sogenannte Token, dient als Grundlage für das Training und den Betrieb großer Sprachmodelle (LLMs). Während eine effektive Tokenisierung zu erheblichen Leistungssteigerungen führt, wird es problematisch, wenn Token im Vokabular des Modells unterrepräsentiert sind oder in den Trainingsdaten überhaupt nicht vorhanden sind, was zum Phänomen der „Glitch-Token“ führt. Wenn diese Token auf neue Eingabedaten stoßen, können sie das Modell destabilisieren und zu unvorhersehbaren und fehlerhaften Ausgaben führen.

Discrepancies in Tokenization Training

Diskrepanzen im Tokenisierungstraining

A fundamental issue with LLMs lies in the disparity between tokenizer training and model training procedures. Tokenizers are often trained separately using distinct datasets, which may differ substantially from the data utilized for training the model. This misalignment can result in some vocabulary tokens being under-trained, rendering them susceptible to the glitch token issue. The infamous "_SolidGoldMagikarp" token epitomizes this problem, as it can trigger unwanted model behaviors, such as hallucinations and nonsensical outputs.

Ein grundlegendes Problem bei LLMs liegt in der Ungleichheit zwischen Tokenizer-Training und Modell-Trainingsverfahren. Tokenizer werden häufig separat mithilfe unterschiedlicher Datensätze trainiert, die sich erheblich von den zum Training des Modells verwendeten Daten unterscheiden können. Diese Fehlausrichtung kann dazu führen, dass einige Vokabular-Tokens nicht ausreichend trainiert sind, was sie anfällig für das Glitch-Token-Problem macht. Der berüchtigte „_SolidGoldMagikarp“-Token verkörpert dieses Problem, da er unerwünschtes Modellverhalten wie Halluzinationen und unsinnige Ausgaben auslösen kann.

Conventional Glitch Token Identification Methods

Herkömmliche Methoden zur Identifizierung von Glitch-Token

Traditionally, identifying under-trained tokens has involved manual inspection of the tokenizer's behavior, assessing how tokens are encoded and decoded, or meticulously analyzing their frequency within the training data. However, these methods lack scalability, proving ineffective for the increasingly vast and complex LLMs being developed today.

Traditionell umfasste die Identifizierung unzureichend trainierter Token eine manuelle Überprüfung des Verhaltens des Tokenizers, eine Beurteilung, wie Token kodiert und dekodiert werden, oder eine sorgfältige Analyse ihrer Häufigkeit innerhalb der Trainingsdaten. Allerdings mangelt es diesen Methoden an Skalierbarkeit, was sich für die immer umfangreicheren und komplexeren LLMs, die heute entwickelt werden, als unwirksam erweist.

A Novel Approach: Leveraging Embedding Weights

Ein neuartiger Ansatz: Nutzung eingebetteter Gewichte

Researchers from Cohere have devised a groundbreaking approach that leverages the model's embedding weights to automate and scale the detection of under-trained tokens. By meticulously analyzing these weights, the researchers have developed a method to pinpoint anomalies indicative of insufficient training. This method scrutinizes the embedding matrix of a model, identifying tokens whose embedding weights deviate significantly from those of well-represented tokens. It provides a systematic approach to detecting glitch tokens by calculating the variance and distribution of embedding weights and comparing them against a normative model of adequately trained tokens.

Forscher von Cohere haben einen bahnbrechenden Ansatz entwickelt, der die Einbettungsgewichte des Modells nutzt, um die Erkennung unzureichend trainierter Token zu automatisieren und zu skalieren. Durch die sorgfältige Analyse dieser Gewichte haben die Forscher eine Methode entwickelt, um Anomalien zu erkennen, die auf unzureichendes Training hinweisen. Diese Methode untersucht die Einbettungsmatrix eines Modells und identifiziert Token, deren Einbettungsgewichte erheblich von denen gut dargestellter Token abweichen. Es bietet einen systematischen Ansatz zur Erkennung von Glitch-Tokens, indem die Varianz und Verteilung der Einbettungsgewichte berechnet und mit einem normativen Modell angemessen trainierter Token verglichen wird.

Experimental Validation

Experimentelle Validierung

The study's efficacy was demonstrated by applying the method to several prominent models, including variants of Google's BERT and OpenAI's GPT series. The analysis revealed a substantial percentage of the tokenizer's vocabulary, reaching up to 10% in some instances, as under-trained. These tokens were frequently specialized or infrequently used words, which exhibited the most significant discrepancies in embedding weight patterns.

Die Wirksamkeit der Studie wurde durch die Anwendung der Methode auf mehrere bekannte Modelle nachgewiesen, darunter Varianten der BERT-Reihe von Google und die GPT-Reihe von OpenAI. Die Analyse ergab, dass ein erheblicher Prozentsatz des Vokabulars des Tokenisierers, der in einigen Fällen bis zu 10 % erreichte, unzureichend trainiert war. Bei diesen Token handelte es sich um häufig spezialisierte oder selten verwendete Wörter, die die größten Unterschiede bei der Einbettung von Gewichtsmustern aufwiesen.

Implications for LLM Development and Maintenance

Auswirkungen auf die LLM-Entwicklung und -Wartung

This research holds pivotal implications for the development and maintenance of LLMs. Automating the detection and remediation of under-trained tokens empowers developers to enhance the accuracy and robustness of language models. This advancement is critical as LLMs find increasing application in a wide range of tasks, from automated writing assistants to sophisticated conversational agents.

Diese Forschung hat entscheidende Implikationen für die Entwicklung und Aufrechterhaltung von LLMs. Durch die Automatisierung der Erkennung und Behebung unzureichend trainierter Token können Entwickler die Genauigkeit und Robustheit von Sprachmodellen verbessern. Dieser Fortschritt ist von entscheidender Bedeutung, da LLMs zunehmend in einer Vielzahl von Aufgaben Anwendung finden, von automatisierten Schreibassistenten bis hin zu hochentwickelten Konversationsagenten.

Conclusion

Abschluss

This research uncovers a critical vulnerability in LLM training and presents a scalable solution to combat this issue. Adopting automated methods for detecting under-trained tokens enables more robust training processes, ensuring that all tokens within a model's vocabulary are adequately prepared for real-world scenarios. By rectifying this vulnerability, this research significantly improves the efficacy and reliability of language models, paving the way for more trustworthy and effective natural language processing tools.

Diese Untersuchung deckt eine kritische Schwachstelle in der LLM-Ausbildung auf und stellt eine skalierbare Lösung zur Bekämpfung dieses Problems vor. Der Einsatz automatisierter Methoden zur Erkennung unzureichend trainierter Token ermöglicht robustere Trainingsprozesse und stellt sicher, dass alle Token im Vokabular eines Modells angemessen auf reale Szenarien vorbereitet sind. Durch die Behebung dieser Schwachstelle verbessert diese Forschung die Wirksamkeit und Zuverlässigkeit von Sprachmodellen erheblich und ebnet den Weg für vertrauenswürdigere und effektivere Werkzeuge zur Verarbeitung natürlicher Sprache.

Haftungsausschluss:info@kdj.com

Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!

Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.

Weitere Artikel veröffentlicht am Aug 22, 2026