Marktkapitalisierung: $2.1564T -0.83%
Volumen (24h): $39.3565B 2.43%
  • Marktkapitalisierung: $2.1564T -0.83%
  • Volumen (24h): $39.3565B 2.43%
  • Angst- und Gier-Index:
  • Marktkapitalisierung: $2.1564T -0.83%
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
Top -Nachrichten
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Nachrichtenartikel zu Kryptowährungen

Tokenformer: Transformatoren neu denken, indem Parameter als Token behandelt werden

Nov 03, 2024 at 09:00 pm

Transformer haben die künstliche Intelligenz verändert und bieten unübertroffene Leistung in den Bereichen NLP, Computer Vision und multimodale Datenintegration. Diese Modelle zeichnen sich durch die Erkennung von Mustern in Daten durch ihre Aufmerksamkeitsmechanismen aus und eignen sich daher ideal für komplexe Aufgaben. Allerdings muss die schnelle Skalierung von Transformatormodellen aufgrund des hohen Rechenaufwands, der mit ihrer traditionellen Struktur verbunden ist, verbessert werden.

Tokenformer: Transformatoren neu denken, indem Parameter als Token behandelt werden

Transformers have revolutionized artificial intelligence, offering unparalleled performance in natural language processing (NLP), computer vision, and multi-modal data integration. These models excel at identifying patterns within data through their attention mechanisms, making them ideal for complex tasks. However, the rapid scaling of transformer models needs to be improved because of the high computational cost associated with their traditional structure. As these models grow, they demand significant hardware resources and training time, which increases exponentially with the model size.

Transformer haben die künstliche Intelligenz revolutioniert und bieten beispiellose Leistung in der Verarbeitung natürlicher Sprache (NLP), Computer Vision und multimodaler Datenintegration. Diese Modelle zeichnen sich durch die Erkennung von Mustern in Daten durch ihre Aufmerksamkeitsmechanismen aus und eignen sich daher ideal für komplexe Aufgaben. Allerdings muss die schnelle Skalierung von Transformatormodellen aufgrund des hohen Rechenaufwands, der mit ihrer traditionellen Struktur verbunden ist, verbessert werden. Wenn diese Modelle wachsen, erfordern sie erhebliche Hardwareressourcen und Trainingszeit, die exponentiell mit der Modellgröße ansteigen.

The primary obstacle in scaling transformers lies in the fixed parameters within their linear projection layers. This static structure limits the model’s ability to expand without being entirely retrained, which becomes exponentially more expensive as model sizes increase. These traditional models typically demand comprehensive retraining when architectural modifications occur, such as increasing channel dimensions.

Das Haupthindernis bei Skalierungstransformatoren liegt in den festen Parametern innerhalb ihrer linearen Projektionsschichten. Diese statische Struktur begrenzt die Fähigkeit des Modells, sich zu erweitern, ohne dass es vollständig neu trainiert werden muss, was mit zunehmender Modellgröße exponentiell teurer wird. Diese traditionellen Modelle erfordern in der Regel eine umfassende Neuschulung, wenn architektonische Änderungen vorgenommen werden, wie beispielsweise die Vergrößerung der Kanalabmessungen.

Consequently, the computational cost for these expansions grows impractically high, and the approach lacks flexibility. The inability to add new parameters dynamically stifles growth, rendering these models less adaptable to evolving AI applications and more costly in terms of time and resources.

Folglich steigt der Rechenaufwand für diese Erweiterungen unpraktisch hoch und dem Ansatz mangelt es an Flexibilität. Die Unfähigkeit, neue Parameter dynamisch hinzuzufügen, bremst das Wachstum, wodurch diese Modelle weniger an sich entwickelnde KI-Anwendungen angepasst werden können und in Bezug auf Zeit und Ressourcen teurer werden.

Historically, approaches to managing model scalability included duplicating weights or restructuring models using methods like Net2Net, where duplicating neurons expand layers. However, these approaches often disrupt the balance of pre-trained models, resulting in slower convergence rates and additional training complexities.

In der Vergangenheit umfassten Ansätze zur Verwaltung der Modellskalierbarkeit das Duplizieren von Gewichten oder das Umstrukturieren von Modellen mithilfe von Methoden wie Net2Net, bei denen duplizierte Neuronen Schichten erweitern. Diese Ansätze stören jedoch häufig das Gleichgewicht vorab trainierter Modelle, was zu langsameren Konvergenzraten und zusätzlicher Trainingskomplexität führt.

While these methods have made incremental progress, they still face limitations in preserving model integrity during scaling. Transformers rely heavily on static linear projections, making parameter expansion expensive and inflexible. Traditional models like GPT and other large transformers often retrain from scratch, incurring high computational costs with each new scaling stage.

Obwohl diese Methoden inkrementelle Fortschritte gemacht haben, stoßen sie immer noch auf Einschränkungen bei der Wahrung der Modellintegrität während der Skalierung. Transformatoren basieren stark auf statischen linearen Projektionen, was die Parametererweiterung teuer und unflexibel macht. Herkömmliche Modelle wie GPT und andere große Transformatoren werden oft von Grund auf neu trainiert, was mit jeder neuen Skalierungsstufe hohe Rechenkosten verursacht.

Now, researchers at the Max Planck Institute, Google, and Peking University have developed a new architecture called Tokenformer that fundamentally reimagines transformers by treating model parameters as tokens, allowing for dynamic interactions between tokens and parameters.

Nun haben Forscher des Max-Planck-Instituts, von Google und der Peking-Universität eine neue Architektur namens Tokenformer entwickelt, die Transformatoren grundlegend neu konzipiert, indem sie Modellparameter als Token behandelt und so dynamische Interaktionen zwischen Token und Parametern ermöglicht.

In this framework, Tokenformer introduces a novel component called the token-parameter attention (Pattention) layer, which facilitates incremental scaling. The model can add new parameter tokens without retraining, drastically reducing training costs.

In diesem Framework führt Tokenformer eine neuartige Komponente namens Token-Parameter-Aufmerksamkeitsschicht (Pattention) ein, die eine inkrementelle Skalierung erleichtert. Das Modell kann ohne erneutes Training neue Parameter-Tokens hinzufügen, wodurch die Trainingskosten drastisch gesenkt werden.

By representing input tokens and parameters within the same framework, Tokenformer allows for flexible scaling, providing researchers with a more efficient, resource-conscious model architecture that retains scalability and high performance.

Durch die Darstellung von Eingabetokens und Parametern innerhalb desselben Frameworks ermöglicht Tokenformer eine flexible Skalierung und bietet Forschern eine effizientere, ressourcenschonendere Modellarchitektur, die Skalierbarkeit und hohe Leistung beibehält.

Tokenformer’s Pattention layer uses input tokens as queries, while model parameters serve as keys and values, which differs from the standard transformer approach, relying solely on linear projections.

Die Pattention-Schicht von Tokenformer verwendet Eingabe-Tokens als Abfragen, während Modellparameter als Schlüssel und Werte dienen, was sich vom Standard-Transformer-Ansatz unterscheidet, der ausschließlich auf linearen Projektionen basiert.

The model’s scaling is achieved by adding new key-value parameter pairs, keeping input and output dimensions constant, and avoiding full retraining. Tokenformer’s architecture is designed to be modular, enabling researchers to expand the model seamlessly by incorporating additional tokens.

Die Skalierung des Modells wird durch das Hinzufügen neuer Schlüssel-Wert-Parameterpaare erreicht, wobei die Eingabe- und Ausgabedimensionen konstant gehalten werden und eine vollständige Neuschulung vermieden wird. Die Architektur von Tokenformer ist modular aufgebaut, sodass Forscher das Modell nahtlos durch die Einbindung zusätzlicher Token erweitern können.

This incremental scaling capability supports the efficient reuse of pre-trained weights while enabling rapid adaptation for new datasets or larger model sizes without disrupting learned information.

Diese inkrementelle Skalierungsfunktion unterstützt die effiziente Wiederverwendung vorab trainierter Gewichtungen und ermöglicht gleichzeitig eine schnelle Anpassung an neue Datensätze oder größere Modellgrößen, ohne erlernte Informationen zu beeinträchtigen.

The performance benefits of Tokenformer are notable, as the model significantly reduces computational costs while maintaining accuracy. For instance, Tokenformer scaled from 124 million to 1.4 billion parameters with only half the typical training costs traditional transformers require.

Die Leistungsvorteile von Tokenformer sind bemerkenswert, da das Modell die Rechenkosten erheblich reduziert und gleichzeitig die Genauigkeit beibehält. Beispielsweise konnte Tokenformer von 124 Millionen auf 1,4 Milliarden Parameter skaliert werden, und das mit nur der Hälfte der typischen Schulungskosten, die herkömmliche Transformatoren erfordern.

In one experiment, the model achieved a test perplexity of 11.77 for a 1.4 billion parameter configuration, nearly matching the 11.63 perplexity of a similarly sized transformer trained from scratch.

In einem Experiment erreichte das Modell eine Test-Perplexität von 11,77 für eine Konfiguration mit 1,4 Milliarden Parametern, was nahezu der 11,63-Perplexität eines von Grund auf trainierten Transformators ähnlicher Größe entsprach.

This efficiency means Tokenformer can achieve high performance across multiple domains, including language and visual modeling tasks, at a fraction of the resource expenditure of traditional models.

Diese Effizienz bedeutet, dass Tokenformer eine hohe Leistung über mehrere Domänen hinweg, einschließlich sprachlicher und visueller Modellierungsaufgaben, zu einem Bruchteil des Ressourcenaufwands herkömmlicher Modelle erzielen kann.

Tokenformer presents numerous key takeaways for advancing AI research and improving transformer-based models. These include:

Tokenformer präsentiert zahlreiche wichtige Erkenntnisse zur Weiterentwicklung der KI-Forschung und zur Verbesserung transformatorbasierter Modelle. Dazu gehören:

Treating parameters as tokens enables incremental model scaling without retraining.

Die Behandlung von Parametern als Token ermöglicht eine inkrementelle Modellskalierung ohne erneutes Training.

The token-parameter attention layer facilitates efficient parameter expansion.

Die Token-Parameter-Aufmerksamkeitsschicht ermöglicht eine effiziente Parametererweiterung.

Modular architecture supports seamless model growth by incorporating additional tokens.

Die modulare Architektur unterstützt ein nahtloses Modellwachstum durch die Integration zusätzlicher Token.

The model achieves high performance across diverse domains with minimal resource expenditure.

Das Modell erreicht eine hohe Leistung über verschiedene Domänen hinweg mit minimalem Ressourcenaufwand.

In conclusion, Tokenformer offers a transformative approach to scaling transformer-based models. This model architecture achieves scalability and resource efficiency by treating parameters as tokens, reducing costs, and preserving model performance across tasks.

Zusammenfassend bietet Tokenformer einen transformativen Ansatz zur Skalierung transformatorbasierter Modelle. Diese Modellarchitektur erreicht Skalierbarkeit und Ressourceneffizienz, indem sie Parameter als Token behandelt, Kosten senkt und die Modellleistung über alle Aufgaben hinweg aufrechterhält.

This flexibility represents a breakthrough in transformer design, providing a model that can adapt to the demands of advancing AI applications without retraining. Tokenformer’s architecture holds promise for future AI research, offering a pathway to develop large-scale models sustainably and efficiently.

Diese Flexibilität stellt einen Durchbruch im Transformatordesign dar und stellt ein Modell bereit, das sich ohne Umschulung an die Anforderungen fortschrittlicher KI-Anwendungen anpassen kann. Die Architektur von Tokenformer ist vielversprechend für die zukünftige KI-Forschung und bietet einen Weg zur nachhaltigen und effizienten Entwicklung groß angelegter Modelle.

Check out the Paper, GitHub Page, and Models on HuggingFace.

Schauen Sie sich das Paper, die GitHub-Seite und die Modelle auf HuggingFace an.

All credit for this research goes to the researchers of this project. Also, don’t forget to follow us on Twitter and join our Telegram Channel and LinkedIn Group. If you like our work, you will love our newsletter. Don’t Forget to join our 55k+ ML SubReddit.

Alle Anerkennung für diese Forschung gebührt den Forschern dieses Projekts. Vergessen Sie auch nicht, uns auf Twitter zu folgen und unserem Telegram-Kanal und unserer LinkedIn-Gruppe beizutreten. Wenn Ihnen unsere Arbeit gefällt, werden Sie unseren Newsletter lieben. Vergessen Sie nicht, unserem 55k+ ML SubReddit beizutreten.

[Sponsorship Opportunity with us] Promote Your Research/Product/Webinar with 1Million+ Monthly Readers and 500k+ Community Members

[Sponsoring-Möglichkeit bei uns] Bewerben Sie Ihre Forschung/Ihr Produkt/Webinar mit über 1 Million monatlichen Lesern und über 500.000 Community-Mitgliedern

Originalquelle:marktechpost

Haftungsausschluss:info@kdj.com

Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!

Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.

Weitere Artikel veröffentlicht am Aug 03, 2026