Marktkapitalisierung: $2.1884T 0.82%
Volumen (24h): $63.5815B -9.54%
  • Marktkapitalisierung: $2.1884T 0.82%
  • Volumen (24h): $63.5815B -9.54%
  • Angst- und Gier-Index:
  • Marktkapitalisierung: $2.1884T 0.82%
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
Top -Nachrichten
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Nachrichtenartikel zu Kryptowährungen

Zyda: Ein bahnbrechender offener Datensatz mit 1,3 Billionen Token für die Sprachmodellierung

Jun 08, 2024 at 10:39 am

Zyphra kündigte die Veröffentlichung von Zyda an, einem bahnbrechenden offenen Datensatz mit 1,3 Billionen Token für die Sprachmodellierung. Dieser innovative Datensatz soll die Standards für die Ausbildung und Forschung von Sprachmodellen neu definieren

Zyda: Ein bahnbrechender offener Datensatz mit 1,3 Billionen Token für die Sprachmodellierung

Zyphra, a pioneer in the field of natural language processing (NLP), has announced the release of Zyda, a groundbreaking 1.3 trillion-token open dataset for language modeling. This massive and meticulously curated dataset is poised to redefine the standards of language model training and research, offering an unparalleled combination of size, quality, and accessibility.

Zyphra, ein Pionier auf dem Gebiet der Verarbeitung natürlicher Sprache (NLP), hat die Veröffentlichung von Zyda angekündigt, einem bahnbrechenden offenen Datensatz mit 1,3 Billionen Token für die Sprachmodellierung. Dieser umfangreiche und sorgfältig zusammengestellte Datensatz ist bereit, die Standards für die Schulung und Forschung von Sprachmodellen neu zu definieren und bietet eine beispiellose Kombination aus Größe, Qualität und Zugänglichkeit.

To create Zyda, several high-quality open datasets were combined and refined through a rigorous filtering and deduplication process. The resulting dataset boasts an impressive token count while maintaining the highest data quality standards. Zyda is primarily designed to facilitate advanced language modeling experiments and training at a scale that was previously unattainable with open datasets.

Um Zyda zu erstellen, wurden mehrere hochwertige offene Datensätze kombiniert und durch einen strengen Filter- und Deduplizierungsprozess verfeinert. Der resultierende Datensatz weist eine beeindruckende Token-Anzahl auf und erfüllt gleichzeitig die höchsten Datenqualitätsstandards. Zyda ist in erster Linie darauf ausgelegt, fortgeschrittene Experimente und Schulungen zur Sprachmodellierung in einem Umfang zu ermöglichen, der bisher mit offenen Datensätzen nicht erreichbar war.

In comprehensive ablation studies, Zyda has consistently outperformed existing datasets, including Dolma, Fineweb, Pile, RefinedWeb, and SlimPajama. This makes Zyda a crucial resource for researchers and developers looking to contribute to the field of language modeling.

In umfassenden Ablationsstudien hat Zyda bestehende Datensätze, darunter Dolma, Fineweb, Pile, RefinedWeb und SlimPajama, durchweg übertroffen. Dies macht Zyda zu einer wichtigen Ressource für Forscher und Entwickler, die einen Beitrag zum Bereich der Sprachmodellierung leisten möchten.

Key Features of Zyda

Hauptmerkmale von Zyda

Zyda was meticulously crafted by merging seven well-respected open language modeling datasets: RefinedWeb, Starcoder, C4, Pile, Slimpajama, pe2so, and arXiv. Each dataset underwent a uniform post-processing pipeline designed to enhance quality and coherence.

Zyda wurde sorgfältig erstellt, indem sieben angesehene Open-Language-Modellierungsdatensätze zusammengeführt wurden: RefinedWeb, Starcoder, C4, Pile, Slimpajama, pe2so und arXiv. Jeder Datensatz durchlief eine einheitliche Nachbearbeitungspipeline, um Qualität und Kohärenz zu verbessern.

The creation process involved thorough syntactic filtering to eliminate low-quality documents, followed by an aggressive cross-deduplication pass. Many datasets contained significant overlaps due to common data sources like Common Crawl, making cross-deduplication particularly important. This extensive cleaning process reduced the initial 2 trillion tokens to a more refined and manageable 1.3 trillion.

Der Erstellungsprozess umfasste eine gründliche syntaktische Filterung zur Eliminierung minderwertiger Dokumente, gefolgt von einem aggressiven Cross-Deduplizierungsdurchlauf. Viele Datensätze enthielten erhebliche Überschneidungen aufgrund gemeinsamer Datenquellen wie Common Crawl, weshalb die übergreifende Deduplizierung besonders wichtig ist. Durch diesen umfassenden Reinigungsprozess wurden die anfänglichen 2 Billionen Token auf verfeinerte und überschaubare 1,3 Billionen reduziert.

The effectiveness of Zyda is evident in the performance of Zamba, a language model trained on Zyda. When compared to models trained on competing datasets, Zamba demonstrates significant strength on a per-token basis. This serves as a testament to Zyda’s superior quality and potential to drive language modeling advancements.

Die Wirksamkeit von Zyda zeigt sich in der Leistung von Zamba, einem auf Zyda trainierten Sprachmodell. Im Vergleich zu Modellen, die auf konkurrierenden Datensätzen trainiert wurden, zeigt Zamba auf Token-Basis eine erhebliche Stärke. Dies ist ein Beweis für die überragende Qualität und das Potenzial von Zyda, Fortschritte bei der Sprachmodellierung voranzutreiben.

In conclusion, Zyda represents a monumental leap forward in the field of language modeling. By providing a massive, high-quality, open dataset, Zyphra is paving the way for the next generation of NLP research and applications. The release of Zyda not only underscores Zyphra’s leadership in the field but also sets a new benchmark for what is possible with open datasets.

Zusammenfassend lässt sich sagen, dass Zyda einen monumentalen Fortschritt auf dem Gebiet der Sprachmodellierung darstellt. Durch die Bereitstellung eines riesigen, hochwertigen, offenen Datensatzes ebnet Zyphra den Weg für die nächste Generation der NLP-Forschung und -Anwendungen. Die Veröffentlichung von Zyda unterstreicht nicht nur Zyphras Führungsrolle auf diesem Gebiet, sondern setzt auch einen neuen Maßstab für das, was mit offenen Datensätzen möglich ist.

Haftungsausschluss:info@kdj.com

Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!

Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.

Weitere Artikel veröffentlicht am Jul 30, 2026