Capitalisation boursière: $2.2001T 1.31%
Volume(24h): $63.9638B -6.10%
  • Capitalisation boursière: $2.2001T 1.31%
  • Volume(24h): $63.9638B -6.10%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.2001T 1.31%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

Zyda : un ensemble de données ouvertes révolutionnaire de 1 300 milliards de jetons pour la modélisation du langage

Jun 08, 2024 at 10:39 am

Zyphra a annoncé la sortie de Zyda, un ensemble de données ouvertes révolutionnaire de 1,3 billion de jetons pour la modélisation du langage. Cet ensemble de données innovant est destiné à redéfinir les normes de formation et de recherche sur les modèles linguistiques

Zyda : un ensemble de données ouvertes révolutionnaire de 1 300 milliards de jetons pour la modélisation du langage

Zyphra, a pioneer in the field of natural language processing (NLP), has announced the release of Zyda, a groundbreaking 1.3 trillion-token open dataset for language modeling. This massive and meticulously curated dataset is poised to redefine the standards of language model training and research, offering an unparalleled combination of size, quality, and accessibility.

Zyphra, pionnier dans le domaine du traitement du langage naturel (NLP), a annoncé la sortie de Zyda, un ensemble de données ouvertes révolutionnaire de 1 300 milliards de jetons pour la modélisation du langage. Cet ensemble de données massif et méticuleusement organisé est sur le point de redéfinir les normes de formation et de recherche sur les modèles linguistiques, offrant une combinaison inégalée de taille, de qualité et d'accessibilité.

To create Zyda, several high-quality open datasets were combined and refined through a rigorous filtering and deduplication process. The resulting dataset boasts an impressive token count while maintaining the highest data quality standards. Zyda is primarily designed to facilitate advanced language modeling experiments and training at a scale that was previously unattainable with open datasets.

Pour créer Zyda, plusieurs ensembles de données ouvertes de haute qualité ont été combinés et affinés grâce à un processus rigoureux de filtrage et de déduplication. L'ensemble de données résultant possède un nombre impressionnant de jetons tout en conservant les normes de qualité de données les plus élevées. Zyda est principalement conçu pour faciliter les expériences avancées de modélisation linguistique et la formation à une échelle auparavant inaccessible avec des ensembles de données ouverts.

In comprehensive ablation studies, Zyda has consistently outperformed existing datasets, including Dolma, Fineweb, Pile, RefinedWeb, and SlimPajama. This makes Zyda a crucial resource for researchers and developers looking to contribute to the field of language modeling.

Dans des études complètes sur l'ablation, Zyda a systématiquement surpassé les ensembles de données existants, notamment Dolma, Fineweb, Pile, RefinedWeb et SlimPajama. Cela fait de Zyda une ressource cruciale pour les chercheurs et les développeurs cherchant à contribuer au domaine de la modélisation du langage.

Key Features of Zyda

Principales caractéristiques de Zyda

Zyda was meticulously crafted by merging seven well-respected open language modeling datasets: RefinedWeb, Starcoder, C4, Pile, Slimpajama, pe2so, and arXiv. Each dataset underwent a uniform post-processing pipeline designed to enhance quality and coherence.

Zyda a été méticuleusement conçu en fusionnant sept ensembles de données de modélisation de langage ouvert très respectés : RefinedWeb, Starcoder, C4, Pile, Slimpajama, pe2so et arXiv. Chaque ensemble de données a subi un pipeline de post-traitement uniforme conçu pour améliorer la qualité et la cohérence.

The creation process involved thorough syntactic filtering to eliminate low-quality documents, followed by an aggressive cross-deduplication pass. Many datasets contained significant overlaps due to common data sources like Common Crawl, making cross-deduplication particularly important. This extensive cleaning process reduced the initial 2 trillion tokens to a more refined and manageable 1.3 trillion.

Le processus de création impliquait un filtrage syntaxique approfondi pour éliminer les documents de mauvaise qualité, suivi d'une passe de déduplication croisée agressive. De nombreux ensembles de données contenaient des chevauchements importants en raison de sources de données communes telles que Common Crawl, ce qui rendait la déduplication croisée particulièrement importante. Ce processus de nettoyage approfondi a réduit les 2 000 milliards de jetons initiaux à 1 300 milliards, plus raffinés et plus gérables.

The effectiveness of Zyda is evident in the performance of Zamba, a language model trained on Zyda. When compared to models trained on competing datasets, Zamba demonstrates significant strength on a per-token basis. This serves as a testament to Zyda’s superior quality and potential to drive language modeling advancements.

L'efficacité de Zyda est évidente dans les performances de Zamba, un modèle de langage formé sur Zyda. Comparé aux modèles formés sur des ensembles de données concurrents, Zamba démontre une force significative par jeton. Cela témoigne de la qualité supérieure de Zyda et de son potentiel à faire progresser la modélisation du langage.

In conclusion, Zyda represents a monumental leap forward in the field of language modeling. By providing a massive, high-quality, open dataset, Zyphra is paving the way for the next generation of NLP research and applications. The release of Zyda not only underscores Zyphra’s leadership in the field but also sets a new benchmark for what is possible with open datasets.

En conclusion, Zyda représente un bond en avant monumental dans le domaine de la modélisation du langage. En fournissant un ensemble de données ouvertes massives et de haute qualité, Zyphra ouvre la voie à la prochaine génération de recherche et d'applications en PNL. La sortie de Zyda souligne non seulement le leadership de Zyphra dans le domaine, mais établit également une nouvelle référence pour ce qui est possible avec les ensembles de données ouverts.

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Jul 29, 2026