Capitalisation boursière: $2.1716T -2.69%
Volume(24h): $68.119B 35.62%
  • Capitalisation boursière: $2.1716T -2.69%
  • Volume(24h): $68.119B 35.62%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.1716T -2.69%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

Grands modèles conceptuels : une nouvelle architecture pour la communication basée sur l'IA

Dec 16, 2024 at 08:44 am

Les grands concepts modèles (LCM) représentent un changement par rapport aux architectures LLM traditionnelles. Les LCM apportent deux innovations significatives : une structure hiérarchique qui permet de raisonner à différents niveaux d'abstraction et un pipeline de traitement indépendant des modalités qui prend en charge les applications multilingues et multimodales.

Grands modèles conceptuels : une nouvelle architecture pour la communication basée sur l'IA

Large Language Models (LLMs) have made significant strides in natural language processing (NLP), with applications in text generation, summarization, and question-answering. However, their reliance on token-level processing—predicting one word at a time—presents challenges. This approach contrasts with human communication, which often operates at higher levels of abstraction, such as sentences or ideas.

Les grands modèles linguistiques (LLM) ont fait des progrès significatifs dans le traitement du langage naturel (NLP), avec des applications dans la génération de texte, le résumé et la réponse à des questions. Cependant, leur dépendance à l’égard d’un traitement au niveau des jetons (prédire un mot à la fois) présente des défis. Cette approche contraste avec la communication humaine, qui opère souvent à des niveaux d’abstraction plus élevés, comme les phrases ou les idées.

Token-level modeling also struggles with tasks requiring long-context understanding and may produce outputs with inconsistencies. Moreover, extending these models to multilingual and multimodal applications is computationally expensive and data-intensive. To address these issues, a team of researchers at Meta AI has proposed a new approach: Large Concept Models (LCMs).

La modélisation au niveau des jetons rencontre également des difficultés avec les tâches nécessitant une compréhension du contexte à long terme et peut produire des résultats incohérents. De plus, étendre ces modèles à des applications multilingues et multimodales est coûteux en termes de calcul et nécessite beaucoup de données. Pour répondre à ces problématiques, une équipe de chercheurs de Meta AI a proposé une nouvelle approche : les Large Concept Models (LCM).

Large Concept Models

Grands modèles conceptuels

Meta AI's Large Concept Models (LCMs) represent a departure from traditional LLM architectures. At their core, LCMs introduce two key innovations:

Les grands modèles conceptuels (LCM) de Meta AI représentent une rupture par rapport aux architectures LLM traditionnelles. À la base, les LCM introduisent deux innovations clés :

Concept Encoders and Decoders: LCMs utilize frozen concept encoders and decoders to map input sentences into a high-dimensional embedding space (e.g., SONAR) and decode these embeddings back into natural language or other modalities. This modular design allows for easy extension to new languages or modalities without requiring the entire model to be retrained.

Encodeurs et décodeurs de concepts : les LCM utilisent des encodeurs et des décodeurs de concepts figés pour mapper les phrases d'entrée dans un espace d'intégration de grande dimension (par exemple, SONAR) et décoder ces intégrations en langage naturel ou dans d'autres modalités. Cette conception modulaire permet une extension facile à de nouveaux langages ou modalités sans nécessiter de recyclage de l'ensemble du modèle.

Hierarchical Architecture: LCMs feature a hierarchical architecture, where a high-level language model operates over concept sequences, and lower-level models handle intra-concept token generation. This hierarchy promotes coherence in generated text and improves efficiency by reducing the vocabulary size for the high-level language model.

Architecture hiérarchique : les LCM présentent une architecture hiérarchique, dans laquelle un modèle de langage de haut niveau opère sur des séquences de concepts, et des modèles de niveau inférieur gèrent la génération de jetons intra-concept. Cette hiérarchie favorise la cohérence du texte généré et améliore l'efficacité en réduisant la taille du vocabulaire pour le modèle de langage de haut niveau.

Technical Details and Benefits of LCMs

Détails techniques et avantages des LCM

LCMs incorporate several innovations to enhance language modeling:

Les LCM intègrent plusieurs innovations pour améliorer la modélisation du langage :

Diffusion-based Two-Tower LCM: This variant of LCMs employs a two-tower architecture with a diffusion-based decoder for efficient and high-quality generation.

LCM à deux tours basé sur la diffusion : cette variante de LCM utilise une architecture à deux tours avec un décodeur basé sur la diffusion pour une génération efficace et de haute qualité.

Concept Embeddings in a Unified Embedding Space: LCMs utilize a single embedding space (e.g., SONAR) for both concepts and tokens, enabling seamless integration and bidirectional mapping between these representations.

Incorporations de concepts dans un espace d'intégration unifié : les LCM utilisent un espace d'intégration unique (par exemple, SONAR) pour les concepts et les jetons, permettant une intégration transparente et un mappage bidirectionnel entre ces représentations.

Modality-Agnostic Processing: LCMs are designed to handle various modalities (e.g., text, images, code) using a shared processing pipeline, making them applicable to multimodal tasks without specialized architectures.

Traitement indépendant des modalités : les LCM sont conçus pour gérer diverses modalités (par exemple, texte, images, code) à l'aide d'un pipeline de traitement partagé, ce qui les rend applicables à des tâches multimodales sans architectures spécialisées.

Insights from Experimental Results

Aperçu des résultats expérimentaux

Meta AI's experiments showcase the capabilities of LCMs. A diffusion-based Two-Tower LCM scaled to 7 billion parameters demonstrated competitive performance in tasks like summarization:

Les expériences de Meta AI mettent en valeur les capacités des LCM. Un LCM à deux tours basé sur la diffusion et adapté à 7 milliards de paramètres a démontré des performances compétitives dans des tâches telles que la synthèse :

On the XSUM benchmark, this LCM achieved a state-of-the-art ROUGE-1 score of 56.9, outperforming the previous best model by 1.1 points.

Sur le benchmark XSUM, ce LCM a obtenu un score ROUGE-1 de pointe de 56,9, surperformant le meilleur modèle précédent de 1,1 points.

When evaluated on the CNN/Daily Mail dataset, the LCM attained a ROUGE-1 score of 52.2, ranking among the top models on this benchmark.

Lorsqu'il a été évalué sur l'ensemble de données CNN/Daily Mail, le LCM a atteint un score ROUGE-1 de 52,2, se classant parmi les meilleurs modèles de cette référence.

Conclusion

Meta AI's Large Concept Models offer a promising alternative to conventional token-based language models. By leveraging high-dimensional concept embeddings and a modality-agnostic processing pipeline, LCMs overcome key limitations of existing approaches. Their hierarchical architecture enhances coherence and efficiency, while their strong zero-shot generalization expands their applicability to diverse languages and modalities. As research into this architecture continues, LCMs have the potential to redefine the capabilities of language models, offering a more scalable and adaptable approach to AI-driven communication.

Les grands modèles conceptuels de Meta AI offrent une alternative prometteuse aux modèles de langage conventionnels basés sur des jetons. En tirant parti de l’intégration de concepts de grande dimension et d’un pipeline de traitement indépendant des modalités, les LCM surmontent les principales limites des approches existantes. Leur architecture hiérarchique améliore la cohérence et l’efficacité, tandis que leur forte généralisation sans tir étend leur applicabilité à divers langages et modalités. À mesure que la recherche sur cette architecture se poursuit, les LCM ont le potentiel de redéfinir les capacités des modèles de langage, offrant ainsi une approche plus évolutive et adaptable de la communication basée sur l'IA.

Visit the Paper and GitHub Page for more details. All credit for this research goes to the researchers of this project. Also, don’t forget to follow us on Twitter and join our Telegram Channel and LinkedIn Group. Don’t Forget to join our 60k+ ML SubReddit.

Visitez la page Paper et GitHub pour plus de détails. Tout le mérite de cette recherche revient aux chercheurs de ce projet. N'oubliez pas non plus de nous suivre sur Twitter et de rejoindre notre chaîne Telegram et notre groupe LinkedIn. N'oubliez pas de rejoindre notre SubReddit de plus de 60 000 ML.

Trending: LG AI Research Releases EXAONE 3.5: Three Open-Source Bilingual Frontier AI-level Models Delivering Unmatched Instruction Following and Long Context Understanding for Global Leadership in Generative AI Excellence….

Tendance : LG AI Research publie EXAONE 3.5 : trois modèles de niveau IA Frontier bilingues open source offrant un suivi d'instructions inégalé et une longue compréhension du contexte pour un leadership mondial en matière d'excellence en IA générative….

Source primaire:marktechpost

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Jul 29, 2026