Capitalisation boursière: $2.1753T 0.52%
Volume(24h): $38.8228B -29.97%
  • Capitalisation boursière: $2.1753T 0.52%
  • Volume(24h): $38.8228B -29.97%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.1753T 0.52%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

Chameleon : un modèle révolutionnaire pour une création de documents multimodaux fluide

May 18, 2024 at 03:04 pm

Les méta-chercheurs ont développé Chameleon, un modèle de base multimodal qui intègre de manière transparente des séquences d'images et de texte. Contrairement aux modèles traditionnels qui séparent les modalités, l'architecture unifiée de Chameleon symbolise les images comme le texte, permettant une modélisation complète des documents et un raisonnement entrelacé entre les modalités. Pour relever les défis d'optimisation dans cette première approche de fusion, les chercheurs ont introduit des améliorations architecturales et des techniques de formation, ce qui a permis une formation réussie sur l'ensemble de données à grande échelle de Meta. L'évaluation de Chameleon démontre des performances compétitives dans les tâches contenant uniquement du texte, surpassant LLaMa-2 en raisonnement de bon sens et en mathématiques. Dans les tâches liées à l'image, il excelle dans le sous-titrage d'images et la réponse visuelle aux questions, dépassant ou faisant correspondre des modèles plus grands avec moins de prises de vue.

Chameleon : un modèle révolutionnaire pour une création de documents multimodaux fluide

Chameleon: A Unified Foundation Model for Seamless Multimodal Document Modeling

Chameleon : un modèle de base unifié pour une modélisation transparente de documents multimodaux

Recent multimodal foundation models have revolutionized the field of artificial intelligence, enabling impressive advancements in tasks such as natural language processing, image recognition, and question answering. However, these models often treat different modalities separately, employing specific encoders or decoders for each. This approach inherently limits their ability to effectively fuse information across modalities and produce comprehensive multimodal documents that seamlessly integrate diverse sequences of images and text.

Les récents modèles de base multimodaux ont révolutionné le domaine de l'intelligence artificielle, permettant des progrès impressionnants dans des tâches telles que le traitement du langage naturel, la reconnaissance d'images et la réponse aux questions. Cependant, ces modèles traitent souvent différentes modalités séparément, employant des encodeurs ou décodeurs spécifiques pour chacune. Cette approche limite intrinsèquement leur capacité à fusionner efficacement les informations entre les modalités et à produire des documents multimodaux complets qui intègrent de manière transparente diverses séquences d'images et de texte.

Meta researchers have addressed this challenge by introducing Chameleon, a groundbreaking mixed-modal foundation model designed to facilitate seamless reasoning and generation with interleaved textual and image sequences. Unlike traditional models, Chameleon employs a unified architecture that treats both modalities equally by tokenizing images akin to text. This approach, termed early fusion, allows for seamless flow of information across modalities but also presents unique optimization challenges.

Les méta-chercheurs ont relevé ce défi en introduisant Chameleon, un modèle de base multimodal révolutionnaire conçu pour faciliter un raisonnement et une génération fluides avec des séquences de textes et d'images entrelacées. Contrairement aux modèles traditionnels, Chameleon utilise une architecture unifiée qui traite les deux modalités de manière égale en symbolisant les images semblables au texte. Cette approche, appelée fusion précoce, permet un flux transparent d'informations entre les modalités, mais présente également des défis d'optimisation uniques.

To overcome these challenges, the researchers have incorporated architectural enhancements and innovative training techniques into Chameleon's design. By adapting transformer architecture and fine-tuning strategies, they have laid the foundation for a model capable of addressing the complexities of multimodal document modeling.

Pour surmonter ces défis, les chercheurs ont incorporé des améliorations architecturales et des techniques de formation innovantes dans la conception de Chameleon. En adaptant l'architecture du transformateur et en affinant les stratégies, ils ont jeté les bases d'un modèle capable de répondre aux complexités de la modélisation de documents multimodaux.

To capture the visual information effectively, they developed a novel image tokenizer that encodes high-resolution 512 × 512 images into 1024 tokens from an 8192-codebook. This tokenization process ensures that images are represented in a manner compatible with the text tokens, facilitating seamless reasoning across modalities. They further refined their tokenizer by introducing a BPE tokenizer with a 65,536-vocabulary, including image tokens, trained using the sentencepiece library. This enhanced tokenizer improved the model's performance and stability.

Pour capturer efficacement les informations visuelles, ils ont développé un nouveau tokeniseur d'images qui code des images haute résolution 512 × 512 en 1 024 jetons à partir d'un livre de codes de 8 192. Ce processus de tokenisation garantit que les images sont représentées d'une manière compatible avec les jetons de texte, facilitant ainsi un raisonnement transparent entre les modalités. Ils ont encore affiné leur tokenizer en introduisant un tokenizer BPE avec un vocabulaire de 65 536, y compris des tokens d'image, formés à l'aide de la bibliothèque de phrases. Ce tokenizer amélioré a amélioré les performances et la stabilité du modèle.

During training, they employed QK-Norm, dropout, and z-loss regularization techniques to address stability issues. Additionally, they leveraged Meta's RSC platform for efficient and scalable training. Inference in Chameleon is streamlined using PyTorch and xformers, supporting both streaming and non-streaming modes with token masking for conditional logic.

Au cours de la formation, ils ont utilisé des techniques de régularisation QK-Norm, d'abandon et de perte z pour résoudre les problèmes de stabilité. De plus, ils ont exploité la plateforme RSC de Meta pour une formation efficace et évolutive. L'inférence dans Chameleon est rationalisée à l'aide de PyTorch et xformers, prenant en charge les modes streaming et non streaming avec masquage de jetons pour la logique conditionnelle.

To enhance model capabilities and safety, Chameleon underwent a rigorous alignment stage, undergoing fine-tuning on diverse datasets encompassing Text, Code, Visual Chat, and Safety. This comprehensive training regimen aimed to improve the model's generalizability and mitigate potential risks. They curated high-quality images for Image Generation using an aesthetic classifier, ensuring that the model generates visually appealing and relevant images.

Pour améliorer les capacités et la sécurité du modèle, Chameleon a subi une étape d'alignement rigoureuse, en cours d'ajustement sur divers ensembles de données englobant le texte, le code, le chat visuel et la sécurité. Ce programme de formation complet visait à améliorer la généralisabilité du modèle et à atténuer les risques potentiels. Ils ont sélectionné des images de haute qualité pour la génération d'images à l'aide d'un classificateur esthétique, garantissant que le modèle génère des images visuellement attrayantes et pertinentes.

Supervised Fine-Tuning (SFT) played a crucial role in Chameleon's training process. By balancing data across modalities and employing a cosine learning rate schedule with a weight decay of 0.1, the researchers optimized the model's performance exclusively based on answer prompts. Dropout of 0.05 and z-loss regularization further enhanced the model's stability. Images in prompts were resized with border padding, while those in answers underwent center-cropping for optimal image generation quality.

Le réglage fin supervisé (SFT) a joué un rôle crucial dans le processus de formation de Chameleon. En équilibrant les données entre les modalités et en employant un programme de taux d'apprentissage du cosinus avec une décroissance du poids de 0,1, les chercheurs ont optimisé les performances du modèle exclusivement sur la base d'invites de réponse. L'abandon de 0,05 et la régularisation de la perte z ont encore amélioré la stabilité du modèle. Les images des invites ont été redimensionnées avec un remplissage de bordure, tandis que celles des réponses ont été recadrées au centre pour une qualité de génération d'image optimale.

Chameleon's versatility extends beyond its core multimodal capabilities, as evidenced by its strong performance on various text-only tasks. The model achieved competitive results on commonsense reasoning and math tasks, surpassing LLaMa-2 on many benchmarks. This improvement can be attributed to Chameleon's robust pre-training and the inclusion of code data in its training regimen.

La polyvalence de Chameleon s'étend au-delà de ses capacités multimodales de base, comme en témoignent ses solides performances sur diverses tâches contenant uniquement du texte. Le modèle a obtenu des résultats compétitifs sur le raisonnement de bon sens et les tâches mathématiques, surpassant LLaMa-2 dans de nombreux tests. Cette amélioration peut être attribuée à la solide pré-formation de Chameleon et à l'inclusion de données de code dans son programme de formation.

In image-to-text tasks, Chameleon excelled in image captioning, matching or surpassing larger models like Flamingo-80B and IDEFICS-80B with fewer shots. Its performance in visual question answering (VQA) approached that of top models, even though LLaMa-1.5 slightly outperformed VQA-v2.

Dans les tâches de conversion d'image en texte, Chameleon excellait dans le sous-titrage d'images, égalant ou dépassant des modèles plus grands comme Flamingo-80B et IDEFICS-80B avec moins de prises de vue. Ses performances en matière de réponse visuelle aux questions (VQA) se rapprochent de celles des modèles haut de gamme, même si LLaMa-1.5 a légèrement surpassé VQA-v2.

Overall, Chameleon demonstrates remarkable versatility and efficiency across different tasks, requiring fewer training examples and smaller model sizes compared to its counterparts.

Dans l’ensemble, Chameleon fait preuve d’une polyvalence et d’une efficacité remarquables dans différentes tâches, nécessitant moins d’exemples de formation et des modèles de plus petite taille par rapport à ses homologues.

In summary, Chameleon is a token-based model that seamlessly integrates image and text tokens, enabling superior performance in vision-language tasks. Its unified architecture facilitates joint reasoning over modalities, surpassing late-fusion models like Flamingo and IDEFICS in image captioning and visual question answering. Chameleon's early-fusion approach introduces novel techniques for stable training, addressing scalability challenges faced by previous multimodal models. It opens up new possibilities for multimodal interaction, as demonstrated by its strong performance on mixed-modal open-ended QA benchmarks.

En résumé, Chameleon est un modèle basé sur des jetons qui intègre de manière transparente des jetons d'image et de texte, permettant des performances supérieures dans les tâches de langage visuel. Son architecture unifiée facilite le raisonnement conjoint sur les modalités, surpassant les modèles de fusion tardive comme Flamingo et IDEFICS en matière de sous-titrage d'images et de réponse visuelle aux questions. L'approche de fusion précoce de Chameleon introduit de nouvelles techniques pour un entraînement stable, répondant aux défis d'évolutivité rencontrés par les modèles multimodaux précédents. Il ouvre de nouvelles possibilités d'interaction multimodale, comme le démontrent ses solides performances sur les tests d'assurance qualité ouverts et multimodaux.

This groundbreaking research paves the way for the development of even more advanced multimodal models capable of handling complex tasks and producing highly coherent and informative content. Researchers, practitioners, and industry leaders alike eagerly anticipate the transformative potential of Chameleon and its potential impact on the future of AI-driven multimodal applications.

Cette recherche révolutionnaire ouvre la voie au développement de modèles multimodaux encore plus avancés, capables de gérer des tâches complexes et de produire un contenu hautement cohérent et informatif. Les chercheurs, les praticiens et les leaders de l’industrie anticipent avec impatience le potentiel de transformation de Chameleon et son impact potentiel sur l’avenir des applications multimodales basées sur l’IA.

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Aug 03, 2026