|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Chameleon : un modèle révolutionnaire pour une création de documents multimodaux fluide
May 18, 2024 at 03:04 pm
Les méta-chercheurs ont développé Chameleon, un modèle de base multimodal qui intègre de manière transparente des séquences d'images et de texte. Contrairement aux modèles traditionnels qui séparent les modalités, l'architecture unifiée de Chameleon symbolise les images comme le texte, permettant une modélisation complète des documents et un raisonnement entrelacé entre les modalités. Pour relever les défis d'optimisation dans cette première approche de fusion, les chercheurs ont introduit des améliorations architecturales et des techniques de formation, ce qui a permis une formation réussie sur l'ensemble de données à grande échelle de Meta. L'évaluation de Chameleon démontre des performances compétitives dans les tâches contenant uniquement du texte, surpassant LLaMa-2 en raisonnement de bon sens et en mathématiques. Dans les tâches liées à l'image, il excelle dans le sous-titrage d'images et la réponse visuelle aux questions, dépassant ou faisant correspondre des modèles plus grands avec moins de prises de vue.

Chameleon: A Unified Foundation Model for Seamless Multimodal Document Modeling
Chameleon : un modèle de base unifié pour une modélisation transparente de documents multimodaux
Recent multimodal foundation models have revolutionized the field of artificial intelligence, enabling impressive advancements in tasks such as natural language processing, image recognition, and question answering. However, these models often treat different modalities separately, employing specific encoders or decoders for each. This approach inherently limits their ability to effectively fuse information across modalities and produce comprehensive multimodal documents that seamlessly integrate diverse sequences of images and text.
Les récents modèles de base multimodaux ont révolutionné le domaine de l'intelligence artificielle, permettant des progrès impressionnants dans des tâches telles que le traitement du langage naturel, la reconnaissance d'images et la réponse aux questions. Cependant, ces modèles traitent souvent différentes modalités séparément, employant des encodeurs ou décodeurs spécifiques pour chacune. Cette approche limite intrinsèquement leur capacité à fusionner efficacement les informations entre les modalités et à produire des documents multimodaux complets qui intègrent de manière transparente diverses séquences d'images et de texte.
Meta researchers have addressed this challenge by introducing Chameleon, a groundbreaking mixed-modal foundation model designed to facilitate seamless reasoning and generation with interleaved textual and image sequences. Unlike traditional models, Chameleon employs a unified architecture that treats both modalities equally by tokenizing images akin to text. This approach, termed early fusion, allows for seamless flow of information across modalities but also presents unique optimization challenges.
Les méta-chercheurs ont relevé ce défi en introduisant Chameleon, un modèle de base multimodal révolutionnaire conçu pour faciliter un raisonnement et une génération fluides avec des séquences de textes et d'images entrelacées. Contrairement aux modèles traditionnels, Chameleon utilise une architecture unifiée qui traite les deux modalités de manière égale en symbolisant les images semblables au texte. Cette approche, appelée fusion précoce, permet un flux transparent d'informations entre les modalités, mais présente également des défis d'optimisation uniques.
To overcome these challenges, the researchers have incorporated architectural enhancements and innovative training techniques into Chameleon's design. By adapting transformer architecture and fine-tuning strategies, they have laid the foundation for a model capable of addressing the complexities of multimodal document modeling.
Pour surmonter ces défis, les chercheurs ont incorporé des améliorations architecturales et des techniques de formation innovantes dans la conception de Chameleon. En adaptant l'architecture du transformateur et en affinant les stratégies, ils ont jeté les bases d'un modèle capable de répondre aux complexités de la modélisation de documents multimodaux.
To capture the visual information effectively, they developed a novel image tokenizer that encodes high-resolution 512 × 512 images into 1024 tokens from an 8192-codebook. This tokenization process ensures that images are represented in a manner compatible with the text tokens, facilitating seamless reasoning across modalities. They further refined their tokenizer by introducing a BPE tokenizer with a 65,536-vocabulary, including image tokens, trained using the sentencepiece library. This enhanced tokenizer improved the model's performance and stability.
Pour capturer efficacement les informations visuelles, ils ont développé un nouveau tokeniseur d'images qui code des images haute résolution 512 × 512 en 1 024 jetons à partir d'un livre de codes de 8 192. Ce processus de tokenisation garantit que les images sont représentées d'une manière compatible avec les jetons de texte, facilitant ainsi un raisonnement transparent entre les modalités. Ils ont encore affiné leur tokenizer en introduisant un tokenizer BPE avec un vocabulaire de 65 536, y compris des tokens d'image, formés à l'aide de la bibliothèque de phrases. Ce tokenizer amélioré a amélioré les performances et la stabilité du modèle.
During training, they employed QK-Norm, dropout, and z-loss regularization techniques to address stability issues. Additionally, they leveraged Meta's RSC platform for efficient and scalable training. Inference in Chameleon is streamlined using PyTorch and xformers, supporting both streaming and non-streaming modes with token masking for conditional logic.
Au cours de la formation, ils ont utilisé des techniques de régularisation QK-Norm, d'abandon et de perte z pour résoudre les problèmes de stabilité. De plus, ils ont exploité la plateforme RSC de Meta pour une formation efficace et évolutive. L'inférence dans Chameleon est rationalisée à l'aide de PyTorch et xformers, prenant en charge les modes streaming et non streaming avec masquage de jetons pour la logique conditionnelle.
To enhance model capabilities and safety, Chameleon underwent a rigorous alignment stage, undergoing fine-tuning on diverse datasets encompassing Text, Code, Visual Chat, and Safety. This comprehensive training regimen aimed to improve the model's generalizability and mitigate potential risks. They curated high-quality images for Image Generation using an aesthetic classifier, ensuring that the model generates visually appealing and relevant images.
Pour améliorer les capacités et la sécurité du modèle, Chameleon a subi une étape d'alignement rigoureuse, en cours d'ajustement sur divers ensembles de données englobant le texte, le code, le chat visuel et la sécurité. Ce programme de formation complet visait à améliorer la généralisabilité du modèle et à atténuer les risques potentiels. Ils ont sélectionné des images de haute qualité pour la génération d'images à l'aide d'un classificateur esthétique, garantissant que le modèle génère des images visuellement attrayantes et pertinentes.
Supervised Fine-Tuning (SFT) played a crucial role in Chameleon's training process. By balancing data across modalities and employing a cosine learning rate schedule with a weight decay of 0.1, the researchers optimized the model's performance exclusively based on answer prompts. Dropout of 0.05 and z-loss regularization further enhanced the model's stability. Images in prompts were resized with border padding, while those in answers underwent center-cropping for optimal image generation quality.
Le réglage fin supervisé (SFT) a joué un rôle crucial dans le processus de formation de Chameleon. En équilibrant les données entre les modalités et en employant un programme de taux d'apprentissage du cosinus avec une décroissance du poids de 0,1, les chercheurs ont optimisé les performances du modèle exclusivement sur la base d'invites de réponse. L'abandon de 0,05 et la régularisation de la perte z ont encore amélioré la stabilité du modèle. Les images des invites ont été redimensionnées avec un remplissage de bordure, tandis que celles des réponses ont été recadrées au centre pour une qualité de génération d'image optimale.
Chameleon's versatility extends beyond its core multimodal capabilities, as evidenced by its strong performance on various text-only tasks. The model achieved competitive results on commonsense reasoning and math tasks, surpassing LLaMa-2 on many benchmarks. This improvement can be attributed to Chameleon's robust pre-training and the inclusion of code data in its training regimen.
La polyvalence de Chameleon s'étend au-delà de ses capacités multimodales de base, comme en témoignent ses solides performances sur diverses tâches contenant uniquement du texte. Le modèle a obtenu des résultats compétitifs sur le raisonnement de bon sens et les tâches mathématiques, surpassant LLaMa-2 dans de nombreux tests. Cette amélioration peut être attribuée à la solide pré-formation de Chameleon et à l'inclusion de données de code dans son programme de formation.
In image-to-text tasks, Chameleon excelled in image captioning, matching or surpassing larger models like Flamingo-80B and IDEFICS-80B with fewer shots. Its performance in visual question answering (VQA) approached that of top models, even though LLaMa-1.5 slightly outperformed VQA-v2.
Dans les tâches de conversion d'image en texte, Chameleon excellait dans le sous-titrage d'images, égalant ou dépassant des modèles plus grands comme Flamingo-80B et IDEFICS-80B avec moins de prises de vue. Ses performances en matière de réponse visuelle aux questions (VQA) se rapprochent de celles des modèles haut de gamme, même si LLaMa-1.5 a légèrement surpassé VQA-v2.
Overall, Chameleon demonstrates remarkable versatility and efficiency across different tasks, requiring fewer training examples and smaller model sizes compared to its counterparts.
Dans l’ensemble, Chameleon fait preuve d’une polyvalence et d’une efficacité remarquables dans différentes tâches, nécessitant moins d’exemples de formation et des modèles de plus petite taille par rapport à ses homologues.
In summary, Chameleon is a token-based model that seamlessly integrates image and text tokens, enabling superior performance in vision-language tasks. Its unified architecture facilitates joint reasoning over modalities, surpassing late-fusion models like Flamingo and IDEFICS in image captioning and visual question answering. Chameleon's early-fusion approach introduces novel techniques for stable training, addressing scalability challenges faced by previous multimodal models. It opens up new possibilities for multimodal interaction, as demonstrated by its strong performance on mixed-modal open-ended QA benchmarks.
En résumé, Chameleon est un modèle basé sur des jetons qui intègre de manière transparente des jetons d'image et de texte, permettant des performances supérieures dans les tâches de langage visuel. Son architecture unifiée facilite le raisonnement conjoint sur les modalités, surpassant les modèles de fusion tardive comme Flamingo et IDEFICS en matière de sous-titrage d'images et de réponse visuelle aux questions. L'approche de fusion précoce de Chameleon introduit de nouvelles techniques pour un entraînement stable, répondant aux défis d'évolutivité rencontrés par les modèles multimodaux précédents. Il ouvre de nouvelles possibilités d'interaction multimodale, comme le démontrent ses solides performances sur les tests d'assurance qualité ouverts et multimodaux.
This groundbreaking research paves the way for the development of even more advanced multimodal models capable of handling complex tasks and producing highly coherent and informative content. Researchers, practitioners, and industry leaders alike eagerly anticipate the transformative potential of Chameleon and its potential impact on the future of AI-driven multimodal applications.
Cette recherche révolutionnaire ouvre la voie au développement de modèles multimodaux encore plus avancés, capables de gérer des tâches complexes et de produire un contenu hautement cohérent et informatif. Les chercheurs, les praticiens et les leaders de l’industrie anticipent avec impatience le potentiel de transformation de Chameleon et son impact potentiel sur l’avenir des applications multimodales basées sur l’IA.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
-
- Consensus 2026 Miami : Web3, Blockchain, Crypto-monnaie, NFT, Metaverse, conférence, 5 mai — Là où Wall Street rencontre la frontière numérique
- May 01, 2026 at 11:27 pm
- Miami vibre à l'approche du Consensus 2026 le 5 mai, mettant en avant le Web3, la blockchain, la crypto, les NFT et le passage du métaverse du battage médiatique à la réalité institutionnelle et durable.
-
- La Fed maintient ses taux stables, déclenchant une baisse du prix du Bitcoin dans un contexte de tensions géopolitiques
- May 01, 2026 at 04:04 am
- La décision de la Réserve fédérale de maintenir les taux d'intérêt, associée au conflit au Moyen-Orient, a un impact sur le prix du Bitcoin. Analyse des tendances récentes et des réactions du marché.
-
- Les mineurs de Bitcoin électrifient le réseau : l'acquisition d'une usine à gaz dans l'Ohio ouvre une nouvelle ère pour l'or numérique
- Apr 30, 2026 at 10:38 pm
- L’industrie minière du Bitcoin connaît une transformation significative, avec des acteurs majeurs développant de manière agressive leurs opérations et acquérant stratégiquement des actifs énergétiques comme les usines à gaz de l’Ohio pour solidifier leur avenir dans l’économie numérique.
-
- Le jeton MEGA de MegaETH arrive dans la Big Apple : définition de nouveaux critères de performance pour la blockchain en temps réel
- Apr 30, 2026 at 09:11 pm
- Le MEGA Token de MegaETH a été officiellement lancé, validant sa vision de la blockchain « en temps réel » avec un modèle de distribution axé sur les performances et une adoption rapide du stablecoin USDM.
-
- La pente glissante de Solana : les prévisions de prix indiquent une perte de résistance et de nouvelles baisses potentielles
- Apr 30, 2026 at 09:08 pm
- Solana a du mal à briser la résistance clé, signalant un potentiel de baisse. Des refus répétés entre 86 et 88 dollars, associés à une tendance à court terme brisée, laissent présager des objectifs aussi bas que 67 dollars, voire 40 dollars, alors que les vendeurs gardent le contrôle. Les investisseurs doivent surveiller de près les niveaux de support critiques.
-
- BTC, pétrole, bénéfices : la géopolitique alimente le brut, le dérapage des cryptos, les triomphes et les essais de la technologie
- Apr 30, 2026 at 04:51 pm
- Les marchés mondiaux sont en tourbillon : le BTC chute alors que le pétrole atteint des sommets pluriannuels en raison des tensions géopolitiques, tandis que les géants de la technologie affichent des bénéfices mitigés, révélant un paysage financier complexe.
-
- Le nouveau rythme de New York : les systèmes de jalonnement, l'USD1 et la gouvernance conduisent la prochaine vague de crypto
- Apr 30, 2026 at 03:02 pm
- Des événements lucratifs générant 1 USD aux modèles de gouvernance robustes, la sphère crypto regorge d'innovations qui remodèlent la façon dont nous interagissons avec les actifs numériques, en nous concentrant sur l'engagement à long terme et l'utilité du stablecoin.
-
- OKX dévoile le protocole de paiement des agents : inaugurant une nouvelle ère de transactions IA
- Apr 30, 2026 at 02:53 pm
- OKX lance son Agent Payments Protocol (APP), une norme ouverte pour le commerce piloté par l'IA, permettant aux agents de gérer des cycles économiques complets. Explorez les implications pour les transactions IA et les paiements agents.

































