|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Tokenbridge: combler l'écart entre les représentations de jetons continues et discrets dans la génération visuelle
Mar 28, 2025 at 06:13 am
Les modèles de génération visuelle autorégressifs sont devenus une approche révolutionnaire de la synthèse d'image, s'inspirant des mécanismes de prédiction des jetons du modèle de langue.

Autoregressive visual generation models have emerged as a groundbreaking approach to image synthesis, drawing inspiration from language model token prediction mechanisms. These innovative models utilize image tokenizers to transform visual content into discrete or continuous tokens. The approach facilitates flexible multimodal integrations and allows adaptation of architectural innovations from LLM research. However, the field faces a critical challenge of determining the optimal token representation strategy. The choice between discrete and continuous tokens remains a fundamental dilemma, impacting model complexity and generation quality.
Les modèles de génération visuelle autorégressifs sont devenus une approche révolutionnaire de la synthèse d'image, s'inspirant des mécanismes de prédiction des jetons du modèle de langue. Ces modèles innovants utilisent des jetons d'image pour transformer le contenu visuel en jetons discrets ou continus. L'approche facilite les intégrations multimodales flexibles et permet l'adaptation des innovations architecturales de la recherche LLM. Cependant, le domaine est confronté à un défi critique de déterminer la stratégie optimale de représentation des jetons. Le choix entre les jetons discrets et continus reste un dilemme fondamental, ce qui a un impact sur la complexité du modèle et la qualité de génération.
Existing methods include visual tokenization that explores two primary approaches: continuous and discrete token representations. Variational autoencoders establish continuous latent spaces that maintain high visual fidelity, becoming foundational in diffusion model development. Discrete methods like VQ-VAE and VQGAN enable straightforward autoregressive modeling but encounter significant limitations, including codebook collapse and information loss.
Les méthodes existantes incluent la tokenisation visuelle qui explore deux approches primaires: les représentations de jetons continues et discrètes. Les autoencodeurs variationnels établissent des espaces latents continus qui maintiennent une forte fidélité visuelle, devenant fondamentale dans le développement du modèle de diffusion. Des méthodes discrètes comme VQ-VAE et VQGAN permettent une modélisation autorégressive simple mais rencontrent des limitations importantes, y compris l'effondrement du livre de codes et la perte d'informations.
Autoregressive image generation evolves from computationally intensive pixel-based methods to more efficient token-based strategies. While models like DALL-E show promising results, hybrid methods such as GIVT and MAR introduce complex architectural modifications to improve generation quality, rendering the traditional autoregressive modeling pipeline complicated.
La génération d'images autorégressive évolue à partir de méthodes basées sur des pixels intensives en calcul vers des stratégies plus efficaces basées sur des jetons. Alors que des modèles comme Dall-E montrent des résultats prometteurs, des méthodes hybrides telles que GIVT et MAR introduisent des modifications architecturales complexes pour améliorer la qualité de la génération, rendant le pipeline de modélisation autorégressif traditionnel compliqué.
To bridge this critical gap between continuous and discrete token representations in visual generation, researchers from the University of Hong Kong, ByteDance Seed, Ecole Polytechnique, and Peking University propose TokenBridge. It aims to utilize the strong representation capacity of continuous tokens while maintaining the modeling simplicity of discrete tokens. TokenBridge decouples the discretization process from initial tokenizer training by introducing a novel post-training quantization technique. Moreover, it implements a unique dimension-wise quantization strategy that independently discretizes each feature dimension, complemented by a lightweight autoregressive prediction mechanism. It efficiently manages the expanded token space while preserving high-quality visual generation capabilities.
Pour combler cet écart critique entre les représentations de jetons continues et discrètes dans la génération visuelle, les chercheurs de l'Université de Hong Kong, des semences de Bytedance, de l'Ecole Polytechnique et de l'Université de Pékin proposent Tokenbridge. Il vise à utiliser la forte capacité de représentation des jetons continus tout en maintenant la simplicité de modélisation des jetons discrets. Tokenbridge découple le processus de discrétisation de la formation initiale de tokenzer en introduisant une nouvelle technique de quantification post-formation. De plus, il met en œuvre une stratégie de quantification unique par dimension qui discrétise indépendamment chaque dimension de caractéristique, complétée par un mécanisme de prédiction autorégressif léger. Il gère efficacement l'espace de jeton élargi tout en préservant les capacités de génération visuelle de haute qualité.
TokenBridge introduces a training-free dimension-wise quantization technique that operates independently on each feature channel, effectively addressing previous token representation limitations. The approach capitalizes on two crucial properties of Variational Autoencoder features: their bounded nature due to KL constraints and near-Gaussian distribution.
Tokenbridge introduit une technique de quantification par dimension sans formation qui fonctionne indépendamment sur chaque canal de caractéristique, abordant efficacement les limitations de représentation des jetons précédents. L'approche capitalise sur deux propriétés cruciales des caractéristiques de l'autoencodeur variationnelles: leur nature limitée en raison des contraintes de KL et de la distribution presque gaussienne.
The autoregressive model adopts a Transformer architecture with two primary configurations: a default L model comprising 32 blocks with 1024 width (approx 400 million parameters) for initial studies and a larger H model with 40 blocks and 1280 width (around 910 million parameters) for final evaluations. This design allows a detailed exploration of the proposed quantization strategy across different model scales.
Le modèle autorégressif adopte une architecture de transformateur avec deux configurations principales: un modèle L par défaut comprenant 32 blocs avec 1024 largeur (environ 400 millions de paramètres) pour les études initiales et un modèle H plus grand avec 40 blocs et 1280 largeur (environ 910 millions de paramètres) pour les évaluations finales. Cette conception permet une exploration détaillée de la stratégie de quantification proposée sur différentes échelles de modèle.
The results demonstrate that TokenBridge outperforms traditional discrete token models, achieving superior Frechet Inception Distance (FID) with significantly fewer parameters. For instance, TokenBridge-L secures an FID of 1.76 with only 486 million parameters, contrasting with LlamaGen's 2.18 using 3.1 billion parameters. When benchmarked against continuous approaches, TokenBridge-L outperforms GIVT, achieving a FID of 1.76 versus 3.35.
Les résultats démontrent que Tokenbridge surpasse les modèles de jetons discrets traditionnels, atteignant une distance de création de Frechet supérieure (FID) avec beaucoup moins de paramètres. Par exemple, Tokenbridge-L sécurise un FID de 1,76 avec seulement 486 millions de paramètres, contrastant avec 2,18 de Llamagen en utilisant 3,1 milliards de paramètres. Lorsqu'il est compliqué contre les approches continues, Tokenbridge-L surpasse Givt, atteignant un FID de 1,76 contre 3,35.
The H-model configuration further validates the method's effectiveness, matching MAR-H in FID (1.55) while delivering superior Inception Score and Recall metrics with marginally fewer parameters. These results highlight TokenBridge's capability to bridge discrete and continuous token representations.
La configuration du modèle H valide en outre l'efficacité de la méthode, correspondant à MAR-H dans FID (1,55) tout en fournissant un score de création supérieur et des mesures de rappel avec légèrement moins de paramètres. Ces résultats mettent en évidence la capacité de Tokenbridge à combler des représentations de jeton discrètes et continues.
In conclusion, researchers present TokenBridge, which bridges the longstanding gap between discrete and continuous token representations. It achieves high-quality visual generation with remarkable efficiency by introducing a post-training quantization approach and dimension-wise autoregressive decomposition. The research demonstrates that discrete token approaches using standard cross-entropy loss can compete with state-of-the-art continuous methods, eliminating the need for complex distribution modeling techniques. This finding opens a promising pathway for future investigations, potentially transforming how researchers conceptualize and implement token-based visual synthesis technologies.
En conclusion, les chercheurs présentent Tokenbridge, qui comble l'écart de longue date entre les représentations de jetons discrets et continus. Il réalise une génération visuelle de haute qualité avec une efficacité remarquable en introduisant une approche de quantification post-formation et une décomposition autorégressive par dimension. La recherche démontre que des approches de jetons discrètes utilisant une perte de croisement standard peuvent rivaliser avec des méthodes continues de pointe, éliminant le besoin de techniques de modélisation de distribution complexes. Cette découverte ouvre une voie prometteuse pour les enquêtes futures, potentiellement transformer la façon dont les chercheurs conceptualisent et mettent en œuvre des technologies de synthèse visuelle basées sur des jetons.
Check out the Paper, GitHub Page and Project. All credit for this research goes to the researchers of this project. Also, feel free to follow us on Twitter and don’t forget to join our 85k+ ML SubReddit.
Consultez le papier, la page GitHub et le projet. Tout le mérite de cette recherche revient aux chercheurs de ce projet. N'hésitez pas à nous suivre sur Twitter et n'oubliez pas de rejoindre notre sous-trède 85k + ML.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
- Datavecta forge un écosystème communautaire mondial pour alimenter la croissance internationale grâce à une stratégie de référencement avancée
- Sep 30, 2026 at 07:55 pm
- Datavecta construit un écosystème communautaire mondial pour améliorer la croissance internationale, en tirant parti de stratégies de référencement avancées et de services axés sur la technologie pour un avenir commercial intelligent et connecté.
-
- L'Illinois déploie un projet de règles pour une taxe sur les transactions cryptographiques de 0,2 %, fixées pour 2027
- Sep 30, 2026 at 12:05 pm
- L'Illinois dévoile un projet de réglementation pour sa prochaine taxe sur les transactions d'actifs numériques de 0,2 %, impactant les échanges, les transferts et les services de garde à partir du 1er janvier 2027. La taxe s'applique à la valeur brute des transactions, et non aux gains d'investissement.
-
- Agent IA de Crypto.com : une éclaboussure du Super Bowl se prépare toujours en mode furtif
- Sep 30, 2026 at 12:05 pm
- Quelques mois après ses débuts très médiatisés au Super Bowl, l'ambitieux agent d'IA personnel de Crypto.com, ai.com, reste en cours de développement, face à un paysage de plus en plus concurrentiel sur le marché des assistants d'IA.
-
- Apeing mène la charge : dévoilement de la prochaine liste de surveillance crypto 100x et de 6 pièces à surveiller
- Sep 30, 2026 at 12:03 pm
- Au milieu d'un marché dynamique de la cryptographie, la dynamique de prévente d'Apeing, associée à des acteurs établis comme Solana et TRON, redéfinit le récit de la cryptographie 100x, offrant à la fois des opportunités de démarrage et une force de réseau éprouvée.
-
- Les documents officiels deviennent viraux, les allégations d'Ari Paul sur Coinbase sont en retard : un regard sur la vitesse de diffusion des informations
- Sep 30, 2026 at 11:55 am
- Les documents officiels se sont répandus comme une traînée de poudre, tandis que les allégations d'Ari Paul sur Coinbase avancent à la vitesse d'un escargot. Analyser la diffusion de l'information dans le monde de la cryptographie.
-
- OpenAI dévoile GPT-6.1 Sol et Ultrafast Tier, tandis qu'AstraZeneca investit gros dans Summit Therapeutics
- Sep 30, 2026 at 08:05 am
- OpenAI déploie GPT-6.1 Sol, offrant des performances proches d'Astra à une fraction du coût, ainsi qu'un nouveau niveau de vitesse « Ultrarapide ». Pendant ce temps, AstraZeneca réalise un investissement important de 2 milliards de dollars dans la société d'oncologie Summit Therapeutics.
-
- Augmentation audacieuse de la participation de Cathie Wood dans les ETF Crypto : surfer sur la vague ou construire l'avenir ?
- Sep 30, 2026 at 04:05 am
- ARK Invest de Cathie Wood aurait augmenté ses avoirs en ETF crypto lors d'une hausse du marché, signalant une stratégie confiante et dynamique dans les actifs numériques.
-
- Hausse des prix LINK : analyse et prévision de maillons de chaîne alimentées par le lancement de CCIP 2.0
- Sep 29, 2026 at 12:05 pm
- Le prix de LINK atteint un nouveau sommet alors que Chainlink déploie CCIP 2.0, améliorant la sécurité entre les chaînes et l'adoption institutionnelle. Des analyses d’experts et des prédictions suivent.
-
- Robinhood Chain constate une augmentation du nombre de perps alors que le trading au comptant se refroidit au milieu de changements plus larges sur le marché
- Sep 29, 2026 at 12:05 pm
- Le paysage commercial de Robinhood Chain se divise : le volume des contrats à terme perpétuels monte en flèche, tandis que les échanges au comptant se refroidissent. Cette tendance laisse présager un changement stratégique dans le comportement des traders sur la plateforme.
































