|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Smolvlms: Hugging Face libère les plus petits modèles de langue de vision du monde
Jan 26, 2025 at 12:21 am
Des algorithmes d'apprentissage automatique ont été développés pour gérer de nombreuses tâches différentes, de la fabrication de prédictions aux modèles correspondants ou à la génération d'images qui correspondent

Recent years have seen a massive increase in the capabilities of machine learning algorithms, which can now perform a wide range of tasks, from making predictions to matching patterns or generating images that match text prompts. To enable them to take on such diverse roles, these models have been given a broad spectrum of capabilities, but one thing they rarely are is efficient.
Les dernières années ont connu une augmentation massive des capacités des algorithmes d'apprentissage automatique, qui peuvent désormais effectuer un large éventail de tâches, de la fabrication de prédictions aux modèles correspondants ou à la génération d'images qui correspondent aux invites de texte. Pour leur permettre d'assumer des rôles aussi divers, ces modèles ont reçu un large éventail de capacités, mais une chose qu'ils sont rarement est efficace.
In the present era of exponential growth in the field, rapid advancements often come at the expense of efficiency. It is faster, after all, to produce a very large kitchen-sink model filled with redundancies than it is to produce a lean, mean inferencing machine.
Dans l'ère actuelle de croissance exponentielle dans le domaine, les progrès rapides se font souvent au détriment de l'efficacité. Il est plus rapide, après tout, de produire un très grand modèle de chair de cuisine rempli de redondances que de produire une machine d'inférence légère.
But as these present algorithms continue to mature, more attention is being directed at slicing them down to smaller sizes. Even the most useful tools are of little value if they require such a large amount of computational resources that they are impractical for use in real-world applications. As you might expect, the more complex an algorithm is, the more challenging it is to shrink it down. That is what makes Hugging Face’s recent announcement so exciting — they have taken an axe to vision language models (VLMs), resulting in the release of new additions to the SmolVLM family — including SmolVLM-256M, the smallest VLM in the world.
Mais à mesure que ces algorithmes actuels continuent de mûrir, plus d'attention vise à les trancher à des tailles plus petites. Même les outils les plus utiles sont de peu de valeur s'ils nécessitent une telle quantité de ressources de calcul qu'elles ne sont pas pratiques pour une utilisation dans les applications du monde réel. Comme vous pouvez vous y attendre, plus un algorithme est complexe, plus il est difficile de le réduire. C'est ce qui rend l'annonce récente de Hugging Face si excitante - ils ont pris une hache à Vision Language Models (VLMS), entraînant la sortie de nouveaux ajouts à la famille Smolvlm - y compris Smolvlm-256m, le plus petit VLM au monde.
SmolVLM-256M is an impressive example of optimization done right, with just 256 million parameters. Despite its small size, this model performs very well in tasks such as captioning, document-based question answering, and basic visual reasoning, outperforming older, much larger models like the Idefics 80B from just 17 months ago. The SmolVLM-500M model provides an additional performance boost, with 500 million parameters offering a middle ground between size and capability for those needing some extra headroom.
SMOLVLM-256M est un exemple impressionnant d'optimisation bien fait, avec seulement 256 millions de paramètres. Malgré sa petite taille, ce modèle fonctionne très bien dans les tâches telles que le sous-titrage, la réponse aux questions basée sur des documents et le raisonnement visuel de base, surperformant des modèles plus anciens et beaucoup plus grands comme les IDEFics 80B d'il y a 17 mois. Le modèle SMOLVLM-500M fournit une augmentation supplémentaire des performances, avec 500 millions de paramètres offrant un terrain d'entente entre la taille et la capacité de ceux qui ont besoin d'une marge supplémentaire.
Hugging Face achieved these advancements by refining its approach to vision encoders and data mixtures. The new models adopt the SigLIP base patch-16/512 encoder, which, though smaller than its predecessor, processes images at a higher resolution. This choice aligns with recent trends seen in Apple and Google research, which emphasize higher resolution for improved visual understanding without drastically increasing parameter counts.
Le visage des câlins a réalisé ces progrès en affinant son approche des encodeurs de vision et des mélanges de données. Les nouveaux modèles adoptent l'encodeur de base de base Siglip Patch-16/512, qui, bien que plus petit que son prédécesseur, traite des images à une résolution plus élevée. Ce choix s'aligne sur les tendances récentes observées dans Apple et Google Research, qui mettent l'accent sur une résolution plus élevée pour une meilleure compréhension visuelle sans augmenter considérablement le nombre de paramètres.
The team also employed innovative tokenization methods to further streamline their models. By improving how sub-image separators are represented during tokenization, the models gained greater stability during training and achieved better quality outputs. For example, multi-token representations of image regions were replaced with single-token equivalents, enhancing both efficiency and accuracy.
L'équipe a également utilisé des méthodes de tokenisation innovantes pour rationaliser davantage leurs modèles. En améliorant la façon dont les séparateurs de sous-image sont représentés pendant la tokenisation, les modèles ont gagné une plus grande stabilité pendant l'entraînement et ont obtenu des résultats de meilleure qualité. Par exemple, les représentations multi-token des régions d'image ont été remplacées par des équivalents mono-token, améliorant à la fois l'efficacité et la précision.
In another advance, the data mixture strategy was fine-tuned to emphasize document understanding and image captioning, while maintaining a balanced focus on essential areas like visual reasoning and chart comprehension. These refinements are reflected in the model’s improved benchmarks which show both the 250M and 500M models outperforming Idefics 80B in nearly every category.
Dans une autre avancée, la stratégie de mélange de données a été affinée pour mettre l'accent sur la compréhension des documents et le sous-titrage de l'image, tout en maintenant un accent équilibré sur les domaines essentiels comme le raisonnement visuel et la compréhension des graphiques. Ces raffinements se reflètent dans les références améliorées du modèle qui montrent que les modèles 250m et 500m surpassent les IDEFics 80b dans presque toutes les catégories.
By demonstrating that small can indeed be mighty, these models pave the way for a future where advanced machine learning capabilities are both accessible and sustainable. If you want to help bring that future into being, go grab these models now. Hugging Face has open-sourced them, and with only modest hardware requirements, just about anyone can get in on the action.
En démontrant que Small peut en effet être puissant, ces modèles ouvrent la voie à un avenir où les capacités avancées d'apprentissage automatique sont à la fois accessibles et durables. Si vous voulez aider à mettre cet avenir dans le fait, allez saisir ces modèles maintenant. Le visage étreint les a open source, et avec seulement des exigences matérielles modestes, à peu près n'importe qui peut se lancer dans l'action.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
- L'Illinois déploie un projet de règles pour une taxe sur les transactions cryptographiques de 0,2 %, fixées pour 2027
- Sep 30, 2026 at 12:05 pm
- L'Illinois dévoile un projet de réglementation pour sa prochaine taxe sur les transactions d'actifs numériques de 0,2 %, impactant les échanges, les transferts et les services de garde à partir du 1er janvier 2027. La taxe s'applique à la valeur brute des transactions, et non aux gains d'investissement.
-
- Agent IA de Crypto.com : une éclaboussure du Super Bowl se prépare toujours en mode furtif
- Sep 30, 2026 at 12:05 pm
- Quelques mois après ses débuts très médiatisés au Super Bowl, l'ambitieux agent d'IA personnel de Crypto.com, ai.com, reste en cours de développement, face à un paysage de plus en plus concurrentiel sur le marché des assistants d'IA.
-
- Apeing mène la charge : dévoilement de la prochaine liste de surveillance crypto 100x et de 6 pièces à surveiller
- Sep 30, 2026 at 12:03 pm
- Au milieu d'un marché dynamique de la cryptographie, la dynamique de prévente d'Apeing, associée à des acteurs établis comme Solana et TRON, redéfinit le récit de la cryptographie 100x, offrant à la fois des opportunités de démarrage et une force de réseau éprouvée.
-
- Les documents officiels deviennent viraux, les allégations d'Ari Paul sur Coinbase sont en retard : un regard sur la vitesse de diffusion des informations
- Sep 30, 2026 at 11:55 am
- Les documents officiels se sont répandus comme une traînée de poudre, tandis que les allégations d'Ari Paul sur Coinbase avancent à la vitesse d'un escargot. Analyser la diffusion de l'information dans le monde de la cryptographie.
-
- OpenAI dévoile GPT-6.1 Sol et Ultrafast Tier, tandis qu'AstraZeneca investit gros dans Summit Therapeutics
- Sep 30, 2026 at 08:05 am
- OpenAI déploie GPT-6.1 Sol, offrant des performances proches d'Astra à une fraction du coût, ainsi qu'un nouveau niveau de vitesse « Ultrarapide ». Pendant ce temps, AstraZeneca réalise un investissement important de 2 milliards de dollars dans la société d'oncologie Summit Therapeutics.
-
- Augmentation audacieuse de la participation de Cathie Wood dans les ETF Crypto : surfer sur la vague ou construire l'avenir ?
- Sep 30, 2026 at 04:05 am
- ARK Invest de Cathie Wood aurait augmenté ses avoirs en ETF crypto lors d'une hausse du marché, signalant une stratégie confiante et dynamique dans les actifs numériques.
-
- Hausse des prix LINK : analyse et prévision de maillons de chaîne alimentées par le lancement de CCIP 2.0
- Sep 29, 2026 at 12:05 pm
- Le prix de LINK atteint un nouveau sommet alors que Chainlink déploie CCIP 2.0, améliorant la sécurité entre les chaînes et l'adoption institutionnelle. Des analyses d’experts et des prédictions suivent.
-
- Robinhood Chain constate une augmentation du nombre de perps alors que le trading au comptant se refroidit au milieu de changements plus larges sur le marché
- Sep 29, 2026 at 12:05 pm
- Le paysage commercial de Robinhood Chain se divise : le volume des contrats à terme perpétuels monte en flèche, tandis que les échanges au comptant se refroidissent. Cette tendance laisse présager un changement stratégique dans le comportement des traders sur la plateforme.
-
- Les utilisateurs d'InterLink peuvent désormais dépenser des ITL pour des biens du monde réel, augmentant ainsi l'utilisation de l'ITL
- Sep 29, 2026 at 12:05 pm
- Les utilisateurs d'InterLink peuvent désormais dépenser leurs jetons ITL directement en produits et services via LinkersMap, marquant une étape importante vers une utilité réelle et favorisant l'utilisation d'ITL au sein de l'écosystème.

































