#Qwen #LocalLLM #AIEngineering Simon Willison a exécuté une invite sur un modèle de dix-sept gigaoctets qui tient sur un ordinateur portable. Dessinez un SVG d'un cercle. Il a fallu **vingt et une minutes** et **22 276 jetons de raisonnement interne** pour produire 3 223 jetons de travail fini — et ce qui est revenu était une « étude de cercle géométrique » avec des guides concentriques, des graduations et un mouvement ambiant. Pas un cercle. Le modèle est vraiment excellent. Le problème est une ligne de configuration. Qwen est livré avec **Qwen 3.8 27B** avec `reasoning_effort` défini sur **xhigh**, le niveau que sa propre documentation réserve pour les « tâches complexes exigeant une analyse approfondie » – appliqué à chaque invite, dans chaque version quantifiée. Le verdict de Willison sur ce choix tient en un mot : hilarant. Cette répartition fonctionne en fonction de ce que coûte la valeur par défaut et du moment où cela vaut la peine de payer : - l'arithmétique : 22 276 jetons de raisonnement contre la fenêtre contextuelle par défaut de 8 192 jetons de LM Studio, que le modèle a épuisée avant de répondre à quoi que ce soit - la même invite sans raisonnement - 3 715 jetons en 137 secondes, vingt et une minutes jusqu'à un peu plus de deux - et ce que coûte cette vitesse : avec le raisonnement, le dessin avait un cadre correct, les jambes sur les deux côtés, ailes sur le guidon. Avec lui, le cadre se brise et les pieds manquent les pédales - là où il est vraiment fort : les boîtes englobantes JSON sont revenues propres et ont atterri sur les oiseaux, pas de gymnastique d'analyse - la version unique qui a **presque** fonctionné avec le raisonnement désactivé - l'interface est sortie solide et les boîtes rendues au mauvais endroit, ce qui est le mode d'échec que vous expédiez par accident - en pilotant un véritable agent de codage contre la base de code Datasette, et en écrivant et en testant un script Python sans invite - le plafond de débit : 15 à 30 jetons par seconde localement contre 74 et 184 pour les modèles hébergés, et pourquoi un modèle dense est limité à la bande passante mémoire - prédiction multi-jetons, déjà à l'intérieur du fichier, mesurée environ **72 % plus rapide** avec un indicateur de service. La règle mérite d'être conservée : **l'effort de raisonnement est un budget que vous définissez par tâche, pas un paramètre que vous laissez seul.** Exécutez-le à un niveau bas ou désactivé pour l'extraction, la classification et les cadres de délimitation, où la réponse a une forme correcte et la réflexion ne vous rapporte rien. Dépensez-le sur des versions uniques et sur tout ce qui coûte cher à remarquer. Une mise en garde, et elle vient de Willison plutôt que de cette chaîne : les benchmarks publiés par Qwen sont auto-déclarés. Il n'existe pas encore de numéros indépendants. ### Chapitres ```texte 0:00 Vingt et une minutes pour un dessin 0:36 Ce que coûte le défaut et le piège 1:06 Trois niveaux documentés, dont un expédié 1:43 Il a mangé la fenêtre contextuelle 2:13 J'ai demandé un cercle, j'ai obtenu une étude 2:48 Raisonnement : vingt et une minutes deviennent deux 3:21 Ce que coûte l'éteindre 3:51 Où il est très bon : vision 4:23 Une invite, un fonctionnement outil 4:52 Et le même outil s'est cassé sans lui 5:18 Piloter un véritable agent de codage 5:49 La vraie contrainte est la vitesse 6:22 Pourquoi les modèles denses sont lents ici 6:50 Soixante-douze pour cent, à partir d'un indicateur de service 7:21 Les benchmarks sont auto-déclarés 7:50 Définissez-le par tâche 8:19 Qui devrait l'exécuter 8:46 Qu'est-ce qui a réellement changé cette année ``` ### Sources primaires - Simon Willison — Qwen 3.8 27B est excellent, mais par défaut, il réfléchit énormément : https://simonwillison.net/2026/Aug/16/qwen-38-27b/ - Carte modèle Qwen3.8-27B (fournisseur) : https://huggingface.co/Qwen/Qwen3.8-27B Chaque figure de cette vidéo provient de ces deux pages. Rien n'a été comparé par cette chaîne, et la description le dit.
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.