bitcoin
bitcoin

$75268.858698 USD

8.53%

ethereum
ethereum

$2363.950936 USD

5.45%

tether
tether

$0.999566 USD

0.03%

bnb
bnb

$664.951035 USD

6.43%

xrp
xrp

$1.312939 USD

19.10%

usd-coin
usd-coin

$0.999944 USD

0.01%

solana
solana

$90.762330 USD

7.09%

tron
tron

$0.338064 USD

1.46%

hyperliquid
hyperliquid

$73.234749 USD

2.61%

dogecoin
dogecoin

$0.083019 USD

11.21%

zcash
zcash

$600.124195 USD

8.72%

unus-sed-leo
unus-sed-leo

$9.273276 USD

-0.80%

chainlink
chainlink

$10.973069 USD

4.91%

monero
monero

$415.751478 USD

0.89%

cardano
cardano

$0.209467 USD

14.41%

Nachrichtenvideo zur Kryptowährung

Warum ist Qwen 3.8 27B so langsam? Eine Standardeinstellung.

Aug 21, 2026 at 01:00 am Stack Current

#Qwen #LocalLLM #AIEngineering Simon Willison führte eine Eingabeaufforderung auf einem 17-Gigabyte-Modell aus, das auf einen Laptop passt. Zeichnen Sie eine SVG-Datei eines Kreises. Es dauerte **einundzwanzig Minuten** und **22.276 Zeichen interner Überlegungen**, um 3.223 Zeichen fertiger Arbeit zu produzieren – und das Ergebnis war eine „geometrische Kreisstudie“ mit konzentrischen Hilfslinien, Teilstrichen und Umgebungsbewegungen. Kein Kreis. Das Modell ist wirklich ausgezeichnet. Das Problem liegt in einer Konfigurationszeile. Qwen liefert **Qwen 3.8 27B** mit der Einstellung „reasoning_effort“ auf **xhigh**, der Stufe, die seine eigene Dokumentation für „komplexe Aufgaben, die eine gründliche Analyse erfordern“ vorsieht – angewendet auf jede Eingabeaufforderung, in jedem quantisierten Build. Willisons Urteil zu dieser Wahl ist ein Wort: urkomisch. Diese Aufschlüsselung geht davon aus, was die Standardeinstellung kostet und wann sich die Zahlung lohnt: - die Arithmetik: 22.276 Argumentations-Tokens im Vergleich zu 8.192 Tokens umfassenden Standardkontextfenstern von LM Studio, die das Modell erschöpft hat, bevor sie etwas beantwortet hat - dieselbe Eingabeaufforderung ohne Argumentation - 3.715 Tokens in 137 Sekunden, einundzwanzig Minuten auf etwas mehr als zwei reduziert - und was diese Geschwindigkeit kostet: Mit aktivierter Argumentation hatte die Zeichnung einen korrekten Rahmen und Beine beidseitig, Flügel am Lenker. Wenn es ausgeschaltet ist, bricht der Rahmen und die Füße verfehlen die Pedale – wo es wirklich stark ist: JSON-Begrenzungsboxen kamen sauber zurück und landeten auf den Vögeln, keine Parsing-Gymnastik – der One-Shot-Build, der **fast** ohne Argumentation funktionierte – die Schnittstelle kam solide heraus und die Boxen wurden an der falschen Stelle gerendert, was der Fehlermodus ist, den Sie versehentlich ausliefern – einen echten Codierungsagenten gegen die Datasette-Codebasis fahren und ohne Aufforderung ein Python-Skript schreiben und testen – der Durchsatz Obergrenze: 15–30 Token pro Sekunde lokal gegenüber 74 und 184 für gehostete Modelle und warum ein dichtes Modell an die Speicherbandbreite gebunden ist – Multi-Token-Vorhersage, bereits in der Datei, gemessen etwa **72 % schneller** mit einem Serving-Flag. Die Regel, die es zu beachten gilt: **Begründungsaufwand ist ein Budget, das Sie pro Job festlegen, keine Einstellung, die Sie in Ruhe lassen.** Lassen Sie es niedrig oder ganz aus für Extraktion, Klassifizierung und Begrenzungsrahmen, wo die Antwort eine richtige Form hat und das Denken Sie überzeugt nichts. Geben Sie es für One-Shot-Builds und alles aus, bei dem es teuer ist, Fehler zu bemerken. Eine Warnung, und sie kommt eher von Willison als von diesem Kanal: Die veröffentlichten Benchmarks von Qwen sind Selbstberichte. Es existieren noch keine unabhängigen Zahlen. ### Kapitel ```Text 0:00 Einundzwanzig Minuten für eine Zeichnung 0:36 Was die Standardeinstellung kostet und der Haken 1:06 Drei dokumentierte Ebenen, eine versendet 1:43 Es hat das Kontextfenster aufgefressen 2:13 Nach einem Kreis gefragt, eine Studie erhalten 2:48 Argumentation aus: aus einundzwanzig Minuten werden zwei 3:21 Was das Ausschalten kostet 3:51 Wo es sehr gut ist: Vision 4:23 Eine Eingabeaufforderung, ein funktionierendes Werkzeug 4:52 Und das gleiche Werkzeug ging ohne es kaputt 5:18 Einen echten Programmieragenten steuern 5:49 Die eigentliche Einschränkung ist die Geschwindigkeit 6:22 Warum dichte Modelle hier langsam sind 6:50 Zweiundsiebzig Prozent, ausgehend von einer Servierflagge 7:21 Die Benchmarks werden selbst angegeben 7:50 Stellen Sie es pro Aufgabe ein 8:19 Wer sollte es ausführen 8:46 Was sich dieses Jahr tatsächlich geändert hat ``` ### Primärquellen - Simon Willison — Qwen 3.8 27B ist ausgezeichnet, aber standardmäßig wird viel zu viel darüber nachgedacht: https://simonwillison.net/2026/Aug/16/qwen-38-27b/ - Qwen3.8-27B-Modellkarte (Anbieter): https://huggingface.co/Qwen/Qwen3.8-27B Jede Figur in diesem Video stammt von diesen beiden Seiten. Von diesem Kanal wurde kein Benchmarking durchgeführt, und die Beschreibung besagt dies auch.
Videoquelle:Youtube

Haftungsausschluss:info@kdj.com

Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!

Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.

Weitere Videos veröffentlicht auf Aug 21, 2026