Ein Freund bat mich, Qwen 3.8 Flash Next für ihn zu hosten: ein 125-Milliarden-Parameter-Modell auf einer Maschine mit einer RTX 4070 (12 GB). Also habe ich Strata ausprobiert, die kostenlose Engine wird von den Leuten als „6× schneller als llama.cpp“ bezeichnet. Es funktioniert. Der Schreibvorgang lief mit etwa 35 Token pro Sekunde im Vergleich zu 15 bei llama.cpp, und eine Codebasis mit 100.000 Token wurde in 2 Minuten und 22 Sekunden statt in 24 Minuten gelesen. Dann zeigten die Protokolle etwas Seltsames: Die Grafikkarte war kaum leistungsfähig. Dieses Video erklärt warum. Aus dem gleichen Grund eignet sich dieses Setup hervorragend für eine Person und ist nicht schneller als llama.cpp, sobald eine zweite Person beitritt. KAPITEL 0:00 Ein 125B-Modell auf einer 12-GB-Karte 1:16 Die Anfrage 2:18 Wie Strata das Modell aufteilt 4:07 Die Maschine 5:28 Eine Person, ein Chat 6:39 Die lange Lektüre 8:41 Die Karte, die kaum ausprobiert wurde 9:56 Zwei sind eine Menge 11:05 Urteil DIE ERGEBNISSE (gleiche Modelldatei, gleiche Karte, beide Engines) • Kurze Chats: Strata 32,5–38,1 tok/s vs llama.cpp 15,3–16,5 tok/s (Standard llama.cpp, kein MTP-Entwurf) • Lesen einer 100.000-Token-C++-Codebasis: Strata 2 Min. 22 s vs. llama.cpp 24 Min. (~71 tok/s) • Schreiben nach diesen 100.000 Lesevorgängen: Strata 47 tok/s (373 von 404 entworfenen Token, die im Code akzeptiert wurden) vs. llama.cpp 15,5 • 235.000-Token-Dokument: in 5 Min. 5 Sek. gelesen; Versteckte Passphrase gefunden. Folgefrage: 11,5 s (229.376 Token aus dem Cache wiederverwendet, 6.054 neu) • Schreiben, während der Chat wächst: 30,0 Token/s (~1K) → 25,7 (120K) → 24,6 (235K) • GPU-Leistung: durchschnittlich 93 W einer 200-W-Grenze (Spitze 117 W), taktet mit voller Geschwindigkeit (~2.865 MHz) • Wo die benötigten Experten liefen (einzelner Benutzer): 58 % bereits auf der Karte, 4 % darauf kopiert, 38 % auf den CPUs • Zwei Benutzer (parallel): ~18 tok/s zusammen vs. llama.cpp ~19. Vier Benutzer: 24,2 vs. 23,2 • Zwei Benutzer, die jeweils ~90.000-Token-Dokumente auf einmal einfügen: 23 Min. 45 Sek. • Vier kurze Chats: 66,5 Sek. parallel, 49,8 Sek. nacheinander DAS SETUP • GPU: NVIDIA RTX 4070, 12 GB • CPU: 2× Intel Xeon E5-2680 v4 (2016) • RAM: ~170 GB verfügbar (die Experten des Modells benötigen ~50 GB; insgesamt sind 64 GB das praktische Minimum für diese Größe) • Modell: Qwen 3.8 Flash Next Uncensored von OrcaRouter, IQ3_XXS GGUF (85 GB); N-Gramm-Tabelle (~29 GB), gelesen von der SSD • Engines: Strata 0.1.40 (262K-Kontext, MTP-Entwurf vom ursprünglichen Qwen-Modell) vs. llama.cpp (Lagerbestand) • Alle Zahlen stammen aus unseren eigenen protokollierten Läufen am 7. Oktober 2026. WAS ES KOSTET Um den 7. Oktober 2026 kostete eine gebrauchte RTX 4070 etwa 600 US-Dollar und ein 64-GB-DDR4-Kit etwa 490 $. Die RAM-Preise ändern sich schnell, schauen Sie sich also die aktuellen Angebote an. RAM NACH MODELLGRÖSSE (aus den Dokumenten von Strata) 32 GB: Coder-Version · 48 GB: 2-Bit-Versionen · 64 GB: 3-Bit-Versionen (hier verwendet) · 96 GB+: ~4-Bit #AIServer #strata #strataai
Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!
Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.