freigeben: 2026/10/08 12:52 lesen: 0
Ursprünglicher Autor:Weights & Wonders
Originalquelle:https://www.youtube.com/embed/8kzSGQzGigc
Ein Freund bat mich, Qwen 3.8 Flash Next für ihn zu hosten: ein 125-Milliarden-Parameter-Modell auf einer Maschine mit einer RTX 4070 (12 GB). Also habe ich Strata ausprobiert, die kostenlose Engine wird von den Leuten als „6× schneller als llama.cpp“ bezeichnet. Es funktioniert. Der Schreibvorgang lief mit etwa 35 Token pro Sekunde im Vergleich zu 15 bei llama.cpp, und eine Codebasis mit 100.000 Token wurde in 2 Minuten und 22 Sekunden statt in 24 Minuten gelesen. Dann zeigten die Protokolle etwas Seltsames: Die Grafikkarte war kaum leistungsfähig. Dieses Video erklärt warum. Aus dem gleichen Grund eignet sich dieses Setup hervorragend für eine Person und ist nicht schneller als llama.cpp, sobald eine zweite Person beitritt. KAPITEL 0:00 Ein 125B-Modell auf einer 12-GB-Karte 1:16 Die Anfrage 2:18 Wie Strata das Modell aufteilt 4:07 Die Maschine 5:28 Eine Person, ein Chat 6:39 Die lange Lektüre 8:41 Die Karte, die kaum ausprobiert wurde 9:56 Zwei sind eine Menge 11:05 Urteil DIE ERGEBNISSE (gleiche Modelldatei, gleiche Karte, beide Engines) • Kurze Chats: Strata 32,5–38,1 tok/s vs llama.cpp 15,3–16,5 tok/s (Standard llama.cpp, kein MTP-Entwurf) • Lesen einer 100.000-Token-C++-Codebasis: Strata 2 Min. 22 s vs. llama.cpp 24 Min. (~71 tok/s) • Schreiben nach diesen 100.000 Lesevorgängen: Strata 47 tok/s (373 von 404 entworfenen Token, die im Code akzeptiert wurden) vs. llama.cpp 15,5 • 235.000-Token-Dokument: in 5 Min. 5 Sek. gelesen; Versteckte Passphrase gefunden. Folgefrage: 11,5 s (229.376 Token aus dem Cache wiederverwendet, 6.054 neu) • Schreiben, während der Chat wächst: 30,0 Token/s (~1K) → 25,7 (120K) → 24,6 (235K) • GPU-Leistung: durchschnittlich 93 W einer 200-W-Grenze (Spitze 117 W), taktet mit voller Geschwindigkeit (~2.865 MHz) • Wo die benötigten Experten liefen (einzelner Benutzer): 58 % bereits auf der Karte, 4 % darauf kopiert, 38 % auf den CPUs • Zwei Benutzer (parallel): ~18 tok/s zusammen vs. llama.cpp ~19. Vier Benutzer: 24,2 vs. 23,2 • Zwei Benutzer, die jeweils ~90.000-Token-Dokumente auf einmal einfügen: 23 Min. 45 Sek. • Vier kurze Chats: 66,5 Sek. parallel, 49,8 Sek. nacheinander DAS SETUP • GPU: NVIDIA RTX 4070, 12 GB • CPU: 2× Intel Xeon E5-2680 v4 (2016) • RAM: ~170 GB verfügbar (die Experten des Modells benötigen ~50 GB; insgesamt sind 64 GB das praktische Minimum für diese Größe) • Modell: Qwen 3.8 Flash Next Uncensored von OrcaRouter, IQ3_XXS GGUF (85 GB); N-Gramm-Tabelle (~29 GB), gelesen von der SSD • Engines: Strata 0.1.40 (262K-Kontext, MTP-Entwurf vom ursprünglichen Qwen-Modell) vs. llama.cpp (Lagerbestand) • Alle Zahlen stammen aus unseren eigenen protokollierten Läufen am 7. Oktober 2026. WAS ES KOSTET Um den 7. Oktober 2026 kostete eine gebrauchte RTX 4070 etwa 600 US-Dollar und ein 64-GB-DDR4-Kit etwa 490 $. Die RAM-Preise ändern sich schnell, schauen Sie sich also die aktuellen Angebote an. RAM NACH MODELLGRÖSSE (aus den Dokumenten von Strata) 32 GB: Coder-Version · 48 GB: 2-Bit-Versionen · 64 GB: 3-Bit-Versionen (hier verwendet) · 96 GB+: ~4-Bit #AIServer #strata #strataai
Crypto Angler
2026-10-08 15:48
Weights & Wonders
2026-10-08 15:48
Pasteur Bernard Fwamba Mirec
2026-10-08 15:48
3.0 TV
2026-10-08 15:48
GemBoy Crypto
2026-10-08 15:48
区块拿铁
2026-10-08 14:35
Fuma Boy'Z
2026-10-08 14:15
The Crypto Report
2026-10-08 13:56
Crypto Việt Nam
2026-10-08 13:19
Währung auswählen
US Dollar
USD
Chinese Yuan
CNY
Japanese Yen
JPY
South Korean Won
KRW
New Taiwan Dollar
TWD
Canadian Dollar
CAD
Euro
EUR
Pound Sterling
GBP
Danish Krone
DKK
Hong Kong Dollar
HKD
Australian Dollar
AUD
Brazilian Real
BRL
Swiss Franc
CHF
Chilean Peso
CLP
Czech Koruna KČ
CZK
Singapore Dollar
SGD
Indian Rupee
INR
Saudi Riyal
SAR
Vietnamese Dong
VND
Thai Baht
THB
Währung auswählen
US Dollar
USD-$
Chinese Yuan
CNY-¥
Japanese Yen
JPY-¥
South Korean Won
KRW -₩
New Taiwan Dollar
TWD-NT$
Canadian Dollar
CAD-$
Euro
EUR - €
Pound Sterling
GBP-£
Danish Krone
DKK-KR
Hong Kong Dollar
HKD- $
Australian Dollar
AUD-$
Brazilian Real
BRL -R$
Swiss Franc
CHF -FR
Chilean Peso
CLP-$
Czech Koruna KČ
CZK -KČ
Singapore Dollar
SGD-S$
Indian Rupee
INR -₹
Saudi Riyal
SAR -SAR
Vietnamese Dong
VND-₫
Thai Baht
THB -฿