Preis: $0.08784 -3.2815%
Marktwert: $13.72B 0.4866%
Umsatz (24h): 1.16B 0%
Dominanz: 0.4866%
Price: $0.08784 -3.2815%
Marktwert: $13.72B 0.4866%
Umsatz (24h): 1.16B 0%
Dominanz: 0.4866% 0.4866%
  • Preis: $0.08784 -3.2815%
  • Marktwert: 13.72B 0.4866%
  • Umsatz (24h): 1.16B 0%
  • Dominanz: 0.4866% 0.4866%
  • Preis: $0.08784 -3.2815%
Titelseite > 视频 > Warum ist Strata so schnell? Und was ist der Haken? Schichten getestet!

Warum ist Strata so schnell? Und was ist der Haken? Schichten getestet!

freigeben: 2026/10/08 12:52 lesen: 0

Ursprünglicher Autor:Weights & Wonders

Originalquelle:https://www.youtube.com/embed/8kzSGQzGigc

Ein Freund bat mich, Qwen 3.8 Flash Next für ihn zu hosten: ein 125-Milliarden-Parameter-Modell auf einer Maschine mit einer RTX 4070 (12 GB). Also habe ich Strata ausprobiert, die kostenlose Engine wird von den Leuten als „6× schneller als llama.cpp“ bezeichnet. Es funktioniert. Der Schreibvorgang lief mit etwa 35 Token pro Sekunde im Vergleich zu 15 bei llama.cpp, und eine Codebasis mit 100.000 Token wurde in 2 Minuten und 22 Sekunden statt in 24 Minuten gelesen. Dann zeigten die Protokolle etwas Seltsames: Die Grafikkarte war kaum leistungsfähig. Dieses Video erklärt warum. Aus dem gleichen Grund eignet sich dieses Setup hervorragend für eine Person und ist nicht schneller als llama.cpp, sobald eine zweite Person beitritt. KAPITEL 0:00 Ein 125B-Modell auf einer 12-GB-Karte 1:16 Die Anfrage 2:18 Wie Strata das Modell aufteilt 4:07 Die Maschine 5:28 Eine Person, ein Chat 6:39 Die lange Lektüre 8:41 Die Karte, die kaum ausprobiert wurde 9:56 Zwei sind eine Menge 11:05 Urteil DIE ERGEBNISSE (gleiche Modelldatei, gleiche Karte, beide Engines) • Kurze Chats: Strata 32,5–38,1 tok/s vs llama.cpp 15,3–16,5 tok/s (Standard llama.cpp, kein MTP-Entwurf) • Lesen einer 100.000-Token-C++-Codebasis: Strata 2 Min. 22 s vs. llama.cpp 24 Min. (~71 tok/s) • Schreiben nach diesen 100.000 Lesevorgängen: Strata 47 tok/s (373 von 404 entworfenen Token, die im Code akzeptiert wurden) vs. llama.cpp 15,5 • 235.000-Token-Dokument: in 5 Min. 5 Sek. gelesen; Versteckte Passphrase gefunden. Folgefrage: 11,5 s (229.376 Token aus dem Cache wiederverwendet, 6.054 neu) • Schreiben, während der Chat wächst: 30,0 Token/s (~1K) → 25,7 (120K) → 24,6 (235K) • GPU-Leistung: durchschnittlich 93 W einer 200-W-Grenze (Spitze 117 W), taktet mit voller Geschwindigkeit (~2.865 MHz) • Wo die benötigten Experten liefen (einzelner Benutzer): 58 % bereits auf der Karte, 4 % darauf kopiert, 38 % auf den CPUs • Zwei Benutzer (parallel): ~18 tok/s zusammen vs. llama.cpp ~19. Vier Benutzer: 24,2 vs. 23,2 • Zwei Benutzer, die jeweils ~90.000-Token-Dokumente auf einmal einfügen: 23 Min. 45 Sek. • Vier kurze Chats: 66,5 Sek. parallel, 49,8 Sek. nacheinander DAS SETUP • GPU: NVIDIA RTX 4070, 12 GB • CPU: 2× Intel Xeon E5-2680 v4 (2016) • RAM: ~170 GB verfügbar (die Experten des Modells benötigen ~50 GB; insgesamt sind 64 GB das praktische Minimum für diese Größe) • Modell: Qwen 3.8 Flash Next Uncensored von OrcaRouter, IQ3_XXS GGUF (85 GB); N-Gramm-Tabelle (~29 GB), gelesen von der SSD • Engines: Strata 0.1.40 (262K-Kontext, MTP-Entwurf vom ursprünglichen Qwen-Modell) vs. llama.cpp (Lagerbestand) • Alle Zahlen stammen aus unseren eigenen protokollierten Läufen am 7. Oktober 2026. WAS ES KOSTET Um den 7. Oktober 2026 kostete eine gebrauchte RTX 4070 etwa 600 US-Dollar und ein 64-GB-DDR4-Kit etwa 490 $. Die RAM-Preise ändern sich schnell, schauen Sie sich also die aktuellen Angebote an. RAM NACH MODELLGRÖSSE (aus den Dokumenten von Strata) 32 GB: Coder-Version · 48 GB: 2-Bit-Versionen · 64 GB: 3-Bit-Versionen (hier verwendet) · 96 GB+: ~4-Bit #AIServer #strata #strataai

Ausgewählte Themen

  • Dogecoin-Wal-Aktivität
    Dogecoin-Wal-Aktivität
    Erhalten Sie mit unserer umfassenden Analyse die neuesten Erkenntnisse über die Aktivitäten der Dogecoin-Wale. Entdecken Sie Trends, Muster und die Auswirkungen dieser Wale auf den Dogecoin-Markt. Bleiben Sie mit unserer Expertenanalyse auf dem Laufenden und behalten Sie auf Ihrem Weg zur Kryptowährung die Nase vorn.
  • Dogecoin-Mining
    Dogecoin-Mining
    Beim Dogecoin-Mining werden der Dogecoin-Blockchain neue Transaktionsblöcke hinzugefügt. Miner werden für ihre Arbeit mit neuen Dogecoins belohnt. Dieses Thema enthält Artikel zum Dogecoin-Mining, einschließlich der Anleitung zum Mining von Dogecoin, der besten Mining-Hardware und -Software und der Rentabilität des Dogecoin-Minings.
  • Start des Spacex-Raumschiffs
    Start des Spacex-Raumschiffs
    Dieses Thema enthält Artikel zu SpaceX-Raumschiffstarts, einschließlich Startdaten, Missionsdetails und Startstatus. Bleiben Sie mit dieser informativen und umfassenden Ressource über die neuesten Starts von SpaceX Starship auf dem Laufenden.
  • König der Meme: Dogecoin
    König der Meme: Dogecoin
    Dieses Thema enthält Artikel zu den beliebtesten Memes, darunter „The King of Memes: Dogecoin“. Memecoin hat sich zu einem dominanten Akteur im Kryptoraum entwickelt. Diese digitalen Assets sind aus verschiedenen Gründen beliebt. Sie treiben die innovativsten Aspekte der Blockchain voran.