libérer: 2026/10/08 12:52 lire: 0
Auteur original:Weights & Wonders
Source originale:https://www.youtube.com/embed/8kzSGQzGigc
Un ami m'a demandé d'héberger pour lui Qwen 3.8 Flash Next : un modèle de 125 milliards de paramètres, sur une machine équipée d'une RTX 4070 (12 Go). J'ai donc essayé Strata, le moteur gratuit que les gens appellent "6 fois plus rapide que lama.cpp". Ça marche. L'écriture s'effectuait à environ 35 jetons par seconde contre 15 pour lama.cpp, et une base de code de 100 000 jetons était lue en 2 min 22 s au lieu de 24 minutes. Ensuite, les journaux ont montré quelque chose d'étrange : la carte graphique essayait à peine. Cette vidéo explique pourquoi. La même raison rend cette configuration géniale pour une personne et pas plus rapide que llama.cpp une fois qu'une deuxième personne la rejoint. CHAPITRES 0:00 Un modèle 125B sur une carte de 12 Go 1:16 La demande 2:18 Comment Strata divise le modèle 4:07 La machine 5:28 Une personne, une conversation 6:39 La longue lecture 8:41 La carte qui essayait à peine 9:56 Deux c'est une foule 11:05 Verdict LES RÉSULTATS (même fichier modèle, même carte, les deux moteurs) • Discussions courtes : Strata 32,5 à 38,1 tok/s contre llama.cpp 15,3 à 16,5 tok/s (stock lama.cpp, pas de brouillon MTP) • Lecture d'une base de code C++ de 100 000 jetons : Strata 2 min 22 s contre llama.cpp 24 min (~ 71 tok/s) • Écriture après cette lecture de 100 000 tok : Strata 47 tok/s (373 des 404 jetons rédigés acceptés sur le code) vs llama.cpp 15,5 • Document de 235 000 jetons : lu en 5 min 5 s ; phrase secrète cachée trouvée. Question de suivi : 11,5 s (229 376 jetons réutilisés à partir du cache, 6 054 nouveaux) • Écriture à mesure que le chat se développe : 30,0 tok/s (~1 K) → 25,7 (120 000) → 24,6 (235 000) • Puissance du GPU : moyenne de 93 W sur une limite de 200 W (pic 117 W), horloges à pleine vitesse (~2 865 MHz) • Là où les experts nécessaires ont fonctionné (utilisateur unique) : 58 % déjà sur la carte, 4 % copiés dessus, 38 % sur les processeurs • Deux utilisateurs (en parallèle) : ~ 18 tok/s combinés contre lama.cpp ~ 19. Quatre utilisateurs : 24,2 contre 23,2 • Deux utilisateurs collant chacun environ 90 000 documents à la fois : 23 min 45 s • Quatre courtes discussions : 66,5 s en parallèle, 49,8 s l'une après l'autre LA CONFIGURATION • GPU : NVIDIA RTX 4070, 12 Go • CPU : 2 × Intel Xeon E5-2680 v4 (2016) • RAM : ~170 Go disponibles (les experts du modèle ont besoin d'environ 50 Go ; 64 Go au total est le minimum pratique pour cette taille) • Modèle : Qwen 3.8 Flash Next non censuré d'OrcaRouter, IQ3_XXS GGUF (85 Go) ; table n-gram (~ 29 Go) lue à partir du SSD • Moteurs : Strata 0.1.40 (contexte 262 Ko, brouillon MTP du modèle Qwen d'origine) vs llama.cpp (stock) • Tous les chiffres proviennent de nos propres exécutions enregistrées le 7 octobre 2026. CE QUE CELA COÛTE Vers le 7 octobre 2026, un RTX 4070 d'occasion coûtait environ 600 $ et un kit DDR4 de 64 Go environ 490 $. Les prix de la RAM évoluent rapidement, alors vérifiez les annonces actuelles. RAM PAR TAILLE DU MODÈLE (à partir de la documentation de Strata) 32 Go : version Coder · 48 Go : versions 2 bits · 64 Go : versions 3 bits (utilisées ici) · 96 Go+ : ~4 bits #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AIServer #strates #strataai
Crypto Angler
2026-10-08 15:48
Weights & Wonders
2026-10-08 15:48
Pasteur Bernard Fwamba Mirec
2026-10-08 15:48
3.0 TV
2026-10-08 15:48
GemBoy Crypto
2026-10-08 15:48
区块拿铁
2026-10-08 14:35
Fuma Boy'Z
2026-10-08 14:15
The Crypto Report
2026-10-08 13:56
Crypto Việt Nam
2026-10-08 13:19
Sélectionnez la devise
US Dollar
USD
Chinese Yuan
CNY
Japanese Yen
JPY
South Korean Won
KRW
New Taiwan Dollar
TWD
Canadian Dollar
CAD
Euro
EUR
Pound Sterling
GBP
Danish Krone
DKK
Hong Kong Dollar
HKD
Australian Dollar
AUD
Brazilian Real
BRL
Swiss Franc
CHF
Chilean Peso
CLP
Czech Koruna KČ
CZK
Singapore Dollar
SGD
Indian Rupee
INR
Saudi Riyal
SAR
Vietnamese Dong
VND
Thai Baht
THB
Sélectionnez la devise
US Dollar
USD-$
Chinese Yuan
CNY-¥
Japanese Yen
JPY-¥
South Korean Won
KRW -₩
New Taiwan Dollar
TWD-NT$
Canadian Dollar
CAD-$
Euro
EUR - €
Pound Sterling
GBP-£
Danish Krone
DKK-KR
Hong Kong Dollar
HKD- $
Australian Dollar
AUD-$
Brazilian Real
BRL -R$
Swiss Franc
CHF -FR
Chilean Peso
CLP-$
Czech Koruna KČ
CZK -KČ
Singapore Dollar
SGD-S$
Indian Rupee
INR -₹
Saudi Riyal
SAR -SAR
Vietnamese Dong
VND-₫
Thai Baht
THB -฿