prix: $0.08784 -3.2815%
Valeur marchande: $13.72B 0.4866%
Chiffre d’affaires (24h): 1.16B 0%
Dominance: 0.4866%
Price: $0.08784 -3.2815%
Valeur marchande: $13.72B 0.4866%
Chiffre d’affaires (24h): 1.16B 0%
Dominance: 0.4866% 0.4866%
  • prix: $0.08784 -3.2815%
  • Valeur marchande: 13.72B 0.4866%
  • Chiffre d’affaires (24h): 1.16B 0%
  • Dominance: 0.4866% 0.4866%
  • prix: $0.08784 -3.2815%
première page > 视频 > Pourquoi Strata est-il si rapide ? Et quel est le piège ? Strates testées !

Pourquoi Strata est-il si rapide ? Et quel est le piège ? Strates testées !

libérer: 2026/10/08 12:52 lire: 0

Auteur original:Weights & Wonders

Source originale:https://www.youtube.com/embed/8kzSGQzGigc

Un ami m'a demandé d'héberger pour lui Qwen 3.8 Flash Next : un modèle de 125 milliards de paramètres, sur une machine équipée d'une RTX 4070 (12 Go). J'ai donc essayé Strata, le moteur gratuit que les gens appellent "6 fois plus rapide que lama.cpp". Ça marche. L'écriture s'effectuait à environ 35 jetons par seconde contre 15 pour lama.cpp, et une base de code de 100 000 jetons était lue en 2 min 22 s au lieu de 24 minutes. Ensuite, les journaux ont montré quelque chose d'étrange : la carte graphique essayait à peine. Cette vidéo explique pourquoi. La même raison rend cette configuration géniale pour une personne et pas plus rapide que llama.cpp une fois qu'une deuxième personne la rejoint. CHAPITRES 0:00 Un modèle 125B sur une carte de 12 Go 1:16 La demande 2:18 Comment Strata divise le modèle 4:07 La machine 5:28 Une personne, une conversation 6:39 La longue lecture 8:41 La carte qui essayait à peine 9:56 Deux c'est une foule 11:05 Verdict LES RÉSULTATS (même fichier modèle, même carte, les deux moteurs) • Discussions courtes : Strata 32,5 à 38,1 tok/s contre llama.cpp 15,3 à 16,5 tok/s (stock lama.cpp, pas de brouillon MTP) • Lecture d'une base de code C++ de 100 000 jetons : Strata 2 min 22 s contre llama.cpp 24 min (~ 71 tok/s) • Écriture après cette lecture de 100 000 tok : Strata 47 tok/s (373 des 404 jetons rédigés acceptés sur le code) vs llama.cpp 15,5 • Document de 235 000 jetons : lu en 5 min 5 s ; phrase secrète cachée trouvée. Question de suivi : 11,5 s (229 376 jetons réutilisés à partir du cache, 6 054 nouveaux) • Écriture à mesure que le chat se développe : 30,0 tok/s (~1 K) → 25,7 (120 000) → 24,6 (235 000) • Puissance du GPU : moyenne de 93 W sur une limite de 200 W (pic 117 W), horloges à pleine vitesse (~2 865 MHz) • Là où les experts nécessaires ont fonctionné (utilisateur unique) : 58 % déjà sur la carte, 4 % copiés dessus, 38 % sur les processeurs • Deux utilisateurs (en parallèle) : ~ 18 tok/s combinés contre lama.cpp ~ 19. Quatre utilisateurs : 24,2 contre 23,2 • Deux utilisateurs collant chacun environ 90 000 documents à la fois : 23 min 45 s • Quatre courtes discussions : 66,5 s en parallèle, 49,8 s l'une après l'autre LA CONFIGURATION • GPU : NVIDIA RTX 4070, 12 Go • CPU : 2 × Intel Xeon E5-2680 v4 (2016) • RAM : ~170 Go disponibles (les experts du modèle ont besoin d'environ 50 Go ; 64 Go au total est le minimum pratique pour cette taille) • Modèle : Qwen 3.8 Flash Next non censuré d'OrcaRouter, IQ3_XXS GGUF (85 Go) ; table n-gram (~ 29 Go) lue à partir du SSD • Moteurs : Strata 0.1.40 (contexte 262 Ko, brouillon MTP du modèle Qwen d'origine) vs llama.cpp (stock) • Tous les chiffres proviennent de nos propres exécutions enregistrées le 7 octobre 2026. CE QUE CELA COÛTE Vers le 7 octobre 2026, un RTX 4070 d'occasion coûtait environ 600 $ et un kit DDR4 de 64 Go environ 490 $. Les prix de la RAM évoluent rapidement, alors vérifiez les annonces actuelles. RAM PAR TAILLE DU MODÈLE (à partir de la documentation de Strata) 32 Go : version Coder · 48 Go : versions 2 bits · 64 Go : versions 3 bits (utilisées ici) · 96 Go+ : ~4 bits #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AIServer #strates #strataai

Sujets en vedette

  • Activité des baleines Dogecoin
    Activité des baleines Dogecoin
    Obtenez les dernières informations sur les activités des baleines Dogecoin grâce à notre analyse complète. Découvrez les tendances, les modèles et l'impact de ces baleines sur le marché Dogecoin. Restez informé grâce à notre analyse d’experts et gardez une longueur d’avance dans votre parcours de crypto-monnaie.
  • Extraction de Dogecoins
    Extraction de Dogecoins
    Le minage de Dogecoin est le processus d'ajout de nouveaux blocs de transactions à la blockchain Dogecoin. Les mineurs sont récompensés par un nouveau Dogecoin pour leur travail. Cette rubrique propose des articles liés au minage de Dogecoin, notamment sur la manière d'exploiter du Dogecoin, les meilleurs matériels et logiciels de minage et la rentabilité du minage de Dogecoin.
  • Lancement du vaisseau Spacex
    Lancement du vaisseau Spacex
    Cette rubrique fournit des articles relatifs aux lancements de SpaceX Starship, notamment les dates de lancement, les détails de la mission et l'état du lancement. Restez au courant des derniers lancements de SpaceX Starship avec cette ressource informative et complète.
  • Roi des mèmes : Dogecoin
    Roi des mèmes : Dogecoin
    Cette rubrique propose des articles liés aux mèmes les plus populaires, notamment « Le roi des mèmes : Dogecoin ». Memecoin est devenu un acteur dominant dans l’espace crypto. Ces actifs numériques sont populaires pour diverses raisons. Ils pilotent les aspects les plus innovants de la blockchain.