リリース: 2026/10/08 12:52 読む: 0
オリジナルソース:https://www.youtube.com/embed/8kzSGQzGigc
友人から、Qwen 3.8 Flash Next をホストしてほしいと頼まれました。これは 1,250 億パラメータのモデルで、RTX 4070 (12 GB) を 1 つ搭載したマシン上です。そこで私は Strata を試してみました。これは人々が「llama.cpp より 6 倍速い」と呼んでいる無料エンジンです。それは動作します。書き込みは 1 秒あたり llama.cpp の 15 トークンに対して約 35 トークンで実行され、100,000 トークンのコードベースは 24 分ではなく 2 分 22 秒で読み取られました。その後、ログに何か奇妙なことが示されました。グラフィックス カードがほとんど動作していませんでした。このビデオではその理由を説明しています。同じ理由で、このセットアップは 1 人にとっては優れたものになりますが、2 人目が参加すると llama.cpp よりも速くはなりません。章 0:00 1 枚の 12 GB カード上の 125B モデル 1:16 リクエスト 2:18 Strata がモデルを分割する方法 4:07 マシン 5:28 1 人、1 人のチャット 6:39 長い読み取り 8:41 かろうじて試行していたカード 9:56 2 人が群衆 11:05 評決 結果 (同じモデル ファイル、同じカード、両方のエンジン) • 短いチャット: Strata 32.5 ~ 38.1 tok/s 対 llama.cpp 15.3 ~ 16.5 tok/s (ストック llama.cpp、MTP ドラフトなし) • 100,000 トークンの C++ コードベースの読み取り: Strata 2 分 22 秒 vs llama.cpp 24 分 (~71 tok/s) • その後の書き込み 100K 読み取り: Strata 47 tok/s (コード上で受け入れられるドラフト トークン 404 個のうち 373 個) vs llama.cpp 15.5 • 235,000 トークンのドキュメント: 5 分 5 秒で読み取り。隠されたパスフレーズが見つかりました。フォローアップの質問: 11.5 秒 (キャッシュから再利用されたトークン 229,376 個、新規トークン 6,054 個) • チャットの成長に伴う書き込み: 30.0 tok/s (~1K) → 25.7 (120K) → 24.6 (235K) • GPU 電力: 200 W 制限のうち平均 93 W (ピーク 117 W)、クロックはフルスピード(~2,865 MHz) • 必要な専門家が実行した場合 (シングル ユーザー): 58% がすでにカード上にあり、4% がカードにコピーされ、38% が CPU 上 • 2 人のユーザー (並列オン): 合計 ~18 tok/s 対 llama.cpp ~19。 4 ユーザー: 24.2 対 23.2 • 2 人のユーザーがそれぞれ約 90,000 トークンのドキュメントを一度に貼り付け: 23 分 45 秒 • 4 つの短いチャット: 並行して 66.5 秒、次々に 49.8 秒 セットアップ • GPU: NVIDIA RTX 4070、12 GB • CPU: 2× Intel Xeon E5-2680 v4 (2016) • RAM: 最大 170 GB が利用可能 (モデルの専門家は最大 50 GB を必要とします。このサイズでは合計 64 GB が実用的な最小値です) • モデル: OrcaRouter の Qwen 3.8 Flash Next 無修正、IQ3_XXS GGUF (85 GB)。 SSD から読み取られた n-gram テーブル (約 29 GB) • エンジン: Strata 0.1.40 (262K コンテキスト、オリジナルの Qwen モデルからの MTP ドラフト) vs llama.cpp (ストック) • すべての数値は、2026 年 10 月 7 日に記録された独自の実行に基づいています。 費用 2026 年 10 月 7 日頃、中古の RTX 4070 は約 600 ドル、64 GB DDR4 でした。キットは約490ドル。 RAM の価格は急速に変動しているため、現在のリストを確認してください。モデル サイズ別の RAM (Strata のドキュメントより) 32 GB: コーダー バージョン · 48 GB: 2 ビット バージョン · 64 GB: 3 ビット バージョン (ここで使用) · 96 GB+: ~4 ビット #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AIサーバー #strata #strataai
Crypto Angler
2026-10-08 15:48
Weights & Wonders
2026-10-08 15:48
Pasteur Bernard Fwamba Mirec
2026-10-08 15:48
3.0 TV
2026-10-08 15:48
GemBoy Crypto
2026-10-08 15:48
区块拿铁
2026-10-08 14:35
Fuma Boy'Z
2026-10-08 14:15
The Crypto Report
2026-10-08 13:56
Crypto Việt Nam
2026-10-08 13:19
通貨を選択してください
US Dollar
USD
Chinese Yuan
CNY
Japanese Yen
JPY
South Korean Won
KRW
New Taiwan Dollar
TWD
Canadian Dollar
CAD
Euro
EUR
Pound Sterling
GBP
Danish Krone
DKK
Hong Kong Dollar
HKD
Australian Dollar
AUD
Brazilian Real
BRL
Swiss Franc
CHF
Chilean Peso
CLP
Czech Koruna KČ
CZK
Singapore Dollar
SGD
Indian Rupee
INR
Saudi Riyal
SAR
Vietnamese Dong
VND
Thai Baht
THB
通貨を選択してください
US Dollar
USD-$
Chinese Yuan
CNY-¥
Japanese Yen
JPY-¥
South Korean Won
KRW -₩
New Taiwan Dollar
TWD-NT$
Canadian Dollar
CAD-$
Euro
EUR - €
Pound Sterling
GBP-£
Danish Krone
DKK-KR
Hong Kong Dollar
HKD- $
Australian Dollar
AUD-$
Brazilian Real
BRL -R$
Swiss Franc
CHF -FR
Chilean Peso
CLP-$
Czech Koruna KČ
CZK -KČ
Singapore Dollar
SGD-S$
Indian Rupee
INR -₹
Saudi Riyal
SAR -SAR
Vietnamese Dong
VND-₫
Thai Baht
THB -฿