価格: $0.08784 -3.2815%
市場価値: $13.72B 0.4866%
ひっくり返す (24h): 1.16B 0%
優位性: 0.4866%
Price: $0.08784 -3.2815%
市場価値: $13.72B 0.4866%
ひっくり返す (24h): 1.16B 0%
優位性: 0.4866% 0.4866%
  • 価格: $0.08784 -3.2815%
  • 市場価値: 13.72B 0.4866%
  • ひっくり返す (24h): 1.16B 0%
  • 優位性: 0.4866% 0.4866%
  • 価格: $0.08784 -3.2815%
フロントページ > 视频 > Strata はなぜそれほど速いのでしょうか?そして、その落とし穴は何でしょうか?階層テスト済み!

Strata はなぜそれほど速いのでしょうか?そして、その落とし穴は何でしょうか?階層テスト済み!

リリース: 2026/10/08 12:52 読む: 0

原作者:Weights & Wonders

オリジナルソース:https://www.youtube.com/embed/8kzSGQzGigc

友人から、Qwen 3.8 Flash Next をホストしてほしいと頼まれました。これは 1,250 億パラメータのモデルで、RTX 4070 (12 GB) を 1 つ搭載したマシン上です。そこで私は Strata を試してみました。これは人々が「llama.cpp より 6 倍速い」と呼んでいる無料エンジンです。それは動作します。書き込みは 1 秒あたり llama.cpp の 15 トークンに対して約 35 トークンで実行され、100,000 トークンのコードベースは 24 分ではなく 2 分 22 秒で読み取られました。その後、ログに何か奇妙なことが示されました。グラフィックス カードがほとんど動作していませんでした。このビデオではその理由を説明しています。同じ理由で、このセットアップは 1 人にとっては優れたものになりますが、2 人目が参加すると llama.cpp よりも速くはなりません。章 0:00 1 枚の 12 GB カード上の 125B モデル 1:16 リクエスト 2:18 Strata がモデルを分割する方法 4:07 マシン 5:28 1 人、1 人のチャット 6:39 長い読み取り 8:41 かろうじて試行していたカード 9:56 2 人が群衆 11:05 評決 結果 (同じモデル ファイル、同じカード、両方のエンジン) • 短いチャット: Strata 32.5 ~ 38.1 tok/s 対 llama.cpp 15.3 ~ 16.5 tok/s (ストック llama.cpp、MTP ドラフトなし) • 100,000 トークンの C++ コードベースの読み取り: Strata 2 分 22 秒 vs llama.cpp 24 分 (~71 tok/s) • その後の書き込み 100K 読み取り: Strata 47 tok/s (コード上で受け入れられるドラフト トークン 404 個のうち 373 個) vs llama.cpp 15.5 • 235,000 トークンのドキュメント: 5 分 5 秒で読み取り。隠されたパスフレーズが見つかりました。フォローアップの質問: 11.5 秒 (キャッシュから再利用されたトークン 229,376 個、新規トークン 6,054 個) • チャットの成長に伴う書き込み: 30.0 tok/s (~1K) → 25.7 (120K) → 24.6 (235K) • GPU 電力: 200 W 制限のうち平均 93 W (ピーク 117 W)、クロックはフルスピード(~2,865 MHz) • 必要な専門家が実行した場合 (シングル ユーザー): 58% がすでにカード上にあり、4% がカードにコピーされ、38% が CPU 上 • 2 人のユーザー (並列オン): 合計 ~18 tok/s 対 llama.cpp ~19。 4 ユーザー: 24.2 対 23.2 • 2 人のユーザーがそれぞれ約 90,000 トークンのドキュメントを一度に貼り付け: 23 分 45 秒 • 4 つの短いチャット: 並行して 66.5 秒、次々に 49.8 秒 セットアップ • GPU: NVIDIA RTX 4070、12 GB • CPU: 2× Intel Xeon E5-2680 v4 (2016) • RAM: 最大 170 GB が利用可能 (モデルの専門家は最大 50 GB を必要とします。このサイズでは合計 64 GB が実用的な最小値です) • モデル: OrcaRouter の Qwen 3.8 Flash Next 無修正、IQ3_XXS GGUF (85 GB)。 SSD から読み取られた n-gram テーブル (約 29 GB) • エンジン: Strata 0.1.40 (262K コンテキスト、オリジナルの Qwen モデルからの MTP ドラフト) vs llama.cpp (ストック) • すべての数値は、2026 年 10 月 7 日に記録された独自の実行に基づいています。 費用 2026 年 10 月 7 日頃、中古の RTX 4070 は約 600 ドル、64 GB DDR4 でした。キットは約490ドル。 RAM の価格は急速に変動しているため、現在のリストを確認してください。モデル サイズ別の RAM (Strata のドキュメントより) 32 GB: コーダー バージョン · 48 GB: 2 ビット バージョン · 64 GB: 3 ビット バージョン (ここで使用) · 96 GB+: ~4 ビット #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AIサーバー #strata #strataai

注目のトピック

  • ドージコインクジラの活動
    ドージコインクジラの活動
    包括的な分析により、Dogecoin クジラの活動に関する最新の洞察を得ることができます。ドージコイン市場におけるこれらのクジラの傾向、パターン、影響を発見してください。私たちの専門家による分析で最新情報を入手し、暗号通貨への取り組みを前進させてください。
  • ドージコインマイニング
    ドージコインマイニング
    Dogecoin マイニングは、Dogecoin ブロックチェーンに新しいトランザクション ブロックを追加するプロセスです。マイナーはその仕事に対して新しいドージコインを受け取ります。このトピックでは、Dogecoin のマイニング方法、最高のマイニング ハードウェアとソフトウェア、Dogecoin マイニングの収益性など、Dogecoin マイニングに関連する記事を提供します。
  • スペースXスターシップの打ち上げ
    スペースXスターシップの打ち上げ
    このトピックでは、打ち上げ日、ミッションの詳細、打ち上げステータスなど、SpaceX Starship の打ち上げに関連する記事を提供します。この有益で包括的なリソースを利用して、最新の SpaceX Starship の打ち上げに関する最新情報を入手してください。
  • ミームの王様: ドージコイン
    ミームの王様: ドージコイン
    このトピックでは、「ミームの王様: ドージコイン」など、最も人気のあるミームに関連する記事を提供します。 Memecoin は暗号通貨分野で支配的なプレーヤーとなっています。これらのデジタル資産はさまざまな理由で人気があります。これらはブロックチェーンの最も革新的な側面を推進します。