가격: $0.08784 -3.2815%
시장가치: $13.72B 0.4866%
회전율 (24h): 1.16B 0%
권세: 0.4866%
Price: $0.08784 -3.2815%
시장가치: $13.72B 0.4866%
회전율 (24h): 1.16B 0%
권세: 0.4866% 0.4866%
  • 가격: $0.08784 -3.2815%
  • 시장가치: 13.72B 0.4866%
  • 회전율 (24h): 1.16B 0%
  • 권세: 0.4866% 0.4866%
  • 가격: $0.08784 -3.2815%
첫 페이지 > 视频 > Strata가 왜 그렇게 빠른가요? 그리고 문제는 무엇입니까? 스트라타 테스트 완료!

Strata가 왜 그렇게 빠른가요? 그리고 문제는 무엇입니까? 스트라타 테스트 완료!

풀어 주다: 2026/10/08 12:52 읽다: 0

원저자:Weights & Wonders

원본 소스:https://www.youtube.com/embed/8kzSGQzGigc

한 친구가 나에게 RTX 4070(12GB) 1개가 장착된 시스템에서 1,250억 매개변수 모델인 Qwen 3.8 Flash Next를 호스팅해 달라고 요청했습니다. 그래서 무료 엔진 사람들이 "llama.cpp보다 6배 빠르다"고 부르는 Strata를 사용해 보았습니다. 작동합니다. llama.cpp의 15개에 비해 초당 약 35개의 토큰으로 쓰기가 실행되었으며, 100,000개의 토큰 코드베이스를 24분이 아닌 2분 22초 만에 읽었습니다. 그런 다음 로그에는 이상한 점이 표시되었습니다. 그래픽 카드가 거의 작동하지 않는 것입니다. 이 영상에서는 그 이유를 설명합니다. 같은 이유로 이 설정은 한 사람에게는 훌륭하지만 두 번째 사람이 참여하면 llama.cpp보다 빠르지 않습니다. 챕터 0:00 하나의 12GB 카드에 125B 모델 1:16 요청 2:18 Strata가 모델을 분할하는 방법 4:07 기계 5:28 한 사람, 하나의 채팅 6:39 긴 읽기 8:41 간신히 노력한 카드 9:56 둘은 군중 11:05 결과 평결(동일 모델 파일, 동일 카드, 두 엔진 모두) • 간략 채팅: Strata 32.5–38.1 tok/s vs llama.cpp 15.3–16.5 tok/s (stock llama.cpp, MTP 초안 없음) • 100,000개 토큰 C++ 코드베이스 읽기: Strata 2분 22초 vs llama.cpp 24분(~71 tok/s) • 100K 읽기 이후 쓰기: Strata 47톡/초(코드에서 허용되는 초안 토큰 404개 중 373개) 대 llama.cpp 15.5 • 235,000개 토큰 문서: 5분 5초 안에 읽습니다. 숨겨진 암호가 발견되었습니다. 후속 질문: 11.5초(캐시에서 재사용된 토큰 229,376개, 신규 6,054개) • 채팅 증가에 따른 쓰기: 30.0tok/s(~1K) → 25.7(120K) → 24.6(235K) • GPU 전력: 200W 제한 중 평균 93W(피크 117W), 최고 속도의 클럭 (~2,865MHz) • 필요한 전문가가 실행된 위치(단일 사용자): 58%는 이미 카드에 있고, 4%는 카드에 복사되었으며, 38%는 CPU에 있습니다. • 2명의 사용자(병렬): 합쳐서 ~18 tok/s vs llama.cpp ~19. 4명의 사용자: 24.2 대 23.2 • 두 명의 사용자가 각각 최대 90,000개의 토큰 문서를 동시에 붙여넣기: 23분 45초 • 4명의 짧은 채팅: 병렬로 66.5초, 차례로 49.8초 설정 • GPU: NVIDIA RTX 4070, 12GB • CPU: 2× Intel Xeon E5-2680 v4(2016) • RAM: ~170GB 사용 가능(모델 전문가는 ~50GB 필요, 이 크기에 대한 실제 최소 용량은 총 64GB임) • 모델: OrcaRouter's Qwen 3.8 Flash Next Uncensored, IQ3_XXS GGUF(85GB); SSD에서 읽은 n-gram 테이블(~29GB) • 엔진: Strata 0.1.40(262K 컨텍스트, 원래 Qwen 모델의 MTP 초안) 대 llama.cpp(주식) • 모든 수치는 2026년 10월 7일에 자체적으로 기록된 실행에서 나온 것입니다. 비용은 2026년 10월 7일경에 중고 RTX 4070은 약 600달러였고 64GB DDR4 키트는 약 $600였습니다. $490. RAM 가격이 빠르게 움직이고 있으므로 현재 목록을 확인하세요. 모델 크기별 RAM(Strata 문서에서) 32GB: Coder 버전 · 48GB: 2비트 버전 · 64GB: 3비트 버전(여기서 사용됨) · 96GB+: ~4비트 #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AI서버 #strata #strataai

주요 주제

  • Dogecoin 고래 활동
    Dogecoin 고래 활동
    포괄적인 분석을 통해 Dogecoin 고래 활동에 대한 최신 통찰력을 얻으십시오. Dogecoin 시장에서 이러한 고래의 추세, 패턴 및 영향을 알아보세요. 우리의 전문가 분석을 통해 정보를 얻고 암호화폐 여정에서 앞서 나가십시오.
  • 도지코인 채굴
    도지코인 채굴
    Dogecoin 채굴은 Dogecoin 블록체인에 새로운 거래 블록을 추가하는 프로세스입니다. 광부들은 그들의 작업에 대해 새로운 Dogecoin으로 보상을 받습니다. 이 주제에서는 Dogecoin 채굴 방법, 최고의 채굴 하드웨어 및 소프트웨어, Dogecoin 채굴의 수익성 등 Dogecoin 채굴과 관련된 기사를 제공합니다.
  • 스페이스엑스 우주선 발사
    스페이스엑스 우주선 발사
    이 주제에서는 발사 날짜, 임무 세부 정보 및 발사 상태를 포함하여 SpaceX Starship 발사와 관련된 기사를 제공합니다. 이 유익하고 포괄적인 리소스를 통해 최신 SpaceX Starship 출시에 대한 최신 정보를 받아보세요.
  • 밈의 왕: Dogecoin
    밈의 왕: Dogecoin
    이 주제에서는 "The King of Memes: Dogecoin"을 포함하여 가장 인기 있는 밈과 관련된 기사를 제공합니다. Memecoin은 암호화폐 공간에서 지배적인 플레이어가 되었습니다. 이러한 디지털 자산은 다양한 이유로 인기가 있습니다. 그들은 블록체인의 가장 혁신적인 측면을 주도합니다.