한 친구가 나에게 RTX 4070(12GB) 1개가 장착된 시스템에서 1,250억 매개변수 모델인 Qwen 3.8 Flash Next를 호스팅해 달라고 요청했습니다. 그래서 무료 엔진 사람들이 "llama.cpp보다 6배 빠르다"고 부르는 Strata를 사용해 보았습니다. 작동합니다. llama.cpp의 15개에 비해 초당 약 35개의 토큰으로 쓰기가 실행되었으며, 100,000개의 토큰 코드베이스를 24분이 아닌 2분 22초 만에 읽었습니다. 그런 다음 로그에는 이상한 점이 표시되었습니다. 그래픽 카드가 거의 작동하지 않는 것입니다. 이 영상에서는 그 이유를 설명합니다. 같은 이유로 이 설정은 한 사람에게는 훌륭하지만 두 번째 사람이 참여하면 llama.cpp보다 빠르지 않습니다. 챕터 0:00 하나의 12GB 카드에 125B 모델 1:16 요청 2:18 Strata가 모델을 분할하는 방법 4:07 기계 5:28 한 사람, 하나의 채팅 6:39 긴 읽기 8:41 간신히 노력한 카드 9:56 둘은 군중 11:05 결과 평결(동일 모델 파일, 동일 카드, 두 엔진 모두) • 간략 채팅: Strata 32.5–38.1 tok/s vs llama.cpp 15.3–16.5 tok/s (stock llama.cpp, MTP 초안 없음) • 100,000개 토큰 C++ 코드베이스 읽기: Strata 2분 22초 vs llama.cpp 24분(~71 tok/s) • 100K 읽기 이후 쓰기: Strata 47톡/초(코드에서 허용되는 초안 토큰 404개 중 373개) 대 llama.cpp 15.5 • 235,000개 토큰 문서: 5분 5초 안에 읽습니다. 숨겨진 암호가 발견되었습니다. 후속 질문: 11.5초(캐시에서 재사용된 토큰 229,376개, 신규 6,054개) • 채팅 증가에 따른 쓰기: 30.0tok/s(~1K) → 25.7(120K) → 24.6(235K) • GPU 전력: 200W 제한 중 평균 93W(피크 117W), 최고 속도의 클럭 (~2,865MHz) • 필요한 전문가가 실행된 위치(단일 사용자): 58%는 이미 카드에 있고, 4%는 카드에 복사되었으며, 38%는 CPU에 있습니다. • 2명의 사용자(병렬): 합쳐서 ~18 tok/s vs llama.cpp ~19. 4명의 사용자: 24.2 대 23.2 • 두 명의 사용자가 각각 최대 90,000개의 토큰 문서를 동시에 붙여넣기: 23분 45초 • 4명의 짧은 채팅: 병렬로 66.5초, 차례로 49.8초 설정 • GPU: NVIDIA RTX 4070, 12GB • CPU: 2× Intel Xeon E5-2680 v4(2016) • RAM: ~170GB 사용 가능(모델 전문가는 ~50GB 필요, 이 크기에 대한 실제 최소 용량은 총 64GB임) • 모델: OrcaRouter's Qwen 3.8 Flash Next Uncensored, IQ3_XXS GGUF(85GB); SSD에서 읽은 n-gram 테이블(~29GB) • 엔진: Strata 0.1.40(262K 컨텍스트, 원래 Qwen 모델의 MTP 초안) 대 llama.cpp(주식) • 모든 수치는 2026년 10월 7일에 자체적으로 기록된 실행에서 나온 것입니다. 비용은 2026년 10월 7일경에 중고 RTX 4070은 약 600달러였고 64GB DDR4 키트는 약 $600였습니다. $490. RAM 가격이 빠르게 움직이고 있으므로 현재 목록을 확인하세요. 모델 크기별 RAM(Strata 문서에서) 32GB: Coder 버전 · 48GB: 2비트 버전 · 64GB: 3비트 버전(여기서 사용됨) · 96GB+: ~4비트 #LocalAI #Qwen #Strata #LocalLLM #llamacpp #RTX4070 #AI #LLM #NVIDIA #GPU #SelfHosted #HomeLab #OpenSourceAI #MoE #AI서버 #strata #strataai