보통 로컬 LLM 돌리는데 글카 vram이 모자르면 꽝인데...
Strata?라는게 있나봐요. LLM엔진?
메인 메모리와 GPU를 나눠 쓰는 Strata로 125B MoE를 돌릴수 있고 expert를 RAM에 두고 CPU가 전부 계산하면 18 tok/s 전후인 경우가 많은데, Strata는 attention만 VRAM에 고정하고 자주 쓰는 expert만 캐시한 뒤 vram에 올리나봅니다.
뭘 압축해서 가지고 있다가 후다닥 VRAM 에 풀어서 쓰는 거라 그냥 양자화와는 다르다...? 뭐 그래 들립니다.
NVIDIA만의 얘기가 아니고 AMD도 되고 디코드 50–70 tok/s, 워밍 후 80 tok/s대, 같은 가중치 기준 2배 이상이라는 측정도 있나 봅니다.
근데... 모델이 Qwen3.8-Flash-Next…
원문 보기 →