128GB 맥 살 뻔한 사람 잠깐만.
대형 AI를 RAM에 다 넣는 대신
필요한 Expert만 SSD에서 그때그때 꺼내 쓰는 방법이 나옴.
덕분에 Qwen 3.8 Next Flash·DeepSeek V4 Flash 같은 모델도 훨씬 적은 메모리에서 구동 가능.
느려도 이건 의미가 큼.
“내 컴에선 못 돌려”가 “어? 돌아가네?”로 바뀌는 중.
여기
/
github.com
GitHub - kk-r/dsv4-streaming: Running DeepSeek-V4-Flash (284B MoE) on a 64 GB Mac by streaming experts from SSD — a measurement lab: cache-size sweeps, prefetch and speculative-decoding experiments, and the failures documented with mechanisms
[댓글 @dextune]
도대체 이런 똑같은 흐름 분석은 어디서 나오는걸까. 도매 공급처라도 있는걸까.
[댓글 @suung.hoon]
@dextune
저 ds4 엔진 업스트림 포크해서 나름 열심히 최적화하고 있는 입장에서 진짜 울고싶슴다 이런 포스팅이 본질을 엄청 흐리는 것 같네..
ds4 엔진이 메모리를 세이빙하는 포인트는 asymmetric하게 모듈별 정밀도를 다르게 압축해서 mixed quant를 만드는 것에 있고.. (중요한 모듈을 16비트, 8비트 유지. 갯수가 많고 상대적 중요도가 떨어지는 모듈은 Q2까지 양자화.)
SSD에 가중치를 offload 하는 기법은
1. 이미 소개되었지만 상당히 느리거나, (이게 무슨 블루투스 샤워기도 아니고 아니 뭐 인터넷에서 가중치 로드해서 쓰지 그러면? I/O는 누가 다 잡수시고 SSD를 만능처럼 여기는지 모르겠음.)
2. Qwen3.8-Next의 경우 qwen4exp 아키텍처로 51B 가량이 통째로 연산이 없는 맵핑 테이블의 역할만 수행하는 특수하고 결정론적인 아키텍처이기 때문에 (PLE)
오프로드를 효과적으로 사용 가능한 것임.

