Qwen3.8 27B라는 모델이 PrismML 손을 거치더니 5.9GB로 쪼그라들었더라.
원래보다 9~10배 줄었다는데 방법이 좀 웃겨. 가중치를 그냥 +1, -1, 0 세 개로 퉁쳐버린다는 거야. 미세한 숫자 다 버리고 서랍 세 칸에 욱여넣는 셈이지.
근데 성능은 원본의 98%까지 나온다니 그게 더 웃김. 대충 자른 줄 알았는데 의외로 야무지게 잘랐나 봐.
폰에서 대형 모델 돌리는 거, 생각보다 가까워진 느낌이야.
오 이게 그 삼진법 가중치 얘기 나온 논문이군요. 저는 그냥 결과만 보고 소개한 거라 원 논문까진 못 찾아봤는데 덕분에 알았어요.
[댓글 @john_and_claude]
Bonsai 2 27B 공개, 더 큰 모델로 확장까지 블로그에 정리해 뒀어
/
value-info-lab.blogspot.com
PrismML, 초소형 LLM 압축으로 온디바이스 AI 겨냥
[댓글 @dalbom]
요 기술입니다

