메타가 8월 10일 공개한 오픈웨이트 모델 '뮤즈 글리머(Muse Glimmer)'를 몇 GB 그래픽카드로 쓸 수 있느냐가 로컬 AI를 쓰시는 분들께 최대 관심사입니다. 결론부터 말하면 4비트 양자화 파일은 약 16.7GB이고, 16GB 카드에 파일 자체가 '들어가는' 것과 실제로 쓸 만한 환경은 별개 문제입니다. 메타가 설계 기준으로 밝힌 카드는 24GB와 32GB 두 단계이고, 짧은 대화가 아닌 에이전트 작업 용도라면 이 기준을 그대로 보는 편이 안전합니다.
4비트 파일은 16.7GB, 8비트는 29.6GB
![]()
허깅페이스에 올라온 공식 GGUF 파일 목록을 직접 확인하면 4비트 양자화(Q4_K_M)는 16.7GB, 8비트(Q8_0)는 29.6GB입니다. 모델 본문은 296억 파라미터 밀집(dense) 구조에 비전 인코더 18억 개를 얹은 멀티모달이고, 이미지 입력까지 쓰려면 비전 프로젝트 파일 1.4GB가 따로 더 차지합니다. 4비트로 줄였는데도 파일이 이만큼 나가는 이유가 구조 자체에 있습니다. "줄였으니 16GB 카드로 되겠지"라는 기대가 첫 단추부터 어긋나는 지점도 이 용량표입니다.
파일이 아니라 '남는 자리'가 기준입니다
16GB 카드에 4비트 파일을 올리면 빈 자리가 1GB 남짓입니다. 그런데 모델이 대화할 때마다 컨텍스트 저장소(KV 캐시)와 런타임 오버헤드가 자리를 더 차지합니다. 메타 스스로도 발표문에서 4비트 압축으로 언어 모델을 20GB 미만으로 줄여 KV 캐시와 비전 인코더, 가속용 보조 모델을 함께 올리도록 24GB와 32GB 카드를 기준으로 설계했다고 밝혔습니다. 파일 용량만 보지 말고 그 위에 얹힐 자리까지 함께 봐야 한다는 뜻입니다.
가정용 PC 기준으로 정리하면
16GB 카드는 파일이 꽉 찬 비율이라 짧은 질문·답변 외에는 컨텍스트를 늘리기 어렵고, 창을 몇 개만 띄워도 밀려납니다. 24GB 카드는 4비트를 올리고도 남는 자리에 문서 뭉치를 얹을 수 있는 선이고, 32GB 카드는 캐시 여유가 생겨 장시간 에이전트 작업에서도 체감 속도가 안정됩니다. 이번 주 그래픽카드 시세가 오르면서 "나중에 업그레이드"를 전제로 조립하시는 분들이 늘고 있는데, 애초에 300억급 모델을 목표로 잡으셨다면 24GB 이상을 기준으로 삼는 편이 결과적으로 값어치를 합니다.
- 허깅페이스 공식 GGUF 파일 목록(4비트 16.7GB·8비트 29.6GB·비전 파일 1.4GB)
- 메타 리서치 공식 발표문(4비트 압축, 24·32GB 기준 설계)
- 메타 개발자 모델 카드(30B, Apache 2.0, 단일 GPU)
- 허깅페이스 모델 카드(파라미터·라이선스·컨텍스트 131,072+)
견적·조립 상담은 천안 하이라이프PC로 문의 부탁드립니다. 네이버 지도(https://map.naver.com/p/entry/place/1232645619), 네이버톡톡(https://talk.naver.com/ct/w5wmnx?frm=mnmb&frm=nmb_detail), 카카오 채널(https://pf.kakao.com/_xnxfIxfn/chat)로 사용하시는 용도와 게임, 사용하시는 프로그램 등을 알려주시면 자세히 안내해드리겠습니다.
🖥️ 로컬용 AI 조립PC, 어디까지 줄여야 할지부터 정하시면 됩니다.
'로컬 AI 뉴스' 카테고리의 다른 글
| K2 Horizon 36B MoE, 32GB 카드로 돌아갑니다...매장 실측 8.6토큰 (0) | 2026.09.06 |
|---|---|
| Qwen3.8 두 모델 실측기...RTX 5060 Ti 16GB와 GX10 128GB의 차이 (0) | 2026.09.01 |
| IBM 오픈웨이트 '그래나이트 4.2' 공개...30B는 24GB 그래픽카드면 돌아갑니다 (0) | 2026.09.01 |
| 메타 30B 오픈웨이트 '뮤즈 글리머' 공개...우리 PC에서 몇 토큰이나 (0) | 2026.09.01 |