IBM이 8월 25일 오픈웨이트 언어모델 '그래나이트(Granite) 4.2'를 공개했습니다. 3B, 8B, 30B 세 종류이고, 라이선스는 전부 Apache 2.0입니다. 상업 이용에 제약이 없어 개인PC는 물론 매장 업무용으로도 그대로 내려받아 쓸 수 있는 계열입니다. 🖥️
공개 소식과 동시에 매장에서 굴리는 AI 머신 두 대에 같은 급 모델을 올려 300토큰 고정 생성 시간을 재봤습니다. AMD Radeon AI PRO R9700 32GB에 27B급 dense 모델, RTX 5060 Ti 16GB에 26B급 MoE 모델을 올린 조합입니다.
공식 벤치마크, 8B가 SWE-Bench Verified 47점을 넘었다
IBM 공식 제품 페이지에 따르면 8B는 MMLU-Pro 74.04점, AIME25 86.67점, SWE-Bench Verified 47.67점(pass@1)을 기록했습니다. 30B는 같은 항목에서 각각 77.60점, 89.17점, 57.00점입니다. 8B급 치고는 코드 점수가 꽤 나온 편이라, IBM은 GitHub 리포지토리에서 "8B급에서 reasoning과 instruction following 경쟁 모델들과 대등 이상"이라고 밝혔습니다.
그래나이트 4.2의 진짜 변화는 추론 모드입니다. 기술 블로그 기준으로 세 모델 모두 기본 학습량이 약 15T 토큰이고, thinking / non-thinking 전환과 저부하(low-effort) 모드를 내장했습니다. 8B와 30B에는 샌드박스 환경에서의 에이전트 RL 학습이 추가돼 도구 호출과 터미널 조작을 모델 자체의 언어로 출력합니다. OpenAI 호환 엔드포인트(vLLM, SGLang)에서 바로 붙을 뿐 아니라, Hugging Face에 GGUF 양자화까지 같이 올라와 있어서 llama.cpp·Ollama·LM Studio에서 바로 돌릴 수 있습니다. 모델 카드 기준 지원 언어에 한국어가 포함되어 있다는 점도 눈에 띕니다.
필요 VRAM 계산과 실측 파일 크기
Q4_K_M 기준으로 계산해보면 이렇습니다. 필요 VRAM 대략치는 10억 파라미터당 약 0.65GB로 잡고 컨텍스트 여분 1~2GB를 더하는 방식으로 산정하는데, 실제 GGUF 파일 크기가 8B는 5.35GB, 30B는 17.7GB로 이 계산과 잘 맞아떨어집니다. 8B는 6~7GB면 여유가 있고, 30B는 파일 자체만 17.7GB라 20GB 이상, 실사용은 24GB 그래픽카드를 권장합니다. 컨텍스트를 길게 쓸수록 KV 캐시가 먹기 때문에, 512K 전문으로 돌릴 계획이면 이 숫자보다 여유를 두셔야 합니다.
매장 실측 (300토큰 고정, 2026-09-01)
| AI 머신 | 구동 모델 급 | 300토큰 생성 속도 |
| AMD Radeon AI PRO R9700 32GB 조립PC | 27B급 dense | 초당 27.6~29.3 토큰 |
| RTX 5060 Ti 16GB 조립PC | 26B급 MoE (활성 4B) | 초당 57.6~61.9 토큰 |
같은 방 안에서도 dense 27B와 MoE 26B의 체감 속도가 2배 이상 갈립니다. 300토큰 기준 dense는 10초 안팎, MoE는 5초 안에 끝나는 수치입니다. 그래나이트 30B dense를 Q4로 올리면 파라미터가 더 많은 만큼 위 표의 27B급 dense보다 조금 더 느린 구간으로 봐야 하고, MoE급 체감을 원하시면 활성 파라미터가 작은 모델을 고르시면 됩니다.
이 카드면 이 모델
| 그래픽카드 VRAM | 올리기 좋은 구성 |
| 8GB | 3B는 여유, 8B Q4_K_M은 컨텍스트를 짧게 잡으면 가능 |
| 12GB | 8B Q4_K_M이 정석 구간 (파일 5.35GB + 여분) |
| 16GB | 8B Q8_0 또는 30B Q3 계열 시도 |
| 24GB | 30B Q4_K_M (파일 17.7GB)이 딱 들어감 |
| 32GB 이상 | 30B Q5_K_M 이상 + 긴 컨텍스트 |
견적을 문의하시는 분께
요즘 로컬 AI PC 문의를 보면 "30B급을 얼마나 조용히 빠르게 돌릴 수 있냐"로 좁혀집니다. 이번 그래나이트 4.2는 Apache 2.0이라 사업자도 라이선스 걱정 없이 쓸 수 있고, GGUF가 공식으로 함께 나와 셋팅 장벽도 낮습니다. 24GB급 카드로 30B Q4를 올리든, 라데온 기반 AI 머신으로 컨텍스트 여유를 두든 케이스별로 상담드리고 있습니다.
남은 과제는 속도보다 한국말 안정성입니다. 모델 카드는 한국어가 시험된 언어라고 밝히지만, 추론 모드의 thinking 블록까지 한국어로 일관되게 쓰는지는 아직 직접 돌려봐야 알 단계입니다.
견적·조립 상담은 천안 하이라이프PC로 문의 부탁드립니다.
네이버 지도(https://map.naver.com/p/entry/place/1232645619),
네이버톡톡(https://talk.naver.com/ct/w5wmnx?frm=mnmb&frm=nmb_detail),
카카오 채널(https://pf.kakao.com/_xnxfIxfn/chat)로
사용하시는 용도와 게임, 사용하시는 프로그램 등을 알려주시면 자세히 안내해드리겠습니다.
출처: Hugging Face 모델 카드·GGUF 저장소 (ibm-granite/granite-4.2-8b, 30b, 각 -GGUF, 2026-08-25 공개분), IBM Granite 공식 제품 페이지 벤치마크, IBM 기술 블로그 "Granite 4.2 LLMs: How They're Built". 매장 실측은 2026-09-01 자사 서버에서 300토큰 고정 생성 기준.
'로컬 AI 뉴스' 카테고리의 다른 글
| 메타 뮤즈 글리머 4비트 실측...16GB 카드엔 들어가지만 24GB부터 쓸 만합니다 (1) | 2026.09.08 |
|---|---|
| K2 Horizon 36B MoE, 32GB 카드로 돌아갑니다...매장 실측 8.6토큰 (0) | 2026.09.06 |
| Qwen3.8 두 모델 실측기...RTX 5060 Ti 16GB와 GX10 128GB의 차이 (0) | 2026.09.01 |
| 메타 30B 오픈웨이트 '뮤즈 글리머' 공개...우리 PC에서 몇 토큰이나 (0) | 2026.09.01 |