알리바바 Qwen3.8, 로컬 PC에서 돌아가는 GGUF·NVFP4로 공개
알리바바 계열 Qwen이 신규 모델군 Qwen3.8을 내놓았고, Unsloth이 이를 GGUF·NVFP4로 변환해 27B 밀집형 모델을 4비트 기준 17~19GB 메모리로 개인 PC나 Mac에서 실행할 수 있게 됐다. Unsloth은 이후 Dynamic v3.0 업데이트로 동일 크기에서 정확도를 끌어올렸으며, 초대형 MoE 모델은 여전히 서버급 인프라를 요구해 두 모델의 활용 조건이 뚜렷이 갈린다.
무엇이 바뀌었나
Qwen(알리바바 계열)이 새 모델군 Qwen3.8을 공개했고, AI 양자화 도구 업체 Unsloth이 이를 GGUF와 NVFP4 형식으로 변환해 개인 PC나 Mac에서도 실행할 수 있도록 배포했다[1]. 특히 270억 파라미터급 밀집형(dense) 모델인 Qwen3.8-27B는 4비트 양자화 기준 1719GB 메모리만 있으면 로컬에서 구동할 수 있다[1]. 양자화 수준에 따라 메모리 요구량은 2비트 1113GB, 3비트 13~16GB, 6비트 24GB, 8비트 31GB, 원본 BF16 56GB까지 다양하게 나뉜다[1]. 기본 컨텍스트 윈도우는 26만2144토큰(약 256K)이며, YaRN 기법을 적용하면 최대 약 101만 토큰(1M)까지 확장할 수 있다[1].
Unsloth은 8월 15일 이 양자화 버전을 공개했다[1]. 이어 8월 19일에는 Dynamic v3.0 기법을 적용한 업데이트를 배포했다[2]. 이번 업데이트는 동일한 파일 크기에서 정확도를 개선한 것이 특징으로, top-1% 정확도가 기존 대비 10% 이상 향상됐다고 밝혔다[2]. 공개 후 5일 동안 Unsloth의 Qwen3.8 관련 GGUF는 510만 회 다운로드됐다[2].
성능과 용량의 균형점
Unsloth이 제시한 벤치마크에 따르면 Qwen3.8-27B는 이전 세대인 Qwen3.6-27B 대비 여러 지표에서 상승을 기록했다. Terminal Bench 2.1 점수는 63.4에서 73.0으로, SWE-bench Pro는 53.5에서 61.7로, LiveCodeBench v6는 83.9에서 90.3으로, CoWorkBench는 61.0에서 70.7로 각각 올랐다[1]. 코딩·에이전트 작업 관련 벤치마크에서 고르게 개선된 셈이다.
용량을 크게 줄인 양자화 버전에서도 정확도 손실을 최소화하려는 시도가 이어졌다. 약 9GB 크기의 IQ2_XXS는 원본 대비 82.5%의 정확도를 유지한다고 소개됐다[1]. Dynamic v3.0 적용 이후에는 6.2GB 크기의 UD-IQ1_S가 top-1% 정확도 약 72%를 유지하면서 크기를 89% 줄였고, 9.83GB의 UD-Q2_K_XL은 차선 모델 대비 top-1% 정확도가 8%포인트 높다고 밝혔다[2]. 다만 UD-Q2_K_XL(약 25%)에서 UD-IQ2_S(8~10% 미만)로 넘어가는 구간에서 Divergence-300 지표 기준 정확도가 급격히 떨어지는 지점이 관찰됐다[2]. 극단적으로 작은 1비트 양자화를 사용할 경우 presence_penalty를 1.5 이상으로 설정하는 것이 권장된다[2].
한편 초대형 MoE(전문가 혼합) 모델인 Qwen3.8-2.4T-A95B는 전체 2.4조 파라미터 중 950억 개만 활성화하는 구조로, 전체 정밀도로 저장하면 4.9TB에 달한다[1]. Unsloth Dynamic GGUF로 1비트 수준까지 압축해도 397GB, IQ1_S 기준으로는 508GB가 필요해 개인 환경보다는 워크스테이션·서버급 인프라를 전제로 한 모델로 보인다[1]. NVIDIA Blackwell 계열 GPU(RTX 50 시리즈, DGX Spark, B200, B300)를 겨냥한 NVFP4 양자화는 BF16 대비 약 1.5배 빠른 속도를 내면서도 24GB VRAM에서 실행 가능하고, 정확도는 BF16 대비 92~97% 수준으로 복원된다고 소개됐다[1]. MTP(Multi-Token Prediction) 모듈은 8.37GB 이하 양자화에서 제거돼 약 500MB를 추가로 절약한다[2].
실무에 미치는 영향
로컬 LLM을 검토하는 개발팀이나 인프라 담당자 입장에서는 27B급 모델을 소비자용 GPU나 고사양 Mac 한 대로 돌릴 수 있다는 점이 실질적인 선택지를 넓힌다. 특히 4비트 기준 17~19GB라는 수치는 RTX 4090(24GB)이나 유사 사양의 워크스테이션에서 여유 있게 구동 가능한 수준이어서, 클라우드 API 비용 없이 사내 코드 검토나 에이전트형 작업을 실험해볼 수 있는 여지가 생긴다. llama.cpp, vLLM, SGLang 등 기존 추론 엔진과 호환되는 형태로 배포된 점도 도입 장벽을 낮추는 요소다[1].
다만 대형 MoE 모델인 Qwen3.8-2.4T-A95B는 여전히 수백 기가바이트 단위의 저장 공간과 서버급 GPU 구성을 요구하기 때문에, 이 모델을 온프레미스로 운영하려는 조직은 인프라 투자 규모를 먼저 가늠해야 한다. 또한 벤치마크 수치나 정확도 유지율은 모두 개발사·배포사가 자체 제시한 값으로, 실제 사내 데이터셋이나 업무 시나리오에 적용했을 때의 성능은 별도로 검증이 필요하다.
불확실한 부분
Unsloth이 최초 공개 당시 제시한 IQ2_XXS(약 9GB, 정확도 82.5%) 수치와 이후 Dynamic v3.0 업데이트에서 제시한 UD-IQ1_S(6.2GB, 정확도 약 72%), UD-Q2_K_XL(9.83GB, 정확도 +8%포인트) 수치는 양자화 명명 체계나 측정 버전이 달라 보이지만, 두 발표 간 정확한 대응 관계는 공개된 자료에서 명시되지 않았다. 같은 모델을 두고 비교할 때는 어떤 버전과 측정 기준을 사용했는지 확인이 필요하다.
또한 Qwen3.8-2.4T-A95B가 'GPT-5.6 Sol'과 경쟁 관계에 있다는 언급이 일부 자료에서 등장하지만, 이는 원문 요약 안에서 나온 비교일 뿐 구체적인 벤치마크 근거나 출처가 함께 제시되지 않았다. 이 부분은 추가 확인이 필요한 사안으로 남아 있다.

