-
GPT5.5급 최고 성능 오픈소스 LLM, GLM-5.2 IQ2 로컬 간단 테스트카테고리 없음 2026. 6. 24. 15:24
오픈소스LLM의 새 기준?을 보여준다는 평가를 받는 GLM-5.2를 테스트하고 있습니다.
먼저 지푸의 최신 모델 GLM-5.2이 어떤 성능인지 아래 표를 보시죠. 무려 직전 세대 상용 AI모델(GPT-5.2, Gemini-3 pro)를 뛰어넘거나 필적하는 성능입니다. 지푸에서 공개한 벤치에선 GPT5.5, 제미나이3.1Pro와 대등하다고 화제가 되고 있습니다.
https://huggingface.co/zai-org/GLM-5.2<'GLM-5' 정식 출시...앤트로픽·오픈AI 이어 '세계 3위' 등극>


일론 머스크가 중국판 미소스는 내년 1분기 쯤 등장할거라고 하자 지푸 CEO가 그렇게 오래 걸리지 않을 거라고 말했는데 오픈소스 모델과 클로즈드 모델 성능 차이가 6개월 정도일 거란 말이 와닫고 있습니다^^

저는 ASUS판 DGX spark인 GX-10을 2대 연결해 Vram을 256gb 활용할 수 있습니다.
아쉽게도 753B의 GLM-5.2를 그대로 올릴 수 없기에 성능이 떨어지는 양자화 모델을 선택합니다 ㅠㅠ
저는 기본모델의 BF16기준에서 2의 3승배 정도 용량을 줄인 IQ2_M 양자화 GGUF 모델을 골랐습니다. IQ2는 GGUF 형식의 중요도 기반(Importance-Quantization) 2-bit 양자화로, 모델 크기를 극적으로 줄이지만 그에 상응하는 대가가 따릅니다.
정확도와 품질이 저하되어 아래의 문제가 생기게 됩니다.
퍼플렉시티(perplexity) 급등(FP16 대비 IQ2_XXS 기준 PPL이 10~30% 이상 증가하는 경우 흔함. 모델이 "다음 토큰"을 덜 확신), 환각(hallucination) 증가, 지시 추종 능력 약화되어 복잡한 system prompt나 멀티스텝 지시를 제대로 따르지 못하는 경우 발생, 추론 능력이 급감해 수학, 코딩, 논리 체인(CoT) 같이 정밀한 내부 계산이 필요한 태스크에서 성능이 크게 무너짐
같은 네트워크에 있으며 ConnectX-7(최대 4개의 포트 연결을 통해 400Gb/s 속도의 처리량을 제공하며 클라우드, 통신, AI 및 엔터프라이즈 워크로드를 위해 하드웨어로 가속)로 묶인 GX-10a를 head 노드로 GX-10b를 worker 노드로 설정 후 llama.cpp의 RPC 실행합니다. 먼저 RPC의 개념에 대해 알아보겠습니다.
실제 동작은 아래 구성으로 실행하겠습니다.
1. 헤드노드에서 ssh 접속으로 worker 노드 RPC 실행합니다.
ssh 192.168.2.3 "cd /home/q/projs/llama.cpp && nohup env GGML_RPC_DEBUG=1 ./build/bin/rpc-server --host 192.168.2.3 --port 50052 --device CUDA0 --cache > /tmp/glm52-rpc-iq2m.log 2>&1 < /dev/null &"
2. head 노드에서 llama-server 실행(리소스 부족으로 12K context로 실행합니다.)
./build/bin/llama-server \
--model /home/q/projs/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
--rpc 192.168.2.3:50052 \
--device CUDA0,RPC0 \
--split-mode layer \
--tensor-split 1,1 \
--n-gpu-layers all \
--no-mmap \
--fit off \
--ctx-size 12096 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--flash-attn on \
--batch-size 512 \
--ubatch-size 128 \
--parallel 1 \
--threads 16 \
--no-warmup \
--jinja \
--host 0.0.0.0 \
--port 8080


Dgx spark류는 대시보드를 통해 점유율을 확인하지만, 실행 중 워커 쪽 GPU-util 상황은 이렇습니다.
제 환경에서는 초당 7.52토큰 정도로 실행됩니다.
https://www.youtube.com/watch?v=ZZLGJTUfpC0
저는 레트로 비행기 게임 갤러그를 만들어 달라고 했습니다. 처음에는 3단계로 발전하는 게임 구현 계획을 제안받아 자바스크립트로 코드를 만들다 중간에 파이썬으로 전환해 달라고 했고, 처음 만든 galaga.py에서 비행기 디자인, 스테이지 3개로 추가해달라 요청하여 galaga_deluxe.py를 받았습니다. 아쉽게도 파일 다운은 안되었고 복붙을 통해 직접 파일을 만들었습니다.
가벼운 코드 생성 테스트만 진행했지만 전체적인 느낌은 상냥하고 친절하게 응답하는 스마트한 모델이라 생각되었습니다. 에르메스같은 에이전트 시스템에 얼마만큼 성공적으로 적용할 수 있을지 궁금합니다^^
*GLM-5.2모델이 VLM이 아닌 것은 많이 아쉽습니다.
https://www.youtube.com/shorts/cjwwLXKTEP0- YouTube
www.youtube.com
생성 파일들galaga.py0.01MBgalaga_deluxe.py0.01MB