
Ox Alpha라는 이름으로 먼저 공개됐던 AI 모델의 정체가 밝혀졌습니다. Z.ai의 GLM 5.3 Flash인데요. 정식 공개일은 2026년 8월 26일입니다. 출시 정보 · Z.ai의 익명 테스트 설명
그런데 가격이 눈에 들어옵니다. 출력 100만 토큰당 GLM 5.2는 4.4달러, GLM 5.3 Flash는 0.5달러거든요. 요금이 낮은 만큼 성능도 낮을까 싶지만, 회사의 코딩·도구 사용 평가에서는 오히려 GLM 5.2보다 점수가 높습니다. 공식 가격표 · Z.ai 자체 평가
회사 평가만큼 실제로도 잘해줄까요? 직접 사용한 후기는 아니지만, 외부 평가와 먼저 써본 사람들의 사례를 모아봤습니다. 가격과 OpenRouter 순위는 2026년 9월 16일 확인 기준입니다.
가격을 놓고 보면 차이가 큽니다
같은 회사의 모델끼리 놓고 보죠. 월 구독료가 아닌, 사용한 토큰량에 따라 내는 API 요금입니다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GLM 5.3 | $1.40 | $4.40 |
| GLM 5.3 Flash | $0.15 | $0.50 |
Z.ai 공식 가격표 기준입니다. 앞서 처리한 입력을 재사용하는 캐시가 적용되면 Flash의 입력 요금은 100만 토큰당 $0.03입니다. 공식 가격표
캐시 없이 입력과 출력을 각각 100만 토큰씩 쓴다고 가정하면, GLM 5.2는 5.8달러이고 Flash는 0.65달러입니다. 같은 토큰량에서는 약 89% 저렴합니다. 세금과 별도 도구 비용 등을 제외한 계산입니다.
OpenRouter의 DeepInfra 경로에는 50% 할인된 입력 $0.075, 출력 $0.25도 보였습니다. 공급자 할인 요금이니 공식 기본가와 구분해서 보면 됩니다. OpenRouter 공급자별 가격
API로 코드를 고칠 때는 수정할 코드와 설명을 다시 보내고, 새 답변을 받는 만큼 요금이 붙습니다. 입력과 출력이 모두 이 정도로 저렴해지면, 막힌 부분을 다른 구현 방식으로 다시 시도해볼 부담도 덜하겠네요.
직접 내려받아 돌리는 비용은 별개입니다. MIT 라이선스로 공개됐지만, 총 3,200억 파라미터 중 토큰마다 약 180억 개를 활성화하는 MoE 모델이거든요. 계산에 쓰지 않는 가중치도 담을 공간은 필요해서, 기본 FP8 가중치만 약 306GiB이고 실행 메모리는 더 듭니다. Flash라는 이름처럼 가벼운 로컬 모델은 아닌 셈이죠. 공식 모델 카드 · vLLM 실행 자료
OpenRouter 사용량 표에서는 4위입니다

9월 16일 확인한 OpenRouter 기본 사용량 표에서 GLM 5.3 Flash는 4위였습니다. GPT-5.6 Luna, Hy4 preview, DeepSeek V4 Flash 0731 다음입니다. OpenRouter 순위
입력·출력 토큰량으로 정한 순위라 성능이나 사용자 수 순위는 아닙니다.
데이터 기준일이 9월 15일인 기본 표를 확인했습니다. 선택된 집계 기간을 확인하지 못해 일간·주간 순위로 구분하지 않았습니다.
이 표로 알 수 있는 것은 토큰 사용량 순위까지입니다. 어떤 결과를 만드는지는 사용자 사례 쪽이 더 구체적인데요. 참고 이미지를 주고 게임을 만든 과정도 있었습니다.
이미지를 보고 만드는 작업까지

GLM 5.3 Flash는 글뿐 아니라 이미지와 영상도 입력으로 받고, 약 100만 토큰급 문맥을 다룹니다. 실제 한도와 지원 방식은 사용하는 API 공급자에 따라 달라집니다. NVIDIA 모델 설명
화면을 만드는 일이라면 이 기능이 꽤 반갑죠. 버튼 위치나 여백, 참고 이미지와 다른 부분을 글로 하나씩 설명하는 대신 화면을 보여줄 수 있으니까요.
한 사용자는 GLM 5.3 Flash와 Qwen 3.8 Flash Next에 참고 이미지를 주고 비슷한 게임이나 기술 데모를 만들도록 요청했습니다.
그 사용자는 GLM이 구도와 세부 표현을 더 잘 따라갔다고 평가했습니다. 오류 수정까지 거쳐 약 23만 8천 토큰, 두 시간 정도에 플레이 가능한 픽셀아트 결과물을 만들었다고 합니다. 이미지로 게임을 만든 사용자 사례
다만 Qwen은 렌더러를 직접 만들었고 GLM은 Canvas 2D를 썼습니다. 양자화와 실행 환경도 달라, 댓글에서도 같은 조건의 비교는 아니라는 지적이 나옵니다.
두 시간에 약 23만 8천 토큰. 한 번에 끝난 작업은 아니었네요. 이런 식으로 결과를 보고 여러 번 고치는 작업이라면, 앞서 본 낮은 토큰 단가의 이점이 커지겠죠.
점수는 높은데, 기다리는 시간은 어떨까요
Z.ai 자체 평가에서 GLM 5.2 대비 소프트웨어 작업 평가인 DeepSWE v1.1은 46.2→63.4, 도구 사용 평가인 Toolathlon Verified는 59.9→78.4로 올랐습니다. 가격을 낮추면서 이 점수들은 높아진 셈이죠. Z.ai 자체 평가
외부 평가기관인 Artificial Analysis의 비교에서는 다른 차이도 보입니다.
| 항목 | GLM 5.3 Flash | DeepSeek V4 Flash 0731, max |
|---|---|---|
| 종합 지능 평가, Intelligence Index v4.3 | 42 | 35 |
| API 출력 속도 | 107 tokens/s | 214 tokens/s |
9월 15일 확인한 값이며, DeepSeek 비교 대상은 V4.1이 아닌 V4 Flash 0731 버전입니다. Artificial Analysis 비교
종합 점수는 GLM이 높고, 출력은 DeepSeek가 빠르네요. 코드를 조금 고칠 때마다 답을 기다린다면 이 속도 차이가 쌓일 겁니다. 일을 맡겨두고 다른 작업을 할 수 있다면 덜 불편할 수도 있고요.
평가기관의 API 측정값이며, OpenRouter 공급자별 속도는 다릅니다. 가장 싼 경로에서 같은 속도가 나온다는 뜻은 아니에요.
Artificial Analysis에 따르면 Flash는 평가 중 비교군 중앙값보다 많은 출력 토큰을 썼습니다. 앞서 계산한 89% 차이가 모든 작업에 적용되지는 않겠죠. 얼마나 길게 답하고 재요청이 생기는지에 따라 최종 비용이 달라집니다. Artificial Analysis 모델 분석
고치는 과정에서 불편했다는 사람도 있습니다
GLM 5.3 Flash를 서버 설정 작업에 쓴 한 사용자는 같은 대화 안에서도 접근법이 바뀌고, 말하지 않은 내용을 임의로 가정하거나 지우면 안 되는 설정을 삭제했다고 적었습니다. 해당 사용자의 경험담이며, 같은 실패를 직접 재현해보지는 않았습니다. 서버 설정 작업에 대한 불만
잘못 만든 부분에 더해 원래 되던 설정까지 찾아 복구해야 한다면, 가격이 싸다고 넘기기는 어렵습니다.
OpenRouter 사용 경험을 묻는 글에서도 반응이 갈립니다. 원문에는 맥락을 놓친다는 불만이, 댓글에는 코딩에 잘 쓰고 있고 저렴해서 좋다는 평가가 있었습니다. 긍정적인 댓글에서도 속도는 느리다고 덧붙였고요. 상반된 사용 경험
몇 사례를 전체 여론으로 볼 수는 없습니다. 다만 다음 수정에서 요청하지 않은 곳까지 바뀐다면, 처음에 잘됐던 부분도 다시 확인해야 합니다.
주가 급락과 50억 달러 조달 계획

Z.ai 소식에는 모델 가격만큼 눈에 띄는 숫자가 하나 더 있습니다. 약 50억 달러의 추가 자금조달 계획입니다. 주가가 크게 내려온 와중에 나온 소식인데요. 다만 회사의 재무 소식만으로 저렴한 API가 적자 판매인지, 주가 하락이 모델 성능 때문인지 알 수는 없습니다.
SCMP에 따르면 Z.ai, 즉 즈푸AI의 주가는 6월 22일 장중 2,980홍콩달러까지 올랐다가 9월 11일 종가 793홍콩달러로 내려왔습니다. 고점 대비 약 73% 하락입니다. 앞서 많이 오르기도 해서 당시 가격은 여전히 1월 상장 가격의 약 일곱 배였다고 합니다. SCMP 보도
9월 14일에는 할인 신주 발행 소식 뒤 장중 최대 10.5% 떨어졌다는 Reuters 보도도 나왔습니다. Reuters 보도
약 20억 달러는 신주 발행, 약 30억 달러는 조건에 따라 주식으로 바꿀 수 있는 전환사채입니다. 신주 발행가는 714홍콩달러로 9월 11일 종가보다 약 10% 낮았습니다. 홍콩거래소 공시
회사는 순조달액의 약 60%를 차세대 GLM과 학습 시스템, 컴퓨팅 인프라 등에 쓸 계획이라고 밝혔습니다. 9월 13일 공시상 신주 납입 예정일은 조건 충족 시 9월 16일이며, 여기서는 납입 완료 여부까지 확인하지 않았습니다. 자금 사용 계획과 일정
반복해서 코드를 고칠 때 요청 비용을 낮춰준다는 점에서 GLM 5.3 Flash는 매력적입니다. 다만 원래 되던 설정까지 복구해야 한다면, 단가에서 아낀 만큼 사람이 더 일하게 될 수도 있겠죠. 지금 확인한 자료로는 저렴한 요금은 분명하지만, 수정한 코드를 확인하는 수고까지 줄었다고 말하기는 어렵네요.