주요 이미지 모델을 이제 지원합니다 · GPT-Image, Nano Banana, Seedream 등
블로그
가이드

GLM-5.3-FlashX 리뷰

FlashX가 파는 것은 입증된 새 지능 등급이 아니라 짧은 대기 시간입니다. 약 2.5배의 요금은 지연 시간에 민감한 경로에만 맞습니다.

약 12분OmniaKey
GLM-5.3-FlashXGLM-5.3-FlashAPI 지연 시간API 가격모델 리뷰

GLM-5.3-FlashX 리뷰는 더 빠른 호스팅 경로와 더 좋은 모델을 구분합니다. Z.ai는 200 tokens/s를 내세우지만 Flash와 FlashX의 동일 조건 품질 비교, 지연 시간 분포, 이 숫자의 측정 방법은 공개하지 않았습니다.

결론은 간단합니다. 사람이 긴 스트리밍 응답이나 대화형 도구 루프를 기다리는 경우 FlashX를 시험할 가치가 있습니다. 배치, 백그라운드 Agent, 오프라인 평가에서는 token당 약 2.5배의 비용을 정당화하기 어려우므로 일반 Flash가 기본값입니다.

팩트 체크: 2026년 9월 19일. Z.ai의 모델 문서, API 가격표, 출시 글, 공개 모델 카드와 일반 GLM-5.3-Flash에 대한 Artificial Analysis 데이터를 확인했습니다. 유료 FlashX 자격 증명이 없어 직접 지연 시간 테스트를 실행하지 않았으며, 200 tokens/s를 독립 측정 결과로 제시하지 않습니다.

먼저 보는 결론

  • FlashX 우선 시험: 대화형 코딩, 실시간 조사, Computer Use, 고객용 assistant, 긴 스트리밍 출력.
  • 일반 Flash 유지: 큐 작업, 문서 추출, 야간 리뷰, 합성 데이터, 대규모 자동화.
  • 품질만으로 전환하지 않기: Z.ai는 별도의 FlashX checkpoint나 동일 조건 품질 우위를 공개하지 않았습니다.

FlashX와 Flash 핵심 비교

판단 항목GLM-5.3-FlashXGLM-5.3-Flash
API 모델 IDglm-5.3-flashxglm-5.3-flash
문서상 역할더 빠른 호스팅 경로저렴한 호스팅 경로와 공개 weight
속도 근거Z.ai의 200 tokens/s, 방법 비공개Artificial Analysis 중앙값 98.6 tokens/s
입력 / 캐시 입력 / 출력1M token당 $0.37 / $0.075 / $1.25$0.15 / $0.03 / $0.50
컨텍스트 / 최대 출력1M / 128K token1M / 128K token
입력 형식동영상, 이미지, 텍스트, 파일동영상, 이미지, 텍스트, 파일
Thinking항상 활성화, 비활성화 불가항상 활성화, 비활성화 불가
GLM Coding Plan확인 시점에 미포함GLM-5.3의 3배 할당량으로 포함
공개 weight별도 checkpoint 없음zai-org/GLM-5.3-Flash, MIT

공유 문서는 두 경로의 공개 기능 계약이 같다는 근거입니다. 그러나 내부 serving, 출력 일관성, tool call, 오류율까지 같다는 증거는 아닙니다.

OmniaKey의 현재 가격과 경로 상태는 GLM-5.3-Flash 모델 페이지실시간 모델 카탈로그가 기준입니다. Z.ai에 glm-5.3-flashx가 있다고 해서 모든 gateway에서 같은 ID를 호출할 수 있는 것은 아닙니다.

200 tokens/s가 실제로 말해 주는 것

Z.ai는 200이 peak, mean, median 중 무엇인지, 지역과 prompt, 출력 길이, 동시 요청 수, reasoning token 포함 여부, p95를 설명하지 않습니다. Time to First Token도 공개하지 않았습니다.

text
종단 간 지연 시간
  = 큐 대기
  + prompt 처리와 첫 token
  + 생성 token / decode throughput
  + tool 및 network 시간

200 tokens/s가 완전히 유지된다고 가정하면 100 token은 0.5초, 1,000 token은 5초, 4,000 token은 20초의 decode 시간이 필요합니다. 이는 산술일 뿐 FlashX 측정값이 아닙니다. 짧은 응답은 첫 token, 매우 긴 prompt는 prefill이 지배할 수 있습니다.

독립 데이터는 일반 Flash에만 있다

Artificial Analysis가 Z.ai API의 일반 Flash에서 보고한 결과입니다.

지표일반 Flash 결과범위
Intelligence Index41.9독립 평가
출력 속도 중앙값98.6 tokens/sZ.ai API 표본
첫 chunk까지 중앙값2.43초Z.ai API 표본
Intelligence 평가 task당 비용$0.253평가 기관의 task 구성

이것은 FlashX 테스트가 아닙니다. Z.ai의 200을 제3자의 98.6로 나눠 “2.03배 빠르다”고 하면 방법, 날짜, workload, 트래픽 조건이 다른 수치를 섞게 됩니다.

Z.ai는 기반 Flash 모델에 Terminal-Bench 2.1 84.3, DeepSWE v1.1 63.4, NL2Repo 56.3, AutomationBench 48.8도 보고했습니다. 모두 vendor-run GLM-5.3-Flash 결과이며 FlashX 품질 향상의 증거가 아닙니다. 세대 비교는 GLM-5.3 대 GLM-5.2 코딩 비교를 참고하세요.

API 가격과 계산 예시

Z.ai 직접 API의 100만 token당 가격입니다.

모델입력캐시 입력캐시 저장출력
GLM-5.3-Flash$0.15$0.03기간 한정 무료$0.50
GLM-5.3-FlashX$0.37$0.075기간 한정 무료$1.25
GLM-5.3$1.40$0.26기간 한정 무료$4.40

FlashX는 일반 Flash보다 비캐시 입력이 2.47배, 캐시 입력과 출력이 정확히 2.5배 비쌉니다. “기간 한정 무료”는 캐시 저장 프로모션이며 캐시 입력 읽기 요금 면제가 아닙니다.

100K 비캐시 입력과 20K 출력의 비용은 Flash $0.0250, FlashX $0.0620, 전체 GLM-5.3 $0.2280입니다. 80K가 캐시되고 20K만 비캐시라면 $0.0154 / $0.0384 / $0.1368입니다. 비캐시 예시를 1,000번 실행하면 $25.00 / $62.00 / $228.00입니다.

FlashX의 추가 비용은 요청당 $0.037입니다. 인건비를 시간당 $30로 보면 약 4.4초에 해당합니다. 이는 손익 기준이지 FlashX가 실제로 4.4초를 줄인다는 측정 결과가 아닙니다.

아키텍처와 통합 제약

기반 GLM-5.3-Flash는 전체 320B, token당 18B 활성 parameter를 쓰는 45-layer 모델입니다. 30T-token 멀티모달 말뭉치로 학습했고 sparse attention과 linear attention을 결합합니다. Z.ai는 GLM-5.3 대비 attention 계산 3.01배, KV Cache 사용 4.44배 감소를 주장합니다. 이는 Flash 계열 속성이며 FlashX 전용 변경이 아닙니다.

일반 Flash weight는 MIT로 공개됩니다. 확인한 자료에서 FlashX는 hosted model ID로만 나타납니다. Thinking은 끌 수 없고, 대화형 권장 설정은 temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true, tool_stream: true입니다.

thinking.type: "disabled"를 보내는 client는 먼저 수정해야 합니다. reasoning_effort: max는 decode가 빨라도 reasoning token과 전체 시간을 늘릴 수 있습니다. 멀티모달 입력에는 크기, 형식, 개인정보, 보존 정책 검토가 필요합니다.

워크로드별 선택

워크로드먼저 시험할 경로이유
대화형 코딩 또는 디버깅FlashX사람이 reasoning, tool, 출력을 기다림
긴 답변의 고객 assistantp95 시험 후 FlashXtail latency가 체감 품질에 영향
Computer Use / Browser Use성공률 시험 후 FlashX각 turn이 다음 action을 막음
야간 리뷰 또는 CI 분석Flashtoken마다 기다리는 사람이 없음
대량 추출, 분류, 합성 데이터Flash대화형 이득 없이 2.5배 비용이 누적됨
실패 비용이 큰 어려운 작업Flash, FlashX, 전체 GLM-5.3 비교통과율이 속도와 단가보다 중요할 수 있음
GLM Coding PlanFlashFlashX는 현재 미포함

운영 라우터는 두 ID를 함께 쓸 수 있습니다. 대화형 critical path만 FlashX에 두고 retry, indexing, summary, 후처리는 일반 Flash에 남기세요.

제대로 비교하는 방법

  1. 짧은 작업, 긴 작업, tool-heavy, 멀티모달 task와 합격 조건을 고정합니다.
  2. 같은 prompt와 tool policy를 두 정확한 모델 ID에 보냅니다.
  3. 순서를 무작위화하고 지역과 시간대를 맞춥니다.
  4. 첫 chunk, decode speed, 종단 간 시간, p50/p95를 기록합니다.
  5. 입력, cache, reasoning, 출력 token과 실제 청구액을 기록합니다.
  6. 합격률, tool call, retry, 오류, 사람의 수정량을 평가합니다.
  7. 실제 동시성에서 반복해 분산을 확인합니다.

핵심 지표는 요구 지연 시간 안에서 합격한 task 하나의 총비용입니다. 모델과 Agent harness를 같이 평가해야 하는 이유는 코딩 Agent 모델 가이드(영문)에서 설명합니다.

최종 평가

GLM-5.3-FlashX는 GLM-5.3-Flash 계열의 유료 fast lane으로 이해하는 편이 정확합니다. 200 tokens/s는 매력적이고 대화형 요청당 추가 금액도 작을 수 있습니다. 하지만 새 지능 등급, 보장된 2배 속도, 종단 간 SLA를 입증하는 공개 증거는 없습니다.

대기 시간의 가치가 명확한 곳에서만 FlashX를 쓰고, 나머지는 일반 Flash를 비용 기준으로 유지하세요.

자주 묻는 질문

FlashX가 일반 Flash보다 더 똑똑한가요?

공개 증거는 없습니다. 공유 기능과 Flash 계열 benchmark는 있지만 동일 조건 품질 비교나 별도 FlashX checkpoint는 없습니다.

정말 200 tokens/s인가요?

Z.ai의 공식 표기입니다. 방법, percentile, 지역, 동시성, prompt 형태, 첫 token 시간은 비공개이며 이 리뷰도 독립 재현하지 않았습니다.

FlashX 가격은 얼마인가요?

100만 token당 비캐시 입력 $0.37, 캐시 입력 $0.075, 출력 $1.25로 일반 Flash의 약 2.5배입니다.

1M 컨텍스트와 이미지를 지원하나요?

예. 공유 문서에 1M 컨텍스트, 최대 128K 출력, 동영상·이미지·텍스트·파일 입력이 적혀 있습니다. 긴 컨텍스트가 낮은 지연 시간을 보장하지는 않습니다.

1차 출처

증거와 계산은 2026년 9월 19일에 확인했습니다. ID, 가격, Plan, 지연 시간, gateway 제공 여부는 바뀔 수 있으므로 운영 전환 전에 1차 출처와 동일 조건 시험을 다시 확인하세요.