zai-org/GLM-5.3-Flash · Hugging Face
Feed

zai-org/GLM-5.3-Flash · Hugging Face

2026.08.26
·Hugging Face·by Mineru
#AI#LLM#Model

핵심 포인트

  • 1GLM-5.3-Flash는 320B 매개변수 규모의 GLM-5 시리즈 첫 네이티브 멀티모달 모델로, 18B의 활성 매개변수를 통해 우수한 효율성과 성능을 제공합니다.
  • 2하이브리드 아키텍처인 sparse-linear attention과 Manifold-Constrained Hyper-Connections(mHC)를 도입하여, 긴 문맥 처리 비용을 획기적으로 낮추고 확장성을 개선했습니다.
  • 330T 토큰의 멀티모달 코퍼스로 학습된 이 모델은 코딩 및 에이전트 벤치마크에서 기존 모델 대비 뛰어난 가성비와 강력한 지능을 보여줍니다.

GLM-5.3-Flash: 모델 개요 및 핵심 기술 요약

GLM-5.3-Flash는 GLM-5 시리즈의 최신 모델로, 효율성과 성능을 극대화한 네이티브 멀티모달(natively multimodal) 모델입니다. 총 320B의 파라미터를 보유하고 있으나, 실제 추론 시에는 18B의 파라미터만을 활성화(active parameters)하여 계산 비용을 획기적으로 줄인 구조를 갖추고 있습니다.

1. 핵심 아키텍처 및 방법론
본 모델은 기존 GLM-5.2 모델 대비 연산 효율성을 높이기 위해 다음과 같은 기술적 진보를 도입했습니다.

  • 하이브리드 어텐션(Hybrid Attention): Sparse Attention과 Linear Attention을 결합한 하이브리드 아키텍처를 도입했습니다. 이는 긴 문맥(long-context) 처리에 필요한 추론 비용을 대폭 절감하면서도 고정밀도 성능을 유지할 수 있게 합니다.
  • mHC (Manifold-Constrained Hyper-Connections): 모델의 확장 효율성(scaling efficiency)을 향상시키기 위해 매니폴드 제약이 가해진 하이퍼 커넥션 기술을 채택했습니다. 이를 통해 모델이 더 적은 컴퓨팅 자원으로 더 높은 수준의 지능을 구현할 수 있도록 설계되었습니다.
  • 멀티모달 학습: 약 30T 토큰 규모의 대규모 멀티모달 사전 학습 코퍼스를 기반으로 학습되었으며, 코드 생성 및 에이전트 작업(agentic tasks)에서 Claude Opus 4.8에 준하는 성능을 달성했습니다.

2. 벤치마크 및 성능 지표

  • DeepSWE: mini-swe-agent 하니스와 400K 문맥 길이를 활용하여 63.4%의 성능을 기록했습니다.
  • Terminal-Bench 2.1: Claude Code 2.1.207 환경에서 6시간 타임아웃 조건으로 평가하여 84.3의 점수를 획득했습니다.
  • HLE (HLE with tools): 300K 컨텍스트 관리 전략과 함께 GPT-5.6-luna를 판정 모델로 사용하여 55.3의 점수를 기록했습니다.

3. 추론 및 배포
본 모델은 효율적인 서빙을 위해 다음과 같은 프레임워크를 공식 지원합니다.

  • SGLang, vLLM, TokenSpeed, KTransformers 등을 통해 로컬 환경에서의 배포 및 추론이 가능하며, 사용자 맞춤형 최적화가 가능합니다.

4. 결론
GLM-5.3-Flash는 Vibe Coding에서 Agentic Engineering으로의 전환을 지향하며, 특히 긴 문맥 처리와 복잡한 에이전트 작업에서의 효율성을 극대화한 것이 특징입니다. 18B 활성 파라미터 구조는 기존 대규모 언어 모델 대비 경제성을 크게 개선하여, 고성능 AI 인프라의 새로운 기준을 제시합니다.