upstage/Solar-Open2-250B · Hugging Face
Service

upstage/Solar-Open2-250B · Hugging Face

2026.07.22
·Hugging Face·by Mineru
#LLM#AI#Large Language Model#Korean AI

핵심 포인트

  • 1Solar Open 2는 에이전트 워크플로우, 복잡한 추론 및 코딩 작업에 최적화된 250B 규모의 하이브리드 어텐션 Mixture-of-Experts(MoE) 모델입니다.
  • 2이 모델은 선형 어텐션을 결합한 하이브리드 아키텍처를 통해 추론 시 15B 파라미터만 활성화하여 매우 효율적인 연산 성능과 1M 토큰의 긴 컨텍스트 처리를 구현했습니다.
  • 3Tool calling과 다단계 추론에 특화되어 있으며, vLLM 환경에서 Claude Code 및 Hermes Agent와 같은 에이전트 도구와 원활하게 통합하여 활용할 수 있습니다.

Solar Open 2는 Upstage AI에서 개발한 250B 파라미터 규모의 Mixture-of-Experts (MoE) 기반 거대 언어 모델로, 에이전트 워크플로우, 오피스 생산성, 문서 기반 작업 및 코딩 최적화를 목적으로 설계되었습니다.

핵심 기술적 방법론

  1. Hybrid-Attention MoE 아키텍처
본 모델은 Softmax attention과 Linear attention을 조합한 하이브리드 구조를 채택했습니다. 구체적으로는 [Softmax, Linear×3] 패턴이 12회 반복되는 48개 레이어 구조로 이루어져 있습니다. Linear attention 층은 토큰의 순서 정보를 재귀적 상태(recurrent state)에 내재적으로 인코딩하여, 기존의 Rotary Positional Encoding (RoPE)을 완전히 제거한 NoPE (No Positional Encoding) 기법을 통해 1M 토큰 이상의 긴 문맥 처리 한계를 극복했습니다.

  1. 효율적 파라미터 운용
전체 250B 파라미터 중 토큰당 15B 파라미터만을 활성화하는 MoE 구조를 갖추고 있습니다. 총 321개의 전문가(320개 routed + 1개 shared) 중 Top-8 전문가와 공유 전문가 1개를 활성화하여 추론 효율을 극대화했습니다. 또한, 48개 레이어 중 12개 레이어에만 KV 캐시를 유지함으로써 메모리 점유율을 기존 Softmax 모델 대비 1/4 수준으로 낮추었습니다.

  1. 학습 효율성 및 지식 전이
학습 초기 단계에서 Solar Open 1(102B) 모델의 가중치를 선별적으로 전이(selective weight transfer)하는 방식을 사용했습니다. 전체 파라미터 중 약 2.3%의 유효 가중치만을 계승하고 나머지는 랜덤 초기화하여, 250B 규모의 대규모 모델임에도 불구하고 초기 수렴 속도를 비약적으로 향상시켰습니다.

에이전트 및 추론 최적화

Solar Open 2는 Tool Calling 및 다단계 추론에 최적화된 에이전트 특화 모델입니다. 추론 시 reasoning_effort 매개변수를 통해 모델의 사고 과정을 제어할 수 있으며, thinkrenderoption=preservedthink_render_option=preserved 설정을 통해 사고 과정을 명시적으로 보존합니다. 긴 문맥 처리를 지원하기 위해 최대 131,072 토큰의 추론 블록을 허용하며, vLLM 환경에서 expert-paralleltriton 백엔드 최적화를 통해 효율적인 서빙이 가능합니다.

성능 및 확장성

MMLU-Pro, GPQA-Diamond, SWE-Bench Verified 등 주요 에이전트 및 추론 벤치마크에서 최상위권의 성능을 기록하고 있으며, 특히 영어, 한국어, 일본어의 다국어 처리에 강점을 보입니다. 모델 배포 시에는 Upstage Solar License를 준수해야 하며, 파생 모델 생성 시 명칭 규칙(Solar 접두어 사용)과 출처 명시가 필수적입니다.