Service
thinkingmachines/Inkling-Small · Hugging Face
2026.07.31
·Hugging Face·by Mineru#Image-to-Text#LLM#Multimodal#Transformers
핵심 포인트
- 1Inkling-Small은 텍스트, 이미지, 오디오를 통합적으로 처리하는 276B 파라미터 규모의 다중 모달(Multimodal) Mixture-of-Experts(MoE) 모델입니다.
- 2이 모델은 42개의 디코더 전용 레이어를 사용하여 SWE-bench 및 AIME 2026과 같은 고난도 벤치마크에서 우수한 성능을 입증하며, 개발자를 위한 에이전트 및 코딩 도구로 최적화되었습니다.
- 3개발자는 오픈 웨이트로 공개된 이 모델을 활용해 연구나 제품 개발을 수행할 수 있으며, 안전한 운영을 위해 Llama Guard와 같은 외부 조정 도구를 보조적으로 결합하는 것이 권장됩니다.
Inkling-Small은 다중 모달(Multimodal) 입력을 처리하고 텍스트를 생성하는 범용 디코더 전용(decoder-only) 트랜스포머 모델입니다. 이 모델은 276B의 총 파라미터와 12B의 활성화 파라미터를 갖춘 Mixture-of-Experts (MoE) 아키텍처를 기반으로 설계되었습니다.
핵심 방법론 및 기술적 구조
- 아키텍처: 42개의 레이어로 구성된 트랜스포머 구조로, 각 토큰은 256개의 전문가(expert) 중 6개와 모든 토큰에 활성화되는 2개의 공용 전문가(shared experts)를 통해 처리됩니다. 어텐션 레이어는 로컬과 글로벌 계층이 결합된 하이브리드 방식을 채택하고 있습니다.
- 멀티모달 통합: 이 모델은 태생적으로 멀티모달하게 설계되었습니다. 이미지는 계층적 패치 인코더(hierarchical patch encoder)를 통해, 오디오는 이산 토큰 인코딩(discrete token encoding)을 통해 표현됩니다. 서로 다른 모달리티의 입력값들은 모두 공유된 잠재 공간(shared hidden space)으로 투영되어 디코더에서 통합적으로 처리됩니다.
- 수치 정밀도 및 하드웨어: BF16 및 NVFP4 정밀도를 지원하며, 효율적인 추론을 위해 SGLang, vLLM 등 다양한 오픈 소스 라이브러리와 호환됩니다.
학습 데이터 및 훈련 과정
훈련 데이터는 텍스트, 이미지, 오디오, 비디오 등 광범위한 공개 데이터와 제3자 소스, 합성 데이터로 구성되었습니다. 데이터 정제 과정에서는 중복 제거 및 필터링을 통해 저품질 데이터를 배제하고 안전성을 향상시켰습니다.성능 및 평가
- 주요 벤치마크: SWE-bench Verified(80.2%), GPQA Diamond(89.5%), AIME 2026(95.5%) 등 에이전트 및 추론 태스크에서 우수한 성능을 입증했습니다. 특히 수학 및 과학 추론 벤치마크에서 대규모 모델과 견줄 만한 성과를 보였습니다.
- 안전성 및 한계: 적대적 공격 및 잠재적 위험을 평가하기 위해 강력한 레드팀(red-teaming) 테스트를 수행했습니다. 모델은 일상적인 대화에서 긍정적인 성능을 보이지만, 여전히 환각(hallucination) 문제나 특정 언어/도메인에서의 성능 편향이 존재할 수 있습니다.