Blog
Qwen Studio
Qwen Team
2026.09.18
·Web·by igor#Agent#AI Model#Omnimodal AI#Productivity#Qwen
핵심 포인트
- 1Qwen3.8-Omni-Flash는 실시간 음성 및 영상 처리에 최적화된 차세대 네이티브 omnimodal 모델로, 1M-token context window를 지원하며 전작 대비 뛰어난 추론 성능과 비용 효율성을 제공합니다.
- 2이 모델은 Qwen-MM-Plugins와 Qwen-Live Harness를 통해 영상 편집, 회의 분석, 심층 연구와 같은 복잡한 long-horizon 워크플로우를 자율적으로 수행하는 agentic 기능을 강화했습니다.
- 3특히 Agentic Understanding 방식을 도입하여 긴 영상에서 필요한 정보만을 효율적으로 추출함으로써, 기존 방식 대비 높은 정확도를 유지하면서도 토큰 소비량을 45.7% 절감하는 성과를 달성했습니다.
Qwen3.8-Omni-Flash는 단순한 멀티모달 이해를 넘어 에이전트의 작업 계획, 도구 사용, 창의적 결과물 생성을 목표로 하는 차세대 네이티브 옴니모달 모델입니다. 본 모델은 1M-token의 문맥 창(context window)을 지원하며, 텍스트, 이미지, 오디오, 비디오를 통합적으로 처리하여 실질적인 생산성 시나리오에서의 에이전트 성능을 극대화합니다.
핵심 방법론 및 기술적 특징
- 에이전트 중심의 비디오 이해 (Agentic Long-Form Audio-Visual Understanding)
- 효율성 개선: OmniVideoBench 평가 결과, 기존 대비 토큰 소비량을 약 45.7% 절감()하면서도 정확도를 에서 로 향상시켰습니다.
- 통합된 옴니모달 프레임워크
- Qwen-MM-Plugins: 오디오-비디오의 실시간 인식, 도구 사용, 워크플로우 실행을 담당하는 확장 모듈로, 비디오 편집, 영상 번역, 영화 해설 등 장기 호라이즌 작업(Long-horizon tasks)을 지원합니다.
- Qwen-Live Harness: 지속적인 실시간 상호작용을 위한 런타임 환경으로, 대화 기억 관리, 상황 맥락 유지, 작업 위임 기능을 제공합니다.
- 고급 오디오-비주얼 추론 및 제어
- Controllable Captioning: 사용자가 출력의 형식, 상세 수준, 분석 항목(조명, 카메라 앵글, 캐릭터 동작 등)을 자유롭게 지정할 수 있는 제어형 캡셔닝 기능을 지원합니다.
- 심층 회의 분석: 다중 화자 인식과 영상 정보를 결합하여 화자 분리(Speaker Segmentation), 전사, ID 정렬을 수행하며, 모호한 대화 참조를 시각적 정보로 해결합니다.
- Deep Research: 비디오 내용을 기반으로 부족한 정보를 웹에서 다각도로 조사(이미지, 비디오, 문서 검색)하고, 병렬적 서브 에이전트(Parallel subagents)를 가동하여 전문적인 리포트를 작성합니다.
성능 및 경제성
- 모델 성능: 29개의 벤치마크에서 평균 25% 이상의 성능 향상을 보였으며, 특히 WildClawBench-MM에서 36.5점, AgenticVBench에서 22.3점의 점수 상승을 기록했습니다.
- 비용 최적화: API 가격 측면에서 오디오 입력 비용은 98%, 오디오-비주얼 입력 비용은 93% 이상 절감되었습니다.
- 벤치마크 지표: 의 DER(Diarization Error Rate)과 cpWER(concatenated minimum permutation Word Error Rate)이 각각 에서 수준으로 획기적으로 개선되었습니다.
결론적으로, Qwen3.8-Omni-Flash는 긴 오디오 및 비디오 데이터를 수동적 관찰 대상이 아닌, 에이전트가 환경을 이해하고 추론하며 능동적으로 작업을 수행하기 위한 핵심 미디어로 전환함으로써 옴니모달 에이전트 분야의 새로운 이정표를 제시합니다.