앤트로픽,
News

앤트로픽,

박찬 기자
2026.08.25
·News·by Homin.Lee
#AI#Anthropic#Cybersecurity#Mitos

핵심 포인트

  • 1앤트로픽(Anthropic)이 자사의 AI 모델 'Claude'에 적용된 '미소스 5(Mythos 5)' 기술의 활용 범위를 대폭 확대했습니다.
  • 2이번 업데이트는 AI 기술의 악용 가능성을 사전에 차단하여 보안성을 강화하는 데 초점을 맞추고 있습니다.
  • 3앤트로픽은 이를 통해 향상된 사이버 방어 능력을 제공하며 더욱 안전한 AI 생태계를 구축할 계획입니다.

앤트로픽(Anthropic)은 자사의 인공지능 모델인 'Claude' 시리즈에 적용되는 안전 및 방어 아키텍처인 'Mythos 5'의 적용 범위를 대폭 확대한다고 발표했습니다. 본 업데이트는 모델의 오남용을 방지하고, 급증하는 사이버 보안 위협으로부터 시스템을 보호하기 위한 다각적인 방어 전략을 골자로 합니다.

핵심 내용 및 방법론:

  1. 사이버 보안 방어 메커니즘 (Cybersecurity Defense):
'Mythos 5'는 모델의 출력물에 대한 실시간 모니터링 및 필터링 기능을 강화하여, 악성 코드 생성, 취약점 공격 스크립트 작성, 피싱(Phishing) 기법 시연 등 악의적인 요청을 사전에 차단합니다. 이는 입력 토큰의 의도(Intent)를 벡터화하여 임베딩 공간에서 공격적 패턴(PattackP_{attack})과 정상적 패턴(PnormalP_{normal})을 구분하는 정교한 분류 알고리즘에 기반합니다.

  1. 악용 차단 모델 (Abuse Prevention):
모델이 사회공학적 기법이나 기만적 정보를 생성하는 것을 방지하기 위해, 강화학습(Reinforcement Learning) 과정에서 안전성 가이드라인을 강제하는 보상 함수(RsafeR_{safe})를 최적화했습니다. 이를 통해 모델의 응답 생성 과정에서 발생하는 손실 함수(LL)를 다음과 같이 제어합니다.
L=Ltask+λRsafetyL = L_{task} + \lambda \cdot R_{safety}
여기서 LtaskL_{task}는 모델의 응답 성능을 결정하며, λ\lambda는 안전성 제약 조건의 가중치를 의미합니다.

  1. 적용 범위 확대 및 인프라:
이번 업데이트를 통해 API 사용자와 엔터프라이즈 환경에서의 사이버 방어 능력을 표준화했습니다. 특히, 텍스트 기반의 탐지 방식을 넘어, 다중 모달(Multimodal) 입력에 대해서도 동일한 보안 정책이 적용되도록 통합 아키텍처를 구축했습니다. 이는 대규모 언어 모델(LLM)이 잠재적 보안 사고의 매개체가 되는 것을 원천 차단하고, 기업 고객이 보다 안전하게 모델을 활용할 수 있도록 지원하는 데 목적이 있습니다.

결론적으로, 앤트로픽은 'Mythos 5'의 범위를 넓힘으로써 고도화된 AI 모델이 초래할 수 있는 보안 리스크를 효과적으로 통제하고, 신뢰성 있는 AI 생태계 구축을 목표로 하고 있습니다.