30B가 로컬 멀티모달 에이전트로: Meta Muse Glimmer 공개

Meta가 이미지 이해·도구 호출·장기 작업을 겨냥한 30B 모델 Muse Glimmer를 Apache 2.0으로 공개했다.

로컬 에이전트를 겨냥한 30B 모델

Meta는 8월 10일 Muse Glimmer 30B를 공개했습니다. 공식 모델 카드 기준 약 296억 파라미터의 dense causal transformer와 약 18억 파라미터 perception encoder를 결합하며, 최대 131,072토큰 이상의 문맥과 텍스트·이미지 입력, 텍스트 출력을 지원합니다. 도구 호출, 다단계 추론, 실패 복구와 에이전트 실행을 주요 목적으로 내세웁니다.

모델은 Apache 2.0으로 배포되고 Transformers, llama.cpp, vLLM 등에 출시 당일 지원이 추가됐습니다. Meta는 4비트 계열 양자화로 언어 모델을 20GB 미만으로 줄여 24GB 또는 32GB 메모리 환경에서 실행할 수 있다고 설명합니다. 다만 실제 메모리와 속도는 문맥 길이, KV 캐시, 이미지 입력, 런타임과 양자화 방식에 따라 달라집니다.

공개 벤치마크를 읽는 법

Hugging Face 글에는 MCP Atlas, DeepSearch QA, SWE-Bench Pro 등 다수 결과가 제시되지만 Meta가 보고한 비교표입니다. 일부 평가에서는 앞서고 다른 평가에서는 Gemma4·Qwen3.6이 더 높아 단일 종합 우승으로 해석할 수 없습니다. 모델 카드가 지원 모달리티를 텍스트·이미지 입력으로 명시하므로, 영상 데모나 제3자 확장 기능을 기본 기능과 혼동해서도 안 됩니다.

활용 전 확인

로컬 문서 분석, 화면 이해와 개인정보 민감 작업의 후보지만 30B 모델은 여전히 상당한 메모리와 운영 역량이 필요합니다. Apache 2.0 라이선스와 별개로 입력 데이터 권리, 도구 권한, 프롬프트 인젝션 방어와 실제 업무 성공률을 자체 검증해야 합니다.

공식 출처