AI

메타, Muse Glimmer 공개 — GPU 하나로 실행되는 300억 매개변수 AI 에이전트

Adrian Kessler

메타가 300억 개의 파라미터를 가진 AI 에이전트를 일반 소비자용 하드웨어에서 전적으로 구동되도록 만들었고, 그 소스 코드를 무료로 공개했다. ‘뮤즈 글리머(Muse Glimmer)’라는 이름의 이 모델은 사용자의 작업을 메타 서버로 라우팅하지 않는다. 사용자 자신의 GPU에서 로컬로 실행되며, 양자화된 메모리 사용량이 18~20GB에 불과해 현재 고성능 소비자용 그래픽 카드의 범위 내에서 작동한다.

이 점이 중요한 이유는, 지난 2년간 Ollama 라이브러리를 채웠던 이전 세대의 로컬 모델들(70억, 130억 파라미터 변종)은 괜찮은 텍스트 생성기였지만 자율 에이전트로서는 형편없었기 때문이다. 이들은 다단계 추론, 중간에 실패하는 도구 호출, 세 단계 전에 무슨 일이 있었는지 기억해야 하는 작업에 어려움을 겪었다. 뮤즈 글리머는 바로 그러한 워크플로, 즉 코딩, 함수 호출, 일정 관리, 파일 정리, 그리고 도구 호출이 끊겨도 자동으로 복구되는 다단계 작업 시퀀스를 위해 특별히 설계되었다.

기본 아키텍처는 메타가 지난달 API 액세스를 판매하기 시작한 상용 모델인 뮤즈 스파크(Muse Spark)를 증류한 것이다. 로짓 증류와 강화 학습을 통해 회사는 자사의 폐쇄형 플래그십 모델을 24GB GPU(RTX 5090, Apple M5 Max, M4 Max)에 맞는 형태로 압축했다. 추측 디코딩은 처리량을 더욱 높여준다. RTX 5090은 이를 적용하지 않았을 때보다 모델을 3.1배 빠르게 실행하고, M5 Max는 1.8배, M4 Max는 1.5배 빠르게 실행한다. 실제로 이 차이는 반응성이 느껴지는 에이전트와 인내심이 필요한 에이전트를 가르는 기준선이다.

이 모델은 텍스트와 이미지(스크린샷, 문서, 혼합 콘텐츠 입력)를 혼합하여 처리하며, 100개 이상의 언어에서 작동한다. 또한 로컬 AI 사용자들이 이미 사용 중인 프레임워크(Ollama, LM Studio, llama.cpp, MLX)에 기본적으로 연결된다. 이미 Hugging Face에서 모델을 가져와 하드웨어에서 실행하고 있다면, 뮤즈 글리머는 추가 도구 없이 그 워크플로에 바로 들어간다.

라이선스는 Apache 2.0으로, 상업적 제한이 없다. 개인, 기업, 연구자 모두 메타에 비용을 지불하지 않고 사용할 수 있다. 이는 개발 작업조차 토큰당 비용을 지불해야 하는 OpenAIAnthropic의 모델과는 다른 범주에 속한다. 규모 면에서 가장 가까운 오픈 가중치 경쟁사인 Google의 Gemma4-31B 및 Alibaba의 Qwen3.6-27B와 비교하여, 메타는 뮤즈 글리머가 에이전트 및 일반 언어 모델 벤치마크에서 크기 대비 강력하다고 주장하지만, 어떤 작업에서 우위를 점하는지에 대한 구체적인 주장은 하지 않는다.

하드웨어 임계값은 여전히 까다롭다. 18GB의 모델 가중치를 GPU에 맞추는 것은, 어떤 GPU가 필요한지 계산해보기 전까진 쉬워 보인다. RTX 5090의 현재 가격은 2천 달러가 훌쩍 넘는다. Apple M5 Max 기기는 3천 달러 근처에서 시작한다. 이는 특정 소득 계층을 위한 로컬 AI일 뿐, 대부분의 사용자에게 클라우드를 대체할 수 있는 것은 아니다. 또한 양자화된 버전은 뮤즈 스파크의 충실도가 낮은 형제다. 상용 모델의 훈련 신호를 물려받았지만, 상용 모델 자체는 아니다. 메타는 더 높은 성능의 버전에 대한 액세스를 계속 판매하고 있다.

이번 릴리스에서 달라진 점은 로컬 모델의 ‘유능한 에이전트’ 계층이다. 자율 작업 완료를 위해 훈련된 300억 파라미터 모델을 실행하는 것은, 동일한 파라미터 수의 채팅 모델을 실행하는 것과 다르다. 그 차이는 모델이 도구 실패와 다단계 시퀀스를 어떻게 처리하는지에 달려 있으며, 단일 문장을 얼마나 잘 완성하는지에 있지 않다.

가중치는 8월 10일부터 Apache 2.0 라이선스 하에 Hugging Face에서 제공된다. 메타는 AMD, Arm, Dell, Intel, Nvidia와의 디바이스 수준 최적화 파트너십을 확인했으며, 특정 하드웨어 구성을 위한 추가 튜닝 빌드도 뒤따를 예정이다. 로컬 AI 커뮤니티는 모든 주요 릴리스 때와 마찬가지로 며칠 내로 이 모델을 스트레스 테스트할 것이다. 해당 커뮤니티의 벤치마크 결과는 오늘로부터 2주 이내에 뮤즈 글리머의 실제 위치에 대한 더 명확한 그림을 제공할 것이다.

태그: , , , , ,

토론

댓글 0개가 있습니다.