Meta, 에이전트 기반 이미지·영상 생성 모델 'Muse' 공개
Meta 슈퍼인텔리전스랩스(Meta Superintelligence Labs)가 2026년 7월 7일 새로운 멀티미디어 생성 모델 'Muse Image'와 'Muse Video'를 공개했다. Muse Image는 즉시 Meta AI, meta.ai, 미국 내 인스타그램 스토리, 일부 국가 WhatsApp에서 사용 가능하며 Facebook 지원도 예정되어 있다.
Muse Image의 핵심은 기존 프롬프트-이미지 직접 변환 방식이 아닌 에이전트(agent) 아키텍처다. 모델이 코딩·검색 등 외부 도구를 활용하고, 출력 결과를 스스로 평가한 뒤 부족한 부분을 수정하거나 재생성하는 자기 정제(self-refinement) 능력이 학습 과정에서 자연스럽게 발현됐다. 이 덕분에 정확도가 높은 QR코드 생성, 실시간 웹 정보를 반영한 이미지 제작 등이 가능하다.
성능 면에서는 독립 평가 플랫폼 Arena의 텍스트-이미지 생성, 단일 이미지 편집, 다중 이미지 편집 세 부문 모두에서 2위(2026년 7월 5일 기준)를 기록했다. 추론 시간을 늘릴수록 성능이 로그 선형(log-linear) 비율로 향상되는 테스트-타임 컴퓨팅 스케일링도 확인됐다.
또한 Meta는 조작 추적을 위한 보이지 않는 워터마킹 기술 'Content Seal'을 적용했다. 이 워터마크는 잘라내기, 압축, 크기 조정에도 살아남으며 탐지 도구를 별도 제공한다.
Muse Video는 현재 얼리 프리뷰 단계로 텍스트-영상 생성 Arena 3위를 기록하고 있다. 개발 초점은 오디오-영상 동기화와 물리적으로 정확한 모션 렌더링에 맞춰져 있다.