본문 바로가기
딥러닝

[논문리뷰] 사람이 없어도, 그린스크린이 없어도 완벽한 영상 분리가 가능할까? — MatAnyone: Stable Video Matting with Consistent Memory Propagation

by 카이스토 2026. 9. 20.

왜 이 논문에 주목해야 하는가

영상 편집을 해본 사람이라면 한 번쯤 배경 제거의 어려움을 겪어봤을 것이다. 사진 한 장에서 인물을 오려내는 것도 쉽지 않은데, 영상에서는 프레임마다 조명, 자세, 배경이 계속 바뀌기 때문에 문제가 훨씬 복잡해진다. 특히 그린스크린 없이 일반적인 실내외 환경에서 촬영한 영상에서 사람만 깔끔하게 분리하는 작업, 즉 비디오 매팅(video matting)은 여전히 어려운 연구 주제다.

2025년 CVPR에 발표된 MatAnyone: Stable Video Matting with Consistent Memory Propagation은 이 문제를 정면으로 다룬다. 저자는 Nanyang Technological University S-Lab 소속의 Peiqing Yang, Shangchen Zhou, Jixin Zhao, Chen Change Loy와 SenseTime Research 소속의 Qingyi Tao로, arXiv에는 2025년 1월 24일 처음 공개되었고 이후 3월에 개정판이 올라왔다(arXiv:2501.14677).

기존 비디오 매팅의 한계

기존의 보조 정보 없는(auxiliary-free) 비디오 매팅 기법들은 입력 프레임만 보고 전경과 배경을 분리해야 한다. 문제는 이런 방식이 배경이 복잡하거나 카메라가 흔들리거나 인물의 자세가 급격히 바뀌는 실제 영상에서 불안정해진다는 점이다. 한 프레임에서는 손끝이나 머리카락 같은 미세한 경계가 잘 표현되다가도, 바로 다음 프레임에서 갑자기 실루엣이 흐트러지거나 배경의 일부가 전경으로 잘못 인식되는 식의 깜빡임(flickering) 현상이 흔히 나타난다. 즉 "디테일을 살리는 것"과 "시간적으로 안정적인 결과를 유지하는 것" 사이에서 균형을 잡기가 매우 어려웠다는 것이 이 논문이 지적하는 핵심 문제의식이다.

MatAnyone의 핵심 아이디어: 일관된 메모리 전파

MatAnyone이 제안하는 해결책의 이름은 논문 제목에도 드러나듯 '일관된 메모리 전파(consistent memory propagation)'다. 구체적으로는 영역 적응형 메모리 융합(region-adaptive memory fusion)이라는 모듈을 도입해, 이전 프레임의 정보를 다음 프레임으로 넘길 때 영역별로 다르게 처리한다.

쉽게 말해, 인물의 몸통처럼 형태가 비교적 명확하고 안정적인 '핵심 영역'에서는 이전 프레임의 의미적 정보를 강하게 유지해 결과가 튀지 않도록 하고, 반대로 머리카락이나 옷의 가장자리처럼 경계가 미세하고 프레임마다 변화가 큰 영역에서는 현재 프레임의 세부 정보를 더 적극적으로 반영한다. 이렇게 영역에 따라 메모리를 다르게 융합함으로써, 전체적으로는 안정적이면서도 경계 디테일은 놓치지 않는 결과를 만들어내는 것이 이 방법의 핵심이다.

데이터와 학습 전략의 개선

MatAnyone은 모델 구조뿐 아니라 데이터와 학습 방식에서도 개선을 시도한다. 저자들은 기존보다 더 크고 다양한 고품질 비디오 매팅 데이터셋을 새로 구축해, 다양한 실제 환경과 인물 유형을 학습에 포함시켰다.

또한 대규모 세그멘테이션(segmentation) 데이터를 함께 활용하는 새로운 학습 전략을 제안한다. 매팅용 정밀 라벨 데이터는 만들기 어렵고 양이 제한적인 반면, 세그멘테이션 데이터는 상대적으로 풍부하게 구할 수 있다는 점에 착안해, 매팅의 세부 표현을 다듬는 손실 함수와 의미적 일관성을 강화하는 손실 함수를 분리해 학습에 적용했다. 이를 통해 라벨이 제한적인 매팅 데이터의 한계를 세그멘테이션 데이터로 보완하면서도 안정성을 높였다고 설명한다.

실험 결과와 실제 적용 사례

논문과 프로젝트 페이지에서는 MatAnyone이 다양한 실제 촬영 영상, AI로 생성된(AIGC) 영상, 게임 화면 등 폭넓은 시나리오에서 기존 방법들보다 안정적이고 정확한 매팅 결과를 보여준다고 밝히고 있다. 다만 공개된 논문 초록과 프로젝트 페이지 내용만으로는 DAVIS 등 특정 벤치마크에서의 정량적 수치(MAD, MSE, Grad 등 구체적 지표 값)는 확인되지 않았다. 이 부분은 논문 본문이나 공식 코드 저장소를 통해 추가로 검증이 필요한 부분이다.

정성적으로는 복잡한 배경, 빠르게 움직이는 인물, 부분적으로 가려지는 상황 등에서도 이전 프레임과의 일관성을 유지하면서 경계 디테일을 살리는 결과를 확인할 수 있으며, 특히 기존 방법들이 자주 겪는 프레임 간 깜빡임 문제가 눈에 띄게 줄어든 사례들이 공식 프로젝트 페이지의 데모 영상을 통해 소개되고 있다.

정리하며

MatAnyone은 "보조 정보 없이도 안정적인 비디오 매팅이 가능한가"라는 질문에 메모리 전파 방식을 정교하게 설계하는 것으로 답을 시도한 연구다. 핵심 영역과 경계 영역을 구분해 메모리를 다르게 융합한다는 아이디어 자체는 단순하지만, 실제로 시간적 안정성과 디테일 보존이라는 상충하는 목표를 동시에 달성하려는 시도로서 의미가 있다. 여기에 대규모 세그멘테이션 데이터를 끌어와 학습 데이터의 한계를 보완한 점도 실용적인 접근으로 평가할 수 있다.

영상 편집, 배경 합성, AI 콘텐츠 제작 등에서 정교한 인물 분리가 점점 더 중요해지는 만큼, 이런 방향의 연구는 앞으로도 실무에 빠르게 스며들 가능성이 높다. 다만 이 글에서 다루지 못한 구체적인 정량 비교나 실패 사례, 연산 비용 등은 원 논문(arXiv:2501.14677)과 공식 프로젝트 페이지, 코드가 공개되어 있다면 그 저장소를 함께 확인하는 것을 권한다.

댓글