1년 전
싱가폴의 SenseTime Research에서 그린스크린이 없어도 그린스크린으로 만들 수 있는 기술을 공개했습니다.
기존의 Segmentation들도 좋은 결과를 내는 모델이 많았지만, 해당 연구는 실용적으로 활용할 수 있도록 하기 위해 범위를 좁힌것이 매우 의미가 있다고 생각합니다.
MatAnyone의 연구의 핵심 사항을 3가지로 정리해보았습니다.
1️⃣ 일관된 메모리 전파(Consistent Memory Propagation) 모듈
이전 프레임의 정보를 적응적으로 통합하여 시각적 일관성을 유지
핵심 영역(semantic core)에서는 의미론적 안정성을 확보하고, 객체 경계(boundary)에서는 세밀한 디테일을 보존
"큰 변화"(large-change) 영역과 "작은 변화"(small-change) 영역을 구분하여 학습
2️⃣ 새로운 데이터셋 구축 (VM800 & YouTubeMatte)
기존 VideoMatte240K 데이터셋의 품질 한계를 극복하기 위해, 2배 이상 크고 다양한 VM800 데이터셋을 구축
보다 도전적인 평가를 위해 YouTubeMatte 데이터셋을 제작해 실험에 활용
3️⃣ 새로운 훈련 전략 도입
실제 세그멘테이션 데이터(segmentation data)를 활용한 학습 기법 도입
기존 방법들은 세그멘테이션 데이터를 병렬 헤드에서 학습했지만, MatAnyone은 동일한 헤드에서 학습하여 더 높은 의미론적 안정성 확보
인물을 타겟으로 한 연구이기 때문에, 핵심이 되는 안정적인 지점들은 이전 프레임의 결과를 그대로 가져오고, 경계지점의 세밀한 디테일들을 추론하는 방식을 활용하였습니다. 또한 단순히 픽셀을 1과 0으로 구분하는 것이 아니라, 투명도를 예측하여 자연스러운 경게선을 추출할 수 있는것이 강점입니다.
아직은 데모 영상만 나와있는 상태라 실제로 모델이 공개되면 더 자세한 내용을 알 수 있을것 같네요.
모델은 오픈소스로 2월중에 공개할 예정이라고 합니다!
참고: 📃 논문 링크
1.6천
0
0
2
0

당신의 생각을 들려주세요
2
0
1.6천
0
