기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

홍콩대, 편집·생성 이미지에서도 같은 대상의 대응점을 찾는 'FreeMatching' 공개

홍콩대학교(The University of Hong Kong) 소속 Luping Liu 등 연구자 4명이 'FreeMatching(프리매칭)'이라는 밀집 대응 매칭(dense correspondence matching) 프레임워크를 제안했다. FreeMatching은 이미지를 편집하거나 참조 이미지를 바탕으로 새로 생성한 결과물에서도 같은 대상의 대응 지점을 찾아내는 것을 목표로 한다. 사전공개 논문 저장소 arXiv에 올라온 논문 「Beyond Spatio-Temporal Priors: A Generalizable Approach for Dense Correspondence Matching」(arXiv:2610.12421)의 저자 초록에 따르면, FreeMatching 모델 하나로 까다로운 편집·생성 이미지 쌍의 대응 품질을 크게 끌어올렸다. 기존 벤치마크에서도 경쟁력 있는 성능을 유지했다고 한다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 32회를 받았다.


밀집 대응 매칭은 두 이미지 속 지점들이 서로 어디에 해당하는지를 촘촘하게 연결하는 작업이다. 저자들은 이 분야가 그동안 '시공간 사전 가정(spatio-temporal priors)'에 묶여 있었다고 지적했다. 시공간 사전 가정이란 물체가 매끄럽게 움직이고 형태가 단단하게 유지된다고 보는 단순화된 전제를 말한다. 이런 가정은 고전적인 과제에서는 잘 통했다. 하지만 저자들은 이미지 편집 및 참조 기반 생성(IEG, image editing and reference-guided generation) 영역에서는 이 가정이 무너진다고 설명했다. IEG에서는 대상의 시각적 정체성은 그대로 두면서 물리적 연속성은 깨뜨리는 변환이 일어나기 때문이다. 예를 들어 같은 인물이나 사물이 전혀 다른 장면과 자세로 다시 그려지는 경우, 움직임이 매끄럽다는 전제로는 두 이미지를 연결하기 어렵다.


연구진은 이런 변환을 거친 뒤에도 정체성이 유지되는 대응 관계를 찾기 위해 두 종류의 기반 모델 표현을 결합했다. 하나는 생성(generative) 파운데이션 모델, 다른 하나는 의미(semantic) 파운데이션 모델의 표현이다. 학습에는 성격이 다른 여러 감독 신호를 함께 썼다. 기존 고전 데이터셋, 추적(tracking) 정보가 붙은 영상, 합성 장면이 그것이다. 여기에 교사 모델이 이끄는 반복 정제(teacher-guided iterative refinement) 기법을 더했다. 이를 통해 IEG 영역에 밀집 대응 정답 주석이 없어도 대응 품질을 높일 수 있었다고 저자들은 밝혔다. 편집·생성 이미지 쌍마다 사람이 대응점을 일일이 표시하기는 사실상 어렵다. 그래서 이 부분이 방법론의 핵심으로 보인다.


저자들은 FreeMatching을 매칭 도구로 쓰는 데 그치지 않고 평가 지표로도 활용할 수 있다고 제시했다. 생성 결과물이 원본 대상의 정체성을 얼마나 보존했는지 수치로 측정하는 정량 지표로 쓸 수 있으며, 그 점수가 사람의 판단과 상관관계를 보였다는 것이다. 참조 이미지 속 캐릭터나 제품을 유지한 채 새 이미지를 만드는 기능은 이미지 생성 AI의 주요 활용처로 꼽힌다. 다만 '얼마나 똑같이 유지됐는가'를 객관적으로 재는 방법은 아직 마땅치 않았다. 이번 제안은 이 빈자리를 겨냥한 것으로 볼 수 있다.


연구진은 코드를 깃허브(github.com/luping-liu/FreeMatching)에 공개했다. 다만 이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 초록에는 구체적인 성능 수치와 비교 대상 모델, 사람 판단과의 상관 정도가 제시되지 않아 개선 폭이 어느 정도인지는 확인되지 않았다. 이 기사는 저자가 공개한 초록을 바탕으로 정리했다.