기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

AI

KAIST 연구진, 영상 생성 AI 처리 토큰 8분의 1로 줄이는 압축 기법 'GRACE' 공개…생성 지연 11.1배 단축

KAIST AI 소속 Jiyoung Kim 등 연구진 8명이 사전공개 논문 저장소 arXiv에 논문 「GRACE: Generation-aware latent compression for efficient video generation」(arXiv:2610.10524)을 공개했다. 이 논문은 이미 학습을 마친 영상 생성 모델을 처음부터 다시 학습시키지 않고도 영상을 더 빨리 만들 수 있는 압축 기법을 제안한다. 연구진은 140억 파라미터 규모의 이미지-영상 변환 모델 'Wan2.1-I2V-14B'에 이 기법을 적용했다. 그 결과 모델이 처리하는 토큰 수는 8분의 1로 줄었고, 생성 지연시간은 11.1배 짧아졌다고 밝혔다.


이 수치는 480×832 해상도, 81프레임 영상을 기준으로 측정했다. 연구진은 영상 생성 성능 평가 지표인 VBench에서 압축 전 원래 파이프라인과 같은 수준의 생성 품질을 냈다고 설명했다. 이 논문은 연구자 커뮤니티 플랫폼 허깅페이스의 일일 논문 목록에서 추천 51회를 받았다.


이 연구는 영상 생성 AI의 계산 비용 문제에서 출발했다. 최근 영상 생성 모델은 대부분 확산 트랜스포머(DiT) 구조를 쓴다. 오토인코더가 영상을 압축된 잠재 표현(latent)으로 바꾸면 DiT가 이를 토큰 단위로 처리한다. 압축률을 높여 토큰 수를 줄이면 DiT의 연산량도 크게 줄어든다. 문제는 압축을 세게 할수록 복원 품질이 떨어진다는 점이다. 품질을 되살리려면 채널 수를 늘려야 하는데, 그러면 DiT의 학습 수렴이 느려진다. 압축된 잠재 표현이 DiT가 학습한 것과 달라지는 것도 걸림돌이다. 이 경우 기존 DiT를 처음부터 다시 학습시키거나 큰 비용을 들여 맞춰야 한다. 원래 쓰던 오토인코더를 그대로 압축하는 방법도 있지만, 복원 성능만 기준으로 최적화하면 잠재 표현이 여전히 DiT가 학습한 분포에서 벗어난다고 연구진은 지적했다.


GRACE는 두 단계로 이 문제를 풀었다. 첫 단계에서는 사전학습된 인코더가 만든 '기본 잠재 표현'을 고정해 둔다. 그리고 더 강하게 압축할 때 잃어버리는 정보만 '잔차 잠재 표현'으로 따로 학습한다. 이때 고정된 DiT의 특징 공간에서 압축된 잠재 표현이 기존 잠재 표현과 맞도록 정렬한다. 오토인코더를 복원이 아니라 '생성'에 맞춰 최적화하는 셈이다. 둘째 단계에서는 DiT를 가볍게 미세조정한다. 여기에 기본 잠재 표현의 노이즈를 잔차보다 먼저 제거하는 '비대칭 디노이징' 방식을 더했다.


이 접근법은 이미 공개된 대형 영상 생성 모델을 거의 그대로 살려 쓰면서 추론 속도를 높이는 데 초점을 맞췄다. 영상 생성은 이미지 생성보다 처리할 토큰이 훨씬 많아 비용과 대기 시간이 큰 분야다. 연구진의 주장대로 품질 저하 없이 지연시간을 10배 넘게 줄일 수 있다면, 고성능 영상 생성 모델을 서비스에 쓰는 부담이 상당히 줄어들 수 있다.


다만 이 논문은 동료평가를 거치지 않은 사전공개 논문이다. 이 기사도 저자가 공개한 초록만 바탕으로 정리했다. 미세조정에 실제로 든 계산 비용, 다른 모델이나 해상도에서도 같은 효과가 나는지, 코드 공개 여부는 초록에서 확인되지 않았다.