← 연구

논문 리뷰 · 2026년 10월 7일

In-Distribution Forcing: 테스트 시점에 긴 영상을 생성하기 위한 분포 내 KV 운용

In-Distribution Forcing for Long Video Generation at Test Time

생성형 미디어컴퓨터 비전 고급 추천 35 cs.CV

KV 캐시를 만드는 방식과 읽는 방식을 모두 학습 때의 구성에 맞추는 추가 학습 없는 기법으로, 5초 모델을 분 단위 영상 생성으로 늘리면서 색·움직임 드리프트를 줄였다.

문제

자기회귀 비디오 확산 모델은 짧은 영상은 잘 만들지만, 학습 구간을 넘어가면 색과 질감이 변하고 움직임이 줄어드는 드리프트가 생긴다. 기존 방법은 어떤 KV 항목을 읽을지(KV conditioning)만 조절했다. 저자들은 이 방법들이 캐시된 KV가 분포 안에 있다고 가정한다는 점을 지적한다. 학습 구간을 넘으면 KV를 만들 때 참조한 문맥(provenance) 자체가 학습에서 본 적 없는 구성이 되어, KV가 분포 밖(OOD)이 된다. 저자들은 이를 KV-provenance 문제로 정의한다.

방법

Level 1(KV 캐싱)에서는 self-caching을 쓴다. 학습 구간 밖에서는 윈도우의 앞쪽 ℓ개 청크를 이전 KV를 참조하지 않고 자기 자신만 보고 캐싱한다. 나머지는 그 위에 자기회귀 방식으로 다시 캐싱해, 모든 KV가 학습 때 본 구성에서 만들어지게 한다. Level 2(KV conditioning)에서는 첫 청크 κ0을 항상 슬롯 0에 둔다. 인과적 3D-VAE가 첫 프레임을 단일 프레임으로 인코딩하기 때문에 분포상 대체할 수 없다는 이유다. 최근 L−1개 항목은 RoPE를 다시 회전시켜 굴리는 정확한 롤링 윈도우로 유지한다. 추가 학습이 필요 없다. Wan2.1-T2V-1.3B 기반의 Self-Forcing과 LongLive에 적용했다.

결과

한계

Motion Smoothness는 일부 설정에서 기준 모델보다 약간 낮다. 예를 들어 LongLive 240초에서 98.50으로 원래 LongLive(98.74)보다 낮았다. LongLive 기반에서는 Motion Drift가 MemRoPE(96.88)보다 약간 낮은 96.09였다. 실험은 Wan2.1 1.3B 아키텍처 기반 두 모델, MovieGen 프롬프트 128개, 480×832 해상도로 한정된다. 드리프트 지표 중 일부는 저자들이 정의한 지표다.

의미

긴 영상 생성의 드리프트를 '무엇을 읽느냐'뿐 아니라 'KV가 어떤 문맥에서 만들어졌느냐'의 문제로 다시 정의했다. 재학습 없이 기존 짧은 구간 모델에 바로 적용할 수 있어, 월드 모델이나 스트리밍 영상처럼 긴 생성이 필요한 응용에 실용적이다.

핵심 용어

KV 캐시
트랜스포머가 이전에 생성한 내용의 키·값 벡터를 저장해 두고, 다음 생성 때 어텐션으로 참조하는 메모리다.
드리프트(drifting)
자기회귀 생성이 길어질수록 오차가 쌓여 색·질감이 변하고 움직임이 줄어드는 품질 저하 현상이다.
KV-provenance 문제
KV 항목이 만들어질 때 참조한 문맥이 학습에서 본 적 없는 구성이라서, KV 자체가 분포 밖이 되는 문제다.
Self-caching
청크를 캐싱할 때 이전 KV를 참조하지 않고 자기 자신만 보게 하는 방식이다. 출처 문맥이 없으므로, 윈도우에서 다른 항목이 빠져도 분포를 벗어나지 않는다.

원문

저자: Jeongwoo Shin, Youngyoon Choi, Sangwoo Jo, Hyunmog Kim, Sungjoon Choi, Joonseok Lee, Jaewoong Choi, Jaemoo Choi · 게시 2026-10-02 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.