← 연구

논문 리뷰 · 2026년 10월 7일

Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

생성형 미디어멀티모달음성·오디오 고급 추천 117 cs.CV

사전학습된 비디오 스트림과 새로 학습한 오디오 스트림을 양방향 크로스 어텐션으로 연결해, 립싱크가 맞는 5초 영상과 44kHz 오디오를 함께 생성하는 오픈 모델을 만들었다.

문제

텍스트로 소리가 있는 영상을 만들려면 영상과 오디오가 의미·시간·감정 면에서 서로 맞아야 해서, 한 가지만 생성할 때보다 훨씬 어렵다. Veo 3.1, Sora 2 같은 상용 시스템은 성능이 좋지만 코드가 공개되지 않았다. 오픈소스 모델은 클립 길이, 해상도, 동기화 정확도에서 아직 뒤처져 있다.

방법

Kandinsky 5.0의 CrossDiT를 두 스트림 구조로 확장했다. 비디오 스트림과 오디오 스트림을 블록마다 양방향 크로스 어텐션(V2A·A2V)으로 연결한다. 모델은 Lite(3B)와 Pro(29B) 두 가지다. Pro는 비디오 19B, 오디오 5B, 크로스 어텐션 5B로 구성된다. 학습은 다음 순서로 진행했다. ① 오디오 스트림을 오디오 4천만 트랙으로 처음부터 학습 ② 영상·오디오 쌍 데이터 700만 세그먼트로 두 스트림을 함께 학습 ③ 도메인별 SFT 결과를 model soup으로 결합 ④ OmniNFT 기반 강화학습 ⑤ π-Flow와 적대적 정제로 두 단계 증류해 함수 평가 10회까지 줄임. 출력은 별도의 K-VAE 잠재공간 초해상도 모델로 Full-HD까지 키운다.

결과

한계

생성 길이가 5초 클립으로 제한된다. 기본 출력은 SD 해상도이고 Full-HD는 별도 초해상도 모델로 얻는다. 제공된 본문에는 정량 평가 수치가 거의 없고, 주요 비교가 사람의 나란히 비교 평가에 기대고 있어 객관적 수치 비교는 어렵다. 데이터에 러시아 문화 데이터셋이 들어 있고 캡션이 러시아어·영어 중심이라, 다른 언어에서의 성능은 확인되지 않았다.

의미

립싱크가 포함된 영상·오디오 동시 생성 모델 가운데 29B급 대형 모델을 MIT 라이선스로 공개했다. 오디오 스트림을 먼저 따로 학습한 뒤 기존 비디오 모델에 붙이는 방식은, 이미 있는 비디오 모델에 소리를 추가하려는 팀이 참고할 수 있는 실용적인 방법이다.

핵심 용어

듀얼 스트림 CrossDiT
비디오와 오디오를 각각 처리하는 두 개의 디퓨전 트랜스포머를 크로스 어텐션으로 연결한 구조다. 두 모달리티가 서로를 참고하며 동기화된다.
양방향 크로스 어텐션
비디오 토큰이 오디오를 참조(V2A)하고 오디오 토큰이 비디오를 참조(A2V)하는 어텐션이다. 시간적·의미적 정렬을 맞추는 역할을 한다.
T2AV / I2AV
텍스트에서 영상과 오디오를 함께 생성하는 모드(T2AV)와, 시작 이미지를 조건으로 영상과 오디오를 생성하는 모드(I2AV)다.
증류(distillation)
많은 샘플링 단계가 필요한 모델을, 적은 단계로 비슷한 결과를 내는 모델로 압축하는 기법이다. 생성 속도를 높인다.

원문

저자: Team Kandinsky, Julia Agafonova, Bulat Akhmatov, Mikhail Aksyutin, Grigorii Alekseenko, Anastasia Aliaskina, Olga Androsova, Vladimir Arkhipkin, 외 · 게시 2026-10-04 · 라이선스 CC BY 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.