연구

커뮤니티 추천을 많이 받은 최신 AI 논문을 골라 문제·방법·결과·한계로 정리합니다. 원문은 arXiv에서 확인하세요.

2026년 10월 7일 5

생성형 미디어멀티모달음성·오디오 고급 추천 117

Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

사전학습된 비디오 스트림과 새로 학습한 오디오 스트림을 양방향 크로스 어텐션으로 연결해, 립싱크가 맞는 5초 영상과 44kHz 오디오를 함께 생성하는 오픈 모델을 만들었다.

언어 모델효율·인프라 고급 추천 60

ALoDLM: 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델

ALoDLM: Adaptively Looped Diffusion Language Models

확산 언어 모델에서 어려운 토큰만 잠재 상태를 더 반복해 다듬게 해서, 같은 크기의 자기회귀 모델보다 높은 평균 점수와 빠른 병렬 디코딩을 함께 얻었다.

생성형 미디어컴퓨터 비전 고급 추천 35

In-Distribution Forcing: 테스트 시점에 긴 영상을 생성하기 위한 분포 내 KV 운용

In-Distribution Forcing for Long Video Generation at Test Time

KV 캐시를 만드는 방식과 읽는 방식을 모두 학습 때의 구성에 맞추는 추가 학습 없는 기법으로, 5초 모델을 분 단위 영상 생성으로 늘리면서 색·움직임 드리프트를 줄였다.

에이전트안전·정렬언어 모델 중급 추천 33

MemAdapter: 메모리 때문에 생기는 아첨을 막는 반사실적 적응 프레임워크

Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy

검색한 메모리마다 반사실적 추론으로 위험 조건을 찾고 현재 과제에 맞게 영향력을 조정해서, LLM 에이전트의 메모리 기반 아첨을 줄였다.

에이전트데이터·평가피지컬 AI·로봇 중급 추천 31

LMBuild: 실제로 조립할 수 있고 작동하는 구조물을 만드는 LLM 에이전트 평가

LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures

부품·관절·재료·조립 순서까지 포함해 구조물을 만드는 상호작용 환경과 4단계 평가 체계를 만들어 30개 시스템을 평가한 결과, 기능과 물리적 작동성이 가장 큰 약점임을 확인했다.