AI 용어집 · 심화 · 컴퓨터 비전 · 피지컬 AI·로봇 · 자율주행
JEPA 결합 임베딩 예측 아키텍처 (I-JEPA · V-JEPA)
JEPA(결합 임베딩 예측 아키텍처)는 이미지나 영상에서 가려진 부분을 픽셀 그대로 그려 내는 대신, 그 부분의 '요약된 의미'(임베딩)를 예측하게 하여 AI가 세상을 이해하는 법을 스스로 배우게 하는 학습 방식이다.
어떻게 작동하나
먼저 이미지나 영상의 일부를 가리고, 보이는 부분(맥락)만 모델에 보여 준다. 모델은 가려진 부분이 어떤 모습인지를 픽셀 단위로 복원하지 않고, 그 부분을 요약한 숫자 표현(임베딩)이 무엇일지를 예측한다. 정답 역시 같은 방식으로 요약된 표현이므로, 모델은 잎사귀 하나하나 같은 사소한 세부보다 '무엇이 어디에 있는지' 같은 의미에 집중하게 된다. 사람이 일일이 정답 라벨을 달아 주지 않아도 데이터 자체에서 배우는 '자기지도 학습'의 한 종류다.
어떻게 발전해 왔나
출발점은 2023년 논문 'Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture'의 I-JEPA로, 한 이미지 안의 한 구역을 보고 다른 여러 구역의 표현을 예측하게 해 사람이 손으로 설계한 데이터 변형 없이도 의미 있는 이미지 이해를 배울 수 있음을 보였다. 2024년 'Revisiting Feature Prediction for Learning Visual Representations from Video'의 V-JEPA는 같은 아이디어를 영상으로 넓혀, 텍스트나 기존 이미지 모델의 도움 없이 영상 속 특징 예측만으로 움직임과 겉모습을 함께 이해하는 모델을 만들었다. 2025년 'V-JEPA 2'는 대규모 인터넷 영상으로 배운 뒤 적은 양의 로봇 영상을 더해, 목표 이미지를 보고 물건을 집어 옮기는 계획까지 세우는 '월드 모델'로 발전시켰다. 2026년에는 이를 자율주행에 적용한 Drive-JEPA(주행 영상으로 사전학습하고 다양한 주행 경로를 함께 학습), 미래 장면과 차량의 움직임을 함께 예측하도록 바꾼 WA-JEPA, 그리고 미래 예측을 하나의 정답이 아닌 여러 가능성으로 다뤄 잡음에 더 강하게 만든 Flow-JEPA 등이 나왔다.
왜 중요한가
사람이 라벨을 붙이지 않은 방대한 영상과 이미지에서 세상의 구조를 배울 수 있어 데이터 준비 부담이 적다. 픽셀을 다시 그리지 않으므로 불필요한 세부에 계산을 낭비하지 않고, 의미 위주의 이해를 얻기 쉽다. 특히 '다음에 무슨 일이 일어날지'를 요약된 형태로 예측하는 능력은 로봇이나 자율주행처럼 행동을 계획해야 하는 분야에서 월드 모델의 기반으로 주목받고 있다.
알아 둘 점
JEPA는 그림이나 영상을 만들어 내는 생성 모델이 아니라, 이해와 예측을 위한 표현을 배우는 방식이다. 따라서 그 자체로 결과물을 보여 주기보다는 다른 작업(분류, 질의응답, 계획 등)의 밑바탕으로 쓰인다. 모델이 모든 입력을 똑같은 표현으로 뭉개 버리는 '표현 붕괴'를 막는 것이 중요한 과제이며, 최근 연구는 잡음이 섞인 환경에서의 안정성과 불확실한 미래를 다루는 방법을 개선하는 데 집중하고 있다.
예시
연구 현장에서 JEPA는 주로 로봇과 자율주행의 '세상 이해' 부분을 미리 학습시키는 데 쓰인다. 예를 들어 V-JEPA 2 연구에서는 인터넷 영상으로 먼저 세상이 어떻게 움직이는지를 배운 뒤, 소량의 로봇 영상만 추가해 처음 보는 실험실의 로봇 팔이 목표 사진을 보고 물건을 집어 옮기도록 계획하게 했다. 자율주행 분야에서도 주행 영상으로 JEPA 방식의 사전학습을 한 뒤, 그 위에 경로를 정하는 모듈을 얹는 방식이 연구되고 있다.
함께 보면 좋은 용어
참고
- Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (2023)
- Revisiting Feature Prediction for Learning Visual Representations from Video (2024)
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (2025)
- Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving (2026)
- WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving (2026)
- Flow-JEPA: Robust Latent Dynamics for JEPA World Models via Flow Matching (2026)