← 연구

논문 리뷰 · 2026년 10월 7일

ALoDLM: 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델

ALoDLM: Adaptively Looped Diffusion Language Models

언어 모델효율·인프라 고급 추천 60 cs.AI

확산 언어 모델에서 어려운 토큰만 잠재 상태를 더 반복해 다듬게 해서, 같은 크기의 자기회귀 모델보다 높은 평균 점수와 빠른 병렬 디코딩을 함께 얻었다.

문제

확산 언어 모델(DLM)은 여러 토큰을 병렬로 예측해 빠르다. 하지만 같은 크기의 자기회귀(AR) 모델보다 품질이 낮다. 저자들은 그 원인을 '계산-난이도 불일치'로 본다. 한 디노이징 단계 안에서 쉬운 토큰과 어려운 토큰에 똑같은 깊이의 계산을 쓴다는 것이다. 신뢰도 기반 디코딩도 미룬 토큰의 잠재 계산을 버리고 다음 단계에서 처음부터 다시 계산한다.

방법

Transformer를 Prelude, Recurrent Core, Coda 세 부분으로 나누고, 각 디노이징 단계 안에 내부 루프를 둔다. 예측 엔트로피가 임계값 이하인 토큰은 확정해 임베딩을 문맥으로 되돌려 넣는다. 확정되지 않은 토큰은 잠재 상태를 유지한 채 Recurrent Core를 반복 통과한다. 내부 루프를 언제 멈출지는 별도의 ExitGate 헤드가 정한다. 학습에서는 토큰별 종료 깊이(exit schedule)를 잠재 변수로 보고 조건부 NELBO를 유도해, 토큰 예측과 계산 배분을 함께 최적화한다. 이산적인 종료 결정은 score-function 기반의 비편향 기울기 추정기와 분산 감소 기법으로 학습한다. Qwen3 1.7B·8B 백본을 50억 토큰 코퍼스로 직접 SFT했다.

결과

한계

실험은 Qwen3 백본을 50억 토큰으로 SFT한 1.7B·8B 규모에 한정된다. 처음부터 사전학습했을 때나 더 큰 규모에서의 효과는 확인되지 않았다. 속도 비교는 GSM8K 중심으로 제시되어 있어, 다른 과제에서의 품질-효율 균형은 별도 확인이 필요하다. 종료 결정을 score-function 추정기로 학습하므로 분산 감소 기법 같은 추가 장치가 필요하다.

의미

DLM의 품질 격차를 AR 구조로 돌아가지 않고 토큰 단위 적응형 계산으로 줄였다. 8B 규모에서 AR 모델보다 높은 평균 점수와 더 빠른 서빙을 함께 보였다는 점에서, 확산 기반 LLM을 실제로 쓸 수 있을지 판단하는 데 참고가 된다.

핵심 용어

확산 언어 모델(DLM)
마스크된 문장을 여러 단계에 걸쳐 복원하며 텍스트를 만드는 모델이다. 한 단계에서 여러 토큰을 병렬로 예측할 수 있어 빠르다.
루프형(재귀 깊이) 트랜스포머
같은 레이어 묶음을 여러 번 반복 적용해, 파라미터를 늘리지 않고 계산 깊이를 키우는 구조다.
NELBO
음의 증거 하한이다. 직접 계산하기 어려운 로그우도 대신 최소화하는 상한 목적함수로, 여기서는 종료 스케줄을 잠재 변수로 다루는 데 쓰였다.
Score-function 추정기
이산 샘플링처럼 미분할 수 없는 선택이 있을 때, 로그 확률의 기울기에 결과 비용을 곱해 기울기를 추정하는 방법(REINFORCE)이다.

원문

저자: Liancheng Fang, Zhuowei Li, Youngeun Kim, Tianchen Zhao, Rajat Koner, Jiaye Wu, Linghan Xu, Xuanbai Chen, 외 · 게시 2026-10-03 · 라이선스 CC BY-NC-SA 4.0 · 본문 기준 분석

이 리뷰는 AI가 논문을 읽고 작성한 요약이며, 정확한 내용은 원문을 기준으로 확인해 주세요.