spark logo
Spark AI 순위
커뮤니티 홈으로
아이언맨
AI 전문가
1년 전

1년 전

Large Language Diffusion Models(LLaDA): 디퓨전 모델로 언어모델 만들기


디퓨전 모델로 언어모델을 만들 수 있을까요?

일반적으로 언어모델을 만드는 구조는 Autoregressive modeling(ARM)으로 만들 수 있다고 생각했습니다.

사람이 언어를 글을 쓸 때처럼, 단어들을 먼저 써야 다음 단어를 쓸 수 있다고 생각했고 상식으로 받아들여저 왔습니다..

그런데 사람은 실제로 그렇게 생각하고 말 할까요?

디퓨전 기반의 모델은 글을 순서대로 쓰는 것이 아니라 문장을 한 번에 써내는 방식을 활용합니다.

이러한 방식은 단순히 실험으로 끝나지 않았고, 실제로도 기존의 방식에 근접한 성능을 보였다고 합니다.

특히 기존의 모델들이 순서대로 학습을 하다보니, 역순(reasoning reversal) 과제에서 좋지 못한 성능을 보였었는데요, LLaDA는 GPT-4o보다높은 성능을 보였다고 합니다. reasoning reversal task는 논리적으로 A = B일 때, B = A라고 답할 수 있는지에 대한 문제입니다. 기존의 ARM방식의 모델들 등은 순차적으로 언어를 학습하는것에 구조적으로 종속되어있어 이러한 문제에 매우 약한 모습을 보였으나, LLaDA는 이러한 문제를 해결한 것이 매우 흥미롭네요.

다만 해당 태스크 외에는 비슷한 규모의 모델들과 비교하였을 때, 일부는 잘하고, 일부는 못하는 등 비슷한 성능을 보이고 있습니다.

하지만 여전히 RLHF(사람의 피드백을 활용한 강화학습) 등을 진행하지 않았는 등 개선될 여지는 있다고 보여집니다.

여러 방식의 장점이 더해지면 더 좋은 모델이 나올 수도 있을것 같아 기대가 되네요.

출처: 📃LLaDA 논문

1.6천

3

0

3

0

당신의 생각을 들려주세요

3

0

1.6천

3

mobile bookmark image
문화데이터 활용 영상 제작 AI 챌린지
하루동안 보지않기