spark logo
Spark AI 순위
커뮤니티 홈으로
아이언맨
AI 전문가
1년 전

1년 전

DeepSeek 루머 바로잡기



안녕하세요.

오랜만에 글 올립니다. 오늘은 한동안 시끄러웠고 시끄러울 DeepSeek의 AI 모델들에 대한 이야기를 해보려고 합니다.

이미 관련된 내용은 많이 보셨을텐데요, 해당 내용에 대해 논쟁적이거나 잘못 알려진 부분들이 많은것 같아 그에 관한 얘기를 해보려 합니다.


1. 모델 관련 이슈.

최근 이슈와 관련된 모델은 총 3가지 입니다. DeepSeek V3, DeepSeek R1-zero, DeepSeek R1

DeepSeek V3: 한달전 발표된 LLM모델. MoE아키텍쳐를 적용하여 현존하는 최고 성능 LLMs들에 준하는 성능을 내며, 추론 강화 모델의 일종인 O1, O3와는 다른 기존의 LLMs모델에 가깝습니다.
DeepSeek R1-zero: CoT(Chain-of-Thought)방식을 순수 강화학습 방식으로 학습한 모델. 범용적인 답변에는 기존 모델에 크게 못미치지만, 추론능력이 중요한 영역(코딩, 수학, 과학, 논리 등)에서 높은 성능을 보입니다.
DeepSeek R1: 기존의 V3모델을 기반으로 R1-zero의 학습 방법을 가미한 모델. 범용적인 능력, 추론능력 모두 뛰어납니다.

2. 금액 관련 이슈.

알려지기로는 총 5.576M USD 한화로 약 80억원의 비용이 발생했다고 합니다. 이를 통해, "AI 개발에 더이상 천문학적인 비용이 필요하지 않다.", "그렇기에 AI 기존의 회사들이 다 힘을 잃고 판이 뒤집힐 것이다." 등의 이야기가 나오고 있습니다.

해당 금액은 DeepSeekV3 논문에서 밝힌 금액으로 V3모델을 학습한 비용이지 최고 성능의 LLMs를 따라잡은 R1의 비용이 아닙니다. 또한 해당 비용은 논문에서는 사전 리서치, 구조, 알고리즘, 데이터 등에 필요한 실험에 대한 비용은 제외된 공식적인 학습비용이라고 언급하고 있습니다. 즉 온전히 모델 학습에 소요된 GPU 시간에 따른 비용만 계산된 것입니다. 따라서 기존의 빅테크 기업들에서 발표한 금액과 1:1로 비교할 수 있는 금액은 아닙니다.

3. GPU 관련 이슈

중국에서는 최고성능 GPU인 H100을 구입하지 못합니다. 따라서 성능이 차이나는 H800으로 학습되었습니다.
H100과 H800의 성능차이는 1. NVLink, 2. fp32, 16에서의 연산속도 이렇게 두 가지에서 주로 차이납니다. DeepSeek모델이 fp8에서 주로 학습된 모델임을 감안하면, H100 과 H800의 성능 차이는 생각만큼 크지 않습니다. 또한 동일한 HBM이 들어가, 동일한 메모리 용량을 지닙니다.

4. 모델 학습 비용에 대한 오해
앞서 언급한 금액은 DeepSeek-V3의 금액입니다. 현재 화재의 모델 DeepSeek-R1은 학습 비용이 공개된바가 없습니다. 그리고 다음을 생각해보면 학습 비용은R1이 훨씬 높을 것임을 생각해 볼 수 있습니다.

SFT(Supervised Fine Tuning) -기존 방식(GPT4, DeepSeek V3 등)

-데이터를 사람이 레이블링하고 기계가 학습

RL(Reinforcement Learning) - R1에 활용된 방식

-데이터를 기계가 생성하고 기계가 학습.

*출처 Jim Fan(Nvidia researcher X)


그러나 DeepSeek의 연구가 위대한 성과임은 자명합니다. 괄목할만한 발견이 많았으며, Open Source 생태계에 기여했다는 부분 역시 대단한 부분입니다. 상대적으로 열악한 환경에 있는 인공지능 연구자로써 저는 이러한 움직임을 응원합니다. 그러나 그러한 내용들이 너무 맹목적으로 받아들여지며 내용이 부풀려지고 와전되는 부분이 있는듯 합니다. 따라서 그러한 부분을 걷어내고자 최대한 객관적으로 기술적인 관점에서 작성하려 노력했습니다.

AI-Kive에 계신 여러분은 어떻게 생각하시나요?

1.8천

3

0

5

0

당신의 생각을 들려주세요

5

0

1.8천

3

mobile bookmark image
문화데이터 활용 영상 제작 AI 챌린지
하루동안 보지않기