루브릭RUBRIC.LETTER
한장요약 · AI · 언어모델 · 작동원리

챗GPT의 대답은 '다음 단어 맞히기'를 반복한 결과다

3Blue1Brown 한국어 채널이 올린 번역 영상으로, 챗GPT 같은 대규모 언어 모델이 어떻게 문장을 만들어 내는지를 8분 남짓에 정리한다. 다음 단어 예측이라는 출발점에서 시작해 파라미터와 훈련, 연산량, 사람의 선호를 반영하는 추가 학습, 트랜스포머와 어텐션까지 순서대로 따라간다. 수식 대신 비유와 규모 비교로 설명하고, 마지막에는 모델이 왜 그 단어를 골랐는지 사람이 설명하기 어렵다는 점까지 짚는다.

3Blue1Brown 한국어7:54업로드 2025-04-24자막 기반
요지 · 핵심

이 영상이 전하는 핵심은 단순하다. 챗GPT가 하는 일은 말을 이해하는 것이 아니라, 지금까지 나온 단어들을 보고 다음에 올 단어의 확률을 계산하는 것이다. 그 단순한 계산을 수천억 개의 값과 상상하기 어려운 연산량으로 반복하고, 거기에 사람의 선호를 얹은 결과가 지금 우리가 쓰는 대화형 AI다.

2,600년GPT3가 학습한 글을 사람이 24시간 읽어야 하는 시간
1억 년초당 10억 번 연산하는 기계로 훈련할 때 걸리는 시간
수천억 개모델 안에서 예측을 결정하는 파라미터의 규모
2017년구글 연구팀이 트랜스포머를 발표한 해
요약본
01 / 전제

챗GPT와의 대화는 다음에 올 단어를 한 개씩 맞혀 나간 결과다

영상은 사람과 인공지능이 대화하는 짧은 영화 대본을 예로 든다. 대본의 절반이 찢어져 사람이 질문하는 대사만 남아 있는데, 어떤 문장을 넣든 그다음에 올 단어를 가장 그럴듯하게 예측해 주는 기계가 있다고 해 보자. 예측한 단어를 대본에 덧붙이고 다시 그다음 단어를 예측하는 식으로 반복하면 찢어진 절반이 채워진다. 챗GPT와의 대화가 실제로 이런 식으로 이루어진다는 것이다. 그래서 대규모 언어 모델은 어떤 텍스트가 주어졌을 때 다음에 올 단어를 예측하는 정교한 수학 함수라고 정의된다. 더 정확히는 단어 하나를 확정해 내놓는 것이 아니라, 다음에 올 수 있는 단어들의 확률을 구하는 함수다. 확률이 가장 높은 단어만 고르지 않고 가끔 조금 낮은 단어도 무작위로 고르게 하면 훨씬 사람이 쓴 것 같은 답이 나온다. 언어 모델 자체는 결과가 정해진 결정론적 모델이지만, 이 무작위성 때문에 같은 질문에도 매번 다른 답이 나올 수 있다고 설명한다.

대규모 언어 모델은 어떤 텍스트가 주어졌을 때 다음에 올 단어를 예측하는 매우 정교한 수학적 함수입니다.
0:02 장면 보기 ↗
02 / 규모

학습에 쓰인 글은 사람이 2,600년을 읽어야 할 분량이다

언어 모델은 인터넷에서 모은 엄청난 양의 텍스트로 학습한다. 영상은 그 양을 시간으로 바꿔 보여 준다. GPT3가 학습한 텍스트를 사람이 하루 24시간 쉬지 않고 읽는다면 2,600년 이상이 걸린다는 것이다. 요즘 나온 모델들은 그보다 훨씬 더 많은 데이터로 훈련되었다고 덧붙인다. 모델 안에는 학습 결과를 담는 다이얼이 수없이 많다. 이 다이얼을 파라미터 또는 가중치라고 부르고, 이 값들이 모델이 다음 단어를 어떻게 예측할지를 결정한다. 대규모 언어 모델이라는 이름이 붙은 이유도 이 파라미터가 수백억 개에서 수천억 개에 이르기 때문이다. 사람이 그 값을 하나하나 정할 수는 없으므로 처음에는 무작위로 놓고, 훈련을 반복하면서 점점 더 그럴듯한 예측을 하는 값으로 조정해 간다.

1:29 장면 보기 ↗
03 / 절차

훈련은 마지막 단어를 가리고 맞히게 하는 일의 반복이다

훈련에는 짧게는 몇 단어, 길게는 수천 단어로 이루어진 데이터를 쓴다. 방식은 단순하다. 어떤 텍스트에서 마지막 단어를 뺀 나머지를 모델에 넣고, 모델이 그 마지막 단어를 어떻게 예측하는지 확인한다. 그리고 예측이 정답에 가까워지도록 파라미터를 살짝 조정한다. 이때 쓰는 것이 역전파, 영어로 백프로파게이션이라고 불리는 알고리즘이다. 이 과정을 수없이 반복하면 모델은 학습에 쓴 데이터에서만 잘 맞히는 것이 아니라 처음 보는 문장에 대해서도 그럴듯한 예측을 하게 된다.

1:48 장면 보기 ↗
04 / 비용

사전 훈련에 필요한 연산은 초당 10억 번 기계로 1억 년이다

이만한 파라미터와 데이터를 처리하려면 연산량이 상상을 초월한다. 영상은 1초에 10억 번 덧셈과 곱셈을 할 수 있는 기계를 가정한다. 이 기계로 언어 모델을 훈련시키면 1년일까, 1만 년일까. 답은 1억 년이고, 그렇게 해도 챗GPT의 절반도 만들지 못한다고 말한다. 여기까지가 사전 훈련, 즉 프리트레이닝 과정이다. 그런데 텍스트의 다음 단어를 잘 예측하는 것과 좋은 AI 어시스턴트를 만드는 것은 조금 다른 일이라서, 훈련은 여기서 끝나지 않는다.

정답은 그것보다 훨씬 더 많은 1억년이 걸립니다.
3:10 장면 보기 ↗
05 / 보정

사람이 응답을 고쳐 주는 RLHF가 어시스턴트다운 답을 만든다

사전 훈련을 마친 모델을 가지고 강화 학습의 하나인 RLHF로 한 번 더 훈련한다. 방법은 사람이 직접 개입하는 것이다. 모델의 잘못된 응답을 고치거나, 더 나은 응답을 골라 주는 식으로 추가 학습이 이뤄진다. 그 결과 모델은 사용자들이 더 선호하는 방향으로 다음 단어를 예측하도록 조정된다. 다음 단어를 맞히는 기계가 대화 상대처럼 굴게 되는 지점이 여기다.

3:52 장면 보기 ↗
06 / 전환

2017년 트랜스포머가 문장을 한꺼번에 처리하게 만들었다

이 정도 연산을 감당하려면 병렬 처리와 그에 특화된 컴퓨터 칩, 곧 GPU가 반드시 필요하다. 그런데 모든 언어 모델 알고리즘이 병렬 처리에 잘 맞았던 것은 아니다. 2017년 이전까지만 해도 대부분의 모델은 단어를 하나씩 순차적으로 처리했다. 구글의 한 연구팀이 트랜스포머라는 새 모델을 발표한 뒤 많은 것이 바뀌었다. 트랜스포머는 텍스트를 처음부터 끝까지 순서대로 읽는 대신 전체 문장을 한꺼번에 병렬로 처리한다. 이때 각 단어는 모델이 다룰 수 있는 숫자 벡터로 바뀌어 들어간다. AI 훈련이 연속적인 수치 데이터 위에서 이뤄지기 때문에 언어를 숫자로 바꾸는 것이고, 각 벡터는 그 단어의 의미나 맥락을 담고 있다.

4:16 장면 보기 ↗
07 / 핵심

어텐션이 내리는 눈과 보는 눈을 갈라 놓는다

트랜스포머는 어텐션이라는 연산으로 이 숫자 벡터들을 처리한다. 어텐션은 벡터들이 서로 정보를 주고받게 해서, 주변 맥락에 따라 각 단어의 의미를 적절히 조정하게 해 준다. 영상이 든 예가 '눈'이다. 주변에 '내린다'가 있으면 하늘에서 내리는 눈을 뜻하는 벡터가 되고, '보는 눈이 많다'면 사람의 눈을 뜻하게 된다. 트랜스포머 안에는 피드포워드 네트워크라는 연산도 들어 있다. 피드포워드는 모델이 더 많은 언어 패턴을 저장할 수 있게 해 준다. 어텐션과 피드포워드를 여러 층, 곧 여러 레이어에 걸쳐 반복하면 각 단어 벡터는 점점 더 맥락을 잘 반영하게 되고, 다음 단어를 정확히 예측하는 데 필요한 정보가 압축되어 끝까지 전달된다. 마지막 단계에서는 전체 문맥을 반영한 벡터를 가지고 다음에 올 수 있는 모든 단어의 확률 분포를 예측한다.

5:10 장면 보기 ↗
08 / 한계

구조는 사람이 설계했지만 왜 그 단어인지는 설명하기 어렵다

모델의 구조는 연구자들이 설계했다. 그러나 실제로 어떤 출력을 내는지는 훈련을 통해 자동으로 조정된 수십억 개의 파라미터가 결정한다. 그래서 이 모델이 다음에 올 단어로 왜 하필 그 단어를 예측했는지 설명하기는 굉장히 어렵다는 것이다. 영상은 설명하기 어렵다는 점을 인정하면서도, 이렇게 만들어진 언어 모델이 생성하는 텍스트가 매우 자연스럽고 유용하다는 말로 마무리한다. 트랜스포머와 어텐션을 더 알고 싶으면 원본 채널의 딥러닝 시리즈를 보라고 안내한다.

설명하긴 어렵지만 이렇게 만들어진 언어 모델이 생성해내는 텍스트는 굉장히 자연스럽고 신기하고 게다가 유용하죠.
6:29 장면 보기 ↗
읽기 전에 참고

2,600년이나 1억 년 같은 숫자는 규모를 실감하게 하려고 원본 영상이 계산해 둔 값이고, 산식까지 보여 주지는 않는다. 기준으로 삼은 모델도 GPT3라서 지금 쓰이는 모델의 규모와는 차이가 있다. 영어 원본을 옮긴 요약판이라 트랜스포머 내부 동작은 크게 덜어 낸 설명이라는 점도 감안하고 볼 필요가 있다. 영상 안에서도 파라미터 규모를 수십억·수백억·수천억으로 다르게 말하는데, 이 요약은 가장 자주 나온 수천억 개로 통일했다.

자막 기반 · 2026-09-23 01:21
이 한장요약이 도움이 됐나요?👍 도움됐다👎 별로▶ 봤다⏭ 안 볼래누르면 텔레그램이 열리고 기록됩니다
내 영상도 채점받기 →유튜브 링크를 텔레그램 봇에 보내면 몇 분 안에 이런 레터가 옵니다 · 하루 3회 무료