Prologue · From Language to LLM - The Journey to Language Models

컴퓨터는 어떻게 언어를 이해하게 되었는가

오늘날 ChatGPT와 같은 거대 언어 모델은 사람과 자연스럽게 대화하고, 글을 작성하며, 다양한 문제를 해결합니다. 하지만 컴퓨터가 처음부터 사람의 언어를 이해했던 것은 아닙니다. 문자를 숫자로 표현하는 방법에서 시작해, 단어의 의미를 배우고, 문맥을 이해하며, 필요한 정보를 직접 찾아보는 기술이 차례로 등장했습니다. 이 책은 그 과정을 처음부터 끝까지 따라가며 현대 언어 모델이 만들어진 이유와 원리를 하나씩 이해해 나갑니다.

Scene 1 · A Sentence

우리는 문장을 읽는 순간 하나의 상황을 떠올린다

아침에 휴대전화에서 다음 문장을 보았다고 생각해 보겠습니다.

오늘 오후부터 전국에 많은 비가 내릴 예정입니다.

우리는 이 문장을 한 글자씩 계산하지 않습니다. ‘오늘’이 현재 날짜를 기준으로 한 시간이라는 것, ‘오후부터’ 비가 시작된다는 것, ‘전국’이 넓은 지역을 가리킨다는 것, ‘많은 비’가 외출에 영향을 줄 수 있다는 것을 거의 동시에 파악합니다.

문장을 모두 읽은 뒤에는 글에 직접 적혀 있지 않은 “우산을 준비해야겠다”라는 판단까지 자연스럽게 이어집니다. 단어의 뜻, 순서, 문맥, 과거 경험이 하나의 상황으로 연결되기 때문입니다.

사람이 문장을 읽을 때

단어 인식→뜻 파악→문맥 연결→상황 판단

이 과정은 빠르고 직관적으로 일어나므로 우리는 언어 이해가 얼마나 복잡한 작업인지 자주 잊습니다.

반면

컴퓨터가 문장을 받을 때

컴퓨터는 ‘비’를 보고 비 오는 장면을 떠올리지 않습니다. ‘오늘’을 시간으로 느끼지도 않고 ‘우산’을 연상하지도 않습니다.

컴퓨터가 실제로 처리할 수 있는 것은 메모리에 저장된 숫자와 그 숫자에 대한 계산입니다.

자연어 처리의 첫 질문은 “사람이 이해하는 문장을 컴퓨터가 계산할 수 있는 형태로 어떻게 바꿀 것인가?”입니다.
Scene 2 · A World of Numbers

컴퓨터 안에서는 문자·사진·소리·영상도 모두 숫자가 된다

컴퓨터가 숫자만 처리한다는 말은 텍스트에만 해당하지 않습니다. 우리가 보는 거의 모든 디지털 데이터는 저장되고 계산되기 전에 숫자로 표현됩니다.

텍스트(Text)문자는 문자 코드와 바이트 값으로 저장됩니다. 글자의 모양이나 의미가 그대로 메모리에 들어가는 것은 아닙니다.
이미지(Image)이미지는 수많은 픽셀로 나뉘고 각 픽셀의 밝기와 RGB 색상값이 숫자로 저장됩니다.
음성(Audio)소리는 시간에 따라 변하는 진동을 일정한 간격으로 측정한 숫자 배열로 저장됩니다.
영상(Video)영상은 시간 순서대로 이어지는 이미지 프레임과 음성 데이터의 집합입니다.
데이터를 숫자로 저장할 수 있다는 것과 그 데이터의 의미를 이해한다는 것은 서로 다른 문제입니다.
Scene 3 · Numbers Are Not Meaning

문자를 숫자로 바꾸기만 하면 언어를 이해할 수 있을까?

사과를 먹었다Apple이 제품을 발표했다그는 자신의 실수를 사과했다

사람은 앞뒤 문장을 보고 과일, 회사, 잘못을 인정하는 행위를 구분합니다. 하지만 컴퓨터에 ‘사과’를 단순히 842번이라고 저장했다고 해서 842라는 숫자 안에 이러한 의미가 자동으로 들어가는 것은 아닙니다.

단순 번호

사과 = 842

다른 항목과 구분하기 위한 식별 번호일 뿐 과일인지 행동인지 알려주지 않습니다.

→

필요한 것

단어가 어떤 단어들과 비슷한지, 어떤 문맥에서 쓰이는지, 문장 안에서 어떤 역할을 하는지를 계산할 표현이 필요합니다.

숫자에 의미를 담고, 문맥에 따라 그 의미를 바꾸려면 어떻게 해야 할까?
Scene 4 · Learning Instead of Writing Rules

사람이 모든 언어 규칙을 직접 작성하는 것은 불가능했다

초기에는 사람이 “좋다”가 나오면 긍정, “싫다”가 나오면 부정처럼 규칙을 직접 작성했습니다. 그러나 실제 언어에는 “안 나쁘다”, “정말 잘도 했다”처럼 단어 하나만으로 판단하기 어려운 표현이 끊임없이 등장합니다.

규칙 기반 프로그램

사람이 IF–THEN 규칙을 계속 추가합니다. 표현이 늘어날수록 규칙이 복잡해지고 서로 충돌합니다.

→

데이터에서 학습하는 모델

많은 예시와 정답을 보여주고 예측 오류가 줄어들도록 모델 내부의 숫자를 수정합니다.

컴퓨터가 데이터에서 판단 패턴을 찾도록 만드는 방법을 머신러닝(Machine Learning)이라고 합니다. 그중 여러 층으로 연결된 신경망을 이용하는 방법이 딥러닝(Deep Learning)입니다.

인공지능지능적 작업 전체
머신러닝데이터에서 패턴 학습
딥러닝다층 신경망 사용
LLM언어를 학습한 대규모 신경망
ChatGPTLLM 기반 서비스
ChatGPT는 인공지능 전체가 아닙니다. 인공지능이라는 큰 분야 안에서 딥러닝으로 학습한 LLM을 대화에 활용한 서비스입니다.
Scene 5 · Neural Network Learning

신경망은 사람의 규칙을 외우는 대신 Weight를 수정한다

신경망은 여러 계산 단계가 연결된 모델입니다. 각 연결에는 입력을 얼마나 강하게 반영할지 정하는 Weight가 있습니다.

학습할 때는 현재 Weight로 먼저 예측하고, 실제 정답과 비교해 오차를 계산한 뒤, 오차가 줄어드는 방향으로 Weight와 Bias를 조금씩 수정합니다.

입력 데이터
현재 Weight
예측
정답과 비교
역전파·수정
신경망이 스스로 목표를 정하거나 사람처럼 공부한다는 뜻은 아닙니다. 주어진 데이터와 학습 목표에 따라 오차를 줄이는 수치 계산을 반복합니다.
Scene 6 · The Journey to LLM

언어를 처리하기 위해 해결해야 할 문제는 하나가 아니었다

문자를 숫자로 바꾼 뒤에도 의미, 순서, 문맥, 긴 기억, 관계 계산이라는 문제가 차례로 남았습니다. 앞으로 우리는 이 문제들이 어떻게 다음 기술을 탄생시켰는지 따라갑니다.

Tokenizer
문장을 그대로 계산할 수 없다.
→
문장을 Token으로 나누고 Token ID를 부여한다.
Embedding
Token ID는 단순 번호라 의미가 없다.
→
Token을 의미 관계를 계산할 수 있는 벡터로 바꾼다.
Word2Vec
좋은 단어 벡터를 사람이 직접 만들기 어렵다.
→
비슷한 문맥의 단어가 가까워지도록 벡터를 학습한다.
RNN
단어 벡터만으로는 순서와 문맥을 알 수 없다.
→
문장을 순서대로 읽고 이전 정보를 다음 계산에 전달한다.
LSTM·GRU
RNN은 긴 문장에서 오래된 정보를 잃기 쉽다.
→
중요한 기억을 선택적으로 유지한다.
Attention
정보를 끝까지 전달하고 하나의 상태에 압축하는 데 한계가 있다.
→
필요한 정보가 있는 위치를 직접 찾아 참고한다.
Transformer·GPT
문장 전체 관계를 효율적으로 계산하고 대규모로 학습해야 한다.
→
Self-Attention과 다음 Token 예측을 대규모로 학습한다.
이 기술들은 서로 무관한 이름의 목록이 아니라 앞선 방법의 한계를 해결하기 위해 이어진 하나의 발전 과정입니다.
Scene 7 · What Is an LLM?

LLM은 다음 Token을 예측하도록 학습한 거대한 신경망이다

거대 언어 모델은 매우 많은 텍스트를 이용해 학습한 대규모 신경망입니다. 앞의 Token들이 주어졌을 때 다음에 올 Token의 확률을 예측합니다.

오늘 오후부터 비가→내릴먹을읽을

이 예측을 방대한 텍스트에서 반복하면서 문법, 표현 방식, 단어 관계, 문맥 패턴이 모델의 Weight에 반영됩니다. 학습된 모델은 입력 문맥에 이어질 Token을 반복해서 선택해 문장을 생성합니다.

LLM이 사람과 완전히 같은 방식으로 언어를 이해한다고 단정할 수는 없습니다. 보다 정확하게는 언어 데이터에서 학습한 수치적 패턴을 이용해 문맥에 맞는 Token을 예측한다고 설명할 수 있습니다.
Learning Goals

이번 과정을 마치면 무엇을 설명할 수 있을까?

AI의 관계AI, 머신러닝, 딥러닝, 신경망, LLM, ChatGPT의 관계를 구분할 수 있습니다.
언어의 숫자 표현Token, Token ID, Vocabulary, Embedding이 왜 필요한지 설명할 수 있습니다.
신경망 학습Weight, Bias, 순전파, Loss, 역전파와 반복 학습의 의미를 설명할 수 있습니다.
문맥 모델의 발전Word2Vec에서 RNN, LSTM, GRU로 발전한 이유를 이해할 수 있습니다.
Attention의 발상기억 전달에서 필요한 위치 직접 참조로 바뀐 이유를 설명할 수 있습니다.
LLM의 기본 구조Transformer와 GPT가 Token을 이용해 문장을 생성하는 흐름을 설명할 수 있습니다.
Interactive Preview

앞으로 만날 기술의 역할을 미리 살펴보기

이 기술이 필요했던 이유

핵심 아이디어

아직 남은 문제

다음 단계

이제 기술 이름이 아니라 문제를 따라가 보자

앞으로 등장하는 모든 기술에는 이유가 있습니다. 문장을 나누고, 의미를 숫자로 표현하고, 문맥을 기억하고, 필요한 관계를 직접 계산하는 과정을 따라가다 보면 LLM이 어떻게 만들어졌는지 하나의 흐름으로 이해할 수 있습니다.