Part 1 · Natural Language Processing - The Evolution of NLP

언어 모델은 어떻게 발전해 왔는가

오늘날의 거대 언어 모델은 하루아침에 만들어진 기술이 아닙니다. 새로운 기술은 항상 이전 기술이 해결하지 못했던 문제를 극복하기 위해 등장했습니다. 이 장에서는 규칙 기반 시스템에서 Word2Vec, RNN, Attention, Transformer 그리고 LLM으로 이어지는 발전 과정을 큰 흐름으로 살펴봅니다.

Overview

왜 새로운 NLP 기술이 계속 등장했을까?

자연어는 단어의 순서, 문맥, 의미 관계가 복잡하게 얽혀 있습니다. 초기 모델은 짧은 문장과 단순한 패턴은 처리할 수 있었지만, 긴 문맥을 기억하거나 여러 단어의 관계를 동시에 이해하는 데 한계가 있었습니다.

새로운 기술은 이전 기술을 완전히 없애기 위해 등장한 것이 아니라, 기존 방식의 한계를 줄이고 더 많은 데이터를 효율적으로 학습하기 위해 발전했습니다.

NLP 기술의 발전은 크게 순차 처리 → 장기 기억 보완 → 단어 의미의 벡터화 → 전체 문맥의 병렬 처리 → 대규모 사전학습 의 흐름으로 이해할 수 있습니다.
RNN 문장을 순서대로 읽으며 이전 정보를 다음 단계로 전달
LSTM 필요한 정보를 오래 기억하도록 기억 구조 보완
Word2Vec 단어를 의미를 가진 숫자 벡터로 표현
Transformer 문장 전체의 관계를 동시에 계산
LLM 대규모 데이터로 사전학습하여 다양한 작업 수행
Technology Evolution

주요 기술의 발전 과정

1

순환 신경망 (RNN)

순차 처리
왜 등장했나? 문장은 단어의 순서가 중요합니다. RNN은 이전 시점의 정보를 다음 시점으로 전달하여 순서를 가진 데이터를 처리하기 위해 사용되었습니다.
무엇이 가능했나? 앞에서 읽은 단어의 정보를 활용하여 다음 단어를 처리할 수 있어 언어 모델, 번역, 음성 인식 등에 활용되었습니다.
한계는 무엇인가? 문장이 길어질수록 앞부분의 정보가 약해지고, 단어를 순서대로 처리해야 하므로 병렬 학습이 어렵습니다.
2

장단기 메모리 (LSTM)

기억 구조 보완
왜 등장했나? 일반 RNN은 긴 문장에서 오래된 정보를 유지하기 어려웠습니다. LSTM은 필요한 정보를 오래 기억하기 위해 제안되었습니다.
무엇이 달라졌나? 게이트 구조를 이용해 어떤 정보는 저장하고, 어떤 정보는 버릴지 조절할 수 있습니다.
한계는 무엇인가? 장기 의존성 문제를 완화했지만, 여전히 토큰을 순서대로 처리해야 하므로 계산 속도와 병렬화에 제약이 있습니다.
3

Word2Vec

단어 임베딩
왜 등장했나? 단어를 단순한 번호로 표현하면 단어 사이의 의미 관계를 알 수 없습니다. Word2Vec은 비슷한 문맥에 등장하는 단어가 비슷한 의미를 가진다고 보았습니다.
무엇이 가능했나? 단어를 숫자 벡터로 표현하여 단어 사이의 유사성과 의미 관계를 계산할 수 있게 되었습니다.
한계는 무엇인가? 하나의 단어에 하나의 고정된 벡터를 사용하므로, 같은 단어가 문맥에 따라 다른 뜻을 갖는 문제를 충분히 처리하지 못합니다.
4

트랜스포머 (Transformer)

셀프 어텐션
왜 등장했나? RNN과 LSTM은 순차 처리 때문에 학습 속도가 느리고, 긴 거리의 단어 관계를 다루는 데 한계가 있었습니다.
무엇이 달라졌나? 셀프 어텐션을 사용하여 문장 안의 모든 토큰 관계를 직접 계산하고, 여러 토큰을 병렬로 처리할 수 있게 되었습니다.
어떤 변화가 생겼나? 긴 문맥과 복잡한 관계를 더 효과적으로 학습할 수 있게 되었고, 현대 자연어 처리 모델의 핵심 구조가 되었습니다.
5

대규모 언어 모델 (LLM)

대규모 사전학습
왜 등장했나? Transformer 구조가 대규모 데이터와 계산 자원을 효과적으로 활용할 수 있게 되면서, 하나의 모델을 폭넓은 언어 작업에 사용하는 방식이 가능해졌습니다.
무엇이 가능해졌나? 번역, 요약, 질의응답, 문장 생성, 코드 작성 등 여러 작업을 하나의 모델이 수행할 수 있게 되었습니다.
새로운 과제는 무엇인가? 학습 비용, 환각, 편향, 개인정보, 저작권, 추론 비용과 같은 새로운 문제를 함께 고려해야 합니다.
Interactive Timeline

기술 흐름 살펴보기

아래 기술을 선택하면 각 기술이 해결한 문제와 남긴 한계를 다시 확인할 수 있습니다.

RNN — 문장을 순서대로 처리

이전 시점의 정보를 다음 시점으로 전달하여 단어 순서를 반영했습니다. 그러나 긴 문장의 앞부분 정보를 오래 유지하기 어렵고, 순차 계산 때문에 학습을 병렬화하기 어렵습니다.

Comparison

주요 기술 비교

기술 핵심 아이디어 개선한 점 대표 한계
RNN 이전 상태를 다음 단계로 전달 단어 순서를 가진 문장 처리 긴 문맥 기억과 병렬화의 어려움
LSTM 게이트를 이용한 기억 제어 장기 의존성 문제 완화 여전히 순차 계산 필요
Word2Vec 문맥을 이용한 단어 벡터 학습 단어 의미와 유사성 표현 문맥에 따라 변하지 않는 고정 벡터
Transformer 셀프 어텐션과 병렬 처리 긴 거리 관계와 학습 효율 개선 큰 계산량과 메모리 사용
LLM 대규모 사전학습과 범용 생성 하나의 모델로 다양한 작업 수행 환각, 비용, 편향, 신뢰성 문제
How Technologies Connect

기술은 서로 어떻게 연결되는가?

RNN과 LSTM의 관계 LSTM은 RNN을 완전히 다른 방식으로 대체한 것이 아니라, RNN의 기억 구조를 개선하여 긴 문맥을 더 잘 처리하도록 만든 모델입니다.
Word2Vec과 Transformer의 관계 Word2Vec은 단어를 의미 벡터로 표현하는 개념을 널리 확산시켰고, Transformer는 문맥에 따라 달라지는 동적인 표현을 학습합니다.
Transformer와 LLM의 관계 LLM은 대부분 Transformer를 기반으로 하며, 모델 크기와 학습 데이터, 계산 자원을 크게 확장한 형태입니다.
이전 기술은 사라졌는가? 아닙니다. RNN과 LSTM은 시계열 데이터나 작은 모델이 필요한 환경에서 여전히 사용되며, Word2Vec도 가볍고 해석하기 쉬운 임베딩이 필요한 경우 활용됩니다.
이 흐름은 완전한 NLP 연대표인가?
아닙니다. 실제 자연어 처리의 역사에는 규칙 기반 시스템, 통계적 언어 모델, n-gram, CNN, GRU, Seq2Seq, Attention, BERT 등 많은 기술이 함께 존재합니다. 이 페이지는 현대 NLP를 이해하는 데 필요한 대표적인 흐름만 단순화하여 정리한 것입니다.
Summary

학습 내용 정리

이번 장에서는 자연어 처리 기술이 발전해 온 대표적인 흐름을 살펴보았습니다.

  • RNN은 문장을 순서대로 처리하여 단어의 순서를 반영했습니다.
  • LSTM은 필요한 정보를 오래 기억하도록 RNN의 기억 구조를 보완했습니다.
  • Word2Vec은 단어를 의미를 가진 벡터로 표현하는 방법을 확산시켰습니다.
  • Transformer는 셀프 어텐션과 병렬 처리를 통해 긴 문맥을 효과적으로 학습했습니다.
  • LLM은 Transformer를 대규모로 사전학습하여 여러 자연어 처리 작업을 하나의 모델로 수행합니다.

이후 장에서는 이 흐름의 출발점인 RNN부터 차례대로 살펴보며, 각 모델이 문장을 어떻게 읽고 학습하는지 더 자세히 알아봅니다.