단어 단위 토큰화 (Word-Level Tokenization)
완전한 단어문장을 공백과 문장부호를 기준으로 나누어 완전한 단어를 하나의 토큰으로 사용하는 방식입니다.
A cute teddy bear is reading.
사람이 이해하기 쉽고, 한 문장을 비교적 적은 수의 토큰으로 표현할 수 있습니다.
새로운 단어가 등장할 때마다 어휘 사전에 추가해야 하므로 사전이 매우 커질 수 있습니다.
Part 2 · Tokenization - Tokenization Methods
문장을 어떤 기준으로 나누느냐에 따라 언어 모델이 바라보는 입력의 형태는 크게 달라집니다. 같은 문장이라도 단어 단위, 문자 단위, 서브워드 단위로 서로 다른 결과를 만들 수 있습니다. 이 장에서는 대표적인 토큰화 방법을 비교하며 각각의 장점과 한계를 살펴봅니다.
토큰화는 문장을 작은 입력 단위로 나누는 과정이지만, 어디에서 끊을지는 하나의 정답으로 정해져 있지 않습니다.
완전한 단어를 하나의 토큰으로 사용할 수도 있고, 문자 하나씩 나눌 수도 있으며, 단어보다 작은 조각인 서브워드를 사용할 수도 있습니다.
문장을 공백과 문장부호를 기준으로 나누어 완전한 단어를 하나의 토큰으로 사용하는 방식입니다.
A cute teddy bear is reading.
단어나 문장을 구성하는 문자 하나하나를 토큰으로 사용하는 방식입니다.
A cute
자주 등장하는 단어는 하나의 토큰으로 유지하고, 드문 단어나 긴 단어는 더 작은 조각으로 나누는 방식입니다.
A cute teddy bear is reading.
| 방식 | 기본 단위 | 어휘 사전 크기 | 문장의 토큰 수 | 처음 보는 단어 처리 |
|---|---|---|---|---|
| 단어 단위 | 완전한 단어 | 매우 큼 | 적음 | 어려움 |
| 문자 단위 | 개별 문자 | 작음 | 매우 많음 | 쉬움 |
| 서브워드 단위 | 자주 쓰이는 단어 조각 | 중간 | 중간 | 비교적 쉬움 |
이번 장에서는 대표적인 세 가지 토큰화 방법을 비교했습니다.
다음 장에서는 서브워드 토큰화가 처음 보는 단어를 어떻게 처리하는지, 그리고 BPE와 WordPiece 같은 대표적인 알고리즘이 어떻게 동작하는지 살펴봅니다.