A Human Reading Strategy
사람은 모든 단어를 똑같이 기억하지 않는다
우리는 긴 문장을 읽을 때 모든 단어를 같은 강도로 기억하지 않습니다.
질문을 받으면 문장 전체를 다시 훑어보고, 답과 관련 있는 부분에 집중합니다.
Tom, who lived in New York for ten years
before moving to Paris, finally met his old friend yesterday.
질문: Tom은 어디에서 10년 동안 살았을까요?
질문 확인무엇을 찾아야 하는가?
문장 다시 보기전체 내용을 확인
관련 위치 찾기New York에 집중
답 선택필요한 정보만 사용
사람은 문장 전체를 하나의 기억으로만 압축하지 않습니다.
필요하면 원래 문장으로 돌아가 관련 부분을 다시 참고합니다.
How RNN Reads
RNN은 문장을 순서대로 읽는다
RNN은 첫 단어부터 마지막 단어까지 한 단계씩 처리합니다.
각 단계에서 현재 단어와 이전 Hidden State를 이용해 새로운 Hidden State를 만듭니다.
Tom
who
lived
in
New York
for
ten years
...
이전 정보
hₜ₋₁
+
현재 단어
xₜ
→
새로운 기억
hₜ
RNN은 과거의 정보를 Hidden State에 계속 담아 다음 단계로 전달합니다.
즉, 앞에서 읽은 내용을 하나의 상태 벡터에 압축해서 이어가는 방식입니다.
The Bottleneck
긴 문장에서는 초반 정보가 약해질 수 있다
문장이 짧다면 Hidden State만으로도 충분할 수 있습니다.
하지만 문장이 길어질수록 초반의 중요한 정보는 여러 계산 단계를 거쳐 전달되어야 합니다.
New York중요 정보
단어 1
단어 2
단어 3
단어 4
마지막 단계
문장 초반 정보
New York
→
여러 Hidden State를 통과
계속 압축·변형
→
마지막 단계
정보가 약해질 수 있음
문제는 RNN이 항상 초반 정보를 잊는다는 뜻이 아닙니다.
다만 문장이 길어질수록 중요한 정보를 끝까지 안정적으로 전달하는 일이 어려워질 수 있다는 뜻입니다.
A Better Question
모든 정보를 끝까지 들고 갈 필요가 있을까?
필요한 정보가 문장 초반에 있다면,
그것을 Hidden State 안에 끝까지 보존하려고만 할 필요는 없습니다.
필요한 순간에 원래 문장의 필요한 위치를 직접 참고하면 어떨까?
질문 또는 현재 처리 위치무엇이 필요한가?
문장 전체 확인모든 위치를 후보로 봄
관련 위치에 더 집중New York의 비중 증가
필요한 정보 사용답이나 표현 생성
Attention의 출발점은 모든 정보를 하나의 기억에 억지로 담는 대신,
필요한 순간마다 관련 있는 정보를 직접 찾아 사용하자는 것입니다.
RNN vs Attention
기억을 전달하는 방식과 직접 참고하는 방식
RNN의 기본 방식
정보를 Hidden State에 압축해 단계마다 전달합니다.
현재 단계는 주로 이전 단계가 넘겨준 기억에 의존합니다.
Attention의 기본 방식
필요한 순간에 여러 입력 위치를 직접 살펴봅니다.
관련성이 높은 정보에 더 큰 비중을 주어 사용합니다.
Attention은 RNN을 단순히 더 크게 만든 기술이 아닙니다.
정보를 사용하는 방식을
순차적인 기억 전달에서 관련 위치의 직접 참조로 확장한 아이디어입니다.
From Attention to Transformer
이 아이디어는 Transformer의 핵심이 되었다
Attention은 처음에는 긴 입력에서 필요한 부분을 참고하기 위한 방법으로 사용되었습니다.
이후 같은 문장 안의 단어들이 서로를 직접 참고하는
Self-Attention으로 발전했습니다.
Attention필요한 입력 위치 참고
Self-Attention문장 내부 단어끼리 참고
TransformerSelf-Attention 중심 구조
LLM대규모 언어 모델의 기반
Attention과 Self-Attention은 완전히 같은 표현이 아닙니다.
다음 페이지에서는 먼저 Attention이 어떤 방식으로
“중요한 정보”를 선택하는지 살펴봅니다.
Summary
핵심 정리
- RNN은 앞의 정보를 Hidden State에 담아 순서대로 전달합니다.
- 문장이 길어지면 초반의 중요한 정보가 약해질 수 있습니다.
- 사람은 필요할 때 원래 문장의 관련 부분을 다시 참고합니다.
- Attention은 필요한 순간에 관련 있는 입력 위치를 직접 찾아 사용합니다.
- 이 아이디어는 Self-Attention과 Transformer로 발전했습니다.