같은 문장도 질문에 따라 보는 위치가 달라진다
사람을 찾으므로 Tom을 가장 많이 봅니다.
행동을 찾으므로 lives를 가장 많이 봅니다.
장소를 찾으므로 New York을 가장 많이 봅니다.
한 번의 Attention은 한 관점에 집중하기 쉽다
한 Attention이 사람 관계를 잘 보고 있다고 생각해 봅시다. 그러면 Tom에는 큰 비중을 주지만, 장소나 행동 관계는 충분히 보지 못할 수 있습니다.
Tom은 사람입니다.
lives는 행동입니다.
New York은 장소입니다.
이 관계를 모두 함께 보는 편이 문장을 더 잘 이해할 수 있습니다.
여러 전문가가 같은 회의를 보는 것과 같다
하나의 프로젝트 회의에 여러 전문가가 참여한다고 생각해 봅시다. 모두 같은 회의를 듣지만 각자 중요하게 보는 부분은 다릅니다.
기획자
무엇을 만들지, 목표가 무엇인지 봅니다.
개발자
어떻게 구현할지, 기술 관계를 봅니다.
디자이너
사용자 경험과 화면 구성을 봅니다.
운영 담당
언제, 어디에서, 어떻게 운영할지 봅니다.
Transformer는 여러 Attention을 동시에 사용한다
Head 1
사람 관계에 집중Head 2
장소 관계에 집중Head 3
행동 관계에 집중Head 4
전체 연결 관계에 집중여러 Head는 같은 문장을 서로 다르게 본다
Head를 선택해 서로 다른 관점을 확인해 보자
아래 Head 버튼을 누르면 같은 문장을 어떤 관점으로 보는지 달라집니다.
현재 Head의 관점
Attention Weight
여러 Head의 결과를 합치면 더 풍부한 표현이 된다
Head 1 결과
누가 행동하는지에 대한 정보
Head 2 결과
어디에서 일어나는지에 대한 정보
Head 3 결과
어떤 행동인지에 대한 정보
Head 4 결과
문장 전체 연결 관계에 대한 정보
Single-Head와 Multi-Head의 차이
한 가지 관점으로 문장을 살펴봅니다.
특정 관계는 잘 볼 수 있지만 다른 관계를 놓칠 수 있습니다.
여러 관점으로 문장을 동시에 살펴봅니다.
사람, 행동, 장소, 문법 관계 등 다양한 정보를 함께 담을 수 있습니다.
여러 Head의 결과는 실제로 어떻게 하나로 합칠까?
각 Head는 자신만의 새로운 벡터를 만듭니다. Transformer는 이 결과들을 옆으로 이어 붙인 뒤, 다시 하나의 벡터로 정리합니다.
핵심 정리
- 한 번의 Attention은 한 가지 관점에 집중하기 쉽습니다.
- 문장에는 사람, 행동, 장소, 문법 관계 등 여러 정보가 함께 들어 있습니다.
- Transformer는 여러 Attention Head를 동시에 사용합니다.
- 각 Head는 같은 문장을 서로 다른 관점으로 살펴봅니다.
- Head의 역할은 사람이 직접 지정하지 않고 학습 과정에서 형성됩니다.
- 여러 Head의 결과를 합치면 더 풍부한 문맥 표현을 만들 수 있습니다.
- 이 구조를 Multi-Head Attention이라고 합니다.