기계 번역이란?
기계 번역(Machine Translation, MT)은 한 언어로 작성된 문장의 의미를 파악한 뒤, 그 의미를 다른 언어의 자연스러운 문장으로 표현하는 자연어 처리 작업입니다.
번역할 원래 문장을 원문(Source Text), 번역 결과로 생성되는 문장을 목표 문장(Target Text)이라고 합니다. 기계 번역은 미리 정해진 번호를 고르는 분류 작업이 아니라, 새로운 단어를 차례대로 생성하는 텍스트 생성 작업에 해당합니다.
(Source Text)
(Translation Model)
(Target Text)
번역 모델은 무엇을 학습하는가?
단어를 하나씩 바꾸면 왜 자연스럽지 않은가?
번역 과정 이해하기
실제 번역 모델의 내부 계산은 복잡하지만, 입문 단계에서는 다음 세 과정으로 이해할 수 있습니다.
예제로 살펴보는 기계 번역
문장의 핵심 의미는 오늘의 날씨가 좋다는 것입니다.
한국어의 자연스러운 어순과 표현에 맞게 문장이 다시 구성됩니다.
영어와 한국어의 단어 순서가 다른데도 번역할 수 있는 이유
기계 번역이 어려운 이유
하나의 문장은 단어의 사전적 의미만으로 해석되지 않습니다. 문맥과 상황, 언어별 표현 방식까지 고려해야 하기 때문에 기계 번역에는 여러 어려움이 있습니다.
기계 번역 실습
예시 문장을 선택하고 번역 버튼을 눌러 원문과 번역문의 차이를 확인해 보겠습니다. 이 실습은 번역 과정의 출력 형태를 이해하기 위한 예시입니다.
실제 번역 결과는 사용하는 모델, 학습 데이터, 문맥 정보와 생성 설정에 따라 달라질 수 있습니다.
기계 번역 모델의 학습 데이터
기계 번역 모델은 일반적으로 같은 의미를 가진 서로 다른 언어의 문장을 짝지은 병렬 말뭉치(Parallel Corpus)를 사용해 학습합니다.
정답 번역은 반드시 하나뿐인가?
학습 내용 정리
이번 장에서는 기계 번역의 기본 개념과 처리 과정을 살펴보았습니다.
- 기계 번역은 한 언어의 문장을 다른 언어의 문장으로 바꾸는 텍스트 생성 작업입니다.
- 모델은 단어를 하나씩 치환하지 않고, 문장 전체의 의미와 문맥을 파악하여 목표 언어의 문장을 생성합니다.
- 언어마다 어순, 문법, 관용 표현과 높임 방식이 다르므로 자연스러운 번역에는 문맥 이해가 필요합니다.
- 번역 모델은 주로 원문과 번역문이 짝을 이룬 병렬 말뭉치를 이용해 학습합니다.
이후 학습할 RNN, LSTM, Attention, Transformer는 번역 모델이 문장의 의미를 표현하고 목표 문장을 생성하는 방식을 이해하기 위한 핵심 기술입니다.