Part 1 · Natural Language Processing - Machine Translation

언어를 넘어 의미를 전달하는 기술

번역은 단어를 다른 언어로 바꾸는 작업이 아닙니다. 문장의 의미와 문맥을 이해한 뒤, 다른 언어에서도 같은 의미가 전달되도록 다시 표현하는 과정입니다. 기계 번역은 이러한 과정을 컴퓨터가 수행하도록 만드는 대표적인 생성형 자연어 처리 기술입니다. 이 장에서는 문맥과 단어의 순서가 왜 중요한지 함께 살펴봅니다.

Concept

기계 번역이란?

기계 번역(Machine Translation, MT)은 한 언어로 작성된 문장의 의미를 파악한 뒤, 그 의미를 다른 언어의 자연스러운 문장으로 표현하는 자연어 처리 작업입니다.

번역할 원래 문장을 원문(Source Text), 번역 결과로 생성되는 문장을 목표 문장(Target Text)이라고 합니다. 기계 번역은 미리 정해진 번호를 고르는 분류 작업이 아니라, 새로운 단어를 차례대로 생성하는 텍스트 생성 작업에 해당합니다.

기계 번역의 목표는 원문의 단어를 하나씩 바꾸는 것이 아니라, 원문의 의미를 유지하면서 목표 언어에 자연스럽게 맞는 문장을 생성하는 것입니다.
원문
(Source Text)
→
번역 모델
(Translation Model)
→
목표 문장
(Target Text)
번역 모델은 무엇을 학습하는가?
번역 모델은 같은 의미를 나타내는 두 언어의 문장 쌍을 학습합니다. 이 과정에서 단어의 대응 관계뿐 아니라 문장 구조, 어순, 문맥, 관용 표현과 같은 언어적 규칙도 함께 학습합니다.
단어를 하나씩 바꾸면 왜 자연스럽지 않은가?
언어마다 어순과 문법 구조가 다르고, 같은 단어도 문맥에 따라 의미가 달라집니다. 또한 관용 표현은 단어를 그대로 번역하면 원래 의미가 사라질 수 있습니다. 따라서 번역 모델은 문장 전체의 의미를 고려해 목표 문장을 다시 구성해야 합니다.
Translation Process

번역 과정 이해하기

실제 번역 모델의 내부 계산은 복잡하지만, 입문 단계에서는 다음 세 과정으로 이해할 수 있습니다.

1. 원문 분석 입력 문장을 토큰 단위로 나누고, 각 토큰이 문장 안에서 어떤 의미와 역할을 갖는지 파악합니다.
2. 문맥 표현 구성 단어 하나만 따로 보지 않고, 앞뒤 단어와 문장 전체의 관계를 종합하여 원문의 의미를 내부 표현으로 만듭니다.
3. 목표 문장 생성 목표 언어의 문법과 어순에 맞게 다음 토큰을 하나씩 예측하면서 번역문을 생성합니다.
중요한 점 좋은 번역은 원문의 의미를 보존하는 동시에 목표 언어를 사용하는 사람이 자연스럽게 읽을 수 있어야 합니다.
Worked Example

예제로 살펴보는 기계 번역

원문 · 영어 The weather is nice today.

문장의 핵심 의미는 오늘의 날씨가 좋다는 것입니다.

→
번역문 · 한국어 오늘 날씨가 좋습니다.

한국어의 자연스러운 어순과 표현에 맞게 문장이 다시 구성됩니다.

영어와 한국어의 단어 순서가 다른데도 번역할 수 있는 이유
번역 모델은 단어의 위치를 그대로 복사하지 않습니다. 먼저 문장의 의미와 단어 사이의 관계를 파악한 뒤, 목표 언어의 어순에 맞추어 새로운 문장을 생성합니다.
Translation Challenges

기계 번역이 어려운 이유

하나의 문장은 단어의 사전적 의미만으로 해석되지 않습니다. 문맥과 상황, 언어별 표현 방식까지 고려해야 하기 때문에 기계 번역에는 여러 어려움이 있습니다.

문맥에 따른 의미 변화 영어의 bank는 문맥에 따라 은행이나 강둑을 의미할 수 있습니다. 모델은 주변 단어를 함께 살펴 올바른 의미를 선택해야 합니다.
서로 다른 어순과 문법 영어와 한국어는 기본 어순과 조사·전치사의 사용 방식이 다릅니다. 단어 대응만으로는 자연스러운 문장을 만들기 어렵습니다.
관용 표현과 비유 “Break a leg”을 단어 그대로 번역하면 의미가 왜곡됩니다. 표현 전체가 ‘행운을 빈다’는 뜻임을 이해해야 합니다.
생략과 높임 표현 한국어는 주어를 자주 생략하고 상대에 따라 높임말이 달라집니다. 번역 모델은 문맥에 맞는 표현 수준을 선택해야 합니다.
Interactive Example

기계 번역 실습

예시 문장을 선택하고 번역 버튼을 눌러 원문과 번역문의 차이를 확인해 보겠습니다. 이 실습은 번역 과정의 출력 형태를 이해하기 위한 예시입니다.

원문 · 영어 A cute teddy bear is reading.
→
번역문 · 한국어 귀여운 곰 인형이 책을 읽고 있습니다.

실제 번역 결과는 사용하는 모델, 학습 데이터, 문맥 정보와 생성 설정에 따라 달라질 수 있습니다.

Training Data

기계 번역 모델의 학습 데이터

기계 번역 모델은 일반적으로 같은 의미를 가진 서로 다른 언어의 문장을 짝지은 병렬 말뭉치(Parallel Corpus)를 사용해 학습합니다.

WMT 데이터셋 여러 언어 쌍의 뉴스 문장과 번역문을 제공하며, 기계 번역 연구와 모델 성능 비교에 널리 사용됩니다.
OPUS 자막, 국제기구 문서, 소프트웨어 번역 등 다양한 출처의 다국어 병렬 문장을 모은 공개 데이터 모음입니다.
도메인 특화 번역 데이터 의료, 법률, 금융처럼 전문 용어가 많은 분야에서는 해당 분야의 문장과 번역문을 별도로 학습해야 합니다.
데이터 품질의 중요성 잘못 정렬되거나 부정확한 번역문이 많으면 모델도 잘못된 표현을 학습할 수 있으므로, 문장 쌍의 정확성과 일관성이 중요합니다.
정답 번역은 반드시 하나뿐인가?
아닙니다. 하나의 원문도 여러 방식으로 자연스럽게 번역할 수 있습니다. 따라서 기계 번역은 정답이 항상 하나로 고정되는 문제가 아니며, 의미 보존과 자연스러움을 함께 고려해야 합니다.
Summary

학습 내용 정리

이번 장에서는 기계 번역의 기본 개념과 처리 과정을 살펴보았습니다.

  • 기계 번역은 한 언어의 문장을 다른 언어의 문장으로 바꾸는 텍스트 생성 작업입니다.
  • 모델은 단어를 하나씩 치환하지 않고, 문장 전체의 의미와 문맥을 파악하여 목표 언어의 문장을 생성합니다.
  • 언어마다 어순, 문법, 관용 표현과 높임 방식이 다르므로 자연스러운 번역에는 문맥 이해가 필요합니다.
  • 번역 모델은 주로 원문과 번역문이 짝을 이룬 병렬 말뭉치를 이용해 학습합니다.

이후 학습할 RNN, LSTM, Attention, Transformer는 번역 모델이 문장의 의미를 표현하고 목표 문장을 생성하는 방식을 이해하기 위한 핵심 기술입니다.