Part 1 · Natural Language Processing - Evaluating NLP Models

좋은 모델은 어떻게 판단할 수 있을까

모델이 높은 정확도를 보인다고 해서 항상 좋은 모델이라고 말할 수는 없습니다. 어떤 문제에서는 틀리지 않는 것이 중요하고, 어떤 문제에서는 놓치지 않는 것이 더 중요하기 때문입니다. 자연어 처리에서는 다양한 평가 지표를 함께 사용해 모델의 성능을 분석합니다. 이 장에서는 혼동 행렬과 주요 평가 지표가 각각 무엇을 의미하는지 이해합니다.

Why Evaluation?

모델 평가는 왜 필요한가?

학습이 끝난 모델도 새로운 데이터에서 항상 정답을 맞히는 것은 아닙니다. 따라서 모델의 예측과 실제 정답을 비교하여 오류의 종류와 성능 수준을 객관적으로 확인해야 합니다.

하나의 지표만 보면 성능을 잘못 해석할 수 있으므로, 데이터 분포와 업무 목적에 맞춰 여러 지표를 함께 살펴보아야 합니다.
Confusion Matrix

예측 결과 비교표(Confusion Matrix, 혼동 행렬)

혼동 행렬은 실제 정답과 모델의 예측을 비교하여 네 가지 경우로 구분한 표입니다. 여기서는 이해를 돕기 위해 양성과 음성의 두 범주를 가정합니다.

TP (True Positive) 실제로 관심 대상인 데이터를 모델도 관심 대상으로 올바르게 예측한 경우입니다.
FP (False Positive) 실제로는 관심 대상이 아닌 데이터를 모델이 관심 대상이라고 잘못 예측한 경우입니다.
FN (False Negative) 실제로는 관심 대상이지만 모델이 대상이 아니라고 잘못 판단한 경우입니다.
TN (True Negative) 실제로 관심 대상이 아닌 데이터를 모델도 대상이 아니라고 올바르게 예측한 경우입니다.
FP와 FN 중 무엇이 더 중요한가?
업무에 따라 다릅니다. 스팸 필터에서는 정상 메일을 스팸으로 분류하는 FP가 문제가 될 수 있고, 질병 탐지에서는 실제 환자를 놓치는 FN이 더 치명적일 수 있습니다.
Interactive Calculator

평가 지표 계산 실습

실제 양성·음성 개수와 모델이 맞힌 개수(TP, TN)를 입력하면 FN과 FP, 주요 평가 지표가 자동으로 계산됩니다.

TP + FN
TN + FP
실제 양성 중 맞힌 개수
실제 음성 중 맞힌 개수
실제 양성 전체 − TP
실제 음성 전체 − TN
예측 양성
예측 음성
실제 양성
TP
80
FN
20
실제 음성
FP
10
TN
90
정확도(Accuracy)
(TP + TN) / 전체

전체 데이터 중 올바르게 예측한 비율입니다.

정밀도(Precision)
TP / (TP + FP)

양성이라고 예측한 것 중 실제 양성의 비율입니다.

재현율(Recall)
TP / (TP + FN)

실제 양성 중 모델이 찾아낸 비율입니다.

F1 점수
2PR / (P + R)

정밀도와 재현율의 균형을 나타냅니다.

Interpretation

지표 해석 시 주의점

정확도만으로 충분하지 않은 경우

전체의 99%가 정상 데이터인 상황에서 모든 데이터를 정상으로 예측해도 정확도는 99%입니다. 그러나 중요한 이상 데이터를 전혀 찾지 못하므로 좋은 모델이라고 보기 어렵습니다.

정밀도와 재현율의 선택

잘못된 경보를 줄이는 것이 중요하면 정밀도를, 중요한 대상을 놓치지 않는 것이 중요하면 재현율을 더 중시합니다.

NER 평가의 특징

NER은 개별 토큰의 태그가 맞는지 보는 토큰 수준 평가와 개체의 시작·끝·유형이 모두 정확한지 보는 엔터티 수준 평가가 다릅니다.

Summary

학습 내용 정리

  • 혼동 행렬은 예측 결과를 TP, FP, FN, TN으로 구분합니다.
  • 정확도는 전체 정답 비율, 정밀도는 양성 예측의 신뢰도, 재현율은 실제 양성의 탐지율입니다.
  • F1 점수는 정밀도와 재현율을 함께 고려합니다.
  • 적절한 평가 지표는 데이터 분포와 실제 업무 목적에 따라 달라집니다.