논문 개요

현재 LLM 연구와 평가는 영어 중심으로 이루어지고 있습니다. MMLU, HumanEval, GSM8K 같은 주요 벤치마크들은 영어만을 다루며, LLM의 다국어 능력에 대한 체계적 평가가 부족합니다. 전 세계 인구의 약 80%는 영어가 모국어가 아님에도 불구하고, AI 기술의 혜택이 영어권에 편중되어 있다는 공정성 문제가 제기되고 있습니다.

MEGAVERSE(Ahuja et al., 2023)는 이 문제를 정면으로 다루는 대규모 다국어 벤치마크입니다. ACL 2024에 발표된 이 논문은 22개 언어, 83개 데이터셋을 아우르며, 다양한 LLM의 다국어 성능을 체계적으로 평가합니다.

“MEGA” 시리즈(Massive Evaluation of Language Abilities)의 확장판인 MEGAVERSE는 텍스트 전용 평가를 넘어 멀티모달(텍스트+이미지) 평가까지 포함하며, “VERSE”는 다양성(diversity)을 의미합니다.

핵심 기여

  1. 대규모 다국어 평가: 22개 언어(고자원부터 저자원까지)와 83개 데이터셋에 걸친 포괄적 평가 프레임워크를 구축합니다.

  2. 영어 편향 정량화: 영어와 비영어 성능 간의 격차를 체계적으로 측정하고, 언어 자원 풍부도에 따른 성능 패턴을 분석합니다.

  3. 멀티모달 다국어 평가: 이미지-텍스트 멀티모달 태스크에서의 다국어 성능을 평가하는 새로운 측면을 추가합니다.

  4. 다양한 태스크 유형 포괄: 자연어 추론, 독해, 감성 분석, Machine Translation, 요약 등 다양한 태스크 유형에 걸쳐 평가합니다.

  5. 실용적 인사이트: 다국어 LLM 개발자와 연구자를 위한 구체적인 방향성을 제시합니다.

방법론 상세

언어 선택 기준

22개 언어는 다음 기준으로 선택되었습니다:

  • 자원 풍부도(Resource Level): 고자원(영어, 중국어, 스페인어, 프랑스어, 독일어 등), 중자원(터키어, 아랍어, 힌디어 등), 저자원(스와힐리어, 우르두어, 텔루구어 등)
  • 언어 계통 다양성: 인도유럽어족, 중국-티베트어족, 셈어족, 드라비다어족 등
  • 지리적 분포: 아시아, 유럽, 아프리카, 중동 등

언어 자원 풍부도를 정량화하기 위해 Wikipedia 문서 수, CC-100 코퍼스 크기 등을 프록시로 사용합니다:

여기서 는 언어 의 웹 코퍼스 크기입니다.

83개 데이터셋 구성

데이터셋은 다음 태스크 카테고리로 구성됩니다:

자연어 이해(NLU):

  • 자연어 추론(NLI): XNLI, MultiNLI 등
  • 독해 이해(RC): XQuAD, MLQA 등
  • 감성 분석: 언어별 감성 데이터셋
  • 상식 추론: X-CSQA, XCOPA 등

자연어 생성(NLG):

  • Machine Translation
  • 요약
  • 질문 생성

멀티모달:

  • 이미지 캡셔닝 (다국어)
  • 시각적 질문 응답(VQA) (다국어)

평가 프로토콜

모든 모델을 동일한 프롬프트 형식으로 평가합니다. 기본 프롬프트는 영어로 작성되며, 언어별로 번역된 버전도 사용합니다:

영어 프롬프트 (EN-prompt):

Passage: {passage}
Question: {question}
Options: A) ... B) ... C) ... D) ...
Answer:

타겟 언어 프롬프트 (TGT-prompt):

[타겟 언어로 번역된 동일 형식]

두 프롬프트 방식의 성능 차이를 분석하여 모델이 언어 간 지시를 얼마나 잘 따르는지 측정합니다.

평가 지표

각 태스크의 표준 지표를 사용합니다:

  • 분류 태스크: 정확도(Accuracy)
  • 독해 QA: F1 점수
  • 번역: BLEU, chrF
  • 요약: ROUGE

다국어 성능 비교를 위해 언어별 점수의 평균과 분산을 분석합니다:

높은 는 언어 간 성능 불균형이 심함을 의미합니다.

실험 결과

영어 편향 확인

모든 모델에서 영어 성능이 다른 언어보다 유의미하게 높습니다. 영어 대비 성능 저하율:

모델영어 성능평균 다국어 성능격차
GPT-482.371.410.9
GPT-3.574.159.214.9
mT5-XXL65.853.112.7
LLaMA-2-70B70.248.721.5

영어 전용 사전학습 모델(LLaMA-2)은 다국어 모델(mT5)보다 다국어 격차가 더 큽니다.

언어 자원 풍부도와 성능 상관관계

언어 자원 풍부도와 성능 사이에는 강한 양의 상관관계가 있습니다:

이는 모델이 사전학습 데이터에서 더 많이 노출된 언어일수록 더 잘 수행함을 의미합니다.

저자원 언어(스와힐리어, 우르두어, 텔루구어 등)에서의 성능은 고자원 언어 대비 15~30%p 낮습니다.

영어 vs. 타겟 언어 프롬프트

흥미롭게도, 많은 모델에서 영어 프롬프트로 비영어 질문에 답하도록 했을 때와 타겟 언어 프롬프트를 사용했을 때의 성능 차이가 있습니다:

  • 고자원 언어: 타겟 언어 프롬프트가 더 효과적인 경우가 많음
  • 저자원 언어: 영어 프롬프트가 더 효과적인 경우가 많음 (모델이 해당 언어의 지시를 따르는 능력이 부족하기 때문)

멀티모달 다국어 평가

VQA 및 이미지 캡셔닝 태스크에서도 동일한 영어 편향 패턴이 관찰됩니다. 텍스트 전용 태스크보다 멀티모달 태스크에서 언어 간 격차가 더 크게 나타나는 경향이 있습니다. 이는 시각-언어 정렬 학습도 영어 데이터에 편중되어 있기 때문입니다.

모델별 다국어 강인성

다국어 성능의 일관성을 측정하는 지표로 언어 간 표준편차 를 사용합니다. 가 낮을수록 언어 간 성능이 균일합니다:

  • mT5, mBERT 등 다국어 전용 모델: 낮은 (균일한 다국어 성능)
  • GPT-4: 중간
  • 영어 전용 LLaMA 계열: 높은 (큰 언어 간 격차)

의의 및 한계

의의

AI 형평성 연구: MEGAVERSE는 AI 기술의 언어적 불평등 문제를 구체적인 숫자로 증명합니다. 영어 화자가 얻는 AI의 혜택을 비영어권 사람들도 동등하게 받기 위해서는 다국어 능력 향상이 필수적임을 강조합니다.

다국어 LLM 개발 방향 제시: 어떤 언어에서 어떤 태스크가 약한지를 세밀하게 파악함으로써, 다국어 모델 개발자들에게 구체적인 개선 방향을 제시합니다.

포괄적 평가 인프라: 83개 데이터셋을 통합 관리하고 평가하는 인프라를 공개하여, 후속 다국어 LLM 연구의 기반을 제공합니다.

멀티모달 확장: 텍스트 전용 다국어 평가를 넘어 멀티모달까지 확장함으로써, 미래의 멀티모달 다국어 AI 평가에 대한 선행 연구를 제공합니다.

한계

  • 번역 품질 의존성: 다국어 데이터셋 중 일부는 영어 원본을 Machine Translation한 것이어서, 번역 품질이 평가의 신뢰성에 영향을 줍니다.
  • 언어 커버리지: 22개 언어는 세계 6500여 개 언어 중 극소수에 불과하며, 극저자원 언어나 구술 언어(written form이 없는)는 포함되지 않습니다.
  • 문화적 맥락: 언어 능력과 별개로, 문화 특유의 지식이나 관점이 필요한 태스크에서의 평가가 부족합니다.
  • 방언 미포함: 아랍어의 경우 표준 아랍어(MSA)만 평가하며, 다양한 지역 방언은 포함되지 않습니다.
  • 코드 생성 미포함: 프로그래밍 언어가 포함된 코드 생성/이해 태스크는 평가 범위에서 제외됩니다.