논문 개요

GPT-3의 등장으로 대규모 언어 모델이 제로샷·퓨샷 학습 능력을 가질 수 있음이 알려졌지만, 이 능력이 단순히 모델 규모에서 비롯된 것인지, 아니면 학습 방식에서 비롯된 것인지에 대한 질문이 남았습니다. Sanh et al.(2021)의 T0 논문은 이 질문에 답하며, ICLR 2022에 발표되었습니다.

핵심 주장은 다음과 같습니다: 다양한 태스크에 대한 다양한 프롬프트 형식으로 멀티태스크 학습(multitask prompted training)을 수행하면, 모델 규모와 무관하게 강력한 제로샷 일반화 능력을 획득할 수 있다. T5(11B)를 이 방식으로 학습시킨 T0는 GPT-3(175B)에 비해 16배 작지만, 많은 제로샷 벤치마크에서 GPT-3를 능가합니다.

이 연구는 BigScience 프로젝트의 일환으로 수행되었으며, 모델과 데이터셋, 프롬프트 풀 모두 공개적으로 배포되어 연구 커뮤니티에 큰 기여를 했습니다.

핵심 기여

  1. Public Prompt Pool (P3) 구축: PromptSource 툴을 이용해 커뮤니티가 수집한 약 2000개의 자연어 프롬프트 데이터베이스를 공개합니다. 각 프롬프트는 다양한 NLP 태스크를 자연어 지시 형태로 표현합니다.

  2. 멀티태스크 프롬프트 학습: 62개의 서로 다른 NLP 데이터셋에 걸쳐 다양한 프롬프트 형식으로 T5를 파인튜닝합니다. 이때 테스트 태스크들은 학습에서 완전히 제외됩니다.

  3. 규모 효율성 증명: 175B GPT-3 대비 11B T0로 동등하거나 우수한 제로샷 성능을 달성합니다.

  4. 프롬프트 다양성의 중요성 규명: 단일 프롬프트로 학습하는 것보다 다양한 형식의 프롬프트로 학습할수록 제로샷 일반화가 향상됨을 보입니다.

방법론 상세

Public Prompt Pool (P3)

P3는 PromptSource라는 협업 툴을 통해 구축된 대규모 프롬프트 데이터베이스입니다. 각 NLP 태스크에 대해 여러 명의 연구자가 서로 다른 자연어 프롬프트를 작성합니다.

예를 들어 감성 분석 태스크(SST-2)에 대해:

  • 프롬프트 1: “다음 리뷰의 감정은 무엇인가요? {review} 긍정 또는 부정으로 답하세요.”
  • 프롬프트 2: “이 리뷰를 읽고 영화를 추천하겠습니까? {review}”
  • 프롬프트 3: “{review} - 이 리뷰의 전반적인 감정은?”

동일한 태스크를 다양한 방식으로 표현함으로써, 모델이 태스크의 본질을 더 깊이 이해하도록 유도합니다.

학습 데이터 구성

학습에는 다음 카테고리의 데이터셋이 포함됩니다:

  • 텍스트 분류: 감성 분석, 주제 분류, 자연어 추론 등
  • 질문 응답: 추출형 QA, 다지선다형 QA 등
  • 요약: CNN/DailyMail 등
  • 구조화 지식 생성: 테이블-텍스트 변환 등

각 데이터셋마다 여러 개의 프롬프트 형식을 사용하므로, 실질적인 (데이터셋, 프롬프트) 쌍의 수는 훨씬 많습니다.

테스트 태스크는 학습에서 완전히 제외됩니다. 이를 통해 真제로샷(true zero-shot) 일반화 능력을 평가합니다.

학습 목표

T5의 시퀀스-투-시퀀스 구조에서, 입력 프롬프트가 주어졌을 때 정답 레이블을 생성하도록 학습합니다:

여기서 는 입력 에 프롬프트 템플릿 를 적용한 것이고, 는 정답 출력입니다. 멀티태스크 학습은 모든 태스크의 손실을 균일하게 혼합합니다.

T0 모델 변형

논문은 여러 변형 모델을 제안합니다:

  • T0: T5-11B 기반, 전체 학습 태스크 사용
  • T0+: 추가 태스크 포함 (GPT-3 평가 태스크 일부)
  • T0++: 더 많은 태스크 포함
  • T0-3B: T5-3B 기반 경량 버전

실험 결과

제로샷 벤치마크 성능

평가는 BIG-bench의 일부, SuperGLUE 등에서 수행되며, 이 태스크들은 모두 학습 데이터에서 제외되었습니다.

SuperGLUE 결과 (GPT-3와의 비교):

모델파라미터SuperGLUE 평균
GPT-3 (few-shot)175B71.8
T0 (zero-shot)11B75.4

T0는 GPT-3보다 16배 작지만 퓨샷 GPT-3를 능가하는 제로샷 성능을 보입니다.

프롬프트 다양성의 효과

단일 프롬프트 vs. 다중 프롬프트로 학습했을 때의 차이:

다중 프롬프트 학습 시 평균 제로샷 성능이 약 3~5%p 향상됩니다. 이는 다양한 형식의 프롬프트에 노출될수록 모델이 태스크의 본질적 구조를 더 잘 파악하게 됨을 시사합니다.

수식으로, 개의 프롬프트 형식 로 학습할 때의 목표는:

태스크 수의 영향

더 많은 다양한 태스크로 학습할수록 제로샷 일반화가 향상되는 경향을 보입니다. 태스크 수가 증가함에 따라 성능이 로그 스케일로 증가하는 패턴이 관찰됩니다. 이는 더 다양한 태스크를 포함할수록 일반적인 지시 따르기 능력이 향상됨을 보여줍니다.

T0-3B의 효율성

3B 파라미터의 T0-3B조차도 GPT-3(175B)에 비해 많은 태스크에서 경쟁력 있는 성능을 보입니다. 이는 올바른 학습 방식이 모델 규모를 상당 부분 대체할 수 있음을 의미합니다.

의의 및 한계

의의

FLAN과의 동시대적 발견: FLAN(Wei et al., 2021)과 거의 동시에 발표되어, 멀티태스크 지시 튜닝의 효과를 독립적으로 확인합니다. T0는 오픈소스이고 FLAN의 LaMDA는 미공개였다는 점에서 연구 커뮤니티에 더 큰 직접적 기여를 했습니다.

오픈 AI 생태계 구축: 모델(Hugging Face Hub), 데이터셋(P3), 프롬프트 작성 도구(PromptSource)를 모두 공개하여 후속 연구를 가능하게 했습니다.

지시 튜닝 연구의 기초: InstructGPT, FLAN-T5, Alpaca 등 이후 지시 튜닝 연구의 중요한 토대가 되었습니다.

효율적 스케일링: “적절한 방식으로 학습된 작은 모델 > 잘못 학습된 큰 모델”이라는 메시지를 실증합니다.

한계

  • 생성 품질: T5는 인코더-디코더 구조로 분류/추출 태스크에 강하지만, 긴 자유 형식 텍스트 생성에서는 GPT 계열 모델에 비해 약할 수 있습니다.
  • 복잡한 추론: 수학 문제 풀이, 코드 생성 등 복잡한 추론이 필요한 태스크에서는 여전히 한계를 보입니다.
  • 프롬프트 선택 편향: P3에 포함된 프롬프트 스타일에 의존하기 때문에, 훈련 분포 밖의 새로운 프롬프트 형식에는 덜 견고할 수 있습니다.
  • 다국어 지원 미흡: 주로 영어 태스크로 구성되어 있어 다국어 일반화 능력에 한계가 있습니다.