논문 개요

“Scaling Instruction-Finetuned Language Models”(2022, JMLR)는 Google의 Hyung Won Chung 등이 발표한 연구로, **지시 파인튜닝(Instruction Finetuning, IFT)**의 세 가지 핵심 스케일링 요소를 체계적으로 분석한다. T5 계열(80M~11B)과 PaLM(62B, 540B)을 기반으로 FLAN(Finetuned Language Net) 모델 시리즈를 구축하며, 멀티태스크 지시 파인튜닝이 LLM의 제로샷·퓨샷 일반화 능력을 어떻게 향상시키는지를 규명한다.

지시 파인튜닝이란, 다양한 NLP 태스크를 자연어 지시문(instruction) 형태로 표현한 데이터로 파인튜닝하여 모델이 새로운 지시를 이해하고 따르는 능력을 학습시키는 방법이다. 이 논문은 그 효과를 결정하는 주요 변수들을 정밀하게 분석한 최초의 대규모 연구다.

핵심 기여

  1. FLAN 2022 데이터셋 구축: 공개 데이터셋에서 1836개 태스크, 473개 데이터셋을 수집·정규화하여 멀티태스크 파인튜닝 데이터를 구성.
  2. 스케일링 3요소 분석: 태스크 수, 모델 크기(80M~540B), CoT 데이터 포함 여부가 각각 성능에 미치는 영향 분석.
  3. FLAN-T5, FLAN-PaLM 출시: 동일 크기 베이스라인 대비 큰 폭의 성능 향상을 기록한 공개 모델 제공.
  4. CoT와 표준 IFT의 시너지: CoT 태스크와 비-CoT 태스크를 함께 학습하면 추론 능력과 일반 태스크 모두 향상됨을 발견.

방법론 상세

1. 태스크 믹스 구성

FLAN 2022 데이터셋은 네 가지 소스를 통합한다:

소스태스크 수특징
Muffin~62기존 FLAN 태스크
T0-SF~193T0 공개 태스크
NIV2~1554Natural Instructions v2
CoT~9사고 연쇄 추론 태스크

각 태스크에는 10개의 다양한 지시 템플릿이 붙어 총 약 18,000개 이상의 지시 표현이 존재한다.

2. 모델 설정

FLAN-T5: T5 아키텍처(인코더-디코더) 기반

  • 규모: 80M, 250M, 780M, 3B, 11B
  • 사전학습: C4 데이터로 Span-MLM 사전학습
  • 파인튜닝: FLAN 2022 데이터셋으로 멀티태스크

FLAN-PaLM: PaLM 아키텍처(디코더-온리) 기반

  • 규모: 8B, 62B, 540B
  • 사전학습: 780B 토큰의 고품질 웹 데이터

3. 세 가지 스케일링 축 분석

축 1: 태스크 수 스케일링

태스크 수를 늘릴수록 성능이 향상되지만, 어느 지점 이후로는 수익 감소가 나타난다:

약 100개 태스크부터 효과가 뚜렷해지고, 1000개 이상에서는 점진적 향상이 지속된다.

축 2: 모델 크기 스케일링

지시 파인튜닝의 효과는 모델 크기가 클수록 더 극적으로 증가한다:

  • 소형 모델(80M-1B): 지시 파인튜닝 후 약 5-10% 향상
  • 대형 모델(62B-540B): 지시 파인튜닝 후 약 15-25% 향상

이는 지시 파인튜닝이 **사전학습에서 획득한 잠재 능력을 표면화(surface)**하는 역할을 하기 때문으로 해석된다. 파라미터가 많을수록 잠재된 능력이 많아, 파인튜닝의 효과가 크다.

축 3: Chain-of-Thought 데이터 포함

CoT 태스크를 파인튜닝 믹스에 포함하면:

  • 추론 태스크(GSM8K, MATH 등)에서 큰 성능 향상
  • 비-추론 태스크에서도 소폭 향상 또는 유지
  • CoT 제외 시 추론 태스크에서 큰 성능 저하

4. 파인튜닝 설정

  • 학습률: 사전학습 학습률의 약 10%
  • 스텝 수: 데이터셋 크기에 비례, 일반적으로 수천~수만 스텝
  • 배치 크기: 모델 크기에 따라 256~2048
  • 팩킹(packing): 다수의 짧은 예시를 단일 시퀀스에 결합하여 학습 효율 향상

실험 결과

MMLU (5-shot) 비교

모델정확도
GPT-3 175B43.9%
PaLM 540B62.9%
FLAN-PaLM 540B75.2%
FLAN-T5-11B55.1%

FLAN-PaLM 540B는 GPT-3보다 30%p 이상 높은 성능.

BIG-Bench Hard (평균)

모델점수
PaLM 540B35.3%
FLAN-PaLM 540B (직접 프롬프팅)39.1%
FLAN-PaLM 540B (CoT 프롬팅)45.0%

인간 평가 (유용성, FLAN-T5-11B)

인간 평가자가 응답 유용성을 1-5 척도로 평가한 결과, FLAN-T5-11B는 T5-11B 대비 평균 +0.8점 향상을 기록했다.

의의 및 한계

의의

  • InstructGPT와의 상호 보완: OpenAI의 InstructGPT가 RLHF에 집중한 반면, 이 연구는 지도 학습(supervised) 방식의 극한을 탐구. 두 방향이 상호 보완적임을 시사.
  • 오픈소스 강력 모델 제공: FLAN-T5 시리즈는 현재까지도 사용되는 강력한 오픈 기반 모델.
  • CoT + IFT 시너지 발견: 추론과 일반 태스크를 함께 학습하는 것이 둘 다를 향상시킨다는 반직관적 결과.
  • LLM 파인튜닝 커리큘럼 설계 지침 제공: 태스크 다양성과 모델 크기 간 상호작용에 대한 실증적 데이터 제공.

한계

  • 태스크 간 부정적 전이 미분석: 일부 태스크 조합이 다른 태스크 성능을 저하시킬 수 있는 부정적 전이(negative transfer) 분석이 부족.
  • 지시 품질 미통제: 태스크 수를 늘릴 때 개별 지시 템플릿의 품질을 일정하게 유지하기 어려웠다.
  • ChatGPT 비교 부재: 논문 작성 시점에 ChatGPT가 공개되지 않아 RLHF 모델과의 직접 비교가 없다.
  • 데이터 오염 가능성: 파인튜닝 데이터가 일부 평가 벤치마크와 중복될 수 있다.