도형준 지식 볼트

태그: R1-Zero

1건의 항목

  • 2026년 7월 21일

    DeepSeek-R1-Zero: SFT 없이 순수 RL만으로 추론이 창발한 최초의 대규모 모델

    • Aha-Moment
    • Chain-of-Thought
    • DeepSeek
    • Emergent-Behavior
    • GRPO
    • MoE
    • Open-Source
    • Pure-RL
    • Pure-RL-Training
    • R1-Zero
    • Reasoning

Created with Quartz v4.5.2 © 2026

  • GitHub
  • Discord Community