도형준 지식 볼트
Search
검색
다크 모드
라이트 모드
탐색기
태그: GRPO
3건의 항목
2026년 7월 21일
DeepSeek-R1-Zero: SFT 없이 순수 RL만으로 추론이 창발한 최초의 대규모 모델
Aha-Moment
Chain-of-Thought
DeepSeek
Emergent-Behavior
GRPO
MoE
Open-Source
Pure-RL
Pure-RL-Training
R1-Zero
Reasoning
2026년 7월 21일
DeepSeek-R1: 순수 강화학습으로 o1에 필적하는 추론 AI의 민주화
Chain-of-Thought
DeepSeek
Distillation
GRPO
MoE
Open-Source
Pure-RL
Pure-RL-Training
R1
Reasoning
Self-Verification
2026년 7월 21일
Phi-4 Reasoning: 오픈소스 대규모 언어 모델
Chain-of-Thought
GRPO
Microsoft
Phi-4-Reasoning
Reasoning
Small-Language-Model
Synthetic-Data