샘플 수만으론 부족… LLM 테스트 시간 스케일링, 후보 생성 전략이 성능 좌우
본 논문은 Test-time scaling 시 단순히 생성된 후보의 수(N)뿐만 아니라, 이를 실행하는 Candidate-generation strategy가 시스템의 에너지와 성능에 미치는 영향을 분석합니다. 연구진은 Phi-3-mini와 Qwen2.5-1.5B 모델을 사용하여 N의 증가가 reasoning accuracy에 미치는 효과를 확인했습니다. 또한, 동일한 N을 유지하더라도 batch size를 다르게 구성하는 다양한 generation schedules(1x8, 2x4, 4x2, 8x1)가 latency, throughput, GPU-hours 등에 미치는 차이를 조사했습니다.