전자상거래 LLM 에이전트의 장기 일관성 평가 벤치마크
기존 LLM Agent 벤치마크가 단기 작업 성공에 집중하는 한계를 지적하며, 실제 이커머스 데이터를 기반으로 365일 동안 주문 단위로 시뮬레이션하는 MerchantBench를 통해 에이전트의 장기적인 목적 지향 행동 평가의 필요성을 강조합니다.
피드백 지연과 누적된 결과가 미래의 선택을 제약하는 복잡한 환경에서 LLM Agent의 실질적인 운영 능력을 측정할 수 있는 기반을 마련했습니다.
arXiv 원문 →