The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models
Shishir G. Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, Joseph Gonzalez
BFCL은 LLM의 함수 호출 및 도구 사용 능력을 평가하는 벤치마크로, 기존 평가의 한계를 넘어 에이전트적 관점에서 LLM의 실용적 능력을 측정한다.
LLM이 실제로 도구를 호출하고 함수를 실행하는 능력은 중요하지만, 기존 벤치마크는 단순한 함수 호출만 평가하거나 실제 에이전트 작업을 반영하지 못했다. BFCL은 다양한 함수 호출 시나리오와 에이전트 작업을 포함하여 LLM의 실제 도구 활용 능력을 종합적으로 평가해야 하는 문제를 해결한다.
BFCL은 여러 함수 호출 유형(단일 함수, 다중 함수, 중첩 함수 등)과 에이전트 작업(도구 사용, 계획 수립 등)을 포함하는 데이터셋을 구축한다. LLM의 출력을 정답과 비교하여 정확도, 완전성, 효율성 등을 측정한다. 또한, 다양한 LLM을 평가하여 함수 호출 능력의 차이를 분석한다.
BFCL은 LLM의 함수 호출 능력에 대한 포괄적인 평가를 제공하며, 모델 간 성능 차이를 명확히 보여준다. 이 벤치마크는 LLM의 실제 도구 사용 능력을 향상시키는 연구에 기여하며, 향후 LLM 기반 에이전트 개발의 기준점을 제시한다.