PromptBio-Bench: Benchmarking LLM-based Bioinformatics Agents for End-to-End Data Analysis
Guo, W., Zhang, M., Han, B., Ma, Y., Leng, Y., Hebbar, S., Zhou, X., Gu, W. 외
LLM 기반 바이오인포매틱스 에이전트의 실제 활용 준비도를 체계적으로 평가하기 위한 종합 벤치마크 PromptBio-Bench를 제안한다.
LLM 기반 에이전트는 바이오인포매틱스 워크플로우 자동화에 잠재력을 가지고 있지만, 그들의 실제 활용 가능성을 명확히 평가할 수 있는 체계적인 평가 방법이 부족하다.
244개의 전문가 큐레이션 과제와 구조화된 파일 비교 및 점수 매기기 평가 프레임워크를 갖춘 종합 평가 스위트 PromptBio-Bench를 개발 및 제시한다.
Biomni와 ToolsGenie 등 최신 에이전트들을 평가한 결과, 과제 난이도가 증가함에 따라 모든 에이전트의 정확도가 눈에 띄게 떨어지는 경향을 보였다. 본 벤치마크는 에이전트 기반 바이오인포매틱스 분야의 발전을 체계적으로 추적할 수 있는 기반을 제공한다.