Jason Wei, Nguyen Karina, Hyung Won Chung, Yunxin Joy Jiao, Spencer Papay, Amelia Glaese, John Schulman, W. Fedus
A short-form factuality benchmark adversarially collected against GPT-4 responses, evaluating models' factuality and ability to recognize their own limitations.
Existing factuality benchmarks for LLMs suffer from saturation or difficult grading. In particular, it is challenging to measure a model's ability to abstain from answering questions it does not know.
Each question is designed to have a single, indisputable answer. Questions are adversarially collected against GPT-4 to increase difficulty. Responses are graded as correct, incorrect, or not attempted, jointly evaluating accuracy and abstention rate.
SimpleQA achieves a difficulty level that current models find challenging, providing a simple and effective benchmark that simultaneously measures factuality and a model's awareness of its knowledge limits.