Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang. "Evaluating large language models for accuracy incentivizes hallucinations." Nature (2026). https://doi.org/10.1038/s41586-026-10549-w