Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang. "Evaluating large language models for accuracy incentivizes hallucinations." Nature, 2026. doi:10.1038/s41586-026-10549-w