Kalai, A. T., Nachum, O., Vempala, S. S., Zhang, E. (2026). Evaluating large language models for accuracy incentivizes hallucinations. Nature. https://doi.org/10.1038/s41586-026-10549-w