@misc{song2026evaluating,
author = {Song, Zhangde and Lu, Jieyu and Du, Yuanqi and Yu, Botao and Pruyn, Thomas M. and Huang, Yue and Guo, Kehan and Luo, Xiuzhe and Qu, Yuanhao and Qu, Yi and Wang, Yinkai and Wang, Haorui and Guo, Jeff and Gan, Jingru and Shojaee, Parshin and Luo, Di and Dillmann, Steven and Bran, Andres M. and Li, Gen and Zhao, Qiyuan and Luo, Shao-Xiong Lennon and Zhang, Yuxuan and Zou, Xiang and Zhao, Wanru and Zhang, Yifan F. and Zhang, Wucheng and Zheng, Shunan and Zhang, Saiyang and Khan, Sartaaj Takrim and Rajabi-Kochi, Mahyar and Paradi-Maropakis, Samantha and Baltoiu, Tony and Xie, Fengyu and Chen, Tianyang and Huang, Kexin and Luo, Weiliang and Fang, Meijing and Yang, Xin and Cheng, Lixue and He, Jiajun and Hassoun, Soha and Zhang, Xiangliang and Wang, Wei and Reddy, Chandan K. and Zhang, Chao and Zheng, Zhiling and Wang, Mengdi and Cong, Le and Gomes, Carla P. and Hsieh, Chang-Yu and Nandy, Aditya and Schwaller, Philippe and Kulik, Heather J. and Jia, Haojun and Sun, Huan and Moosavi, Seyed Mohamad and Duan, Chenru},
title = {{Evaluating Large Language Models in Scientific Discovery}},
eprint = {2512.15567},
archiveprefix = {arXiv},
primaryclass = {cs.AI},
year = 2026,
}
