DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning
-
期刊论文
-
出版模式:
开放获取
-
发表日期:
2025年9月17日
- Daya Guo,
- Dejian Yang,
- Haowei Zhang,
- Junxiao Song,
- Peiyi Wang,
- Qihao Zhu,
- Runxin Xu,
- Ruoyu Zhang,
- Shirong Ma,
- Xiao Bi,
- Xiaokang Zhang,
- Xingkai Yu,
- Yu Wu,
- Z. F. Wu,
- Zhibin Gou,
- Zhihong Shao,
- Zhuoshu Li,
- Ziyi Gao,
- Aixin Liu,
- Bing Xue,
- Bingxuan Wang,
- Bochao Wu,
- Bei Feng,
- Chengda Lu,
- Chenggang Zhao,
- Chengqi Deng,
- Chong Ruan,
- Damai Dai,
- Deli Chen,
- Dongjie Ji,
- Erhang Li,
- Fangyun Lin,
- Fucong Dai,
- Fuli Luo,
- Guangbo Hao,
- Guanting Chen,
- Guowei Li,
- H. Zhang,
- Hanwei Xu,
- Honghui Ding,
- Huazuo Gao,
- Hui Qu,
- Hui Li,
- Jianzhong Guo,
- Jiashi Li,
- Jingchang Chen,
- Jingyang Yuan,
- Jinhao Tu,
- Junjie Qiu,
- Junlong Li,
- J. L. Cai,
- Jiaqi Ni,
- Jian Liang,
- Jin Chen,
- Kai Dong,
- Kai Hu,
- Kaichao You,
- Kaige Gao,
- Kang Guan,
- Kexin Huang,
- Kuai Yu,
- Lean Wang,
- Lecong Zhang,
- Liang Zhao,
- Litong Wang,
- Liyue Zhang,
- Lei Xu,
- Leyi Xia,
- Mingchuan Zhang,
- Minghua Zhang,
- Minghui Tang,
- Mingxu Zhou,
- Meng Li,
- Miaojun Wang,
- Mingming Li,
- Ning Tian,
- Panpan Huang,
- Peng Zhang,
- Qiancheng Wang,
- Qinyu Chen,
- Qiushi Du,
- Ruiqi Ge,
- Ruisong Zhang,
- Ruizhe Pan,
- Runji Wang,
- R. J. Chen,
- R. L. Jin,
- Ruyi Chen,
- Shanghao Lu,
- Shangyan Zhou,
- Shanhuang Chen,
- Shengfeng Ye,
- Shiyu Wang,
- Shuiping Yu,
- Shunfeng Zhou,
- Shuting Pan,
- S. S. Li,
- Shuang Zhou,
- Shaoqing Wu,
- Tao Yun,
- Tian Pei,
- Tianyu Sun,
- T. Wang,
- Wangding Zeng,
- Wen Liu,
- Wenfeng Liang,
- Wenjun Gao,
- Wenqin Yu,
- Wentao Zhang,
- W. L. Xiao,
- Wei An,
- Xiaodong Liu,
- Xiaohan Wang,
- Xiaokang Chen,
- Xiaotao Nie,
- Xin Cheng,
- Xin Liu,
- Xin Xie,
- Xingchao Liu,
- Xinyu Yang,
- Xinyuan Li,
- Xuecheng Su,
- Xuheng Lin,
- X. Q. Li,
- Xiangyue Jin,
- Xiaojin Shen,
- Xiaosha Chen,
- Xiaowen Sun,
- Xiaoxiang Wang,
- Xinnan Song,
- Xinyi Zhou,
- Xianzu Wang,
- Xinxia Shan,
- Y. K. Li,
- Y. Q. Wang,
- Y. X. Wei,
- Yang Zhang,
- Yanhong Xu,
- Yao Li,
- Yao Zhao,
- Yaofeng Sun,
- Yaohui Wang,
- Yi Yu,
- Yichao Zhang,
- Yifan Shi,
- Yiliang Xiong,
- Ying He,
- Yishi Piao,
- Yisong Wang,
- Yixuan Tan,
- Yiyang Ma,
- Yiyuan Liu,
- Yongqiang Guo,
- Yuan Ou,
- Yuduan Wang,
- Yue Gong,
- Yuheng Zou,
- Yujia He,
- Yunfan Xiong,
- Yuxiang Luo,
- Yuxiang You,
- Yuxuan Liu,
- Yuyang Zhou,
- Y. X. Zhu,
- Yanping Huang,
- Yaohui Li,
- Yi Zheng,
- Yuchen Zhu,
- Yunxian Ma,
- Ying Tang,
- Yukun Zha,
- Yuting Yan,
- Z. Z. Ren,
- Zehui Ren,
- Zhangli Sha,
- Zhe Fu,
- Zhean Xu,
- Zhenda Xie,
- Zhengyan Zhang,
- Zhewen Hao,
- Zhicheng Ma,
- Zhigang Yan,
- Zhiyu Wu,
- Zihui Gu,
- Zijia Zhu,
- Zijun Liu,
- Zilin Li,
- Ziwei Xie,
- Ziyang Song,
- Zizheng Pan,
- Zhen Huang,
- Zhipeng Xu,
- Zhongyu Zhang,
- Zhen Zhang
摘要
General reasoning represents a long-standing and formidable challenge in artificial intelligence (AI). Recent breakthroughs, exemplified by large language models (LLMs)