余超
教授
联系邮箱: yuchao3@mail.sysu.edu.cn
联系地址: 广州大学城中山大学管理学院楼D504
教师简介:
余超,教授、博导、国家香江学者、广东省杰青、中山大学逸仙学者、小米青年学者。本科毕业于华中科技大学电信系,博士毕业于澳大利亚伍伦贡大学计算机系。主要研究基于强化学习、大模型、AI智能体的智能决策技术。在IEEE TNNLS, IEEE TCB,IEEE ITS, IEEE TKDE等国际期刊和ICML/NeurlPS/IJCAI/AAAI上发表学术论文150余篇,主持科研项目30余项,其中重点项目1项,获最佳论文奖4次。
实验室常年招收博士生、博士后、研究员,待遇优厚,如果感兴趣,请将简历发送至邮箱yuchao3@mail.sysu.edu.cn。
研究领域:
(1)人工智能理论:强化学习、AI智能体、多智能体系统
(2)智能决策技术:非完全信息博弈、大规模群体博弈、人机博弈
(3)大模型技术:大模型训推、AI Infra、决策大模型(能源、金融、医疗、零售、工业)
(4)具身智能:运动控制(小脑)、任务规划(大脑)、多具身技术(协同)
工作经历:
- 2014.3-2016.12, 大连理工大学/js4399金沙线,讲师
- 2016.12-2019.12,大连理工大学/js4399金沙线,副教授(破格)
- 2019.12-2024.04,中山大学/js4399金沙线,副教授
- 2024.04-今,中山大学/js4399金沙线,教授
海外经历:
- 2018.1-2019.6, 香港浸会大学/计算机系,研究员
- 2010.9-2013.12,澳大利亚伍伦贡大学/计算机与软件工程系,博士
获奖及荣誉:
- 2024中国指挥控制学会科技进步一等奖
- 2024全球非完全信息博弈竞赛德扑组第一、麻将组第三
- 2023年教育部腾讯产学研协同育人项目杰出案例奖
- 2022年全球机器人迁移强化学习挑战赛冠军
- 2018年度国家“香江学者”
- 2017年大连市高层次创新人才
- 2015年大连理工“星海学者”
- 辽宁省自然科学学术成果奖(论文类)三等奖, 2018
- 辽宁省自然科学学术成果奖(论文类)二等奖, 2016, 2017
- 大连市自然科学优秀学术论文奖二等奖, 2017
- 大连市自然科学优秀学术论文奖一等奖, 2016
- 大连理工大学教学质量优良奖, 2016
- 大连理工大学“优秀党员“, 2016
- 大连理工大学“优秀工会工作积极分子”, 2016,2017
- 中山大学“校优秀班主任”,2023
主持科研项目:
(一)纵向课题
- 基于AI智能体与决策大模型的群体博弈技术,广东省杰青项目, 2025.1-2028.12,100万
- 面向复杂多智能体系统的强化学习方法及关键技术研究, 国家自然科学基金委员会, 面上项目, 2021.01-2024.12, 59万元
- 群体博弈模型与泛化方法,2021.12-2023.10,国家级重点课题,400万
- 无人机蜂群深度迁移强化学习与分布式训练技术,国家级课题,2020.12-2021.12,100万
- 空地无人集群分布式协同关键技术研究,2021.4-2023.4,国家级课题,192万
- 多智能体强化学习算法研究,国家级课题, 2020.11-2022.6, 60万
- 面向多智能体系统的博弈学习技术研究, 2018.11-2019.12, 国家级课题,50万
- 面向离线数据的强化学习方法及应用研究,广东省自然科学基金(面上项目), 2023.01-2025.12, 10万
- 面向大规模群体的智能博弈技术研究,广州市科技计划项目 ,2025-2027,30万
- 基于虚实混合的机器人强化学习关键技术研究,大连市科技创新基金应用基础研究项目, 2018.1-2020.12,50万
- 机器人强化学习的关键技术研究, 大连市高层次人才创新支持计划项目, 2018.01-2019.12, 10万
- 大规模智能集群协同学习和分布式训练方法研究,高校基本科研业务费-青年教师培育项目,2022,23.32万
(二)企事业横向课题
- 对抗轨迹优化模型, 企事业合作项目, 2020.11-2022.02, 120万元
- 群体博弈模型优化技术, 企事业合作项目, 2020.11-2021.07, 80万元
- 基于多步规划的多智能体强化学习,华为校企合作项目,2020-2021,167万
- 基于多智能体的决策共享平台定制化开发,企事业合作项目, 2025.3-2025.9
- 基于多智能体协同的搜索及推荐技术研究,中国移动校企合作项目,2026-2027
- 大模型赋能员工的智能体软件研发(一期),中国联通校企合作项目,2025-2026
- 面向非完全信息的多智能博弈学习技术研究,腾讯犀牛鸟基金(结题优秀), 2020.3-2021.3
- 基于多智能体强化学习的大规模博弈技术研究,字跳校企合作项目(卓越创新奖), 2022.7-2023.7
- 基于多渠道分层强化学习的智能出价技术研究 ,美团校企合作项目,2022-2023
- 基于离线强化学习的即时配送动态调度问题研究,美团校企合作项目,2023-2024
- 基于多轮强化学习的商户经营诊断系统研究,美团校企合作项目,2025-2026
- 基于强化学习的产品智能推荐技术研究,GOSO香蜜闺秀校企合作项目,2023-2024
主要学术兼职:
- 中国自动化学会博弈智能专委副主任
- 中国计算机学会青年工作委员会、机器人学组、多智能体系统学组委员
- IEICE Trans. Information and Systems特邀编辑
- J. Systems Science and Engineering特邀编辑
- 中国计算机学会通讯专题
- 2021 CCFAI第八届中国智能体及多智能体系统研讨会(大会主席)
- 2016 IEEE International Conf. on Agent (IEEE ICA 2016)(大会主席)
- 2015 Dalian International Symposium on Agents (MATCSD 2015)(大会主席)
- 2024 IEEE International Conference on Agents (IEEE ICA 2024)(组委)
- International Conf. on Automated Planning and Scheduling(ICAPS 2021)(组委)
- 2020 International Conf. on Distributed Artificial Intelligence (DAI2020)(组委)
- 2019 International Conf. on Distributed Artificial Intelligence (DAI 2019)(组委)
- 15th Pacific Rim International Conf. on Artificial Intelligence (PRICAI 2018)(强化学习专题、研讨会组委)
- 2017 IEEE International Conference on Agent (IEEE ICA 2017)(组委)
- 9th International Workshop on Agent-based Complex Automated Negotiations (ACAN2016@AAMAS2016)(组委)
- 2021 International Joint Conf. on Theoretical Computer Science(特邀报告)
- 2020首届中国智能决策论坛(特邀报告)
- 2022第二届中国智能决策论坛(特邀报告)
- 2023中国多智能体前沿论坛(特邀报告)
教授课程:
《强化学习原理及应用》、《人工智能》、《人工智能实验》、《人工智能实践》、 《多智能体系统》、 《推理与学习》、 《汇编语言》、 《图论以及应用》
已毕业学生:
董银昭(国家奖学金、校优秀研究生标兵、省优秀毕业生)、王鑫(中国农行、国家奖学金)、王东旭(百度)、谭佳瑶(华为)、赵洪义(中国电子科技集团)、谭晋(公务员)、张乐(腾讯)、刘恒(腾讯)、夏礼俊(拼多多)、胡比洋(百度)、杨瀚林(腾讯)、胡超豪(中国农行)、陈思吉(网易)、周颖(海通证券)、郑学敬(虎牙)、吴梓帆(美国读博、国家奖学金)、林谦(美国读博、国家奖学金)、方梓健(腾讯)、叶世城(阿里)、伍夏威(电信)
代表性论著:
期刊论文
- Shenghong He, Chao Yu, et al. Hierarchical Multi-agent Meta-Reinforcement Learning for Cross-channel Bidding,IEEE TKDE 2024
- 余超,胡超豪,刘宗凯等,非完美信息博弈综述:对抗求解方法与对比分析,计算机学报,2024
- 徐昕,高阳,俞扬,余超*, 强化学习方法及其应用, 中国计算机学会通讯,2023,19(8):8-10
- 朱圆恒,陆润宇,刘瑜,余超,赵冬斌,面向对抗博弈的深度强化学习研究进展, 中国计算机学会通讯,2023,19(8):25-35
- 余超, 董银昭, 郭宪, 冯旸赫, 卓汉逵, 张强,一种基于结构交互驱动的机器人深度强化学习控制方法,软件学报,2023
- 林谦,余超,等,面向机器人系统的虚实迁移强化学习研究综述,软件学报,2023
- Chao Yu, Qikai Huang, Towards more efficient and robust evaluation of sepsis treatment with deep reinforcement learning, BMC Medical Informatics and Decision Making, 2023
- Chao Yu, JIming Liu and Shamim Nemati. Reinforcement Learning in Healthcare: A Survey ACM Computing Survey, 2021.
- Chao Yu, et al. Supervised-actor-critic reinforcement learning for intelligent mechanical ventilation and sedative dosing in intensive care units. BMC Medical Informatics and Decision Making, 2020 (IF:2.134)
- Chao Yu, Yinzhao Dong, Yangning Li, Yatong Chen Distributed multi-agent deep reinforcement learning for cooperative multi-robot pursuit , The Journal of Engineering, 2020.
- Chao Yu, Xin Wang, Xin Xu, et al. Distributed Multiagent Coordinated Learning for Autonomous Driving in Highways Based on Dynamic Coordination Graphs. IEEE Transactions Intelligent Transportation Systems, doi: 10.1109/TITS.2019.2893683, 2019. (IF:4.051)
- Chao Yu, Jiming Liu and Hongyi Zhao. Inverse Reinforcement Learning for Intelligent Mechanical Ventilation and Sedative Dosing in Intensive Care Units. BMC Medical Informatics and Decision Making, 2019. (IF:2.134)
- Chao Yu, Yinzhao Dong and Jiming Liu, and Guoqi Ren. Incorporating Causal Factors into Reinforcement Learning for Dynamic Treatment Regimes in HIV. BMC Medical Informatics and Decision Making, 2019. (IF:2.134)
- Chao Yu, Minjie Zhang, Fenghui Ren, and Guozhen Tan. Emotional Multiagent Reinforcement Learning in Spatial Social Dilemmas, IEEE Transactions on Neural Networks and Learning Systems. 26(12), 3083-3096, 2015. (4.051)
- Chao Yu, Minjie Zhang, Fenghui Ren, and Guozhen Tan. Multiagent Learning of Coordination in Loosely Coupled Multiagent Systems, IEEE Transactions on Cybernetics. 45(12), 2853-2867, 2015. (IF:10.387)
- Chao Yu, Minjie Zhang and Fenghui Ren and Guozhen Tan. Emergence of Social Norms through Collective Learning in Networked Multiagent Systems, IEEE Transactions on Cybernetics, 44(12): 2342-2355, 2014. (IF:10.387)
会议论文
- Shenghong He, Chao Yu*, et al, Reliability-Guaranteed and Reward-Seeking Sequence Modeling for Model-Based Offline Reinforcement Learning, AAAI2026
- Shan Cong, Chao Yu*, et al, CATAL: Causally Disentangled Task Representation Learning for Offline Meta-Reinforcement Learning, AAAI2026
- Kaiqiang Ke, Chao Yu*, Conservative Offline Goal-Conditioned Implicit V-Learning, ICML2025
- Zijian Fang, Zongkai Liu, Chao Yu*, Rapid Learning in Constrained Minimax Games with Negative Momentum, AAAI2025
- Hanlin Yang, Chao Yu* et al., Diverse Policies Recovering via Pointwise Mutual Information Weighted Imitation Learning, ICLR2025
- Zongkai Liu, Qian Lin, Chao Yu*, et al., Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization, AAAI2025
- Qian Lin, Zongkai Liu, Danying Mo, Chao Yu*,An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning, NeurlPS2024
- Zifan Wu, Bo Tang, Qian Lin, Chao Yu*, Shangqin Mao, Qianlong Xie, Xingxing Wang, Dong Wang, Off-Policy Primal-Dual Safe Reinforcement Learning, ICLR2024
- Qian Lin, Chao Yu*, Zongkai Liu, Zifan Wu. Policy-regularized Offline Multi-objective Reinforcement Learning, AAMAS2024
- Qian Lin, Bo Tang, Zifan Wu, Chao Yu*, et al. Safe Offline Reinforcement Learning with Real-Time Budget Constraints, ICML2023
- Hanlin Yang, Chao Yu, Peng Sun, and Siji Chen, Hybrid Policy Optimization from Imperfect Demonstrations, NeurlPS2023
- Wenxuan Zhu, Chao Yu*, Qiang Zhang. Causal Deep Reinforcement Learning using Observational Data, IJCAI2023
- Chao Yu, Hierarchical Mean-Field Deep Reinforcement Learning for Large-Scale Multiagent Systems, AAAI2023
- Zifan Wu, Chao Yu*, et al. Models as Agents: Optimizing Multi-Step Predictions of Interactive Local Models in Model-Based Multi-Agent Reinforcement Learning, AAAI2023
- Yucong Zhang, Chao Yu*, et al. EXPODE: EXploiting POlicy Discrepancy for Efficient Exploration in Multi-agent Reinforcement Learning, AAMAS2023
- Zongkai Liu, Chao Yu*, et al. A Unified Diversity Measure for Multiagent Reinforcement Learning, NeurlPS2022.
- Zifan Wu, Chao Yu*, et al. Plan To Predict: Learning an Uncertainty-Foreseeing Model For Model-Based Reinforcement Learning, NeurlPS2022.
- Mu Jin, Zhihao Ma, Kebin Jin, Hankui Zhuo, Chen Chen, Chao Yu, SORL: Automatic Symbolic Option Discovery for Facilitating Deep Reinforcement Learning, AAAI2022
- Zifan Wu, Chao Yu*, et al. Coordinated Proximal Policy Optimization, NeurlPS2021.
- Chao Yu, et al. Decomposed Deep Reinforcement Learning for Robotic Control, AAMAS2020.
- Chao Yu, et al. Interactive RL via Online Human Demonstrations, AAMAS2020.
- Chao Yu, Guozhen Tan, The Price of Governance: A Middle Ground Solution to Coordination in Organizational Control, IJCAI2019.
- Yaodong yang, Jianye Hao and Chao Yu, Large-Scale Home Energy Management Using Entropy-Based Collective Multiagent Reinforcement Learning Framework. IJCAI2019
- Chao Yu, Xin Wang, Zhanbo Feng: Coordinated Multiagent Reinforcement Learning for Teams of Mobile Sensing Robots. AAMAS 2019: 2297-2299
- Chao Yu, Guoqi Ren and Jiming Liu, Deep Inverse Reinforcement Learning for Sepsis Treatment, 2019 IEEE International Conference on Healthcare Informatics, 2019. (EI)
- Chao Yu, Yinzhao Dong and Xin Wang, Multiagent Reinforcement Learning on Coordination Graphs, 4th International Workshop on Smart Simulation and Modelling for Complex Systems (SSMCS@IJCAI 2019). (Best Paper Award)
- Chao Yu, Dongxu Wang, Jiankang Ren, Hongwei Ge and Liang Sun. Decentralized Multiagent Reinforcement Learning for Efficient Robotic Control by Coordination Graphs. 15th Pacific Rim International Conference on Artificial Intelligence, pp. 191-203, 2018.
- Chao Yu, Dongxu Wang, Tianpei Yang, Wenxuan Zhu, Yuchen Li, Hongwei Ge and Jiankang Ren. Adaptively Shaping Reinforcement Learning Agents via Human Reward. 15th Pacific Rim International Conference on Artificial Intelligence, pp. 85-97, 2018. (Best Paper Nomination, 5 out of 441)
- Chao Yu, Yatong Chen, Hongtao Lv, Jiankang Ren, Hongwei Ge and Liang Sun. Neural learning for the emergence of social norms in multiagent systems. 2017 IEEE International Conference on Agents (ICA), pp. 40-45, 2017.
- Chao Yu, Hongtao Lv, Sandip Sen, Jianye hao, Fenghui Ren and Rui Liu. An Adaptive Learning Framework for Efficient Emergence of Social Norms. 15th International Conference on Autonomous Agents and Multiagent Systems (AAMAS2016), Singapore. pp. 1307-1308, 2016.
- Chao Yu, Hongtao Lv, Sandip Sen, Fenghui Ren and Guozhen Tan. Adaptive Learning for Efficient Emergence of Social Norms in Networked Multiagent Systems. In The Proceedings of the 14th Pacific Rim International Conference on Artificial Intelligence (PRICAI 2016): Trends in Artificial Intelligence. LNAI 9810, pp. 805-818, 2016.
- Chao Yu, Minjie Zhang, Fenghui Ren and Xudong Luo. Emergence of Social Norms Through Collective Learning in Networked Agent Societies. The Twelfth International Conference on Autonomous Agents and Multiagent Systems (AAMAS2013) , pp.475-482, May 6-10, 2013, Saint Paul, USA.
- Chao Yu, Fenghui Ren and Minjie Zhang. An Adaptive Bilateral Negotiation Model Based on Bayesian Learning. The 4th AAMAS International Workshop on Agent-based Complex Automated Negotiations (ACAN@AAMAS2011), The Best Student Paper Award, Taipei, 2011



