Yikun Ban 班义琨

I am a professor in the School of Computer Science and Engineering at Beihang University and a member of the State Key Laboratory of Software Development Environment. Previously, I was a postdoc and obtained my Ph.D. degree at Computer Science, University of Illinois at Urbana-Champaign. Prior to this, I obtained my Master's degree from EECS, Peking University and bachelor's degree from Wuhan University.

I am interested in principled algorithms in the space of reinforcement learning and deep learning, to solve real-world sequential decision-making problems. Current research topics:

News

Selected Preprint (* Equal Contribution, # Corresponding)

Agent Exploration Toward Artificial General Intelligence: A Survey [Paper] [Paper-SSRN] [Github] [Website]
Ban, Yikun and Yang, Fengkai and Chen, Fangzheng and Wang, Yibo and Chen, Zhijun and Li, Zhongyi and Huang, Zixuan and Zhang, Xiaoyuan and Li, Gongxun and Chen, Zehao and others
Policy Improvement Reinforcement Learning [Paper] [Github]
Huaiyang Wang, Xiaojie Li, Deqing Wang, Haoyi Zhou, Zixuan Huang, Yaodong Yang, Jianxin Li, Yikun Ban#
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration [Paper] [Github]
Zhongyi Li, Wan Tian, Yikun Ban#, Jinju Chen, Huiming Zhang, Yang Liu, Fuzhen Zhuang
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger [Paper] [Github] [Hugging Face] [PaperWeekly] [小红书]
Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban#

Selected Publications — 2026

* Equal Contribution, # Corresponding

Your Group-Relative Advantage Is Biased[Paper] [Hugging Face] [机器之心] [小红书]
Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Fuzhen Zhuang, Shuai Ma, Deqing Wang, Yaodong Yang, Yikun Ban#
Conference on Neural Information Processing Systems (NeurIPS'26)
Heterogeneous Agent Collaborative Reinforcement Learning [Paper] [Project Page] [Hugging Face] [机器之心] [小红书]
Zhixia Zhang, Zixuan Huang, Gongxun Li, Huaiyang Wang, Chengyi Yuan, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma, Ning Ding, Yaodong Yang, Yikun Ban#
Conference on Neural Information Processing Systems (NeurIPS'26)
Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation
Jianing Guo, Fangzheng Chen, Zihao Mao, WONG Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li
Conference on Neural Information Processing Systems (NeurIPS'26)
Adaptive Robust Estimator for Policy Optimization in Reinforcement Learning
Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Ruijie Wang, Yijie Peng, Yikun Ban#, Fuzhen Zhuang
Conference on Neural Information Processing Systems (NeurIPS'26)
Alignment-Free Multi-Modality Large-Small Model Bidirectional Collaboration with Missing Modality [DBLP]
Wei Guo, Jiale Mao, Yiqi Tong, Chuyu Fang, Xiao Zhang, Yikun Ban, Zhaojun Hu, Yiyang Duan, Fuzhen Zhuang
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26), pp. 1451–1461
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling [paper]
Dengcan Liu, Fengkai Yang, Xiaohan Wang, Shurui Yan, Jiajun Chai, Jiahao Li, Yikun Ban, Zhendong Mao, Wei Lin, Guojun Yin
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26)
Does Your Reasoning Model Implicitly Know When to Stop Thinking? [paper] [Code] [Hugging Face] [小红书]
Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuanda Wang, Zhixia Zhang, Hongyan Xie, Songshi Liang, Zehao Chen, Xuefeng Xiao, Fuzhen Zhuang, Jianxin Li, Yikun Ban#, Deqing Wang
International Conference on Machine Learning (ICML'26)
Real-Time Aligned Reward Model beyond Semantics [paper]
Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban#, Deqing Wang
International Conference on Machine Learning (ICML'26)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [paper]
Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban#, Deqing Wang
International Conference on Machine Learning (ICML'26)
T-POP: Test-Time Personalization with Online Preference Feedback [paper]
Qu Zikun, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai
International Conference on Machine Learning (ICML'26)
Bi-level Hierarchical Neural Contextual Bandits for Online Recommendation [DBLP]
Yunzhe Qi, Yao Zhou, Yikun Ban, Allan Stewart, Chuanwei Ruan, Jiachuan He, Shishir Kumar Prasad, Haixun Wang, Jingrui He
Transactions on Machine Learning Research (TMLR, 2026)
Harmonizing Gradient Matching For Fairness [DBLP]
Ziwei Wu, Yikun Ban, Jingrui He
Transactions on Machine Learning Research (TMLR, 2026)
Harnessing Multiple Large Language Models: A Survey on LLM Ensemble [paper] [github]
Zhijun Chen, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Yikun Ban#, Hailong Sun, Philip S. Yu
International Joint Conferences on Artificial Intelligence (IJCAI'26)
Neural Exploitation and Exploration of Contextual Bandits [paper]
Yikun Ban, Yuchen Yan, Arindam Banerjee, Jingrui He
Journal of Machine Learning Research (JMLR, 2026)
GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs [DBLP]
Yating Ren, Yikun Ban, Huobin Tan
AAAI Conference on Artificial Intelligence (AAAI'26), pp. 25142–25150

Selected Publications — 2025 & Earlier

Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning [paper] [github] [小红书]
Jiaru Zou, Yikun Ban#, Zihao Li, Yunzhe Qi, Ruizhong Qiu, Ling Yang, Jingrui He#
Thirty-ninth Conference on Neural Information Processing Systems (NeurIPS'25, Spotlight)
Adaptive Sample Scheduling for Direct Preference Optimization [github] [paper]
Zixuan Huang, Yikun Ban#, Lean Fu, Xiaojie Li, Zhongxiang Dai, Jianxin Li, Deqing Wang#
Thirty-ninth Conference on Neural Information Processing Systems (NeurIPS'25)
LLM-Forest: Ensemble Learning of LLMs with Graph-Augmented Prompts for Data Imputation [paper]
Xinrui He, Yikun Ban#, Jiaru Zou, Tianxin Wei, Curtiss Cook, Jingrui He#
The 63rd Annual Meeting of the Association for Computational Linguistics, Findings (ACL'25)
Adaptive Sampling-based Dynamic Graph Learning for Information Diffusion Prediction [paper]
Xiaodong Lu, Mingzhe Liu, Tongyu Zhu, Leilei Sun, Jibin Wang, Weifeng Lv, Yikun Ban, Deqing Wang
ACM Transactions on Information Systems (TOIS, 2025)
Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision? [paper]
Zihao Li, Lecheng Zheng, Bowen Jin, Dongqi Fu, Baoyu Jing, Yikun Ban, Jingrui He, Jiawei Han
The 63rd Annual Meeting of the Association for Computational Linguistics, Main (ACL'25)
Robust Neural Contextual Bandit against Adversarial Corruptions [paper]
Yunzhe Qi, Yikun Ban, Arindam Banerjee, Jingrui He
Thirty-eighth Conference on Neural Information Processing Systems (NeurIPS'24)
PageRank Bandits for Link Prediction [paper]
Yikun Ban*, Jiaru Zou*, Zihao Li, Yunzhe Qi, Dongqi Fu, Jian Kang, Hanghang Tong, Jingrui He
Thirty-eighth Conference on Neural Information Processing Systems (NeurIPS'24)
Meta Clustering of Neural Bandits [paper] [github]
Yikun Ban*, Yunzhe Qi*, Tianxin Wei, Lihui Liu, Jingrui He
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'24)
Neural Contextual Bandits for Personalized Recommendation [website] [paper]
Yikun Ban, Yunzhe Qi, Jingrui He
The Web Conference, Tutorial (WWW'24)
Neural Active Learning Beyond Bandits [paper] [github]
Yikun Ban, Ishika Agarwal, Ziwei Wu, Yada Zhu, Kommy Weldemariam, Hanghang Tong, Jingrui He
International Conference on Learning Representations (ICLR'24)
Contextual Bandits with Online Neural Regression [paper]
Rohan Deb, Yikun Ban, Shiliang Zuo, Jingrui He, Arindam Banerjee
International Conference on Learning Representations (ICLR'24)
Meta-Learning with Neural Bandit Scheduler [paper]
Yunzhe Qi*, Yikun Ban*, Tianxin Wei, Jiaru Zou, Huaxiu Yao, Jingrui He
Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS'23)
Graph Neural Bandits [paper] [github]
Yunzhe Qi*, Yikun Ban*, Jingrui He
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'23)
Improved Algorithms for Neural Active Learning [paper] [github]
Yikun Ban*, Yuheng Zhang*, Hanghang Tong, Arindam Banerjee, Jingrui He
Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS'22)
DISCO: Comprehensive and Explainable Disinformation Detection [paper]
Dongqi Fu, Yikun Ban, Hanghang Tong, Ross Maciejewski, Jingrui He
ACM International Conference on Information and Knowledge Management (CIKM'22, Demo Track)
Neural Bandit with Arm Group Graph [paper]
Yunzhe Qi, Yikun Ban, Jingrui He
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'22)
EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits [paper] [github]
Yikun Ban, Yuchen Yan, Arindam Banerjee, Jingrui He
International Conference on Learning Representations (ICLR'22, Spotlight)
Convolutional Neural Bandit for Visual-aware Recommendation [paper] [github]
Yikun Ban, Jingrui He
Preprint: ArXiv:2107.07438
Multi-Facet Contextual Bandits: A Neural Network Perspective [paper] [slides] [github]
Yikun Ban, Jingrui He, Curtiss B. Cook
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'21)
Local Clustering in Contextual Multi-Armed Bandits [paper] [slides] [github]
Yikun Ban, Jingrui He
The Web Conference (WWW'21)
Dynamic Knowledge Graph Alignment [paper]
Yuchen Yan, Lihui Liu, Yikun Ban, Baoyu Jing, Hanghang Tong
AAAI Conference on Artificial Intelligence (AAAI'21)
Generic Outlier Detection in Multi-Armed Bandit [paper] [slides] [github]
Yikun Ban, Jingrui He
ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'20)
No Place to Hide: Catching Fraudulent Entities in Tensors [paper] [poster]
Yikun Ban, Xin liu, Ling Huang, Yitao Duan, Xue Liu, Wei Xu
The Web Conference (WWW'19)

Education

Aug 2019 – Jun 2024
Ph.D., Computer Science, Advised by Jingrui He and Hanghang Tong
University of Illinois at Urbana-Champaign, Illinois, US
Aug 2016 – Jul 2019
M.S., Computer Science
Peking University, Beijing, China
Aug 2012 – Jul 2016
B.S., School of Software Engineering
Wuhan University, Wuhan, China