 |
Unlocking Token Rewards via Training-Free Reward Attribution
Sitong Wu, Haoru Tan, Bin Xia, Xichen Zhang, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
paper code
|
 |
TRAC: Teacher-Guided Token Reward with Adaptive Calibration for Robust Policy Optimization
Sitong Wu, Haoru Tan, Xichen Zhang, Bin Xia, Wenhu Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
Annual Meeting of the Association for Computational Linguistics (ACL), 2026
paper code
|
 |
Beyond Majority Voting: Self-Reflective Test-Time Reinforcement Learning for LLM Reasoning
Sitong Wu, Haoru Tan, Xichen Zhang, Bin Xia, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
International Conference on Machine Learning (ICML), 2026
paper code
|
 |
DLoFT: Gradient-Decoupled Fine-Tuning for Generalizable Long Chain-of-Thought Reasoning
Sitong Wu, Haoru Tan, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
Conference on Neural Information Processing Systems (NeurIPS), 2025
paper code
|
 |
Dynamic Important Example Mining for Reinforcement Finetuning
Haoru Tan, Sitong Wu✉, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
paper code
|
 |
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
Xichen Zhang*, Sitong Wu*, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia
International Conference on Learning Representations (ICLR), 2026
paper arXiv code
|
 |
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
Xichen Zhang*, Sitong Wu*, Haoru Tan, Shaozuo Yu, Yinghao Zhu, Ziyi He, Jiaya Jia
arXiv: 2510.19767
arXiv code
|
 |
SpaceSkill: Hierarchical Skill Routing for Tool-Augmented Spatial Agents
Yuhuai Li, Haoru Tan, Sitong Wu, Wei Yin, Xiaojuan Qi
arXiv, 2026
coming soon
|
 |
SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
Xichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia
Annual Meeting of the Association for Computational Linguistics (ACL), 2026
paper arXiv code
|
 |
StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding
Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia
arXiv: 2608.05703
arXiv code
|