Sitong Wu | 吴思彤  

PhD (3rd Year)

Department of Computer Science and Engineering
The Chinese University of Hong Kong (CUHK)

Email: stone-wu@link.cuhk.edu.hk


Biography

I am currently a 3rd year PhD student at Computer Science & Engineering Department, The Chinese University of Hong Kong (CUHK), under the supervision of Prof. Jiaya Jia. Before that, I got the Bachelor degree in Information Engineering at Jilin University (JLU).

My current research revolves around efficient and data-centric AI, particularly exploring their applications in current hot topics, such as large language models, multi-modality models, and generative models.

Selected Publications [Google Scholar]

*: equal contribution   |   Click a research direction to expand / collapse.

Expand all Collapse all

LLM & Agent10
Unlocking Token Rewards via Training-Free Reward Attribution
Sitong Wu, Haoru Tan, Bin Xia, Xichen Zhang, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
paper code
TRAC: Teacher-Guided Token Reward with Adaptive Calibration for Robust Policy Optimization
Sitong Wu, Haoru Tan, Xichen Zhang, Bin Xia, Wenhu Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
Annual Meeting of the Association for Computational Linguistics (ACL), 2026
paper code
Beyond Majority Voting: Self-Reflective Test-Time Reinforcement Learning for LLM Reasoning
Sitong Wu, Haoru Tan, Xichen Zhang, Bin Xia, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
International Conference on Machine Learning (ICML), 2026
paper code
DLoFT: Gradient-Decoupled Fine-Tuning for Generalizable Long Chain-of-Thought Reasoning
Sitong Wu, Haoru Tan, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
Conference on Neural Information Processing Systems (NeurIPS), 2025
paper code
Dynamic Important Example Mining for Reinforcement Finetuning
Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
paper code
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
Xichen Zhang*, Sitong Wu*, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia
International Conference on Learning Representations (ICLR), 2026
paper arXiv code
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
Xichen Zhang*, Sitong Wu*, Haoru Tan, Shaozuo Yu, Yinghao Zhu, Ziyi He, Jiaya Jia
arXiv: 2510.19767
arXiv code
SpaceSkill: Hierarchical Skill Routing for Tool-Augmented Spatial Agents
Yuhuai Li, Haoru Tan, Sitong Wu, Wei Yin, Xiaojuan Qi
arXiv, 2026
coming soon
SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
Xichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia
Annual Meeting of the Association for Computational Linguistics (ACL), 2026
paper arXiv code
StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding
Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia
arXiv: 2608.05703
arXiv code
Multi-Modality5
SaCo Loss: Sample-wise Affinity Consistency for Vision-Language Pre-training
Sitong Wu*, Haoru Tan*, Zhuotao Tian, Yukang Chen, Xiaojuan Qi, Jiaya Jia
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024
paper supp code
Mixture-of-Scores: Robust Image-Text Data Valuation via Three Lines of Code
Sitong Wu*, Haoru Tan*, Yukang Chen, Shaofeng Zhang, Jingyao Li, Bei Yu, Xiaojuan Qi, Jiaya Jia
IEEE/CVF International Conference on Computer Vision (ICCV), 2025
paper supp code
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
Zhisheng Zhong, Chengyao Wang, Yuqi Liu, Senqiao Yang, Longxiang Tang, Yuechen Zhang, Jingyao Li, Tianyuan Qu, Yanwei Li, Yukang Chen, Shaozuo Yu, Sitong Wu, Eric Lo, Shu Liu, Jiaya Jia
IEEE/CVF International Conference on Computer Vision (ICCV), 2025
paper arXiv code
VisionLeaf: Entropy-Guided Leaf-First Reasoning for Efficient and Accurate Think-with-Image
Haokun Gui, Senqiao Yang, Mingkang Zhu, Meng Chu, Sitong Wu, Changsheng Lu, Zihao Wang, Zhuotao Tian, Jiaya Jia
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
paper supp
RegionBLIP: A Unified Multi-modal Pre-training Framework for Holistic and Regional Comprehension
Qiang Zhou, Chaohui Yu, Shaofeng Zhang, Sitong Wu, Zhibin Wang, Fan Wang
arXiv: 2308.02299
arXiv code
Data-Centric3
Data Pruning by Information Maximization
Haoru Tan*, Sitong Wu*, Wei Huang, Shizhen Zhao, Xiaojuan Qi
International Conference on Learning Representations (ICLR), 2026
paper arXiv code
Fast Data Mixture Optimization via Gradient Descent
Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi
International Conference on Learning Representations (ICLR), 2026
paper arXiv code
Data Pruning via Moving-one-Sample-out
Haoru Tan*, Sitong Wu*, Fei Du, Yukang Chen, Zhibin Wang, Fan Wang, Xiaojuan Qi
Conference on Neural Information Processing Systems (NeurIPS), 2023
arXiv code
Computer Vision4
Pale Transformer: A General Vision Transformer Backbone with Pale-Shaped Attention
Sitong Wu, Tianyi Wu, Haoru Tan, Guodong Guo
Association for the Advancement of Artificial Intelligence (AAAI), 2022, Oral
paper arXiv code
Demystify Transformers & Convolutions in Modern Image Deep Networks
Xiaowei Hu*, Min Shi*, Weiyun Wang*, Sitong Wu*, Linjie Xing, Wenhai Wang, Xizhou Zhu, Lewei Lu, Jie Zhou, Xiaogang Wang, Yu Qiao, Jifeng Dai
arXiv: 2211.05781
arXiv code
Semantic Diffusion Network for Semantic Segmentation
Haoru Tan*, Sitong Wu*, Jimin Pi
Conference on Neural Information Processing Systems (NeurIPS), 2022
paper arXiv code
UniNeXt: Exploring A Unified Architecture for Vision Recognition
Fangjian Lin, Jianlong Yuan, Sitong Wu, Fan Wang, Zhibin Wang
ACM Multimedia Conference (ACM MM), 2023
paper arXiv code
CATrans: Context and Affnity Transformer for Few-Shot Segmentation
Shan Zhang, Tianyi Wu, Sitong Wu, Guodong Guo
International Joint Conference on Artificial Intelligence (IJCAI), 2022
paper arXiv
StructToken: Rethinking Semantic Segmentation with Structural Prior
Fangjian Lin*, Zhanhao Liang*, Sitong Wu, Junjun He, Kai Chen, Shengwei Tian
IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2023
paper arXiv code
PRSeg: A Lightweight Patch Rotate MLP Decoder for Semantic Segmentation
Fangjian Lin*, Yizhe Ma*, Sitong Wu, Long Yu, Shengwei Tian
IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2023
paper arXiv
AxWin Transformer: A Context-Aware Vision Transformer Backbone with Axial Windows
Fangjian Lin, Yizhe Ma, Sitong Wu, Long Yu, Shengwei Tian
arXiv: 2305.01280
arXiv
Fully Transformer Networks for Semantic Image Segmentation
Sitong Wu*, Tianyi Wu*, Fangjian Lin*, Shengwei Tian, Guodong Guo
arXiv: 2106.04108
arXiv code
Full-scale Selective Transformer for Semantic Segmentation
Fangjian Lin*, Sitong Wu*, Yizhe Ma, Shengwei Tian
Asian Conference on Computer Vision (ACCV), 2022
paper
Ensemble Quadratic Assignment Network for Graph Matching
Haoru Tan, Chuang Wang, Sitong Wu, Xuyao Zhang, Fei Yin, Chenglin Liu
International Journal on Computer Vision (IJCV), 2024
arXiv
Proxy Graph Matching with Proximal Matching Networks
Haoru Tan, Chuang Wang, Sitong Wu, Tieqiang Wang, Xuyao Zhang, Chenglin Liu
Association for the Advancement of Artificial Intelligence (AAAI), 2021
paper

Experiences

Honors and Awards