@article{fastddrive,title={Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving},author={Zhang, Kewei and Wang, Jin and Gao, Sensen and Wu, Chengyue and Cao, Yulong and Han, Songyang and Ivanovic, Boris and Liu, Langechuan and Pavone, Marco and Han, Song and Zhou, Daquan and Xie, Enze},journal={arXiv preprint arXiv:2605.23163},year={2026},primaryclass={cs.CL},note={*Co-first author},}
arXiv
HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong, and 14 more authors
@article{humanscale,title={HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining},author={Ma, Juncheng and Bi, Jianxin and Deng, Yufan and Zhai, Xuanran and Zhang, Kewei and Huang, Ye and Liang, Bo and Gong, Shukai and Tu, Jiankai and Tang, Xiaotian and Li, Jiaxin and Chen, Kaiqi and Wang, Duomin and Wang, Yuqi and Kang, Bingyi and Huang, Eric and Dou, Zhiyang and Dong, Zhen and Xie, Enze and Matusik, Wojciech and Chua, Tat-Seng and Zhou, Daquan},journal={arXiv preprint arXiv:2606.20521},year={2026},primaryclass={cs.CV},}
ICLR
MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
@inproceedings{mhla,title={MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head},author={Zhang, Kewei and Huang, Ye and Deng, Yufan and Yu, Jincheng and Chen, Junsong and Ling, Huan and Xie, Enze and Zhou, Daquan},booktitle={The Fourteenth International Conference on Learning Representations},year={2026},primaryclass={cs.CV},note={*Co-first author},}
2025
ACM MM
FAB-Attack: Fabric-Aware Adversarial Attacks on Person Detectors under Motion Blur