Ying Shan
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
186
Venues
21
Active years
2000–2026
Best venue rank
A*
Where they publish
- A*CVPR64 papers
- A*ICCV26 papers
- A*ECCV19 papers
- A*AAAI14 papers
- A*SIGGRAPH9 papers
- A*ICLR9 papers
- MulticonferenceICASSP8 papers
- A*ACL6 papers
- A*SiggraphA6 papers
- A*ICML5 papers
- A*KDD4 papers
- AInterspeech3 papers
- A*IJCAI3 papers
- BACCV2 papers
- NationalMVA2 papers
- ANAACL1 paper
- A*WWW1 paper
- BICTAI1 paper
- NationalHCI1 paper
- CISCAS1 paper
- BICIP1 paper
Papers
186 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | MMhops-R1: Multimodal Multi-hop Reasoning. | Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu |
| 2026 | ACL | GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning. | Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu |
| 2026 | SIGGRAPH | ViewWeaver: Geometry-Grounded Generative Rendering for 3D-Aware Image Customization. | Yaowei Li, Xiaoyu Li, Zhaoyang Zhang, Hongxiang Li, Long Chen, Ying Shan, Yuexian Zou |
| 2026 | SIGGRAPH | Pixal3D: Pixel-Aligned 3D Generation from Images. | Dong-Yang Li, Wang Zhao, Yuxin Chen, Wenbo Hu, Meng-Hao Guo, Fang-Lue Zhang, Ying Shan, Shi-Min Hu |
| 2025 | AAAI | Image Conductor: Precision Control for Interactive Video Synthesis. | Yaowei Li, Xintao Wang, Zhaoyang Zhang, Zhouxia Wang, Ziyang Yuan, Liangbin Xie, Ying Shan, Yuexian Zou |
| 2025 | AAAI | CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities. | Tao Wu, Yong Zhang, Xintao Wang, Xianpan Zhou, Guangcong Zheng, Zhongang Qi, Ying Shan, Xi Li |
| 2025 | CVPR | DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos. | Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan |
| 2025 | CVPR | DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation. | Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue |
| 2025 | CVPR | Mani-GS: Gaussian Splatting Manipulation with Triangular Mesh. | Xiangjun Gao, Xiaoyu Li, Yiyu Zhuang, Qi Zhang, Wenbo Hu, Chaopeng Zhang, Yao Yao, Ying Shan, Long Quan |
| 2025 | CVPR | Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation. | Yuying Ge, Yizhuo Li, Yixiao Ge, Ying Shan |
| 2025 | CVPR | NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed Images. | Lingen Li, Zhaoyang Zhang, Yaowei Li, Jiale Xu, Wenbo Hu, Xiaoyu Li, Weihao Cheng, Jinwei Gu, Tianfan Xue, Ying Shan |
| 2025 | CVPR | Mono2Stereo: A Benchmark and Empirical Study for Stereo Conversion. | Songsong Yu, Yuxin Chen, Zhongang Qi, Zeke Xie, Yifan Wang, Lijun Wang, Ying Shan, Huchuan Lu |
| 2025 | CVPR | DI-PCG: Diffusion-based Efficient Inverse Procedural Content Generation for High-quality 3D Asset Creation. | Wang Zhao, Yan-Pei Cao, Jiale Xu, Yuejiang Dong, Ying Shan |
| 2025 | ICASSP | Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer. | Siyuan Hou, Shansong Liu, Ruibin Yuan, Wei Xue, Ying Shan, Mangsuo Zhao, Chao Zhang |
| 2025 | ICCV | AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction. | Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan |
| 2025 | ICCV | Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos. | Yi Chen, Yuying Ge, Weiliang Tang, Yizhuo Li, Yixiao Ge, Mingyu Ding, Ying Shan, Xihui Liu |
| 2025 | ICCV | DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation. | Yuejiang Dong, Wang Zhao, Jiale Xu, Ying Shan, Song-Hai Zhang |
| 2025 | ICCV | VisionMath: Vision-Form Mathematical Problem-Solving. | Zongyang Ma, Yuxin Chen, Ziqi Zhang, Zhongang Oi, Chunfeng Yuan, Shaojie Zhu, Chengxiang Zhuo, Bing Li, Ye Liu, Zang Li, Ying Shan, Weiming Hu |
| 2025 | ICCV | GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers. | Shijie Ma, Yuying Ge, Teng Wang, Yuxin Guo, Yixiao Ge, Ying Shan |
| 2025 | ICCV | Scalable Image Tokenization with Index Backpropagation Quantization. | Fengyuan Shi, Zhuoyan Luo, Yixiao Ge, Yujiu Yang, Ying Shan, Limin Wang |
| 2025 | ICCV | Mamba-3VL: Taming State Space Model for 3D Vision Language Learning. | Yuan Wang, Yuxin Chen, Zhongang Qi, Lijun Liu, Jile Jiao, Xuetao Feng, Yujia Liang, Ying Shan, Zhipeng Zhang |
| 2025 | ICCV | Geometrycrafter: Consistent Geometry Estimation for Open-World Videos With Diffusion Priors. | Tian-Xing Xu, Xiangjun Gao, Wenbo Hu, Xiaoyu Li, Song-Hai Zhang, Ying Shan |
| 2025 | ICCV | FreeSplatter: Pose-free Gaussian Splatting for Sparse-view 3D Reconstruction. | Jiale Xu, Shenghua Gao, Ying Shan |
| 2025 | ICCV | SEED-Story: Multimodal Long Story Generation with Large Language Model. | Shuai Yang, Yuying Ge, Yang Li, Yukang Chen, Yixiao Ge, Ying Shan, Yingcong Chen |
| 2025 | ICCV | TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models. | Mark Yu, Wenbo Hu, Jinbo Xing, Ying Shan |
| 2025 | ICML | HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding. | Rui Yang, Lin Song, Yicheng Xiao, Runhui Huang, Yixiao Ge, Ying Shan, Hengshuang Zhao |
| 2025 | ICML | Taming Rectified Flow for Inversion and Editing. | Jiangshan Wang, Junfu Pu, Zhongang Qi, Jiayi Guo, Yue Ma, Nisha Huang, Yuxin Chen, Xiu Li, Ying Shan |
| 2025 | ICML | LoRA-Gen: Specializing Large Language Model via Online LoRA Generation. | Yicheng Xiao, Lin Song, Rui Yan, Cheng Cheng, Yixiao Ge, Xiu Li, Ying Shan |
| 2025 | NAACL | Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots. | Chengyue Wu, Zhixuan Liang, Yixiao Ge, Qiushan Guo, Zeyu Lu, Jiahao Wang, Ying Shan, Ping Luo |
| 2025 | SIGGRAPH | VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control. | Yuxuan Bian, Zhaoyang Zhang, Xuan Ju, Mingdeng Cao, Liangbin Xie, Ying Shan, Qiang Xu |
| 2025 | SIGGRAPH | FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios. | Shiyi Zhang, Junhao Zhuang, Zhaoyang Zhang, Ying Shan, Yansong Tang |
| 2025 | SIGGRAPH | Cobra: Efficient Line Art COlorization with BRoAder References. | Junhao Zhuang, Lingen Li, Xuan Ju, Zhaoyang Zhang, Chun Yuan, Ying Shan |
| 2025 | SiggraphA | BlobCtrl: Taming Controllable Blob for Element-level Image Editing. | Yaowei Li, Lingen Li, Zhaoyang Zhang, Xiaoyu Li, Guangzhi Wang, Hongxiang Li, Xiaodong Cun, Ying Shan, Yuexian Zou |
| 2025 | SiggraphA | Assembler: Scalable 3D Part Assembly via Anchor Point Diffusion. | Wang Zhao, Yan-Pei Cao, Jiale Xu, Yuejiang Dong, Ying Shan |
| 2024 | AAAI | SparseGNV: Generating Novel Views of Indoor Scenes with Sparse RGB-D Images. | Weihao Cheng, Yan-Pei Cao, Ying Shan |
| 2024 | AAAI | SC-NeuS: Consistent Neural Surface Reconstruction from Sparse and Noisy Views. | Shi-Sheng Huang, Zi-Xin Zou, Yichi Zhang, Yan-Pei Cao, Ying Shan |
| 2024 | AAAI | T2I-Adapter: Learning Adapters to Dig Out More Controllable Ability for Text-to-Image Diffusion Models. | Chong Mou, Xintao Wang, Liangbin Xie, Yanze Wu, Jian Zhang, Zhongang Qi, Ying Shan |
| 2024 | AAAI | SphereDiffusion: Spherical Geometry-Aware Distortion Resilient Diffusion Model. | Tao Wu, Xuewei Li, Zhongang Qi, Di Hu, Xintao Wang, Ying Shan, Xi Li |
| 2024 | AAAI | A Pre-convolved Representation for Plug-and-Play Neural Illumination Fields. | Yiyu Zhuang, Qi Zhang, Xuan Wang, Hao Zhu, Ying Feng, Xiaoyu Li, Ying Shan, Xun Cao |
| 2024 | AAAI | Sparse3D: Distilling Multiview-Consistent Diffusion for Object Reconstruction from Sparse Views. | Zixin Zou, Weihao Cheng, Yan-Pei Cao, Shi-Sheng Huang, Ying Shan, Song-Hai Zhang |
| 2024 | ACL | LLaMA Pro: Progressive LLaMA with Block Expansion. | Chengyue Wu, Yukang Gan, Yixiao Ge, Zeyu Lu, Jiahao Wang, Ye Feng, Ying Shan, Ping Luo |
| 2024 | CVPR | DreamAvatar: Text-and-Shape Guided 3D Human Avatar Generation via Diffusion Models. | Yukang Cao, Yan-Pei Cao, Kai Han, Ying Shan, Kwan-Yee K. Wong |
| 2024 | CVPR | YOLO-World: Real-Time Open-Vocabulary Object Detection. | Tianheng Cheng, Lin Song, Yixiao Ge, Wenyu Liu, Xinggang Wang, Ying Shan |
| 2024 | CVPR | How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval? | Yuxin Chen, Zongyang Ma, Ziqi Zhang, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Ying Shan, Xiaojuan Qi, Weiming Hu |
| 2024 | CVPR | VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models. | Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang, Chao Weng, Ying Shan |
| 2024 | CVPR | UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition. | Xiaohan Ding, Yiyuan Zhang, Yixiao Ge, Sijie Zhao, Lin Song, Xiangyu Yue, Ying Shan |
| 2024 | CVPR | ConTex-Human: Free-View Rendering of Human from a Single Image with Texture-Consistent Synthesis. | Xiangjun Gao, Xiaoyu Li, Chaopeng Zhang, Qi Zhang, Yanpei Cao, Ying Shan, Long Quan |
| 2024 | CVPR | Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis. | Yuchao Gu, Xintao Wang, Yixiao Ge, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | SmartEdit: Exploring Complex Instruction-Based Image Editing with Multimodal Large Language Models. | Yuzhou Huang, Liangbin Xie, Xintao Wang, Ziyang Yuan, Xiaodong Cun, Yixiao Ge, Jiantao Zhou, Chao Dong, Rui Huang, Ruimao Zhang, Ying Shan |
| 2024 | CVPR | VIT-LENS: Towards Omni-modal Representations. | Weixian Lei, Yixiao Ge, Kun Yi, Jianfeng Zhang, Difei Gao, Dylan Sun, Yuying Ge, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | GS-IR: 3D Gaussian Splatting for Inverse Rendering. | Zhihao Liang, Qi Zhang, Ying Feng, Ying Shan, Kui Jia |
| 2024 | CVPR | PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding. | Zhen Li, Mingdeng Cao, Xintao Wang, Zhongang Qi, Ming-Ming Cheng, Ying Shan |
| 2024 | CVPR | SEED-Bench: Benchmarking Multimodal Large Language Models. | Bohao Li, Yuying Ge, Yixiao Ge, Guangzhi Wang, Rui Wang, Ruimao Zhang, Ying Shan |
| 2024 | CVPR | EvalCrafter: Benchmarking and Evaluating Large Video Generation Models. | Yaofang Liu, Xiaodong Cun, Xuebo Liu, Xintao Wang, Yong Zhang, Haoxin Chen, Yang Liu, Tieyong Zeng, Raymond Chan, Ying Shan |
| 2024 | CVPR | DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing. | Jia-Wei Liu, Yan-Pei Cao, Jay Zhangjie Wu, Weijia Mao, Yuchao Gu, Rui Zhao, Jussi Keppo, Ying Shan, Mike Zheng Shou |
| 2024 | CVPR | BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning. | Ruyang Liu, Chen Li, Yixiao Ge, Thomas H. Li, Ying Shan, Ge Li |
| 2024 | CVPR | Programmable Motion Generation for Open-Set Motion Control Tasks. | Hanchao Liu, Xiaohang Zhan, Shaoli Huang, Tai-Jiang Mu, Ying Shan |
| 2024 | CVPR | HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting. | Xian Liu, Xiaohang Zhan, Jiaxiang Tang, Ying Shan, Gang Zeng, Dahua Lin, Xihui Liu, Ziwei Liu |
| 2024 | CVPR | DiffEditor: Boosting Accuracy and Flexibility on Diffusion-Based Image Editing. | Chong Mou, Xintao Wang, Jiechong Song, Ying Shan, Jian Zhang |
| 2024 | CVPR | Low-Rank Approximation for Sparse Attention in Multi-Modal LLMs. | Lin Song, Yukang Chen, Shuai Yang, Xiaohan Ding, Yixiao Ge, Ying-Cong Chen, Ying Shan |
| 2024 | CVPR | Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities. | Yiyuan Zhang, Xiaohan Ding, Kaixiong Gong, Yixiao Ge, Ying Shan, Xiangyu Yue |
| 2024 | CVPR | HumanRef: Single Image to 3D Human Generation via Reference-Guided Diffusion. | Jingbo Zhang, Xiaoyu Li, Qi Zhang, Yanpei Cao, Ying Shan, Jing Liao |
| 2024 | ECCV | DreamDiffusion: High-Quality EEG-to-Image Generation with Temporal Masked Signal Modeling and CLIP Alignment. | Yunpeng Bai, Xintao Wang, Yan-Pei Cao, Yixiao Ge, Chun Yuan, Ying Shan |
| 2024 | ECCV | Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution Adaptation. | Lanqing Guo, Yingqing He, Haoxin Chen, Menghan Xia, Xiaodong Cun, Yufei Wang, Siyu Huang, Yong Zhang, Xintao Wang, Qifeng Chen, Ying Shan, Bihan Wen |
| 2024 | ECCV | Storytelling Video Generation with Retrieval Augmentation and Character Consistency. | Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao Weng, Ying Shan, Qifeng Chen |
| 2024 | ECCV | BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion. | Xuan Ju, Xian Liu, Xintao Wang, Yuxuan Bian, Ying Shan, Qiang Xu |
| 2024 | ECCV | ST-LLM: Large Language Models Are Effective Temporal Learners. | Ruyang Liu, Chen Li, Haoran Tang, Yixiao Ge, Ying Shan, Ge Li |
| 2024 | ECCV | EA-VTR: Event-Aware Video-Text Retrieval. | Zongyang Ma, Ziqi Zhang, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Yingmin Luo, Xu Li, Xiaojuan Qi, Ying Shan, Weiming Hu |
| 2024 | ECCV | MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model. | Muyao Niu, Xiaodong Cun, Xintao Wang, Yong Zhang, Ying Shan, Yinqiang Zheng |
| 2024 | ECCV | DynamiCrafter: Animating Open-Domain Images with Video Diffusion Priors. | Jinbo Xing, Menghan Xia, Yong Zhang, Hao Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, Tien-Tsin Wong |
| 2024 | ECCV | Texture-GS: Disentangling the Geometry and Texture for 3D Gaussian Splatting Editing. | Tian-Xing Xu, Wenbo Hu, Yu-Kun Lai, Ying Shan, Song-Hai Zhang |
| 2024 | ECCV | Noise Calibration: Plug-and-Play Content-Preserving Video Enhancement Using Pre-trained Video Diffusion Models. | Qinyu Yang, Hao Chen, Yong Zhang, Menghan Xia, Xiaodong Cun, Zhixun Su, Ying Shan |
| 2024 | ECCV | DMiT: Deformable Mipmapped Tri-Plane Representation for Dynamic Scenes. | Jing-Wen Yang, Jia-Mu Sun, Yong-Liang Yang, Jie Yang, Ying Shan, Yan-Pei Cao, Lin Gao |
| 2024 | ECCV | HiFi-123: Towards High-Fidelity One Image to 3D Content Generation. | Wangbo Yu, Li Yuan, Yan-Pei Cao, Xiangjun Gao, Xiaoyu Li, Wenbo Hu, Quan Long, Ying Shan, Yonghong Tian |
| 2024 | ICASSP | Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning. | Shansong Liu, Atin Sakkeer Hussain, Chenshuo Sun, Ying Shan |
| 2024 | ICASSP | Humtrans: A Novel Open-Source Dataset for Humming Melody Transcription and Beyond. | Shansong Liu, Xu Li, Dian Li, Ying Shan |
| 2024 | ICASSP | Unified Pretraining Target Based Video-Music Retrieval with Music Rhythm and Video Optical Flow Information. | Tianjun Mao, Shansong Liu, Yunxuan Zhang, Dian Li, Ying Shan |
| 2024 | ICASSP | Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion. | Binzhu Sha, Xu Li, Zhiyong Wu, Ying Shan, Helen Meng |
| 2024 | ICLR | Making LLaMA SEE and Draw with SEED Tokenizer. | Yuying Ge, Sijie Zhao, Ziyun Zeng, Yixiao Ge, Chen Li, Xintao Wang, Ying Shan |
| 2024 | ICLR | ScaleCrafter: Tuning-free Higher-Resolution Visual Generation with Diffusion Models. | Yingqing He, Shaoshu Yang, Haoxin Chen, Xiaodong Cun, Menghan Xia, Yong Zhang, Xintao Wang, Ran He, Qifeng Chen, Ying Shan |
| 2024 | ICLR | DragonDiffusion: Enabling Drag-style Manipulation on Diffusion Models. | Chong Mou, Xintao Wang, Jiechong Song, Ying Shan, Jian Zhang |
| 2024 | ICLR | FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling. | Haonan Qiu, Menghan Xia, Yong Zhang, Yingqing He, Xintao Wang, Ying Shan, Ziwei Liu |
| 2024 | ICLR | TapMo: Shape-aware Motion Generation of Skeleton-free Characters. | Jiaxu Zhang, Shaoli Huang, Zhigang Tu, Xin Chen, Xiaohang Zhan, Gang Yu, Ying Shan |
| 2024 | Interspeech | AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild. | Yongkang Yin, Xu Li, Ying Shan, Yuexian Zou |
| 2024 | SIGGRAPH | MotionCtrl: A Unified and Flexible Motion Controller for Video Generation. | Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan |
| 2024 | WWW | RecDCL: Dual Contrastive Learning for Recommendation. | Dan Zhang, Yangliao Geng, Wenwen Gong, Zhongang Qi, Zhiyu Chen, Xing Tang, Ying Shan, Yuxiao Dong, Jie Tang |
| 2023 | AAAI | Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval. | Yizhen Chen, Jie Wang, Lijian Lin, Zhongang Qi, Jin Ma, Ying Shan |
| 2023 | AAAI | Accelerating the Training of Video Super-resolution Models. | Lijian Lin, Xintao Wang, Zhongang Qi, Ying Shan |
| 2023 | AAAI | Mitigating Artifacts in Real-World Video Super-resolution Models. | Liangbin Xie, Xintao Wang, Shuwei Shi, Jinjin Gu, Chao Dong, Ying Shan |
| 2023 | AAAI | What Does Your Face Sound Like? 3D Face Shape towards Voice. | Zhihan Yang, Zhiyong Wu, Ying Shan, Jia Jia |
| 2023 | AAAI | Darwinian Model Upgrades: Model Evolving with Selective Compatibility. | Binjie Zhang, Shupeng Su, Yixiao Ge, Xuyuan Xu, Yexin Wang, Chun Yuan, Mike Zheng Shou, Ying Shan |
| 2023 | ACL | DSRM: Boost Textual Adversarial Training with Distribution Shift Risk Minimization. | Songyang Gao, Shihan Dou, Yan Liu, Xiao Wang, Qi Zhang, Zhongyu Wei, Jin Ma, Ying Shan |
| 2023 | ACL | On the Universal Adversarial Perturbations for Efficient Data-free Adversarial Detection. | Songyang Gao, Shihan Dou, Qi Zhang, Xuanjing Huang, Jin Ma, Ying Shan |
| 2023 | ACL | A Confidence-based Partial Label Learning Model for Crowd-Annotated Named Entity Recognition. | Limao Xiong, Jie Zhou, Qunxi Zhu, Xiao Wang, Yuanbin Wu, Qi Zhang, Tao Gui, Xuanjing Huang, Jin Ma, Ying Shan |
| 2023 | ACL | Characterizing the Impacts of Instances on Robustness. | Rui Zheng, Zhiheng Xi, Qin Liu, Wenbin Lai, Tao Gui, Qi Zhang, Xuanjing Huang, Jin Ma, Ying Shan, Weifeng Ge |
| 2023 | CVPR | SurfelNeRF: Neural Surfel Radiance Fields for Online Photorealistic Reconstruction of Indoor Scenes. | Yiming Gao, Yan-Pei Cao, Ying Shan |
| 2023 | CVPR | HRDFuse: Monocular 360° Depth Estimation by Collaboratively Learning Holistic-with-Regional Depth Distributions. | Hao Ai, Zidong Cao, Yan-Pei Cao, Ying Shan, Lin Wang |
| 2023 | CVPR | High-fidelity Facial Avatar Reconstruction from Monocular Video with Generative Priors. | Yunpeng Bai, Yanbo Fan, Xuan Wang, Yong Zhang, Jingxiang Sun, Chun Yuan, Ying Shan |
| 2023 | CVPR | NTIRE 2023 Challenge on 360° Omnidirectional Image and Video Super-Resolution: Datasets, Methods and Results. | Mingdeng Cao, Chong Mou, Fanghua Yu, Xintao Wang, Yinqiang Zheng, Jian Zhang, Chao Dong, Gen Li, Ying Shan, Radu Timofte, Xiaopeng Sun, Weiqi Li, Zhenyu Zhang, Xuhan Sheng, Bin Chen, Haoyu Ma, Ming Cheng, Shijie Zhao, Wanwan Cui, Tianyu Xu, Chunyang Li, Long Bao, Heng Sun, Huaibo Huang, Xiaoqiang Zhou, Yuang Ai, Ran He, Renlong Wu, Yi Yang, Zhilu Zhang, Shuohao Zhang, Junyi Li, Yunjin Chen, Dongwei Ren, Wangmeng Zuo, Qian Wang, Hao-Hsiang Yang, Yi-Chung Chen, Zhi-Kai Huang, Wei-Ting Chen, Yuan-Chun Chiang, Hua-En Chang, I-Hsiang Chen, Chia-Hsuan Hsieh, Sy-Yen Kuo, Zebin Zhang, Jiaqi Zhang, Yuhui Wang, Shuhao Cui, Junshi Huang, Li Zhu, Shuman Tian, Wei Yu, Bingchun Luo |
| 2023 | CVPR | Local-to-Global Registration for Bundle-Adjusting Neural Radiance Fields. | Yue Chen, Xingyu Chen, Xuan Wang, Qi Zhang, Yu Guo, Ying Shan, Fei Wang |
| 2023 | CVPR | ViLEM: Visual-Language Error Modeling for Image-Text Retrieval. | Yuxin Chen, Zongyang Ma, Ziqi Zhang, Zhongang Qi, Chunfeng Yuan, Ying Shan, Bing Li, Weiming Hu, Xiaohu Qie, Jianping Wu |
| 2023 | CVPR | Improved Test-Time Adaptation for Domain Generalization. | Liang Chen, Yong Zhang, Yibing Song, Ying Shan, Lingqiao Liu |
| 2023 | CVPR | DPE: Disentanglement of Pose and Expression for General Video Portrait Editing. | Youxin Pang, Yong Zhang, Weize Quan, Yanbo Fan, Xiaodong Cun, Ying Shan, Dong-Ming Yan |
| 2023 | CVPR | All in One: Exploring Unified Video-Language Pre-Training. | Jinpeng Wang, Yixiao Ge, Rui Yan, Yuying Ge, Kevin Qinghong Lin, Satoshi Tsutsui, Xudong Lin, Guanyu Cai, Jianping Wu, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | CVPR | Accelerating Vision-Language Pretraining with Free Language Modeling. | Teng Wang, Yixiao Ge, Feng Zheng, Ran Cheng, Ying Shan, Xiaohu Qie, Ping Luo |
| 2023 | CVPR | DropMAE: Masked Autoencoders with Spatial-Attention Dropout for Tracking Tasks. | Qiangqiang Wu, Tianyu Yang, Ziquan Liu, Baoyuan Wu, Ying Shan, Antoni B. Chan |
| 2023 | CVPR | Dream3D: Zero-Shot Text-to-3D Synthesis Using 3D Shape Prior and Text-to-Image Diffusion Models. | Jiale Xu, Xintao Wang, Weihao Cheng, Yan-Pei Cao, Ying Shan, Xiaohu Qie, Shenghua Gao |
| 2023 | CVPR | RILS: Masked Visual Reconstruction in Language Semantic Space. | Shusheng Yang, Yixiao Ge, Kun Yi, Dian Li, Ying Shan, Xiaohu Qie, Xinggang Wang |
| 2023 | CVPR | 3D GAN Inversion with Facial Symmetry Prior. | Fei Yin, Yong Zhang, Xuan Wang, Tengfei Wang, Xiaoyu Li, Yuan Gong, Yanbo Fan, Xiaodong Cun, Ying Shan, Cengiz ztireli, Yujiu Yang |
| 2023 | CVPR | OSRT: Omnidirectional Image Super-Resolution with Distortion-aware Transformer. | Fanghua Yu, Xintao Wang, Mingdeng Cao, Gen Li, Ying Shan, Chao Dong |
| 2023 | CVPR | SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation. | Wenxuan Zhang, Xiaodong Cun, Xuan Wang, Yong Zhang, Xi Shen, Yu Guo, Ying Shan, Fei Wang |
| 2023 | CVPR | Skinned Motion Retargeting with Residual Perception of Motion Semantics & Geometry. | Jiaxu Zhang, Junwu Weng, Di Kang, Fang Zhao, Shaoli Huang, Xuefei Zhe, Linchao Bao, Ying Shan, Jue Wang, Zhigang Tu |
| 2023 | CVPR | Learning Anchor Transformations for 3D Garment Animation. | Fang Zhao, Zekun Li, Shaoli Huang, Junwu Weng, Tianfei Zhou, Guo-Sen Xie, Jue Wang, Ying Shan |
| 2023 | CVPR | LayoutDiffusion: Controllable Diffusion Model for Layout-to-Image Generation. | Guangcong Zheng, Xianpan Zhou, Xuewei Li, Zhongang Qi, Ying Shan, Xi Li |
| 2023 | ICASSP | ERBNet: An Effective Representation Based Network for Unbiased Scene Graph Generation. | Wenxi Ma, Tianxiang Hou, Qianji Di, Zhongang Qi, Ying Shan, Hanzi Wang |
| 2023 | ICASSP | Enhancing the Vocal Range of Single-Speaker Singing Voice Synthesis with Melody-Unsupervised Pre-Training. | Shaohuan Zhou, Xu Li, Zhiyong Wu, Ying Shan, Helen Meng |
| 2023 | ICCV | OmniZoomer: Learning to Move and Zoom in on Sphere at High-Resolution. | Zidong Cao, Hao Ai, Yan-Pei Cao, Ying Shan, Xiaohu Qie, Lin Wang |
| 2023 | ICCV | MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and Editing. | Mingdeng Cao, Xintao Wang, Zhongang Qi, Ying Shan, Xiaohu Qie, Yinqiang Zheng |
| 2023 | ICCV | Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object Detection. | Yuxin Fang, Shusheng Yang, Shijie Wang, Yixiao Ge, Ying Shan, Xinggang Wang |
| 2023 | ICCV | Exploring Model Transferability through the Lens of Potential Energy. | Xiaotong Li, Zixuan Hu, Yixiao Ge, Ying Shan, Ling-Yu Duan |
| 2023 | ICCV | HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single Video. | Jia-Wei Liu, Yan-Pei Cao, Tianyuan Yang, Zhongcong Xu, Jussi Keppo, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | ICCV | Order-Prompted Tag Sequence Generation for Video Tagging. | Zongyang Ma, Ziqi Zhang, Yuxin Chen, Zhongang Qi, Yingmin Luo, Zekun Li, Chunfeng Yuan, Bing Li, Xiaohu Qie, Ying Shan, Weiming Hu |
| 2023 | ICCV | FateZero: Fusing Attentions for Zero-shot Text-based Video Editing. | Chenyang Qi, Xiaodong Cun, Yong Zhang, Chenyang Lei, Xintao Wang, Ying Shan, Qifeng Chen |
| 2023 | ICCV | Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation. | Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gu, Yufei Shi, Wynne Hsu, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2023 | ICCV | Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a Short Video. | Xiuzhe Wu, Pengfei Hu, Yang Wu, Xiaoyang Lyu, Yan-Pei Cao, Ying Shan, Wenming Yang, Zhongqian Sun, Xiaojuan Qi |
| 2023 | ICLR | Masked Image Modeling with Denoising Contrast. | Kun Yi, Yixiao Ge, Xiaotong Li, Shusheng Yang, Dian Li, Jianping Wu, Ying Shan, Xiaohu Qie |
| 2023 | ICML | π-Tuning: Transferring Multimodal Foundation Models with Optimal Multi-task Interpolation. | Chengyue Wu, Teng Wang, Yixiao Ge, Zeyu Lu, Ruisong Zhou, Ying Shan, Ping Luo |
| 2023 | ICML | DeSRA: Detect and Delete the Artifacts of GAN-based Real-World Super-Resolution Models. | Liangbin Xie, Xintao Wang, Xiangyu Chen, Gen Li, Ying Shan, Jiantao Zhou, Chao Dong |
| 2023 | IJCAI | SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation. | Xuewei Li, Tao Wu, Zhongang Qi, Gaoang Wang, Ying Shan, Xi Li |
| 2023 | Interspeech | Prosody Modeling with 3D Visual Information for Expressive Video Dubbing. | Zhihan Yang, Shansong Liu, Xu Li, Haozhe Wu, Zhiyong Wu, Ying Shan, Jia Jia |
| 2023 | KDD | Binary Embedding-based Retrieval at Tencent. | Yukang Gan, Yixiao Ge, Chang Zhou, Shupeng Su, Zhouchuan Xu, Xuyuan Xu, Quanchao Hui, Xiang Chen, Yexin Wang, Ying Shan |
| 2023 | SIGGRAPH | NeRF-Texture: Texture Synthesis with Neural Radiance Fields. | Yihua Huang, Yan-Pei Cao, Yu-Kun Lai, Ying Shan, Lin Gao |
| 2023 | SIGGRAPH | NOFA: NeRF-based One-shot Facial Avatar Reconstruction. | Wangbo Yu, Yanbo Fan, Yong Zhang, Xuan Wang, Fei Yin, Yunpeng Bai, Yan-Pei Cao, Ying Shan, Yang Wu, Zhongqian Sun, Baoyuan Wu |
| 2023 | SiggraphA | Interactive Story Visualization with Multiple Characters. | Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, Yujiu Yang |
| 2023 | SiggraphA | VMesh: Hybrid Volume-Mesh Representation for Efficient View Synthesis. | Yuan-Chen Guo, Yan-Pei Cao, Chen Wang, Yu He, Ying Shan, Song-Hai Zhang |
| 2023 | SiggraphA | Neural Point-based Volumetric Avatar: Surface-guided Neural Points for Efficient and Photorealistic Volumetric Head Avatar. | Cong Wang, Di Kang, Yan-Pei Cao, Linchao Bao, Ying Shan, Song-Hai Zhang |
| 2023 | SiggraphA | Anti-Aliased Neural Implicit Surfaces with Encoding Level of Detail. | Yiyu Zhuang, Qi Zhang, Ying Feng, Hao Zhu, Yao Yao, Xiaoyu Li, Yan-Pei Cao, Ying Shan, Xun Cao |
| 2022 | ACCV | Robust Human Matting via Semantic Guidance. | Xiangguang Chen, Ye Zhu, Yu Li, Bingtao Fu, Lei Sun, Ying Shan, Shan Liu |
| 2022 | CVPR | Bridging Video-text Retrieval with Multiple Choice Questions. | Yuying Ge, Yixiao Ge, Xihui Liu, Dian Li, Ying Shan, Xiaohu Qie, Ping Luo |
| 2022 | CVPR | UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection. | Ye Liu, Siyuan Li, Yang Wu, Chang Wen Chen, Ying Shan, Xiaohu Qie |
| 2022 | CVPR | Object-aware Video-language Pre-training for Retrieval. | Alex Jinpeng Wang, Yixiao Ge, Guanyu Cai, Rui Yan, Xudong Lin, Ying Shan, Xiaohu Qie, Mike Zheng Shou |
| 2022 | CVPR | VFHQ: A High-Quality Dataset and Benchmark for Video Face Super-Resolution. | Liangbin Xie, Xintao Wang, Honglun Zhang, Chao Dong, Ying Shan |
| 2022 | CVPR | BTS: A Bi-lingual Benchmark for Text Segmentation in the Wild. | Xixi Xu, Zhongang Qi, Jianqi Ma, Honglun Zhang, Ying Shan, Xiaohu Qie |
| 2022 | CVPR | Temporally Efficient Vision Transformer for Video Instance Segmentation. | Shusheng Yang, Xinggang Wang, Yu Li, Yuxin Fang, Jiemin Fang, Wenyu Liu, Xun Zhao, Ying Shan |
| 2022 | ECCV | MILES: Visual BERT Pre-training with Injected Language Semantics for Video-Text Retrieval. | Yuying Ge, Yixiao Ge, Xihui Liu, Jinpeng Wang, Jianping Wu, Ying Shan, Xiaohu Qie, Ping Luo |
| 2022 | ECCV | VQFR: Blind Face Restoration with Vector-Quantized Dictionary and Parallel Decoder. | Yuchao Gu, Xintao Wang, Liangbin Xie, Chao Dong, Gen Li, Ying Shan, Ming-Ming Cheng |
| 2022 | ECCV | mc-BEiT: Multi-choice Discretization for Image BERT Pre-training. | Xiaotong Li, Yixiao Ge, Kun Yi, Zixuan Hu, Ying Shan, Ling-Yu Duan |
| 2022 | ECCV | Metric Learning Based Interactive Modulation for Real-World Super-Resolution. | Chong Mou, Yanze Wu, Xintao Wang, Chao Dong, Jian Zhang, Ying Shan |
| 2022 | ECCV | Not All Models Are Equal: Predicting Model Transferability in a Self-challenging Fisher Space. | Wenqi Shao, Xun Zhao, Yixiao Ge, Zhaoyang Zhang, Lei Yang, Xiaogang Wang, Ying Shan, Ping Luo |
| 2022 | ICASSP | Audio-To-Symbolic Arrangement Via Cross-Modal Music Representation Learning. | Ziyu Wang, Dejing Xu, Gus Xia, Ying Shan |
| 2022 | ICLR | Uncertainty Modeling for Out-of-Distribution Generalization. | Xiaotong Li, Yongxing Dai, Yixiao Ge, Jun Liu, Ying Shan, Lingyu Duan |
| 2022 | ICLR | Dynamic Token Normalization improves Vision Transformers. | Wenqi Shao, Yixiao Ge, Zhaoyang Zhang, Xuyuan Xu, Xiaogang Wang, Ying Shan, Ping Luo |
| 2022 | ICLR | Hot-Refresh Model Upgrades with Regression-Free Compatible Training in Image Retrieval. | Binjie Zhang, Yixiao Ge, Yantao Shen, Yu Li, Chun Yuan, Xuyuan Xu, Yexin Wang, Ying Shan |
| 2022 | IJCAI | Towards Universal Backward-Compatible Representation Learning. | Binjie Zhang, Yixiao Ge, Yantao Shen, Shupeng Su, Fanzi Wu, Chun Yuan, Xuyuan Xu, Yexin Wang, Ying Shan |
| 2022 | Interspeech | A Hierarchical Speaker Representation Framework for One-shot Singing Voice Conversion. | Xu Li, Shansong Liu, Ying Shan |
| 2022 | ICTAI | Convolutional Transformer with Similarity-based Boundary Prediction for Action Segmentation. | Dazhao Du, Bing Su, Yu Li, Zhongang Qi, Lingyu Si, Ying Shan |
| 2021 | CVPR | Distilling Audio-Visual Knowledge by Compositional Contrastive Learning. | Yanbei Chen, Yongqin Xian, A. Sophia Koepke, Ying Shan, Zeynep Akata |
| 2021 | CVPR | Towards Real-World Blind Face Restoration With Generative Facial Prior. | Xintao Wang, Yu Li, Honglun Zhang, Ying Shan |
| 2021 | CVPR | Open-Book Video Captioning With Retrieve-Copy-Generate Network. | Ziqi Zhang, Zhongang Qi, Chunfeng Yuan, Ying Shan, Bing Li, Ying Deng, Weiming Hu |
| 2021 | ICCV | Instances as Queries. | Yuxin Fang, Shusheng Yang, Xinggang Wang, Yu Li, Chen Fang, Ying Shan, Bin Feng, Wenyu Liu |
| 2021 | ICCV | Towards Vivid and Diverse Image Colorization with Generative Color Prior. | Yanze Wu, Xintao Wang, Yu Li, Honglun Zhang, Xun Zhao, Ying Shan |
| 2021 | ICCV | Crossover Learning for Fast Online Video Instance Segmentation. | Shusheng Yang, Yuxin Fang, Xinggang Wang, Yu Li, Chen Fang, Ying Shan, Bin Feng, Wenyu Liu |
| 2020 | ECCV | Fast Video Object Segmentation Using the Global Context Module. | Yu Li, Zhuoran Shen, Ying Shan |
| 2020 | IJCAI | Feature Augmented Memory with Global Attention Network for VideoQA. | Jiayin Cai, Chun Yuan, Cheng Shi, Lei Li, Yangyang Cheng, Ying Shan |
| 2018 | KDD | Recurrent Binary Embedding for GPU-Enabled Exhaustive Retrieval from Billion-Scale Semantic Vectors. | Ying Shan, Jian Jiao, Jie Zhu, J. C. Mao |
| 2017 | KDD | Deep Embedding Forest: Forest-based Serving with Deep Embedding Features. | Jie Zhu, Ying Shan, J. C. Mao, Dong Yu, Holakou Rahmanian, Yi Zhang |
| 2016 | KDD | Deep Crossing: Web-Scale Modeling without Manually Crafted Combinatorial Features. | Ying Shan, T. Ryan Hoens, Jian Jiao, Haijing Wang, Dong Yu, J. C. Mao |
| 2013 | HCI | An Empirical Research on Designing and Promoting the Brand Logo of Yangshan Shuimi Peaches Based on the Theory of Brand Experience. | Liang Yin, Junmiao Wang, Ying Shan, Yi Jin, Zilin Sun, Weifeng Huang, Binbin Li |
| 2009 | ACCV | Efficient Scale-Space Spatiotemporal Saliency Tracking for Distortion-Free Video Retargeting. | Gang Hua, Cha Zhang, Zicheng Liu, Zhengyou Zhang, Ying Shan |
| 2009 | ISCAS | Kernel PCA Regression for Missing Data Estimation in DNA Microarray Analysis. | Ying Shan, Guang Deng |
| 2008 | CVPR | Discovering class specific composite features through discriminative sampling with Swendsen-Wang Cut. | Feng Han, Ying Shan, Harpreet S. Sawhney, Rakesh Kumar |
| 2007 | CVPR | PEET: Prototype Embedding and Embedding Transition for Matching Vehicles over Disparate Viewpoints. | Yanlin Guo, Ying Shan, Harpreet S. Sawhney, Rakesh Kumar |
| 2006 | CVPR | Learning Exemplar-Based Categorization for the Detection of Multi-View Multi-Pose Objects. | Ying Shan, Feng Han, Harpreet S. Sawhney, Rakesh Kumar |
| 2005 | CVPR | Vehicle Fingerprinting for Reacquisition and Tracking in Videos. | Yanlin Guo, Steven C. Hsu, Ying Shan, Harpreet S. Sawhney, Rakesh Kumar |
| 2005 | CVPR | Unsupervised Learning of Discriminative Edge Measures for Vehicle Matching between Non-Overlapping Cameras. | Ying Shan, Harpreet S. Sawhney, Rakesh Kumar |
| 2005 | ICCV | Vehicle Identification between Non-Overlapping Cameras without Direct Feature Matching. | Ying Shan, Harpreet S. Sawhney, Rakesh Kumar |
| 2004 | CVPR | Linear Model Hashing and Batch RANSAC for Rapid and Accurate Object Recognition. | Ying Shan, Bogdan Matei, Harpreet S. Sawhney, Rakesh Kumar, Daniel F. Huber, Martial Hebert |
| 2004 | ECCV | Partial Object Matching with Shapeme Histograms. | Ying Shan, Harpreet S. Sawhney, Bogdan Matei, Rakesh Kumar |
| 2003 | ICIP | Incremental motion estimation through modified bundle adjustment. | Zhengyou Zhang, Ying Shan |
| 2001 | CVPR | Image-Based Surface Detail Transfer. | Ying Shan, Zicheng Liu, Zhengyou Zhang |
| 2001 | ICCV | Model-Based Bundle Adjustment with Application to Face Modeling. | Ying Shan, Zicheng Liu, Zhengyou Zhang |
| 2001 | ICCV | Cloning Your Own Face with a Desktop Camera. | Zhengyou Zhang, Zicheng Liu, Dennis Adler, Michael F. Cohen, Erik Hanson, Ying Shan |
| 2001 | SIGGRAPH | Expressive expression mapping with ratio images. | Zicheng Liu, Ying Shan, Zhengyou Zhang |
| 2000 | CVPR | Corner Guided Curve Matching and its Application to Scene Reconstruction. | Ying Shan, Zhengyou Zhang |
| 2000 | MVA | Curve Matching with Probabilistic Relaxation. | Ying Shan, Zhengyou Zhang |
| 2000 | MVA | Visual Screen: Transforming an Ordinary Screen into a Touch Screen. | Zhengyou Zhang, Ying Shan |