Zhou Zhao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
258
Venues
31
Active years
2011–2026
Best venue rank
A*
Where they publish
- A*ACL59 papers
- A*AAAI28 papers
- A*IJCAI21 papers
- A*CVPR20 papers
- MulticonferenceICASSP12 papers
- A*ICLR12 papers
- A*ICML12 papers
- A*SIGIR12 papers
- A*EMNLP11 papers
- ACIKM10 papers
- A*KDD9 papers
- A*WWW8 papers
- AMICCAI8 papers
- A*ICCV7 papers
- AInterspeech4 papers
- BEDBT4 papers
- BDASFAA3 papers
- BCOLING2 papers
- BIJCNLP2 papers
- ANAACL2 papers
- BICPR2 papers
- BPAKDD1 paper
- A*ICRA1 paper
- AIUI1 paper
- CIECON1 paper
- AIROS1 paper
- AWSDM1 paper
- ASDM1 paper
- BSMC1 paper
- CICA3PP1 paper
- NationalICNC1 paper
Papers
258 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | F.A.C.U.L.: Language-Based Interaction with AI Companions in Gaming. | Wenya Wei, Sipeng Yang, Qixian Zhou, Ruochen Liu, Xuelei Zhang, Yifu Yuan, Yan Jiang, Yongle Luo, Hailong Wang, Tianzhou Wang, Peipei Jin, Wangtong Liu, Zhou Zhao, Xiaogang Jin, Elvis S. Liu |
| 2026 | ACL | WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training. | Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang, Jingyu Lu, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao |
| 2026 | ACL | Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models. | Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao |
| 2026 | ACL | Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-Speech. | Fangming Feng, Dongjie Fu, Zequn Xie, Yu Zhang, Yangyang Wu, Zhou Zhao, Tao Jin |
| 2026 | ACL | View-R1: Asymmetric Policy Optimization for Difficulty-Aware Multimodal Reinforcement Learning. | Minjie Hong, Zirun Guo, Jiabao Zhang, Zehan Wang, Ziang Zhang, Tao Jin, Zhou Zhao |
| 2026 | ACL | Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization. | Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2026 | ACL | DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration. | Yanru Huo, Ziyue Jiang, Zuoli Tang, Qingyang Hong, Zhou Zhao |
| 2026 | ACL | VoxMind: An End-to-End Agentic Spoken Dialogue System. | Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao |
| 2026 | ACL | Iterative Self-Correction for Text-Driven Person Re-Identification with Large Vision-Language Models. | Guijin Luo, Zequn Xie, Sihang Cai, Chuxin Wang, Zhou Zhao, Yixuan Tang |
| 2026 | ACL | SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness. | Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao |
| 2026 | ACL | Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios. | Changhao Pan, Rui Yang, Han Wang, Zhuan Zhou, Xuming He, Wenxiang Guo, Ziyue Jiang, Ruiqi Li, Yu Zhang, Chenyuhao Wen, Ke Lei, Xiang Yin, Jingyu Lu, Zhiyuan Zhu, Zhou Zhao |
| 2026 | ACL | Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search. | Zequn Xie, Guijin Luo, Chuxin Wang, Sihang Cai, Tao Jin, Zhou Zhao, Yixuan Tang |
| 2026 | ACL | Unified Thinker: A General Reasoning Core for Image Generation. | Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng, Zhou Zhao |
| 2026 | PAKDD | Learning Multi-aspect Item Palette: A Semantic Tokenization Framework for Generative Recommendation. | Qijiong Liu, Jieming Zhu, Zhaocheng Du, Lu Fan, Zhou Zhao, Xiao-Ming Wu |
| 2025 | AAAI | TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching. | Wenxiang Guo, Yu Zhang, Changhao Pan, Rongjie Huang, Li Tang, Ruiqi Li, Zhiqing Hong, Yongqi Wang, Zhou Zhao |
| 2025 | AAAI | Speech Watermarking with Discrete Intermediate Representations. | Shengpeng Ji, Ziyue Jiang, Jialong Zuo, Minghui Fang, Yifu Chen, Tao Jin, Zhou Zhao |
| 2025 | AAAI | MergeNet: Knowledge Migration Across Heterogeneous Models, Tasks, and Modalities. | Kunxi Li, Tianyu Zhan, Kairui Fu, Shengyu Zhang, Kun Kuang, Jiwei Li, Zhou Zhao, Fan Wu, Fei Wu |
| 2025 | ACL | T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback. | Zehan Wang, Ke Lei, Chen Zhu, Jiawei Huang, Sashuai Zhou, Luping Liu, Xize Cheng, Shengpeng Ji, Zhenhui Ye, Tao Jin, Zhou Zhao |
| 2025 | ACL | CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao |
| 2025 | ACL | Enhancing Multimodal Unified Representations for Cross Modal Generalization. | Hai Huang, Yan Xia, Shengpeng Ji, Shulei Wang, Hanting Wang, Minghui Fang, Jieming Zhu, Zhenhua Dong, Sashuai Zhou, Zhou Zhao |
| 2025 | ACL | MIRA: Empowering One-Touch AI Services on Smartphones with MLLM-based Instruction Recommendation. | Zhipeng Bian, Jieming Zhu, Xuyang Xie, Quanyu Dai, Zhou Zhao, Zhenhua Dong |
| 2025 | ACL | WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models. | Yifu Chen, Shengpeng Ji, Haoxiao Wang, Ziqing Wang, Siyu Chen, Jinzheng He, Jin Xu, Zhou Zhao |
| 2025 | ACL | STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotation. | Wenxiang Guo, Yu Zhang, Changhao Pan, Zhiyuan Zhu, Ruiqi Li, ZheTao Chen, Wenhao Xu, Fei Wu, Zhou Zhao |
| 2025 | ACL | OS Agents: A Survey on MLLM-based Agents for Computer, Phone and Browser Use. | Xueyu Hu, Tao Xiong, Biao Yi, Zishu Wei, Ruixuan Xiao, Yurun Chen, Jiasheng Ye, Meiling Tao, Xiangxin Zhou, Ziyu Zhao, Yuhuai Li, Shengze Xu, Shenzhi Wang, Xinchen Xu, Shuofei Qiao, Zhaokai Wang, Kun Kuang, Tieyong Zeng, Liang Wang, Jiwei Li, Yuchen Eleanor Jiang, Wangchunshu Zhou, Guoyin Wang, Keting Yin, Zhou Zhao, Hongxia Yang, Fan Wu, Shengyu Zhang, Fei Wu |
| 2025 | ACL | Language-Codec: Bridging Discrete Codec Representations and Speech Language Models. | Shengpeng Ji, Minghui Fang, Jialong Zuo, Ziyue Jiang, Dingdong Wang, Hanting Wang, Hai Huang, Zhou Zhao |
| 2025 | ACL | ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control. | Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao |
| 2025 | ACL | FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio Generation. | Huadai Liu, Jialei Wang, Rongjie Huang, Yang Liu, Heng Lu, Zhou Zhao, Wei Xue |
| 2025 | ACL | Sign2Vis: Automated Data Visualization from Sign Language. | Yao Wan, Yang Wu, Zhen Li, Guobiao Zhang, Hongyu Zhang, Zhou Zhao, Hai Jin, April Yi Wang |
| 2025 | ACL | TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis. | Yu Zhang, Wenxiang Guo, Changhao Pan, Dongyu Yao, Zhiyuan Zhu, Ziyue Jiang, Yuhan Wang, Tao Jin, Zhou Zhao |
| 2025 | ACL | Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao |
| 2025 | COLING | VoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation. | Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao |
| 2025 | CVPR | SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language. | Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | CVPR | RoboGround: Robotic Manipulation with Grounded Vision-Language Priors. | Haifeng Huang, Xinyi Chen, Yilun Chen, Hao Li, Xiaoshen Han, Zehan Wang, Tai Wang, Jiangmiao Pang, Zhou Zhao |
| 2025 | CVPR | Non-Natural Image Understanding with Advancing Frequency-based Vision Encoders. | Wang Lin, Qingsong Wang, Yueying Feng, Shulei Wang, Tao Jin, Zhou Zhao, Fei Wu, Chang Yao, Jingyuan Chen |
| 2025 | CVPR | Towards Transformer-Based Aligned Generation with Self-Coherence Guidance. | Shulei Wang, Wang Lin, Hai Huang, Hanting Wang, Sihang Cai, WenKang Han, Tao Jin, Jingyuan Chen, Jiacheng Sun, Jieming Zhu, Zhou Zhao |
| 2025 | CVPR | FADA: Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG Distillation. | Tianyun Zhong, Chao Liang, Jianwen Jiang, Gaojie Lin, Jiaqi Yang, Zhou Zhao |
| 2025 | EMNLP | ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment. | Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong |
| 2025 | EMNLP | InteractSpeech: A Speech Dialogue Interaction Corpus for Spoken Dialogue Model. | Yifu Chen, Shengpeng Ji, Ziqing Wang, Hanting Wang, Zhou Zhao |
| 2025 | EMNLP | Versatile Framework for Song Generation with Prompt-based Control. | Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Ruiqi Li, Jingyu Lu, Rongjie Huang, Ruiyuan Zhang, Zhiqing Hong, Ziyue Jiang, Zhou Zhao |
| 2025 | EMNLP | RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendation. | Sashuai Zhou, Weinan Gan, Qijiong Liu, Ke Lei, Jieming Zhu, Hai Huang, Yan Xia, Ruiming Tang, Zhenhua Dong, Zhou Zhao |
| 2025 | ICASSP | Curriculum Learning aided Audio-Visual Speech Recognition with Arbitrary Speaker Number. | Yuxiao Lin, Tao Jin, Xize Cheng, Zhou Zhao, Fei Wu |
| 2025 | ICASSP | NAT3DSound: 3D Spatial Sound Field Synthesis with Multi-Modal Non-Autoregressive Transformer. | Fuming You, Rongjie Huang, Boyang Zhang, Yongqi Wang, Zhiqing Hong, Zhimeng Zhang, Zhou Zhao |
| 2025 | ICASSP | Pathological Prior-Guided Multiple Instance Learning For Mitigating Catastrophic Forgetting in Breast Cancer Whole Slide Image Classification. | Weixi Zheng, Aoling Huang, Jingping Yuan, Haoyu Zhao, Zhou Zhao, Yongchao Xu, Thierry Graud |
| 2025 | ICASSP | Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao |
| 2025 | ICCV | Open-Set Cross Modal Generalization via Multimodal Unified Representation. | Hai Huang, Yan Xia, Shulei Wang, Hanting Wang, Minghui Fang, Shengpeng Ji, Sashuai Zhou, Tao Jin, Zhou Zhao |
| 2025 | ICCV | Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations. | Hai Huang, Yan Xia, Sashuai Zhou, Hanting Wang, Shulei Wang, Zhou Zhao |
| 2025 | ICLR | OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces. | Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICLR | VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words? | Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao |
| 2025 | ICLR | OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup. | Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao |
| 2025 | ICLR | WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling. | Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao |
| 2025 | ICLR | EcoFace: Audio-Visual Emotional Co-Disentanglement Speech-Driven 3D Talking Face Generation. | Jiajian Xie, Shengyu Zhang, Mengze Li, Chengfei Lv, Zhou Zhao, Fei Wu |
| 2025 | ICML | Dataflow-Guided Neuro-Symbolic Language Models for Type Inference. | Ge Li, Yao Wan, Hongyu Zhang, Zhou Zhao, Wenbin Jiang, Xuanhua Shi, Hai Jin, Zheng Wang |
| 2025 | ICML | Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models. | Zehan Wang, Ziang Zhang, Tianyu Pang, Chao Du, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICML | OmniAudio: Generating Spatial Audio from 360-Degree Video. | Huadai Liu, Tianyi Luo, Kaicheng Luo, Qikai Jiang, Peiwen Sun, Jialei Wang, Rongjie Huang, Qian Chen, Wen Wang, Xiangtai Li, Shiliang Zhang, Zhijie Yan, Zhou Zhao, Wei Xue |
| 2025 | ICML | IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models. | Hanting Wang, Tao Jin, Wang Lin, Shulei Wang, Hai Huang, Shengpeng Ji, Zhou Zhao |
| 2025 | ICML | CodeSync: Synchronizing Large Language Models with Dynamic Code Evolution at Scale. | Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng, Xuyi Yang, Kaiyue Qiu, Yao Wan, Zhou Zhao, Xuanhua Shi, Hai Jin, Dongping Chen |
| 2025 | IJCAI | ExpTalk: Diverse Emotional Expression via Adaptive Disentanglement and Refined Alignment for Speech-Driven 3D Facial Animation. | Zhan Qu, Shengyu Zhang, Mengze Li, Zhuo Chen, Chengfei Lv, Zhou Zhao, Fei Wu |
| 2025 | IJCNLP | Synthetic Singers: A Review of Deep-Learning-based Singing Voice Synthesis Approaches. | Changhao Pan, Dongyu Yao, Yu Zhang, Wenxiang Guo, Jingyu Lu, Zhiyuan Zhu, Zhou Zhao |
| 2025 | IJCNLP | ASAudio: A Survey of Advanced Spatial Audio Research. | Zhiyuan Zhu, Yu Zhang, Wenxiang Guo, Changhao Pan, Zhou Zhao |
| 2025 | ICRA | LiftFeat: 3D Geometry-Aware Local Feature Matching. | Yepeng Liu, Wenpeng Lai, Zhou Zhao, Yuxuan Xiong, Jinchi Zhu, Jun Cheng, Yongchao Xu |
| 2025 | Interspeech | GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao |
| 2025 | IUI | SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models. | Bo Lin, Yingjing Xu, Xuanwen Bao, Zhou Zhao, Zhouyang Wang, Jianwei Yin |
| 2025 | KDD | Multimodal Conditional Retrieval with High Controllability. | Xiaoda Yang, Xize Cheng, Minghui Fang, Hongshun Qiu, Yuhang Ma, Junyu Lu, Jiaqi Duan, Sihang Cai, Zehan Wang, Ruofan Hu, Dongjie Fu, Zhou Zhao, Tao Jin |
| 2025 | NAACL | Data-Efficiently Learn Large Language Model for Universal 3D Scene Perception. | Zehan Wang, Haifeng Huang, Yang Zhao, Ziang Zhang, Tao Jin, Zhou Zhao |
| 2025 | WWW | EAGER-LLM: Enhancing Large Language Models as Recommenders through Exogenous Behavior-Semantic Integration. | Minjie Hong, Yan Xia, Zehan Wang, Jieming Zhu, Ye Wang, Sihang Cai, Xiaoda Yang, Quanyu Dai, Zhenhua Dong, Zhimeng Zhang, Zhou Zhao |
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | AAAI | Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-Modal Structured Representations. | Yufeng Huang, Jiji Tang, Zhuo Chen, Rongsheng Zhang, Xinfeng Zhang, Weijie Chen, Zeng Zhao, Zhou Zhao, Tangjie Lv, Zhipeng Hu, Wen Zhang |
| 2024 | AAAI | StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis. | Yu Zhang, Rongjie Huang, Ruiqi Li, Jinzheng He, Yan Xia, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ACL | TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation. | Xize Cheng, Rongjie Huang, Linjun Li, Zehan Wang, Tao Jin, Aoxiong Yin, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ACL | Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition. | Zirun Guo, Tao Jin, Zhou Zhao |
| 2024 | ACL | Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment. | Zhiqing Hong, Rongjie Huang, Xize Cheng, Yongqi Wang, Ruiqi Li, Fuming You, Zhou Zhao, Zhimeng Zhang |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | ACL | MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech. | Shengpeng Ji, Ziyue Jiang, Hanting Wang, Jialong Zuo, Zhou Zhao |
| 2024 | ACL | Rethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment. | Tao Jin, Wang Lin, Ye Wang, Linjun Li, Xize Cheng, Zhou Zhao |
| 2024 | ACL | Uni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation. | Songju Lei, Xize Cheng, Mengjiao Lyu, Jianqiao Hu, Jintao Tan, Runlin Liu, Lingyu Xiong, Tao Jin, Xiandong Li, Zhou Zhao |
| 2024 | ACL | Robust Singing Voice Transcription Serves Synthesis. | Ruiqi Li, Yu Zhang, Yongqi Wang, Zhiqing Hong, Rongjie Huang, Zhou Zhao |
| 2024 | ACL | Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion. | Ruiqi Li, Rongjie Huang, Yongqi Wang, Zhiqing Hong, Zhou Zhao |
| 2024 | ACL | Wav2SQL: Direct Generalizable Speech-To-SQL Parsing. | Huadai Liu, Rongjie Huang, Jinzheng He, Gang Sun, Ran Shen, Xize Cheng, Zhou Zhao |
| 2024 | ACL | Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer. | Yongqi Wang, Jionghao Bai, Rongjie Huang, Ruiqi Li, Zhiqing Hong, Zhou Zhao |
| 2024 | ACL | AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension. | Qian Yang, Jin Xu, Wenrui Liu, Yunfei Chu, Ziyue Jiang, Xiaohuan Zhou, Yichong Leng, Yuanjun Lv, Zhou Zhao, Chang Zhou, Jingren Zhou |
| 2024 | COLING | AntCritic: Argument Mining for Free-Form and Visually-Rich Financial Comments. | Huadai Liu, Wenqiang Xu, Xuan Lin, Jingjing Huo, Hong Chen, Zhou Zhao |
| 2024 | CVPR | MPOD123: One Image to 3D Content Generation Using Mask-Enhanced Progressive Outline-to-Detail Optimization. | Jimin Xu, Tianbao Wang, Tao Jin, Shengyu Zhang, Dongjie Fu, Zhe Wang, Jiangjing Lyu, Chengfei Lv, Chaoyue Niu, Zhou Yu, Zhou Zhao, Fei Wu |
| 2024 | EMNLP | TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control. | Yu Zhang, Ziyue Jiang, Ruiqi Li, Changhao Pan, Jinzheng He, Rongjie Huang, Chuxin Wang, Zhou Zhao |
| 2024 | ICASSP | TextrolSpeech: A Text Style Control Speech Corpus with Codec Language Text-to-Speech Models. | Shengpeng Ji, Jialong Zuo, Minghui Fang, Ziyue Jiang, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ICASSP | Language Model is a Branch Predictor for Simultaneous Machine Translation. | Aoxiong Yin, Tianyun Zhong, Haoyuan Li, Siliang Tang, Zhou Zhao |
| 2024 | ICLR | Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis. | Ziyue Jiang, Jinglin Liu, Yi Ren, Jinzheng He, Zhenhui Ye, Shengpeng Ji, Qian Yang, Chen Zhang, Pengfei Wei, Chunfeng Wang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICLR | Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis. | Zhenhui Ye, Tianyun Zhong, Yi Ren, Jiaqi Yang, Weichuang Li, Jiawei Huang, Ziyue Jiang, Jinzheng He, Rongjie Huang, Jinglin Liu, Chen Zhang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICML | FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion. | Zehan Wang, Ziang Zhang, Xize Cheng, Rongjie Huang, Luping Liu, Zhenhui Ye, Haifeng Huang, Yang Zhao, Tao Jin, Peng Gao, Zhou Zhao |
| 2024 | ICML | InstructSpeech: Following Speech Editing Instructions via Large Language Models. | Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao |
| 2024 | ICML | Non-confusing Generation of Customized Concepts in Diffusion Models. | Wang Lin, Jingyuan Chen, Jiaxin Shi, Yichen Zhu, Chen Liang, Junzhong Miao, Tao Jin, Zhou Zhao, Fei Wu, Shuicheng Yan, Hanwang Zhang |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis. | Qian Yang, Jialong Zuo, Zhe Su, Ziyue Jiang, Mingze Li, Zhou Zhao, Feiyang Chen, Zhefeng Wang, Baoxing Huai |
| 2024 | KDD | Multimodal Pretraining, Adaptation, and Generation for Recommendation: A Survey. | Qijiong Liu, Jieming Zhu, Yanting Yang, Quanyu Dai, Zhaocheng Du, Xiao-Ming Wu, Zhou Zhao, Rui Zhang, Zhenhua Dong |
| 2024 | KDD | EAGER: Two-Stream Generative Recommender with Behavior-Semantic Collaboration. | Ye Wang, Jiahao Xun, Minjie Hong, Jieming Zhu, Tao Jin, Wang Lin, Haoyuan Li, Linjun Li, Yan Xia, Zhou Zhao, Zhenhua Dong |
| 2024 | MICCAI | Position-Guided Prompt Learning for Anomaly Detection in Chest X-Rays. | Zhichao Sun, Yuliang Gu, Yepeng Liu, Zerui Zhang, Zhou Zhao, Yongchao Xu |
| 2024 | MICCAI | Prompting Segment Anything Model with Domain-Adaptive Prototype for Generalizable Medical Image Segmentation. | Zhikai Wei, Wenhui Dong, Peilin Zhou, Yuliang Gu, Zhou Zhao, Yongchao Xu |
| 2024 | MICCAI | Spatial-Aware Attention Generative Adversarial Network for Semi-supervised Anomaly Detection in Medical Image. | Zerui Zhang, Zhichao Sun, Zelong Liu, Zhou Zhao, Rui Yu, Bo Du, Yongchao Xu |
| 2024 | MICCAI | MoreStyle: Relax Low-Frequency Constraint of Fourier-Based Image Reconstruction in Generalizable Medical Image Segmentation. | Haoyu Zhao, Wenhui Dong, Rui Yu, Zhou Zhao, Bo Du, Yongchao Xu |
| 2024 | MICCAI | WIA-LD2ND: Wavelet-Based Image Alignment for Self-supervised Low-Dose CT Denoising. | Haoyu Zhao, Yuliang Gu, Zhou Zhao, Bo Du, Yongchao Xu, Rui Yu |
| 2024 | NAACL | Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt. | Yongqi Wang, Ruofan Hu, Rongjie Huang, Zhiqing Hong, Ruiqi Li, Wenrui Liu, Fuming You, Tao Jin, Zhou Zhao |
| 2024 | WWW | MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer. | Dong Yao, Jieming Zhu, Jiahao Xun, Shengyu Zhang, Zhou Zhao, Liqun Deng, Wenqiao Zhang, Zhenhua Dong, Xin Jiang |
| 2023 | AAAI | Video-Audio Domain Generalization via Confounder Disentanglement. | Shengyu Zhang, Xusheng Feng, Wenyan Fan, Wenjing Fang, Fuli Feng, Wei Ji, Shuo Li, Li Wang, Shanshan Zhao, Zhou Zhao, Tat-Seng Chua, Fei Wu |
| 2023 | AAAI | ShiftDDPMs: Exploring Conditional Diffusion Models by Shifting Diffusion Trajectories. | Zijian Zhang, Zhou Zhao, Jun Yu, Qi Tian |
| 2023 | ACL | OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment. | Xize Cheng, Tao Jin, Linjun Li, Wang Lin, Xinyu Duan, Zhou Zhao |
| 2023 | ACL | RMSSinger: Realistic-Music-Score based Singing Voice Synthesis. | Jinzheng He, Jinglin Liu, Zhenhui Ye, Rongjie Huang, Chenye Cui, Huadai Liu, Zhou Zhao |
| 2023 | ACL | FastDiff 2: Revisiting and Incorporating GANs and Diffusion Models in High-Fidelity Speech Synthesis. | Rongjie Huang, Yi Ren, Ziyue Jiang, Chenye Cui, Jinglin Liu, Zhou Zhao |
| 2023 | ACL | AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation. | Rongjie Huang, Huadai Liu, Xize Cheng, Yi Ren, Linjun Li, Zhenhui Ye, Jinzheng He, Lichao Zhang, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2023 | ACL | Prosody-TTS: Improving Prosody with Masked Autoencoder and Conditional Diffusion Model For Expressive Text-to-Speech. | Rongjie Huang, Chunlei Zhang, Yi Ren, Zhou Zhao, Dong Yu |
| 2023 | ACL | FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models. | Ziyue Jiang, Qian Yang, Jialong Zuo, Zhenhui Ye, Rongjie Huang, Yi Ren, Zhou Zhao |
| 2023 | ACL | AlignSTS: Speech-to-Singing Conversion via Cross-Modal Alignment. | Ruiqi Li, Rongjie Huang, Lichao Zhang, Jinglin Liu, Zhou Zhao |
| 2023 | ACL | Contrastive Token-Wise Meta-Learning for Unseen Performer Visual Temporal-Aligned Translation. | Linjun Li, Tao Jin, Xize Cheng, Ye Wang, Wang Lin, Rongjie Huang, Zhou Zhao |
| 2023 | ACL | TAVT: Towards Transferable Audio-Visual Text Generation. | Wang Lin, Tao Jin, Wenwen Pan, Linjun Li, Xize Cheng, Ye Wang, Zhou Zhao |
| 2023 | ACL | DopplerBAS: Binaural Audio Synthesis Addressing Doppler Effect. | Jinglin Liu, Zhenhui Ye, Qian Chen, Siqi Zheng, Wen Wang, Qinglin Zhang, Zhou Zhao |
| 2023 | ACL | Multi-modal Action Chain Abductive Reasoning. | Mengze Li, Tianbao Wang, Jiahe Xu, Kairong Han, Shengyu Zhang, Zhou Zhao, Jiaxu Miao, Wenqiao Zhang, Shiliang Pu, Fei Wu |
| 2023 | ACL | Semantic-conditioned Dual Adaptation for Cross-domain Query-based Visual Segmentation. | Ye Wang, Tao Jin, Wang Lin, Xize Cheng, Linjun Li, Zhou Zhao |
| 2023 | ACL | Weakly-Supervised Spoken Video Grounding via Semantic Interaction Learning. | Ye Wang, Wang Lin, Shengyu Zhang, Tao Jin, Linjun Li, Xize Cheng, Zhou Zhao |
| 2023 | ACL | Scene-robust Natural Language Video Localization via Learning Domain-invariant Representations. | Zehan Wang, Yang Zhao, Haifeng Huang, Yan Xia, Zhou Zhao |
| 2023 | ACL | CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-Training. | Zhenhui Ye, Rongjie Huang, Yi Ren, Ziyue Jiang, Jinglin Liu, Jinzheng He, Xiang Yin, Zhou Zhao |
| 2023 | CVPR | ANetQA: A Large-scale Benchmark for Fine-grained Compositional Reasoning over Untrimmed Videos. | Zhou Yu, Lixiang Zheng, Zhou Zhao, Fei Wu, Jianping Fan, Kui Ren, Jun Yu |
| 2023 | CVPR | DATE: Domain Adaptive Product Seeker for E-Commerce. | Haoyuan Li, Hao Jiang, Tao Jin, Mengyan Li, Yan Chen, Zhijie Lin, Yang Zhao, Zhou Zhao |
| 2023 | CVPR | WINNER: Weakly-supervised hIerarchical decompositioN and aligNment for spatio-tEmporal video gRounding. | Mengze Li, Han Wang, Wenqiao Zhang, Jiaxu Miao, Zhou Zhao, Shengyu Zhang, Wei Ji, Fei Wu |
| 2023 | CVPR | Gloss Attention for Gloss-free Sign Language Translation. | Aoxiong Yin, Tianyun Zhong, Li Tang, Weike Jin, Tao Jin, Zhou Zhao |
| 2023 | EMNLP | ART: rule bAsed futuRe-inference deducTion. | Mengze Li, Tianqi Zhao, Jionghao Bai, Baoyi He, Jiaxu Miao, Wei Ji, Zheqi Lv, Zhou Zhao, Shengyu Zhang, Wenqiao Zhang, Fei Wu |
| 2023 | EMNLP | ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer. | Huadai Liu, Rongjie Huang, Xuan Lin, Wenqiang Xu, Maozong Zheng, Hong Chen, Jinzheng He, Zhou Zhao |
| 2023 | EMNLP | 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding. | Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICASSP | VarietySound: Timbre-Controllable Video to Sound Generation Via Unsupervised Information Disentanglement. | Chenye Cui, Zhou Zhao, Yi Ren, Jinglin Liu, Rongjie Huang, Feiyang Chen, Zhefeng Wang, Baoxing Huai, Fei Wu |
| 2023 | ICASSP | Overview of the ICASSP 2023 General Meeting Understanding and Generation Challenge (MUG). | Qinglin Zhang, Chong Deng, Jiaqing Liu, Hai Yu, Qian Chen, Wen Wang, Zhijie Yan, Jinglin Liu, Yi Ren, Zhou Zhao |
| 2023 | ICASSP | MUG: A General Meeting Understanding and Generation Benchmark. | Qinglin Zhang, Chong Deng, Jiaqing Liu, Hai Yu, Qian Chen, Wen Wang, Zhijie Yan, Jinglin Liu, Yi Ren, Zhou Zhao |
| 2023 | ICCV | MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition. | Xize Cheng, Tao Jin, Rongjie Huang, Linjun Li, Wang Lin, Zehan Wang, Ye Wang, Huadai Liu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICCV | Exploring Group Video Captioning with Efficient Relational Approximation. | Wang Lin, Tao Jin, Ye Wang, Wenwen Pan, Linjun Li, Xize Cheng, Zhou Zhao |
| 2023 | ICCV | Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding. | Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICCV | Open-Vocabulary Object Detection With an Open Corpus. | Jiong Wang, Huiming Zhang, Haiwen Hong, Xuan Jin, Yuan He, Hui Xue, Zhou Zhao |
| 2023 | ICLR | TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation. | Rongjie Huang, Jinglin Liu, Huadai Liu, Yi Ren, Lichao Zhang, Jinzheng He, Zhou Zhao |
| 2023 | ICLR | GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis. | Zhenhui Ye, Ziyue Jiang, Yi Ren, Jinglin Liu, Jinzheng He, Zhou Zhao |
| 2023 | ICML | Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models. | Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2023 | IECON | MechTac: A Multifunctional Tendon-Linked Optical Tactile Sensor for In/Out-the-Field-of-View Perception with Deep Learning. | Zhenyu Lu, Tianqi Yue, Zhou Zhao, Weiyong Si, Ning Wang, Chenguang Yang |
| 2023 | KDD | MSSRNet: Manipulating Sequential Style Representation for Unsupervised Text Style Transfer. | Yazheng Yang, Zhou Zhao, Qi Liu |
| 2023 | SIGIR | Beyond Two-Tower Matching: Learning Sparse Retrievable Cross-Interactions for Recommendation. | Liangcai Su, Fan Yan, Jieming Zhu, Xi Xiao, Haoyi Duan, Zhou Zhao, Zhenhua Dong, Ruiming Tang |
| 2023 | SIGIR | DisCover: Disentangled Music Representation Learning for Cover Song Identification. | Jiahao Xun, Shengyu Zhang, Yanting Yang, Jieming Zhu, Liqun Deng, Zhou Zhao, Zhenhua Dong, Ruiqi Li, Lichao Zhang, Fei Wu |
| 2022 | AAAI | Flow-Based Unconstrained Lip to Speech Generation. | Jinzheng He, Zhou Zhao, Yi Ren, Jinglin Liu, Baoxing Huai, Nicholas Jing Yuan |
| 2022 | AAAI | DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism. | Jinglin Liu, Chengxi Li, Yi Ren, Feiyang Chen, Zhou Zhao |
| 2022 | AAAI | Parallel and High-Fidelity Text-to-Lip Generation. | Jinglin Liu, Zhiying Zhu, Yi Ren, Wencan Huang, Baoxing Huai, Nicholas Jing Yuan, Zhou Zhao |
| 2022 | ACL | Revisiting Over-Smoothness in Text to Speech. | Yi Ren, Xu Tan, Tao Qin, Zhou Zhao, Tie-Yan Liu |
| 2022 | ACL | Prior Knowledge and Memory Enriched Transformer for Sign Language Translation. | Tao Jin, Zhou Zhao, Meng Zhang, Xingshan Zeng |
| 2022 | ACL | Learning the Beauty in Songs: Neural Singing Voice Beautifier. | Jinglin Liu, Chengxi Li, Yi Ren, Zhiying Zhu, Zhou Zhao |
| 2022 | ACL | End-to-End Modeling via Information Tree for One-Shot Natural Language Spatial Video Grounding. | Mengze Li, Tianbao Wang, Haoyu Zhang, Shengyu Zhang, Zhou Zhao, Jiaxu Miao, Wenqiao Zhang, Wenming Tan, Jin Wang, Peng Wang, Shiliang Pu, Fei Wu |
| 2022 | CVPR | Fine-Grained Predicates Learning for Scene Graph Generation. | Xinyu Lyu, Lianli Gao, Yuyu Guo, Zhou Zhao, Hao Huang, Heng Tao Shen, Jingkuan Song |
| 2022 | CVPR | Wnet: Audio-Guided Video Object Segmentation via Wavelet-Based Cross- Modal Denoising Networks. | Wenwen Pan, Haonan Shi, Zhou Zhao, Jieming Zhu, Xiuqiang He, Zhigeng Pan, Lianli Gao, Jun Yu, Fei Wu, Qi Tian |
| 2022 | CVPR | Cross-modal Background Suppression for Audio-Visual Event Localization. | Yan Xia, Zhou Zhao |
| 2022 | CVPR | MLSLT: Towards Multilingual Sign Language Translation. | Aoxiong Yin, Zhou Zhao, Weike Jin, Meng Zhang, Xingshan Zeng, Xiaofei He |
| 2022 | ICASSP | Prosospeech: Enhancing Prosody with Quantized Vector Pre-Training in Text-To-Speech. | Yi Ren, Ming Lei, Zhiying Huang, Shiliang Zhang, Qian Chen, Zhijie Yan, Zhou Zhao |
| 2022 | ICASSP | HiFiDenoise: High-Fidelity Denoising Text to Speech with Adversarial Networks. | Lichao Zhang, Yi Ren, Liqun Deng, Zhou Zhao |
| 2022 | ICLR | Pseudo Numerical Methods for Diffusion Models on Manifolds. | Luping Liu, Yi Ren, Zhijie Lin, Zhou Zhao |
| 2022 | IJCAI | FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis. | Rongjie Huang, Max W. Y. Lam, Jun Wang, Dan Su, Dong Yu, Yi Ren, Zhou Zhao |
| 2022 | IJCAI | SyntaSpeech: Syntax-Aware Generative Adversarial Text-to-Speech. | Zhenhui Ye, Zhou Zhao, Yi Ren, Fei Wu |
| 2022 | IJCAI | EditSinger: Zero-Shot Text-Based Singing Voice Editing System with Diverse Prosody Modeling. | Lichao Zhang, Zhou Zhao, Yi Ren, Liqun Deng |
| 2022 | IROS | Multi-purpose Tactile Perception Based on Deep Learning in a New Tendon-driven Optical Tactile Sensor. | Zhou Zhao, Zhenyu Lu |
| 2022 | WWW | Contrastive Learning with Positive-Negative Frame Mask for Music Representation. | Dong Yao, Zhou Zhao, Shengyu Zhang, Jieming Zhu, Yudong Zhu, Rui Zhang, Xiuqiang He |
| 2022 | WWW | Re4: Learning to Re-contrast, Re-attend, Re-construct for Multi-interest Recommendation. | Shengyu Zhang, Lingxiao Yang, Dong Yao, Yujie Lu, Fuli Feng, Zhou Zhao, Tat-Seng Chua, Fei Wu |
| 2022 | WSDM | Uncovering Causal Effects of Online Short Videos on Consumer Behaviors. | Ziqi Tan, Shengyu Zhang, Nuanxin Hong, Kun Kuang, Yifan Yu, Jin Yu, Zhou Zhao, Hongxia Yang, Shiyuan Pan, Jingren Zhou, Fei Wu |
| 2021 | AAAI | Modeling High-order Interactions across Multi-interests for Micro-video Reommendation (Student Abstract). | Dong Yao, Shengyu Zhang, Zhou Zhao, Wenyan Fan, Jieming Zhu, Xiuqiang He, Fei Wu |
| 2021 | CVPR | Multi-Modal Relational Graph for Cross-Modal Video Moment Retrieval. | Yawen Zeng, Da Cao, Xiaochi Wei, Meng Liu, Zhou Zhao, Zheng Qin |
| 2021 | CVPR | Grounded, Controllable and Debiased Image Completion With Lexical Semantics. | Shengyu Zhang, Tan Jiang, Qinghao Huang, Ziqi Tan, Kun Kuang, Zhou Zhao, Siliang Tang, Jin Yu, Hongxia Yang, Yi Yang, Fei Wu |
| 2021 | CVPR | DeVLBert: Out-of-Distribution Visio-Linguistic Pretraining With Causality. | Shengyu Zhang, Tan Jiang, Tan Wang, Kun Kuang, Zhou Zhao, Jianke Zhu, Jin Yu, Hongxia Yang, Fei Wu |
| 2021 | CVPR | Cascaded Prediction Network via Segment Tree for Temporal Video Grounding. | Yang Zhao, Zhou Zhao, Zhu Zhang, Zhijie Lin |
| 2021 | ICCV | Cortical Surface Shape Analysis Based on Alexandrov Polyhedra. | Min Zhang, Yang Guo, Na Lei, Zhou Zhao, Jianfeng Wu, Xiaoyin Xu, Yalin Wang, Xianfeng Gu |
| 2021 | ICLR | FastSpeech 2: Fast and High-Quality End-to-End Text to Speech. | Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu |
| 2021 | ICML | Learning to Rehearse in Long Sequence Memorization. | Zhu Zhang, Chang Zhou, Jianxin Ma, Zhijie Lin, Jingren Zhou, Hongxia Yang, Zhou Zhao |
| 2021 | IJCAI | FedSpeech: Federated Text-to-Speech with Continual Learning. | Ziyue Jiang, Yi Ren, Ming Lei, Zhou Zhao |
| 2021 | Interspeech | EMOVIE: A Mandarin Emotion Speech Dataset with a Simple Emotional Text-to-Speech Model. | Chenye Cui, Yi Ren, Jinglin Liu, Feiyang Chen, Rongjie Huang, Ming Lei, Zhou Zhao |
| 2021 | Interspeech | WSRGlow: A Glow-Based Waveform Generative Model for Audio Super-Resolution. | Kexun Zhang, Yi Ren, Changliang Xu, Zhou Zhao |
| 2021 | WWW | Future-Aware Diverse Trends Framework for Recommendation. | Yujie Lu, Shengyu Zhang, Yingxuan Huang, Luyao Wang, Xinyao Yu, Zhou Zhao, Fei Wu |
| 2021 | SIGIR | Hierarchical Cross-Modal Graph Consistency Learning for Video-Text Retrieval. | Weike Jin, Zhou Zhao, Pengcheng Zhang, Jieming Zhu, Xiuqiang He, Yueting Zhuang |
| 2021 | SIGIR | CauseRec: Counterfactual User Sequence Synthesis for Sequential Recommendation. | Shengyu Zhang, Dong Yao, Zhou Zhao, Tat-Seng Chua, Fei Wu |
| 2020 | AAAI | Weakly-Supervised Video Moment Retrieval via Semantic Completion Network. | Zhijie Lin, Zhou Zhao, Zhu Zhang, Qi Wang, Huasheng Liu |
| 2020 | AAAI | Interactive Dual Generative Adversarial Networks for Image Captioning. | Junhao Liu, Kai Wang, Chunpu Xu, Zhou Zhao, Ruifeng Xu, Ying Shen, Min Yang |
| 2020 | AAAI | Multi-Speaker Video Dialog with Frame-Level Temporal Localization. | Qiang Wang, Pin Jiang, Zhiyi Guo, Yahong Han, Zhou Zhao |
| 2020 | AAAI | Convolutional Hierarchical Attention Network for Query-Focused Video Summarization. | Shuwen Xiao, Zhou Zhao, Zijian Zhang, Xiaohui Yan, Min Yang |
| 2020 | AAAI | Be Relevant, Non-Redundant, and Timely: Deep Reinforcement Learning for Real-Time Event Summarization. | Min Yang, Chengming Li, Fei Sun, Zhou Zhao, Ying Shen, Chenglin Wu |
| 2020 | ACL | SimulSpeech: End-to-End Simultaneous Speech to Text Translation. | Yi Ren, Jinglin Liu, Xu Tan, Chen Zhang, Tao Qin, Zhou Zhao, Tie-Yan Liu |
| 2020 | ACL | A Study of Non-autoregressive Model for Sequence Generation. | Yi Ren, Jinglin Liu, Xu Tan, Zhou Zhao, Sheng Zhao, Tie-Yan Liu |
| 2020 | CVPR | Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form Sentences. | Zhu Zhang, Zhou Zhao, Yang Zhao, Qi Wang, Huasheng Liu, Lianli Gao |
| 2020 | IJCAI | Task-Level Curriculum Learning for Non-Autoregressive Neural Machine Translation. | Jinglin Liu, Yi Ren, Xu Tan, Chen Zhang, Tao Qin, Zhou Zhao, Tie-Yan Liu |
| 2020 | IJCAI | Object-Aware Multi-Branch Relation Networks for Spatio-Temporal Video Grounding. | Zhu Zhang, Zhou Zhao, Zhijie Lin, Baoxing Huai, Jing Yuan |
| 2020 | ICPR | FOANet: A Focus of Attention Network with Application to Myocardium Segmentation. | Zhou Zhao, lodie Puybareau, Nicolas Boutry, Thierry Graud |
| 2020 | ICPR | Do not Treat Boundaries and Regions Differently: An Example on Heart Left Atrial Segmentation. | Zhou Zhao, lodie Puybareau, Nicolas Boutry, Thierry Graud |
| 2020 | KDD | DeepSinger: Singing Voice Synthesis with Data Mined From the Web. | Yi Ren, Xu Tan, Tao Qin, Jian Luan, Zhou Zhao, Tie-Yan Liu |
| 2020 | KDD | Comprehensive Information Integration Modeling Framework for Video Titling. | Shengyu Zhang, Ziqi Tan, Zhou Zhao, Jin Yu, Kun Kuang, Tan Jiang, Jingren Zhou, Hongxia Yang, Fei Wu |
| 2020 | MICCAI | Stacked and Parallel U-Nets with Multi-output for Myocardial Pathology Segmentation. | Zhou Zhao, Nicolas Boutry, lodie Puybareau |
| 2020 | SIGIR | A Generic Network Compression Framework for Sequential Recommender Systems. | Yang Sun, Fajie Yuan, Min Yang, Guoao Wei, Zhou Zhao, Duo Liu |
| 2020 | SIGIR | Regional Relation Modeling for Visual Place Recognition. | Yingying Zhu, Biao Li, Jiong Wang, Zhou Zhao |
| 2019 | AAAI | Answer Identification from Product Reviews for User Questions by Multi-Task Attentive Networks. | Long Chen, Ziyu Guan, Wei Zhao, Wanqing Zhao, Xiaopeng Wang, Zhou Zhao, Huan Sun |
| 2019 | AAAI | Location-Based End-to-End Speech Recognition with Multiple Language Models. | Zhijie Lin, Kaiyang Lin, Shiling Chen, Linlin Li, Zhou Zhao |
| 2019 | AAAI | Exploring Human-Like Reading Strategy for Abstractive Text Summarization. | Min Yang, Qiang Qu, Wenting Tu, Ying Shen, Zhou Zhao, Xiaojun Chen |
| 2019 | AAAI | ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering. | Zhou Yu, Dejing Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, Dacheng Tao |
| 2019 | CIKM | Hierarchical Multi-label Text Classification: An Attention-based Recurrent Network Approach. | Wei Huang, Enhong Chen, Qi Liu, Yuying Chen, Zai Huang, Yang Liu, Zhou Zhao, Dan Zhang, Shijin Wang |
| 2019 | CIKM | Cross-modal Image-Text Retrieval with Multitask Learning. | Junyu Luo, Ying Shen, Xiang Ao, Zhou Zhao, Min Yang |
| 2019 | CVPR | Self-Supervised Spatiotemporal Learning via Video Clip Order Prediction. | Dejing Xu, Jun Xiao, Zhou Zhao, Jian Shao, Di Xie, Yueting Zhuang |
| 2019 | EMNLP | Video Dialog via Progressive Inference and Cross-Transformer. | Weike Jin, Zhou Zhao, Mao Gu, Jun Xiao, Furu Wei, Yueting Zhuang |
| 2019 | ICLR | Multilingual Neural Machine Translation with Knowledge Distillation. | Xu Tan, Yi Ren, Di He, Tao Qin, Zhou Zhao, Tie-Yan Liu |
| 2019 | ICML | Almost Unsupervised Text to Speech and Automatic Speech Recognition. | Yi Ren, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu |
| 2019 | IJCAI | Beyond Product Quantization: Deep Progressive Quantization for Image Retrieval. | Lianli Gao, Xiaosu Zhu, Jingkuan Song, Zhou Zhao, Heng Tao Shen |
| 2019 | IJCAI | Weak Supervision Enhanced Generative Network for Question Generation. | Yutong Wang, Jiyuan Zheng, Qijiong Liu, Zhou Zhao, Jun Xiao, Yueting Zhuang |
| 2019 | IJCAI | Localizing Unseen Activities in Video via Image Query. | Zhu Zhang, Zhou Zhao, Zhijie Lin, Jingkuan Song, Deng Cai |
| 2019 | IJCAI | Open-Ended Long-Form Video Question Answering via Hierarchical Convolutional Self-Attention Networks. | Zhu Zhang, Zhou Zhao, Zhijie Lin, Jingkuan Song, Xiaofei He |
| 2019 | MICCAI | A Two-Stage Temporal-Like Fully Convolutional Network Framework for Left Ventricle Segmentation and Quantification on MR Images. | Zhou Zhao, Nicolas Boutry, lodie Puybareau, Thierry Graud |
| 2019 | WWW | Abstractive Meeting Summarization via Hierarchical Adaptive Segmental Network Learning. | Zhou Zhao, Haojie Pan, Changjie Fan, Yan Liu, Linlin Li, Min Yang |
| 2019 | SIGIR | Video Dialog via Multi-Grained Convolutional Self-Attention Context Networks. | Weike Jin, Zhou Zhao, Mao Gu, Jun Yu, Jun Xiao, Yueting Zhuang |
| 2019 | SIGIR | Cross-Modal Interaction Networks for Query-Based Moment Retrieval in Videos. | Zhu Zhang, Zhijie Lin, Zhou Zhao, Zhenxin Xiao |
| 2018 | AAAI | Multi-Label Community-Based Question Classification via Personalized Sequence Memory Network Learning. | Xinyu Duan, Shengyu Zhang, Zhou Zhao, Fei Wu, Yueting Zhuang |
| 2018 | AAAI | StackReader: An RNN-Free Reading Comprehension Model. | Yibo Jiang, Zhou Zhao |
| 2018 | AAAI | Distance-Aware DAG Embedding for Proximity Search on Heterogeneous Graphs. | Zemin Liu, Vincent W. Zheng, Zhou Zhao, Fanwei Zhu, Kevin Chen-Chuan Chang, Minghui Wu, Jing Ying |
| 2018 | ACL | Discourse Marker Augmented Network with Reinforcement Learning for Natural Language Inference. | Boyuan Pan, Yazheng Yang, Zhou Zhao, Yueting Zhuang, Deng Cai, Xiaofei He |
| 2018 | CIKM | Cross-domain Aspect/Sentiment-aware Abstractive Review Summarization. | Min Yang, Qiang Qu, Jia Zhu, Ying Shen, Zhou Zhao |
| 2018 | EMNLP | Investigating Capsule Networks with Dynamic Routing for Text Classification. | Min Yang, Wei Zhao, Jianbo Ye, Zeyang Lei, Zhou Zhao, Soufei Zhang |
| 2018 | IJCAI | Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding. | Zhou Yu, Jun Yu, Chenchao Xiang, Zhou Zhao, Qi Tian, Dacheng Tao |
| 2018 | IJCAI | Multi-Turn Video Question Answering via Multi-Stream Hierarchical Attention Context Network. | Zhou Zhao, Xinghua Jiang, Deng Cai, Jun Xiao, Xiaofei He, Shiliang Pu |
| 2018 | IJCAI | Attentional Image Retweet Modeling via Multi-Faceted Ranking Network Learning. | Zhou Zhao, Lingtao Meng, Jun Xiao, Min Yang, Fei Wu, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2018 | IJCAI | A Multi-task Learning Approach for Image Captioning. | Wei Zhao, Benyou Wang, Jianbo Ye, Min Yang, Zhou Zhao, Ruotian Luo, Yu Qiao |
| 2018 | IJCAI | Open-Ended Long-form Video Question Answering via Adaptive Hierarchical Reinforced Networks. | Zhou Zhao, Zhu Zhang, Shuwen Xiao, Zhou Yu, Jun Yu, Deng Cai, Fei Wu, Yueting Zhuang |
| 2018 | KDD | Interactive Paths Embedding for Semantic Proximity Search on Heterogeneous Graphs. | Zemin Liu, Vincent W. Zheng, Zhou Zhao, Zhao Li, Hongxia Yang, Minghui Wu, Jing Ying |
| 2018 | KDD | NGUARD: A Game Bot Detection Framework for NetEase MMORPGs. | Jianrong Tao, Jiarong Xu, Linxia Gong, Yifu Li, Changjie Fan, Zhou Zhao |
| 2018 | MICCAI | Left Atrial Segmentation in a Few Seconds Using Fully Convolutional Network and Transfer Learning. | lodie Puybareau, Zhou Zhao, Younes Khoudli, Edwin Carlinet, Yongchao Xu, Jrme Lacotte, Thierry Graud |
| 2018 | WWW | Subgraph-augmented Path Embedding for Semantic User Search on Heterogeneous Social Network. | Zemin Liu, Vincent W. Zheng, Zhou Zhao, Hongxia Yang, Kevin Chen-Chuan Chang, Minghui Wu, Jing Ying |
| 2018 | SIGIR | Dialogue Act Recognition via CRF-Attentive Structured Network. | Zheqian Chen, Rongqin Yang, Zhou Zhao, Deng Cai, Xiaofei He |
| 2018 | SDM | Investigating Deep Reinforcement Learning Techniques in Personalized Dialogue Generation. | Min Yang, Qiang Qu, Kai Lei, Jia Zhu, Zhou Zhao, Xiaojun Chen, Joshua Zhexue Huang |
| 2017 | AAAI | Semantic Proximity Search on Heterogeneous Graph by Proximity Embedding. | Zemin Liu, Vincent W. Zheng, Zhou Zhao, Fanwei Zhu, Kevin Chen-Chuan Chang, Minghui Wu, Jing Ying |
| 2017 | AAAI | Community-Based Question Answering via Asymmetric Multi-Faceted Ranking Network Learning. | Zhou Zhao, Hanqing Lu, Vincent W. Zheng, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2017 | CIKM | Integrating Side Information for Boosting Machine Comprehension. | Yutong Wang, Yixin Xu, Min Yang, Zhou Zhao, Jun Xiao, Yueting Zhuang |
| 2017 | CIKM | Dual Learning for Cross-domain Image Captioning. | Wei Zhao, Wei Xu, Min Yang, Jianbo Ye, Zhou Zhao, Yabing Feng, Yu Qiao |
| 2017 | EMNLP | Identifying and Tracking Sentiments and Topics from Social Media Texts during Natural Disasters. | Min Yang, Jincheng Mei, Heng Ji, Wei Zhao, Zhou Zhao, Xiaojun Chen |
| 2017 | IJCAI | Link Prediction via Ranking Metric Dual-Level Attention Network Learning. | Zhou Zhao, Ben Gao, Vincent W. Zheng, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2017 | IJCAI | Microblog Sentiment Classification via Recurrent Random Walk Network Learning. | Zhou Zhao, Hanqing Lu, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2017 | IJCAI | Video Question Answering via Hierarchical Spatio-Temporal Attention Networks. | Zhou Zhao, Qifan Yang, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2017 | WWW | User Personalized Satisfaction Prediction via Multiple Instance Deep Learning. | Zheqian Chen, Ben Gao, Huimin Zhang, Zhou Zhao, Haifeng Liu, Deng Cai |
| 2017 | SIGIR | Personalized Response Generation via Domain adaptation. | Min Yang, Zhou Zhao, Wei Zhao, Xiaojun Chen, Jia Zhu, Lianqiang Zhou, Zigang Cao |
| 2017 | SIGIR | Video Question Answering via Attribute-Augmented Attention Network Learning. | Yunan Ye, Zhou Zhao, Yimeng Li, Long Chen, Jun Xiao, Yueting Zhuang |
| 2017 | SIGIR | Learning Max-Margin GeoSocial Multimedia Network Representations for Point-of-Interest Suggestion. | Zhou Zhao, Qifan Yang, Hanqing Lu, Min Yang, Jun Xiao, Fei Wu, Yueting Zhuang |
| 2016 | AAAI | Community-Based Question Answering via Heterogeneous Social Network Learning. | Hanyin Fang, Fei Wu, Zhou Zhao, Xinyu Duan, Yueting Zhuang, Martin Ester |
| 2016 | DASFAA | Crowdsourced Query Processing on Microblogs. | Weikeng Chen, Zhou Zhao, Xinyu Wang, Wilfred Ng |
| 2016 | ICASSP | PLIP based unsharp masking for medical image enhancement. | Zhou Zhao, Yicong Zhou |
| 2016 | IJCAI | Expert Finding for Community-Based Question Answering via Ranking Metric Network Learning. | Zhou Zhao, Qifan Yang, Deng Cai, Xiaofei He, Yueting Zhuang |
| 2016 | SMC | Comparative study of logarithmic image processing models for medical image enhancement. | Zhou Zhao, Yicong Zhou |
| 2015 | DASFAA | A Comparative Study of Team Formation in Social Networks. | Xinyu Wang, Zhou Zhao, Wilfred Ng |
| 2015 | DASFAA | Cold-Start Expert Finding in Community Question Answering via Graph Regularization. | Zhou Zhao, Furu Wei, Ming Zhou, Wilfred Ng |
| 2015 | EDBT | Crowd-Selection Query Processing in Crowdsourcing Databases: A Task-Driven Approach. | Zhou Zhao, Furu Wei, Ming Zhou, Weikeng Chen, Wilfred Ng |
| 2015 | ICA3PP | Energy Consumption Prediction Based on Time-Series Models for CPU-Intensive Activities in the Cloud. | Juan Li, Xiao Liu, Zhou Zhao, Jin Liu |
| 2015 | IJCAI | Mobile Query Recommendation via Tensor Function Learning. | Zhou Zhao, Ruihua Song, Xing Xie, Xiaofei He, Yueting Zhuang |
| 2014 | CIKM | Truth Discovery in Data Streams: A Single-Pass Probabilistic Approach. | Zhou Zhao, James Cheng, Wilfred Ng |
| 2014 | CIKM | SocialTransfer: Transferring Social Knowledge for Cold-Start Cowdsourcing. | Zhou Zhao, James Cheng, Furu Wei, Ming Zhou, Wilfred Ng, Yingjun Wu |
| 2013 | EDBT | CrowdSeed: query processing on microblogs. | Zhou Zhao, Wilfred Ng, Zhijun Zhang |
| 2013 | KDD | A transfer learning based framework of crowd-selection on twitter. | Zhou Zhao, Da Yan, Wilfred Ng, Shi Gao |
| 2012 | CIKM | Leveraging read rates of passive RFID tags for real-time indoor location tracking. | Da Yan, Zhou Zhao, Wilfred Ng |
| 2012 | CIKM | Monochromatic and bichromatic reverse nearest neighbor queries on land surfaces. | Da Yan, Zhou Zhao, Wilfred Ng |
| 2012 | CIKM | A model-based approach for RFID data stream cleansing. | Zhou Zhao, Wilfred Ng |
| 2012 | EDBT | Mining probabilistically frequent sequential patterns in uncertain databases. | Zhou Zhao, Da Yan, Wilfred Ng |
| 2012 | EDBT | A probabilistic convex hull query tool. | Zhou Zhao, Da Yan, Wilfred Ng |
| 2011 | ICNC | Study on the application of improved simulated annealing algorithm for several types of optimization problems. | Qiang Wang, Huoming Zhang, Juan Jiang, Wenjun Gao, Zhou Zhao |