Skip to content

Qin Jin

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

115

Venues

19

Active years

1998–2026

Best venue rank

A*

Where they publish

Papers

115 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIChartEditor: A Reinforcement Learning Framework for Robust Chart Editing.Liangyu Chen, Yichen Xu, Jianzhe Ma, Yuqi Liu, Donglu Yang, Liang Zhang, Zihao Yue, Wenxuan Wang, Qin Jin
2026AAAIMem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction.Zhaopei Huang, Qifeng Dai, Guozheng Wu, Xiaopeng Wu, Xubin Li, Tiezheng Ge, Wenxuan Wang, Qin Jin
2026ACLLongMP-Bench: A Benchmark for Multimodal Persona Understanding in Long-Term Dialogues.Zhuoqun Li, Zhaopei Huang, Wenxuan Wang, Qin Jin
2026ACLA Survey of Deep Learning for Geometry Problem Solving.Jianzhe Ma, Wenxuan Wang, Qin Jin
2026ACLHowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge.Xueyan Wang, Dingyi Yang, Qin Jin
2026ACLExploring Attention Attractors in Large Language Models.Ziheng Wang, Zihao Yue, Wenxuan Wang, Qin Jin
2026ACLPOLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering.Yichen Xu, Liangyu Chen, Liang Zhang, Zihao Yue, Jianzhe Ma, Wenxuan Wang, Qin Jin
2026ACLA Survey of Large Models in Sports.Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin
2026ACLChangJuan: A Comprehensive Benchmark for Book-Length Chinese Story Evaluation.Dingyi Yang, Mingshuo Wang, Qin Jin
2025ACLmPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding.Anwen Hu, Haiyang Xu, Liang Zhang, Jiabo Ye, Ming Yan, Ji Zhang, Qin Jin, Fei Huang, Jingren Zhou
2025ACLWhat Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story Evaluation.Dingyi Yang, Qin Jin
2025ACLMovie101v2: Improved Movie Narration Benchmark.Zihao Yue, Yepeng Zhang, Ziheng Wang, Qin Jin
2025ACLIntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systems.Xinjie Zhang, Wenxuan Wang, Qin Jin
2025EMNLPVC4VG: Optimizing Video Captions for Text-to-Video Generation.Yang Du, Zhuoran Lin, Kaiqiang Song, Biao Wang, Zhicheng Zheng, Tiezheng Ge, Bo Zheng, Qin Jin
2025ICCVMotionCtrl: A Real-Time Controllable Vision-Language-Motion Model.Bin Cao, Sipeng Zheng, Ye Wang, Lujie Xia, Qianshan Wei, Qin Jin, Jing Liu, Zongqing Lu
2025ICLRDo Egocentric Video-Language Models Truly Understand Hand-Object Interactions?Boshen Xu, Ziheng Wang, Yang Du, Zhinan Song, Sipeng Zheng, Qin Jin
2025ICMLScaling Large Motion Models with Million-Level Human Motions.Ye Wang, Sipeng Zheng, Bin Cao, Qianshan Wei, Weishuai Zeng, Qin Jin, Zongqing Lu
2024ACLSynchronized Video Storytelling: Generating Video Narrations with Structured Storyline.Dingyi Yang, Chunru Zhan, Ziheng Wang, Biao Wang, Tiezheng Ge, Bo Zheng, Qin Jin
2024ACLLess is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective.Zihao Yue, Liang Zhang, Qin Jin
2024ACLRespond in my Language: Mitigating Language Inconsistency in Response Generation based on Large Language Models.Liang Zhang, Qin Jin, Haoyang Huang, Dongdong Zhang, Furu Wei
2024ACLESCoT: Towards Interpretable Emotional Support Dialogue Systems.Tenggan Zhang, Xinjie Zhang, Jinming Zhao, Li Zhou, Qin Jin
2024ECCVUnveiling Visual Biases in Audio-Visual Localization Benchmarks.Liangyu Chen, Zihao Yue, Boshen Xu, Qin Jin
2024EMNLPmPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding.Anwen Hu, Haiyang Xu, Jiabo Ye, Ming Yan, Liang Zhang, Bo Zhang, Ji Zhang, Qin Jin, Fei Huang, Jingren Zhou
2024EMNLPRevealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues.Lei Sun, Jinming Zhao, Qin Jin
2024EMNLPTinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging.Liang Zhang, Anwen Hu, Haiyang Xu, Ming Yan, Yichen Xu, Qin Jin, Ji Zhang, Fei Huang
2024IJCAIECR-Chain: Advancing Generative Language Models to Better Emotion-Cause Reasoners through Reasoning Chains.Zhaopei Huang, Jinming Zhao, Qin Jin
2024InterspeechThe Interspeech 2024 Challenge on Speech Processing Using Discrete Units.Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin
2024InterspeechSinging Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing.Jiatong Shi, Yueqian Lin, Xinyi Bai, Keyi Zhang, Yuning Wu, Yuxun Tang, Yifeng Yu, Qin Jin, Shinji Watanabe
2024InterspeechSingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models.Yuxun Tang, Yuning Wu, Jiatong Shi, Qin Jin
2024InterspeechTokSing: Singing Voice Synthesis based on Discrete Tokens.Yuning Wu, Chunlei Zhang, Jiatong Shi, Yuxun Tang, Shan Yang, Qin Jin
2023AAAIToken Mixing: Parameter-Efficient Transfer Learning from Image-Language to Video-Language.Yuqi Liu, Luhui Xu, Pengfei Xiong, Qin Jin
2023AAAIAccommodating Audio Modality in CLIP for Multimodal Processing.Ludan Ruan, Anwen Hu, Yuqing Song, Liang Zhang, Sipeng Zheng, Qin Jin
2023AAAIMulti-Modal Knowledge Hypergraph for Diverse Image Retrieval.Yawen Zeng, Qin Jin, Tengfei Bao, Wenfeng Li
2023AAAIMPMQA: Multimodal Question Answering on Product Manuals.Liang Zhang, Anwen Hu, Jing Zhang, Shuo Hu, Qin Jin
2023ACLInfoMetIC: An Informative Metric for Reference-free Image Caption Evaluation.Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin
2023ACLUniLG: A Unified Structure-aware Framework for Lyrics Generation.Tao Qian, Fan Lou, Jiatong Shi, Yuning Wu, Shuai Guo, Xiang Yin, Qin Jin
2023ACLAttractive Storyteller: Stylized Visual Storytelling with Unpaired Text.Dingyi Yang, Qin Jin
2023ACLMovie101: A New Movie Understanding Benchmark.Zihao Yue, Qi Zhang, Anwen Hu, Liang Zhang, Ziheng Wang, Qin Jin
2023CVPRMM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation.Ludan Ruan, Yiyang Ma, Huan Yang, Huiguo He, Bei Liu, Jianlong Fu, Nicholas Jing Yuan, Qin Jin, Baining Guo
2023CVPROpen-Category Human-Object Interaction Pre-training via Language Modeling Framework.Sipeng Zheng, Boshen Xu, Qin Jin
2023EMNLPUReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model.Jiabo Ye, Anwen Hu, Haiyang Xu, Qinghao Ye, Ming Yan, Guohai Xu, Chenliang Li, Junfeng Tian, Qi Qian, Ji Zhang, Qin Jin, Liang He, Xin Lin, Fei Huang
2023ICASSPPhoneix: Acoustic Feature Processing Strategy for Enhanced Singing Pronunciation With Phoneme Distribution Predictor.Yuning Wu, Jiatong Shi, Tao Qian, Dongji Gao, Qin Jin
2023ICCVExplore and Tell: Embodied Visual Captioning in 3D Environments.Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin
2023WWWCapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge.Linli Yao, Weijing Chen, Qin Jin
2023SIGIRRethinking Benchmarks for Cross-modal Image-text Retrieval.Weijing Chen, Linli Yao, Qin Jin
2022AAAIImage Difference Captioning with Pre-training and Contrastive Learning.Linli Yao, Weiying Wang, Qin Jin
2022ACLM3ED: Multi-modal Multi-scene Multi-label Emotional Dialogue Database.Jinming Zhao, Tenggan Zhang, Jingwen Hu, Yuchen Liu, Qin Jin, Xinchao Wang, Haizhou Li
2022COLINGDialogueEIN: Emotion Interaction Network for Dialogue Affective Analysis.Yuchen Liu, Jinming Zhao, Jingwen Hu, Ruichen Li, Qin Jin
2022CVPRValence and Arousal Estimation based on Multimodal Temporal-Aware Features for Videos in the Wild.Liyu Meng, Yuchen Liu, Xiaolong Liu, Zhaopei Huang, Wenqiang Jiang, Tenggan Zhang, Chuanhe Liu, Qin Jin
2022CVPRVRDFormer: End-to-End Video Visual Relation Detection with Transformers.Sipeng Zheng, Shizhe Chen, Qin Jin
2022ECCVTS2-Net: Token Shift and Selection Transformer for Text-Video Retrieval.Yuqi Liu, Pengfei Xiong, Luhui Xu, Shengming Cao, Qin Jin
2022ECCVUnifying Event Detection and Captioning as Sequence Generation via Pre-training.Qi Zhang, Yuqing Song, Qin Jin
2022ECCVMulti-Task Learning Framework for Emotion Recognition In-the-Wild.Tenggan Zhang, Chuanhe Liu, Xiaolong Liu, Yuchen Liu, Liyu Meng, Lei Sun, Wenqiang Jiang, Fengyuan Zhang, Jinming Zhao, Qin Jin
2022ECCVFew-Shot Action Recognition with Hierarchical Matching and Contrastive Learning.Sipeng Zheng, Shizhe Chen, Qin Jin
2022EMNLPMovieUN: A Dataset for Movie Understanding and Narrating.Qi Zhang, Zihao Yue, Anwen Hu, Ziheng Wang, Qin Jin
2022ICASSPTraining Strategies for Automatic Song Writing: A Unified Framework Perspective.Tao Qian, Jiatong Shi, Shuai Guo, Peter Wu, Qin Jin
2022ICASSPMemobert: Pre-Training Model with Prompt-Based Learning for Multimodal Emotion Recognition.Jinming Zhao, Ruichen Li, Qin Jin, Xinchao Wang, Haizhou Li
2022InterspeechSingAug: Data Augmentation for Singing Voice Synthesis with Cycle-consistent Training Strategy.Shuai Guo, Jiatong Shi, Tao Qian, Shinji Watanabe, Qin Jin
2022InterspeechMuskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis.Jiatong Shi, Shuai Guo, Tao Qian, Tomoki Hayashi, Yuning Wu, Fangzheng Xu, Xuankai Chang, Huazhe Li, Peter Wu, Shinji Watanabe, Qin Jin
2022SIGIRProgressive Learning for Image Retrieval with Hybrid-Modality Queries.Yida Zhao, Yuqing Song, Qin Jin
2021ACLMMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation.Jingwen Hu, Yuchen Liu, Jinming Zhao, Qin Jin
2021ACLMissing Modality Imagination Network for Emotion Recognition with Uncertain Missing Modalities.Jinming Zhao, Ruichen Li, Qin Jin
2021CVPRTowards Diverse Paragraph Captioning for Untrimmed Videos.Yuqing Song, Shizhe Chen, Qin Jin
2021EMNLPLanguage Resource Efficient Learning for Captioning.Jia Chen, Yike Wu, Shiwan Zhao, Qin Jin
2021ICASSPSequence-To-Sequence Singing Voice Synthesis With Perceptual Entropy Loss.Jiatong Shi, Shuai Guo, Nan Huo, Yuekai Zhang, Qin Jin
2021InterspeechSpeech Emotion Recognition via Multi-Level Cross-Modal Distillation.Ruichen Li, Jinming Zhao, Qin Jin
2020CVPRBetter Captioning With Sequence-Level Exploration.Jia Chen, Qin Jin
2020CVPRSay As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs.Shizhe Chen, Qin Jin, Peng Wang, Qi Wu
2020CVPRFine-Grained Video-Text Retrieval With Hierarchical Graph Reasoning.Shizhe Chen, Yida Zhao, Qin Jin, Qi Wu
2020InterspeechContext-Aware Goodness of Pronunciation for Computer-Assisted Pronunciation Training.Jiatong Shi, Nan Huo, Qin Jin
2019AAAIUnsupervised Bilingual Lexicon Induction from Mono-Lingual Multimodal Data.Shizhe Chen, Qin Jin, Alexander G. Hauptmann
2019EMNLPYouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension.Weiying Wang, Yongcheng Wang, Shizhe Chen, Qin Jin
2019ICASSPCross-culture Multimodal Emotion Recognition with Adversarial Learning.Jingjun Liang, Shizhe Chen, Jinming Zhao, Qin Jin, Haibo Liu, Li Lu
2019IJCAIFrom Words to Sentences: A Progressive Learning Approach for Zero-resource Machine Translation with Visual Pivots.Shizhe Chen, Qin Jin, Jianlong Fu
2019InterspeechSpeech Emotion Recognition in Dyadic Dialogues with Attentive Interaction Modeling.Jinming Zhao, Shizhe Chen, Jingjun Liang, Qin Jin
2017ICMIEmotion recognition with multimodal features and temporal models.Shuai Wang, Wenxuan Wang, Jinming Zhao, Shizhe Chen, Qin Jin, Shilei Zhang, Yong Qin
2016ICMIVideo emotion recognition in the wild based on fusion of multimodal features.Shizhe Chen, Xinrui Li, Qin Jin, Shilei Zhang, Yong Qin
2016InterspeechGenerating Natural Video Descriptions via Multimodal Processing.Qin Jin, Junwei Liang, Xiaozhu Lin
2015ACIIImproving emotion classification on Chinese microblog texts with auxiliary cross-domain data.Huimin Wu, Qin Jin
2015ICASSPSpeech emotion recognition with acoustic and lexical features.Qin Jin, Chengxin Li, Shizhe Chen, Huimin Wu
2015ICASSPDetecting semantic concepts in consumer videos using audio.Junwei Liang, Qin Jin, Xixi He, Gang Yang, Jieping Xu, Xirong Li
2014ICANNStructure Perturbation Optimization for Hopfield-Type Neural Networks.Gang Yang, Xirong Li, Jieping Xu, Qin Jin
2014SMCA guided Hopfield evolutionary algorithm with local search for maximum clique problem.Gang Yang, Xirong Li, Jieping Xu, Qin Jin, Hui Sun
2014SIGIRDoes product recommendation meet its waterloo in unexplored categories?: no, price comes to help.Jia Chen, Qin Jin, Shiwan Zhao, Shenghua Bao, Li Zhang, Zhong Su, Yong Yu
2012InterspeechEvent-based Video Retrieval Using Audio.Qin Jin, Peter Franz Schulam, Shourabh Rawat, Susanne Burger, Duo Ding, Florian Metze
2011InterspeechHarmonic Structure Transform for Speaker Recognition.Kornel Laskowski, Qin Jin
2011InterspeechAnalysis of Dialectal Influence in Pan-Arabic ASR.Udhyakumar Nallasamy, Michael Garbus, Florian Metze, Qin Jin, Thomas Schaaf, Tanja Schultz
2011InterspeechInvestigation of Cross-Show Speaker Diarization.Qian Yang, Qin Jin, Tanja Schultz
2010ICASSPSpeaker identification with distant microphone speech.Qin Jin, Runxin Li, Qian Yang, Kornel Laskowski, Tanja Schultz
2010InterspeechThe 2010 CMU GALE speech-to-text system.Florian Metze, Roger Hsiao, Qin Jin, Udhyakumar Nallasamy, Tanja Schultz
2009ASRUSpeaker de-identification via voice transformation.Qin Jin, Arthur R. Toth, Tanja Schultz, Alan W. Black
2009ICASSPDetecting bandlimited audio in broadcast television shows.Mark C. Fuhs, Qin Jin, Tanja Schultz
2009ICASSPVoice convergin: Speaker de-identification by voice transformation.Qin Jin, Arthur R. Toth, Tanja Schultz, Alan W. Black
2009ICASSPModeling instantaneous intonation for speaker identification using the fundamental frequency variation spectrum.Kornel Laskowski, Qin Jin
2009ICASSPThe I4U system in NIST 2008 speaker recognition evaluation.Haizhou Li, Bin Ma, Kong-Aik Lee, Hanwu Sun, Donglai Zhu, Khe Chai Sim, Changhuai You, Rong Tong, Ismo Krkkinen, Chien-Lin Huang, Vladimir Pervouchine, Wu Guo, Yijie Li, Li-Rong Dai, Mohaddeseh Nosratighods, Tharmarajah Thiruvaran, Julien Epps, Eliathamby Ambikairajah, Chng Eng Siong, Tanja Schultz, Qin Jin
2009InterspeechImproving speaker segmentation via speaker identification and text segmentation.Runxin Li, Tanja Schultz, Qin Jin
2009InterspeechSpeaker identification using warped MVDR cepstral features.Matthias Wlfel, Qian Yang, Qin Jin, Tanja Schultz
2008ICASSPIs voice transformation a threat to speaker identification?Qin Jin, Arthur R. Toth, Alan W. Black, Tanja Schultz
2008InterspeechThe CMU-interACT 2008 Mandarin transcription system.Roger Hsiao, Mark C. Fuhs, Yik-Cheung Tam, Qin Jin, Tanja Schultz
2008InterspeechRobust far-field speaker identification under mismatched conditions.Qin Jin, Tanja Schultz
2007CVPRMulti-modal Person Identification in a Smart Environment.Hazim Kemal Ekenel, Mika Fischer, Qin Jin, Rainer Stiefelhagen
2006ICASSPFar-Field Speaker Recognition.Qin Jin, Yue Pan, Tanja Schultz
2004ICASSPThe 2003 ISL rich transcription system for conversational telephony speech.Hagen Soltau, Hua Yu, Florian Metze, Christian Fgen, Qin Jin, Szu-Chen Stan Jou
2004InterspeechSpeaker segmentation and clustering in meetings.Qin Jin, Tanja Schultz
2004InterspeechCrosscorrelation-based multispeaker speech activity detection.Kornel Laskowski, Qin Jin, Tanja Schultz
2004InterspeechIssues in meeting transcription - the ISL meeting transcription system.Tanja Schultz, Qin Jin, Kornel Laskowski, Yue Pan, Florian Metze, Christian Fgen
2003ICASSPCombining cross-stream and time dimensions in phonetic speaker recognition.Qin Jin, Jir Navrtil, Douglas A. Reynolds, Joseph P. Campbell, Walter D. Andrews, Joy S. Abramson
2003ICASSPPhonetic speaker recognition using maximum-likelihood binary-decision tree models.Jir Navrtil, Qin Jin, Walter D. Andrews, Joseph P. Campbell
2003ICASSPThe SuperSID project: exploiting high-level information for high-accuracy speaker recognition.Douglas A. Reynolds, Walter D. Andrews, Joseph P. Campbell, Jir Navrtil, Barbara Peskin, Andr Adami, Qin Jin, David Kluscek, Joy S. Abramson, Radu Mihaescu, John J. Godfrey, Douglas A. Jones, Bing Xiang
2002ACLImprovements in Non-Verbal Cue Identification Using Multilingual Phone Strings.Tanja Schultz, Qin Jin, Kornel Laskowski, Alicia Tribble, Alex Waibel
2002ICASSPSpeaker identification using multilingual phone strings.Qin Jin, Tanja Schultz, Alex Waibel
2002InterspeechPhonetic speaker identification.Qin Jin, Tanja Schultz, Alex Waibel
2000InterspeechApplication of LDA to speaker recognition.Qin Jin, Alex Waibel
2000InterspeechA na ve de-lambing method for speaker identification.Qin Jin, Alex Waibel
1998InterspeechA high-performance text-independent speaker identification system based on BCDM.Qin Jin, Luo Si, Qixiu Hu