Xiang Yue
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
49
Venues
12
Active years
2019–2026
Best venue rank
A*
Where they publish
Papers
49 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Video-MMMU: Evaluating Knowledge Acquisition from Multidisciplinary Professional Videos. | Kairui Hu, Penghao Wu, Fanyi Pu, Wang Xiao, Xiang Yue, Bo Li, Yuanhan Zhang, Ziwei Liu |
| 2026 | ACL | Scaling Evaluation-Time Compute with Reasoning Models as Evaluators. | Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Minkyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck |
| 2026 | ACL | Temporal Sampling for Forgotten Reasoning in LLMs. | Yuetai Li, Zhangchen Xu, Fengqing Jiang, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Xiang Yue, Radha Poovendran |
| 2025 | ACL | Synthetic Data in the Era of Large Language Models. | Vijay Viswanathan, Xiang Yue, Alisa Liu, Yizhong Wang, Graham Neubig |
| 2025 | ACL | MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale. | Jiawei Guo, Tianyu Zheng, Yizhi Li, Yuelin Bai, Bo Li, Yubo Wang, King Zhu, Graham Neubig, Wenhu Chen, Xiang Yue |
| 2025 | ACL | Evaluating Language Models as Synthetic Data Generators. | Seungone Kim, Juyoung Suk, Xiang Yue, Vijay Viswanathan, Seongyun Lee, Yizhong Wang, Kiril Gashteovski, Carolin Lawrence, Sean Welleck, Graham Neubig |
| 2025 | ACL | Small Models Struggle to Learn from Strong Reasoners. | Yuetai Li, Xiang Yue, Zhangchen Xu, Fengqing Jiang, Luyao Niu, Bill Yuchen Lin, Bhaskar Ramasubramanian, Radha Poovendran |
| 2025 | ACL | Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA. | Qianqi Yan, Xuehai He, Xiang Yue, Xin Eric Wang |
| 2025 | ACL | MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark. | Xiang Yue, Tianyu Zheng, Yuansheng Ni, Yubo Wang, Kai Zhang, Shengbang Tong, Yuxuan Sun, Botao Yu, Ge Zhang, Huan Sun, Yu Su, Wenhu Chen, Graham Neubig |
| 2025 | ACL | LIME: Less Is More for MLLM Evaluation. | King Zhu, Qianbo Zang, Shian Jia, Siwei Wu, Feiteng Fang, Yizhi Li, Shuyue Guo, Tianyu Zheng, Jiawei Guo, Bo Li, Haoning Wu, Xingwei Qu, Jian Yang, Ruibo Liu, Xiang Yue, Jiaheng Liu, Chenghua Lin, Hamid Alinejad-Rokny, Min Yang, Shiwen Ni, Wenhao Huang, Ge Zhang |
| 2025 | CVPR | Evaluating Vision-Language Models as Evaluators in Path Planning. | Mohamed Aghzal, Xiang Yue, Erion Plaku, Ziyu Yao |
| 2025 | EMNLP | VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search. | Yiming Jia, Jiachen Li, Xiang Yue, Bo Li, Ping Nie, Kai Zou, Wenhu Chen |
| 2025 | EMNLP | VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation. | Yuansheng Ni, Ping Nie, Kai Zou, Xiang Yue, Wenhu Chen |
| 2025 | EMNLP | AgentDiagnose: An Open Toolkit for Diagnosing LLM Agent Trajectories. | Tianyue Ou, Wanyao Guo, Apurva Gandhi, Graham Neubig, Xiang Yue |
| 2025 | ICLR | MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks. | Jiacheng Chen, Tianhao Liang, Sherman Siu, Zhengqing Wang, Kai Wang, Yubo Wang, Yuansheng Ni, Ziyan Jiang, Wang Zhu, Bohan Lyu, Dongfu Jiang, Xuan He, Yuan Liu, Hexiang Hu, Xiang Yue, Wenhu Chen |
| 2025 | ICLR | Harnessing Webpage UIs for Text-Rich Visual Understanding. | Junpeng Liu, Tianyue Ou, Yifan Song, Yuxiao Qu, Wai Lam, Chenyan Xiong, Wenhu Chen, Graham Neubig, Xiang Yue |
| 2025 | ICLR | KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks. | Kaijing Ma, Xeron Du, Yunran Wang, Haoran Zhang, Zhoufutu Wen, Xingwei Qu, Jian Yang, Jiaheng Liu, Minghao Liu, Xiang Yue, Wenhao Huang, Ge Zhang |
| 2025 | ICLR | MixEval-X: Any-to-any Evaluations from Real-world Data Mixture. | Jinjie Ni, Yifan Song, Deepanway Ghosal, Bo Li, David Junhao Zhang, Xiang Yue, Fuzhao Xue, Yuntian Deng, Zian Zheng, Kaichen Zhang, Mahir Shah, Kabir Jain, Yang You, Michael Shieh |
| 2025 | ICLR | MuPT: A Generative Symbolic Music Pretrained Transformer. | Xingwei Qu, Yuelin Bai, Yinghao Ma, Ziya Zhou, Ka Man Lo, Jiaheng Liu, Ruibin Yuan, Lejun Min, Xueling Liu, Tianyu Zhang, Xeron Du, Shuyue Guo, Yiming Liang, Yizhi Li, Shangda Wu, Junting Zhou, Tianyu Zheng, Ziyang Ma, Fengze Han, Wei Xue, Gus Xia, Emmanouil Benetos, Xiang Yue, Chenghua Lin, Xu Tan, Wenhao Huang, Jie Fu, Ge Zhang |
| 2025 | ICLR | Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages. | Xiang Yue, Yueqi Song, Akari Asai, Seungone Kim, Jean de Dieu Nyandwi, Simran Khanuja, Anjali Kantharuban, Lintang Sutawika, Sathyanarayanan Ramamoorthy, Graham Neubig |
| 2025 | ICML | Overtrained Language Models Are Harder to Fine-Tune. | Jacob Mitchell Springer, Sachin Goyal, Kaiyue Wen, Tanishq Kumar, Xiang Yue, Sadhika Malladi, Graham Neubig, Aditi Raghunathan |
| 2025 | ICML | Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning. | Rongzhe Wei, Mufei Li, Mohsen Ghassemi, Eleonora Kreacic, Yifan Li, Xiang Yue, Bo Li, Vamsi K. Potluru, Pan Li, Eli Chien |
| 2025 | ICML | Demystifying Long Chain-of-Thought Reasoning. | Shiming Yang, Yuxuan Tong, Xinyao Niu, Graham Neubig, Xiang Yue |
| 2025 | Interspeech | OpusLM: A Family of Open Unified Speech Language Models. | Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe |
| 2025 | NAACL | SimulBench: Evaluating Language Models with Creative Simulation Tasks. | Qi Jia, Xiang Yue, Tuney Zheng, Jie Huang, Bill Yuchen Lin |
| 2025 | NAACL | JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation. | Shota Onohara, Atsuyuki Miyai, Yuki Imajuku, Kazuki Egashira, Jeonghun Baek, Xiang Yue, Graham Neubig, Kiyoharu Aizawa |
| 2025 | NAACL | ESPnet-SpeechLM: An Open Speech Language Model Toolkit. | Jinchuan Tian, Jiatong Shi, William Chen, Siddhant Arora, Yoshiki Masuyama, Takashi Maekaku, Yihan Wu, Junyi Peng, Shikhar Bharadwaj, Yiwen Zhao, Samuele Cornell, Yifan Peng, Xiang Yue, Chao-Han Huck Yang, Graham Neubig, Shinji Watanabe |
| 2024 | ACL | VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation. | Max Ku, Dongfu Jiang, Cong Wei, Xiang Yue, Wenhu Chen |
| 2024 | ACL | AttributionBench: How Hard is Automatic Attribution Evaluation? | Yifei Li, Xiang Yue, Zeyi Liao, Huan Sun |
| 2024 | ACL | Trial and Error: Exploration-Based Trajectory Optimization of LLM Agents. | Yifan Song, Da Yin, Xiang Yue, Jie Huang, Sujian Li, Bill Yuchen Lin |
| 2024 | ACL | Machine Unlearning of Pre-trained Large Language Models. | Jin Yao, Eli Chien, Minxin Du, Xinyao Niu, Tianhao Wang, Zezhou Cheng, Xiang Yue |
| 2024 | ACL | OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement. | Tianyu Zheng, Ge Zhang, Tianhao Shen, Xueling Liu, Bill Yuchen Lin, Jie Fu, Wenhu Chen, Xiang Yue |
| 2024 | CVPR | MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. | Xiang Yue, Yuansheng Ni, Tianyu Zheng, Kai Zhang, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen |
| 2024 | ICLR | MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning. | Xiang Yue, Xingwei Qu, Ge Zhang, Yao Fu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen |
| 2024 | ICML | Data Engineering for Scaling Language Models to 128K Context. | Yao Fu, Rameswar Panda, Xinyao Niu, Xiang Yue, Hannaneh Hajishirzi, Yoon Kim, Hao Peng |
| 2024 | NAACL | TableLlama: Towards Open Large Generalist Models for Tables. | Tianshu Zhang, Xiang Yue, Yifei Li, Huan Sun |
| 2023 | ACL | Synthetic Text Generation with Differential Privacy: A Simple and Practical Recipe. | Xiang Yue, Huseyin A. Inan, Xuechen Li, Girish Kumar, Julia McAnallen, Hoda Shajari, Huan Sun, David Levitan, Robert Sim |
| 2023 | CCS | DP-Forward: Fine-tuning and Inference on Language Models with Differential Privacy in Forward Pass. | Minxin Du, Xiang Yue, Sherman S. M. Chow, Tianhao Wang, Chenyu Huang, Huan Sun |
| 2023 | EMNLP | Can ChatGPT Defend its Belief in Truth? Evaluating LLM Reasoning via Debate. | Boshi Wang, Xiang Yue, Huan Sun |
| 2023 | EMNLP | Automatic Evaluation of Attribution by Large Language Models. | Xiang Yue, Boshi Wang, Ziru Chen, Kai Zhang, Yu Su, Huan Sun |
| 2023 | WWW | Sanitizing Sentence Embeddings (and Labels) for Local Differential Privacy. | Minxin Du, Xiang Yue, Sherman S. M. Chow, Huan Sun |
| 2023 | SIGdial | Roll Up Your Sleeves: Working with a Collaborative and Engaging Task-Oriented Dialogue System. | Lingbo Mo, Shijie Chen, Ziru Chen, Xiang Deng, Ashley Lewis, Sunit Singh, Samuel Stevens, Chang-You Tai, Zhen Wang, Xiang Yue, Tianshu Zhang, Yu Su, Huan Sun |
| 2022 | ACL | C-MORE: Pretraining to Answer Open-Domain Questions by Consulting Millions of References. | Xiang Yue, Xiaoman Pan, Wenlin Yao, Dian Yu, Dong Yu, Jianshu Chen |
| 2022 | ACL | Synthetic Question Value Estimation for Domain Adaptation of Question Answering. | Xiang Yue, Ziyu Yao, Huan Sun |
| 2021 | ACL | Differential Privacy for Text Analytics via Natural Text Sanitization. | Xiang Yue, Minxin Du, Tianhao Wang, Yaliang Li, Huan Sun, Sherman S. M. Chow |
| 2021 | EMNLP | COUGH: A Challenge Dataset and Models for COVID-19 FAQ Retrieval. | Xinliang Frederick Zhang, Heming Sun, Xiang Yue, Simon M. Lin, Huan Sun |
| 2020 | ACL | Clinical Reading Comprehension: A Thorough Analysis of the emrQA Dataset. | Xiang Yue, Bernal Jimenez Gutierrez, Huan Sun |
| 2020 | IJCAI | Towards Making the Most of Context in Neural Machine Translation. | Zaixiang Zheng, Xiang Yue, Shujian Huang, Jiajun Chen, Alexandra Birch |
| 2019 | KDD | SurfCon: Synonym Discovery on Privacy-Aware Clinical Data. | Zhen Wang, Xiang Yue, Soheil Moosavinasab, Yungui Huang, Simon M. Lin, Huan Sun |