| 2026 | ACL | CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents. | Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung |
| 2026 | ACL | Self-Sum: Teaching an Agent to Decide Itself When and What to Summarize. | Hongru Wang, Rui Wang, Jushi Kai, Boyang Xue, Yongqi Li, Shijue Huang, Xiaoteng Ma, Jeff Z. Pan, Amos Storkey |
| 2025 | AAAI | Empowering Self-Learning of LLMs: Inner Knowledge Explicitation as a Catalyst. | Shijue Huang, Wanjun Zhong, Deng Cai, Fanqi Wan, Chengyi Wang, Mingxuan Wang, Mu Qiao, Ruifeng Xu |
| 2025 | ACL | Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst. | Hongru Wang, Deng Cai, Wanjun Zhong, Shijue Huang, Jeff Z. Pan, Zeming Liu, Kam-Fai Wong |
| 2025 | ICASSP | CroPrompt: Cross-task Interactive Prompting for Zero-shot Spoken Language Understanding. | Libo Qin, Fuxuan Wei, Qiguang Chen, Jingxuan Zhou, Shijue Huang, Jiasheng Si, Wenpeng Lu, Wanxiang Che |
| 2024 | ACL | Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios. | Shijue Huang, Wanjun Zhong, Jianqiao Lu, Qi Zhu, Jiahui Gao, Weiwen Liu, Yutai Hou, Xingshan Zeng, Yasheng Wang, Lifeng Shang, Xin Jiang, Ruifeng Xu, Qun Liu |
| 2024 | EMNLP | CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models. | Zexuan Qiu, Jingjing Li, Shijue Huang, Xiaoqi Jiao, Wanjun Zhong, Irwin King |
| 2024 | ICASSP | SDIF-DA: A Shallow-to-Deep Interaction Framework with Data Augmentation for Multi-Modal Intent Detection. | Shijue Huang, Libo Qin, Bingbing Wang, Geng Tu, Ruifeng Xu |
| 2023 | ACL | MMSD2.0: Towards a Reliable Multi-modal Sarcasm Detection System. | Libo Qin, Shijue Huang, Qiguang Chen, Chenran Cai, Yudi Zhang, Bin Liang, Wanxiang Che, Ruifeng Xu |
| 2023 | EMNLP | Cross-lingual Prompting: Improving Zero-shot Chain-of-Thought Reasoning across Languages. | Libo Qin, Qiguang Chen, Fuxuan Wei, Shijue Huang, Wanxiang Che |
| 2022 | COLING | CGIM: A Cycle Guided Interactive Learning Model for Consistency Identification in Task-oriented Dialogue. | Libo Qin, Qiguang Chen, Tianbao Xie, Qian Liu, Shijue Huang, Wanxiang Che, Zhou Yu |
| 2021 | EMNLP | Don't be Contradicted with Anything! CI-ToD: Towards Benchmarking Consistency for Task-oriented Dialogue System. | Libo Qin, Tianbao Xie, Shijue Huang, Qiguang Chen, Xiao Xu, Wanxiang Che |