| 2026 | ACL | Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation. | Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi, Zongwan Cao, Chenjun Xu, Bingbing Wen, Su Lin Blodgett, Lucy Lu Wang |
| 2026 | IUI | SusBench: An Online Benchmark for Evaluating Dark Pattern Susceptibility of Computer-Use Agents. | Longjie Guo, Chenjie Yuan, Mingyuan Zhong, Robert Wolfe, Ruican Zhong, Yue Xu, Bingbing Wen, Hua Shen, Lucy Lu Wang, Alexis Hiniker |
| 2025 | ACL | Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs. | Chenjun Xu, Bingbing Wen, Bin Han, Robert Wolfe, Lucy Lu Wang, Bill Howe |
| 2024 | CVPR | OmniMotionGPT: Animal Motion Generation with Limited Data. | Zhangsihao Yang, Mingyuan Zhou, Mengyi Shan, Bingbing Wen, Ziwei Xuan, Mitch Hill, Junjie Bai, Guo-Jun Qi, Yalin Wang |
| 2024 | EMNLP | Characterizing LLM Abstention Behavior in Science QA with Context Perturbations. | Bingbing Wen, Bill Howe, Lucy Lu Wang |
| 2023 | AAAI | CCQ: Cross-Class Query Network for Partially Labeled Organ Segmentation. | Xuyang Liu, Bingbing Wen, Sibei Yang |
| 2022 | WWW | ExpScore: Learning Metrics for Recommendation Explanation. | Bingbing Wen, Yunhe Feng, Yongfeng Zhang, Chirag Shah |