| 2025 | ICLR | From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency. | Kaiyue Wen, Huaqing Zhang, Hongzhou Lin, Jingzhao Zhang |
| 2025 | ICML | Task Generalization with Autoregressive Compositional Structure: Can Learning from D Tasks Generalize to DT Tasks? | Amirhesam Abedsoltan, Huaqing Zhang, Kaiyue Wen, Hongzhou Lin, Jingzhao Zhang, Mikhail Belkin |
| 2025 | NAACL | UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models. | Yijiang River Dong, Hongzhou Lin, Mikhail Belkin, Ramn Huerta, Ivan Vulic |
| 2022 | ICML | Beyond Worst-Case Analysis in Stochastic Approximation: Moment Estimation Improves Instance Complexity. | Jingzhao Zhang, Hongzhou Lin, Subhro Das, Suvrit Sra, Ali Jadbabaie |
| 2020 | ICML | Complexity of Finding Stationary Points of Nonconvex Nonsmooth Functions. | Jingzhao Zhang, Hongzhou Lin, Stefanie Jegelka, Suvrit Sra, Ali Jadbabaie |
| 2018 | AISTATS | Catalyst for Gradient-based Nonconvex Optimization. | Courtney Paquette, Hongzhou Lin, Dmitriy Drusvyatskiy, Julien Mairal, Zad Harchaoui |