Sainbayar Sukhbaatar
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
19
Venues
9
Active years
2018–2025
Best venue rank
A*
Where they publish
Papers
19 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | EMNLP | Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge. | Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason E. Weston, Sainbayar Sukhbaatar |
| 2025 | EMNLP | Following Length Constraints in Instructions. | Weizhe Yuan, Ilia Kulikov, Ping Yu, Kyunghyun Cho, Sainbayar Sukhbaatar, Jason E. Weston, Jing Xu |
| 2025 | ICLR | Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces. | DiJia Su, Sainbayar Sukhbaatar, Michael Rabbat, Yuandong Tian, Qinqing Zheng |
| 2025 | ICML | Thinking LLMs: General Instruction Following with Thought Generation. | Tianhao Wu, Janice Lan, Weizhe Yuan, Jiantao Jiao, Jason E. Weston, Sainbayar Sukhbaatar |
| 2025 | ICML | Self-Consistency Preference Optimization. | Archiki Prasad, Weizhe Yuan, Richard Yuanzhe Pang, Jing Xu, Maryam Fazel-Zarandi, Mohit Bansal, Sainbayar Sukhbaatar, Jason E. Weston, Jane Yu |
| 2025 | ICML | R.I.P.: Better Models by Survival of the Fittest Prompts. | Ping Yu, Weizhe Yuan, Olga Golovneva, Tianhao Wu, Sainbayar Sukhbaatar, Jason E. Weston, Jing Xu |
| 2024 | ICML | Self-Rewarding Language Models. | Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston |
| 2023 | AAAI | A Data Source for Reasoning Embodied Agents. | Jack Lanchantin, Sainbayar Sukhbaatar, Gabriel Synnaeve, Yuxuan Sun, Kavya Srinet, Arthur Szlam |
| 2023 | ACL | The CRINGE Loss: Learning what language not to model. | Leonard Adolphs, Tianyu Gao, Jing Xu, Kurt Shuster, Sainbayar Sukhbaatar, Jason Weston |
| 2022 | CoRL | Learning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping. | Lina Mezghani, Sainbayar Sukhbaatar, Piotr Bojanowski, Alessandro Lazaric, Karteek Alahari |
| 2022 | IJCNLP | Director: Generator-Classifiers For Supervised Language Modeling. | Kushal Arora, Kurt Shuster, Sainbayar Sukhbaatar, Jason Weston |
| 2022 | IROS | Memory-Augmented Reinforcement Learning for Image-Goal Navigation. | Lina Mezghani, Sainbayar Sukhbaatar, Thibaut Lavril, Oleksandr Maksymets, Dhruv Batra, Piotr Bojanowski, Karteek Alahari |
| 2022 | UAI | Temporal abstractions-augmented temporally contrastive learning: An alternative to the Laplacian in RL. | Akram Erraqabi, Marlos C. Machado, Mingde Zhao, Sainbayar Sukhbaatar, Alessandro Lazaric, Ludovic Denoyer, Yoshua Bengio |
| 2021 | ICML | Not All Memories are Created Equal: Learning to Forget by Expiring. | Sainbayar Sukhbaatar, Da Ju, Spencer Poff, Stephen Roller, Arthur Szlam, Jason Weston, Angela Fan |
| 2019 | ACL | Training Hybrid Language Models by Marginalizing over Segmentations. | Edouard Grave, Sainbayar Sukhbaatar, Piotr Bojanowski, Armand Joulin |
| 2019 | ACL | Adaptive Attention Span in Transformers. | Sainbayar Sukhbaatar, Edouard Grave, Piotr Bojanowski, Armand Joulin |
| 2019 | ICLR | Learning when to Communicate at Scale in Multiagent Cooperative and Competitive Tasks. | Amanpreet Singh, Tushar Jain, Sainbayar Sukhbaatar |
| 2018 | ICLR | Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play. | Sainbayar Sukhbaatar, Zeming Lin, Ilya Kostrikov, Gabriel Synnaeve, Arthur Szlam, Rob Fergus |
| 2018 | ICML | Composable Planning with Attributes. | Amy Zhang, Sainbayar Sukhbaatar, Adam Lerer, Arthur Szlam, Rob Fergus |