Skip to content

Sainbayar Sukhbaatar

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

19

Venues

9

Active years

2018–2025

Best venue rank

A*

Where they publish

Papers

19 indexed papers, newest first.

YearVenueTitleAuthors
2025EMNLPMeta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason E. Weston, Sainbayar Sukhbaatar
2025EMNLPFollowing Length Constraints in Instructions.Weizhe Yuan, Ilia Kulikov, Ping Yu, Kyunghyun Cho, Sainbayar Sukhbaatar, Jason E. Weston, Jing Xu
2025ICLRDualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces.DiJia Su, Sainbayar Sukhbaatar, Michael Rabbat, Yuandong Tian, Qinqing Zheng
2025ICMLThinking LLMs: General Instruction Following with Thought Generation.Tianhao Wu, Janice Lan, Weizhe Yuan, Jiantao Jiao, Jason E. Weston, Sainbayar Sukhbaatar
2025ICMLSelf-Consistency Preference Optimization.Archiki Prasad, Weizhe Yuan, Richard Yuanzhe Pang, Jing Xu, Maryam Fazel-Zarandi, Mohit Bansal, Sainbayar Sukhbaatar, Jason E. Weston, Jane Yu
2025ICMLR.I.P.: Better Models by Survival of the Fittest Prompts.Ping Yu, Weizhe Yuan, Olga Golovneva, Tianhao Wu, Sainbayar Sukhbaatar, Jason E. Weston, Jing Xu
2024ICMLSelf-Rewarding Language Models.Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston
2023AAAIA Data Source for Reasoning Embodied Agents.Jack Lanchantin, Sainbayar Sukhbaatar, Gabriel Synnaeve, Yuxuan Sun, Kavya Srinet, Arthur Szlam
2023ACLThe CRINGE Loss: Learning what language not to model.Leonard Adolphs, Tianyu Gao, Jing Xu, Kurt Shuster, Sainbayar Sukhbaatar, Jason Weston
2022CoRLLearning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping.Lina Mezghani, Sainbayar Sukhbaatar, Piotr Bojanowski, Alessandro Lazaric, Karteek Alahari
2022IJCNLPDirector: Generator-Classifiers For Supervised Language Modeling.Kushal Arora, Kurt Shuster, Sainbayar Sukhbaatar, Jason Weston
2022IROSMemory-Augmented Reinforcement Learning for Image-Goal Navigation.Lina Mezghani, Sainbayar Sukhbaatar, Thibaut Lavril, Oleksandr Maksymets, Dhruv Batra, Piotr Bojanowski, Karteek Alahari
2022UAITemporal abstractions-augmented temporally contrastive learning: An alternative to the Laplacian in RL.Akram Erraqabi, Marlos C. Machado, Mingde Zhao, Sainbayar Sukhbaatar, Alessandro Lazaric, Ludovic Denoyer, Yoshua Bengio
2021ICMLNot All Memories are Created Equal: Learning to Forget by Expiring.Sainbayar Sukhbaatar, Da Ju, Spencer Poff, Stephen Roller, Arthur Szlam, Jason Weston, Angela Fan
2019ACLTraining Hybrid Language Models by Marginalizing over Segmentations.Edouard Grave, Sainbayar Sukhbaatar, Piotr Bojanowski, Armand Joulin
2019ACLAdaptive Attention Span in Transformers.Sainbayar Sukhbaatar, Edouard Grave, Piotr Bojanowski, Armand Joulin
2019ICLRLearning when to Communicate at Scale in Multiagent Cooperative and Competitive Tasks.Amanpreet Singh, Tushar Jain, Sainbayar Sukhbaatar
2018ICLRIntrinsic Motivation and Automatic Curricula via Asymmetric Self-Play.Sainbayar Sukhbaatar, Zeming Lin, Ilya Kostrikov, Gabriel Synnaeve, Arthur Szlam, Rob Fergus
2018ICMLComposable Planning with Attributes.Amy Zhang, Sainbayar Sukhbaatar, Adam Lerer, Arthur Szlam, Rob Fergus