Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning.
Mantek Singh, Jeshwanth Challagundla, Siddharth Raina, Jasmin Jarsania
Browse the full MMM paper archive.
Mantek Singh, Jeshwanth Challagundla, Siddharth Raina, Jasmin Jarsania
Browse the full MMM paper archive.