ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation.
Cihang Peng, Qiming Hou, Zhong Ren, Kun Zhou
Browse the full ICCV paper archive.
Cihang Peng, Qiming Hou, Zhong Ren, Kun Zhou
Browse the full ICCV paper archive.