| 2018 | Guitar Music Transcription from Silent Video. | Shir Goldstein, Yael Moses |
| 2018 | Understanding Deep Architectures by Visual Summaries. | Marco Godi, Marco Carletti, Maya Aghaei, Francesco Giuliari, Marco Cristani |
| 2018 | Learning Finer-class Networks for Universal Representations. | Julien Girard, Youssef Tamaazousti, Herv Le Borgne, Cline Hudelot |
| 2018 | Video Time: Properties, Encoders and Evaluation. | Amir Ghodrati, Efstratios Gavves, Cees Snoek |
| 2018 | Fewer is More: Image Segmentation Based Weakly Supervised Object Detection with Partial Aggregation. | Ce Ge, Jingyu Wang, Qi Qi, Haifeng Sun, Jianxin Liao |
| 2018 | Asymmetric Spatio-Temporal Embeddings for Large-Scale Image-to-Video Retrieval. | Noa Garcia, George Vogiatzis |
| 2018 | iCAN: Instance-Centric Attention Network for Human-Object Interaction Detection. | Chen Gao, Yuliang Zou, Jia-Bin Huang |
| 2018 | Git Loss for Deep Face Recognition. | Ignazio Gallo, Shah Nawaz, Alessandro Calefati, Muhammad Kamran Janjua |
| 2018 | Reciprocal Attention Fusion for Visual Question Answering. | Moshiur R. Farazi, Salman H. Khan |
| 2018 | VSE++: Improving Visual-Semantic Embeddings with Hard Negatives. | Fartash Faghri, David J. Fleet, Jamie Ryan Kiros, Sanja Fidler |
| 2018 | Propagating Confidences through CNNs for Sparse Data Regression. | Abdelrahman Eldesokey, Michael Felsberg, Fahad Shahbaz Khan |
| 2018 | Mining for meaning: from vision to language through multiple networks consensus. | Iulia Duta, Andrei Liviu Nicolicioiu, Simion-Vlad Bogolin, Marius Leordeanu |
| 2018 | Accurate Detection and Localization of Checkerboard Corners for Calibration. | Alexander Duda, Udo Frese |
| 2018 | LieNet: Real-time Monocular Object Instance 6D Pose Estimation. | Thanh-Toan Do, Trung Pham, Ming Cai, Ian Reid |
| 2018 | Few-Shot Semantic Segmentation with Prototype Learning. | Nanqing Dong, Eric P. Xing |
| 2018 | Holistic and Deep Feature Pyramids for Saliency Detection. | Shizhong Dong, Zhifan Gao, Shanhui Sun, Xin Wang, Ming Li, Heye Zhang, Guang Yang, Huafeng Liu, Shuo Li |
| 2018 | Not All Words Are Equal: Video-specific Information Loss for Video Captioning. | Jiarong Dong, Ke Gao, Xiaokai Chen, Junbo Guo, Juan Cao, Yongdong Zhang |
| 2018 | JointFlow: Temporal Flow Fields for Multi Person Pose Estimation. | Andreas Doering, Umar Iqbal, Jrgen Gall |
| 2018 | DeepInsight: Multi-Task Multi-Scale Deep Learning for Mental Disorder Diagnosis. | Mingyu Ding, Yuqi Huo, Jun Hu, Zhiwu Lu |
| 2018 | Efficient Correction for EM Connectomics with Skeletal Representation. | Konstantin Dimitriev, Toufiq Parag, Brian Matejek, Arie E. Kaufman, Hanspeter Pfister |
| 2018 | Zero-Shot Object Detection by Hybrid Region Embedding. | Berkan Demirel, Ramazan Gokberk Cinbis, Nazli Ikizler-Cinbis |
| 2018 | Actor-Action Semantic Segmentation with Region Masks. | Kang Dang, Chunluan Zhou, Zhigang Tu, Michael Hoy, Justin Dauwels, Junsong Yuan |
| 2018 | Wide Range Depth Estimation from Binocular Light Field Camera. | Feng Dai, Xianyu Chen, Yike Ma, Guoqing Jin, Qiang Zhao |
| 2018 | An Efficient End-to-End Neural Model for Handwritten Text Recognition. | Arindam Chowdhury, Lovekesh Vig |
| 2018 | Sparse Estimation of Light Transport Matrix under Saturated Condition. | Naoya Chiba, Koichi Hashimoto |