| 2025 | ICML | ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding. | Xingyu Fu, Minqian Liu, Zhengyuan Yang, John Corring, Yijuan Lu, Jianwei Yang, Dan Roth, Dinei A. F. Florncio, Cha Zhang |
| 2023 | AAAI | TrOCR: Transformer-Based Optical Character Recognition with Pre-trained Models. | Minghao Li, Tengchao Lv, Jingye Chen, Lei Cui, Yijuan Lu, Dinei A. F. Florncio, Cha Zhang, Zhoujun Li, Furu Wei |
| 2023 | ACL | From Characters to Words: Hierarchical Pre-trained Language Model for Open-vocabulary Language Understanding. | Li Sun, Florian Luisier, Kayhan Batmanghelich, Dinei A. F. Florncio, Cha Zhang |
| 2023 | CVPR | Unifying Vision, Text, and Layout for Universal Document Processing. | Zineng Tang, Ziyi Yang, Guoxin Wang, Yuwei Fang, Yang Liu, Chenguang Zhu, Michael Zeng, Cha Zhang, Mohit Bansal |
| 2023 | ICDAR | Diffusion-Based Document Layout Generation. | Liu He, Yijuan Lu, John Corring, Dinei A. F. Florncio, Cha Zhang |
| 2022 | ACL | XFUND: A Benchmark Dataset for Multilingual Visually Rich Form Understanding. | Yiheng Xu, Tengchao Lv, Lei Cui, Guoxin Wang, Yijuan Lu, Dinei A. F. Florncio, Cha Zhang, Furu Wei |
| 2022 | EMNLP | XDoc: Unified Pre-training for Cross-Format Document Understanding. | Jingye Chen, Tengchao Lv, Lei Cui, Cha Zhang, Furu Wei |
| 2022 | IJCNLP | A Simple yet Effective Learnable Positional Encoding Method for Improving Document Transformer Model. | Guoxin Wang, Yijuan Lu, Lei Cui, Tengchao Lv, Dinei A. F. Florncio, Cha Zhang |
| 2021 | ACL | LayoutLMv2: Multi-modal Pre-training for Visually-rich Document Understanding. | Yang Xu, Yiheng Xu, Tengchao Lv, Lei Cui, Furu Wei, Guoxin Wang, Yijuan Lu, Dinei A. F. Florncio, Cha Zhang, Wanxiang Che, Min Zhang, Lidong Zhou |
| 2021 | CVPR | Renofeation: A Simple Transfer Learning Method for Improved Adversarial Robustness. | Ting-Wu Chin, Cha Zhang, Diana Marculescu |
| 2021 | CVPR | TAP: Text-Aware Pre-Training for Text-VQA and Text-Caption. | Zhengyuan Yang, Yijuan Lu, Jianfeng Wang, Xi Yin, Dinei Florncio, Lijuan Wang, Cha Zhang, Lei Zhang, Jiebo Luo |
| 2020 | CVPR | Towards Efficient Model Compression via Learned Global Ranking. | Ting-Wu Chin, Ruizhou Ding, Cha Zhang, Diana Marculescu |
| 2020 | ICASSP | Multimodal Active Speaker Detection and Virtual Cinematography for Video Conferencing. | Ross Cutler, Ramin Mehran, Sam Johnson, Cha Zhang, Adam Kirk, Oliver Whyte, Adarsh Kowdle |
| 2019 | CVPR | RePr: Improved Training of Convolutional Filters. | Aaditya Prakash, James A. Storer, Dinei A. F. Florncio, Cha Zhang |
| 2017 | ICASSP | Automatic speech emotion recognition using recurrent neural networks with local attention. | Seyedmahdad Mirsamadi, Emad Barsoum, Cha Zhang |
| 2016 | ICMI | Emotion recognition in the wild from videos using images. | Sarah Adel Bargal, Emad Barsoum, Cristian Canton-Ferrer, Cha Zhang |
| 2016 | ICMI | Training deep networks for facial expression recognition with crowd-sourced label distribution. | Emad Barsoum, Cha Zhang, Cristian Canton-Ferrer, Zhengyou Zhang |
| 2015 | ICMI | Image based Static Facial Expression Recognition with Multiple Deep Network Learning. | Zhiding Yu, Cha Zhang |
| 2014 | ICIP | Image bit-depth enhancement via maximum-a-posteriori estimation of graph AC component. | Pengfei Wan, Gene Cheung, Dinei A. F. Florncio, Cha Zhang, Oscar C. Au |
| 2014 | ICIP | Point cloud attribute compression with graph transform. | Cha Zhang, Dinei A. F. Florncio, Charles T. Loop |
| 2014 | WACV | Improving multiview face detection with multi-task deep convolutional neural networks. | Cha Zhang, Zhengyou Zhang |
| 2013 | CVPR | Wide-Baseline Hair Capture Using Strand-Based Refinement. | Linjie Luo, Cha Zhang, Zhengyou Zhang, Szymon Rusinkiewicz |
| 2013 | CVPR | Video Enhancement of People Wearing Polarized Glasses: Darkening Reversal and Reflection Reduction. | Mao Ye, Cha Zhang, Ruigang Yang |
| 2012 | ICASSP | 3D scene reconstruction by multiple structured-light based commodity depth cameras. | Jianfeng Wang, Cha Zhang, Wenwu Zhu, Zhengyou Zhang, Zixiang Xiong, Philip A. Chou |
| 2011 | ICASSP | CROWDMOS: An approach for crowdsourcing mean opinion score studies. | Flavio P. Ribeiro, Dinei A. F. Florncio, Cha Zhang, Michael L. Seltzer |
| 2011 | MMSP | Low-complexity, near-lossless coding of depth maps from kinect-like depth cameras. | Sanjeev Mehrotra, Zhengyou Zhang, Qin Cai, Cha Zhang, Philip A. Chou |
| 2010 | ECCV | 3D Deformable Face Tracking with a Commodity Depth Camera. | Qin Cai, David Gallup, Cha Zhang, Zhengyou Zhang |
| 2010 | ICASSP | L1 regularized room modeling with compact microphone arrays. | Demba E. Ba, Flavio P. Ribeiro, Cha Zhang, Dinei A. F. Florncio |
| 2010 | MMSP | Enhancing loudspeaker-based 3D audio with room modeling. | Myung-Suk Song, Cha Zhang, Dinei A. F. Florncio, Hong-Goo Kang |
| 2010 | VCIP | Joint tracking and multiview video compression. | Cha Zhang, Dinei Florncio |
| 2009 | ACCV | Efficient Scale-Space Spatiotemporal Saliency Tracking for Distortion-Free Video Retargeting. | Gang Hua, Cha Zhang, Zicheng Liu, Zhengyou Zhang, Ying Shan |
| 2009 | CVPR | Boosted multi-task learning for face verification with applications to web image and video search. | Xiaogang Wang, Cha Zhang, Zhengyou Zhang |
| 2009 | ICASSP | Multiview video compression and streaming based on predicted viewer position. | Dinei A. F. Florncio, Cha Zhang |
| 2009 | MMSP | Improving depth perception with motion parallax and its application in teleconferencing. | Cha Zhang, Zhaozheng Yin, Dinei A. F. Florncio |
| 2008 | CVPR | Taylor expansion based classifier adaptation: Application to person detection. | Cha Zhang, Raffay Hamid, Zhengyou Zhang |
| 2008 | ICASSP | Why does PHAT work well in lownoise, reverberative environments? | Cha Zhang, Dinei A. F. Florncio, Zhengyou Zhang |
| 2008 | MMSP | Semantic saliency driven camera control for personal remote collaboration. | Cha Zhang, Zicheng Liu, Zhengyou Zhang, Qi Zhao |
| 2007 | ICASSP | Maximum Likelihood Sound Source Localization for Multiple Directional Microphones. | Cha Zhang, Zhengyou Zhang, Dinei A. F. Florncio |
| 2006 | ICIP | Light Weight Background Blurring for Video Conferencing Applications. | Cha Zhang, Yong Rui, Li-wei He |
| 2006 | ICPR | Robust Visual Tracking via Pixel Classification and Integration. | Cha Zhang, Yong Rui |
| 2006 | MMSP | Boosting-Based Multimodal Speaker Detection for Distributed Meetings. | Cha Zhang, Pei Yin, Yong Rui, Ross Cutler, Paul A. Viola |
| 2005 | ICIP | Light field capturing with lensless cameras. | Cha Zhang, Tsuhan Chen |
| 2004 | ICIP | View-dependent non-uniform sampling for image-based rendering. | Cha Zhang, Tsuhan Chen |
| 2004 | ICIP | Security analysis for key generation systems using face images. | Wende Zhang, Cha Zhang, Tsuhan Chen |
| 2004 | MMM | Non-Uniform Sampling for Image-Based Rendering: Convergence of Image, Vision, and Graphic. | Cha Zhang, Tsuhan Chen |
| 2004 | SIGGRAPH | A self-reconfigurable camera array. | Cha Zhang, Tsuhan Chen |
| 2003 | ICASSP | On generalized sampling for image-based rendering data. | Cha Zhang, Tsuhan Chen |
| 2003 | ICASSP | Surface plenoptic function: a tool for the sampling analysis of image-based rendering. | Cha Zhang, Tsuhan Chen |
| 2003 | ICIP | Annotating retrieval database with active learning. | Cha Zhang, Tsuhan Chen |
| 2003 | VCIP | Nonuniform sampling of image-based rendering data with the position-interval-error (PIE) function. | Cha Zhang, Tsuhan Chen |
| 2003 | VCIP | Color image sharpening based on collective time-evolution of simultaneous nonlinear reaction-diffusion. | Cha Zhang, Tsuhan Chen |
| 2002 | ICASSP | Towards optimal least square filters using the eigenfilter approach. | Cha Zhang, Tsuhan Chen |
| 2001 | ICIP | Efficient feature extraction for 2D/3D objects in mesh representation. | Cha Zhang, Tsuhan Chen |
| 2001 | VCIP | Interactive browsing of 3D environment over the Internet. | Cha Zhang, Jin Li |
| 2000 | DCC | Compression of Lumigraph with Multiple Reference Frame (MRF) Prediction and Just-in-Time Rendering. | Cha Zhang, Jin Li |
| 2000 | VCIP | Compression and rendering of concentric mosaics with reference block codec (RBC). | Cha Zhang, Jin Li |