Skip to content
cs-conference-ranking
.org
By subfield
By rank
Methodology
⌕
Search 971 venues
Home
/
ICASSP
/
Paper
From Pixels to Voice: A Simple and Efficient End-to-End Spoken Image Description Approach via Vision Codec Language Models.
Chung Tran
,
Sakriani Sakti
Venue
Multiconference
ICASSP
Year
2025
Proceedings
ICASSP
DBLP record
conf/icassp/TranS25 ↗
Browse the full
ICASSP paper archive
.