Video Caption Generation Using Deep Learning
摘要
A deep learning system addressing accessibility issues for blind users is the motivation of this proposed work. By integrating LSTM networks for temporal dependencies, it generates comprehensive video captions. Unlike traditional methods relying on visual cues, this system provides context-aware descriptions, enhancing understanding and enjoyment for blind users. LSTM networks capture temporal relationships, ensuring smooth narrative flow. Combining these approaches yields detailed audio descriptions, facilitating better access to online video content. This advancement marks a significant step towards inclusivity in digital media consumption, benefiting blind individuals and improving their online experience.