A deep learning system addressing accessibility issues for blind users is the motivation of this proposed work. By integrating LSTM networks for temporal dependencies, it generates comprehensive video captions. Unlike traditional methods relying on visual cues, this system provides context-aware descriptions, enhancing understanding and enjoyment for blind users. LSTM networks capture temporal relationships, ensuring smooth narrative flow. Combining these approaches yields detailed audio descriptions, facilitating better access to online video content. This advancement marks a significant step towards inclusivity in digital media consumption, benefiting blind individuals and improving their online experience.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Video Caption Generation Using Deep Learning

  • N. Kopperundevi,
  • Adithya Biju,
  • Kristef Chacko,
  • Mayukh Saleel

摘要

A deep learning system addressing accessibility issues for blind users is the motivation of this proposed work. By integrating LSTM networks for temporal dependencies, it generates comprehensive video captions. Unlike traditional methods relying on visual cues, this system provides context-aware descriptions, enhancing understanding and enjoyment for blind users. LSTM networks capture temporal relationships, ensuring smooth narrative flow. Combining these approaches yields detailed audio descriptions, facilitating better access to online video content. This advancement marks a significant step towards inclusivity in digital media consumption, benefiting blind individuals and improving their online experience.