As one of the promising approaches to improving efficiency in clinical medicine, deep learning models are still faced with dataset shortages since data collection inevitably incurs extra effort and is time-consuming. Moreover, conventional data augmentation for medical images, such as rotation and cropping, fails to maintain sufficient diversity of pathological samples. In this paper, we propose Med-VQ-VAE, a pre-training model for image reconstruction inspired by VQ-VAE and VQ-GAN that utilises its decoder component to generate robust image varieties. Based on our proposed pre-training model, we introduce Med-VAE-GAN, an image-generation model that utilises diagnosis reports to create image-report pairs. Our models can obtain a promising result.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Cross-Modal Translation for Medical Images Augmentation Based on Diagnosis Reports

  • Xingren Wang,
  • Sixing Yin,
  • Wenyu Yin,
  • Yining Wang,
  • Jiayue Li,
  • Shufang Li

摘要

As one of the promising approaches to improving efficiency in clinical medicine, deep learning models are still faced with dataset shortages since data collection inevitably incurs extra effort and is time-consuming. Moreover, conventional data augmentation for medical images, such as rotation and cropping, fails to maintain sufficient diversity of pathological samples. In this paper, we propose Med-VQ-VAE, a pre-training model for image reconstruction inspired by VQ-VAE and VQ-GAN that utilises its decoder component to generate robust image varieties. Based on our proposed pre-training model, we introduce Med-VAE-GAN, an image-generation model that utilises diagnosis reports to create image-report pairs. Our models can obtain a promising result.