Cross-Modal Translation for Medical Images Augmentation Based on Diagnosis Reports
摘要
As one of the promising approaches to improving efficiency in clinical medicine, deep learning models are still faced with dataset shortages since data collection inevitably incurs extra effort and is time-consuming. Moreover, conventional data augmentation for medical images, such as rotation and cropping, fails to maintain sufficient diversity of pathological samples. In this paper, we propose Med-VQ-VAE, a pre-training model for image reconstruction inspired by VQ-VAE and VQ-GAN that utilises its decoder component to generate robust image varieties. Based on our proposed pre-training model, we introduce Med-VAE-GAN, an image-generation model that utilises diagnosis reports to create image-report pairs. Our models can obtain a promising result.