<p>Reliable prostate cancer decision support requires integrating evidence across MRI, ultrasound and whole slide imaging (WSI), while recognizing that these modalities differ in scale, acquisition context and label availability. We present a MedGemma-based multimodal framework for prostate cancer segmentation, Gleason grade group classification and survival prediction. The architecture uses modality-specific encoders, hierarchical MIL for WSI, modality availability masks, registered or semantically constrained gated cross-attention, and dedicated task heads. Because public resources do not provide one large fully matched MRI+US+WSI cohort, we report task-specific configurations and make every result table locally explicit about dataset, target, active modalities, comparison source, and model variant. Supervised training optimizes classification, segmentation, survival, and alignment losses, followed by a separate RL-DAPO stage that tunes a structured clinical rationale decoder while freezing visual encoders and task heads. The rationale reward combines final-answer correctness, factuality, grounding, cross-output consistency, and length regularization. Results from this study report confidence intervals for prespecified primary metrics; paired tests are limited to predefined same-case contrasts with available paired prediction vectors, including the matched MRI+US analysis. Published values are presented as contextual references rather than statistically tested comparative claims.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Policy optimized MedGemma for multimodal prostate cancer care

  • Jimeng Hu,
  • Quan Zhou,
  • Bohan Zeng,
  • Boke Liu,
  • Fangdie Ye,
  • Mengbo Hu,
  • Haowen Jiang

摘要

Reliable prostate cancer decision support requires integrating evidence across MRI, ultrasound and whole slide imaging (WSI), while recognizing that these modalities differ in scale, acquisition context and label availability. We present a MedGemma-based multimodal framework for prostate cancer segmentation, Gleason grade group classification and survival prediction. The architecture uses modality-specific encoders, hierarchical MIL for WSI, modality availability masks, registered or semantically constrained gated cross-attention, and dedicated task heads. Because public resources do not provide one large fully matched MRI+US+WSI cohort, we report task-specific configurations and make every result table locally explicit about dataset, target, active modalities, comparison source, and model variant. Supervised training optimizes classification, segmentation, survival, and alignment losses, followed by a separate RL-DAPO stage that tunes a structured clinical rationale decoder while freezing visual encoders and task heads. The rationale reward combines final-answer correctness, factuality, grounding, cross-output consistency, and length regularization. Results from this study report confidence intervals for prespecified primary metrics; paired tests are limited to predefined same-case contrasts with available paired prediction vectors, including the matched MRI+US analysis. Published values are presented as contextual references rather than statistically tested comparative claims.