Abstract <p>Extreme class imbalance hinders clinical text classification, particularly when rare cases have diagnostic or prognostic significance. We benchmark 336 pipelines varying vectorization (BoW, TF–IDF), resampling (12 methods + baseline), and classifiers (15 models) on 49,035 French radiology reports (164 minority; prevalence <InlineEquation ID="IEq1"> <EquationSource Format="TEX">\(\approx 0.33\%\)</EquationSource> </InlineEquation>). Oversampling—especially BorderlineSMOTE/SMOTE—consistently improves minority-class <InlineEquation ID="IEq2"> <EquationSource Format="TEX">\(F_{1}\)</EquationSource> </InlineEquation>; naïve undersampling degrades it. The top configuration pairs TF–IDF with Stacking and boundary-cleaning undersampling (OSS/NCR), reaching <InlineEquation ID="IEq3"> <EquationSource Format="TEX">\(F_{1}=0.727\)</EquationSource> </InlineEquation>, performing comparably to the best oversampling pipeline (RandomOverSampler + LightGBM, <InlineEquation ID="IEq4"> <EquationSource Format="TEX">\(F_{1}=0.717\)</EquationSource> </InlineEquation>) and a strong no-resampling baseline (BoW + Voting, <InlineEquation ID="IEq5"> <EquationSource Format="TEX">\(F_{1}=0.706\)</EquationSource> </InlineEquation>). Sampler and classifier failures at this prevalence are also documented. These results establish robust starting configurations for extreme-imbalance settings and a transparent evaluation protocol to support future work.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Efficient detection of rare clinical cohorts: a robust framework for extreme class imbalance in low-resource clinical text

  • Hiba Ouchene,
  • Melyara Mezzi,
  • Nadjia Benblidia

摘要

Abstract

Extreme class imbalance hinders clinical text classification, particularly when rare cases have diagnostic or prognostic significance. We benchmark 336 pipelines varying vectorization (BoW, TF–IDF), resampling (12 methods + baseline), and classifiers (15 models) on 49,035 French radiology reports (164 minority; prevalence \(\approx 0.33\%\) ). Oversampling—especially BorderlineSMOTE/SMOTE—consistently improves minority-class \(F_{1}\) ; naïve undersampling degrades it. The top configuration pairs TF–IDF with Stacking and boundary-cleaning undersampling (OSS/NCR), reaching \(F_{1}=0.727\) , performing comparably to the best oversampling pipeline (RandomOverSampler + LightGBM, \(F_{1}=0.717\) ) and a strong no-resampling baseline (BoW + Voting, \(F_{1}=0.706\) ). Sampler and classifier failures at this prevalence are also documented. These results establish robust starting configurations for extreme-imbalance settings and a transparent evaluation protocol to support future work.