Die Dokumentenklassifikation ist eine typische Aufgabe des Natural Language Processing (NLP). Verfahren des maschinellen Lernens erfordern große Datenmengen, die in sensiblen Bereichen wie der Medizin oft nicht zur Verfügung stehen. Daher wäre die Wiederverwendung von bereits trainierten Klassifikationsmodellen hier besonders hilfreich. Allerdings ist dies aus Gründen des Datenschutzes in der Regel nicht möglich. Der vorgestellte Ansatz stellt sicher, dass Klassifikatoren keine personenbezogenen Daten nutzen. Durch die Verwendung von Ontologien können Klassifikatoren für verschiedene Domänen trainiert und dort ohne weitere Anpassung eingesetzt werden. Das Transfer-Lernen erfolgt sowohl durch direkte Übertragung als auch durch Anreicherung der Ontologie mit Begriffen aus der Zieldomäne. Ontologien dienen dazu, die Klassifikatoren an die Zieldomäne anzupassen, indem das Vokabular der Zieldomäne auf den Merkmalsraum des Klassifikators abgebildet wird. Ein Anwendungsfall ist die Annotation von Patientenakten in Krankenhäusern mit ICD-Codes. Die Lösung ermöglicht die Anpassung an die Fachsprache des jeweiligen Krankenhauses sowie die Konformität mit der DSGVO.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Transfer-Lernen für die Klassifikation medizinischer Texte

  • Daniel Bruneß,
  • Matthias Bay,
  • Christian Schulze,
  • Michael Guckert,
  • Mirjam Minor

摘要

Die Dokumentenklassifikation ist eine typische Aufgabe des Natural Language Processing (NLP). Verfahren des maschinellen Lernens erfordern große Datenmengen, die in sensiblen Bereichen wie der Medizin oft nicht zur Verfügung stehen. Daher wäre die Wiederverwendung von bereits trainierten Klassifikationsmodellen hier besonders hilfreich. Allerdings ist dies aus Gründen des Datenschutzes in der Regel nicht möglich. Der vorgestellte Ansatz stellt sicher, dass Klassifikatoren keine personenbezogenen Daten nutzen. Durch die Verwendung von Ontologien können Klassifikatoren für verschiedene Domänen trainiert und dort ohne weitere Anpassung eingesetzt werden. Das Transfer-Lernen erfolgt sowohl durch direkte Übertragung als auch durch Anreicherung der Ontologie mit Begriffen aus der Zieldomäne. Ontologien dienen dazu, die Klassifikatoren an die Zieldomäne anzupassen, indem das Vokabular der Zieldomäne auf den Merkmalsraum des Klassifikators abgebildet wird. Ein Anwendungsfall ist die Annotation von Patientenakten in Krankenhäusern mit ICD-Codes. Die Lösung ermöglicht die Anpassung an die Fachsprache des jeweiligen Krankenhauses sowie die Konformität mit der DSGVO.