상세 보기
자연어 데이터 증강 기법을 활용한 노이즈 의료 데이터 딥러닝 학습 성능 개선
Improving Deep Learning Performance on Imbalanced Medical Data Using Natural Language Data Augmentation Technique
- 권태형;
- 김대호;
- 김세영;
- 정옥란
초록
본 연구에서는 한국어 간호기록 데이터를 활용하여 간호사의 의사결정을 지원하는 모델을 개발하고, 데이터 증강 기법을 적용하여 성능을 향상시키는 방안을 탐구하였다. 기존 연구들은 영어의료 데이터를 중심으로 이루어져 한국어 의료 데이터에 대한 연구가 부족한 상황이었다. 이를해결하기 위해 복부 수술 환자의 전자의무기록(EMR) 데이터를 활용하고, KoBERT 기반의 간호조치 예측 모델을 개발하였다. 또한, 데이터 불균형 문제를 완화하기 위해 Up/down sampling, Few-shot Augmentation, Back-translation, Synonym Replacement 등의 기법을 적용하고 성능을 비교분석하였다. 실험 결과, Few-shot Augmentation 기법이 가장 높은 성능을 기록하였으며, 이를 통해데이터 증강이 EMR 데이터의 다양성을 높이는 데 효과적임을 확인하였다.
키워드
Data Augmentation; Few-shot; Back-Translation; Synonym Replacement; 데이터 증강; 퓨샷 증강; 역번역; 동의어 대체
- 제목
- 자연어 데이터 증강 기법을 활용한 노이즈 의료 데이터 딥러닝 학습 성능 개선
- 제목 (타언어)
- Improving Deep Learning Performance on Imbalanced Medical Data Using Natural Language Data Augmentation Technique
- 저자
- 권태형; 김대호; 김세영; 정옥란
- 발행일
- 2025-06
- 저널명
- 한국컴퓨터정보학회논문지
- 권
- 30
- 호
- 6
- 페이지
- 11 ~ 20