국내 병원 의무기록 해석 잘하는 인공지능 언어모델 개발- 한국어·영어 병기된 의무기록 동시 분석 가능한 인공지능 언어모델 국내 최초로 개발- 임상 흉부 CT 판독문 분석에서 종합정확도 0.94 달성 질병관리청(청장 임승관) 국립보건연구원(원장 남재환)은 한국어와 영어가 혼합된 국내 병원 전자의무기록을 보다 정확하게 분석하고 활용할 수 있는 한·영 이중언어 인공지능 모델을 국내 최초로 개발*하였다.
논문명: Domain and Language adaptive pre-training of BERT models for Korean-English bilingual clinical text analysis (붙임 참고) 국내 의료기관에서 생성되는 전자의무기록(Electronic Medical Record, EMR)의 약 80%는 자유서술 형태의 비정형 문서로 구성되어 있으며, 한국어와 영어 의학 용어가 혼합된 형태로 작성되어 있다. 이에 따라 단일 언어 기반 인공지능 모델을 적용할 경우 분석 정확도가 저하되는 한계가 제기되어 왔다. 이번 연구에서는 한·영 의료 어휘 체계와 말뭉치를 활용하고 추가 사전학습을 수행한 이중언어 인공지능 모델을 개발하였다. 이중언어 인공지능 모델을 의료현장에서 수집한 흉부 CT 판독문에 적용하여 다중 질환 분류 분석을 수행하였다. 그 결과, 최대 종합정확도 0.94*를 달성하여 임상 적용 가능성을 확인하였다.
종합정확도는 질환 판별의 정확도와 검출 능력을 종합적으로 평가하는 지표로, 0.9 이상일 경우 임상 활용 가능성을 검토할 수 있는 수준으로 평가됨. 국립보건연구원은 '비정형 의료 데이터 분석을 위한 인공지능 알고리즘 기술 개발 사업'을 통해 고려대학교 의과대학(연구책임자 주형준)과 함께 비정형 텍스트 의무기록 데이터 활용을 위한 연구를 수행해 왔다. 연구를 주도한 주형준 교수는 "이번 연구는 국내 임상 현장 특성을 반영한 이중언어 의료 언어모델을 구현하고, 실제 의료데이터 검증을 통해 임상 적용 가능성을 확인한 점에서 의미가 있다