AI 챗봇이 환자 치료에서 가능성을 보이다

xtalfi

10.22 16:09

(퍼플렉시티가 정리한 기사)

대규모 언어 모델은 의료 분야 애플리케이션에서 상당한 잠재력을 보여주고 있으며, 최근 연구들은 환자 교육 및 임상 워크플로우를 향상시킬 수 있는 능력을 보여주는 동시에 신중한 고려가 필요한 중요한 한계점들을 드러내고 있습니다.

중재적 영상의학 교육에서의 우수한 성과

CVIR Endovascular에 10월 13일 게재된 연구에 따르면, DeepSeek-V3와 ChatGPT-4o는 복잡한 중재적 영상의학 시술에 관한 환자 질문에 답변하는 데 있어 우수한 성능을 보였습니다. 베를린 샤리테 의과대학(Charité-Universitätsmedizin Berlin) 연구진은 경동맥 관절주위 색전술(TAPE), CT 유도 고선량률 근접치료, 블레오마이신 전기경화요법 시술과 관련된 107개의 질문에 대해 4개의 LLM을 평가했습니다.

DeepSeek-V3는 BEST 질문(4.49점)과 CT-HDR 근접치료 질문(4.24점)에서 가장 높은 평균 점수를 달성했으며, TAPE 관련 질문에서는 ChatGPT-4o와 비슷한 성능을 보였습니다. 그러나 의학적으로 사전 훈련된 모델인 OpenBioLLM-8b와 BioMistral-7b는 훨씬 낮은 성능을 보였으며, BioMistral-7b는 방사선 노출에 관한 잠재적으로 위험한 정보를 제공했습니다.

종양학에서 안전한 AI 구현을 위한 첫 번째 지침

10월 20일, 유럽종양학회(European Society for Medical Oncology)는 대규모 언어 모델(LLM)을 암 치료에 안전하게 통합하기 위한 최초의 구조화된 지침을 발표했습니다. ESMO의 임상 진료에서 대규모 언어 모델 사용에 관한 지침(ELCAP)은 특정 안전 요구사항을 갖춘 세 가지 범주의 AI 응용 프로그램을 설정합니다.

챗봇과 같은 환자 대면 도구는 명시적인 에스컬레이션 경로와 함께 감독 하에 운영되어야 합니다. 임상의 대면 도구는 공식적인 검증과 투명한 한계를 요구합니다. 전자 건강 기록과 통합된 배경 기관 시스템은 지속적인 모니터링과 기관 거버넌스가 필요합니다.

ESMO 회장 Fabrice André는 "혁신은 종양학자들과 궁극적으로 환자들에게 도움이 되어야 하며, 그들을 혼란스럽게 하거나 오도해서는 안 됩니다"라고 말했습니다. 이 지침은 LLM이 임상 의사결정을 대체하는 것이 아니라 향상시켜야 한다는 점을 강조합니다.

더 광범위한 의료 응용 분야에서 엇갈린 결과 보여

최근 비교 연구들은 의료 전문 분야별로 다양한 성능을 보여줍니다. 2025년에 발표된 연구에 따르면 DeepSeek-V3는 복강경 담낭절제술 환자 교육에 있어 ChatGPT-4o보다 더 적합한 응답을 제공했으며, 질문의 95%에서 5점 만점 평가를 받은 반면 ChatGPT-4o는 65%를 기록했습니다. 그러나 10월 16일 발표된 Mass General Brigham 연구에서는 LLM이 의료 맥락에서 정확성보다 유용성을 우선시한다는 것을 발견했습니다.

연구 결과는 LLM이 환자 교육과 임상 업무 지원에 있어 가능성을 보여주지만, 아직 포괄적인 의료 상담을 대체할 수는 없다는 것을 나타냅니다. 향후 연구에서는 실제 임상 환경에서 이러한 결과를 검증하고 안전한 구현을 보장하기 위해 환자 피드백을 통합해야 합니다.