논문 정보
- 제목: Benchmarking Large Language Models for MIMIC-IV Clinical Note Summarization
- 저자: Amin Naemi, Ali Sahafi
- 저널: Journal of Healthcare Informatics Research (2026) 10:95–115
- DOI: 10.1007/s41666-025-00221-9
한 줄 요약
이 논문은 MIMIC-IV-Note 임상노트 30,000건을 대상으로 16개 LLM의 임상 요약 성능을 비교한 벤치마크 연구다.
결론은 명확하다. 추출 요약(extractive)에서는 Gemma-3-27B가 가장 균형 잡힌 성능을 보였고, 생성 요약(abstractive)에서는 DeepSeek-R1-70B, Qwen-3-32B, GPT-4o가 각기 다른 강점으로 상위권을 형성했다. 또한 모델이 크다고 항상 더 좋은 것은 아니며, 작은 로컬 모델도 속도와 비용 측면에서 충분히 경쟁력이 있다는 점이 핵심 메시지다.
이 논문이 중요한 이유
임상노트는 환자의 상태, 치료 과정, 약물, 검사 결과, 퇴원 계획까지 담고 있어서 의료 현장에서 매우 중요하다. 문제는 문서가 길고 복잡하다는 점이다.
이 논문은 “어떤 LLM이 실제 임상 문서 요약에 더 적합한가?”를 성능뿐 아니라 시간, 비용, 로컬 배포 가능성까지 함께 비교했다는 점에서 실무 가치가 크다.
특히 병원 환경에서는 단순한 성능 순위보다도 다음 질문이 더 중요하다.
- 가장 잘 요약하는 모델은 무엇인가?
- 로컬에서 돌릴 수 있는가?
- 속도와 비용은 감당 가능한가?
- 개인정보 규제 환경에서 쓸 수 있는가?
이 논문은 바로 이 질문들에 답하려고 한다.
연구 설계 한눈에 보기
데이터
- 데이터셋: MIMIC-IV-Note
- 원 데이터 규모: 260만 건 이상 비식별화 임상노트
- 실험 샘플: 무작위 30,000건
- 평균 노트 길이: 약 1,602단어
비교한 모델
- OpenAI: GPT-o1-mini, GPT-o3-mini, GPT-4-Turbo, GPT-4o
- DeepSeek: DeepSeek-R1-671B, DeepSeek-R1-70B
- Meta: LLaMa-3.3-70B, LLaMa-3-8B
- Google: Gemma-3-27B, Gemma-3-12B, Gemma-2-9B
- Mistral: Mixtral-8x22B, Mixtral-8x7B
- Alibaba: Qwen-2.5-32B, Qwen-3-32B, Qwen-3-8B
요약 과제
- Extractive summarization: 원문 문장을 최대한 유지하면서 핵심 문장/정보를 추출하는 방식
- Abstractive summarization: 내용을 재구성해서 더 자연스럽고 압축된 새 문장으로 요약하는 방식
프롬프트 설계 포인트
- 온도(temperature) = 0
- 임상의가 프롬프트와 결과를 검토
- AI 챗봇을 활용해 프롬프트를 반복적으로 다듬음
- 최종적으로 각 모델에 추출 요약 + 생성 요약을 모두 수행시킴
평가 지표
- Lexical overlap 중심: ROUGE-1, ROUGE-2, ROUGE-L, BLEU, METEOR
- Semantic 중심: COMET, BERTScore Precision/Recall/F1
- 실무 관점 추가 지표: 시간, 비용, 로컬 배포 가능 여부
Figure 1. 논문의 전체 워크플로

해석 포인트
- 데이터베이스(MIMIC-IV)에서 임상노트를 불러온다.
- 일부 모델은 클라우드 API로, 일부 모델은 로컬 서버에서 실행한다.
- 임상의와 AI 챗봇이 함께 프롬프트를 반복 개선한다.
- 각 모델은 최종적으로 추출 요약과 생성 요약을 모두 만든다.
이 그림의 핵심은 단순히 “모델 성능 비교”가 아니라, 실제 배포 환경까지 포함한 실험 설계라는 점이다.
핵심 결론 7가지
- Extractive summarization의 전체 최강자는 Gemma-3-27B다.
- Abstractive summarization은 단일 절대강자보다 ‘목적별 강자’가 나뉜다. DeepSeek-R1-70B, Qwen-3-32B, GPT-4o가 대표적이다.
- 대형 모델이 항상 더 좋은 결과를 내지는 않는다.
- 작은 모델도 충분히 실전적이다. LLaMa-3-8B, Gemma-2-9B 같은 모델은 빠르고 저렴하다.
- 어떤 지표를 중시하느냐에 따라 우승 모델이 달라진다.
- 병원 환경에서는 성능만큼이나 개인정보 보호와 로컬 배포 가능성이 중요하다.
- 현재 자동 평가만으로는 부족하다. 결국 임상의의 정성 평가가 필요하다.
결과 1. Extractive summarization: 누가 가장 잘 뽑아냈나
추출 요약에서는 원문 표현을 얼마나 잘 보존하면서 핵심 정보를 압축했는지가 중요하다.
이 구간에서 논문이 가장 강하게 밀어주는 모델은 Gemma-3-27B다.
왜 Gemma-3-27B가 강했나
- ROUGE-1 0.736로 최고
- ROUGE-L 0.592로 최고
- BLEU 37.258로 상위권
- METEOR 0.597로 최상위권
- BERTScore F1 0.832로 매우 높음
즉, 표면적 단어 겹침(lexical overlap)과 의미 보존(semantic fidelity)을 둘 다 잘 챙겼다.
그래서 논문은 Gemma-3-27B를 가장 균형 잡힌 extractive 모델로 해석한다.
다른 상위 모델은 무엇이 강했나
- GPT-4o: BERTScore F1 0.841로 최고 → 의미 보존력이 매우 강함
- GPT-4-Turbo: COMET 0.755로 최고 → 의미적 정확성과 문장 품질이 강점
- DeepSeek-R1-70B: ROUGE-2 0.529로 최고 → 구(phrase) 단위 보존에 강점
- Qwen-2.5-32B: BERTScore Precision 0.898로 최고 → 핵심 의미를 정밀하게 담는 데 강점
- Qwen-3-32B: BERTScore Recall 0.814로 최고 → 참조 요약의 의미를 폭넓게 커버

읽는 포인트
이 결과는 “누가 무조건 최고인가”보다도 어떤 기준으로 최고인가를 보여준다.
예를 들어, 원문 표현 보존을 중시하면 Gemma 계열이 좋고, 의미 정확성을 중시하면 GPT-4 계열이나 Qwen 계열도 매우 강력하다.
결과 2. Abstractive summarization: 누가 가장 잘 ‘재구성’했나
생성 요약은 추출 요약보다 훨씬 어렵다.
단순히 문장을 복사하는 것이 아니라, 내용을 재해석해서 더 짧고 자연스럽게 다시 써야 하기 때문이다.
그래서 이 구간은 extractive보다 우승 모델이 더 분산되어 나타난다.
이 구간의 핵심 상위권
1) DeepSeek-R1-70B
- BLEU 9.400 최고
- BERTScore Recall 0.810 최고
- BERTScore F1 0.837 최고
즉, 생성 요약이면서도 참조 요약의 의미를 넓게 잘 담고, 전체 균형도 좋다.
논문이 abstractive 쪽 대표 상위 모델로 DeepSeek-R1-70B를 강조하는 이유다.
2) Qwen-3-32B
- COMET 0.718 최고
COMET은 단순 단어 겹침보다 의미적 적합성을 잘 본다.
따라서 Qwen-3-32B는 “사람이 봤을 때 의미상 더 잘 맞는 요약” 쪽 강점이 있다고 해석할 수 있다.
3) GPT-4o
- BERTScore Precision 0.873 최고
즉, 생성한 문장이 의미적으로 정밀하다는 쪽에서 강점이 있다.
임상처럼 해석이 중요한 영역에서는 꽤 중요한 장점이다.
4) GPT-4-Turbo
- ROUGE-L 0.368 최고
- METEOR 0.313 최고
문장 구조와 유창성 측면에서 강하다.
블로그 관점으로 말하면 “읽기 좋은 생성 요약”에 강한 모델로 볼 수 있다.
5) Gemma-3-27B
- 절대 1위 지표는 많지 않지만
- BERTScore Precision/Recall/F1 = 0.867 / 0.806 / 0.835
즉, 의미적 안정성이 높고 고르게 잘한다.
논문이 Gemma-3-27B를 abstractive에서도 상위 그룹으로 본 이유다.

읽는 포인트
Extractive 점수와 Abstractive 점수는 직접 비교하면 안 된다.
생성 요약은 원문을 그대로 가져오지 않기 때문에, ROUGE나 BLEU가 낮아지는 것이 자연스럽다.
따라서 abstractive에서는 COMET, BERTScore 같은 semantic 지표를 함께 봐야 해석이 맞다.
결과 3. 시간, 비용, 배포: 실무에서는 여기서 갈린다
이 논문의 가장 좋은 점 중 하나는 성능만 보지 않았다는 것이다.
실제 병원이나 의료기관에서는 “조금 더 좋다”보다 돌릴 수 있느냐가 더 중요할 때가 많다.
빠른 로컬 모델
논문 기준, 로컬 A100(40GB) 환경에서 특히 빨랐던 모델은 다음과 같다.
- LLaMa-3-8B: 5.49초/노트
- Mixtral-8x7B: 7.83초/노트
- Gemma-2-9B: 8.04초/노트
즉, 이 세 모델은 실시간성 + 무료 + 로컬 배포라는 장점이 있다.
균형형 로컬 모델
- Gemma-3-12B: 13.56초
- Qwen-3-8B: 15.86초
- Gemma-3-27B: 22.21초
- Qwen-2.5-32B: 25.39초
- Qwen-3-32B: 37.49초
속도는 아주 빠르진 않지만, 품질과 배포성을 함께 볼 때 꽤 현실적이다.
로컬에서 매우 무거운 모델
- Mixtral-8x22B: 389.2초
- LLaMa-3.3-70B: 691.1초
- DeepSeek-R1-70B: 715.6초
즉, “성능이 좋아 보여도 단일 A100 기준 로컬 운영은 쉽지 않다”는 점을 보여준다.

클라우드 모델은 어떤가
- GPT-4o: 10.98초/노트, $0.015/노트
- GPT-4-Turbo: 18.56초/노트, $0.055/노트
- GPT-o1-mini: 52.36초/노트, $0.007/노트
- GPT-o3-mini: 46.68초/노트, $0.007/노트
- DeepSeek-R1-671B: 68.23초/노트, $0.002/노트
이 중에서 눈에 띄는 모델은 두 개다.
- GPT-4o: 가장 빠른 편이면서 의미 품질도 강하다.
- DeepSeek-R1-671B: 가장 저렴하지만 속도는 느리다.

실무 해석
- 속도 + 의미 품질이 중요하면: GPT-4o
- 로컬 + 균형형 품질이 중요하면: Gemma-3-27B
- 가장 빠른 로컬이 중요하면: LLaMa-3-8B / Gemma-2-9B / Mixtral-8x7B
- 비용 최소화 클라우드가 중요하면: DeepSeek-R1-671B
모델 선택 가이드
| 상황 | 추천 모델 | 이유 |
|---|---|---|
| 로컬 배포 + 성능 균형 | Gemma-3-27B | extractive에서 가장 강하고, abstractive에서도 의미 지표가 안정적 |
| 생성 요약 품질 우선 | DeepSeek-R1-70B, Qwen-3-32B, GPT-4o | 각각 BLEU/BERT-F1, COMET, semantic precision 쪽 강점 |
| 가장 빠른 로컬 운영 | LLaMa-3-8B, Gemma-2-9B, Mixtral-8x7B | 10초 이내 수준의 로컬 추론 |
| 클라우드에서 빠르게 쓰기 | GPT-4o | 속도와 의미 품질의 균형이 좋음 |
| 클라우드 비용 절감 | DeepSeek-R1-671B | 노트당 비용이 가장 낮음 |
| 개인정보 규제가 매우 중요 | Gemma / LLaMA / Mixtral / Qwen 계열 | 로컬 배포 가능, 오픈 모델 기반 운영 가능 |
이 논문이 던지는 가장 중요한 메시지
1) “큰 모델 = 무조건 좋은 모델”은 아니다
이 논문에서 가장 인상적인 대목 중 하나다.
매개변수가 큰 모델이 항상 이기는 것이 아니라, 작은 모델도 특정 과제에서는 충분히 경쟁력을 보여준다.
2) 병원 환경에서는 로컬 배포성이 매우 중요하다
의료 데이터는 규제와 보안 이슈가 크다.
그래서 클라우드 전용 모델이 아무리 강해도, 실제 도입에서는 로컬 오픈 모델이 더 현실적일 수 있다.
3) 자동 지표만으로는 임상 요약 품질을 다 설명할 수 없다
ROUGE, BLEU, COMET, BERTScore는 유용하지만,
실제 임상에서는 의학적 정확성, 누락 여부, 위험한 환각(hallucination)이 더 중요할 수 있다.
논문의 한계
- 대규모 clinician-annotated summary dataset이 없다.
그래서 자동 평가에 많이 의존한다. - 임상의가 프롬프트는 다듬었지만, 생성 결과를 체계적으로 대규모 평가하지는 않았다.
- 자동 지표가 의료 맥락의 정확성을 완전히 반영하지 못한다.
- 로컬 추론 성능은 사용한 하드웨어 환경에 크게 좌우된다.
즉, 다른 GPU/서버 구성에서는 시간이 달라질 수 있다.
요약
이 논문은 MIMIC-IV-Note 임상노트 3만 건을 대상으로 OpenAI, DeepSeek, Meta, Google, Mistral, Alibaba 계열의 16개 LLM을 비교한 연구다. 추출 요약에서는 Gemma-3-27B가 가장 균형 잡힌 성능을 보였고, 생성 요약에서는 DeepSeek-R1-70B, Qwen-3-32B, GPT-4o가 각기 다른 강점으로 상위권을 차지했다. 특히 이 연구가 중요한 이유는 단순한 품질 비교를 넘어 시간, 비용, 로컬 배포 가능성까지 함께 평가했다는 점이다. 결론적으로 의료 환경에서는 “가장 큰 모델”보다 “품질·속도·보안 제약에 맞는 모델”을 고르는 것이 더 중요하다는 메시지를 준다.
강조 포인트
- Extractive에서는 Gemma-3-27B
- Abstractive에서는 목적별 강자 분화
- GPT-4o는 빠르고 의미 품질이 좋음
- 작은 로컬 모델도 생각보다 강함
- 의료에서는 성능보다 배포 조건이 더 중요할 수 있음
- 향후엔 clinician-in-the-loop 평가가 반드시 필요함
출처 및 활용 메모
- 본 문서는 논문 내용을 한국어로 핵심 정리한 2차 문서다.
- Figure 1은 논문 원본의 워크플로 그림을 페이지에서 직접 crop해 포함했다.
- Figure 2~5는 논문의 Table 1~3 수치를 바탕으로 재구성한 시각자료다.
- 원 논문은 본문에 명시된 바와 같이 CC BY 4.0 오픈액세스 라이선스를 따른다.
원문 인용 정보
Naemi, A., & Sahafi, A. Benchmarking Large Language Models for MIMIC-IV Clinical Note Summarization. Journal of Healthcare Informatics Research, 10, 95–115. https://doi.org/10.1007/s41666-025-00221-9
'AI 생성 글 정리 > medical' 카테고리의 다른 글
| AI agent in healthcare 논문 정리 (0) | 2026.05.18 |
|---|---|
| Accurate discharge summary generation using fine tuned large language models with self evaluation 논문 핵심 정리 (0) | 2026.04.07 |
| Automated generation of discharge summaries 정리 (0) | 2026.04.06 |
| EHRNoteQA 논문 핵심 정리 (0) | 2026.04.06 |
| MEDOPENCLAW 논문 정리: 정적 2D를 넘어 전체 검사를 읽는 의료영상 에이전트 (1) | 2026.03.31 |