Large language models in healthcare: applications, evaluation frameworks, and governance pathways — a scoping review and multidimensional framework
João C. Ferreira · Isabel Rosa
综述医疗大模型应用,提出多维评估与治理框架。
范围综述,检索7大数据库及灰色文献,主题分析78项研究。
应用分五域,证据多为基准测试,缺前瞻性嵌入评估,风险含幻觉与偏见。
医疗LLM评估治理框架可迁移至农业大模型,填补农业场景前瞻性验证空白。
该文为医疗领域大语言模型的范围综述,与三农、农业信息化、智慧农业等主题无关,不予入选。
背景 大语言模型(Large Language Models, LLMs)在医疗健康领域的应用评估日益增多,涵盖临床文档、决策支持、患者沟通、研究辅助和运营工作流程。尽管应用兴趣迅速增长,但证据仍呈现异质性,评估与治理的标准化方法尚未得到一致应用。目的 梳理大语言模型在医疗健康领域的应用,综合已报告的结局与风险,并提出面向数字健康实施的多维评估与治理框架。方法 按照Arksey和O'Malley、Levac等人以及乔安娜布里格斯研究所的方法学指导开展范围综述,报告遵循PRISMA-ScR清单。研究方案已在开放科学框架(Open Science Framework)前瞻性注册(https://doi.org/10.17605/OSF.IO/SWP78)。检索在PubMed/MEDLINE、Embase、Scopus、Web of Science、IEEE Xplore、ACM Digital Library和ACL Anthology中进行,并补充检索medRxiv/bioRxiv预印本以及世界卫生组织(WHO)、美国食品药品监督管理局(FDA)和欧盟人工智能办公室(EU AI-Office)指南的灰色文献,覆盖2019年1月1日至2026年4月30日。标题/摘要和全文筛选由两人独立完成;评分者间一致性为Cohen's κ = 0.78。数据采用经预试验的表格由两人独立提取。综合采用Braun和Clarke的六阶段反思性主题分析法。78项纳入研究的完整列表见补充文件S4。结果 78项研究符合纳入标准;68%发表于2023年至2025年间。识别出五个应用领域:(1)临床文档与摘要生成;(2)临床决策支持与推理辅助;(3)患者沟通与健康素养支持;(4)生物医学研究与知识综合;(5)行政与运营用例。证据基础以基准测试和模拟工作流程研究为主(89%),前瞻性嵌入工作流程的评估有限(11%)。已报告的获益集中在文档效率、文本质量和知识综合方面;与安全相关的风险包括幻觉内容、临床关键信息遗漏、人口统计学偏倚、隐私漏洞、可解释性有限和自动化偏倚。研究在地理上集中于北美和东亚,撒哈拉以南非洲、南亚和拉丁美洲的代表性有限。结论 Cu