Key Takeaways
- “使用了 AI”不是完整信息。软件可能协助扫描采集、图像重建、急症排序、病灶提示、分割测量,或起草部分报告。
- 放射科医生签署的正式报告才是临床文件。患者应知道谁看过完整原始影像,以及人与软件意见不一致时怎样处理。
- 准确率只属于特定任务、人群、设备、扫描协议、阈值和软件版本;宣传页上的高数字不是通用诊断率。
- 假阴性会造成错误安心,假阳性则可能引出焦虑、复查、活检甚至不必要治疗;错误 AI 提示还可能影响医生判断 [9]。
- 必须保留完整 DICOM 和正式报告。热图、风险分或自动摘要不能取代源影像。
Content
患者可能在扫描前、扫描中或阅片后接触人工智能,却从未看到机器人或“AI 按钮”。软件可以帮助技师摆位、缩短 MRI 采集、重建低剂量 CT,把疑似脑出血检查提前到阅片队列,勾画肿瘤、比较病灶大小,或建议报告措辞。这些工具做的事不同,出错方式也不同。
中国 2025 年“人工智能+医疗卫生”实施意见提出医学影像辅助诊断、报告生成、影像质量评价和治疗方案建议等应用,同时强调安全、标准和规范使用 [1]。国家发布的应用场景指引也把多种影像功能分别列出,而不是把它们合称为自主诊断 [2]。因此,患者要问的是产品的准确任务,不是医院是否自称“AI 医院”。
常被混在一起的六类任务
任务 · 软件可能做什么 · 单靠软件不能证明什么
采集辅助 · 摆位、协议选择、运动或质量提示 · 这项检查本来是否应该做
图像重建 · 降噪、加速、低剂量相关重建 · 所有细微征象在所有设置下都被保留
工作列表分诊 · 把疑似急症检查提前 · 最终诊断,或允许患者延迟急救
检出与分类 · 标出结节、骨折、出血等目标 · 未标记就是正常,标记就一定患病
分割与测量 · 勾画器官或病灶、计算体积和变化 · 变化有临床意义,或已经达到治疗缓解
报告辅助 · 填入测量、比较旧片、生成草稿 · 已完成结合病情的核实和正式签署
一款产品可能只覆盖其中一行。肺结节检出软件不能默认同时判断肺栓塞、肺炎、乳腺、骨骼,以及同一 CT 上所有偶然发现。
从具体临床问题开始
影像检查本身仍要有合理指征。应问:
- 这项 CT、MRI、X 线、超声、乳腺摄影或 PET 要回答什么症状、诊断或治疗问题?
- 是否需要增强?有没有辐射、镇静、妊娠、肾功能、过敏、金属植入或运动风险?
- AI 用于筛查、有症状诊断、急症排序、治疗规划,还是复查?
- 产品适用的部位、疾病、年龄和图像类型是什么?
AI 插件不能让一项不必要的扫描变得必要,也不能补救选错检查、覆盖不全、摆位差、明显运动、增强时相错误或缺少旧片。
核对产品、版本和预期用途
向医院索取产品准确名称、生产企业、软件版本及它在诊疗路径中的角色。在中国作为医疗器械功能使用时,应到国家药监局数据库核对当前注册信息和预期用途 [3]。注册代表产品按特定用途接受了审查,不等于它优于所有放射科医生、所有医院或所有竞品。
还可以继续问:
- 当前版本是注册版本、医院自研工具,还是临床研究软件?
- 它是否支持本次检查使用的设备、协议和重建方式?
- 产品允许独立工作,还是只能供受训医生辅助决策?
- 上线后是否改过模型或阈值?
- 软件离线、拒绝分析或给出明显不合理结果时,医院怎样兜底?
美国 FDA 持续更新的 AI 医疗器械清单可以帮助理解这种“窄用途”:大量产品都对应具体专科、产品代码和申报,而不是获准作为通用医疗智能 [4]。FDA、加拿大卫生部和英国药械监管机构提出的透明度原则,还要求用户能理解用途、性能、限制、工作流和更新 [5]。评价中国产品时以中国注册为准,但这些问题同样值得问。
把准确率翻译成诊疗后果
敏感度是“真正有目标病变的人中,软件找到了多少”;特异度是“真正没有目标病变的人中,软件正确保持阴性的比例”。阳性和阴性预测值还受受检人群患病比例影响。疾病很少见时,即使敏感度漂亮,也可能出现许多假警报。
看到百分比前,应找到:
- 准确目标与金标准;
- 是筛查人群还是有症状人群;
- 内部测试还是外部医院验证;
- 患者人数,而不只是图片张数;
- 覆盖的设备厂家、协议和国家;
- 年龄、性别及重要亚组表现;
- 使用阈值和置信区间;
- 软件单独表现,还是医生加软件的表现;
- 回顾性数据库、真实工作流研究,还是随机试验;
- 结局是患者获益、诊断准确、阅片时间,还是工作量。
DECIDE-AI 之所以被制定,就是因为回顾性数据上表现好,并不自动等于真实诊疗获益。它要求报告临床工作流、人机因素、使用者差异、版本变化、安全性和可推广性 [7]。
一项强研究不能给所有影像 AI 背书
瑞典 MASAI 随机试验是一个“结果可喜、适用范围却很具体”的例子。2026 年对超过 10.5 万名乳腺筛查参与者的分析显示,与标准双人阅片相比,AI 辅助乳腺摄影路径的间期癌发生率达到非劣效,敏感度更高、特异度相同,同时降低阅片工作量 [8]。
该结论适用于受试的乳腺摄影工作流和人群,不能直接证明胸片检出软件、中国 CT 人群、乳腺症状门诊或新版软件同样有效。它也说明结局必须拆开:筛查发现的癌、两轮筛查之间出现的癌、敏感度、特异度和工作量回答的不是同一个问题。
AI 与医生可能一起犯错
AI 经常被称为“第二双眼睛”,但提示出现的时间、位置和置信度会改变人的注意力。一项胸片多阅片者研究发现,AI 提示错误时,放射科医生的假阳性和假阴性错误都会增加 [9],这属于自动化偏差的一种表现。
医院应明确:医生先独立阅片再看 AI,还是从一开始就显示提示;意见冲突时是否二次阅片;急症警报是否先由人确认再采取临床行动。正式报告不能悄悄把概率分变成确定诊断。
患者可以直接问:“放射科医生是否亲自看过完整原始检查,包括 AI 不负责的区域?”正常回答应当是肯定的;如果采用其他受监管工作流,也应清楚说明。
假阳性与假阴性的代价不同
假阳性可能带来复查、增强暴露、短期随访、专科转诊、活检、操作风险、费用和数周焦虑。假阴性可能延迟诊断,还可能让患者因“低风险”而忽略持续症状。
可接受的平衡取决于任务。急诊分诊可能更强调敏感度,让疑似出血尽快排到前面,同时接受更多误报;筛查项目要考虑召回和过度诊断;放疗肿瘤勾画需要几何和质量复核;低剂量重建要保留临床细节,而不只是让图像看起来更光滑。
要问清每个 AI 分类会触发什么行动、谁能推翻结果。一个没有后续处置规则的风险分数,不是诊疗计划。
可推广性可能在不知不觉中失效
当患者人群、疾病比例、设备、增强时相、采集协议、图像压缩或医院工作流与开发环境不同时,性能会漂移。儿童解剖、术后改变、植入物、少见病和多种异常同时出现,也可能在训练数据中代表不足。
软件升级同样重要。若 AI 结果实质影响了本次诊疗,应保存产品及版本。医院应监测漏诊、误报、拒绝分析、报告周转时间、不同亚组表现和升级后变化。WHO 的治理原则强调人的自主、安全、透明、问责、公平,以及上线后的持续评估 [6]。
影像病历中应保留什么
源检查是完整 DICOM,不是一张截图、JPEG、热图或 AI 标记序列。应保存:
- 原始 DICOM 和序列清单;
- 放射科医生签署的报告及补充报告;
- 用于比较的重要既往影像;
- 必要时的对比剂、剂量或采集信息;
- 关键测量值和使用的疗效标准;
- 若实质影响判断,记录 AI 产品、版本和输出;
- 临床医生依据影像作出的决定。
热图可能表示模型注意了哪里,但不是病变证据,也不一定能解释因果。如果导出叠加图,应明确标成衍生图像,避免下一家医院误当成源数据。
隐私和二次使用要分开问
临床诊断、软件质量监测、产品改进和科研不是天然相同的用途。患者应知道影像是否离开医院、是否去标识、谁会接收、保存多久、是否用于训练新模型,以及拒绝后是否影响正常医疗。国际患者还应单独了解跨境传输。
不要把 DICOM 上传到公共消费级 AI 网站。文件头和直接烧录在图像上的文字可能含姓名、日期、编号和机构信息。医院批准的安全通道和可核实接收方,比个人聊天账号更合适。
当 AI 结果与症状不一致
新发无力、剧烈头痛、可触及肿块、持续出血、呼吸困难加重等警示症状,不能因为 AI 分数低就被否定。若分歧会改变治疗,应要求放射科复核、比较旧片、补充报告或第二意见。有时需要的是另一种检查、针对性超声、纠正协议后重拍、病理或临床随访,而不是重复运行同一模型。
出现急症应立即在当地就医。自动生成的“低风险”不等于急诊通行证。
医学声明: 本文帮助患者理解和追问影像 AI,不用于解读任何扫描。只有能查看完整影像、病史和查体的合格临床人员,才能判断征象意义和下一步方案。
FAQ
每份影像报告都会显示 AI 分数吗?
不会。有些工具在采集或重建阶段后台运行,另一些只向工作人员提示或测量。应询问其结果是否改变正式报告或临床决定。
AI 没有标出异常,是否说明片子正常?
不能。产品通常只针对限定目标,也可能漏掉目标。放射科医生仍需看完整检查,并结合症状和旧片解释。
获得 NMPA 注册是否证明 AI 比放射科医生更强?
不一定。注册对应指定预期用途和证据包;是否更优取决于比较对象、任务、人群、工作流、版本和研究结局。
AI 能降低 CT 辐射剂量吗?
在规定条件下,AI 重建可支持低剂量协议,但剂量选择和诊断图像质量仍由专业人员负责。应询问本次实际扫描协议,而不是泛泛的降幅宣传。
去另一家医院做第二意见要带什么?
带完整 DICOM、正式报告和补充报告、相关旧片及临床病史。AI 热图或分数只能作为明确标注的补充材料。
Sources
- 国家卫生健康委员会——《关于促进和规范“人工智能+医疗卫生”应用发展的实施意见》
- 国家卫生健康委员会——《卫生健康行业人工智能应用场景参考指引》
- 国家药品监督管理局——医疗器械数据库
- 美国食品药品监督管理局——人工智能医疗器械清单
- FDA、加拿大卫生部与英国 MHRA——机器学习医疗器械透明度原则
- 世界卫生组织——《卫生健康人工智能伦理与治理》
- Nature Medicine——DECIDE-AI 真实临床评价报告规范
- The Lancet——MASAI 人工智能辅助乳腺筛查随机试验
- European Radiology——错误 AI 结果对胸片阅片者的影响
Image Review
- Decision: 经编辑复核后保留,复制为 hero-reviewed.png。
- Editorial note: 图中同时出现临床人员、患者、放射影像和 AI 分析符号,主题辨识度明显高于普通问诊图。但它仍是概念插图:胸片与脑部符号不是同一真实产品的连贯输出,不能描述为诊断结果、真实热图或已验证软件界面。