AI不是医生——也不是急救服务
AI新手10 分钟阅读健康与就医导航

AI不是医生——也不是急救服务

一份绿/黄/红指南:通用聊天机器人在健康问题上可以安全帮什么、什么需要药剂师或临床医生、什么始终需要急救——不编造任何危机电话号码。

您应该能够做到的事情

关于你症状的、格式工整且语气自信的回答,是生成文本,不是诊断。聊天机器人没有查体、没有生命体征、没有完整病史,也没有执业许可——因此安全用途很窄;你停下来并联系真正临床医生的那条线,不是可选项。

仅在此浏览器中保存。
本文内容

若你或身边的人可能正在经历医疗紧急情况——请采用当地急救服务公布的标准,或前往最近的急诊科。不要先向聊天机器人描述情况,也不要在呼叫求助前等待聊天机器人的回复。若担忧的是心理健康危机而不是身体疾病,见AI不是心理治疗,并联系当地急救服务或IASP危机资源

通用AI聊天机器人几乎会立刻、以平静而有条理的语气回答关于症状、药物或检验结果的任何问题。正是这种流畅性,让人忍不住把它当成临床医生——也正是因此,越过相当窄的界限就会危险。模型没有听诊器、没有实验室、看不到你的病历,若答错也没有可被吊销的执照。

本文尽可能直白地画出那条线:聊天机器人可以安全帮你准备什么、什么需要药剂师或你的主治临床医生、什么始终需要急救。它写给这类事实际发生的普通时刻——夜里十一点把症状打进聊天窗口,因为诊所已关门,而担忧等不及。

为什么需要单独划线

健康问题属于人们带给通用聊天机器人的高利害话题之一,而关于结果如何的证据并不令人安心。牛津互联网研究所与牛津大学Nuffield初级保健健康科学系2026年的一项研究——迄今为止关于大语言模型用于医学建议的最大用户研究——发现:用聊天机器人梳理医生撰写的医学情景的人,在识别可能问题或正确下一步上,并不比使用普通搜索或自身判断等传统来源的人更准确;参与者往往也分不清聊天机器人质量参差的回答中哪些部分可信(Oxford Internet Institute,2026年2月Nature Medicine研究)。在标准化医学考试上得分不错的模型,一旦对话另一端是一个从残缺情景描述出发的真人,仍会出错。

另有一项2026年发表于npj Digital Medicine的研究,让医生对四款广泛使用的聊天机器人进行红队测试,使用源自健康搜索提示与医生撰写题目的222个医学问题(作者注明他们无法获取患者实际发给聊天机器人的真实消息)。视模型而定,21.6%至43.2%的回复被评为有问题,5%至13%被评为直接不安全——若被遵循,这类回答有可能造成伤害(Draelos、Afreen、Blasko等,2026)。该研究评估的是单条回复,而不是整个产品;其实践启示是:在这些工具达到足以让人依赖、而无需持证专业人员核对高利害答案的临床安全水平之前,还需要更多工作。

世界卫生组织关于大型多模态模型的伦理与治理指南,将诊断、临床护理与患者自行引导使用列为讨论中的应用,并记录了虚假、不准确、有偏见或不完整陈述的风险(WHO,2024年1月)。该指南面向政府、开发者与卫生系统——不是在写消费者自我诊断规则——但所记录的失效模式,同样直接适用于把症状清单打进聊天应用、并把回复当作已核实结论的人。

在此语境中,模型实际是什么

通用聊天机器人是用它手头的信息和工具生成一个回答。它没有做过体格检查,没有测量你的生命体征,没有确认你的病史是否完整,也不为后续随访承担责任。即便你把大量病史打进去,它也无法核实这份陈述,更无法可靠地察觉你漏掉了什么。底层机制见为什么AI有时会给出有把握的错误答案

这些并不使工具在健康素养上毫无用处,只是把风险较低的那部分角色限得很窄:整理你自己的笔记、对照来源解释通用术语、准备要问的问题。回答里出现拒绝或免责声明,并不能证明其余内容在医学上可靠。

准备 / 科普 / 专业 / 紧急 对照表

区域用例示例原因
绿——风险较低的准备就诊前整理问题,或把笔记整理成供临床医生审阅的事实摘要“把我过去三周的零散笔记整理成短清单,我可以读给医生听。”事实由你提供并核实;隐私与遗漏风险依然存在
黄——一般性科普,使用前先核实对照当前权威来源理解一个通用术语,或了解某类检验测的是什么“这个化验值一般测什么?”(不是“我的结果正不正常”)一般信息可能并不适用于你的结果、你所在实验室、你的病史、剂量或身体状况
仅限专业人员——不要在聊天里做决定诊断症状、为你比较治疗方案、更改药物或剂量、解读你的结果,或判断能不能再等任何个性化的诊断、治疗、用药或紧急程度问题联系相应的临床医生、药剂师或合格的分诊服务;时限取决于实际情况
红——立即行动任何可能符合当地急救服务所公布紧急标准的情况可能正处于紧急情况时还在问“要不要再观察看看?”不要等聊天机器人;联系当地急救服务或前往相应的急诊科

完整的医学AI边界对照表为每行补充更多示例与固定措辞,可在对话从绿滑向红时立即复用。

一个做好的绿色区示例

绿色区用法是这样:事实由你提供,模型只做整理,一切判断留在你手里。

这是我过去三周的零散笔记:[粘贴笔记,含日期]。请整理成一份简短、
事实性的时间线,我可以在两分钟内读给医生听:发生了什么、何时发生、
我想问什么。不要添加任何解读、可能原因或紧急程度——只整理我给你的内容,
用我自己的话。

注意其中明确指示了不要解读。模型仍可能主动给出猜测,因此请把输出与你的笔记逐条对照,删掉任何不是你提供的内容。

为什么黄色问题比感觉上更危险

科普性的请求可能滑向个人决定。问某个药物类别一般做什么、某个化验类别一般测什么,是背景阅读。越界发生在问题变成“我的结果正不正常”“我该为此担心吗”“这是不是意味着我有X”的那一刻。模型无从知道你的基线、你的其他疾病、你所在实验室的具体情况,也不知道你省略了哪些病史,却仍可能照样回答这个个性化问题。把这类问题带给相应的专业人员;另见用20分钟为一次就诊做准备

健康问题属于你能放进通用AI账号的最敏感文本之一。在把症状、化验值或药物名称粘贴进你不希望被无限期存储、或日后被人工审核员查看的个人聊天历史之前,见ChatGPT会记住、看到和分享什么

为什么个性化决定与紧急决定不是聊天机器人的工作

三个事实指向同一结论:

  1. 没有诊疗关系,也没有查体。 合格的临床医生在专业、机构与司法辖区各自的义务框架内工作。通用聊天不是那种照护关系,也没有做过体格检查。
  2. 恰恰在这类问题上,有一个可测量且有实际意义的失败率。 2026年的红队研究发现,四款主流聊天机器人中不安全回复占5%至13%(Draelos、Afreen、Blasko等,2026)。测试的是日常工具,且是公众在2024年九月至十二月收集回复期间可用的版本:Claude 3.5 Sonnet、Gemini 1.5 Flash、GPT-4o与Llama-3。作者注明不安全回复的比例此后可能已变化——这不等于已改善,且今天运行的版本尚未被重新测量。
  3. 无法核实你告诉它的内容,也无法察觉你漏掉了什么。 临床医生可以追问、可以看着你,或开检验。聊天机器人只有你碰巧打进去的词,无法区分完整叙述与残缺叙述。

若某个问题需要个性化判断或紧急行动,就别再依赖聊天,改走相应的途径:

  • 联系当地急救服务处理任何紧急情况——号码因国家而异;使用你所在急救系统公布的号码。
  • 致电药剂师或你的处方医生处理关于具体药物、剂量或相互作用的问题。他们能看到你多少完整记录、被允许的执业范围有多大,因国家和服务而异,因此请提供已核验的用药清单,并询问他们能给出什么建议。
  • 联系你的主治临床医生或其非工作时间热线处理可等几小时、但仍需专业判断的任何事。
  • 前往最近的急诊科,若你或其他人可能处于立即危险中。

对未达全面紧急、但仍需要真人的情况,更完整的升级阶梯见停下聊天:五种需要找真人、而不是再发一条提示的情况。若红色区问题是情绪危机、自杀念头或持续精神困扰,而不是身体症状,请切换到AI不是心理治疗中的陪伴边界——不要试图在医学信息聊天里解决那一类风险。

常见陷阱

  • 问“这可能是什么”而不是“帮我描述这件事”。 前者招来一个装扮成答案的猜测;后者让模型待在它实际擅长的范围里。
  • 把平静、详尽的语气当作准确性证据。 流畅不是正确性的可靠证据,而健康信息中的错误可能造成严重后果。
  • 用聊天机器人决定某事是否紧急。 紧急程度评估是建立在训练、且往往建立在见到患者之上的临床技能——按上述研究,不是文本预测系统能可靠完成的事。
  • 在聊天里问用药变更,而不是联系药剂师或处方医生。 合格的专业人员可以核实你提供的药物与背景信息,并告诉你哪些属于他们的执业范围;通用聊天机器人无法为这项变更承担责任。
  • 在未先核对该提供方如何处理数据的情况下,把完整记录粘贴进个人账号。

今天就试

在下一次与健康相关的聊天之前,把问题放到上表中。风险较低的准备用途,只用最少必要数据,并逐行核对。把一般性科普当作背景阅读,而不是针对你个人的判决。个性化的诊断、治疗、用药、结果解读与紧急程度问题,交给相应的合格专业人员。若可能正在发生紧急情况,立刻停下,使用当地的急救服务。

复核边界

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。