若你或身边的人可能正在经历医疗紧急情况——请采用当地急救服务公布的标准,或前往最近的急诊科。不要先向聊天机器人描述情况,也不要在呼叫求助前等待聊天机器人的回复。若担忧的是心理健康危机而不是身体疾病,见AI不是心理治疗,并联系当地急救服务或IASP危机资源。
通用AI聊天机器人几乎会立刻、以平静而有条理的语气回答关于症状、药物或检验结果的任何问题。正是这种流畅性,让人忍不住把它当成临床医生——也正是因此,越过相当窄的界限就会危险。模型没有听诊器、没有实验室、看不到你的病历,若答错也没有可被吊销的执照。
本文尽可能直白地画出那条线:聊天机器人可以安全帮你准备什么、什么需要药剂师或你的主治临床医生、什么始终需要急救。它写给这类事实际发生的普通时刻——夜里十一点把症状打进聊天窗口,因为诊所已关门,而担忧等不及。
为什么需要单独划线
健康问题属于人们带给通用聊天机器人的高利害话题之一,而关于结果如何的证据并不令人安心。牛津互联网研究所与牛津大学Nuffield初级保健健康科学系2026年的一项研究——迄今为止关于大语言模型用于医学建议的最大用户研究——发现:用聊天机器人梳理医生撰写的医学情景的人,在识别可能问题或正确下一步上,并不比使用普通搜索或自身判断等传统来源的人更准确;参与者往往也分不清聊天机器人质量参差的回答中哪些部分可信(Oxford Internet Institute,2026年2月;Nature Medicine研究)。在标准化医学考试上得分不错的模型,一旦对话另一端是一个从残缺情景描述出发的真人,仍会出错。
另有一项2026年发表于npj Digital Medicine的研究,让医生对四款广泛使用的聊天机器人进行红队测试,使用源自健康搜索提示与医生撰写题目的222个医学问题(作者注明他们无法获取患者实际发给聊天机器人的真实消息)。视模型而定,21.6%至43.2%的回复被评为有问题,5%至13%被评为直接不安全——若被遵循,这类回答有可能造成伤害(Draelos、Afreen、Blasko等,2026)。该研究评估的是单条回复,而不是整个产品;其实践启示是:在这些工具达到足以让人依赖、而无需持证专业人员核对高利害答案的临床安全水平之前,还需要更多工作。
世界卫生组织关于大型多模态模型的伦理与治理指南,将诊断、临床护理与患者自行引导使用列为讨论中的应用,并记录了虚假、不准确、有偏见或不完整陈述的风险(WHO,2024年1月)。该指南面向政府、开发者与卫生系统——不是在写消费者自我诊断规则——但所记录的失效模式,同样直接适用于把症状清单打进聊天应用、并把回复当作已核实结论的人。
在此语境中,模型实际是什么
通用聊天机器人是用它手头的信息和工具生成一个回答。它没有做过体格检查,没有测量你的生命体征,没有确认你的病史是否完整,也不为后续随访承担责任。即便你把大量病史打进去,它也无法核实这份陈述,更无法可靠地察觉你漏掉了什么。底层机制见为什么AI有时会给出有把握的错误答案。
这些并不使工具在健康素养上毫无用处,只是把风险较低的那部分角色限得很窄:整理你自己的笔记、对照来源解释通用术语、准备要问的问题。回答里出现拒绝或免责声明,并不能证明其余内容在医学上可靠。
准备 / 科普 / 专业 / 紧急 对照表
| 区域 | 用例 | 示例 | 原因 |
|---|---|---|---|
| 绿——风险较低的准备 | 就诊前整理问题,或把笔记整理成供临床医生审阅的事实摘要 | “把我过去三周的零散笔记整理成短清单,我可以读给医生听。” | 事实由你提供并核实;隐私与遗漏风险依然存在 |
| 黄——一般性科普,使用前先核实 | 对照当前权威来源理解一个通用术语,或了解某类检验测的是什么 | “这个化验值一般测什么?”(不是“我的结果正不正常”) | 一般信息可能并不适用于你的结果、你所在实验室、你的病史、剂量或身体状况 |
| 仅限专业人员——不要在聊天里做决定 | 诊断症状、为你比较治疗方案、更改药物或剂量、解读你的结果,或判断能不能再等 | 任何个性化的诊断、治疗、用药或紧急程度问题 | 联系相应的临床医生、药剂师或合格的分诊服务;时限取决于实际情况 |
| 红——立即行动 | 任何可能符合当地急救服务所公布紧急标准的情况 | 可能正处于紧急情况时还在问“要不要再观察看看?” | 不要等聊天机器人;联系当地急救服务或前往相应的急诊科 |
完整的医学AI边界对照表为每行补充更多示例与固定措辞,可在对话从绿滑向红时立即复用。
一个做好的绿色区示例
绿色区用法是这样:事实由你提供,模型只做整理,一切判断留在你手里。
这是我过去三周的零散笔记:[粘贴笔记,含日期]。请整理成一份简短、
事实性的时间线,我可以在两分钟内读给医生听:发生了什么、何时发生、
我想问什么。不要添加任何解读、可能原因或紧急程度——只整理我给你的内容,
用我自己的话。
注意其中明确指示了不要解读。模型仍可能主动给出猜测,因此请把输出与你的笔记逐条对照,删掉任何不是你提供的内容。
为什么黄色问题比感觉上更危险
科普性的请求可能滑向个人决定。问某个药物类别一般做什么、某个化验类别一般测什么,是背景阅读。越界发生在问题变成“我的结果正不正常”“我该为此担心吗”“这是不是意味着我有X”的那一刻。模型无从知道你的基线、你的其他疾病、你所在实验室的具体情况,也不知道你省略了哪些病史,却仍可能照样回答这个个性化问题。把这类问题带给相应的专业人员;另见用20分钟为一次就诊做准备。
健康问题属于你能放进通用AI账号的最敏感文本之一。在把症状、化验值或药物名称粘贴进你不希望被无限期存储、或日后被人工审核员查看的个人聊天历史之前,见ChatGPT会记住、看到和分享什么。
为什么个性化决定与紧急决定不是聊天机器人的工作
三个事实指向同一结论:
- 没有诊疗关系,也没有查体。 合格的临床医生在专业、机构与司法辖区各自的义务框架内工作。通用聊天不是那种照护关系,也没有做过体格检查。
- 恰恰在这类问题上,有一个可测量且有实际意义的失败率。 2026年的红队研究发现,四款主流聊天机器人中不安全回复占5%至13%(Draelos、Afreen、Blasko等,2026)。测试的是日常工具,且是公众在2024年九月至十二月收集回复期间可用的版本:Claude 3.5 Sonnet、Gemini 1.5 Flash、GPT-4o与Llama-3。作者注明不安全回复的比例此后可能已变化——这不等于已改善,且今天运行的版本尚未被重新测量。
- 无法核实你告诉它的内容,也无法察觉你漏掉了什么。 临床医生可以追问、可以看着你,或开检验。聊天机器人只有你碰巧打进去的词,无法区分完整叙述与残缺叙述。
若某个问题需要个性化判断或紧急行动,就别再依赖聊天,改走相应的途径:
- 联系当地急救服务处理任何紧急情况——号码因国家而异;使用你所在急救系统公布的号码。
- 致电药剂师或你的处方医生处理关于具体药物、剂量或相互作用的问题。他们能看到你多少完整记录、被允许的执业范围有多大,因国家和服务而异,因此请提供已核验的用药清单,并询问他们能给出什么建议。
- 联系你的主治临床医生或其非工作时间热线处理可等几小时、但仍需专业判断的任何事。
- 前往最近的急诊科,若你或其他人可能处于立即危险中。
对未达全面紧急、但仍需要真人的情况,更完整的升级阶梯见停下聊天:五种需要找真人、而不是再发一条提示的情况。若红色区问题是情绪危机、自杀念头或持续精神困扰,而不是身体症状,请切换到AI不是心理治疗中的陪伴边界——不要试图在医学信息聊天里解决那一类风险。
常见陷阱
- 问“这可能是什么”而不是“帮我描述这件事”。 前者招来一个装扮成答案的猜测;后者让模型待在它实际擅长的范围里。
- 把平静、详尽的语气当作准确性证据。 流畅不是正确性的可靠证据,而健康信息中的错误可能造成严重后果。
- 用聊天机器人决定某事是否紧急。 紧急程度评估是建立在训练、且往往建立在见到患者之上的临床技能——按上述研究,不是文本预测系统能可靠完成的事。
- 在聊天里问用药变更,而不是联系药剂师或处方医生。 合格的专业人员可以核实你提供的药物与背景信息,并告诉你哪些属于他们的执业范围;通用聊天机器人无法为这项变更承担责任。
- 在未先核对该提供方如何处理数据的情况下,把完整记录粘贴进个人账号。
今天就试
在下一次与健康相关的聊天之前,把问题放到上表中。风险较低的准备用途,只用最少必要数据,并逐行核对。把一般性科普当作背景阅读,而不是针对你个人的判决。个性化的诊断、治疗、用药、结果解读与紧急程度问题,交给相应的合格专业人员。若可能正在发生紧急情况,立刻停下,使用当地的急救服务。



