拒绝用AI给人打分或排名
初级7 分钟阅读意义、伦理与能动性

拒绝用AI给人打分或排名

很容易想让AI给候选人打分、给团队排名,或评出谁是“最好的”朋友、员工或约会对象。明确的法律规定和已有记录的失败案例表明,不透明的评分会如何固化偏见、削弱问责。这里提供一份适用于日常生活与工作的拒绝清单。

您应该能够做到的事情

AI可以帮助你整理与涉及人的决策相关的标准和证据。它绝不应给出一份你随后当作最终结论的个人排名、分数或等级。一旦AI生成的数字成为区别对待某人的理由,你就已经建立了一套无法问责的评分系统——哪怕你从未这样称呼它。

仅在此浏览器中保存。
本文内容

让AI给一群人排个名,看起来只是一个实用的小捷径:哪份简历最强、哪位同事贡献最大,甚至这个月该把更多时间留给哪位朋友。一些监管机构已经对特定的自动化评分用途规定了义务或禁令,因为不透明的排名会影响人的权利与机会。

某个工具是否属于被禁止、高风险、需审计、需披露或可申诉的范畴,取决于具体系统、用途、运营者、受影响人群及所在司法辖区。不要据本文推断法律合规性。

为什么这种模式会受到特别的监管关注

欧盟《人工智能法案》(EU AI Act)禁止一类被界定的“社会评分”:基于社会行为或推断出的个人特征来评估或分类人的AI系统,且该评分导致特定形式的不利或不公正待遇(EU AI Act, Article 5(1)(c), Regulation (EU) 2024/1689)。其中的构成要件与例外情形都很重要;这并不等于说任何比较、评分表或排名都自动违法。

就业评分在某些司法管辖区受到专门规制。纽约市《地方法律第144号》对其覆盖的“自动化就业决策工具”用途规定了偏见审计、结果公布和通知义务;具体适用范围和触发条件必须对照现行规则和官方常见问题进行核对(NYC Department of Consumer and Worker Protection, Local Law 144)。这只是一项地方性制度,并非适用于所有地区或产品的通用模板。

这并非假设。路透社2018年报道称,亚马逊曾耗时数年开发一套给简历打分的内部AI招聘工具,却在2015年发现系统学会了偏向男性候选人:它会降低含有“women’s”一词的简历评分,也会降低两所女子学院毕业生的评分。原因在于训练数据来自此前十年收到的简历,而当时技术行业由男性主导。工程师尝试修复已经发现的模式,却无法确信修复后不会出现新的隐性偏见,最终放弃了该项目。知情人士告诉路透社,招聘人员看过工具的推荐;亚马逊则表示,招聘人员从未用它评估候选人(Reuters, “Amazon scraps secret AI recruiting tool that showed bias against women,” 2018)。即使是一家具备扎实机器学习能力、认真投入解决该问题的公司,偏见仍在多年的开发过程中出现,项目最终也被放弃。

为什么“只供自己用”并不会更安全

上述监管案例涉及机构,但其基本机制——模型从未经审视的历史模式中学习,给出看似可信、却暗中固化这些模式的分数——并不需要公司级系统也能造成伤害。让通用AI工具给下属排“谁最有前途”、给候选人评“谁最符合团队文化”,或在争执中判断“哪位家人更讲理”,只是在较小范围内承担同样的风险:一个听起来很有道理的数字或排名,实际反映的是模型训练数据中的模式和你的提问方式,却表现出没有核验依据的自信。缺少正式审计流程并不会消除偏见,只会拿掉原本可能发现偏见的机制。

切勿将AI生成的个人分数、排名或等级,作为对某人做出重大决定——招聘、晋升、成绩、监护或照护决定,乃至你付诸行动的非正式判断——的明示或暗示理由,除非存在可被审查、质疑与推翻的可问责人工流程。若你无法向受影响的人解释并捍卫排名背后的标准,就不要使用它。

拒绝清单

在让AI给人排名、打分或定级之前——无论是招聘、绩效评估、学业评分、牵线配对,还是任何日常情境——请逐项核对:

  1. 我是否愿意向被排名的人解释确切标准? 若诚实答案是标准模糊、不透明,或在模型给出数字之前从未真正明确过,就停下来。
  2. 是否有可问责的人对该决定负责,并能就此接受质询? 没有具名、能够作出解释的人对排名负责,无论规模大小,都是不可问责的评分系统。
  3. 我是用AI整理证据,还是让它直接给出最终结论? 整理事实、截止日期与成文标准,是合理用途。让模型据此输出“谁最好”,则不是——最终结论必须由可问责的人根据已整理的证据作出。
  4. 这种排名能否经得起审查? 日常决定不必安排正式审计,但可以问一句:“如果被仔细追问,这套排名能否站得住?”这有助于判断它是否根本就不该存在。

完整的拒绝给人排名清单分别覆盖招聘、绩效评估、学校评分与非正式日常比较,因为利害与适当保障因场景而异。

AI仍能帮忙做什么

这并不意味着AI完全不能参与涉及人员比较的准备工作。它可以帮助你:

  • 在查看任何候选人或个人之前,起草一致、具体的评估标准,降低你为迎合已经偏爱的人而临时改变标准的可能。
  • 将有据可查的证据(出勤、具体交付物、带日期的反馈)整理成便于人工审核的清晰比较格式。
  • 检查你对多人的书面评估是否使用一致的语言和标准,标出对某个人的措辞似乎突然变宽或变严之处。

它绝不应做的,是拿这些已整理材料输出一份排名清单、分数或“赢家”,再让人将其作为决策输入。在模型给出判断之后再加一道人工审核,并不会让模型不透明的排名标准变得可解释或可追责。

对于美国的就业决策,美国平等就业机会委员会(EEOC)的面向劳动者的就业歧视与AI指南是目前可用的一手起点:雇主使用AI时,联邦就业反歧视保护仍然适用。EEOC还强调,选拔标准应与工作相关、一致适用并有证据支持。这些美国规则不能决定其他地区的合法性。

这与更广泛的工作与尊严相关

拒绝让AI给人排名,是机器能做更多时,工作的尊严所讨论的更广原则的具体应用:为了维护劳动者与候选人的尊严,关于人的重大决定仍须由能够接受质询并承担责任的人作出,而不能只追求流程在技术上更快。它也与委托审查:哪些事该留在自己手里直接相关——给人排名或打分,几乎必然通不过该框架中的“后果”与“可逆性”检验:被隐藏、未经审计的分数筛掉的人,很少有机会质疑背后的推理。

一个常见误解

误解在于:一旦排名变得非正式,就更安全——关于哪位同事“最可靠”的私人笔记、心中对优先哪位朋友的打分、从未写进任何正式记录的快速AI比较。非正式去掉的是书面记录,不是机制本身。上述亚马逊案例采用正式系统,也有工程师主动寻找偏见,问题仍用了数年才浮现;非正式、未记录的排名几乎没有相应的机会暴露偏见,因为根本没有人在检查。没有正式流程并不是保障,反而去掉了原本可能发现问题的唯一机制。

今天就试一试

找出一项近期做过或即将做出的决定,其中你曾想让AI给人排名、打分或定级——对象可能是候选人、团队成员、学生,甚至是私人关系中的比较。用四问拒绝清单逐项检查。只要有一项不过关,就重构任务:用AI整理标准与证据,由你自己作出实际排名或决定,并确保能够向受影响的人解释和说明理由。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。