一盒照片、磁带或扫描文档只是原始材料,还不是完成编目的档案。AI工具可以起草转写文本、说明文字或日期假设,但速度和准确性会因媒介与工具而异。工作流程必须把机器输出与已确认的历史主张分开。
这是一种可供尝试的方法:由获批准的工具起草转写文本或用于整理档案的元数据,再由人记录同意状态、来源和可信程度。这套架构可以清楚显示尚未确认的日期,但无法阻止他人或其他系统日后删除“尚未确认”这一限定。
每条档案材料都需要的三件事
对加入档案的每张照片、每段录音、每封信件或每份文档,都要分别记录三件事。将它们混为一谈,正是家庭档案从有据可查的历史滑向笃定家族传说的原因:
- 同意:条目里有谁,每位可识别的在世者是否同意被纳入,以及在何种条件下(仅私人家庭档案,还是可更广泛分享)?
- 来源(provenance):条目来自哪里,是谁的收藏,大致在何时取得或制作,关于它的信息又由谁提供?
- 可信程度:关于条目的每项主张(日期、姓名、地点、事件)是经可靠来源确认,还是仅为估计;若是估计,依据是什么?
第1步:转写和描述时,从一开始就标出可信程度
用模型转写音频或起草照片描述时,要求它把能直接读到或听到的,与任何推断分开。
请转写这段录音[附上或粘贴音频/转写工具的
原始输出]。音频不清处,将该段标为[unclear],
不要猜测词语。不要用听起来合理的文字填补空白——
对我而言,不完整但准确的转写,比完整却部分编造的更有用。
以下是这张照片里可见内容的描述:[描述你能看到的,
或图像描述工具的输出]。请只根据已陈述内容帮我起草说明。
另行列出任何需要外部确认的内容——基于衣着风格的大致日期、
地点猜测、姓名猜测——明确标为「估计,需确认」,
不要写成事实。
要求模型识别旧照片中的人物、地点或日期时,模型可能给出听起来合理、却没有任何明显猜测标记的答案,尤其是在根据服装推测年代或辨认缺少鲜明特征的地点时。切勿把模型生成的猜测记作已确认事实。在世亲属的回忆应记录为注明讲述者、日期和依据的证词;它属于来源信息,本身并不能构成独立确认。只有符合预先定义的证据规则时,例如得到带日期的原件或独立来源佐证,才能提高一项主张的可信程度。若证词相互冲突,应保留不同说法,不要强行统一。
面部和语音处理的风险高于单纯添加说明文字。在照片应用中自动标记人脸、上传录音进行转写,或“增强”旧音频,都可能生成可被再次利用的额外副本。美国联邦贸易委员会(FTC)警告,骗子可以从网上发布的音频克隆亲属声音(FTC消费者指南)。实际可行时应优先使用本地工具;如需使用云端转写或视觉服务,应先检查保留与训练设置,把原始媒体离线保存,并且只在需求明确、当事人知情同意后才提供其语音样本。
第2步:逐项明确记录同意
凡涉及可识别在世者的照片、录音或故事,在把条目加入任何共享或可供分享的档案前,都要先记录其同意状态。不能只为整个项目取得一次同意,而应逐项记录,因为当事人对不同照片的接受程度可能不同,例如可以接受一张童年照,却不愿归档某次特定活动的照片。
请帮我起草一段简短、平实的同意问句,用来问一位家庭成员:
关于一组其中出现了他们的照片或录音,询问他们是否愿意被纳入
私人家庭档案,并另行询问是否愿意让其中任何内容被更广泛分享
(例如与远亲,或公开)。务必真正征求对方的意见,不要使用诱导性措辞。
按单个条目或一组可明确识别的条目记录对方的实际回答;若某人的意愿发生变化,应重新确认。一次“可以”并不代表对档案未来每一种用途永久同意,尤其是在受众或目的后来发生变化时。撤回同意后必须实际处理:移除或限制该条目,在共享视图中遮盖或删除能够识别当事人的信息,并在元数据中记录变更。只有在移除事项有明确责任人和完成日期时,“不被纳入的权利”才真正可执行。
第3步:儿童数据采用更严格的默认
涉及儿童的照片、录音和故事需要比成人更严格的默认设置:除非负责的成年人有合法且以儿童为中心的理由进行分享,否则应默认限制访问(仅限私人家庭档案,不公开或与更广泛的群体共享),并避免将可识别儿童的媒体上传到任何未检查其保留和训练政策的AI服务。以适合儿童年龄的方式征求儿童的意见,并随着他们成长重新审视之前的决定。联合国儿童基金会(UNICEF)目前的关于AI和儿童的指南优先考虑安全、隐私、透明度、问责制和儿童的最佳利益。在将任何涉及儿童的内容上传到通用工具之前,请先查看ChatGPT记住、看到和分享的内容。
监护责任、同意、肖像权、数据保护,以及儿童随年龄发展的判断与参与能力,会因司法辖区和具体情况而异。在创建涉及儿童、面向公众、机构、学校、照护场景或存在家庭争议的档案前,应请当地合格专业人士审查。
第4步:建立元数据架构
把转写文本、同意状态和来源信息统一放进每条材料的结构化记录中,而不是让它们零散存在于说明文字、个人记忆和单独的同意沟通里。
请帮我设计一张家庭档案元数据表,列包括:条目ID、类型
(照片/录音/文档)、日期(已确认或估计——清楚标注是哪一种)、
来源(谁的收藏、谁提供信息)、已识别人物(附可信程度:已确认/
估计/未知)、同意状态(每位可识别在世者)、以及备注。
只用我描述过的字段;未经询问不要新增元数据类别。
模型可以生成表格结构,并根据你已经掌握的信息协助填写字段;它不应凭空生成真实历史主张(姓名、日期、事件)。这些内容必须来自家庭资料来源,并注明已经确认或仍未确认。
不要让修复或上色悄悄变成编造
AI照片修复和上色工具可能让某些损坏不那么显眼,也可能添加原本不存在的细节,例如虚构的衣物图案、猜测的眼睛颜色或被改变的面部特征。应把原始扫描件与所有衍生版本一同保存,并明确标注衍生版本经过AI处理,而不是把它呈现为更准确的版本。美国国家档案馆同样建议保留数字母版和备份副本;具体格式、存储方式和保留期限应根据你的档案情况调整。这与来源追踪和水印所介绍的来源管理原则一致。
复核与后备方案
根据档案用途和家庭成员能够参与的时间设定复核节奏。出现新证据或准备对外发布前,应重新检查标为“估计,需确认”的条目。除非有明确来源支持提高可信程度,否则应保留“估计”标签。
升级规则
若家庭对“应收录什么、谁可以访问、某段故事是否准确”产生分歧,那是需要由家庭处理的决定,不是元数据问题。元数据架构可以把“有争议”记为可信程度状态,却无法解决争议本身。若分歧涉及已故亲属的故事,且不同家庭成员的记忆相互冲突,应分别记录各个版本及其来源,而不是挑选一个作为唯一正式版本。
从一组范围明确、已获同意的材料开始
先选一只鞋盒、一个文件夹或一段录音。用家庭档案元数据架构建立元数据表,取得其中所有可识别在世者的同意,并把每个由猜测得出的日期或姓名清楚标为猜测,直到有符合既定证据规则的来源予以确认。



