使用 AI 构建持续更新的简报或电子通讯
中级10 分钟阅读自动化

使用 AI 构建持续更新的简报或电子通讯

构建一份每日或每周自动简报:来源可追溯、采集遵守权限、质量检查明确,并具备维护循环。

您应该能够做到的事情

把AI简报当作可测量的流水线:获准使用的来源、明确筛选、带来源链接的综合、必要时的人工审核、受控分发、故障告警,以及当它不再有帮助时的退役规则。

仅在此浏览器中保存。
本文内容

当每日或每周AI简报能够检索到正确材料并保留返回来源的链接时,它可以减少重复浏览。收益与阅读时间取决于受众、覆盖范围和错误率;应当测量,而不是承诺节省多少小时。

如果做得不好,它只会变成另一封被你跳过的电子邮件。两者的差别在于架构,更重要的是持续迭代。

本文给出一套候选架构、验收标准与维护循环。简报是否值得阅读,必须在真实受众中测量。

调度细节应以当前的n8n Schedule Trigger文档为准。在通过电子邮件分发或跟踪之前,应根据真实受众和所在司法辖区核对官方规则,例如英国的电子邮件营销指南;不要把一个司法辖区的同意或软性选择加入(soft opt-in)规则照搬到另一个司法辖区。

简报的四项工作

一份实用的AI简报依次完成四项工作:

  1. 采集——从多个来源获取内容。
  2. 筛选——只保留与你的特定受众相关的内容。
  3. 综合——提炼成结构清晰、便于浏览的输出。
  4. 分发——在恰当时间发送到恰当位置。

每一项都需要单独处理。下面逐一介绍。

工作1:采集

来源是基础。无论AI环节多么巧妙,来源平庸,简报就会平庸。

常见的来源类型:

**RSS源。**当发布者提供持续维护的feed时,RSS阅读器可以在不抓取页面的情况下取得结构化更新。应验证完整性、更新时间戳、重定向与发布者条款;RSS的可用性和质量并不一致。

**获批准的新闻或搜索API。**应根据来源覆盖、许可、署名、再分发条款、保留期限、速率限制、数据位置与结构化元数据筛选提供商。产品名称和权益会变化;不要把文章中的供应商清单当作批准。

**抓取特定网站。**没有RSS或API的网站可以抓取,但要注意服务条款和robots.txt。ScrapingBee、Bright Data或Playwright等工具可以处理技术细节。

**社交媒体。**一些平台提供带访问与使用限制的官方API。不要假定界面可以抓取;应核对当前API文档、网站条款、隐私义务与再分发权利。

**新闻通讯。**将订阅内容转发到专用邮箱,然后进行处理。AI可以从电子邮件HTML中提取内容。

**内部来源。**Slack频道、内部文档、客户支持工单。对于内部简报,这些内容通常比外部来源更重要。

**研究数据库。**Semantic Scholar、arXiv、PubMed——适合偏学术的简报。

初始来源集应由主题覆盖需求和团队审核能力决定。扩展前,先跟踪各来源独有的有用条目、错误收录、重要遗漏、重复、成本与来源故障。

一种说明性的来源分层模式如下;测量覆盖情况后再替换数量:

  • **第1层(审核每个条目):**条目数量较少,审核人能够检查全部输出。
  • **第2层(经常相关):**需要透明筛选的来源。
  • **第3层(偶尔相关):**为明确的主题或事件保留,而不是为了盲目增加数量。

筛选环节(工作2)会以不同方式处理各个层级。

工作2:筛选

筛选决定哪些内容可以遗漏,也决定收录哪些内容。应同时测量错误收录与重要遗漏;更短的简报不一定更好。

以下三种方法通常结合使用:

方法1:基于关键词和元数据筛选

成本低、速度快、过程透明。筛选依据包括:

  • 标题或正文中的关键词。
  • 发布日期(过去24小时、过去一周)。
  • 来源层级。
  • 来源提供的类别或标签。

这种方法能捕捉明显相关的内容,也会遗漏隐含的相关性。

方法2:基于嵌入筛选

为每个条目计算向量嵌入,然后与代表“我关注什么”的向量进行比较(该向量可根据以往感兴趣的文章或你的兴趣描述构建)。保留相似度超过阈值的条目。

这种方法能捕捉语义相关性——即使某篇文章没有使用你的特定关键词,只要主题相关,也能发现。

方法3:基于大语言模型筛选

对于通过低成本筛选的每个项目,调用一次小型大语言模型:

你正在为面向[受众描述]的每日简报筛选内容。

根据这篇文章的标题和前300个词,按1-10分评估其与受众的相关性,并用一句话说明他们为什么可能感兴趣(或不感兴趣)。

输出JSON:{"score": <1-10>, "reason": "<一句话>"}

文章:
[标题和摘要]

保留超过阈值的条目,但阈值必须根据有代表性的人工标签校准。不要假定大语言模型筛选最准确,也不要假定7分在不同模型、提示词、来源或语言间含义稳定。

一种候选级联流程,是先使用透明的元数据或关键词筛选,再对未决条目使用嵌入或模型分类器。应在同一标注数据集上与更简单的方案比较;额外阶段可能增加延迟、成本、彼此相关的错误和遗漏。

工作3:综合

得到经审核的候选集后,综合步骤可以生成草稿。条目数量应由模型上下文、读者需求与实测遗漏风险决定,而不是套用普遍的每日范围。

一份有效的综合提示词:

你正在为[受众描述]制作每日简报。

现有[N]篇已通过相关性筛选的文章。请按照以下结构生成简报:

**前 3 条要闻。**读者必须了解的三篇文章。每篇包括:
- 一行标题(由你拟定,不要使用来源标题)
- 两句话摘要
- 来源链接
- 一句话说明“为什么这对我们的受众很重要”

**快速阅读。**另外5-8个值得简要提及的条目:
- 每项一句话
- 来源链接

**略读或跳过。**处于临界范围的项目,只列标题和链接,由读者判断是否感兴趣。

**本周趋势。**(仅限每周简报)本周各篇报道之间有何共同主题。

语气:直接,不要写开场白,也不要说“这是今天的简报”。直接进入内容。

任何超出来源材料的推断都要标记为[我的推断]。

不要编造引语或数字。如引用统计数据,请注明出自哪篇文章。

文章:
[所有已筛选文章的完整内容]

这条提示词只是在请求结构化草稿,并不能保证摘要准确、覆盖完整或排名有用。保留来源链接,并要求在分发前审核陈述、引语、数字与重要遗漏。

还有几种值得了解的变体:

  • **根据受众调整表述角度。**不同简报需要不同视角。面向工程师的简报应强调技术影响;面向高管的简报应强调商业影响;面向记者的简报应强调新闻价值。“受众描述”这一行会显著影响综合结果。

  • **主题式分区。**对于特定主题的简报(例如“AI安全新闻”),按子主题组织章节,而不是按要闻/速读/略读组织。

  • 突出来源之间的对比与矛盾。“如果多个来源报道同一事件,请指出它们在哪些方面存在分歧。”这能捕捉值得关注的冲突。

  • 校准确定性。“报道依据薄弱或不可靠时,请标记[单一来源]。”避免简报为缺乏依据的传闻背书。

工作4:分发

最后一步是分发。简报如果在错误时间发送到错误位置,还不如没有。

需要考虑的实际问题:

**发送到哪里?**选择符合访问控制、保留期限、同意、交付证据、无障碍与读者偏好的获批准渠道。电子邮件、聊天、RSS或工作区页面承担不同义务。

**何时发送?**询问读者希望在何时、何处接收简报,并考虑时区与免打扰时段,再测试交付时间。不存在普遍适用的早间窗口。

**多久一次?**根据有意义的来源数量与读者需求设定节奏。当输出反复为空、重复、陈旧或无人阅读时,应调整或暂停。

**个性化。**如果要为多位读者制作简报,可以考虑轻度个性化——针对不同角色设置不同章节,根据他们声明的兴趣提供不同的“前 3 条要闻”,并为不同来源赋予不同权重。

架构

综合以上步骤,典型的简报系统如下:

[定时触发器:每天上午6点]
    ↓
[并行获取来源:RSS、API、抓取工具]
    ↓
[去重:移除已经报道过的文章]
    ↓
[第1层筛选:全部保留]
[筛选第2-3层:关键词 + 嵌入 + 大语言模型评分]
    ↓
[按分数排序]
[根据读者需求、上下文限制、成本和遗漏测试,选取预先设定的前N项]
    ↓
[以所有项目为输入执行综合提示词]
    ↓
[分发:电子邮件 / Slack / Notion / RSS]
    ↓
[记录获批准的操作元数据与受控审核样本]

实现方式可以是自动化平台,也可以是自定义服务。应根据身份验证、来源连接器、状态、去重、可观测性、审核、分发与支持要求来决定,而不是只看受众规模。

n8n中的一套实用设置:

  1. 在批准的分发时间使用 Schedule trigger(当前n8n节点名称与调度语义取决于版本)。
  2. 为每个第1层来源配置 RSS Read 节点。
  3. 为任何自定义API配置 HTTP Request 节点。
  4. Merge 所有项目,形成单一列表。
  5. 使用 Code node,按规范化来源标识与内容哈希去重;保留窗口根据发布节奏与来源行为选择。
  6. 使用 获批准的模型或分类器节点,根据经过评估的评分契约处理每个合格条目。
  7. Filter 使用在标注评估集上校准的阈值;不要把本例中的7硬编码进去。
  8. Aggregate,将所有项目汇总成一个大上下文。
  9. 使用 获批准的模型节点 执行综合提示词。
  10. 通过 Send Email(或 Slack message、Notion)发送综合结果。

分别构建并测试每个阶段。设置时间取决于身份验证、来源格式、去重状态与分发控制。调度成功触发并不能证明简报健康;应对采集失败、空输入、模型错误、异常重复量、分发失败与异常成本发出告警。

运营纪律:让它始终值得阅读

构建简报与运营简报是两个问题。应监测读者是否使用,以及来源覆盖或综合质量是否下降;成功送达本身并不是价值证据。

以下几项运营习惯很重要:

1. 在边界明确的试点中审核每次输出

对每次试点输出都要问:哪些内容准确且有用,哪些只是填充,又遗漏了哪些重要条目?

每次只改变一个受控组件,然后重新运行标注评估。试点长度应由发布节奏和覆盖代表性问题所需的数量决定,而不是固定一个月。

2. 跟踪参与度

对于电子邮件简报,打开率和点击率可作为读者是否在使用内容的信号;对于Slack,则看回应表情和回复。个人简报只需留意:你今天读了,还是跳过了?

参与度下降意味着某些情况发生了变化:来源已经陈旧,综合结果变得空泛,或受众发生了变化。应查明原因。

3. 果断精简来源

测量每个来源独有的相关贡献、错误收录、重复、时效性、可靠性、成本与重要子主题覆盖。若一个低流量来源是某个重要领域唯一的覆盖,就不要删除它。

每季度可以做一次实用分析:针对每个来源,计算“该来源通过筛选的项目中,有多大比例进入了前 3 条?”持续无法贡献头条项目的来源应被移除。

4. 关注综合质量

大语言模型有时会发生漂移。一月份能生成优秀简报的综合提示词,到了三月份可能只会生成措辞保守、内容空泛的结果,因为底层模型可能已经更新。应定期重新测试;如果质量下降,就更新提示词。

5. 维护“跳过列表”

需要屏蔽的具体模式包括:已经反复报道的事件、某个来源惯用的标题党模式,以及伪装成分析的内容营销。“跳过列表”是一组人工维护的筛选规则,用于表达“即使通过评分也不要收录”。

6. 设置终止开关

有些日子,你所关注的主题没有发生任何重要事件。诚实的做法是不发送,或只发送一份很短的简报。将这一规则内置到系统中——“如果评分高于7的项目少于3个,则不发送完整简报”——有助于保持质量。

完整示例:AI行业简报

下面用一份AI行业新闻每日简报的说明性配置来具体展示。这不代表该简报已经实际运行,也不代表其中的内容已取得使用许可:

来源:

  • Hacker News首页(筛选AI内容)
  • a16z、Stratechery(Stratechery需要订阅,但Ben Thompson的免费文章可用)
  • Anthropic、OpenAI、Google AI、Meta AI博客源
  • The Information的AI报道(完整文章需要付费订阅,否则可使用公开摘要)
  • TechCrunch AI板块
  • arXiv cs.CL每日摘要(筛选“易于理解”的论文)
  • @karpathy、@sama、@demishassabis、@swyx的帖子(通过X API;公开的Nitter类查看器不稳定,只可作为可选来源,不能作为主要来源)
  • /r/MachineLearning每周热门帖子
  • 特定公司的官方公告页面

筛选受众描述:

一位严肃的AI从业者,会用这项技术构建产品、关注模型发布,并关心实际影响。他们对标题党、夸张炒作或“AI将毁灭世界”类内容不感兴趣。他们关注:新模型发布及其能力、具有实际意义的技术研究、商业和竞争动态、影响构建者的政策进展,以及可信人士提出的非同寻常或逆向观点。

筛选评分提示词:

请按1-10分评估这篇文章对严肃AI从业者的价值。以下情况应扣分:
- 只有夸张包装而没有实质内容。
- 没有证据的纯预测文章。
- 行业媒体转述新闻稿。
- 伪装成分析的内容营销。
- 重复已经广泛报道的重大新闻。

以下情况应加分:
- 具体技术发现或模型细节。
- 竞争动态或战略转变。
- 对构建者的实际影响。
- 可信来源提供的逆向或意外分析。

输出JSON:{"score": <1-10>, "reason": "<一句话>"}

**综合提示词:**采用前文所述的标准“前 3 条要闻 / 快速阅读 / 略读或跳过”结构,受众表述与筛选描述保持一致。

**发送方式:**当地时间上午7点发送电子邮件。

这只是一种示例格式,并不保证阅读时长或实用性。应测量打开率、来源点击、读者评分、错误收录与重要遗漏;当简报不再有帮助时,应缩短或退役。

值得借鉴的几种具体模式

**内部简报。**汇总获批准的内部来源可以形成动态概览,但也可能把员工或客户数据暴露给原受众之外的人。导入私人频道或转录内容前,应保留来源ACL、尽量减少个人数据、限制收件人,并完成隐私与安全审查。

**竞争情报简报。**跟踪竞争对手的产品公告、招聘、营销和客户评价,适合战略、销售和产品团队。

**团队技能简报。**每周汇总团队所在领域的新工具、文章和发现。较少追逐新闻,更强调“保持专业敏锐度”。

**个人投资简报。**整理你所关注的市场、公司与趋势链接。它是研究索引,不是投资建议;应在主要来源核验公司申报文件与市场数据,并就受监管或后果重大的决定咨询合格金融专业人员。

**客户之声简报。**每天处理所有客户反馈(支持工单、评价、社交媒体提及),整理成主题、意外发现和值得关注的个别案例。

这些模式采用相同架构,区别只在于来源、受众和筛选提示词。

构建完成后,根据证据调优

简报是一项持续运营的信息产品,而不是永久资产。其架构是采集、筛选、综合与分发;生产工作则包括来源许可、出处、监控、隐私、分发合规与持续评估。

为每个条目保留规范化来源URL、标题、发布者、发布日期、检索时间,以及适用时的使用权利和条款。只做摘要,不要重新发布来源正文;尊重访问控制与网站或API条款,并让法律顾问审核商业聚合产品。在欧洲向订阅者分发时,应审查适用的直接营销、GDPR和ePrivacy义务;编辑审核并不等于完成法律合规确认。

选择一个主题,定义验收样本集与停止条件,先把简报交给内部审核人,再在实测效用和故障处理达到可接受水平后扩大分发。

继续阅读

通过下一篇文章继续沿着相同的学习路径进行学习。