过去两年最实用的AI新功能之一,就是深度研究。如今,各大AI实验室都推出了自己的版本——OpenAI在ChatGPT中提供Deep Research,Google在Gemini中提供相应功能,Perplexity也有Deep Research,Anthropic、xAI等公司则提供名称经常变化的类似功能。它们做的事情大致相同。
你提出一个框架清晰的问题。模型会花5–30分钟自主浏览网页,阅读数十个页面、做笔记,并根据发现继续追查。最后,它会返回一份结构化报告,通常有10–30页,其中每项论断都附有引用来源。
这些报告并不完美,但远胜于你在相同时间内能完成的成果。其质量也已经足够好,以至于一小部分但确实存在的专业研究任务,如今就是用这种方式完成的。
本文将介绍如何正确使用深度研究:它擅长什么、不擅长什么,以及如何界定问题,才能得到一份有用的报告,而不是白白浪费半小时。
深度研究究竟如何工作
在后台,深度研究实际上是一个AI智能体。它收到你的问题后,会规划研究方法、执行网页搜索、阅读页面、评估来源、沿着有价值的线索继续追查,并将所有内容综合为结构化的结果。工作期间,你会看到进度指示。
一次典型的深度研究需要5–30分钟。在此期间,它可能浏览30–100个页面,并生成具备以下特点的结果:
- 结构清晰(执行摘要、各章节、结论)。
- 每项论断都附有指向所用来源的链接。
- 指出尚未解决的问题,或证据薄弱的领域。
- 有时包含表格、对比和定量摘要。
它不能做到的事情:
- 阅读专有、付费墙后或受密码保护的内容(大多数情况下)。
- 开展一手研究(访谈、调查、实验)。
- 在没有你指导的情况下,可靠地区分高质量和低质量来源。
- 在有争议或高度专业的议题上取代审慎的人类判断。
何时适合使用深度研究
以下情况适合使用深度研究:
你需要全面了解一个陌生主题。“总结EU AI Act的当前实施情况,包括实施时间表,以及对不同规模公司的义务。”
你要评估的选项需要对比大量来源。“从价格、性能、运维难度和生态支持几个方面,对比2026年适合生产环境的主流向量数据库——pgvector、Pinecone、Weaviate、Qdrant、Milvus。”
你需要了解市场或竞争格局。“绘制一份AI客户支持初创公司的市场地图,涵盖2024–2026年完成A轮或B轮融资的公司,并列出它们的差异化优势和主要客户群体。”
你想验证或反驳一个假设。“研究是否支持每周工作四天能提高生产力这一观点?找出正反双方最有力的证据。”
你正在准备一份简报。“为我准备一份关于[某公司]的单页简报,供明天开会使用——包括它们的业务、近期动态、财务状况、高管团队,以及我在会议中提出哪些话题时应当谨慎。”
这些场景的共同点是:工作的核心在于从大量来源收集并综合信息,而不是产生原创洞见。
何时不适合使用深度研究
以下情况请跳过深度研究:
你已经知道答案,或确切知道去哪里查。“爱沙尼亚的首都是什么?”或“Apple的CEO是谁?”都不需要一份耗时20分钟的报告。
问题范围狭窄而且具体。“Python列表推导式的语法是什么?”——直接问模型即可。
**你需要的信息不在网上。**例如公司的内部文档、你自己的数据,或只有私有数据库中才有的内容。深度研究无法处理这些信息(不过ChatGPT Enterprise等工具可以“基于公司已连接的数据源开展深度研究”)。
问题更多取决于你的具体处境,而不是事实。“我该不该接受这份工作?”需要的是你的判断,而不是研究报告。
**话题变化太快,报告很快就会过时。**例如股票价格、体育比分、突发新闻。此时应使用搜索。
**产出需要使用你自己的语言风格。**深度研究会以模型自身的语言风格生成报告。如果你需要一篇符合你的语言风格的文章,请把研究与写作分开,文章由你自己撰写。
如何界定深度研究问题
影响输出质量的最大单一因素,就是问题本身。有用报告与无用报告之间的差异,通常取决于你如何设定任务。
一个可靠的问题框架模板:
**目标。**我想了解什么,以及为什么想了解。
**范围。**希望包含什么;希望排除什么。
**受众。**谁会阅读结果,以及他们将如何使用。
**必要结构。**希望包含哪些章节、采用什么输出形式、是否需要表格、目标篇幅。
**质量标准。**希望优先采用哪些来源;有哪些内容需要明确核实。
**需要回答的开放问题。**按优先顺序列出希望回答的具体问题。
一个完整示例:
**目标。**我计划将公司从Salesforce迁移到更现代的CRM。我想了解,对于一家中端市场B2B SaaS公司(约150名员工,ARR约$30M),2026年有哪些切实可行的替代方案。
**范围。**重点关注在我们这个规模上可靠可用的Salesforce替代方案,不考虑小众或业余工具。排除泛泛罗列CRM的文章。纳入真实用户体验数据。
**受众。**我本人(运营负责人)和我们的CFO。我们将用这份报告确定供应商评估的范围。
必要结构。
- 一段式执行摘要
- 一张对比表,涵盖定价、关键功能、从Salesforce迁移的难易程度、生态系统
- 对每个入选供应商(前4名)提供半页简介,说明优势、劣势和最适用的客户
- “演示时应向每家供应商提出的问题”章节
- “常见迁移风险”章节
**质量标准。**优先采用G2、Reddit/HackerNews上真实用户的客户评价,以及已发布的案例研究。对供应商自己发布的对比保持怀疑。避开为SEO制作的“2026年最佳CRM”式文章。
需要回答的开放问题。
- HubSpot在我们这个规模上是否真的有竞争力,还是达到某个ARR后就难以支撑?
- 离开Salesforce的迁移在现实中是否可行——通常需要多长时间、多少成本?
- 是否有值得纳入的较新选择(2023年以后推出)?
采用这一框架开展研究,会得到一份真正有用、可直接支持决策的文档。如果只写“对比CRM”,得到的只会是一篇平庸的罗列式文章。
批判性阅读输出
深度研究的输出看起来很专业:结构清楚、来源齐全、格式规范。这本身就是一种风险,因为一份看似权威的报告很容易让人不经核查就直接信任。
一个很值得养成的习惯是:每次深度研究完成后,都花五分钟审查。
- **抽查三项论断。**点击引用,确认来源确实表达了报告所声称的内容。你很可能会发现至少一项论断被轻微曲解,或引用了模型误读的页面——迄今为止,每一种深度研究产品都存在这种故障模式。
- **寻找缺失的视角。**报告低估了哪一种观点?答案往往是“怀疑者的观点”——模型容易倾向共识,或倾向公开传播声量最大的内容。
- **检查来源。**来源是否可信?是否足够新?其中是否有低质量内容(供应商营销材料、AI生成内容、存在明显偏见的内容)?
- **留意空白。**报告遗漏了哪些你原本希望看到的内容?把它作为后续要求发送:“现在添加一个关于[缺失主题]的章节。”
这五分钟的审查,决定了你是在把深度研究当作严肃工具使用,还是只把它当作花哨的自动补全。
几种有效的模式
**两轮研究法。**第一轮深度研究范围较宽(“主要选项有哪些”)。第二轮缩小范围(“针对上一份报告中的前三个选项,深入研究定价、集成和客户支持质量”)。两次范围较窄的研究,比一次范围过宽的研究效果更好。
**怀疑者审查。**完成一次深度研究后,在新对话中让同一个模型回答:“这是一份深度研究报告。请找出其中没有得到来源充分支持的论断、所有逻辑跳跃,以及你能针对报告结论提出的最有力反驳。”这种方法能发现数量惊人的问题。
**综合提炼。**将深度研究的输出用于你自己的写作。“根据这份报告,起草一份给CFO的单页备忘录,包含我的建议和三项最大风险。”报告只是原材料;结合你的判断完成的综合成果,才是最终产物。
费用与使用权限
截至2026年,深度研究的使用权限因订阅层级而异:
- **ChatGPT Plus:**每月可使用的深度研究次数有限。
- **ChatGPT Pro:**额度高得多。
- **Claude Pro / Max:**Claude Research采用类似的分层结构。
- **Gemini Advanced:**付费Gemini方案中包含此功能。
- **Perplexity Pro:**深度研究额度充足,通常是重度用户最具成本效益的层级。
如果你没有付费订阅,Perplexity往往提供最易获得的免费或低成本深度研究。对于研究量很大的用户,综合计算后通常应根据自己的其他AI使用需求,在Perplexity Pro和ChatGPT Pro之间选择。
设定框架、审查、迭代
深度研究是现代AI最接近真正研究助理的功能。它不能取代专家判断,却能在十五分钟内完成过去需要一天的资料收集与综合工作。
认真界定问题、审查输出,再通过后续问题不断迭代。用得好,它能让你不再把时间花在“阅读50个标签页”上,而是转向“思考这50个标签页究竟说了什么”。这是研究中杠杆效应更高的部分,也是AI目前还无法替你完成的部分。



