配套视频

上下文工程:管理100万token的窗口,同时避免上下文退化——配套视频

文章探讨的是“模型支持1M token”与“模型能可靠使用1M token”之间的差距。它逐一分析故障模式、上下文工程的四项操作(写入、选择、压缩、隔离),以及让长时间运行的会话保持可用的预算。这两段视频依次给出了对问题最清晰的陈述和最清晰的一组解决方案。

首选视频

7:56
上下文退化:输入令牌增加如何影响LLM性能

Chroma

Kelly Hong讲解Chroma对18个模型的研究:为什么大海捞针测试的分数会产生误导;性能如何随歧义和干扰项增加而下降;为什么即使是简单的字符串重复任务,也会在超过500个token后出现性能衰减。内容简短、以证据为基础,恰好说明了为什么在进入工程解决方案之前,你必须认真对待文章所讨论的问题。

您应该从中获得什么: 理解长上下文在存在歧义和干扰项时如何失效,并围绕这种风险设计测试。

先观看或了解: 除基本LLM术语外没有其他要求;这是一场简短的研究演讲。

AI Expert 注释: 模型名称、价格和能力变化很快。用它学习决策方法,然后在采用前验证当前模型的实际表现。

打开视频页面

也值得关注

22:06
面向智能体的上下文工程

LangChain

Lance Martin提出“写入、选择、压缩、隔离”框架,并用具体示例说明何时总结操作历史、何时将状态转存到文件,以及何时仅仅为了保护父智能体的上下文而启动子智能体。这几乎直接对应文章中关于如何在实践中管理1M-token窗口的章节。

您应该从中获得什么: 应用写入、选择、压缩和隔离模式,有意识地管理智能体上下文。

先观看或了解: 具备构建或运营使用长时间上下文的智能体经验。

AI Expert 注释: 模型名称、价格和能力变化很快。用它学习决策方法,然后在采用前验证当前模型的实际表现。

打开视频页面