配套视频

为任务选择合适的模型——配套视频

文章是一份决策速查表:针对不同任务,应该选择哪家提供商、哪个档位,以及是否开启“思考”选项。下面推荐的视频展示了有人在屏幕上实际切换这些模型,让你了解一位实务工作者为何会在具体时刻选择某个模型而不是另一个。

首选视频

2:11:12
我是如何使用LLM的

Andrej Karpathy

Karpathy专门用章节讲解“留意你正在使用的模型与定价档位”和“思考模型及其适用场景”,随后在其余演示中不断切换ChatGPT、Claude、Gemini、Grok和Perplexity。这几乎相当于现场观看一位对各档位何时物有所值有明确见解的人,实际应用文章中的速查表。

您应该从中获得什么: 学会在快速、低成本、深度推理和基于来源的工具之间分配任务,而不是凡事都使用同一个模型。

先观看或了解: 能够熟练使用至少一款主流聊天机器人,并针对同一任务比较不同输出。

AI Expert 注释: 选择模型的习惯很有价值;具体的模型名称、价格、上下文限制和排名则并不稳定。在为团队制定统一建议前,请先用自己的任务重新进行比较。

打开视频页面

也值得关注

16:50
全新最强AI:Claude 3——与Gemini 1.5和GPT-4实测对比

AI Explained

这段视频早于文章(发布于2024年3月),但真正有用的是其中的方法:一位严谨的评估者让三个前沿模型并排完成相同的高难度任务——OCR、心智理论、指令遵循和数学——并准确展示每个模型在什么地方出错。模型名称已经过时,比较模型的框架却没有过时。

您应该从中获得什么: 了解一套可重复使用的结构化比较方法,以判断某个模型是否足以胜任任务。

先观看或了解: 知道Claude 3、Gemini 1.5和GPT-4已不再是前沿模型的基准。

AI Expert 注释: 请把它当作测试方法视频,而不是当前排名。具体的胜出者已成为历史;真正有用的是用相同示例进行测试、检查失败模式,并对含糊的“最佳模型”说法保持审慎。

打开视频页面