模型与工具选择
在ChatGPT、Claude、Gemini、Copilot、推理模型以及托管或本地推理之间作出选择。
27 项内容 (12 篇文章 · 15 个视频)
从这里开始
浏览完整内容之前,先阅读几篇推荐文章。
6 分钟阅读ChatGPT、Claude、Gemini、Copilot——初学者应该选哪一个?
用通俗语言剖析四款主流AI助手。根据你已经在用的工具和真正希望AI带来的价值,选择第一款AI的非技术指南。
AI新手
7 分钟阅读为任务选择合适的模型:2026年决策速查表
根据任务类型选择模型。GPT、Claude、Gemini、推理模型和开放权重选项——按各自真正擅长的领域分类,并配有简单的决策规则。
初级
10 分钟阅读多模型编排:按成本、延迟和质量进行路由
所有任务都使用同一个模型是新手做法。生产AI系统会将不同请求路由到不同模型——既节省60–90%的成本,又提高质量。本文将介绍其中的模式、路由逻辑和权衡。
中级此主题下的更多内容
13 分钟阅读2026年LLM技术栈:模型、推理、工具与权衡
从一线架构师的视角梳理2026年LLM技术栈:模型层级、推理服务商、编排层、评估工具,以及交付生产级AI时真正重要的权衡。这里汇集了我们希望在起步前就有人讲清楚的一切。
高级
10 分钟阅读思维链、自我批评、思维树——何时使用哪一种
三种能切实提升AI处理难题时输出质量的推理技术,以及使用它们的成本效益账。本文提供具体提示词、并列对比,并说明现代推理模型带来的注意事项。
中级
12 分钟阅读推理成本优化:提示缓存、路由与输出控制
采用正确的技术,LLM推理成本可降低60–90%。提示缓存、模型路由、输出控制、批处理,以及一些不太为人所知的模式。本文介绍具体数字、实践模式,以及区分管理良好的推理系统与失控账单的生产纪律。
高级
13 分钟阅读2026年的微调:LoRA何时胜过RAG,以及如何不靠集群完成微调
LoRA微调已不再遥不可及——你可以在笔记本电脑上真正完成微调,也可以租用一小时GPU。本文介绍行之有效的方法、微调胜过RAG的场景,以及从数据准备到部署的实用端到端工作流。
高级
6 分钟阅读免费版与付费版ChatGPT:升级究竟能得到什么
不讲术语,对比ChatGPT免费版、ChatGPT Plus和ChatGPT Pro——升级后有哪些变化,以及如何判断自己是否真的需要升级。
AI新手
10 分钟阅读在Mac上运行本地AI:Ollama、LM Studio,以及7B模型究竟能做什么
本地运行AI已日趋成熟。借助Ollama或LM Studio和一台现代Mac,你可以离线、免费且私密地运行能力不俗的模型。本文将介绍哪些方法可行、哪些不可行,以及真正能从中受益的使用场景。
中级
10 分钟阅读推理模型提示词工程(o3、R1、Claude扩展思考)
推理模型并不是增加了额外步骤的快速模型。它们适合不同的提示方式,会忽略一些传统模式,也有自身的陷阱。本文是一份关于如何用好推理模型的实用指南。
中级
12 分钟阅读如何在提示词、RAG与微调之间选择(以及何时组合)
提示词、RAG和微调是让LLM适应你的问题的三大手段。它们各有适用和不适用的问题。本文提供选择框架、各自的实际成本,以及组合使用时效果突出的生产模式。
高级
11 分钟阅读自托管与托管推理对比:vLLM、TGI与盈亏平衡计算
自托管要达到什么规模才会胜过API调用?本文介绍实际计算、运维现实,以及区分哪些团队应该自托管、哪些团队应该继续为托管推理付费的模式。
高级
211 分钟深入解析ChatGPT等LLM
Andrej Karpathy. 这是YouTube上对大语言模型本质最清晰的端到端讲解,涵盖预训练、token化、SFT、RLHF、推理强化学习、工具使用和幻觉,详细程度足以帮助工程师分析模型权衡。完整看过一遍后,文章中的“GPT级模型、开放权重模型与推理模型”之选就不再像品牌选择,而会成为训练方案的选择。
高级
40 分钟Andrej Karpathy:软件正在再次改变
Y Combinator. Karpathy在AI Startup School的主题演讲中,将大语言模型描述为一种新型计算机——公用事业、晶圆厂和操作系统三者合一——并主张打造由人类掌控约束的“部分自主”产品。这是对文章所采用的架构层面思维模型最清晰的阐述:你是在为一种可编程基础载体选择推理供应商与工具,而不是在选择聊天机器人。
高级
19 分钟RAG会就此终结吗?Anthropic的新提示缓存
Prompt Engineering. 视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。
高级
56 分钟Build Hour:提示缓存
OpenAI. 这是OpenAI官方关于提示缓存的Build Hour,内容包括1024-token阈值、前缀稳定性要求、实时音频缓存的大幅折扣(确切费率请查看当前定价页面),以及长输入对首token延迟的影响。当你评估需要投入多少工程工作,才能让生产提示稳定命中缓存时,本视频很有帮助。
高级
157 分钟LLM模型微调:生成式AI课程
freeCodeCamp.org. 这是一门先讲理论、再写代码的长课程,涵盖量化、LoRA、QLoRA,以及在Llama 2和Gemma上进行完整的PEFT,并使用大多数开发者实际拥有的硬件。它几乎是YouTube上最接近“跟着有实战经验的人从头做一遍”的内容,还通过具体的显存预算印证了文章中“你不需要集群”的观点。
高级
59 分钟开发LLM:构建、训练与微调
Sebastian Raschka. Sebastian Raschka以较慢的节奏讲解微调在更广泛LLM训练流程中的位置,包括指令微调、分类微调、参数高效方法,以及文章在推荐LoRA前指出的各种权衡。它适合在开始前校准认知,尤其适合仍在讨论微调是否真是正确下一步的团队。
高级
15 分钟ChatGPT Plus值得订阅吗?我的2025年最新评估
Ryan Doser. Ryan逐一介绍了只有$20档位才提供的各项功能——使用上限、高级语音模式、图像和Sora限额、自定义GPT、推理模型档位——并与Claude、Gemini和Perplexity等当前的免费替代方案进行比较。由于主题范围较窄,观看次数相对较少,但这是目前最清晰、又不流于炒作的并排比较;因此,我们选择了它,而不是那些声势更大的“Plus改变了我的生活”类视频。
AI新手
19 分钟详解每一种AI模型
Tina Huang. 视频按层级清晰梳理当前的模型格局——旗舰模型、轻量模型、中档模型和专用模型——并通过具体选择说明各层级真正适合哪些任务。这对应文章中“先了解选项,再进行路由”的一半内容;Huang对成本与能力的分析方式也与文章一致,没有依赖基准测试炒作。
中级
9 分钟RouteLLM达到GPT4o质量的90%,成本还降低80%
Matthew Berman. 视频逐步讲解LMSYS的RouteLLM论文和代码:在强弱模型组合前放置一个小型分类器,由它决定调用哪个模型,最终仅用一小部分成本达到强模型约95%的质量。观看次数低于通常的100k门槛,但对于“展示真实模型路由,而不仅仅比较模型”这一具体需求,它是YouTube上最清晰的讲解,也与文章中的质量/成本权衡章节直接对应。
中级
9 分钟RAG与微调对比
IBM Technology. 视频更集中地比较团队最常混淆的两种技术,并深入讨论数据新鲜度、来源归因,以及微调在推理速度方面的优势。如果你正专门尝试说服团队不要开展不必要的微调项目,这段视频值得一看。
高级
13 分钟RAG、微调与提示工程:优化AI模型
IBM Technology. 视频通过清晰的白板讲解对比三种技术及各自的成本——检索延迟、训练算力与灾难性遗忘,以及仅靠提示的局限——并说明哪些组合在生产环境中真正合理。结尾以一套同时使用三种技术的法律AI系统为例,几乎完整对应文章中“何时组合”的论点。
高级
131 分钟我是如何使用LLM的
Andrej Karpathy. Karpathy专门用章节讲解“留意你正在使用的模型与定价档位”和“思考模型及其适用场景”,随后在其余演示中不断切换ChatGPT、Claude、Gemini、Grok和Perplexity。这几乎相当于现场观看一位对各档位何时物有所值有明确见解的人,实际应用文章中的速查表。
初级
17 分钟全新最强AI:Claude 3——与Gemini 1.5和GPT-4实测对比
AI Explained. 这段视频早于文章(发布于2024年3月),但真正有用的是其中的方法:一位严谨的评估者让三个前沿模型并排完成相同的高难度任务——OCR、心智理论、指令遵循和数学——并准确展示每个模型在什么地方出错。模型名称已经过时,比较模型的框架却没有过时。
初级
32 分钟使用vLLM与PagedAttention实现高速LLM推理服务
Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
高级
19 分钟所有AI模型详解
Tina Huang. 这是一份平实清晰的19分钟主流模型系列地图——涵盖OpenAI的GPT系列、Anthropic的Claude、Google的Gemini,以及开源领域的参与者——还会说明各系列中哪个档位值得你投入时间。文章告诉你“选一个,坚持使用一个月”;这段视频则解释你选定的产品中,下拉菜单实际提供了什么。观点坦率鲜明,却不哗众取宠。
AI新手