主题

模型与工具选择

在ChatGPT、Claude、Gemini、Copilot、推理模型以及托管或本地推理之间作出选择。

27 项内容 (12 篇文章 · 15 个视频)

从这里开始

浏览完整内容之前,先阅读几篇推荐文章。

此主题下的更多内容

13 分钟阅读
文章

2026年LLM技术栈:模型、推理、工具与权衡

从一线架构师的视角梳理2026年LLM技术栈:模型层级、推理服务商、编排层、评估工具,以及交付生产级AI时真正重要的权衡。这里汇集了我们希望在起步前就有人讲清楚的一切。

高级
10 分钟阅读
文章

思维链、自我批评、思维树——何时使用哪一种

三种能切实提升AI处理难题时输出质量的推理技术,以及使用它们的成本效益账。本文提供具体提示词、并列对比,并说明现代推理模型带来的注意事项。

中级
12 分钟阅读
文章

推理成本优化:提示缓存、路由与输出控制

采用正确的技术,LLM推理成本可降低60–90%。提示缓存、模型路由、输出控制、批处理,以及一些不太为人所知的模式。本文介绍具体数字、实践模式,以及区分管理良好的推理系统与失控账单的生产纪律。

高级
13 分钟阅读
文章

2026年的微调:LoRA何时胜过RAG,以及如何不靠集群完成微调

LoRA微调已不再遥不可及——你可以在笔记本电脑上真正完成微调,也可以租用一小时GPU。本文介绍行之有效的方法、微调胜过RAG的场景,以及从数据准备到部署的实用端到端工作流。

高级
6 分钟阅读
文章

免费版与付费版ChatGPT:升级究竟能得到什么

不讲术语,对比ChatGPT免费版、ChatGPT Plus和ChatGPT Pro——升级后有哪些变化,以及如何判断自己是否真的需要升级。

AI新手
10 分钟阅读
文章

在Mac上运行本地AI:Ollama、LM Studio,以及7B模型究竟能做什么

本地运行AI已日趋成熟。借助Ollama或LM Studio和一台现代Mac,你可以离线、免费且私密地运行能力不俗的模型。本文将介绍哪些方法可行、哪些不可行,以及真正能从中受益的使用场景。

中级
10 分钟阅读
文章

推理模型提示词工程(o3、R1、Claude扩展思考)

推理模型并不是增加了额外步骤的快速模型。它们适合不同的提示方式,会忽略一些传统模式,也有自身的陷阱。本文是一份关于如何用好推理模型的实用指南。

中级
12 分钟阅读
文章

如何在提示词、RAG与微调之间选择(以及何时组合)

提示词、RAG和微调是让LLM适应你的问题的三大手段。它们各有适用和不适用的问题。本文提供选择框架、各自的实际成本,以及组合使用时效果突出的生产模式。

高级
11 分钟阅读
文章

自托管与托管推理对比:vLLM、TGI与盈亏平衡计算

自托管要达到什么规模才会胜过API调用?本文介绍实际计算、运维现实,以及区分哪些团队应该自托管、哪些团队应该继续为托管推理付费的模式。

高级
211 分钟
视频

深入解析ChatGPT等LLM

Andrej Karpathy. 这是YouTube上对大语言模型本质最清晰的端到端讲解,涵盖预训练、token化、SFT、RLHF、推理强化学习、工具使用和幻觉,详细程度足以帮助工程师分析模型权衡。完整看过一遍后,文章中的“GPT级模型、开放权重模型与推理模型”之选就不再像品牌选择,而会成为训练方案的选择。

高级
40 分钟
视频

Andrej Karpathy:软件正在再次改变

Y Combinator. Karpathy在AI Startup School的主题演讲中,将大语言模型描述为一种新型计算机——公用事业、晶圆厂和操作系统三者合一——并主张打造由人类掌控约束的“部分自主”产品。这是对文章所采用的架构层面思维模型最清晰的阐述:你是在为一种可编程基础载体选择推理供应商与工具,而不是在选择聊天机器人。

高级
19 分钟
视频

RAG会就此终结吗?Anthropic的新提示缓存

Prompt Engineering. 视频将Anthropic的提示缓存与Gemini的上下文缓存进行比较,并针对长文档聊天、少样本和多轮对话等用例给出具体的延迟与成本降幅。对缓存写入附加费与缓存读取折扣的拆解,正是文章讨论缓存何时划算时所采用的基础。

高级
56 分钟
视频

Build Hour:提示缓存

OpenAI. 这是OpenAI官方关于提示缓存的Build Hour,内容包括1024-token阈值、前缀稳定性要求、实时音频缓存的大幅折扣(确切费率请查看当前定价页面),以及长输入对首token延迟的影响。当你评估需要投入多少工程工作,才能让生产提示稳定命中缓存时,本视频很有帮助。

高级
157 分钟
视频

LLM模型微调:生成式AI课程

freeCodeCamp.org. 这是一门先讲理论、再写代码的长课程,涵盖量化、LoRA、QLoRA,以及在Llama 2和Gemma上进行完整的PEFT,并使用大多数开发者实际拥有的硬件。它几乎是YouTube上最接近“跟着有实战经验的人从头做一遍”的内容,还通过具体的显存预算印证了文章中“你不需要集群”的观点。

高级
59 分钟
视频

开发LLM:构建、训练与微调

Sebastian Raschka. Sebastian Raschka以较慢的节奏讲解微调在更广泛LLM训练流程中的位置,包括指令微调、分类微调、参数高效方法,以及文章在推荐LoRA前指出的各种权衡。它适合在开始前校准认知,尤其适合仍在讨论微调是否真是正确下一步的团队。

高级
15 分钟
视频

ChatGPT Plus值得订阅吗?我的2025年最新评估

Ryan Doser. Ryan逐一介绍了只有$20档位才提供的各项功能——使用上限、高级语音模式、图像和Sora限额、自定义GPT、推理模型档位——并与Claude、Gemini和Perplexity等当前的免费替代方案进行比较。由于主题范围较窄,观看次数相对较少,但这是目前最清晰、又不流于炒作的并排比较;因此,我们选择了它,而不是那些声势更大的“Plus改变了我的生活”类视频。

AI新手
19 分钟
视频

详解每一种AI模型

Tina Huang. 视频按层级清晰梳理当前的模型格局——旗舰模型、轻量模型、中档模型和专用模型——并通过具体选择说明各层级真正适合哪些任务。这对应文章中“先了解选项,再进行路由”的一半内容;Huang对成本与能力的分析方式也与文章一致,没有依赖基准测试炒作。

中级
9 分钟
视频

RouteLLM达到GPT4o质量的90%,成本还降低80%

Matthew Berman. 视频逐步讲解LMSYS的RouteLLM论文和代码:在强弱模型组合前放置一个小型分类器,由它决定调用哪个模型,最终仅用一小部分成本达到强模型约95%的质量。观看次数低于通常的100k门槛,但对于“展示真实模型路由,而不仅仅比较模型”这一具体需求,它是YouTube上最清晰的讲解,也与文章中的质量/成本权衡章节直接对应。

中级
9 分钟
视频

RAG与微调对比

IBM Technology. 视频更集中地比较团队最常混淆的两种技术,并深入讨论数据新鲜度、来源归因,以及微调在推理速度方面的优势。如果你正专门尝试说服团队不要开展不必要的微调项目,这段视频值得一看。

高级
13 分钟
视频

RAG、微调与提示工程:优化AI模型

IBM Technology. 视频通过清晰的白板讲解对比三种技术及各自的成本——检索延迟、训练算力与灾难性遗忘,以及仅靠提示的局限——并说明哪些组合在生产环境中真正合理。结尾以一套同时使用三种技术的法律AI系统为例,几乎完整对应文章中“何时组合”的论点。

高级
131 分钟
视频

我是如何使用LLM的

Andrej Karpathy. Karpathy专门用章节讲解“留意你正在使用的模型与定价档位”和“思考模型及其适用场景”,随后在其余演示中不断切换ChatGPT、Claude、Gemini、Grok和Perplexity。这几乎相当于现场观看一位对各档位何时物有所值有明确见解的人,实际应用文章中的速查表。

初级
17 分钟
视频

全新最强AI:Claude 3——与Gemini 1.5和GPT-4实测对比

AI Explained. 这段视频早于文章(发布于2024年3月),但真正有用的是其中的方法:一位严谨的评估者让三个前沿模型并排完成相同的高难度任务——OCR、心智理论、指令遵循和数学——并准确展示每个模型在什么地方出错。模型名称已经过时,比较模型的框架却没有过时。

初级
32 分钟
视频

使用vLLM与PagedAttention实现高速LLM推理服务

Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。

高级
19 分钟
视频

所有AI模型详解

Tina Huang. 这是一份平实清晰的19分钟主流模型系列地图——涵盖OpenAI的GPT系列、Anthropic的Claude、Google的Gemini,以及开源领域的参与者——还会说明各系列中哪个档位值得你投入时间。文章告诉你“选一个,坚持使用一个月”;这段视频则解释你选定的产品中,下拉菜单实际提供了什么。观点坦率鲜明,却不哗众取宠。

AI新手