私有、本地与自托管AI
本地模型、私有化部署模式、自托管推理和混合架构。
10 项内容 (4 篇文章 · 6 个视频)
从这里开始
浏览完整内容之前,先阅读几篇推荐文章。
10 分钟阅读在Mac上运行本地AI:Ollama、LM Studio,以及7B模型究竟能做什么
本地运行AI已日趋成熟。借助Ollama或LM Studio和一台现代Mac,你可以离线、免费且私密地运行能力不俗的模型。本文将介绍哪些方法可行、哪些不可行,以及真正能从中受益的使用场景。
中级
10 分钟阅读私有AI部署模式:本地、VPC、自托管与混合架构
私有AI并非单一架构。针对中小企业在隐私和控制需求下的本地模型、企业SaaS、VPC部署、自托管推理和混合模式的实用对比。
高级
11 分钟阅读自托管与托管推理对比:vLLM、TGI与盈亏平衡计算
自托管要达到什么规模才会胜过API调用?本文介绍实际计算、运维现实,以及区分哪些团队应该自托管、哪些团队应该继续为托管推理付费的模式。
高级此主题下的更多内容
37 分钟Broadcom介绍VMware Private AI Foundation的能力与功能更新
Tech Field Day. 视频将私有AI呈现为分层基础设施:受控算力、隔离环境、Kubernetes、推理容器、模型治理、自助式资源配置、GPU共享和监控。这与文章的提醒直接对应:隐私取决于部署边界、日志、访问控制和运营,而不是“本地”这一个词。
高级
13 分钟阅读2026年的微调:LoRA何时胜过RAG,以及如何不靠集群完成微调
LoRA微调已不再遥不可及——你可以在笔记本电脑上真正完成微调,也可以租用一小时GPU。本文介绍行之有效的方法、微调胜过RAG的场景,以及从数据准备到部署的实用端到端工作流。
高级
157 分钟LLM模型微调:生成式AI课程
freeCodeCamp.org. 这是一门先讲理论、再写代码的长课程,涵盖量化、LoRA、QLoRA,以及在Llama 2和Gemma上进行完整的PEFT,并使用大多数开发者实际拥有的硬件。它几乎是YouTube上最接近“跟着有实战经验的人从头做一遍”的内容,还通过具体的显存预算印证了文章中“你不需要集群”的观点。
高级
59 分钟开发LLM:构建、训练与微调
Sebastian Raschka. Sebastian Raschka以较慢的节奏讲解微调在更广泛LLM训练流程中的位置,包括指令微调、分类微调、参数高效方法,以及文章在推荐LoRA前指出的各种权衡。它适合在开始前校准认知,尤其适合仍在讨论微调是否真是正确下一步的团队。
高级
14 分钟15分钟学会Ollama——免费在本地运行大语言模型
Tech With Tim. 简洁直接的Ollama实操教程——安装、拉取模型、对话,然后用Python调用本地HTTP API,并通过Modelfile创建自定义模型。内容恰好覆盖文章所述的Mac日常使用流程,也讲解了如何根据机器的RAM考虑模型大小。
中级
6 分钟LM Studio教程:在笔记本电脑上运行大语言模型
Kevin Stratvert. 通过图形界面完成与Ollama相同的工作流:下载LM Studio、拉取Llama或Gemma模型、进行对话,以及放入PDF并就其内容提问。适合不想一直使用终端的读者,也有助于直观比较1B–3B模型与更大模型的实际表现。
中级
32 分钟使用vLLM与PagedAttention实现高速LLM推理服务
Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。
高级