主题

私有、本地与自托管AI

本地模型、私有化部署模式、自托管推理和混合架构。

10 项内容 (4 篇文章 · 6 个视频)

从这里开始

浏览完整内容之前,先阅读几篇推荐文章。

此主题下的更多内容

37 分钟
视频

Broadcom介绍VMware Private AI Foundation的能力与功能更新

Tech Field Day. 视频将私有AI呈现为分层基础设施:受控算力、隔离环境、Kubernetes、推理容器、模型治理、自助式资源配置、GPU共享和监控。这与文章的提醒直接对应:隐私取决于部署边界、日志、访问控制和运营,而不是“本地”这一个词。

高级
13 分钟阅读
文章

2026年的微调:LoRA何时胜过RAG,以及如何不靠集群完成微调

LoRA微调已不再遥不可及——你可以在笔记本电脑上真正完成微调,也可以租用一小时GPU。本文介绍行之有效的方法、微调胜过RAG的场景,以及从数据准备到部署的实用端到端工作流。

高级
157 分钟
视频

LLM模型微调:生成式AI课程

freeCodeCamp.org. 这是一门先讲理论、再写代码的长课程,涵盖量化、LoRA、QLoRA,以及在Llama 2和Gemma上进行完整的PEFT,并使用大多数开发者实际拥有的硬件。它几乎是YouTube上最接近“跟着有实战经验的人从头做一遍”的内容,还通过具体的显存预算印证了文章中“你不需要集群”的观点。

高级
59 分钟
视频

开发LLM:构建、训练与微调

Sebastian Raschka. Sebastian Raschka以较慢的节奏讲解微调在更广泛LLM训练流程中的位置,包括指令微调、分类微调、参数高效方法,以及文章在推荐LoRA前指出的各种权衡。它适合在开始前校准认知,尤其适合仍在讨论微调是否真是正确下一步的团队。

高级
14 分钟
视频

15分钟学会Ollama——免费在本地运行大语言模型

Tech With Tim. 简洁直接的Ollama实操教程——安装、拉取模型、对话,然后用Python调用本地HTTP API,并通过Modelfile创建自定义模型。内容恰好覆盖文章所述的Mac日常使用流程,也讲解了如何根据机器的RAM考虑模型大小。

中级
6 分钟
视频

LM Studio教程:在笔记本电脑上运行大语言模型

Kevin Stratvert. 通过图形界面完成与Ollama相同的工作流:下载LM Studio、拉取Llama或Gemma模型、进行对话,以及放入PDF并就其内容提问。适合不想一直使用终端的读者,也有助于直观比较1B–3B模型与更大模型的实际表现。

中级
32 分钟
视频

使用vLLM与PagedAttention实现高速LLM推理服务

Anyscale. 视频讲解了为什么朴素的LLM推理服务会浪费60–80%的GPU内存、PagedAttention如何借鉴操作系统式分页来解决这一问题,以及连续批处理为何能实现文章在计算中采用的24×吞吐量。看完后,文章中“利用率能达到50%就算幸运”这句话就不再抽象。

高级