トピック

プライベートAI、ローカルAI、自社運用AI

ローカルモデル、プライベート環境への導入パターン、自社運用の推論、ハイブリッドアーキテクチャ。

10件のコンテンツ (記事4件 · 動画6件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

37 分
動画

Broadcomが解説するVMware Private AI Foundationの機能更新

Tech Field Day. プライベートAIを、統制されたコンピューティング、分離環境、Kubernetes、推論コンテナ、モデルガバナンス、セルフサービス型プロビジョニング、GPU共有、監視から成る多層インフラとして示します。これは、プライバシーは「ローカル」という言葉ではなく、導入境界、ログ、アクセス、運用によって決まるという記事の警告に直接対応します。

上級者
13 分の読書
記事

2026年のファインチューニング:LoRAがRAGを上回る場面と、クラスターなしで実践する方法

LoRAファインチューニングは身近なものになりました。実用的なファインチューニングをノートパソコンで実行したり、GPUを1時間借りて行ったりできます。効果的なパターン、ファインチューニングがRAGを上回るケース、データ準備からデプロイまでの実践的なエンドツーエンドのワークフローを解説します。

上級者
157 分
動画

LLMのファインチューニング:生成AI講座

freeCodeCamp.org. 量子化、LoRA、QLoRA、包括的なPEFTをLlama 2とGemmaで扱う、理論からコードへ進む長編コースです。しかも、ほとんどの開発者が実際に所有するハードウェアを使用します。YouTube上で「経験者の仕事をそばで見ながら学ぶ」体験に最も近く、具体的なVRAM要件を通じて、記事の「クラスターは不要」という主張を裏付けています。

上級者
59 分
動画

LLMの開発:構築、学習、ファインチューニング

Sebastian Raschka. Sebastian Raschkaが、LLMの学習パイプライン全体におけるファインチューニングの位置付けをじっくり解説します。インストラクションチューニング、分類タスク向けファインチューニング、パラメーター効率の高い手法、そして記事がLoRAを推奨する前に取り上げるトレードオフを扱います。着手前に判断軸を整えるのに適しており、ファインチューニングが本当に正しい選択なのかをチームで検討している場合には特に有用です。

上級者
14 分
動画

Ollamaを15分で学ぶ:LLMを無料でローカル実行

Tech With Tim. Ollamaの要点を簡潔に解説しています。インストール、モデルの取得、チャットに続き、PythonからローカルHTTP APIを試し、Modelfileでカスタムモデルを作成します。モデルのサイズとMacのRAMの関係も含め、記事で説明する日常的な利用ワークフローを正確に網羅しています。

中級者
6 分
動画

LM Studioチュートリアル:ノートPCでLLMを実行する

Kevin Stratvert. Ollamaと同じワークフローをGUIで行います。LM Studioをダウンロードし、LlamaまたはGemmaモデルを取得してチャットし、PDFを追加して内容について質問します。ターミナルを常用したくない読者に適しており、1B~3Bモデルがより大規模なモデルと比べて実際にどう動作するかを体感するのにも役立ちます。

中級者
32 分
動画

vLLMとPagedAttentionによる高速なLLM推論配信

Anyscale. 単純なLLMサービングがGPUメモリの60~80%を無駄にする理由、PagedAttentionがOSのようなページングを応用してそれを解決する仕組み、継続的バッチ処理によって記事の計算で使う24倍のスループットが実現する理由を解説します。視聴後は、記事にある「稼働率が50%に達すれば幸運」という一節が抽象的な話ではなくなります。

上級者