トピック

エージェントとコンピューター操作

エージェントのワークフロー、ブラウザー操作、メモリ、ループ、フレームワーク、顧客向け音声フロー。

48件のコンテンツ (記事29件 · 動画19件)

ここから開始

一覧を見る前に、まずおすすめのコンテンツをいくつかご覧ください。

このトピックの他の記事

9 分の読書
記事

DGX Sparkとは何か:誰に向き、ローカルエージェントをどう変えたのか

NVIDIA DGX Sparkを根拠に即して読み解きます。NVIDIA公表のGrace Blackwell GB10仕様、コヒーレント統合メモリー、ConnectX-7によるクラスタリング、そしてデスクサイドのエージェント用コンピューターがプライベートAIに適する条件を検討します。

上級者
7 分の読書
記事

Hermes Agentとは何か、何ではないか、いつ使うべきか

Nous ResearchによるHermes Agentの見取り図です。永続メモリ、スキル、ツール、メッセージングゲートウェイに加え、チャットボットで足りる場面と、エージェントランタイムが適する場面の判断を扱います。

中級者
8 分の読書
記事

Hermes Agentの最初の1週間:メモリの整理、スキル、ツールの承認

Hermes Agentを安全に始める最初の1週間です。インストールとスモークテストを行い、MEMORY.mdとUSER.mdを整理し、スキルを1つ追加し、ファイル書き込みを制限して、シェルアクセスを無効化または隔離します。

中級者
8 分の読書
記事

Hermesとn8nの比較:仕事に合わせた選び方(併用すべき場合も)

Hermes Agentとn8nを選ぶための判断基準を解説します。手順が明確な連携処理はn8nに残し、範囲を限定したエージェント処理にはBearer認証付きHermes APIステップか、独立したイベントwebhook経路を使います。

中級者
7 分の読書
記事

Hermesのwebhook:巨大な万能プロンプトを使わないイベント駆動エージェント

送信元に適した認証、ポート8644のヘルスチェック、小さな名前付きルートでHermes Agentのwebhookを設定し、イベントを配信先が明確なエージェント実行へ変えます。

中級者
8 分の読書
記事

n8n AIノードの冪等性、再試行、人による承認ゲート

AIノードはCRUD APIとは違う形で失敗します。n8nの再試行、冪等性キー、人をループに入れるゲート、ログを設計し、不安定なモデル呼び出しがメールの二重送信やレビューの省略を起こさないようにします。

中級者
10 分の読書
記事

n8n → Hermes:API呼び出しかイベントwebhookかを選ぶ

手順が明確な状態管理はn8nに残します。n8nがエージェントの結果を必要とする場合はHermes APIを、イベントから設定済みのHermes配信を起動する場合はwebhookアダプターを選びます。

中級者
10 分の読書
記事

DGX Spark上のNemoClaw:導入・セキュリティ計画

DGX Spark上のNVIDIA OpenShell内でOpenClaw、Hermes、またはDeep Agents Codeを評価するための計画です。現行のオンボーディング、ポリシー層、推論ルーティング、必要な受け入れ証拠を扱います。

上級者
8 分の読書
記事

OpenClawの許可リスト、ペアリング、グループメンションのセキュリティ

OpenClawの本当のセキュリティ境界は、チャネルの許可リスト、DMのペアリング、グループでのメンション規則です。ツールにはシェル、ファイル、ブラウザが含まれる可能性があるからです。実務で使えるロックダウン用チェックリストを紹介します。

中級者
9 分の読書
記事

OpenClawパーソナルゲートウェイの設定:インストール、初期設定、ダッシュボード

OpenClawの概要、セルフホスト型マルチチャネルゲートウェイのインストールと初期設定、ポート18789でのControl UIの開き方、セキュリティー基準を省略せずに使えるNodeバージョンを説明します。

中級者
10 分の読書
記事

OpenClawのスキル、heartbeatによる自律動作、承認ゲート

OpenClawがスキルを読み込む仕組み、heartbeatの定期ターン、ホストのシェル実行を制限する方法、ブラウザー自動化を厳しいポリシーとレビュー済みワークフローの確認下に置く方法を説明します。

中級者
8 分の読書
記事

OpenClawとHermes:ブランドではなく用途で選ぶ

OpenClawとHermesは、機能が重なる一方で運用上の強みが異なるセルフホスト型エージェントシステムです。どちらか一方、または両方を選ぶ前に、チャネルルーティング、webhook、ツール、自動化の境界を比較します。

中級者
10 分の読書
記事

実験的なデュアルDGX Spark+DeepSeek-V4-Flash+n8n+Hermesスタック

DeepSeek-V4-Flashを2台のDGX Sparkで動かす実験的なコミュニティ経路を評価する方法です。決定論的な処理をn8nに、判断が必要な処理をHermesに担当させます。

上級者
12 分の読書
記事

Codex、Claude Code、CursorをひとつのCLIチームとして動かす

AGENTS.md、CLAUDE.md、Cursorのルール、CLIのprintモードを使って、Codexが設計し、Claudeがレビューし、Cursorが実装する流れを、独自のオーケストレーション基盤なしで実現します。

上級者
15 分の読書
記事

Linearでマルチエージェント開発を管理する:Claude、Cursor、Codexで1つのバックログを共有

Claude Code、Cursor、Codexを実際の開発チームのように同じLinearプロジェクトで動かします。互いの作業を妨げずに、担当を宣言し、進捗を更新し、レビューを引き継ぎ、指摘を修正してIssueを完了させます。

上級者
6 分
動画

AI音声エージェント:仕組みと人間らしく聞こえる理由

CX Foundation. 音声エージェントを、音声認識、言語モデル、業務システムのAPI、テキスト読み上げ、割り込み処理という実践的なパイプラインに分解して説明します。読者がTwilio、Retell、Vapi、LiveKitなどのプラットフォームを選ぶ前に、記事の導入フレームワークを支える具体的な技術基盤を理解できます。

上級者
9 分の読書
記事

AIネイティブIDEとリポジトリを認識するコーディングワークフロー

Cursor、Copilot、Claude Code、リポジトリを認識するエージェントがソフトウェア開発を変えるのは、チームが境界を設けた場合に限られます。コードベースのコンテキスト、計画、テスト、レビュー、シークレット、本番環境の安全性を扱う実践的なワークフローです。

上級者
9 分の読書
記事

顧客フロー向け音声エージェント:有効な場面と失敗する場面

音声エージェントは、フローが限定され、データが利用でき、フォールバックが明確な場合に役立ちます。TwilioやRetellのようなシステムの採否、開示、引き継ぎ、テスト、段階導入のための実践的な判断枠組みです。

上級者
11 分の読書
記事

LangGraph vs CrewAI vs直接API:2026年のエージェントフレームワークの選び方

2026年のエージェントフレームワークを取り巻く環境は成熟しましたが、選択が明快になったわけではありません。LangGraph、CrewAI、Pydantic AI、OpenAI Agents SDK、直接APIは、それぞれ特定のチームやプロジェクトに適していますが、万能なものはありません。率直な比較と意思決定のフレームワークを紹介します。

上級者
11 分の読書
記事

AIカスタマーサポートエージェントの設計:選別、ナレッジ、アクション、エスカレーション

サポートの選別、検索、回答案、制御されたアクション、人へのエスカレーションを、キューで評価するための参照設計です。安全な試行に必要なポリシーと測定の境界も示します。

中級者
10 分の読書
記事

AIで継続運用するブリーフィング/ニュースレターの構築

追跡可能な情報源、権限を尊重した収集、明確な品質確認、保守の仕組みを備えた、日次または週次の自動ブリーフィングを構築します。

中級者
12 分の読書
記事

本番環境におけるコンピューター操作エージェントとブラウザエージェント

コンピューター操作エージェントやブラウザエージェントのデモは、たびたび大きな話題になります。しかし、大規模な本番導入の姿は異なります。対象範囲を狭く絞り、厳重なガードレールを設け、UXを慎重に設計します。実際に機能するパターン、繰り返し見られる失敗、そして現実的な経済性を解説します。

上級者
10 分の読書
記事

メール、カレンダー、CRMにAIを安全に接続する

権限範囲の最小化、承認ゲート、保護された監査証跡、不正・失敗時のテスト、復旧手順を使い、AIをメール、カレンダー、CRMへ接続するための、リスクに基づくガイドです。

中級者
10 分の読書
記事

非エンジニアのためのMCP:ClaudeやCursorを自分のツールに接続する

MCPは、AIを自分のツールに接続する新しい標準です。メリットを得るために、自分でMCPを開発する必要はありません。MCPとは何か、どのサーバーをインストールすべきか、AIが実際に操作できるようになると何が可能になるかを、非エンジニア向けに解説します。

中級者
12 分の読書
記事

長期実行エージェントのためのメモリ構築

長期実行エージェントには、自ら責任を持つ永続化設計が必要です。出所、確認、テナント分離、検索テスト、保持、修正、検証可能な削除までを設計します。

上級者
9 分の読書
記事

n8n、Zapier、Makeを比較:最適な自動化スタックの選び方

2026年のAIワークフローを支える主要な3つの自動化プラットフォームを率直に比較します。それぞれの得意分野と限界、後悔せずに選ぶための判断基準を解説します。

中級者
12 分の読書
記事

チャンクを超えるRAG:グラフRAG、エージェント型RAG、ロングコンテキストRAG

従来のチャンクベースRAGには限界があります。グラフRAG、エージェント型RAG、ロングコンテキストRAGは、それぞれ異なる方法でその限界を打ち破ります。各手法が適する状況、実際の仕組み、本番環境で重要なトレードオフを解説します。

上級者
190 分
動画

LangGraph初心者完全講座:Pythonで複雑なAIエージェントを構築

freeCodeCamp.org. LangGraphのステートグラフ、ノード、エッジ、条件分岐、チェックポイント、ツール利用を、実際にコードを書きながら構築する長編講座です。最後まで進めると、型付き状態と「すべての遷移を明示する」モデルを十分に体感でき、記事にあるCrewAIやAPI直接利用コードとの比較が抽象的な話ではなくなります。

上級者
66 分
動画

CrewAIチュートリアル:初心者向け集中講座

aiwithbrandon. 同様の構築をCrewAIの「役割・目標・背景」というスタイルで行います。エージェントをチームメンバー、タスクを成果物として扱い、フレームワークが実行ループを隠蔽します。LangGraphのコース直後に見てください。フレームワークにどこまで判断を委ねるかという違いこそ、記事が比較を求めている点です。

上級者
15 分
動画

効果的なエージェントを構築する方法:Anthropic、Barry Zhang

AI Engineer. Barry Zhangが3つの原則を解説します。ワークフローで十分ならエージェントを作らないこと、ループを可能な限り単純に保つこと、そして「エージェントのように考える」ことです。つまり、エージェントのコンテキストウィンドウに身を置き、スクリーンショットの合間には状況が見えないまま判断していると認識します。単純さを重視する主張と、「そもそもこのタスクにエージェントを使う価値があるか」というチェックリストは、記事が求める規律そのものです。

上級者
18 分
動画

AIエージェント構築のヒント

Anthropic. Anthropicの3人のエンジニアが、現場でよく目にする落とし穴を解説します。停止すべきタイミングを判断できないエージェント、環境を修正せずシステムプロンプトへ指示を詰め込みすぎる問題、実際には不要だったマルチエージェント設計のコストなどです。Barryの講演の直後に見ると効果的で、同じパターンを別の角度から捉えられます。

上級者
31 分
動画

n8nでAIカスタマーサポートエージェントを作る方法(無料テンプレート)

Bart Slodyczka. n8nのワークフローがヘルプデスク製品に接続し、検索した材料に基づいて返信案を作り、解決済みチケットをナレッジベースの候補コンテンツに変換します。この取り込み方法を使う前に、人による承認、個人データと機密情報の削除、出典としての元チケットとコンテンツ版の保持、ホールドアウトしたチケット群による検索評価を追加してください。

中級者
231 分
動画

AIエージェントの構築と販売:初心者完全ガイド

Liam Ottley. RAGに基づくチャットボット、エスカレーションロジック、Botpress、Voiceflow、Make、n8nなどで構成するノーコードの技術スタックを扱います。「エージェントの構造」の節では、記事の「選別→根拠→提案アクション→ポリシー審査→引き継ぎ責任」と比較できる具体的な実装を確認できます。

中級者
24 分
動画

Operatorとエージェント入門

OpenAI. Operatorの実際の発表デモです。チームがレストランを予約し、食料品を注文し、イベントチケットを購入する一方、Operatorがリダイレクトで行き詰まったり、ログイン時に操作を人へ戻したりする様子も確認できます。スクリーンショットとクリックを繰り返す処理、状態を変更する操作前の確認、プロンプトインジェクション対策など、ブラウザエージェントの実際の使用感を最も明確に伝える動画です。記事が読者に持ってほしい現実的な期待を具体的に理解できます。

中級者
2 分
動画

Claude|Computer Useでタスクを統合制御する

Anthropic. Claudeがデスクトップを直接操作し、Web検索、地図の確認、カレンダー招待の作成という複数アプリにまたがる小さな作業を計画する、Anthropicによる2分間のデモです。後述するOperatorのクラウドブラウザ限定モデルとの対比に役立ちます。また、コンピューター操作エージェントは自由度の高い作業より、短く明確に区切られた雑務に適しているという記事の要点を直感的に確認できます。

中級者
5 分
動画

Claudeが私のコンピューターを操作する

Fireship. スクリーンショット、操作、再びスクリーンショットというループを、YouTube上で最も明快かつ短く説明しています。Claudeが目的を外れてYellowstoneを調べ始める例、トークン消費、各ステップのレイテンシーといった現実的な失敗パターンも含まれます。Fireshipは意図的に本番環境の詳細を省いているため、その点は記事を参照してください。しかし、こうしたシステムを自社の技術スタックへ組み込む前に、なぜ高コストで壊れやすいのかを正しく直感できるようになります。

上級者
8 分
動画

AnthropicのClaude Computer Useがもたらす変革|YC Decoded

Y Combinator. Garry Tanが、従来は自動化できなかったソフトウェアのロングテールに対し、コンピューター操作が実際に何を変えるのかを解説します。レガシーアプリ、社内ポータル、APIのないあらゆるシステムが対象です。「ブラウザは普遍的なインターフェースである」という記事の主張と同じ枠組みを、最初に効果が見込める領域について、よりビジネスの現実に即した視点から説明しています。

上級者
25 分
動画

OWASPが示すLLMへの攻撃トップ10:AIの脆弱性を解説

IBM Technology. プロンプトインジェクションから視野を広げ、LLMに関するOWASP Top 10全般を扱っています。安全でない出力処理、機密情報の漏えい、過剰なエージェンシーなど、あらゆるものにGmailやHubSpotのスコープを付与する前に理解しておきたい、まさに失敗モードの一覧です。

中級者
11 分
動画

プロンプトインジェクション攻撃とは?

IBM Technology. Jeff Crumeによる「SUVを1ドルで買う」という例は、直接プロンプトインジェクションと間接プロンプトインジェクションが異なる問題である理由と、フィルタリングではどちらも完全には解決できない理由を、10分で説明する最も明快な解説です。取り消せない操作には、より巧妙なシステムプロンプトではなく、最小権限のスコープ、専用エージェントアカウント、人の介在が必要だという記事の主張と直接対応しています。

中級者
26 分
動画

25分で初めてのAIエージェントを作る(コーディング不要)

Futurepedia. 1回の動画で、実際に動くn8nエージェントをゼロから構築します。途中で、エージェントとは実際に何か、直線的なワークフローとどう異なるか、ガードレールをどこに設けるかも説明しています。視聴後は、記事の図にあるすべてのノードを見分けられるようになり、妥当な初期設定がどのようなものかもつかめます。

中級者
92 分
動画

n8nマスター講座:AIエージェント構築とワークフロー自動化(初級から上級まで)

Nate Herk | AI Automation. Nateはn8nに特化した実務家の中でも特に視聴されており、このマスタークラスではFuturepediaの入門動画よりも深く、メモリ、マルチエージェント構成、エラー処理、実際のビジネスワークフローを扱っています。リード選別エージェントが動作し、それを拡張したくなった段階で活用してください。

中級者
20 分
動画

Model Context Protocol(MCP)

Anthropic. プロトコルの設計者であるTheo Chu、David Soria Parra、Alex Albertが、MCPが存在する理由、構成要素(サーバー、クライアント、トランスポート)、2024年11月の公開以降の反響、日常的に実際に使っているサーバーについて説明します。Nate Herkの概要動画に続いて確認する公式情報として役立ちます。

中級者
16 分
動画

MCPがAIエージェントを賢くする仕組み(非技術者向け)

Nate Herk | AI Automation. MCPサーバーとは何か、Claudeやn8nのようなクライアントがMCPサーバーをどのように使うのか、導入後に実際の作業がどう変わるのかを、専門用語を使わず16分で説明します。記事の「ClaudeやCursorを自分のツールに接続する」という捉え方とほぼ完全に一致します。

中級者
7 分
動画

エージェントの記憶(概念解説)

LangChain. 短期メモリと長期メモリの分離、長期メモリが取りやすい3つの形(指示、プロフィール、オブジェクトのリスト)、書き込みタイミングに関するホットパスとバックグラウンド処理のトレードオフを、コードなしで短く解説します。記事のメモリアーキテクチャに関するセクションは、まさにこの分類を前提としています。

上級者
44 分
動画

AIに脳のような記憶を構築する|LLMエージェントの記憶システム

Adam Lucek. 認知科学に着想を得たエピソード記憶、意味記憶、ワーキングメモリ、手続き記憶という分類を詳しく解説し、コードでエージェントに組み込みます。より明確な立場を持つメンタルモデルと、参考にできる実装例を求める場合は、LangChainの概念解説の後に見る価値があります。

上級者