第 15
AI スタック
AI のもう一つの側面 — サーバを操作するアシスタントではなく、サーバが動かす AI インフラそのもの。エージェントランタイム、ローカルモデル、サンドボックス、GPU、そしてその費用までを、ひとつの画面から見守ります。
前の 2 章は AI が FrontierStack を操作する側でした — 組み込みの管理者(第 13 章)と、自分のツールから MCP 経由でアプリを操作する話(第 14 章)です。本章はその逆です。FrontierStack が実行・監視を手助けする AI インフラそのもの — エージェント基盤、ローカルモデルサーバ、コードサンドボックス、ブラウザ自動化、GPU ファブリック、ML ツール、ガバナンス、そしてそれら全部の費用を扱います。これらは他と同じカタログ上のサービスで、サイドバーの AI 系カテゴリーにまとまっていますが、AI を動かすことが「呼び出す箱」ではなく「運用するスタック」になった今、独立した一章に値します。
15.1エージェント基盤ボード
サイドバーからエージェント基盤(Agent Platforms)を開くと、FrontierStack が把握するすべての AI エージェントランタイムが、行ごとのライブ状態ドット付きで一覧されます。ヘッダーには例えば「3 / 7 running」 — 設定済みランタイムのうち到達可能で稼働中の数 — と表示されます。各行は、稼働状態、提供しているモデル、そしてランタイムが報告していればエージェント数・トークン・アクティブセッションを示します。AI ツール get_agent_platforms はまさにこれを管理者に公開するので、「どのエージェントランタイムが落ちている?」と普通の言葉で尋ねられます。
ランタイムは 2 種類です。一つは CLI ランタイム — コマンドラインツールがインストールされ(かつ --version に応答する)ことで検出されます。コーディングエージェントの Claude Code・Gemini CLI・OpenAI Codex、そして Factory の droid です。もう一つは状態エンドポイントを公開し、ライブメトリクスをポーリングする HTTP ランタイムです。いくつかのクラウドエージェント製品(OpenHands・Manus・Devin・OpenAI Operator・E2B)は、ポーリングではなく接続するカタログ項目として下部に並びます。
| プラットフォーム | 何か |
|---|---|
| OpenClaw | セルフホストのエージェントランタイム。稼働状態とモデルを監視。 |
| Hermes | HTTP でポーリングされ、状態・モデル・セッションを表示するランタイム。 |
| DeerFlow | ディープリサーチ/多段エージェントランタイム。 |
| LangGraph Platform | グラフベースのエージェントオーケストレーション。状態とモデルをボードに表示。 |
| CrewAI Enterprise | マルチエージェント「クルー」ランタイム。 |
| Microsoft AutoGen | マルチエージェント会話フレームワーク。 |
| Genspark | 自律型エージェント基盤。 |
| Agent Zero | 汎用の自律エージェント。 |
| NVIDIA NemoClaw | NVIDIA のエージェントランタイム。 |
| OpenAI Codex / Claude Code / Gemini CLI / Factory Droid | コーディングエージェント CLI。インストール+バージョンで検出され、オンデマンドとして表示。 |
設定済みランタイムはより広いシステムに連動するため、ランタイムが停止したり、トークンのクォータ(レート制限・429・課金)に達したりすると、アラートが上がり、Local Health ボードの services グループに赤で表示されます。各ランタイムのエンドポイントと資格情報を一度設定すれば、以後は他のサービスと同様に監視されます。
15.2Registry・Task Queue・Model Router・Connectors
4 つの関連ペインが、同じライブのランタイム状態を読みながら、エージェントフリートを関心ごとに分解します。
- Agent Registry — マスター一覧。すべてのランタイムに加え、カタログのクラウドエージェント製品を、トークンが Keychain にあるものには「資格情報保存済み」マーカー付きで表示。FrontierStack が会話できるすべてを 1 か所で見られます。
- Task Queue — 各ランタイムにまたがるアクティブなエージェントセッションと実行。呼び出しごとの CLI(Claude Code・Gemini・Codex・Factory)は、デーモンではなくタスクごとに起動するため「on-demand」と表示されます。
- Model Router — 各ランタイムが使うモデルと API キー。報告されたモデルと必要なプロバイダキーを読み、そのキーが存在するかを示します(キーの編集は AI Models)。ランタイムが意図したモデル — そして費用 — に向いているか確認できます。
- Repository Connectors — エージェントが読み書きできる Git プロバイダ。GitHub・GitLab・Bitbucket の個人アクセストークンを取り込むと(Keychain 保存)、FrontierStack が
/userへのライブ到達性チェックを実行し、エージェントが必要とする前に資格情報が有効か分かります。
エージェントランタイムとコネクターは、一度保存した資格情報で認証します。FrontierStack の他の場所と同様、これらのトークンは macOS Keychain に置かれ、アプリの設定ファイルには入らず、クラウドモデルに送られることもありません。
/user チェックはトークンが有効かを確認するだけで、トークンが何をできるかは制限しません — それは GitHub/GitLab/Bitbucket 側で設定する PAT のスコープです。15.3Agent Sessions と組み込みターミナル
Agent Sessions は、自分で作る目標駆動の運用・SaaS ループのマネージャです — ヘッダーが言うとおり「one-shot or recurring(1 回/繰り返し)」。セッションは、普通の言葉の目標、タイトル、ステップ予算、そして変更を許可するかのスイッチを持ちます。1 回だけ実行するか、繰り返しに設定(間隔が経過すると再実行)してスケジュール監視します。各セッションは管理者(第 13 章)と同じガード付きツールを動かし、各ステップを、いつでも停止できるトランスクリプトに流します。セッションループからスクリプトは決して許可されません。「このエンドポイントを監視して止まったら再起動」や「毎朝、在庫を突き合わせる」といったエージェントの居場所です。
FrontierStack は、エージェントの隣でシェルが欲しいときのために、本物のターミナルも内蔵します。エンジンは SwiftTerm で、PTY 内でログイン zsh を実行します。スタイルも変えられます — Terminal Style で、iTerm2(.itermcolors)・Ghostty・汎用の Alacritty/Warp の key-value ファイルからカラーテーマをインポートでき、内蔵の dark・light・Solarized テーマに重ねられます。このターミナルはエージェントループのコンソールと同じエンジンなので、見えるものとセッションが実行する環境が一致します。
15.4ローカルモデルを動かす
クラウドモデルに何も送らない選択も可能です。FrontierStack はローカル推論サーバを管理し、管理者をそのうちの一つに向けられます。主要なローカルアプリ 3 つは一級市民です。
- Ollama — 最も手軽なローカルモデルランナー。モデルを取得・提供し、管理者のエンジンとして選択できます。
- LM Studio — LM Studio ペインがインストールを検出し、
lmsCLI でロード済みモデルとダウンロード済みを一覧。ヘッダーに「N models loaded」または「no model loaded」を表示します。 - VibeProxy — これだけ性質が異なり、モデルランタイムではなくすでに契約している AI サブスクリプションへの橋渡しです。Claude Code・ChatGPT・Gemini・Kimi・Qwen・GitHub Copilot・Z.AI GLM を一度接続すれば、従量課金の API キーなしでそれらのモデルがハーネスの選択肢に現れます。VibeProxy ペインは Homebrew でのインストール、起動と停止、通常どおりの Group Start/Run at startup 設定、そしてリクエストログとアカウント状態を見る CLI Proxy API ダッシュボードの起動を提供します。
- LocalAI — ポート 8080 のカタログサービスとして動かす、セルフホストの OpenAI 互換サーバ。
これらの他にも、AI / LLMs カテゴリーはセルフホスト推論の棚一式を備えます — vLLM・llama.cpp・Apple の MLX-LM サーバ・Jan・LiteLLM(100 以上のプロバイダをまとめるプロキシ)・Open WebUI・AnythingLLM・PrivateGPT、RAG/ベクトルツール。ローカルで動かす意義はプライバシーと費用です — 管理者のエンジンがローカルモデル(Ollama・ループバックのエンドポイント・Apple のオンデバイスモデル)のとき、Mac から何も出ないので何も秘匿されません — クラウドエンジンを守る秘密情報のスクラブが、そもそも不要なのです。
15.5コードサンドボックスとブラウザ自動化
エージェントには、コードを安全に動かす場所と、ライブな Web を読む手段が要ります。FrontierStack はその両方を管理します。
コードについては、E2B ペインが e2b CLI 経由でセキュアなクラウドサンドボックスを管理します。API キーを入力(Keychain に E2B_API_KEY として保存、または e2b auth login で一度認証)し、一覧・テンプレートからの起動・実行中サンドボックスのkillができます — 後片付け用の Kill All と「一時停止を含める」トグル付き。緑のドットは稼働中、オレンジは一時停止。エージェントが使う、使い捨ての隔離マシンで、そのコードがサーバに触れることはありません。
Web については、AI カテゴリーがブラウザ・クロールツールを含みます — Browserbase(マネージドのヘッドレスブラウザ)・Crawl4AI・Firecrawl・Apify(サイトをモデル向けの整ったテキストに変換)、そしてスクリプト自動化の Playwright。API のないページにもエージェントの「目」を与えます。
15.6GPU インフラとクラスタ
AI が実 GPU 上で動くなら、GPU Fabric ペインがハードウェアの読み取り専用ヘルスを提供します。連携サーバを選び、SSH で診断を実行します — GPU の構成と温度(nvidia-smi)、NVLink 状態、GPU トポロジー行列、NVSwitch Fabric Manager の健全性、DCGM インベントリ(dcgmi)、InfiniBand と RoCE/RDMA リンク、Slurm の GPU 割り当て、コンポーザブルファブリック CLI(WEKA・Liqid・GigaIO)。GPU は Linux ホスト上にあるため、これはフリート内のサーバを対象とします。GPU のないマシンではツールが単に「not found」と報告します。チェックを 1 つ実行するか、Run All Checks で一括実行します。
ホストの GPU 温度と負荷は、エージェントを入れていれば標準のホストモニタ(第 8 章)でも表面化するので、過熱した GPU ボックスは他のマシンと同様にアラートを上げます。スケールアウトには、AI Clusters カテゴリーが Exo(複数の Mac で 1 モデルを実行)・Petals・Distributed Llama・Ray・Slurm・Run:ai を、ML Workbench カテゴリーが学習側の実験管理・パイプラインツール(MLflow・ClearML・Weights & Biases・Kubeflow・JupyterLab)を備えます。
15.7AI ガバナンスと安全性
本番でエージェントを動かすとは、何をするかを見張り、何ができるかを縛ることです。FrontierStack は AI Governance & Safety の棚をカタログ化し、これらのツールが監視対象のランタイムの隣に並ぶようにしています — LLM 可観測性・トレーシングの Langfuse・Helicone・Arize Phoenix、評価・レッドチーミングの Promptfoo・Ragas・garak、入出力検証とプロンプトインジェクション防御の Guardrails AI・NeMo Guardrails・Lakera Guard、そして Credo AI や Holistic AI などのガバナンス基盤。カタログサービスとしてインストール・監視します — 上のボードのエージェントにとっての監査証跡とシートベルトです。
15.8AI コストモニタ
アシスタント、自作エージェント、複数のローカルモデル、外部ハーネスを使うと、費用は複数の場所に分散します。AI Model Costs はそれをひとつの画面に集約します。ヘッダーは今月の合計と予算に対する割合を表示し、色分けバーは 80% でオレンジ、100% で赤になります。AI ツール get_ai_costs は同じ数値を管理者に公開します。
ダッシュボードは 3 つの流れを一緒に追跡します。
- 従量 API 課金 — プロバイダ・モデル別。編集可能な価格表(100 万トークンあたり USD)から計算するか、請求書から直接入力。Connect Accounts は OpenAI・Anthropic・OpenRouter・DeepSeek、そしてセルフホストの LiteLLM プロキシから月初来の費用を自動取得します — プロバイダごとに複数アカウント、それぞれ独立した費用行。
- 定額サブスク — ChatGPT Plus・Claude Pro/Max・Cursor・Perplexity・T3 Chat など — 月の合計に組み込み、独自のスライスとして表示。削除せずにトグルで除外できます。
- ローカル CLI 使用量 — この Mac の Claude Code と Codex のログをワンクリックでスキャンし、モデル別に今月のトークンを推定として集計。
プロバイダ別の内訳(ドーナツチャート)、予算ラインを引いた 6 か月トレンド、そして費用を費用最適化アドバイザーに渡す Ask AI ボタンが、これを締めくくります。請求ヘルス監視は、接続済みの有料サービスをクレジット切れ・上限到達・支払い遅延・アカウント停止についてプローブし、アラートを上げます — キーが止まろうとしているのを、止まる前に捉えます。
FrontierStack ユーザマニュアル · バージョン 1.0.0 · 第 15