Proxmox VE の監視

Proxmox REST API を使用して、Proxmox VE クラスター、ノード、仮想マシン、コンテナー、ストレージ、および Ceph の健全性を監視します。

cephcluster monitoringcontainerslxcnode monitoringproxmoxproxmox veqemurest apistorage monitoringvirtual machinesvirtualization

NetCrunch は、Proxmox Virtual Environment インフラストラクチャの統合監視を提供します。Proxmox REST API を使用して、Proxmox クラスター、物理 Proxmox ノード、QEMU 仮想マシン、および LXC コンテナーから、健全性、状態、パフォーマンスのデータを収集します。

Proxmox の監視では、インフラストラクチャを一元的かつ階層的に確認できます。

  • クラスターの状態とクォーラム
  • Proxmox ノードの可用性とリソース使用状況
  • データストアとストレージの使用状況
  • Ceph クラスターの状態
  • 仮想マシンとコンテナーのパフォーマンス
  • CPU、メモリ、ディスク、ネットワーク、スワップ、および pressure stall メトリック

NetCrunch は、単一の Proxmox ノードに直接接続することも、Proxmox クラスター全体から情報を取得することもできます。

要件

Proxmox の監視には、Proxmox VE API への読み取り専用アクセスを許可する認証情報が必要です。

サポートされている認証方法:

  • API Token(推奨)
  • Username and password

監視ユーザーには、ルートレベル /PVEAuditor ロールを割り当てる必要があります。

これにより、すべてのクラスターリソースへの読み取り専用アクセスが許可され、クラスター、ノード、ストレージ、VM、およびコンテナーを完全に可視化するために必要となります。

この要件は、サポートされているすべての Proxmox ユーザータイプに適用されます。

  • ローカル Proxmox ユーザー(例: user@pve
  • Linux PAM ユーザー(例: user@pam
  • LDAP または Active Directory ユーザー

可能な場合は API token を使用してください。対話型ユーザーパスワードを保存するより安全であり、ユーザーのログイン認証情報を変更せずに簡単にローテーションできます。

構成

NetCrunch には、Proxmox VE 用の事前構成済み自動監視パッケージが含まれています。ノードのオペレーティングシステムモニターを Proxmox VE に設定すると、NetCrunch は必要な監視設定を自動的に適用できます。

新しいノードの場合、Proxmox VE は自動的に検出できます。また、ノードの監視設定で Proxmox VE の監視を手動で有効にすることもできます。

有効な Proxmox 認証情報を指定すると、NetCrunch は Proxmox クラスターを検出し、監視対象として追加するよう求めます。

クラスター監視オプション

Create atlas nodes for Proxmox nodes
Proxmox クラスターのノードを自動的に Network Atlas に追加して監視します。

ノード監視オプション

Create nodes for guests
Proxmox ゲストシステムを自動的に Network Atlas に追加します。これは、既知の IP アドレスを持つゲストにのみ適用されます。

QEMU 仮想マシンの場合、ゲストの IP アドレスを NetCrunch で使用できるようにするには、Proxmox Guest Agent が実行されている必要があります。

クラスター監視

クラスター監視では、Proxmox クラスター全体の健全性と可用性を追跡します。

NetCrunch は、Proxmox クラスターのストレージ使用量メトリックを自動的に収集し、クラスターの主要な状態を監視します。

クラスターアラート

NetCrunch は、次の Proxmox クラスターの状態についてアラートを生成できます。

  • Ceph Cluster Warning
  • Ceph Cluster Critical
  • Cluster has no Quorum
  • Low free space on Datastore
  • Any Proxmox node goes offline

クラスター監視の範囲

クラスター監視は、次のような共有インフラストラクチャの状態に重点を置いています。

  • クラスタークォーラム
  • ノードメンバーシップ
  • データストアの使用状況
  • クラスター レベルのストレージの健全性
  • Proxmox 環境で Ceph を使用している場合の Ceph の健全性

Proxmox ノード監視

Proxmox ノードは、ノード上で Proxmox VE OS monitor を有効にすることで監視されます。

ノード監視では、Proxmox VE を実行している物理ホストまたは仮想ホストを追跡します。システムレベルのメトリックを収集し、ホストリソースの負荷を監視します。

ノードアラート

NetCrunch は、次の Proxmox ノードの状態についてアラートを生成できます。

  • High CPU Usage
  • High memory usage
  • Low free disk space
  • High swap usage
  • Possible storage bottleneck, based on IO Wait
  • Node CPU Pressure Warning, when cpu > 70% or loadavg / maxcpu > 0.7
  • Node CPU Saturation Critical, when cpu > 90% and loadavg / maxcpu > 1.0

パフォーマンスメトリック - Proxmox ノード

Proxmox node sensor は、ノードのリソース使用状況とパフォーマンスに関する包括的なメトリックを収集します。

プロセッサーメトリック

  • Processor/% CPU Usage
  • Processor/CPU Count

メモリメトリック

  • Memory/% Used
  • Memory/% Free
  • Memory/Total Bytes
  • Memory/Used Bytes
  • Memory/Free Bytes

ディスクメトリック

  • Disk/% Used
  • Disk/% Free
  • Disk/Total Bytes
  • Disk/Used Bytes
  • Disk/Free Bytes

システムメトリック

  • System/Uptime
  • System/% IO Wait

CPU Load メトリック

  • CPU Load/1 Minute Average
  • CPU Load/5 Minutes Average
  • CPU Load/15 Minutes Average

スワップメトリック

  • Swap/% Used
  • Swap/% Free
  • Swap/Total Bytes
  • Swap/Used Bytes
  • Swap/Free Bytes

仮想マシンとコンテナーの監視

NetCrunch がノードを Proxmox 仮想マシンまたはコンテナーとして検出すると、Proxmox/VM Sensor が自動的に追加されます。

追加のセンサー構成は必要ありません。

サポートされているゲストタイプ:

  • QEMU 仮想マシン
  • LXC コンテナー

QEMU 仮想マシンの場合、NetCrunch が Proxmox からゲストの IP アドレスを受信できるようにするには、Proxmox Guest Agent をインストールして実行する必要があります。

ゲストアラート

NetCrunch は、次のゲストの状態についてアラートを生成できます。

  • High guest processor utilization
  • High guest memory usage
  • Low free disk space on guest
  • CPU fully saturated, all tasks waiting
  • Applications waiting for CPU
  • Processes waiting for memory
  • System stalled due to memory pressure
  • Applications waiting for disk
  • All operations blocked by disk I/O

パフォーマンスメトリック - 仮想マシンとコンテナー

Proxmox/VM Sensor は、ゲストシステムのリソース使用状況に関する詳細なメトリックを収集します。

ゲストプロセッサーメトリック

  • Guest Processor/% CPU Usage
  • Guest Processor/CPU Count

ゲストメモリメトリック

  • Guest Memory/% Used
  • Guest Memory/% Free
  • Guest Memory/Total Bytes
  • Guest Memory/Used Bytes
  • Guest Memory/Free Bytes

ゲストスワップメトリック

ゲストスワップメトリックは、LXC コンテナーのみで使用できます。

  • Guest Swap/% Used
  • Guest Swap/% Free
  • Guest Swap/Total Bytes
  • Guest Swap/Used Bytes
  • Guest Swap/Free Bytes

ゲストディスクメトリック

  • Guest Proxmox.Guest.Disk/Read Bytes
  • Guest Proxmox.Guest.Disk/Write Bytes
  • Guest Proxmox.Guest.Disk/Read Bytes/sec
  • Guest Proxmox.Guest.Disk/Write Bytes/sec

ゲストネットワークメトリック

  • Guest Network/In Bytes
  • Guest Network/Out Bytes
  • Guest Network/In Bytes/sec
  • Guest Network/Out Bytes/sec

ゲスト CPU Pressure Stall メトリック

  • Guest CPU Pressure Stall/% Some
  • Guest CPU Pressure Stall/% Full

ゲストメモリ Pressure Stall メトリック

  • Guest Memory Pressure Stall/% Some
  • Guest Memory Pressure Stall/% Full

ゲスト IO Pressure Stall メトリック

  • Guest IO Pressure Stall/% Some
  • Guest IO Pressure Stall/% Full

ゲストシステムメトリック

  • Guest System/Process ID

Pressure Stall メトリック

Proxmox ゲスト監視では、利用可能な場合に pressure stall メトリックが含まれます。

Pressure stall メトリックは、単純な使用率の値だけでは明らかにならないリソース競合を特定するのに役立ちます。

CPU pressure
CPU リソースを使用できないためにタスクが遅延している時間を示します。
Memory pressure
メモリを使用できない、または reclaim アクティビティーによって実行がブロックされているために、プロセスが遅延している時間を示します。
IO pressure
ディスクまたはストレージ I/O によってタスクがブロックされている時間を示します。

% Some メトリックは、少なくとも一部のタスクがリソースの待機状態にあったことを示します。

% Full メトリックは、アイドル状態ではないすべてのタスクが待機状態にあったことを示します。通常、これはより深刻な状態です。

推奨される監視ワークフロー

Proxmox VE の監視を追加する場合は、次の手順を使用します。

Proxmox ノードを追加または検出する

Proxmox ノードを Network Atlas に追加するか、NetCrunch に自動的に検出させます。

Proxmox VE OS 監視を有効にする

自動的に検出されなかった場合は、OS 監視タイプを Proxmox VE に設定します。

Proxmox 認証情報を指定する

API token、または /PVEAuditor ロールが割り当てられた Username and password を使用します。

検出されたクラスターを追加する

認証情報が確認されると、NetCrunch は Proxmox クラスターを検出し、監視対象として追加するよう求めます。

ノードの自動作成を有効にする

Create atlas nodes for Proxmox nodes を使用して、Proxmox クラスターのノードを自動的に追加します。

ゲストの検出を有効にする

Create nodes for guests を使用して、IP アドレスが判明している仮想マシンとコンテナーを Atlas に自動的に追加します。

アラートと監視パックを確認する

自動的に割り当てられた監視パッケージを確認し、Proxmox 環境に通常とは異なるリソース使用パターンがある場合は、しきい値を調整します。

ベストプラクティス

Use API tokens
Username and password 認証ではなく、API token を優先してください。
Assign minimum required permissions
読み取り専用の監視アクセスには、/PVEAuditor ロールを使用します。
Monitor both cluster and nodes
クラスター監視では共有インフラストラクチャの問題を検出し、ノード監視ではホストレベルのリソース問題を検出します。
Enable Guest Agent for QEMU VMs
Proxmox Guest Agent がない場合、QEMU 仮想マシンの IP アドレスを NetCrunch で使用できない可能性があります。
Review datastore thresholds
ストレージアラートは、運用ポリシーを反映する必要があります。小規模な Proxmox 環境では、大規模なクラスターとは異なる空き容量のしきい値が必要になる場合があります。
Watch IO Wait and pressure stall metrics
CPU 使用率が高いだけでは、すべてのパフォーマンス問題を説明できません。IO Wait と pressure stall メトリックは、ストレージおよびスケジューリングのボトルネックの特定に役立ちます。
Add guests to the Atlas when useful
ゲストノードによって可視性が向上しますが、IP アドレスと名前付けが信頼できる場合にのみ、自動的に追加してください。

トラブルシューティング

クラスターが検出されない

次の項目を確認してください。

  • NetCrunch Server または Probe から Proxmox API に到達できる
  • 認証情報が有効である
  • ユーザーまたは token に /PVEAuditor ロールが割り当てられている
  • 選択した Proxmox ノードが想定したクラスターのメンバーである

Proxmox ノードが自動的に追加されない

Create atlas nodes for Proxmox nodes が有効になっているか確認してください。

また、NetCrunch が Proxmox API から返された Proxmox ノードのアドレスを解決し、到達できることを確認してください。

ゲストシステムが自動的に追加されない

Create nodes for guests が有効になっているか確認してください。

QEMU 仮想マシンの場合は、次の項目を確認してください。

  • Proxmox Guest Agent がインストールされている
  • Proxmox Guest Agent が実行されている
  • Proxmox が API 経由でゲストの IP アドレスを報告している

LXC コンテナーの場合は、Proxmox がコンテナーのネットワークアドレスを報告できることを確認してください。

ゲストメトリックが不完全である

一部のメトリックは、ゲストタイプと Proxmox データの可用性に依存します。

例:

  • ゲストスワップメトリックは LXC コンテナーでのみ使用可能
  • QEMU VM のゲスト IP 検出には Guest Agent が必要
  • Pressure stall メトリックは、ゲストとホストのサポート状況に依存

概要

NetCrunch の Proxmox 監視は、Proxmox VE スタック全体を階層的に可視化します。

監視対象:

  • Proxmox クラスター
  • Proxmox ノード
  • データストアとストレージの使用状況
  • Ceph の健全性
  • QEMU 仮想マシン
  • LXC コンテナー
  • ゲストのリソース使用状況と pressure stall の状態

クラスター レベルの監視、ノード レベルの監視、自動ゲスト検出を組み合わせることで、NetCrunch は管理者に Proxmox インフラストラクチャ全体の運用状況を一元的に把握できる環境を提供します。