Nutanix総まとめ!主要コンポーネントと管理機能を総復習【NCA 7.5対策】
はじめに
ここまでNCA対策として、Nutanixの基本的な仕組みを学習してきました。
最初は、
「Nutanixって何?」
というところから始まり、
- HCI
- AOS
- AHV
- CVM
- DSF
- Prism
- VM
- Network
- Storage
- Cluster
- LCM
- License
- NCC
- Alert / Event
- Performance
- Volumes
- Support
など、さまざまな用語が登場しました。
一つひとつを理解していても、
「結局これらがどうつながっているの?」
となってしまうことがあります。
そこで今回は、これまで学習してきた内容をつなげながら、
Nutanix環境の全体像
を総復習していきましょう。
まずはNutanixとは?
Nutanixを理解するうえで、最初に登場したのが、
HCI(Hyperconverged Infrastructure)
です。
従来の3Tier Infrastructureでは、
Compute
│
Network
│
Storage
のように、Server・Network・Storageをそれぞれ別の仕組みとして構築することが一般的でした。
Nutanixでは、
ComputeとStorageなどをSoftwareによって統合的に扱うHCI
という考え方を採用しています。
┌─────────────────────┐
│ Nutanix Cluster │
│ │
│ Compute + Storage │
│ │
└─────────────────────┘
これによってInfrastructureをよりシンプルに管理できるようにします。
NodeとCluster
Nutanix環境の基本単位となるのが、
Node
です。
Nodeは、簡単にいえばNutanix Clusterを構成するServerです。
Node 1
Node 2
Node 3
複数のNodeをまとめることで、
Cluster
を構成します。
Nutanix Cluster
┌────────┐
│ Node 1 │
├────────┤
│ Node 2 │
├────────┤
│ Node 3 │
└────────┘
各Nodeが持つComputeやStorage Resourceを組み合わせて利用します。
Scale-Out
NutanixではResourceが必要になった場合、
Nodeを追加してClusterを拡張する
Scale-Outという考え方が重要です。
3 Nodes
Node ─ Node ─ Node
↓
4 Nodes
Node ─ Node ─ Node ─ Node
Nodeを追加することで、ComputeやStorage Resourceを増やしていきます。
NCAでは、
Nutanix = Scale-Out Architecture
という基本を覚えておきましょう。
AHVとは?
Node上でVMを動作させるために利用されるのが、
AHV
です。
AHVはNutanixが提供するHypervisorです。
VM
VM
VM
│
▼
AHV
│
▼
Physical Node
Hypervisorは、Physical Server上で複数のVMを動作させるためのSoftwareです。
AHVはType 1 Hypervisorとして動作します。
AHVとVM
AHV上では、
VM A
VM B
VM C
などのVirtual Machineを動作させます。
VMには、
- vCPU
- Memory
- vDisk
- vNIC
などのVirtual Resourceを割り当てます。
VM
│
├─ vCPU
├─ Memory
├─ vDisk
└─ vNIC
これらのResourceを利用してGuest OSやApplicationを動作させます。
CVMとは?
Nutanix Architectureで非常に重要なのが、
CVM(Controller Virtual Machine)
です。
各NodeにはCVMが配置されます。
Node 1
├─ AHV
└─ CVM
Node 2
├─ AHV
└─ CVM
Node 3
├─ AHV
└─ CVM
CVMはNutanixのStorageやCluster Serviceなどを支える重要なController VMです。
Nutanixを理解するときは、
CVMは普通のApplication VMとは役割が違う
ことを意識しましょう。
AOSとは?
AOS(Acropolis Operating System)
は、Nutanix Infrastructureの中核となるSoftwareです。
Nutanix Clusterでは、
Hardware
│
▼
AHV / Virtualization
│
▼
AOS / Nutanix Services
という形で、SoftwareによってInfrastructureを制御します。
AOSはNutanixの分散StorageやData Serviceなどを提供する中心的な存在です。
DSFとは?
NutanixのStorage Architectureで重要なのが、
DSF(Distributed Storage Fabric)
です。
各Nodeに搭載されたStorageをまとめて、
Cluster全体の分散Storage
として利用します。
Node 1 Storage ─┐
Node 2 Storage ─┼─→ DSF
Node 3 Storage ─┘
│
▼
Distributed Storage
これによって、複数NodeのStorage Resourceを統合的に利用できます。
NutanixのStorage構造
通常のVM Storageでは、
Physical Disk
↓
Storage Pool
↓
Storage Container
↓
vDisk
↓
VM
という関係を学習しました。
特に、
Storage Container
と
vDisk
の違いを整理しておきましょう。
Storage Containerは、
論理的なStorage領域
です。
vDiskは、
VMが利用するVirtual Disk
です。
Data Locality
Nutanix Storageでは、
Data Locality
という考え方も重要です。
基本的な考え方は、
VMが動作しているNodeに、そのVMが利用するDataをできるだけLocalに配置する
というものです。
Node 1
VM A
│
▼
Local Storage Data
Local Accessを活用することで、効率的なStorage Accessを実現します。
RFとは?
Storage Dataを保護するために、
RF(Replication Factor)
という考え方があります。
たとえばRF2では、Dataを複数のFailure Domainに保持することで障害へ備えます。
Data
│
├─ Copy
│
└─ Copy
NCAでは、
RF = Data Resiliencyに関係する
と理解しておきましょう。
Prismとは?
Nutanix環境を管理するためのInterfaceが、
Prism
です。
Prismから、
- VM
- Storage
- Network
- Health
- Alert
- Event
- Performance
などを管理・確認できます。
Administrator
│
▼
Prism
│
┌────┼─────┬─────┐
▼ ▼ ▼ ▼
VM Storage Network Health
これまでの記事でも何度も登場しました。
Nutanixを管理するときの中心的なInterfaceです。
Prism ElementとPrism Central
Prismには、
Prism Element
と
Prism Central
があります。
Prism Elementは、
個々のClusterを管理する
ために利用します。
Prism Element
│
▼
Cluster A
Prism Centralは、
複数Clusterを集中管理する
ために利用します。
Prism Central
│
┌────────┼────────┐
▼ ▼ ▼
Cluster A Cluster B Cluster C
つまり、
PE = 個別Cluster
PC = 複数Clusterの集中管理
と覚えましょう。
VM管理
PrismからVMの基本操作を行えます。
たとえば、
- Create
- Start
- Stop
- Restart
- Clone
- Snapshot
- Delete
などです。
ここで特に覚えておきたいのが、
Clone
と
Snapshot
です。
Cloneは、
VMを複製する
ために利用します。
Snapshotは、
特定時点の状態を保持する
ために利用します。
ただし、
Snapshot = Backupそのもの
ではないことに注意しましょう。
NutanixのNetwork
VMは、
vNIC
を利用してNetworkへ接続します。
基本的な流れは、
VM
↓
vNIC
↓
Subnet
↓
Virtual Switch
↓
Physical NIC
↓
Physical Switch
↓
External Network
です。
SubnetとVLAN
AHV環境では、VMが接続するNetworkを、
Subnet
として管理します。
そしてVLAN Networkでは、
VLAN ID
によってNetworkを分離できます。
VM A
↓
Subnet A
↓
VLAN 100
VM B
↓
Subnet B
↓
VLAN 200
異なるVLAN同士を通信させる場合には、L3 Routingが必要になります。
StorageとNetworkをつなげて考える
VMは、
VM
┌──┴──┐
▼ ▼
vDisk vNIC
│ │
▼ ▼
Storage Network
というように、Computeだけで動いているわけではありません。
そのためVMの問題を調査するときには、
- Compute
- Storage
- Network
をまとめて考える必要があります。
LCMとは?
Nutanix環境のSoftwareやFirmwareなどのLifecycleを管理するのが、
LCM(Life Cycle Manager)
です。
基本的な流れは、
Inventory
↓
Update確認
↓
Pre-Check
↓
Update
↓
確認
です。
LCMを利用することで、Nutanix環境のLifecycle Managementを行います。
LCMとNCCを混同しない
ここは整理しておきましょう。
LCM
は、
SoftwareやFirmwareなどのLifecycle・Update管理
です。
NCC
は、
ClusterのHealth Check
です。
LCM
↓
Update / Lifecycle
NCC
↓
Health Check
役割がまったく違います。
License
Nutanix Softwareを利用するためには、
License
も重要です。
これまで、
- Starter
- Pro
- Ultimate
などのEditionについて学習しました。
Licenseでは、
利用する機能や環境に応じて適切なLicenseを管理する
ことが重要です。
また、
License
≠
Software Version
です。
LicenseとVersionは別の概念として整理しましょう。
NCCとは?
NCC(Nutanix Cluster Check)
は、
Nutanix ClusterのHealthを確認するためのツールです。
Cluster
↓
NCC
↓
Health Checks
たとえば、
- Hardware
- Storage
- Network
- Configuration
- Services
などの状態確認に役立ちます。
Healthとは?
Healthは、
現在のSystemやComponentがどのような状態なのか
を確認するための情報です。
Cluster Health
├─ Node
├─ VM
├─ Storage
├─ Network
└─ Services
PrismからHealthを確認し、必要に応じてNCCなどを利用して詳しく調査します。
Alertとは?
Alertは、
問題や注意すべき状態を管理者へ知らせるもの
です。
Problem
↓
Alert
↓
Administrator
AlertではSeverityも重要です。
たとえば、
- Info
- Warning
- Critical
など、問題の重大度を判断する情報があります。
Eventとは?
Eventは、
Nutanix環境内で何が起きたのかを記録するもの
です。
たとえば、
09:00 VM Start
09:30 Network Change
09:35 VM Restart
といった出来事を確認できます。
障害調査では、
問題発生前に何が変更されたのか
を確認するためにも役立ちます。
Health・Alert・Eventの違い
ここはNCA対策として整理しておきましょう。
Health
↓
今どうなっている?
Alert
↓
問題・注意がある!
Event
↓
何が起きた?
この3つを混同しないようにしましょう。
Performance Monitoring
「VMが遅い」といった問題では、
Performance
を確認します。
代表的な指標として、
- CPU
- Memory
- IOPS
- Latency
- Throughput
があります。
IOPS・Latency・Throughput
Storage Performanceで特に重要なのが、この3つです。
| 指標 | 意味 |
|---|---|
| IOPS | 1秒間のI/O処理回数 |
| Latency | I/Oの応答時間 |
| Throughput | 単位時間あたりのData転送量 |
覚え方は、
IOPS
↓
何回?
Latency
↓
どのくらい時間がかかった?
Throughput
↓
どのくらいの量?
です。
Bottleneck
Performance問題では、
Bottleneck
を探します。
Bottleneckとは、
System全体のPerformanceを制限している部分
です。
たとえば、
CPU → Normal
Memory → Normal
Network → Normal
Storage → High Latency
なら、
StorageがBottleneckになっている可能性
があります。
Nutanix Volumes
通常のVM Storageとは別に、
Nutanix Volumes
についても学習しました。
Volumesは、
Nutanixの分散Storageを利用してBlock Storageを提供する機能
です。
Server / VM
│
▼
iSCSI
│
▼
Volume Group
│
┌───┼───┐
▼ ▼ ▼
Vol Vol Vol
Volume Group
Volume Groupは、
複数のVolumeをまとめて管理するための単位です。
Volume Group
│
├─ Volume 1
├─ Volume 2
└─ Volume 3
そしてVolumeは、Block Storageとして利用するStorage領域です。
iSCSI
Volumesでは、
iSCSI
が重要です。
iSCSIは、
IP Networkを利用してBlock Storageへアクセスする仕組み
です。
Initiator
│
│ iSCSI
▼
Target
│
▼
Volume
InitiatorとTarget
iSCSIでは、
Initiator = Storageを利用する側
Target = Storageを提供する側
です。
Server
Initiator
│
▼
iSCSI
│
▼
Storage
Target
この関係を覚えておきましょう。
vDiskとVolumeの違い
ここも復習しておきましょう。
通常のVM Storageは、
VM
↓
vDisk
↓
Storage Container
です。
Volumesでは、
Server / VM
↓
Volume Group
↓
Volume
となります。
つまり、
vDisk = VMの通常のVirtual Disk
Volume = Block Storageとして提供されるStorage領域
と整理できます。
Nutanix Support
自分たちだけで問題を解決できない場合には、
Nutanix Support
を利用します。
Problem
↓
Troubleshooting
↓
原因不明
↓
Support Case
Support Caseでは、問題の状況をできるだけ具体的に伝えることが重要です。
Log
Troubleshootingでは、
Log
も重要です。
LogにはSystem内部で発生した処理やErrorなどの情報が記録されています。
Event
↓
何が起きた?
Log
↓
内部で具体的に何が起きていた?
という違いを意識しましょう。
Nutanix全体を1枚で整理
ここまでの内容をまとめてみましょう。
Prism
│
┌───────────┼───────────┐
│ │ │
▼ ▼ ▼
VM Health Management
│ │ │
┌────┴────┐ │ ┌────┼────┐
▼ ▼ ▼ ▼ ▼ ▼
vCPU vNIC NCC LCM Alert Event
Memory │
vDisk ▼
│ Subnet
▼ │
Storage ▼
Container VLAN
│
▼
DSF
│
▼
CVM
│
▼
Cluster
│
┌───┼─────────────┐
▼ ▼ ▼
Node Node Node
│
▼
AHV
│
▼
VM
すべての用語を個別に覚えるのではなく、
「どこに存在して、何を担当しているのか」
を考えると理解しやすくなります。
「何を使う?」で覚える
NCA対策では、
目的から機能を選べるようにする
ことも重要です。
| やりたいこと | 主に確認・利用するもの |
|---|---|
| VMを作成したい | Prism |
| VMを複製したい | Clone |
| 特定時点の状態を保持したい | Snapshot |
| VMをNetworkへ接続したい | vNIC / Subnet |
| Networkを論理的に分離したい | VLAN |
| VMへDiskを提供したい | vDisk |
| Block Storageを提供したい | Volumes |
| 複数Volumeをまとめたい | Volume Group |
| IP経由でBlock Storageへ接続したい | iSCSI |
| ClusterのHealthを確認したい | Prism / NCC |
| 問題の通知を確認したい | Alert |
| 過去に何が起きたか確認したい | Event |
| VMが遅い原因を調査したい | Performance |
| Updateを管理したい | LCM |
| 複数Clusterを管理したい | Prism Central |
| 詳細な障害情報を確認したい | Log |
| 自分たちで解決できない | Nutanix Support |
この対応関係を理解できると、Scenario形式の問題にも対応しやすくなります。
「VMが遅い」と言われたら?
ここからは実践的に考えてみましょう。
ユーザーから、
「VMが遅いです」
と連絡が来ました。
まず、
VMが遅い
↓
Prism
↓
Performance
を確認します。
そして、
CPU?
Memory?
Storage?
Network?
と原因を切り分けます。
Storageが怪しい場合には、
IOPS
Latency
Throughput
などを確認します。
「Clusterがおかしい」と言われたら?
Cluster全体に問題がありそうなら、
Cluster Problem
↓
Prism
↓
Health / Alert
↓
NCC
と調査できます。
さらに、
Event
↓
問題発生前に何が起きた?
を確認します。
「昨日からおかしい」と言われたら?
この場合は、
Event
が重要な手掛かりになります。
昨日
│
├─ Configuration Change
├─ VM Restart
├─ Update
└─ Network Change
などを確認し、
問題発生前に何が変化したのか
を調査します。
「Updateしたい」と言われたら?
SoftwareやFirmwareなどをUpdateする場合には、
LCM
を考えます。
Inventory
↓
Update確認
↓
Pre-Check
↓
Update
Update前後にはClusterのHealth確認も重要です。
「Block Storageが欲しい」と言われたら?
Block Storageを提供したい場合には、
Nutanix Volumes
です。
Server
↓
iSCSI
↓
Volume Group
↓
Volume
通常のvDiskとの違いを意識しましょう。
「複数Clusterをまとめて管理したい」と言われたら?
この場合は、
Prism Central
です。
Prism Central
│
┌────┼────┐
▼ ▼ ▼
C1 C2 C3
個別Clusterを管理するPrism Elementとの違いを理解しておきましょう。
トラブルシューティングの総復習
問題が発生した場合の基本的な流れも整理します。
① Problem
↓
② Impact確認
↓
③ Prism
↓
④ Health / Alert
↓
⑤ Event
↓
⑥ Performance
↓
⑦ NCC
↓
⑧ Knowledge Base / Log
↓
⑨ Support Case
↓
⑩ 問題対応
↓
⑪ Health再確認
実際の手順は問題によって異なりますが、
いきなり原因を決めつけず、情報を集めて範囲を絞る
という考え方が重要です。
はちみつ屋さんでNutanix全体を整理
最後に、これまでのNutanix環境をすべて、
はちみつ屋さん
で考えてみましょう。
Clusterは店舗グループ
はちみつ屋さんグループ
│
┌─────┼─────┐
▼ ▼ ▼
店舗A 店舗B 店舗C
店舗グループ全体が、
Cluster
です。
各店舗が、
Node
です。
AHVは店舗スペースの管理人
各店舗には、複数の売り場があります。
店舗A
│
├─ 売り場1
├─ 売り場2
└─ 売り場3
この売り場が、
VM
です。
売り場を配置・管理する仕組みが、
AHV
のイメージです。
CVMは店舗運営スタッフ
各店舗には、
店舗全体の仕組みを支える専門スタッフ
がいます。
これが、
CVM
です。
店舗
│
├─ 売り場
├─ 売り場
└─ 運営スタッフ
↓
CVM
DSFは共同倉庫
各店舗の倉庫を、
グループ全体の巨大な共同倉庫
として利用します。
店舗A倉庫 ─┐
店舗B倉庫 ─┼─→ 巨大な共同倉庫
店舗C倉庫 ─┘
これが、
DSF
です。
Prismは本部の管理画面
本部から、
- 店舗
- 売り場
- 倉庫
- Network
- 問題
などを確認する管理画面があります。
これが、
Prism
です。
NCCは定期点検
各店舗が正常か、
レジOK?
倉庫OK?
Network OK?
設備OK?
と点検します。
これが、
NCC
です。
Alertは警報
冷蔵庫の温度が上がったら、
ピーピー!
温度が高い!
と通知します。
これが、
Alert
です。
Eventは店舗日誌
09:00 開店
10:00 設定変更
11:00 冷蔵庫交換
という記録が、
Event
です。
Performanceは店舗の処理能力
店員は忙しい?
↓
CPU
作業場所は足りる?
↓
Memory
何回商品を出せる?
↓
IOPS
商品が届くまで何秒?
↓
Latency
何箱運べる?
↓
Throughput
これが、
Performance Monitoring
です。
LCMは設備更新担当
店舗設備を、
現在のVersion確認
↓
新しいVersion確認
↓
問題がないかCheck
↓
Update
する担当が、
LCM
です。
Volumesは貸し倉庫サービス
共同倉庫のStorageを、
外部のお店にもBlock Storageとして貸し出す
仕組みが、
Nutanix Volumes
です。
外部のお店
↓
iSCSI
↓
貸し倉庫センター
↓
Volume Group
Supportはメーカーサポート
どうしても自分たちで問題を解決できなければ、
メーカーへ問い合わせます。
これが、
Nutanix Support
です。
最重要用語まとめ
最後に、NCA対策として重要な用語をまとめます。
| 用語 | 一言でいうと |
|---|---|
| HCI | Compute・StorageなどをSoftwareで統合 |
| Node | Clusterを構成するServer |
| Cluster | 複数Nodeをまとめたもの |
| AHV | NutanixのHypervisor |
| VM | Virtual Machine |
| AOS | Nutanix Infrastructureの中核Software |
| CVM | 各NodeでNutanix Serviceを支えるController VM |
| DSF | 分散Storage |
| Storage Pool | Storage Resourceをまとめる |
| Storage Container | 論理Storage領域 |
| vDisk | VMのVirtual Disk |
| vNIC | VMのVirtual NIC |
| Subnet | AHVでVM Networkを管理するObject |
| VLAN | Networkを論理的に分離 |
| Prism Element | 個別Cluster管理 |
| Prism Central | 複数Clusterの集中管理 |
| LCM | Lifecycle / Update管理 |
| NCC | Cluster Health Check |
| Health | 現在の状態 |
| Alert | 問題・注意を通知 |
| Event | 発生した出来事の記録 |
| IOPS | 1秒間のI/O回数 |
| Latency | I/O応答時間 |
| Throughput | 単位時間あたりのData量 |
| Volumes | Block Storage Service |
| Volume Group | Volumeをまとめる単位 |
| iSCSI | IP Network経由でBlock Storageへ接続 |
| Initiator | Storageを利用する側 |
| Target | Storageを提供する側 |
| Support Case | Nutanix Supportへの問い合わせ |
最後に覚えておきたい関係
NCAでは単語だけではなく、
用語同士の関係
を理解することが重要です。
Node
↓
Cluster
Physical Server
↓
AHV
↓
VM
VM
↓
vDisk
↓
Storage Container
↓
DSF
VM
↓
vNIC
↓
Subnet
↓
VLAN
Administrator
↓
Prism
Cluster Health
↓
NCC
問題発生
↓
Alert
何が起きた?
↓
Event
Performance
↓
CPU / Memory
IOPS / Latency / Throughput
Block Storage
↓
Volumes
↓
Volume Group
↓
Volume
Update
↓
LCM
解決できない問題
↓
Nutanix Support
この関係が頭の中でつながっていれば、NutanixのArchitectureや管理機能をかなり整理できています。
まとめ
今回は、NCA対策として学習してきたNutanixの内容を総復習しました。
Nutanixでは、
AHV
がVMを動作させ、
CVM・AOS・DSF
がNutanix Infrastructureを支え、
Prism
から環境を管理します。
Storageでは、
Storage Pool・Storage Container・vDisk
を利用し、
Block Storageが必要な場合には、
Nutanix Volumes・Volume Group・iSCSI
を利用できます。
運用では、
Health・Alert・Event・Performance・NCC
を利用して環境を監視・調査します。
SoftwareやFirmwareなどのLifecycle Managementには、
LCM
を利用します。
そして、自分たちだけでは解決できない問題については、
Nutanix Support
を利用します。
最初は大量の用語が登場して難しく見えるNutanixですが、
Virtualization
│
├─ AHV
└─ VM
Storage
│
├─ DSF
├─ Container
├─ vDisk
└─ Volumes
Management
│
├─ Prism
├─ LCM
└─ License
Monitoring
│
├─ Health
├─ NCC
├─ Alert
├─ Event
└─ Performance
Support
│
├─ Log
├─ Knowledge Base
└─ Support Case
というように役割ごとに分けると、全体像が見えてきます。
NCA対策では、
「この用語は何か?」
だけではなく、
「何をしたいときに使うのか?」
「他の機能とどうつながっているのか?」
まで意識して復習していきましょう。
これで、NCA 7.5対策として進めてきたNutanix基礎編は完結です。