Proč hyperkonvergence a kdy dává smysl
Hyperkonvergovaná infrastruktura (HCI) konsoliduje výpočetní výkon, úložiště a síť do jediné softwarově definované platformy provozované na standardních x86/ARM serverech. Mezi nejrozšířenější platformy patří VMware vSAN (součást ekosystému vSphere) a Nutanix (AOS s hypervizory AHV/ESXi/Hyper-V). HCI zjednodušuje provoz, zrychluje nasazení, umožňuje škálování přidáváním nodů a nabízí automatizovanou správu životního cyklu. Typické scénáře zahrnují konsolidaci datových center, VDI, databáze a aplikační clustery, ROBO/edge lokality a privátní cloud s Kubernetes.
Referenční architektura HCI: stavební bloky
- Hypervizor: vSphere/ESXi pro vSAN, AHV (KVM) nebo ESXi pro Nutanix.
- Distribuované úložiště: vSAN Datastore vs. Nutanix ADSF (AOS Distributed Storage Fabric).
- Management: vCenter + vSAN UI/ARIA Operations vs. Nutanix Prism Element/Central.
- Síť: datová (VM/overlay), storage replikace (vSAN/Nutanix), management/out-of-band, vMotion/Live Migration.
- Volitelné služby: souborové/sharované služby (vSAN File Services, Nutanix Files), objektové (Nutanix Objects), Kubernetes (Tanzu, Nutanix Kubernetes Engine).
Návrh hardwaru: profily uzlů a diskové skupiny
- Compute profily: „dense CPU“, „memory heavy“, „balanced“. Zohledněte NUMA zarovnání a dimenzování paměti zejména pro databázová a in-memory pracovní zatížení.
- Úložiště: all-flash s NVMe cache (write buffer) a NVMe/SAS SSD pro kapacitu. vSAN využívá cache+capacity diskové skupiny; Nutanix pracuje s per-node cache (OPLOG/extent store) bez explicitních diskových skupin.
- Urychlení IO: NVMe-oF/PCIe, volitelně RDMA (RoCE) pro vSAN Express Storage Architecture (ESA) a AOS (výskyt RDMA v některých validovaných konfiguracích).
- Síťové prvky: 25/100 GbE spine-leaf architektura, QoS pro storage replikaci, LACP/VLT. Podpora jumbo rámců, ale pouze při end-to-end konzistentním nasazení.
- Form factor: 1U „dense“ pro edge/ROBO, 2U s více disky pro core. Dbejte na efektivní chlazení NVMe modulů a dostatek slotů pro budoucí rozšíření.
Topologie a domény selhání
Replikace v HCI je citlivá na latenci a domény selhání. Při návrhu je třeba použít:
- Fault Domains: skupiny serverů sdílející společné riziko (např. rack, PDU). vSAN i Nutanix umožňují konfiguraci tak, že repliky dat se nacházejí v různých doménách selhání.
- 2-Node/ROBO: vyžadují witness (vSAN Witness Appliance / Nutanix Witness) umístěný ve třetí lokalitě nebo v cloudu pro zajištění quorum.
- Stretched/Metro cluster: synchronní replikace mezi dvěma lokalitami s latencí obvykle < 5 ms a třetím witness pro rozhodování o konsenzu.
VMware vSAN: architektura a klíčové vlastnosti
- Datastore: sdílený vSAN datastore napříč všemi uzly clusteru, řízený prostřednictvím Storage Policy Based Management (SPBM).
- ESA vs. OSA: Express Storage Architecture (moderní, pouze all-flash, efektivnější log-structured IO) vs. Original Storage Architecture (cache+capacity diskové skupiny).
- Storage Policies: FTT/FTM (RAID-1/5/6), stripe width, checksum, object space reservation, IOPS limit, šifrování.
- Datové služby: deduplikace/komprese (per disk group/ESA), šifrování dat na úložišti (KMS), vSAN File Services (NFS), snapshoty/klony, HCI Mesh (sdílení kapacity mezi clustery).
- Integrace: vMotion, DRS, HA, vSphere Lifecycle Manager (vLCM) pro správu firmware/driverů/ESXi imagí.
Nutanix AOS: architektura a klíčové vlastnosti
- DSF (ADSF): distribuovaná log-structured fabric se službami na úrovni jednotlivých VM; data i metadata jsou replikována napříč uzly clusteru.
- Hypervizor: nativní AHV (KVM) s managementem Prism, případně ESXi/Hyper-V. AHV nabízí jednodušší licencování a hlubší integraci s Prismem.
- Datové služby: deduplikace, komprese, EC-X (erasure coding), šifrování (KMS), Metro Availability, Leap (DR orchestrace), Files (NAS), Objects (S3 kompatibilní), Volumes (iSCSI).
- Lifecycle: LCM pro orchestraci aktualizací BIOSu, firmwaru, AOS a hypervizoru v rámci jediného „one-click“ procesu.
- Správa: Prism Element (pro správu clusteru), Prism Central (pro multi-cluster management), Calm (orchestrace aplikací), Karbon (Kubernetes).
Výkon a latence: zásady dimenzování
- IO profil: OLTP s nízkou latencí (malá náhodná IO) versus analytické/VDI workloady (sekvenční bursty). Zvažte poměr cache/kapacita a typ SSD (write-intensive modely pro cache).
- Síť: vyhrazené VLANy pro storage a VM provoz; latence mezi uzly < 1 ms v rámci clusteru; u Metro clusterů < 5 ms RTT.
- Overhead replikace: RAID-1 významně zvyšuje zápisové IO, RAID-5/6/EC snižují kapacitní režii, ale mají vyšší nároky na CPU a latenci zápisu.
- NUMA a CPU: vyhněte se přesahům VM přes více NUMA uzlů; u databází preferujte vyšší frekvenci před extrémním počtem jader.
Politiky a SLA: jak mapovat požadavky aplikací
HCI funguje na bázi per-VM/per-vDisk politik. Doporučený postup:
- Segmentujte workloady (kritické databáze, VDI, general purpose, zálohy/archivy).
- Pro každý segment definujte policy: úroveň ochrany (FTT/EC-X), limity IOPS/průtoku, cílová latence, retence snapshotů.
- Automatizujte přiřazení politik pomocí tagů/kategorií, šablon a Infrastructure as Code (vSphere Tags/Storage Policies, Nutanix Categories/Calm barevné šablony).
Bezpečnost a compliance
- Šifrování: vSAN Encryption na úrovni datastore (externí či integrovaný KMS), Nutanix nabízí Native/SED šifrování a KMS s podporou KMIP, šifrování dat v přenosu (TLS, IPsec podle potřeby).
- Oddělení tenanta: RBAC, kategorie a segmentace sítě (NSX/Tanzu, Nutanix Flow/Flow Microsegmentation).
- Audit a logování: integrace do SIEM systémů, detailní logování událostí z hypervizoru, storage a managementu.
Provozní model a životní cyklus
- Update domény: vSAN i Nutanix podporují rolling upgrade bez výpadku; naplánujte „drain“ uzlu, evakuaci dat (vSAN) nebo rebuild bandwidth (AOS).
- Kapacitní management: sledujte volnou kapacitu (doporučený headroom 25–30 %), aby bylo možné provádět rebuildy a erasure coding bez „stop-the-world“ scénářů.
- Monitoring: ARIA Operations/Log Insight a Skyline Health (vSAN) vs. Prism Insights/Cluster Health (Nutanix). Sledování IOPS, latence, rebalancingu a hotspotů.
Zálohování a DR
- Snapshoty vs. zálohování: snapshoty jsou krátkodobé a aplikačně konzistentní s příslušnými guest-toolsy. Pro dlouhodobou retenci využijte VADP-kompatibilní zálohy (vSphere) nebo integrovaná řešení jako Nutanix Mine či třetí strany.
- Replikace: vSAN stretched/obalené LUNy, vSphere Replication/SRM; u Nutanix nativní Async/Sync/Metro replikace s orchestrátorem Leap. Pravidelně testujte DR runbooky.
Migrace a přechod z klasického SAN/NAS
- Inventura workloadů: měření IOPS/latence, určení RPO/RTO, licenční omezení (databáze, OS).
- Pilotní cluster: ověření výkonu a podpory politik, proof of concept s nejkritičtější aplikací.
- Datová migrace: vMotion/Storage vMotion (vSphere), Nutanix Move či nástroje třetích stran pro P2V/V2V transfery.
- Cut-over: fázovaný nebo „big-bang“ přechod podle závislostí; záložní plán pro rollback s časovou rezervou.
Licenční a ekonomický model
- vSAN: licence per CPU/host nebo per-core dle edice a smluvních podmínek, edice (Standard/Advanced/Enterprise/Enterprise Plus) se liší funkcemi (stretched cluster, datové služby, HCI Mesh).
- Nutanix: subscription model per node/per core (Starter/Pro/Ultimate), zahrnuje AOS a dle varianty AHV/Files/Objects/Flow. AHV eliminuje náklady na licence hypervizoru ESXi.
- TCO: porovnejte CAPEX (serverové uzly, softwarové licence) a OPEX (energie, prostor, provozní náklady). Zohledněte úspory díky zjednodušenému provozu a rychlejšímu provisioningu.
Edge a ROBO implementace
- 2-node s witness: minimální hardwarová stopa, lokální běh kritických VM, centrální správa (vCenter/Prism Central).
- Automatizace: image-based nasazení (vLCM/ESXi Image, Nutanix Foundation Central), zero-touch deployment, politiky řízení zdrojů.
- Omezená konektivita: cachování managementu, lokální DNS/NTP služby, watchdog pro autonomní obnovu provozu.
Nejčastější chyby a jak se jim vyhnout
- Nedostatečná síť: storage replikace běžící přes přetížené 10GbE bez QoS; řešení: upgradovat na 25GbE+, oddělit VLANy a monitorovat latenci na p99.
- Podceněný cache tier: malý write buffer vede k vyšší latenci; řešení: NVMe cache s vysokou odolností a kapacitou (min. 10 % write working setu).
- Chybějící headroom: cluster provozovaný na 80–90 % kapacity brání rebuildům; řešení: plánovat rozšiřování dříve a udržovat rezervu 25–30 %.
- Nekonzistentní firmware/driver: způsobuje výpadky a degradaci výkonu; řešení: používat vLCM/LCM a striktně dodržovat HCL/kompatibilitu.
- Nesprávné politiky: používání univerzálního RAID-1 všude nebo agresivní erasure coding tam, kde je citlivost na latenci; řešení: segmentovat workloady a testovat politiky samostatně.
Automatizace a IaC
- VMware: vSphere REST/PowerCLI, vSAN Management API, Terraform (vSphere provider), Aria Automation/Tanzu.
- Nutanix: Prism Central v3 API, Terraform (Nutanix provider), Calm moduly, Ansible role pro AHV/Prism.
- GitOps: verzování politik, šablon a konfigurací; CI/CD pro infrastrukturní změny a detekci odchylek.
Výkonnostní a kapacitní plánování: metodika
- Baseline: měření existujícího prostředí (p95/p99 latence, read/write ratio, velikost bloků, burst pattern).
- Model: simulace režie FTT/EC, doba rebuildu clusteru při výpadku uzlu nebo disku.
- Pilot & test: syntetické i aplikační testy (HammerDB, vdBench, LoginVSI) s politikami odpovídajícími produkci.
- Run: kontinuální optimalizace velikosti clusteru, automatická detekce „noisy neighbors“, plánovaná expanze o uzly nebo disky (pokud to platforma umožňuje).
Kontrolní seznam pro implementaci
- Ověřená HCL/BOM pro servery, síťové karty, SSD (write-intensive modely pro cache).
- 25/100 GbE síťová fabric, vyhrazené VLANy, QoS a end-to-end jumbo frames.
- Design fault domains a případný witness/metro cluster s požadovanou latencí.
- Definované storage policy na úrovni workloadu (FTT/RAID/EC, limity IOPS, šifrování).
- Monitoring p95/p99 latence, headroom 25–30 % kapacity i výkonu.
- Automatizované LCM (firmware/driver/hypervisor/AOS) a krizový runbook.
- DR runbooky: replikace, pravidelné „non-disruptive“ testy a zálohování.
- Bezpečnost: KMS, RBAC, mikrosegmentace, auditní protokoly, compliance.
Závěr: výběr mezi vSAN a Nutanix
Volba většinou vychází z existujícího ekosystému a provozních preferencí. VMware vSAN nabízí těsnou integraci s vSphere, široký ekosystém a tradiční provozní zkušenost týmů. Nutanix poskytuje jednoduch