Cíle základní údržby OS
Základní údržba a správa operačního systému (OS) směřuje k zajištění dostupnosti, bezpečnosti, výkonu a predikovatelnosti prostředí, ve kterém provozujete aplikace a služby. Klíčovým principem je opakovatelnost a auditovatelnost – vše, co provedete manuálně, by mělo být zdokumentováno, automatizováno a opakovatelně spustitelné nezávisle na konkrétní osobě.
Plán údržby: perioda, odpovědnosti a okna
- Definujte údržbová okna: pravidelné časy pro aktualizace, restartování a testy obnovy.
- Matice odpovědností (RACI): kdo schvaluje, provádí, kontroluje a informuje.
- Standardní provozní postupy (SOP): detailní návody pro rutinní úkony, rollback a eskalaci.
Aktualizace a správa balíčků
Aktualizace řeší bezpečnostní zranitelnosti, chyby i optimalizaci výkonu. Pro Linuxové distribuce využívejte správce balíčků (apt, dnf/yum, zypper, pacman), pro Windows Windows Update a případně winget nebo WSUS. Doporučení:
- Segmentace: nasazení z vývojového prostředí → testovací → předprodukční → produkční (kanárkové zavádění).
- Klasifikace záplat: bezpečnostní (urgentní) vs. funkční (plánované).
- Závislosti: kontrola konfliktů verzí a změn konfigurace.
- Automatizace: plánované úlohy s notifikacemi výsledků a jasným logováním.
Zálohování a obnova (BCP/DR)
- 3–2–1 strategie: 3 kopie dat, 2 různá média, 1 kopie mimo fyzické pracoviště.
- Typy záloh: plné, přírůstkové, rozdílové; rotace dle kritičnosti dat.
- Obnovitelnost: pravidelné testy obnovy (na úrovni souborů i bare-metal) s metrikami RTO a RPO.
- Šifrování a integrita: ochrana klíčů, kontrolní součty a digitální podpisy.
Správa uživatelů, identit a přístupů
- Princip nejmenších oprávnění (PoLP): přidělujte pouze nezbytné role a skupiny.
- Centralizace identity: LDAP/AD, SSO, MFA; lokální účty jen výjimečně a pod auditním dohledem.
- Privilegovaný přístup:
sudoprofily, Just-in-Time přístupy, kontrola sdílených tajemství. - Životní cyklus účtů: nástup, změny, odchod, pravidelný proces recertifikace.
Bezpečnostní hardening
- Minimální instalace: odstraňte nepotřebné balíčky, služby a otevřené porty.
- Konfigurace jádra a služeb: nastavení sysctl, firewall (iptables/nftables, Windows Firewall), deaktivace SMBv1 a zastaralých protokolů.
- Ochrana proti malwaru: reputační seznamy, antivirové a EDR řešení, izolace služeb (sandbox, AppArmor/SELinux).
- Šifrování: diskové šifrování (LUKS/BitLocker), šifrování dat v přenosu (TLS), správná správa certifikátů.
- Politiky hesel a klíčů: plány rotace, správa klíčového materiálu (KMS), audit klíčových zdrojů.
Monitoring, metriky a alerting
- Sběr metrik: CPU, paměť, I/O operace, latence, teplota, využití disku, stav služeb.
- Správa logů: centralizace (SIEM/ELK), doba uchování, korelace událostí.
- Prahové hodnoty a SLO: definujte limity a výstrahy se zábranou duplicitního upozornění (deduplikace).
- Runbooky: ke každému alertu existuje jasný postup řešení a kontaktní matice.
Výkon a kapacitní plánování
- Profilace zátěže: analýza špiček, sezónnost, mix workloadů (CPU-bound, IO-bound, RAM-bound).
- Optimalizace: nastavení plánovače, priorit procesů, NUMA, hugepages pro specifické workloady.
- Cache a vrstvy úložiště: správný výběr filesystému (ext4, XFS, ZFS, ReFS), TRIM, zarovnání, RAID úrovně.
- Kapacitní modely: scénáře „co kdyby“, headroom, práh pro vertikální a horizontální škálování.
Síťová konfigurace a údržba
- Inventář rozhraní a VLAN: standardizace pojmenování, MTU, QoS.
- Firewall a ACL: přístup „default-deny“, explicitní povolení, pravidelné revize.
- DNS/DHCP: robustní resoluce, split-horizon, rezervace, nízké TTL u dynamických služeb.
- Bezpečné vzdálené přístupy: SSH s klíči, RDP přes VPN, bastion host, zaznamenávání relací.
Automatizace a konfigurace jako kód
- Konfigurační management: deklarativní nástroje (Ansible, Puppet, Chef) a idempotentní playbooky.
- Šablony a proměnné: oddělení tajemství (Vault), opakované použití konfigurací mezi prostředími.
- CI/CD pro správu OS: pipeline pro testování playbooků, linting, kanárkové nasazování.
- Plánovač úloh: systemd timers/cron s logováním a notifikacemi; vyhýbejte se „tichým“ skriptům.
Správa služeb a procesů
- Supervisor: systemd/sc, politika obnovy (Restart=on-failure), kontrola zdraví služeb.
- Jednoúčelové jednotky: oddělte dlouhodobě běžící služby od jednorázových úloh; čistěte prostředí po jejich ukončení.
- Ukládání stavů: neukládejte data do dočasných adresářů bez kontroly (tmp, var-run), standardizujte adresářovou strukturu.
Provoz v kontejnerech a virtualizaci
- Golden image: šablona OS a baseline hardeningu (VM/kontejner).
- Kontejnerová hygiena: minimální image, pevné verze, rootless provoz, read-only filesystemy, seccomp profily.
- Orchestrace: readiness/liveness kontroly, zdrojové limity, rolling update, správa tajemství z externích KMS.
Správa logů a audit
- Normalizace: jednotný formát a časové zóny (UTC), synchronizace času (NTP/Chrony).
- Retence a právní požadavky: diferencované doby uchování, ochrana proti manipulaci (WORM úložiště).
- Detekce anomálií: korelace, baseline chování, výstrahy při odchylkách.
Správa konfigurace a verzování
- Repozitář konfigurací: Git s pull requesty, code review, tagování verzí.
- Řízení změn: RFC tiket, hodnocení rizik, plán návratu, komunikace se zainteresovanými stranami.
- Detekce drifts: porovnání běžícího stavu s deklarativní konfigurací, automatická náprava.
Ochrana koncových bodů a EDR
- Inventarizace zařízení: CMDB s vazbou na vlastníky a kritičnost.
- Politiky zařízení: šifrování, firewall, restrikce USB, aplikace whitelisting.
- EDR/XDR: detekce chování, izolace zařízení, forenzní záznamy.
Správa časování a synchronizace
- NTP/Chrony: redundantní zdroje času, monitoring časových offsetů.
- Časová zóna: standardizace na UTC na serverech; správné zobrazování v aplikacích.
Správa úložišť a souborových systémů
- Kontrola zdraví disků: SMART monitoring, prediktivní výměny, sledování latencí.
- Konzistence FS: pravidelné kontroly, snapshoty (LVM/ZFS), kvóty a deduplikace tam, kde je to vhodné.
- Zálohy konfigurací úložišť: kontroléry RAID/NAS/SAN, multipath nastavení, verze firmwaru.
Licencování a compliance
- Evidence licencí: OS a komerční komponenty, expirace podpory.
- Konfigurační benchmarky: interní standardy a rámce (CIS-like), pravidelné kontroly souladu.
- Záznam změn: auditní stopa pro externí audity a rekonstrukci incidentů.
Incident response a problem management
- Runbook incidentu: detekce, triáž, zmírnění, komunikace, evidence.
- Post-mortem: bez obviňování, akční plány s termíny, měření regresí.
- Proaktivní řízení problémů: vyhledávání kořenových příčin opakujících se problémů.
Dokumentace, inventář a znalostní báze
- CMDB: vztahy mezi aktivy: služby → servery → konfigurace → závislosti.
- Runbooky a knowledge base: stručné návody s přílohami (příkazy, očekávané výstupy).
- Aktualizace dokumentace: povinný krok u každého RFC/PR; dokumentace je součástí releasu.
Pravidelné kontroly (operational health checks)
- Stav služeb: běh jednotek, selhávající jednotky, počet restartů.
- Disk a souborový systém: volné místo, využití inode, fragmentace, stav snapshotů.
- Bezpečnost: neúspěšné přihlášení, změny sudoers, exspirované certifikáty.
- Zálohy: poslední úspěšná záloha, velikost delta změn, rychlost obnovy.
Best practices pro heterogenní prostředí (Linux/Windows/BSD)
- Standardizace: jednotné politiky logování, patchování, pojmenování a tagging v cloudu.
- Nástroje na míru: PowerShell DSC/GPO pro Windows; systemd/Ansible pro Linux/BSD.
- Integrace do SIEM/CMDB: jednotné identifikátory hostitelů a služeb.
Checklist pro základní údržbu OS
- Aktuální stav záplat a plánované okno pro restart.
- Vynucené šifrování disku a korektní rotace klíčů/certifikátů.
- Funkční zálohy a provedený test obnovy za posledních 90 dní.
- Centralizované logy a aktivní alerty na klíčové metriky.
- Aktualizované SOP/runbooky, CMDB a dokumentace změn.
- Audity uživatelských účtů, skupin a privilegovaných přístupů.
- Kontrola kapacity (disk, RAM, CPU) a plán škálování.
Závěr
Kvalitní základní údržba OS představuje disciplínu, která kombinuje procesy, automatizaci a průběžné měření. Standardizujte prostředí, spravujte konfigurace jako kód, vyhodnocujte rizika a udržujte připravené scénáře obnovy a řešení incidentů. Takto dlouhodobě snížíte MTTR, zvýšíte dostupnost a minimalizujete riziko neplánovaných výpadků či bezpečnostních incidentů.



























