Sim-to-real gap: využití doménové randomizace pro robustní přenos řídicích politik

Proč „sim-to-real” rozhoduje o autonomii dronů

Trénink a testování autonomních algoritmů přímo v terénu je nákladné, rizikové a málo škálovatelné. Simulace (sim) nabízí bezpečné prostředí s kontrolovanými podmínkami a masivním paralelismem. Rozpor mezi simulací a realitou (sim-to-real gap) však často vede ke snížení výkonu po nasazení ve skutečném světě (reality gap). Tento článek systematizuje přístupy k překlenutí této mezery pomocí domain randomizace, transfer learningu, adaptivní identifikace a integračních postupů pro autonomii dronů – od vnímání přes lokalizaci až po plánování a řízení, včetně rojových scénářů.

Architektonický kontext: vrstvy autonomie a kde vzniká „gap”

  • Vnímání (perception): detekce/průzkum scény (RGB, hloubka, LiDAR, event-kamery), semantika, sledování objektů. Gap vyplývá z nepřesné fotometriky, textur, šumu a rušení světla.
  • Odhad stavu (state estimation): VIO/SLAM, fúze IMU/GNSS/vision. Gap tvoří odlišné spektra vibrací, nelinearity senzorů a zpoždění.
  • Plánování a vyhýbání: reaktivní kolizní vyhýbání, globální plánovače, MPC. Gap vzniká v dynamice prostředí (vítr, pohyblivé překážky) a v omezeních aktuátorů.
  • Řízení: nízkoúrovňové smyčky (attitude/rate/thrust) a vysoká vrstva (trajektorie). Gap způsobují nelineární efekty (downwash, ground effect), saturace a zpoždění ESC/motorů.

Doménová randomizace: princip, cíle a návrh rozdělení

Doménová randomizace (Domain Randomization, DR) záměrně variuje parametry simulace během tréninku tak, aby modely viděly široké spektrum možných světů. Cílem je, aby síť/algoritmus naučil invariante a robustní reprezentace.

  • Fotometrie: náhodné zdroje světla, spektrum, intenzita, stínování, odlesky, mlha, meteorologie; textury a materiály s variabilními BRDF.
  • Senzory: šum IMU (bias drift, random walk), rolling shutter, kvantizace, latence; LiDAR s dropouty a vícenásobnými odrazy; kamery s aberacemi a znečištěním čoček.
  • Dynamika „plant”: hmotnost, momenty setrvačnosti, thrust mapy, zpoždění motorů, aerodynamické koeficienty, vítr (nárazy, turbulence, shear), ground effect.
  • Prostředí a geometrie: rozmístění překážek, pohyb aktérů, topologie koridorů, GPS stínění, RF rušení.
  • Komunikační podmínky: jitter, packet loss, zpoždění v roji (C2 a V2V), omezení šířky pásma.

Pravidlo návrhu rozdělení: randomizujte široce, ale fyzikálně realisticky. Používejte truncated nebo mixture rozdělení (např. lognormální pro šum, beta pro osvětlení) s priorem z měření. Pro kritické parametry aplikujte curriculum – postupně zvyšujte rozptyl.

Transfer learning: od simulace k realitě krok za krokem

Transfer learning přenáší znalosti naučené ve zdrojové doméně (sim) do cílové (real). Klíčové strategie:

  • Feature transfer: použití encoderu natrénovaného v simulaci a fine-tune na reálných anotovaných datech (vyžaduje méně dat).
  • Domain adaptation: adversarial zarovnání distribucí (sim vs. real) v latentním prostoru; coral/mmd regularizace.
  • Self-supervised pretraining: kontrastní úlohy (temporal a multi-view) ze simulace, doladění na malém reálném setu.
  • Policy distillation: přenesení politiky RL z fotorealistické/DR simulace do menší sítě běžící na edge (MCU/SoC) s kvantizací.

Fotorealismus vs. randomizace: komplementární pohled

Fotorealistická simulace snižuje rozdíl ve vnímání, ale je nákladná a méně rozmanitá. DR naopak rozšiřuje pokrytí distribucí, ale může vést k „nadměrně robustním” reprezentacím, které ztrácejí jemné detaily. V praxi:

  1. Trénujte perception na fotorealistických scénách s mírnou DR fotometrie.
  2. Trénujte řízení/RL s výraznou DR dynamiky a senzoriky.
  3. Použijte two-stage přístup: nejprve DR, následně narrow-domain fine-tune na reálných datech.

Identifikace parametrů a „plant-model mismatch”

Přesný model dynamiky snižuje potřebu extrémní DR. Doporučený cyklus:

  1. Bezpečné letové experimenty s excitačními manévry (chirp, step, PRBS).
  2. Odhad thrust/torque map, časových konstant ESC/motorů, aerodynamických koeficientů.
  3. Kalibrace modelu a Bayesovské intervaly nejistoty, které se převedou na rozsahy DR.

Sim-to-real pro učení s posilováním (RL)

  • Privileged learning: během tréninku v simulaci má agent přístup k „dokonalému” stavu; při nasazení používá jen odhad senzory. Teacher-student schéma redukuje reality gap.
  • Domain randomization v prostředí: dynamika, zpoždění, poruchy aktuátorů; curriculum podle úspěšnosti agenta.
  • Risk-sensitive RL: minimalizace CVaR nebo penalizace „tail” událostí pro bezpečnost; významné zejména při blízkosti překážek.
  • Safe exploration: barrier functions, shielding nad RL politikou (např. CBF/ECBF), které garantují dodržení omezení.

Imitační učení a DAgger v praxi dronů

Imitační učení využívá expertní trajektorie od člověka nebo MPC. Protože distribuční posun vede ke kumulaci chyb, doporučuje se DAgger (agregace dat s korekcemi experta) i v simulaci s DR a následné doladění na reálných korekcích (on-policy fine-tune s nízkým rizikem).

Vizualizace a augmentace: od obrazů k robustním reprezentacím

  • Spektrální a fotometrické augmentace: náhodné expozice, spektrální posuny, šum, defokus, motion blur, nečistoty čočky.
  • Geometrické augmentace: náhodné oříznutí, rotace, perspektivní „tilt”, simulace rolling shutteru.
  • Sim2Real style transfer: Cycle-consistent mapování textur ze simulace do reality a zpět, bez ztráty geometrie – vhodné pro vnímání.

Časování a latence: end-to-end limit autonomie

I při dokonalém vnímání se výkon zhorší, pokud jsou latence a jitter v uzavřené smyčce podhodnoceny. Při sim-to-real je nutné:

  • Modelovat senzor→odhad→řízení→aktuátor řetězec s realistickými zpožděními a periodicitou.
  • Trénovat politiky tolerantní k jitteru (randomizace periody, delay-aware MPC/RL).
  • V HIL ověřovat deadline miss rate a robustnost vůči CPU zátěži.

Metriky a orákula: jak měřit připravenost na realitu

  • Robustnostní křivky: výkon vs. variace parametru (vítr, zpoždění, šum); cílem je plochý profil.
  • Distributional coverage: procento cílového provozu pokryté tréninkovými rozděleními (odhady z logů reálných misí).
  • Safety KPI: počet „near miss”, minimální clearance k překážkám, zásahy safety-shieldu, porušení omezení.
  • Generalizační testy: neviděné scény/počasí; holdout lokality, které simulátor nezahrnoval.

Pipeline: od simulace k terénu

  1. Data mining z reálných logů (vítr, vibrace, latence) → statistiky pro návrh DR rozdělení.
  2. SIL trénink s DR a fotorealistickou scénou pro perception; RL/IL pro navigaci a vyhýbání.
  3. HIL validační filtr: časování, jitter, rozhraní; fault injection (dropouty senzorů, packet loss).
  4. Pilotní lety s envelope protection (geofencing, virtuální stěny, soft limit thrust).
  5. Iterace: zpětná identifikace a aktualizace DR rozdělení; fine-tune percepce a politiky.

Sim-to-real pro roje: škálování nejistoty a komunikace

  • Komunikace: randomizujte latence, ztrátovost a omezení propustnosti; trénujte decentralizované politiky s omezenou informací.
  • Koordinace: používejte graph neural networks nebo explicitní formace s consensus algoritmy robustními vůči výpadkům uzlů.
  • Bezpečnost: Reciprocal collision avoidance s verifikovanými bariérami; lokální failsafe při ztrátě komunikace.

Modely neurčitosti a verifikované „shields”

Přidejte odhady nejistoty do vnímání a řízení (např. Monte Carlo dropout, ensemble) a rozhodování provazujte na risk-aware MPC. Nad politikou nasazujte formálně verifikované shiely (CBF/Reachability), které garantují bezpečnostní invarianty.

Kontinuální učení a adaptace na zařízení

  • Test-time adaptation: jemné doladění BN statistik nebo nízkodimenzionálních hlav podle přicházejících reálných dat.
  • Meta-learning: inicializace, které se rychle přizpůsobí nové lokalitě/počasiu několika kroky gradientu.
  • Edge constraints: kvantizace, prořezávání sítí, distilace a plánování toků dat vzhledem k energetickému rozpočtu.

Integrace s klasickými metodami: hybridní řízení

Čisté RL politiky nahrazujte hybridem: síť předpovídá reference/parametry pro MPC nebo adaptivní regulátor. Hybrid lépe respektuje omezení a usnadňuje certifikaci. Percepční sítě poskytují mapy rizika a costmaps pro klasické plánovače.

Data a anotace: jak získat „málo, ale dobrá” reálná data

  • Active learning: iterativně navrhujte mise maximalizující informaci (místa s vysokou nejistotou modelu).
  • Weak supervision: pravidla/heuristiky a senzorové triády (např. stereo+IMU) pro generování pseudotitulků.
  • Human-in-the-loop: rychlé anotace na keyframů; korekce v DAgger smyčce.

Bezpečnostní a regulační aspekty

Prokázání bezpečnosti vyžaduje traceability od požadavků po testy a metriky. Sim-to-real postupy musí být auditovatelné: protokoly DR rozdělení, verze simulátorů, seed RNG, logy z HIL a reálných letů, plus „go/no-go” kritéria pro rozšíření provozu (VLOS → BVLOS, denní → noční).

Případové vzory nasazení

  1. Vnitřní inspekce: silná DR osvětlení a textur; hybridní řízení (MPC+policy); HIL testy s RF multipath a občasnou ztrátou vizuálních prvků.
  2. Lesní průzkum: DR větru, pohyblivé vegetace a slunečních skvrn; robustní VIO s event-kamerou; risk-sensitive plánování clearance.
  3. Rojové mapování: decentralizované politiky s DR komunikace; GNN pro formace; shiely pro minimální rozestupy.

„Best practices” pro tým

  • Udržujte binární ekvivalenci algoritmů mezi SIL/HIL/real (stejné knihovny a příznaky).
  • Zaznamenávejte vše: časové razítka, jednotky, rámce, RNG seed, verze simulátorů, parametry DR.
  • Curriculum: od úzkých rozdělení k širokému spektru; „overfit to safety” – bezpečnost jako priorita při rozšiřování obálky.
  • Testujte, jako když létáte: scénáře věrně kopírující provoz (rychlosti, manévry, latence, rušení).

Budoucí směry

  • Sim-to-real s fyzikou učenou z dat (diferencovatelná fyzika) a adaptivní identifikací během letu.
  • Generativní modely pro syntézu realistických senzorických scén s kontrolou variability.
  • Formální metriky distribučné blízkosti mezi sim a real na úrovni reprezentací.
  • Společné učení rojů s garancemi stability při měnící se grafové