On-board neuronové sítě: kvantizace a akcelerace na edge hardwaru

Proč on-board neuronové sítě na UAV

Autonomie dronů spočívá v lokálním zpracování vnímání, lokalizace a rozhodování s nízkou latencí a vysokou spolehlivostí. Přenos surových dat do cloudu není při BVLOS a v rušeném RF prostředí udržitelný. On-board neuronové sítě (NN) na edge hardwaru proto kombinují přísné energetické, hmotnostní a tepelné limity s požadavky na deterministickou odezvu. Klíčem je kvantizace a zrychlení – techniky, které umožňují provozovat moderní modely v rozsahu 1–10 W a při latencích pod 10–50 ms v řídicí smyčce.

Omezení UAV: energetika, latence a spolehlivost

  • Energetický rozpočet: 1–15 W pro vnímání (kamera/LiDAR + NN) při typických bateriích 4–8S LiPo.
  • Latence: 10–30 ms pro vizuální servo, 50–150 ms pro globální plánování; jitter musí být nízký.
  • Hmotnost a termika: chladiče a ventilace zvyšují hmotnost; TDP omezuje takt a frekvenci inferencí.
  • EMI/EMC: výkonné SoC a spínané zdroje mohou rušit GNSS/RC; vyžadují se filtrační a návrhová opatření.

Kvantizace: principy a volby přesnosti

Kvantizace mapuje FP32/FP16 tenzory na nižší bitové šířky s cílem snížit paměť, šířku pásma i spotřebu. Dobře navržená kvantizace má minimální vliv na přesnost při výrazném zisku v rychlosti.

  • Post-Training Quantization (PTQ): rychlá, bez doškolování. Vhodná pro 8-bit (INT8) s reprezentativní kalibrací.
  • Quantization-Aware Training (QAT): simuluje kvantizační šum během tréninku; umožňuje 8-bit a často i 4-bit.
  • Bitové režimy: INT8 je „sweet spot“; INT4/FP4 pro extrémní edge; binární/ternární sítě pro specifické úkoly.
  • Per-tensor vs. per-channel: per-channel škály snižují kvantizační chybu zejména u konvolucí.
  • Symetrická vs. asymetrická: symetrická (signed) zjednodušuje MAC; asymetrická lépe pokrývá posunutá rozdělení aktivací.
  • Kalibrace: klipování (MSE, KL) a sběr reprezentativních vzorků z letových dat minimalizují ztráty přesnosti.

Komplementární kompresní techniky

  • Prořezávání (pruning): strukturované (kanály/filtry) pro HW efekt; nestrukturované + sparsity cca 50–70 % s podporou akcelerátorů.
  • Distilace znalostí: student napodobuje učitele; snižuje velikost při zachování přesnosti.
  • Sdílení vah a low-rank faktorace: dekompozice konvolucí a projekcí v transformerech.

Architektury modelů vhodné pro edge

  • Konvoluční sítě: depthwise separable a group conv (MobileNet, ShuffleNet) minimalizují MAC.
  • Transformery pro vizi: lite/linear attention, windowed self-attention, token pruning a dynamická sparsita.
  • Vícesenzorové fúze: kamerové RGB + IMU + případně ToF/LiDAR s lehkou pozorností.
  • Graph/Spiking: pro plánování trajektorií a extrémně nízkou spotřebu (SNN) tam, kde je to vhodné.

Zrychlení: akcelerační backendy a kompilátory

  • NPU/DLA: vysoká efektivita INT8/INT4, omezený set operací; ideální pro standardní CNN a postprocessing.
  • GPU: flexibilní, FP16/INT8 tensor core; vyšší spotřeba, ale nejuniverzálnější.
  • DSP: výborné pro 1D/2D filtrační operace a malé sítě; deterministické latence.
  • FPGA: přesná kontrola datových toků, pipeline a sparsity; vyšší náklady na vývoj, ale nejlepší efektivita na watt.
  • Kompilátory: TVM, TensorRT, OpenVINO, Glow/XLA – fúze operací, transformace layoutu (NCHW↔NHWC), kernel autotuning.

Optimalizace datových toků a paměťové provozu

  • Operatorová fúze: Conv+BN+ReLU, Q/DQ folding; snižuje přístup do DRAM.
  • Prefetch/tiling: blokování do L2/SRAM; minimalizace cache miss a DMA prostojů.
  • Pipeline: překrytí IO (kamera) – pre/postprocessing – inference – řízení v rámci jednoho rámce.
  • Smíšená přesnost: FP16 pro citlivé vrstvy (např. attention projekce), INT8 pro zbytek.

Realtime plánování: deterministické runtime

  • Rozdělení grafu: kritická smyčka (percepce→kontrola) s pevnou deadlinou, sekundární úlohy (mapování) v režimu „best-effort“.
  • Prioritní fronty: RT plánovač (SCHED_FIFO) pro inferenci; rozpočet GPU času.
  • Řízení jitteru: pinování jader, izolace IRQ, zamknutí frekvencí, NUMA/affinity.

Měření výkonu: metriky a profilace

  • Přesnost: mAP/mIoU/F1 pro úlohy vnímání; success rate pro plánování/avoidance.
  • Latence a jitter: P50/P95/P99; end-to-end od expozice po aktuátor.
  • Energie: J/inference, Wh/mise; teplotní profily a throttling.
  • Robustnost: okluze, změna osvětlení, pohybová neostrost, RF interference, výpadky snímačů.
  • Profilace: per-op statistiky (MAC, BW), roofline analýza, „hot kernels“ a paměťová úzká hrdla.

Robustní kvantizace v praxi

  • Reprezentativní dataset: zahrnout typické letové výšky, úhly, denní/noční scény, povětrnostní podmínky.
  • QAT strategie: fake quant, straight-through estimator; postupné snižování bitů (8→6→4).
  • Senzitivita vrstev: první a poslední vrstva často vyžadují vyšší přesnost; per-layer overrides.
  • Sledování dynamického rozsahu: EMA statistiky, percentile clipping, log-doménové škály pro outliery.

Zpracování obrazových dat na palubě

  • ISP pipeline: denoise/debayer v HW; přísně omezit CPU postprocessing.
  • Downsampling a ořez: dynamické škálování vstupu podle dostupného TDP a požadované latence.
  • Časová synchronizace: PTP/PPS mezi kamerou, IMU a SoC; minimalizace časové nejistoty pro fúzi.

Bezpečnostní aspekty a fail-safe

  • Sandbox inferencí: omezení privilegií, integrity check modelů (hashy, podpisy).
  • Watchdogy: pro ML runtime i pro senzorové ovladače; detekce deadlocků.
  • Degradované režimy: přepnout na jednodušší model/nižší rozlišení při přehřátí nebo nízké baterii.

Integrace do řídicí smyčky

  • Vizuální servo: konverze výstupů NN (např. klíčové body, detekce) na řídicí veličiny s filtrováním a limitéry.
  • Přediktivní filtrování: EKF/UKF při opožděných a kvantizovaných měřeních.
  • Confidence gating: pokud je důvěra NN pod prahem, spustit redundanci (IMU-only, GNSS-only, mapové odhady).

MLOps na edge: nasazení a správa modelů

  • Formáty: ONNX, TFLite, proprietární blobs pro NPU; verzování modelů a kompilátorsky generovaných artefaktů.
  • A/B nasazení: stínové hodnocení (shadow mode) a postupné rozbalování na flotilu.
  • OT(A) aktualizace: robustní, atomické; rollback a kompatibilita s firmwarem.
  • Telemetrie: anonymizované metriky latence/energetiky/chyb pro dlouhodobé ladění.

Validace: HIL/SIL a terénní testy

  • SIL: simulace senzorů a prostředí se záznamy reálných scén; zjišťování numerické stability po kvantizaci.
  • HIL: reálný edge HW v smyčce; záznam P50/P99 latencí a tepelných profilů během typických misí.
  • Letové zkoušky: A/B testy modelů, metriky úspěšnosti úloh (např. procento správných přistání, přeletů bran).

Příklady úkolů a doporučené konfigurace

Úkol Model/architektura Přesnost Kvantizace HW backend
Detekce překážek MobileNet-SSD / YOLO-Nano mAP 30–40 @ COCO-lite INT8 PTQ/QAT, per-channel NPU nebo GPU FP16/INT8
Slam/VO pomoc Lightweight SuperPoint + SuperGlue-lite Stabilní lokalizace INT8 mix, citlivé vrstvy FP16 GPU/DSP mix
Trasa v koridoru Tiny-Transformer s windowed attention F1 > 0.9 (dataset domény) QAT INT8, projekce FP16 GPU/NPU hybrid

Checklist pro inženýrskou realizaci

  1. Definovat KPI: přesnost, P95 latence, spotřeba, teplotní limity.
  2. Zvolit architekturu modelu s ohledem na MAC/BW a podporované operace akcelerátoru.
  3. Připravit reprezentativní kalibrační set pro PTQ/QAT.
  4. Provést kompresi: pruning → kvantizace → distilace → compiler autotuning.
  5. Nastavit runtime: izolace jader, frekvence, DMA, pipeline.
  6. Ověřit v SIL/HIL: přesnost vs. latence vs. energie, P99 jitter, termika.
  7. Nasadit s A/B a telemetrií; připravit rollback a degradované režimy.

Nejčastější úskalí a jak jim předcházet

  • Ztráta přesnosti po PTQ: přejít na QAT, použít per-channel škály a lepší clipping.
  • Nekompatibilní operace na NPU: přepracovat graf (nahradit operace), použít fúzi nebo fallback pouze mimo kritickou smyčku.
  • Skrytá úzká hrdla: postprocessing na CPU; přesunout NMS, resize a normalizaci na akcelerátor.
  • Throttling: předimenzovat chladič, zavést power governor a adaptivní snížení rozlišení.

On-board neuronové sítě umožňují dronům bezpečně a autonomně fungovat i v náročných podmínkách. Kombinace kvantizace, komprese a specializovaných akcelerátorů přináší řádové zlepšení latence a energetické efektivity bez zásadní ztráty přesnosti. Systematický přístup – od volby architektury, přes QAT a kompilaci, až po RT integraci a validaci – je rozhodující pro nasazení, které splňuje přísné požadavky UAV misí.