Proč je sentimentová analýza klíčem k „Voice of Customer“
Sentimentová analýza (SA) je disciplína, která z nestrukturovaného jazyka – recenzí, tiketů, chatů, příspěvků na sociálních sítích či průzkumů – vytváří kvantifikovatelné signály o náladě, spokojenosti a emocích zákazníků. V rámci rámce Voice of Customer (VoC) umožňuje SA kontinuálně monitorovat zákaznickou zkušenost, identifikovat příčiny problémů a uzavírat „closed loop“ – od zjištění k opatření a zpět k měření dopadu.
Typy sentimentu: od polarity po emoce a záměry
- Polární klasifikace: pozitivní / neutrální / negativní (trojtřídní) nebo binární schéma.
- Stupnice: ordinalita (např. −2…+2) pro jemnější odstíny nálady.
- Emočné kategorie: radost, hněv, zklamání, strach, důvěra – vhodné pro diagnostiku CX.
- Intenty: záměr odchodu, eskalace, nákupní motivace – často doplňkové k sentimentu.
- Aspect-Based Sentiment Analysis (ABSA): sentiment vázaný na aspekt (např. „doručení“, „cena“, „aplikace“).
Zdrojová data a jejich kvalita
- Průzkumy a volné texty (NPS/CSAT verbatim): vysoká relevance, menší objem, nižší jazyková variabilita.
- Tikety, chaty, e-maily: střední struktura, různé jazykové registre, často doménová specifika.
- Sociální sítě a recenze: velký objem, šum, sarkasmus, marketingové „výlevy“.
- Zákaznické hovory (ASR → text): nutný kvalitní přepis; přítomný paraligvistický signál (tempo, pauzy).
Klíč: jednotný data contract (zdroj, jazyk, čas, kanál, identifikátory) a privacy-by-design (pseudonymizace, minimalismus).
Předzpracování: připravit, vyčistit, normalizovat
- Jazyková detekce a směrování (SK/CZ/EN…); smíšené jazyky (code-switching) řešit pravidly.
- Tokenizace s podporou diakritiky; normalizace emotikonů a emoji na sémantické tagy (např.
:smile:→ EMO_POS). - Ochrana údajů: maskování PII (jména, e-maily, telefony, IBAN) před tréninkem.
- De-dup a near-dup detekce (reposty, šablonové odpovědi).
- Pravopis a slang: neprovádět agresivní přepis – riziko „vyhlazení“ sentimentu; raději noise-robust modely.
Metody: od lexikonů po transformery
- Lexikonové přístupy: slovníky s skórem (výhoda: interpretace; nevýhoda: ironie, kontext, morfologie).
- Klasické ML: SVM/LogReg nad n-gramy; funguje na menších datech, vyžaduje ruční featury.
- Neuronové sítě: CNN/LSTM pro sekvence; vhodné pro krátké texty.
- Transformery: BERT/roBERTa/mBERT/Slavic-BERT a další; fine-tuning na doménových datech je dnes standard.
- Instruktážní LLM (zero/few-shot): rychlý start bez rozsáhlého labelingu; důležité guardrails a eval.
ABSA: sentiment podle aspektů
ABSA rozkládá výrok na aspekt a jeho sentiment. Přístupy:
- Pravidla/sloty: slovník aspektů + okno kontextu (rychlé MVP).
- Multilabel klasifikace: nejprve extrahovat aspekty (NER/sequence labeling), poté sentiment na úrovni aspektu.
- Joint learning: model predikuje aspekty i sentiment současně (vyšší přesnost, více dat).
Adnotace a kvalita označování
- Schéma: definujte jasné příklady, hraniční situace (ironii, dvojznačnost, multi-target).
- Inter-Annotator Agreement (Cohen κ, Krippendorff α) ≥ 0,7 pro robustnost.
- Gold set a honeypots pro kontrolu konzistence; adjudikace sporů.
- Active learning: model vybere nejisté vzorky k doplnění označení (urychlení labelingu o 30–50 %).
Trénink a validace: metriky správně
- Imbalance: vyrovnání vah, focal loss, stratifikace; pozor na přeučení „většinové třídy“.
- Metriky: Precision/Recall/F1 po třídách (macro-avg), PR-AUC při nevyváženosti; pro ordinalitu i quadratic weighted κ.
- Kalibrace: Platt/Isotonic pro interpretovatelné pravděpodobnosti (prahování alertů).
- Robustnost: testování na out-of-domain vzorcích, šumu, slangu, násilném zkrácení textu.
Vysvětlitelnost a důvěra
- Lokální vysvětlení: SHAP/LIME – které tokeny/aspekty přispěly k rozhodnutí.
- Globální: význam nejčastějších n-gramů, aspektových clusterů a jejich sentimentu.
- Pravidla „safety net“: pro citlivé domény (zdraví, finance) kombinujte model + deterministická pravidla.
Vícejazyčnost a doménová adaptace
- mBERT/XLM-R pro více jazyků; při nízkém objemu použijte translate-train nebo train-translate s opatrností.
- Continual learning: doškolování na aktuálních datech (drifty ve slangu a produktech).
- Adaptery/LoRA pro levné doménové přizpůsobení bez plného přetrénování.
Emoce, ironie, toxicita
- Emoční modely: vícerozměrné (Plutchik, NRC) – přiřaďte váhy emocím pro jemnou diagnostiku.
- Ironie/sarkasmus: detektory s kontextem vlákna; využití metadat (emotikony, interpunkce) a speaker turns.
- Toxicita a bezpečnost: samostatná pipeline (hate, self-harm, NSFW) s přísnějším prahem a human-in-the-loop.
Integrace do VoC: od signálu k akci
- Ingest: streaming/batch z kanálů (API, webhooks, ETL), harmonizace polí.
- Obohacení: identifikátor zákazníka, produkt, segment, fáze cesty, obchod/region.
- Analýza: sentiment (polarita/emoce), ABSA, tematické clustery (topic modeling), trendové linie.
- Diagnostika: korelace sentimentu s NPS/CSAT, časem řešení, churnem, LTV.
- Aktivace: alerty, workflow do Jira/ServiceNow, spouštěče kampaní (win-back, omluvné nabídky).
- Zpětná smyčka: A/B test opatření, vyhodnocení inkrementu (snížení negativních sentimentů, zkrácení TTR).
Dashboard a vizualizace: co má management vidět
- Sentiment heatmapa podle kanálů a regionů.
- Aspektový strom (sunburst/treemap) s vahou a polaritou.
- Trendové grafy (7-/28-denní průměry) s vyznačením release/promo událostí.
- Top drivers: SHAP pro aspekty, které táhnou negativum/pozitivum.
- Closed-loop KPI: procento zpracovaných negativ do 48 h, re-sentiment po intervenci.
Měření dopadu: od modelové přesnosti k byznys výsledkům
| Úroveň | KPI | Interpretace |
|---|---|---|
| Model | Macro-F1, PR-AUC, kalibrace | Přesnost a spolehlivost predikcí |
| Operativa | Alert latency, % routed, SLA zásahů | Rychlost reakce na problémy |
| Byznys | Churn-lift, CSAT/NPS lift, snížení TTR, úspory | Inkrementální dopad na CX a náklady |
Bezpečnost, soukromí a etika
- PII/PHI ochrana: pseudonymizace, retenční politiky, přístupová práva.
- Bias & fairness: audit výkonu podle segmentů (jazyk, region, demografie, pokud je legální a relevantní).
- Transparentnost: vysvětlení a možnost korekcí při eskalacích; logování rozhodnutí.
- Regulace: GDPR, sektorové předpisy (finance, zdravotnictví) – minimalismus účelů.
MLOps a provoz v produkci
- CI/CD pipeline pro modely a pravidla; shadow a canary rollouty.
- Monitoring: datový drift, performanční drift, out-of-vocabulary index, alerty na pokles F1.
- Model registry, verze, reprodukovatelné tréninky, featury ve feature store.
- Human-in-the-loop: operační UI pro přetagování hraničních vzorků → zpětné doškolení.
Topic modeling a příčiny
- TM: BERTopic/Top2Vec (embedding-based) pro objevování témat; kombinujte s ABSA pro „aspekt × téma“.
- Root cause: propojte negativní aspekty s operativními signály (release, dostupnost, kapacita call centra).
Rizika a opatření
| Riziko | Projev | Mitigace |
|---|---|---|
| Přetrénování na jediném kanále | Slabý výkon jinde | Multikanálový trénink, převažování vzorků |
| Jazykový drift/slang | Pokles přesnosti | Rolling retrain, active learning |
| Chybný ASR přepis | Falešně negativní/pozitivní | ASR s doménovým slovníkem, confidence prahy |
| Sarkasmus | Opačný sentiment | Kontext vlákna, speciální detektory |
Implementační „kostra“ (referenční architektura)
- Ingest: konektory (sociální API, helpdesk, e-mail, datové sklady).
- PII maskování → Jazykový routing → Tokenizace/normalizace.
- Model: (a) polární sentiment, (b) emoce, (c) ABSA, (d) toxicita.
- Post-processing: kalibrace, prahy, pravidla „safety net“.
- Ukládání: vektorový index (pro podobnost), analytický sklad (parquet/SQL).
- Aktivace: dashboard, alerty, Jira/CRM tikety, marketingové segmenty.
Praktické vzory použití (use-cases)
- „Early warning“: nárůst negativního sentimentu u aspektu „platby“ → incident v PSP → okamžitá eskalace.
- Prioritizace roadmapy: největší negative volume × business impact = kandidát na sprint.
- Win-back: negativní sentiment + vysoká propensity to churn → personalizovaná nabídka.
- Měření kampaní: porovnání emocí před/po kampani, korelace s organickou návštěvností a CSAT.
Checklist nasazení sentimentové analýzy
- Definovaná taxonomie aspektů a schéma štítků.
- Připravený gold set a metriky (macro-F1, PR-AUC, kalibrace).
- PII maskování a právní rámec (účel, retenční politiky).
- Dashboard s trendy, aspekty a top drivery; alertní prahy.
- Closed-loop workflow (kdo co udělá při negativu X do Y hodin).
- MLOps: registry, monitoring driftu, plán retrainingu.
30–60–90denní plán
- 0–30 dní: audit dat a kanálů, definice aspektů, labeling 3–5k vzorků, baseline model (mBERT), základní dashboard.
- 31–60 dní: ABSA a emoce, kalibrace a alerty, active learning smyčka, integrace do ticketingu.
- 61–90 dní


























