Stručně: Big data označují datové soubory, jejichž objem, rychlost nebo různorodost přesahují běžné postupy zpracování. Velikost sama o sobě nezaručuje užitečný závěr.
Jak Big data používám v praxi
U Big data nejdřív vyberu úzký úkol s jasným vstupem a kontrolovatelným výstupem. Sepíšu, která data může systém použít, co nesmí rozhodnout sám a kdo výsledek schválí. Malý vzorek porovnám s ruční prací; teprve po zjištění typických chyb řeším širší automatizaci.
Na co si dát pozor
Ukázka není provoz. U Big data může dobře fungovat několik připravených příkladů, ale selhat okrajové případy, čeština nebo nový vstup. Bez sady reálných testů, člověka v kontrole a měření nákladů je škálování předčasné.
Otázky pro rozhodnutí
- Který úzký úkol má technologie zlepšit?
- Jaká data smí použít a kdo kontroluje výstup?
- Na jakých reálných případech změříme přesnost a náklady?
- Jak proces zastavíme nebo vrátíme při chybě?