Práce s daty (SŠ)
| Typický ročník | 2. SŠ |
| Interval vhodných ročníků | 1. SŠ – 4. SŠ |
| Učivo | sběr a formát dat, tabulkový editor (vzorce, funkce, podmínky), vizualizace, typy grafů, vizuální kódování, databáze, relace, dotazy, jazyk SQL, regulární výrazy |
| Předcházející moduly | |
| Bezprostřední výsledky učení |
|
| Související RVP výsledky učení |
|
Modul rozvíjí praktické dovednosti v oblasti práce s daty – od jejich sběru a evidence, přes analýzu a vizualizaci až po použití databází a dotazovacího jazyka SQL. Žáci si vyzkouší práci s tabulkami, naučí se tvořit srozumitelné a přesné grafy a porozumí principům relačních databází. Pozornost je věnována také kritickému čtení vizualizací a hledání zkreslení. Pro pokročilejší žáky je zařazeno téma regulárních výrazů, které rozvíjí informatické myšlení při práci se vzory v textech.
Tento blok doporučujeme řešit.
Data mohou mít různý formát. V základu mohou mít tvar textového řetězce (např. želva), čísla (např. 1) nebo logické hodnoty (TRUE – pravda, FALSE – nepravda).
Čísla mohou mít rozličnou podobu. Pokud 0 zastupuje číslici (respektive v některých případech celé číslo), můžeme získat například:
- 0,0 – desetinné číslo
- 000 000 000 – telefonní číslo bez předvolby
- 000 00 – poštovní směrovací číslo
- 0/0 – zlomek
- 0 % – procento
- 0 m – vzdálenost v metrech
Specifické je formátování času. Uvažme, že Y zastupuje rok, m měsíc, d den, H hodinu, M minutu a S sekundu. V rámci tohoto formátu získáme například:
- H.M – čas v rámci dne, uplynulé hodiny a minuty
- M:S – uplynulé minuty a sekundy
- d. m. Y – datum (formát typický pro češtinu)
- m/d/Y – datum (formát typický pro americkou angličtinu)
Zástupné znaky (jako výše) se pro formátování dat používají např. v rámci programovacích jazyků či tabulkového procesoru. Na podobném principu fungují regulární výrazy, které se používají hlavně pro vyhledávání v datech.
Využít konkrétní formát (či kontrolu) dat je výhodné třeba v dotaznících: pokud chceme od respondenta získat PSČ, hodí se vstup omezit pouze na 5 číslic. Zamezíme tak zadání chybných dat.
Při práci s daty se může snadno stát, že dostupná data jsou nějakým způsobem zkreslená. Taková data pak nevypovídají dobře o skutečnosti. Pokud zkreslení nevezmeme v úvahu, může zpracování takových dat vést k matoucím závěrům. Je proto užitečné základní typy zkreslení znát.
Výběrové zkreslení
Při sběru dat většinou není reálné posbírat „všechna data“, často používáme jen nějaký výběr. Tento výběr by měl ideálně představovat takzvaný reprezentativní vzorek, který dobře odpovídá charakteristikám zkoumaného celku. Pokud tomu tak není, tak jsou data zkreslená.
Příklady nereprezentativních vzorků- Průzkum názorů na politiku, který agentura provede pouze v Praze na náměstí.
- Výzkum účinků léku, do kterého jsou zapojeni pouze studenti sportovního gymnázia.
K tomuto typu zkreslení může dojít například tak, že se účastníci průzkumu sami rozhodují, zda se zúčastní či nikoliv (zkreslení neúčasti). Ti, kteří se rozhodnou neúčastnit, se často liší v důležitých ohledech od těch, kteří se účastní. Příklad: Dotazník o počítačových hrách vyplní s větší šancí ti, kdo rádi hrají počítačové hry.
Na výběrovém zkreslení se může podílet také množství získaných dat. Příklad: Když budeme zjišťovat zpětnou vazbu k výuce pouze u 2 žáků, pravděpodobně to nebude vypovídat o celé třídě.
Zkreslení odpovědí
Příklady zkreslení odpovědí Příklad potvrzujícího zkreslení Příklad publikačního zkresleníOdkazy umožňují používat ve vzorcích hodnoty z jiných buněk. Mějme např. odkaz B3, který směřuje na hodnotu ve sloupci B na řádku 3. Vzorec =B3*2 by pak vypsal dvojnásobek hodnoty v buňce B3.
Často se hodí vzorec rozšířit do dalších buněk tabulky přetažením či pomocí schránky, abychom podobný výpočet provedli na dalších datech.
Relativní odkaz se změní, když jej rozšíříme či nakopírujeme do jiné buňky. Pokud bychom vzorec =B3*2 rozšířili směrem doprava, v nové buňce by se změnil na =D3*2.
Absolutní odkazy obsahují znak dolaru ($). Část odkazu za tímto symbolem se „uzamkne“ a při kopírování/přesouvání odkazu se nemění. Pokud bychom vzorec =$B$3*2 rozšířili směrem doprava, v nové buňce by měl zcela stejnou podobu.
V rámci absolutních odkazů je možné při přesouvání/kopírování učinit neměnným jen sloupec ($B3 se změní jen při přesunu nahoru/dolů) či jen řádek (B$3 se změní jen při přesunu doleva/doprava).
Absolutní odkazy lze používat i při vyjadřování rozsahů v argumentech funkcí, např. =SUM($A1:$E1) sečte vždy prvních pět buněk v řádku.
Použití podmínek v tabulkovém editoru umožňuje určité buňky ovlivnit přítomností hodnot v jiných buňkách. Dále uvádíme přehled funkcí souvisejících s podmínkami včetně příkladů navázaných na ukázkovou tabulku.
V rámci kritérií podmínek je možné používat logické spojky NOT (negace, česky NE), AND (A) či OR (NEBO). Např. =IF(OR(B2>3;C2>3);TRUE;FALSE) vypíše, zda má Diorit více než 3 rohy pratura či perly (TRUE).
V tabulkovém procesoru lze používat funkce. Jejich využití vypadá takto: =NÁZEVFUNKCE(argument). Argument představuje data, s nimiž funkce bude pracovat. Může se jednat o číselné hodnoty (např. 2, 0,01), odkazy na buňky či rozsah (např. B2, B2:C5), vzorce či další funkce. Argumenty se v českém uživatelském prostředí oddělují středníkem (;), v anglickém čárkou (,).
Základní funkce (mimo těch souvisejících s podmínkami) uvádíme dále. Cvičení v této kapitole pracují hlavně s anglickými názvy funkcí (ty mnohdy odpovídají označení funkcí v programovacích jazycích).
Grafy sestávají z jednotlivých součástí, které se obvykle ztvárňují a uspořádávají podle určitých pravidel. Díky tomu je možné se snadněji orientovat v různých grafech. Čtenář může bez váhání rozeznat, co která součást grafu vyjadřuje.
Grafy zpravidla mívají nadpis, který stručně shrnuje data v grafu.
U grafů, které vyznačují data pomocí vzdáleností (sloupcové, spojnicové, bodové), jsou základní součástí osy. Svislá osa směřuje odshora dolů, také se označuje jako osa y. Vodorovná osa směřuje zleva doprava, také se označuje jako osa x. V souvislosti s osami může být uveden jak název samotné osy (co která osa značí), tak popisy hodnot/kategorií.
Datové řady jsou řádky či sloupce tabulky obsahující data, která graf znázorňuje. Data mohou být v grafu vyznačena např. pomocí sloupců či bodů (mezi těmi mohou být spojnice).
Mřížka usnadňuje orientaci v oblasti se znázorněnými daty. Mezi úsečkami hlavní mřížky bývají větší vzdálenosti, oblast grafu je jemněji dělena (zpravidla méně výraznou) vedlejší mřížkou.
U grafů může být přítomna spojnice trendu (anglicky trendline), která vyjadřuje odhad postupného vývoje hodnot.
Řekněme, že jsme posbírali data a máme je zapsaná v tabulce. Abychom jim lépe porozuměli, je užitečné je vizualizovat, tj. zobrazit formou obrázku. To můžeme udělat mnoha způsoby. Například následující obrázek ukazuje několik způsobů znázornění stejných dat (A → 5, B → 2, C → 4).

Způsob ztvárnění volíme podle účelu vizualizace. Pokud chceme být schopni hodnoty snadno porovnávat, použijeme délku nebo polohu bodů, protože velikosti ploch, úhly a barvy se lidem srovnávají hůře. Pokud ale chceme být schopni rychle odhadnout, jak velkou část z celku něco tvoří, je většinou výhodnější použít úhly.
Můžeme též různé způsoby znázornění kombinovat. Například následující vizualizace zobrazuje délku života mužů a žen v různých státech světa. Klíčová informace o délce života je kódována pomocí polohy bodů, což usnadňuje srovnání států. Velikost a barva bodů pak zobrazují doplňkové informace (velikost států a příslušnost ke kontinentu).

Zdroj obrázku: Our World in Data
Příklady použití příkazů jazyka SQL
Vytvoří tabulku s názvem fish a atributy name typu varchar(80) a age typu int.
Odstraní celou tabulku fish.
Přidá do tabulky fish nový záznam o rybě Julii.
SELECT je jeden z nejpoužívanějších příkazů jazyka SQL. Používá se pro čtení informací z databáze bez toho, aby byla změněna. Často jsou potřeba složitější operace než jen výpis všech informací z jedné tabulky.
Zobrazí celý obsah tabulky s názvem product.
Zobrazí jména a druhy všech ryb v tabulce fish.
Zobrazí jména všech ryb, kterým je 7 let. Porovnávat za WHERE se dá například i na nerovnost, menší/větší, nebo na existenci podřetězce.
Základními prvky regulárních jazyků jsou obyčejná písmena. Ty při vyhledávání odpovídají přímo sobě. Pokud tedy zadáme regulární výraz kr, tak mu budou odpovídat slova, která obsahují podřetězec „kr“.
Tečka odpovídá libovolnému znaku.
Metaznaky jsou speciální znaky, které používáme na konstrukci regulárních výrazů (např. .*+?). Co když ale chceme hledat právě tyto znaky? Na to použijeme zpětné lomítko, které ruší význam metaznaku a chápe jej jako znak obyčejný.
Pomocí následujících speciálních znaků můžeme v regulárním výrazu označit skupiny písmen:
Dále můžeme využít následující konstrukce, které vymezují více možností, případně seskupují znaky k sobě:
Kvantifikátory v regulárních výrazech vyznačují, kolikrát se má předcházející výraz opakovat. Například hvězdička v pe*s značí libovolný počet výskytů písmene e.