Práce s daty (SŠ)

Typický ročník2. SŠ
Interval vhodných ročníků1. SŠ – 4. SŠ
Učivosběr a formát dat, tabulkový editor (vzorce, funkce, podmínky), vizualizace, typy grafů, vizuální kódování, databáze, relace, dotazy, jazyk SQL, regulární výrazy
Předcházející moduly
Bezprostřední výsledky učení
  • Shromáždí a zpracuje data v tabulkovém editoru pomocí vzorců, funkcí a podmínek.
  • Zobrazí data za použití vhodného typu grafu a vysvětlí přesný význam vizualizace.
  • V konkrétních příkladech odhalí zkreslení v posbíraných datech nebo zavádějící vizualizace.
  • Popíše účel a základní princip relační databáze.
  • Vysvětlí význam jednoduchého dotazu zapsaného v jazyce SQL.
Související RVP výsledky učení
  • Nastavuje účelné zobrazení dat, filtruje a řadí data úpravou databázového dotazu.
  • Navrhne a vytvoří strukturu vzájemného propojení tabulek; navrhne procesy zpracování dat.
  • Interpretuje získané výsledky a závěry, vyslovuje předpovědi na základě dat, uvažuje při tom omezení použitých modelů; posuzuje množství informace podle počtu možností, které jsou díky informaci vyloučeny; odhaluje chyby a manipulace v cizích interpretacích a závěrech.

Modul rozvíjí praktické dovednosti v oblasti práce s daty – od jejich sběru a evidence, přes analýzu a vizualizaci až po použití databází a dotazovacího jazyka SQL. Žáci si vyzkouší práci s tabulkami, naučí se tvořit srozumitelné a přesné grafy a porozumí principům relačních databází. Pozornost je věnována také kritickému čtení vizualizací a hledání zkreslení. Pro pokročilejší žáky je zařazeno téma regulárních výrazů, které rozvíjí informatické myšlení při práci se vzory v textech.

Bloky a dosažený postup

1. Sběr a evidence dat Splněno základních cvičení: 0/4

Tento blok doporučujeme řešit.
2. Tabulky I Splněno základních cvičení: 0/5
3. Tabulky II Splněno základních cvičení: 0/6
4. Vizualizace dat Splněno základních cvičení: 0/6
5. Databáze: úvod Splněno základních cvičení: 0/6
6. SQL Splněno základních cvičení: 0/4
7. Regulární výrazy Splněno základních cvičení: 0/5
1. Sběr a evidence dat
Souhrn tématu

Formát dat

Souhrn tématu

Data mohou mít různý formát. V základu mohou mít tvar textového řetězce (např. želva), čísla (např. 1) nebo logické hodnoty (TRUE – pravda, FALSE – nepravda).

Čísla mohou mít rozličnou podobu. Pokud 0 zastupuje číslici (respektive v některých případech celé číslo), můžeme získat například:

  • 0,0 – desetinné číslo
  • 000 000 000 – telefonní číslo bez předvolby
  • 000 00 – poštovní směrovací číslo
  • 0/0 – zlomek
  • 0 % – procento
  • 0 m – vzdálenost v metrech

Specifické je formátování času. Uvažme, že Y zastupuje rok, m měsíc, d den, H hodinu, M minutu a S sekundu. V rámci tohoto formátu získáme například:

  • H.M – čas v rámci dne, uplynulé hodiny a minuty
  • M:S – uplynulé minuty a sekundy
  • d. m. Y – datum (formát typický pro češtinu)
  • m/d/Y – datum (formát typický pro americkou angličtinu)

Zástupné znaky (jako výše) se pro formátování dat používají např. v rámci programovacích jazyků či tabulkového procesoru. Na podobném principu fungují regulární výrazy, které se používají hlavně pro vyhledávání v datech.

Využít konkrétní formát (či kontrolu) dat je výhodné třeba v dotaznících: pokud chceme od respondenta získat PSČ, hodí se vstup omezit pouze na 5 číslic. Zamezíme tak zadání chybných dat.

Souhrn tématu

Zkreslení dat

Souhrn tématu

Při práci s daty se může snadno stát, že dostupná data jsou nějakým způsobem zkreslená. Taková data pak nevypovídají dobře o skutečnosti. Pokud zkreslení nevezmeme v úvahu, může zpracování takových dat vést k matoucím závěrům. Je proto užitečné základní typy zkreslení znát.

Výběrové zkreslení

Při sběru dat většinou není reálné posbírat „všechna data“, často používáme jen nějaký výběr. Tento výběr by měl ideálně představovat takzvaný reprezentativní vzorek, který dobře odpovídá charakteristikám zkoumaného celku. Pokud tomu tak není, tak jsou data zkreslená.

Příklady nereprezentativních vzorků
  • Průzkum názorů na politiku, který agentura provede pouze v Praze na náměstí.
  • Výzkum účinků léku, do kterého jsou zapojeni pouze studenti sportovního gymnázia.

K tomuto typu zkreslení může dojít například tak, že se účastníci průzkumu sami rozhodují, zda se zúčastní či nikoliv (zkreslení neúčasti). Ti, kteří se rozhodnou neúčastnit, se často liší v důležitých ohledech od těch, kteří se účastní. Příklad: Dotazník o počítačových hrách vyplní s větší šancí ti, kdo rádi hrají počítačové hry.

Na výběrovém zkreslení se může podílet také množství získaných dat. Příklad: Když budeme zjišťovat zpětnou vazbu k výuce pouze u 2 žáků, pravděpodobně to nebude vypovídat o celé třídě.

Zkreslení odpovědí

Příklady zkreslení odpovědí Příklad potvrzujícího zkreslení Příklad publikačního zkreslení
2. Tabulky I
Souhrn tématu

Tabulky: odkazy

Souhrn tématu

Odkazy umožňují používat ve vzorcích hodnoty z jiných buněk. Mějme např. odkaz B3, který směřuje na hodnotu ve sloupci B na řádku 3. Vzorec =B3*2 by pak vypsal dvojnásobek hodnoty v buňce B3.

Často se hodí vzorec rozšířit do dalších buněk tabulky přetažením či pomocí schránky, abychom podobný výpočet provedli na dalších datech.

Relativní odkaz se změní, když jej rozšíříme či nakopírujeme do jiné buňky. Pokud bychom vzorec =B3*2 rozšířili směrem doprava, v nové buňce by se změnil na =D3*2.

Absolutní odkazy obsahují znak dolaru ($). Část odkazu za tímto symbolem se „uzamkne“ a při kopírování/přesouvání odkazu se nemění. Pokud bychom vzorec =$B$3*2 rozšířili směrem doprava, v nové buňce by měl zcela stejnou podobu.

V rámci absolutních odkazů je možné při přesouvání/kopírování učinit neměnným jen sloupec ($B3 se změní jen při přesunu nahoru/dolů) či jen řádek (B$3 se změní jen při přesunu doleva/doprava).

Absolutní odkazy lze používat i při vyjadřování rozsahů v argumentech funkcí, např. =SUM($A1:$E1) sečte vždy prvních pět buněk v řádku.

Souhrn tématu

Tabulky: podmínky

Souhrn tématu

Použití podmínek v tabulkovém editoru umožňuje určité buňky ovlivnit přítomností hodnot v jiných buňkách. Dále uvádíme přehled funkcí souvisejících s podmínkami včetně příkladů navázaných na ukázkovou tabulku.

funkce použití příklad (s tabulkou níže) obvyklý název funkce v češtině IF(podmínka; když pravda; když nepravda) Vypíše text či použije vzorec na základě obsahu jiné buňky. =IF(E2>10;"hodně";"málo") vypíše hodně (Diorit má více než 10 předmětů). KDYŽ COUNTIF(rozsah; podmínka) Spočítá výskyty hodnot v rozsahu odpovídající podmínce. =COUNTIF(E2:E5;">10") vypíše 2 (2 pralidé mají více než 10 předmětů). SUMIF(rozsah; podmínka) Sečte hodnoty v rozsahu, které odpovídají podmínce. =SUMIF(E2:E5;">10") vypíše 30 (sčítáme předměty těch pralidí, kteří jich mají více než 10).

V rámci kritérií podmínek je možné používat logické spojky NOT (negace, česky NE), AND (A) či OR (NEBO). Např. =IF(OR(B2>3;C2>3);TRUE;FALSE) vypíše, zda má Diorit více než 3 rohy pratura či perly (TRUE).

Souhrn tématu

Tabulky: funkce

Souhrn tématu

V tabulkovém procesoru lze používat funkce. Jejich využití vypadá takto: =NÁZEVFUNKCE(argument). Argument představuje data, s nimiž funkce bude pracovat. Může se jednat o číselné hodnoty (např. 2, 0,01), odkazy na buňky či rozsah (např. B2, B2:C5), vzorce či další funkce. Argumenty se v českém uživatelském prostředí oddělují středníkem (;), v anglickém čárkou (,).

Základní funkce (mimo těch souvisejících s podmínkami) uvádíme dále. Cvičení v této kapitole pracují hlavně s anglickými názvy funkcí (ty mnohdy odpovídají označení funkcí v programovacích jazycích).

funkce význam název v češtině SUM(rozsah) Spočítá součet hodnot v rozsahu. Např. =SUM(A1:A3) spočítá =A1+A2+A3. SUMA MIN(rozsah) Najde nejmenší hodnotu v rozsahu. MAX(rozsah) Najde největší hodnotu v rozsahu. AVERAGE(rozsah) Spočítá aritmetický průměr hodnot v rozsahu. Aritmetický průměr čísel 1, 1, 1, 2, 55 je 12. PRŮMĚR MEDIAN(rozsah) Spočítá medián hodnot v rozsahu (medián je číslo, které je větší nebo rovno alespoň polovině hodnot a zároveň menší nebo rovno alespoň polovině hodnot). Medián čísel 1, 1, 1, 2, 55 je 1. COUNT(rozsah) Spočítá počet buněk s číselnými hodnotami v rozsahu. POČET ABS(číslo) Spočítá absolutní hodnotu čísla. SIGN(číslo) Spočítá znaménko čísla (-1 pro záporné, 0 pro nulu a 1 pro kladné číslo). ROUND(číslo; počet) Zaokrouhlí číslo na zadaný počet desetinných míst, pokud není zadaný počet, zaokrouhluje se na celá čísla. ZAOKROUHLIT ROUNDUP(číslo; počet) Zaokrouhlí číslo nahoru na zadaný počet desetinných míst. Pokud není zadaný počet, zaokrouhluje se na celá čísla. Lze zadat záporný počet desetinných míst, např. počet -3 znamená zaokrouhlení nahoru na tisíce. ROUNDDOWN(číslo; počet) Zaokrouhlí číslo dolů na zadaný počet desetinných míst. Pokud není zadaný počet, zaokrouhluje se na celá čísla. Lze zadat záporný počet desetinných míst, např. počet -1 znamená zaokrouhlení dolů na desítky. DEGREES(úhel) Převede úhel v radiánech na úhel ve stupních. DEGREES(1,570796327) vyjde 90. RADIANS(úhel ve stupních) Převede úhel ve stupních na úhel v radiánech. RADIANS(90) vyjde 1,570796327. SIN(úhel) Spočítá sinus úhlu, úhel je zadaný v radiánech. SIN(1,570796327) vyjde 1. COS(úhel) Spočítá kosinus úhlu, úhel je zadaný v radiánech. COS(1,570796327) vyjde 0.
3. Tabulky II
4. Vizualizace dat
Souhrn tématu

Součásti grafů, pojmy

Souhrn tématu

Grafy sestávají z jednotlivých součástí, které se obvykle ztvárňují a uspořádávají podle určitých pravidel. Díky tomu je možné se snadněji orientovat v různých grafech. Čtenář může bez váhání rozeznat, co která součást grafu vyjadřuje.

Grafy zpravidla mívají nadpis, který stručně shrnuje data v grafu.

U grafů, které vyznačují data pomocí vzdáleností (sloupcové, spojnicové, bodové), jsou základní součástí osy. Svislá osa směřuje odshora dolů, také se označuje jako osa y. Vodorovná osa směřuje zleva doprava, také se označuje jako osa x. V souvislosti s osami může být uveden jak název samotné osy (co která osa značí), tak popisy hodnot/kategorií.

Datové řady jsou řádky či sloupce tabulky obsahující data, která graf znázorňuje. Data mohou být v grafu vyznačena např. pomocí sloupců či bodů (mezi těmi mohou být spojnice).

Mřížka usnadňuje orientaci v oblasti se znázorněnými daty. Mezi úsečkami hlavní mřížky bývají větší vzdálenosti, oblast grafu je jemněji dělena (zpravidla méně výraznou) vedlejší mřížkou.

U grafů může být přítomna spojnice trendu (anglicky trendline), která vyjadřuje odhad postupného vývoje hodnot.

Souhrn tématu

Vizuální kódování dat

Souhrn tématu

Řekněme, že jsme posbírali data a máme je zapsaná v tabulce. Abychom jim lépe porozuměli, je užitečné je vizualizovat, tj. zobrazit formou obrázku. To můžeme udělat mnoha způsoby. Například následující obrázek ukazuje několik způsobů znázornění stejných dat (A → 5, B → 2, C → 4).

Způsob ztvárnění volíme podle účelu vizualizace. Pokud chceme být schopni hodnoty snadno porovnávat, použijeme délku nebo polohu bodů, protože velikosti ploch, úhly a barvy se lidem srovnávají hůře. Pokud ale chceme být schopni rychle odhadnout, jak velkou část z celku něco tvoří, je většinou výhodnější použít úhly.

Můžeme též různé způsoby znázornění kombinovat. Například následující vizualizace zobrazuje délku života mužů a žen v různých státech světa. Klíčová informace o délce života je kódována pomocí polohy bodů, což usnadňuje srovnání států. Velikost a barva bodů pak zobrazují doplňkové informace (velikost států a příslušnost ke kontinentu).

Zdroj obrázku: Our World in Data

Pracovní list

Koláčové grafy: Oblíbené barvy

Pracovní list

Koláčové grafy: Oblíbené barvy
Pracovní list

Sloupcový graf: Olympijské medaile

Pracovní list

Sloupcový graf: Olympijské medaile
Pracovní list

Spojnicový graf: Počty obyvatel

Pracovní list

Spojnicový graf: Počty obyvatel
Pracovní list

Bodový graf: Délka života

Pracovní list

Bodový graf: Délka života
5. Databáze: úvod
Souhrn tématu

Relační databáze

Souhrn tématu

Pro snadné vyhledávání a rozšiřování dat se používají různé databázové architektury.

Relační databáze

Nejrozšířenějším typem jsou relační databáze. Data se zde ukládají v tabulkách. Jednotlivé záznamy jsou uloženy v řádcích tabulky a každý záznam odpovídá jedné entitě (například konkrétní osobě, věci apod.). Sloupce tabulky odpovídají atributům, tedy jednotlivým vlastnostem záznamů (například věk osob, cena zboží apod.). V hlavičce tabulky najdeme názvy jednotlivých atributů a někdy i jejich datové typy, tedy omezení na hodnoty, které je možné do daného pole ukládat. Příkladem datového typu je int, který značí celé číslo, nebo char[20], který značí textový řetězec z maximálně 20 znaků.

Klíče

Vyhledávání v tabulce nám zjednodušují superklíče a kandidátní klíče — skupiny atributů, které jednoznačně identifikují a odlišují každý záznam v tabulce. Kandidátní klíče jsou superklíče, které by odebráním jednoho atributu ztratily schopnost identifikovat nějaký záznam od ostatních. Z kandidátních klíčů se pro každou tabulku vybírá jeden primární klíč. Jedna relační databáze se obvykle skládá z většího množství tabulek, které mezi sebou můžeme propojovat pomocí primárních klíčů a vyhledávat tak odpovědi na složitější dotazy o našich datech. Primární klíč jedné tabulky použitý v jiné tabulce se v jejím kontextu nazývá cizí klíč.

Příklad klíčů v databázi e‑shopu
7. Regulární výrazy
Souhrn tématu

Základní vyhledávání

Souhrn tématu

Základními prvky regulárních jazyků jsou obyčejná písmena. Ty při vyhledávání odpovídají přímo sobě. Pokud tedy zadáme regulární výraz kr, tak mu budou odpovídat slova, která obsahují podřetězec „kr“.

Tečka odpovídá libovolnému znaku.

Metaznaky jsou speciální znaky, které používáme na konstrukci regulárních výrazů (např. .*+?). Co když ale chceme hledat právě tyto znaky? Na to použijeme zpětné lomítko, které ruší význam metaznaku a chápe jej jako znak obyčejný.

Souhrn tématu

Skupiny znaků

Souhrn tématu

Pomocí následujících speciálních znaků můžeme v regulárním výrazu označit skupiny písmen:

[] výběr znaku v závorkách, např. [aeiouy] značí libovolnou z uvedených samohlásek [ - ] výběr znaku z intervalu, např. [a-z] značí libovolné malé písmeno anglické abecedy [^ ] negovaný výběr znaku, např. [^aeiouy] značí vše kromě uvedených samohlásek \d číslice (to samé jako [0-9]) \D vše kromě číslic (to samé jako [^0-9]) \w alfanumerické znaky (to samé jako [a-zA-Z0-9_]) \W vše kromě alfanumerických znaků (to samé jako [^a-zA-Z0-9_]) \s „bílé” znaky (mezera, tabulátor, znaky pro zalomení řádků) \S vše kromě „bílých” znaků

Dále můžeme využít následující konstrukce, které vymezují více možností, případně seskupují znaky k sobě:

| odděluje několik dílčích výrazů (ahoj|nazdar odpovídá právě jednomu z pozdravů) () podřetězec, na nějž je možno aplikovat kvantifikátor (ko(ko)?s odpovídá právě kos a kokos)
Souhrn tématu

Kvantifikátory

Souhrn tématu

Kvantifikátory v regulárních výrazech vyznačují, kolikrát se má předcházející výraz opakovat. Například hvězdička v pe*s značí libovolný počet výskytů písmene e.

* libovolný počet opakování + jedno nebo více opakování ? volitelný výskyt (~ 0 nebo 1 opakování) {n} právě n výskytů {n,m} nejméně n, nejvíce m výskytů
NAPIŠTE NÁM

Děkujeme za vaši zprávu, byla úspěšně odeslána.

Napište nám

Nevíte si rady?

Před položením dotazu si prosím projděte návody:

Prosíme, nezasílejte dotazy na prozrazení řešení úloh či vysvětlení postupu. Pokud hlásíte chybu, upřesněte prosím, v čem přesně spočívá a připojte snímek obrazovky.

Čeho se zpráva týká?

Vzkaz Hlášení chyby Obsah Ovládání Přihlášení Licence