High-tech server room with clean white and gray aesthetic, d
Technická dokumentace v1.0

Export a příprava dat

Kvalita analýzy výdajů přímo závisí na integritě vstupních dat. V této sekci rozebereme technické postupy pro získávání transakční historie z bankovních institucí a jejich následnou normalizaci pro potřeby neuronových sítí.

PROSTUDOVAT METODIKU
99%

Přesnost parsování

CSV

Standardní formát

256b

Šifrování toku

Strukturovaný export

Většina českých bank umožňuje export do formátu CSV nebo GPC. Pro potřeby AI analýzy je klíčové získat surová data obsahující datum, částku, variabilní symbol a textový popis transakce.

Více o HW nárocích

Validace duplicit

Při opakovaných exportech dochází k překryvům datových sad. Implementujeme algoritmy, které na základě unikátních ID transakcí eliminují duplicity dříve, než vstoupí do modelu.

Metody klasifikace

Anonymizace dat

Před odesláním do cloudových modelů je nutné odstranit citlivé údaje jako jsou celá čísla účtů nebo osobní jména v poznámkách, což zajišťuje vysokou míru soukromí.

Zásady ochrany
Proces čištění dat

Jak připravit data pro neuronovou síť

Prvním krokem je eliminace šumu. Bankovní výpisy často obsahují systémové záznamy, jako jsou poplatky za vedení účtu nebo vnitrobankovní převody mezi vlastními účty, které mohou zkreslovat reálný obraz o spotřebě. Tyto položky musí být identifikovány a označeny specifickými tagy, aby je neuronová síť mohla v rámci analýzy rozpočtu správně interpretovat nebo ignorovat.

⚠️ Důležité upozornění: Nikdy neupravujte surová data přímo v původním exportovaném souboru. Vždy pracujte s kopií, abyste mohli v případě chyby v parsování ověřit integritu výpočtů oproti originálnímu bankovnímu výpisu.

Technické kroky předzpracování:

  1. Konverze kódování: Převeďte soubor do formátu UTF-8, aby nedošlo k poškození diakritiky v popisech transakcí.
  2. Normalizace měn: Pokud máte účty ve více měnách, přepočítejte všechny částky na základní měnu podle historického kurzu ČNB k datu transakce.
  3. Odstranění prázdných polí: Vymažte řádky, které postrádají klíčové atributy (datum nebo částku).
  4. Tokenizace textu: Rozdělte řetězce v poznámkách na jednotlivá slova pro snadnější zpracování NLP modelem.

Správně vyčištěná data umožňují modelu přesně klasifikovat výdaje do kategorií jako "Potraviny", "Bydlení" nebo "Zábava". Bez této přípravy hrozí, že model zařadí nesouvisející platby do špatných skupin, což znehodnotí celý finanční plán.

Protokol

Krok 01

Stažení dat

Přihlaste se do internetového bankovnictví a vygenerujte export za posledních 12 měsíců ve formátu CSV.

Krok 02

Lokální kontrola

Otevřete soubor v tabulkovém procesoru a ověřte, zda sloupce odpovídají očekávané struktuře.

Krok 03

Nahrání do systému

Importujte data do našeho zabezpečeného rozhraní, které automaticky provede prvotní analýzu struktury.

Krok 04

Manuální korekce

Zkontrolujte položky, které systém označil jako nejednoznačné, a potvrďte jejich správné zařazení.

Připraveni na analýzu?

Nyní, když rozumíte procesu přípravy dat, můžete přejít k samotnému nastavení neuronové sítě pro váš osobní rozpočet.