Využití velkých jazykových modelů k analýze dat z kapitálových trhů

dc.contributor.advisorSvoboda, Radek
dc.contributor.authorDuba, Michal
dc.contributor.refereeGaura, Jan
dc.date.accepted2026-06-04
dc.date.accessioned2026-09-02T14:36:48Z
dc.date.available2026-09-02T14:36:48Z
dc.date.issued2026
dc.description.abstractDiplomová práce se zabývá experimentálním vyhodnocením velkých jazykových modelů (LLM) jako nástroje pro analýzu dat z kapitálových trhů. Hlavním cílem je kvantitativně ověřit, zda současné LLM dokáží v konkrétních analytických úlohách nahradit nebo překonat dosavadní state-of-the-art metody zpracování finančních dokumentů, a tím snížit informační nevýhodu retailových investorů vůči institucionálním účastníkům trhu. V rámci práce byla navržena a implementována modulární experimentální platforma v jazyce Python s využitím frameworku Streamlit, databáze PostgreSQL a ekosystému LangChain. Platforma automatizovaně získává regulatorní dokumenty americké Komise pro cenné papíry a burzy (SEC), tržní data a strukturovaná finanční data ve formátu XBRL. Na této datové infrastruktuře bylo navrženo deset kontrolovaných experimentů pokrývajících sentimentální analýzu, extrakci strukturovaných informací, sémantické porovnávání dokumentů, predikci finančních událostí a vyhledávání informací. Každý experiment porovnává tradiční baseline metodu s přístupem založeným na LLM a výsledky jsou hodnoceny standardními statistickými testy na hladině významnosti $\alpha = 0{,}05$. Z deseti provedených experimentů vyplynuly čtyři hlavní závěry. LLM vykazují statisticky významnou převahu v úlohách vyžadujících kontextové porozumění, jako je detekce nesouladu tónu managementu s finančními fundamenty nebo klasifikace postoje managementu k diskutovaným entitám. Naopak v deterministických numerických a extrakčních úlohách LLM systematicky selhávají -- kontrolní experiment prokázal kritickou míru halucinací při výpočtu finančních ukazatelů a pravidlové systémy výrazně překonaly LLM v extrakci strukturovaných dat. Kapacita modelu má měřitelný, avšak nemonotónní dopad na kvalitu výstupu -- vyšší kapacita přináší zlepšení v kontextových úlohách, ale může vést k horšímu výkonu v úlohách dominovaných požadavky na formátovou konzistenci. Práce proto doporučuje komplementární hybridní architekturu, kde LLM zajišťují kvalitativní analytickou nadstavbu a deterministické systémy zpracovávají strukturovaná numerická data.cs
dc.description.abstractThis thesis presents an experimental evaluation of large language models (LLMs) as tools for capital markets data analysis. The primary objective is to quantitatively assess whether current LLMs can match or surpass established state-of-the-art methods in specific financial document analysis tasks, thereby reducing the information disadvantage of retail investors relative to institutional market participants. A modular experimental platform was designed and implemented in Python, utilizing the Streamlit framework, a PostgreSQL database, and the LangChain ecosystem. The platform automatically acquires regulatory filings from the U.S. Securities and Exchange Commission (SEC), market data, and structured financial data in XBRL format. Ten controlled experiments were designed on this data infrastructure, covering sentiment analysis, structured information extraction, semantic document comparison, financial event prediction, and information retrieval. Each experiment compares a traditional baseline method with an LLM-based approach, and results are evaluated using standard statistical tests at a significance level of $\alpha = 0.05$. Four key findings emerge from the ten completed experiments. LLMs demonstrate statistically significant superiority in tasks requiring contextual understanding, such as detecting tone-fundamentals misalignment or classifying management stance toward discussed entities. Conversely, LLMs systematically fail in deterministic numerical and extraction tasks -- a control experiment revealed critical hallucination rates when computing financial ratios from unstructured text, and rule-based systems significantly outperformed LLMs in structured data extraction. Model capacity has a measurable but non-monotonic effect on output quality -- higher capacity improves performance on contextual tasks but may degrade it on tasks dominated by format consistency requirements. The thesis therefore recommends a complementary hybrid architecture in which LLMs provide qualitative analytical capabilities while deterministic systems process structured numerical data.en
dc.description.department460 - Katedra informatikycs
dc.description.resultvýborněcs
dc.format.extent7112978 bytes
dc.format.mimetypeapplication/pdf
dc.identifier.otherOSD002
dc.identifier.senderS2724
dc.identifier.thesisDUB0074_FEI_N0613A140034_2026
dc.identifier.urihttp://hdl.handle.net/10084/160443
dc.language.isocs
dc.publisherVysoká škola báňská – Technická univerzita Ostravacs
dc.rights.accessopenAccess
dc.subjectvelké jazykové modelycs
dc.subjectanalýza kapitálových trhůcs
dc.subjectzpracování přirozeného jazykacs
dc.subjectsentimentální analýzacs
dc.subjectextrakce informacícs
dc.subjectfinanční dokumenty SECcs
dc.subjecthalucinace LLMcs
dc.subjectexperimentální evaluacecs
dc.subjectlarge language modelsen
dc.subjectcapital markets analysisen
dc.subjectnatural language processingen
dc.subjectsentiment analysisen
dc.subjectinformation extractionen
dc.subjectSEC financial filingsen
dc.subjectLLM hallucinationsen
dc.subjectexperimental evaluationen
dc.thesis.degree-grantorVysoká škola báňská – Technická univerzita Ostrava. Fakulta elektrotechniky a informatikycs
dc.thesis.degree-levelMagisterský studijní programcs
dc.thesis.degree-nameIng.
dc.thesis.degree-programInformatikacs
dc.titleVyužití velkých jazykových modelů k analýze dat z kapitálových trhůcs
dc.title.alternativeUsing Large Language Models for Analysis of Capital Markets Dataen
dc.typeDiplomová prácecs
local.files.count6
local.files.size14304661
local.has.filesyes

Files

Original bundle

Now showing 1 - 5 out of 6 results
Loading...
Thumbnail Image
Name:
DUB0074_FEI_N0613A140034_2026.pdf
Size:
6.78 MB
Format:
Adobe Portable Document Format
Description:
Text práce
Loading...
Thumbnail Image
Name:
DUB0074_FEI_N0613A140034_2026_zadani.pdf
Size:
155.54 KB
Format:
Adobe Portable Document Format
Description:
Zadání
Loading...
Thumbnail Image
Name:
DUB0074_FEI_N0613A140034_2026_priloha.zip
Size:
6.33 MB
Format:
ZIP
Description:
Příloha
Loading...
Thumbnail Image
Name:
DUB0074_FEI_N0613A140034_2026_posudek_vedouci_Svoboda_Radek.pdf
Size:
161.07 KB
Format:
Adobe Portable Document Format
Description:
Posudek vedoucího – Svoboda, Radek
Loading...
Thumbnail Image
Name:
DUB0074_FEI_N0613A140034_2026_posudek_oponent_Gaura_Jan.pdf
Size:
159.59 KB
Format:
Adobe Portable Document Format
Description:
Posudek oponenta – Gaura, Jan