Využití velkých jazykových modelů k analýze dat z kapitálových trhů
| dc.contributor.advisor | Svoboda, Radek | |
| dc.contributor.author | Duba, Michal | |
| dc.contributor.referee | Gaura, Jan | |
| dc.date.accepted | 2026-06-04 | |
| dc.date.accessioned | 2026-09-02T14:36:48Z | |
| dc.date.available | 2026-09-02T14:36:48Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Diplomová práce se zabývá experimentálním vyhodnocením velkých jazykových modelů (LLM) jako nástroje pro analýzu dat z kapitálových trhů. Hlavním cílem je kvantitativně ověřit, zda současné LLM dokáží v konkrétních analytických úlohách nahradit nebo překonat dosavadní state-of-the-art metody zpracování finančních dokumentů, a tím snížit informační nevýhodu retailových investorů vůči institucionálním účastníkům trhu. V rámci práce byla navržena a implementována modulární experimentální platforma v jazyce Python s využitím frameworku Streamlit, databáze PostgreSQL a ekosystému LangChain. Platforma automatizovaně získává regulatorní dokumenty americké Komise pro cenné papíry a burzy (SEC), tržní data a strukturovaná finanční data ve formátu XBRL. Na této datové infrastruktuře bylo navrženo deset kontrolovaných experimentů pokrývajících sentimentální analýzu, extrakci strukturovaných informací, sémantické porovnávání dokumentů, predikci finančních událostí a vyhledávání informací. Každý experiment porovnává tradiční baseline metodu s přístupem založeným na LLM a výsledky jsou hodnoceny standardními statistickými testy na hladině významnosti $\alpha = 0{,}05$. Z deseti provedených experimentů vyplynuly čtyři hlavní závěry. LLM vykazují statisticky významnou převahu v úlohách vyžadujících kontextové porozumění, jako je detekce nesouladu tónu managementu s finančními fundamenty nebo klasifikace postoje managementu k diskutovaným entitám. Naopak v deterministických numerických a extrakčních úlohách LLM systematicky selhávají -- kontrolní experiment prokázal kritickou míru halucinací při výpočtu finančních ukazatelů a pravidlové systémy výrazně překonaly LLM v extrakci strukturovaných dat. Kapacita modelu má měřitelný, avšak nemonotónní dopad na kvalitu výstupu -- vyšší kapacita přináší zlepšení v kontextových úlohách, ale může vést k horšímu výkonu v úlohách dominovaných požadavky na formátovou konzistenci. Práce proto doporučuje komplementární hybridní architekturu, kde LLM zajišťují kvalitativní analytickou nadstavbu a deterministické systémy zpracovávají strukturovaná numerická data. | cs |
| dc.description.abstract | This thesis presents an experimental evaluation of large language models (LLMs) as tools for capital markets data analysis. The primary objective is to quantitatively assess whether current LLMs can match or surpass established state-of-the-art methods in specific financial document analysis tasks, thereby reducing the information disadvantage of retail investors relative to institutional market participants. A modular experimental platform was designed and implemented in Python, utilizing the Streamlit framework, a PostgreSQL database, and the LangChain ecosystem. The platform automatically acquires regulatory filings from the U.S. Securities and Exchange Commission (SEC), market data, and structured financial data in XBRL format. Ten controlled experiments were designed on this data infrastructure, covering sentiment analysis, structured information extraction, semantic document comparison, financial event prediction, and information retrieval. Each experiment compares a traditional baseline method with an LLM-based approach, and results are evaluated using standard statistical tests at a significance level of $\alpha = 0.05$. Four key findings emerge from the ten completed experiments. LLMs demonstrate statistically significant superiority in tasks requiring contextual understanding, such as detecting tone-fundamentals misalignment or classifying management stance toward discussed entities. Conversely, LLMs systematically fail in deterministic numerical and extraction tasks -- a control experiment revealed critical hallucination rates when computing financial ratios from unstructured text, and rule-based systems significantly outperformed LLMs in structured data extraction. Model capacity has a measurable but non-monotonic effect on output quality -- higher capacity improves performance on contextual tasks but may degrade it on tasks dominated by format consistency requirements. The thesis therefore recommends a complementary hybrid architecture in which LLMs provide qualitative analytical capabilities while deterministic systems process structured numerical data. | en |
| dc.description.department | 460 - Katedra informatiky | cs |
| dc.description.result | výborně | cs |
| dc.format.extent | 7112978 bytes | |
| dc.format.mimetype | application/pdf | |
| dc.identifier.other | OSD002 | |
| dc.identifier.sender | S2724 | |
| dc.identifier.thesis | DUB0074_FEI_N0613A140034_2026 | |
| dc.identifier.uri | http://hdl.handle.net/10084/160443 | |
| dc.language.iso | cs | |
| dc.publisher | Vysoká škola báňská – Technická univerzita Ostrava | cs |
| dc.rights.access | openAccess | |
| dc.subject | velké jazykové modely | cs |
| dc.subject | analýza kapitálových trhů | cs |
| dc.subject | zpracování přirozeného jazyka | cs |
| dc.subject | sentimentální analýza | cs |
| dc.subject | extrakce informací | cs |
| dc.subject | finanční dokumenty SEC | cs |
| dc.subject | halucinace LLM | cs |
| dc.subject | experimentální evaluace | cs |
| dc.subject | large language models | en |
| dc.subject | capital markets analysis | en |
| dc.subject | natural language processing | en |
| dc.subject | sentiment analysis | en |
| dc.subject | information extraction | en |
| dc.subject | SEC financial filings | en |
| dc.subject | LLM hallucinations | en |
| dc.subject | experimental evaluation | en |
| dc.thesis.degree-grantor | Vysoká škola báňská – Technická univerzita Ostrava. Fakulta elektrotechniky a informatiky | cs |
| dc.thesis.degree-level | Magisterský studijní program | cs |
| dc.thesis.degree-name | Ing. | |
| dc.thesis.degree-program | Informatika | cs |
| dc.title | Využití velkých jazykových modelů k analýze dat z kapitálových trhů | cs |
| dc.title.alternative | Using Large Language Models for Analysis of Capital Markets Data | en |
| dc.type | Diplomová práce | cs |
| local.files.count | 6 | |
| local.files.size | 14304661 | |
| local.has.files | yes |
Files
Original bundle
1 - 5 out of 6 results
Loading...
- Name:
- DUB0074_FEI_N0613A140034_2026.pdf
- Size:
- 6.78 MB
- Format:
- Adobe Portable Document Format
- Description:
- Text práce
Loading...
- Name:
- DUB0074_FEI_N0613A140034_2026_zadani.pdf
- Size:
- 155.54 KB
- Format:
- Adobe Portable Document Format
- Description:
- Zadání
Loading...
- Name:
- DUB0074_FEI_N0613A140034_2026_priloha.zip
- Size:
- 6.33 MB
- Format:
- ZIP
- Description:
- Příloha
Loading...
- Name:
- DUB0074_FEI_N0613A140034_2026_posudek_vedouci_Svoboda_Radek.pdf
- Size:
- 161.07 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek vedoucího – Svoboda, Radek
Loading...
- Name:
- DUB0074_FEI_N0613A140034_2026_posudek_oponent_Gaura_Jan.pdf
- Size:
- 159.59 KB
- Format:
- Adobe Portable Document Format
- Description:
- Posudek oponenta – Gaura, Jan