Szűcs, Kata Ágnes and Varga, Emese and Vadász, Noémi and Záros, Zsolt and Szatucsek, Zoltán (2026) Az összetett mezők strukturált adatainak szétválasztása az állami anyakönyvekben = Separating Structured Data in the Complex Fields of Hungarian Civil Registers. In: A tudomány, az oktatás és a közgyűjteményi kiszolgálás új informatikai szinergiái : NETWORKSHOP 2026 : 35. Országos Informatikai Konferencia : 2026. március 31-április 2. Debreceni Egyetem, Debrecen. Hungarnet Egyesület, Budapest, pp. 243-255. ISBN 9786156792297 (In Press)
|
Text
nws_2026_inpress_szucs.pdf - Published Version Available under License Creative Commons Attribution. Download (600kB) | Preview |
Abstract
A kézírással készült adatok kinyerése szkennelt anyakönyvekből az összetett mezők miatt is kihívást jelent: egy mező többféle adattípust tartalmazhat, hiányozhat a fejléc és változhat a sorrend, miközben a HTR-kimenetek soralapúak. Tizenhét összetett mezőt azonosítottunk; a szabályalapú módszerek csak egyszerű esetekben működtek, ezért bevezettünk mezőre szabott LLM-megoldásokat prompt- és paraméterhangolással. Egyes modellek megbízható eredményeket adtak, másoknál adatvesztés, ID-kiesés, felesleges tokenek vagy instabilitás jelentkezett, amelyeket szigorú rendszerpromptokkal és prompt módosítással kezelünk. Reprezentatív tesztkorpuszt és mezőszintű mérőszámokat építettünk. Következtetés: nincs univerzális megoldás – néhány mező teljesen automatizálható, soknál maradnak bizonytalanságok; a legjobb eredmény a feladat részekre bontásából és a célzott LLM-ek szabályalapú ellenőrzésének kombinálásából adódott. | Extracting handwritten data from scanned registry books is challenging due to complex fields that may contain multiple data types, missing headers, and variable ordering, while HTR outputs are row-based. We identified 17 complex field types; rule-based methods worked only for simple cases, so we introduced field-specific LLM solutions with prompt and parameter tuning. Some models were stable; others showed data loss, ID dropout, superfluous tokens or instability, which we have mitigated by strict system prompts and tuning. We built a representative test corpora and field-level metrics. Conclusion: there is no universal solution – some fields can be fully automated, many remain ambiguous; best results arise from decomposing the task and combining targeted LLMs with rule-based validation.
| Item Type: | Book Section |
|---|---|
| Uncontrolled Keywords: | Networkshop 2026, állami anyakönyvek, kézírás-felismertetés (HTR), nagy nyelvi modellek (LLM), szemantikus szegmentálás, adatnormalizálás, Magyar Nemzeti Levéltár, civil registers, handwritten text recognition (HTR), large language models (LLM), semantic segmentation, data normalization, National Archives of Hungary |
| Subjects: | C Auxiliary Sciences of History / történeti segédtudományok > CD Diplomatics. Archives. Seals / oklevéltan, levéltárak, pecséttan > CD921 Archives / levéltár, levéltári gyűjtemény Z Bibliography. Library Science. Information Resources / könyvtártudomány > Z701.3.D54 Digitalisation/ICT and cultural heritage / Digitalizálás, ICT és kulturális örökség |
| SWORD Depositor: | MTMT SWORD |
| Depositing User: | MTMT SWORD |
| Date Deposited: | 06 Aug 2026 14:40 |
| Last Modified: | 06 Aug 2026 14:55 |
| URI: | https://real.mtak.hu/id/eprint/243844 |
Actions (login required)
![]() |
Edit Item |




