REAL

Az összetett mezők strukturált adatainak szétválasztása az állami anyakönyvekben = Separating Structured Data in the Complex Fields of Hungarian Civil Registers

Szűcs, Kata Ágnes and Varga, Emese and Vadász, Noémi and Záros, Zsolt and Szatucsek, Zoltán (2026) Az összetett mezők strukturált adatainak szétválasztása az állami anyakönyvekben = Separating Structured Data in the Complex Fields of Hungarian Civil Registers. In: A tudomány, az oktatás és a közgyűjteményi kiszolgálás új informatikai szinergiái : NETWORKSHOP 2026 : 35. Országos Informatikai Konferencia : 2026. március 31-április 2. Debreceni Egyetem, Debrecen. Hungarnet Egyesület, Budapest, pp. 243-255. ISBN 9786156792297 (In Press)

[img]
Preview
Text
nws_2026_inpress_szucs.pdf - Published Version
Available under License Creative Commons Attribution.

Download (600kB) | Preview

Abstract

A kézírással készült adatok kinyerése szkennelt anyakönyvekből az összetett mezők miatt is kihívást jelent: egy mező többféle adattípust tartalmazhat, hiányozhat a fejléc és változhat a sorrend, miközben a HTR-kimenetek soralapúak. Tizenhét összetett mezőt azonosítottunk; a szabályalapú módszerek csak egyszerű esetekben működtek, ezért bevezettünk mezőre szabott LLM-megoldásokat prompt- és paraméterhangolással. Egyes modellek megbízható eredményeket adtak, másoknál adatvesztés, ID-kiesés, felesleges tokenek vagy instabilitás jelentkezett, amelyeket szigorú rendszerpromptokkal és prompt módosítással kezelünk. Reprezentatív tesztkorpuszt és mezőszintű mérőszámokat építettünk. Következtetés: nincs univerzális megoldás – néhány mező teljesen automatizálható, soknál maradnak bizonytalanságok; a legjobb eredmény a feladat részekre bontásából és a célzott LLM-ek szabályalapú ellenőrzésének kombinálásából adódott. | Extracting handwritten data from scanned registry books is challenging due to complex fields that may contain multiple data types, missing headers, and variable ordering, while HTR outputs are row-based. We identified 17 complex field types; rule-based methods worked only for simple cases, so we introduced field-specific LLM solutions with prompt and parameter tuning. Some models were stable; others showed data loss, ID dropout, superfluous tokens or instability, which we have mitigated by strict system prompts and tuning. We built a representative test corpora and field-level metrics. Conclusion: there is no universal solution – some fields can be fully automated, many remain ambiguous; best results arise from decomposing the task and combining targeted LLMs with rule-based validation.

Item Type: Book Section
Uncontrolled Keywords: Networkshop 2026, állami anyakönyvek, kézírás-felismertetés (HTR), nagy nyelvi modellek (LLM), szemantikus szegmentálás, adatnormalizálás, Magyar Nemzeti Levéltár, civil registers, handwritten text recognition (HTR), large language models (LLM), semantic segmentation, data normalization, National Archives of Hungary
Subjects: C Auxiliary Sciences of History / történeti segédtudományok > CD Diplomatics. Archives. Seals / oklevéltan, levéltárak, pecséttan > CD921 Archives / levéltár, levéltári gyűjtemény
Z Bibliography. Library Science. Information Resources / könyvtártudomány > Z701.3.D54 Digitalisation/ICT and cultural heritage / Digitalizálás, ICT és kulturális örökség
SWORD Depositor: MTMT SWORD
Depositing User: MTMT SWORD
Date Deposited: 06 Aug 2026 14:40
Last Modified: 06 Aug 2026 14:55
URI: https://real.mtak.hu/id/eprint/243844

Actions (login required)

Edit Item Edit Item