Micsik, András and Tanácsi, Roland (2026) Tömeges idézésfeltöltés az MTMT-be nagy nyelvi modell segítségével = Citation Batch Upload into MTMT with the Help of an LLM. In: A tudomány, az oktatás és a közgyűjteményi kiszolgálás új informatikai szinergiái : NETWORKSHOP 2026 : 35. Országos Informatikai Konferencia : 2026. március 31-április 2. Debreceni Egyetem, Debrecen. Hungarnet Egyesület, Budapest, pp. 213-221. ISBN 9786156792297
|
Text
nws_2026_inpress_micsik.pdf - Published Version Available under License Creative Commons Attribution. Download (708kB) | Preview |
Abstract
A Magyar Tudományos Művek Tára (MTMT) a hazai tudományos eredmények és eredményesség hiteles adatbázisa. A kutatások eredményességének jelentős mutatója az idézettség, és ehhez az MTMT folyamatosan adatokat gyűjt. Az idézési adatokat nem mindig lehet központilag megszerezni vagy megvásárolni, ezért ezek feltöltése tudományterületenként változó arányban a szerzőkre és az MTMT adminisztrátoraira hárul. Az esetenként több ezer új idézési adat feltöltése óriási plusz terhet ró a kutatókra és a kutatást segítőkre. E feladat gépi asszisztálására a HUN-REN SZTAKI Elosztott Rendszerek Osztálya (DSD) már régóta próbálkozik különböző megoldásokkal. Az elmúlt 1–2 év mesterséges intelligencia (MI) fejlesztései már lehetővé teszik, hogy egy nagy nyelvi modell (LLM) intelligens módon gyűjtsön metaadatokat weblapokról. E lehetőség kihasználására fejlesztettünk ki egy parancssorból vezérelhető tömeges idézésfeldolgozó szkriptet, a Metaxa-t (Metadata Extractor), amelynek alapvető működési elveit mutatjuk itt be. | The Hungarian Science Bibliography (MTMT) is the authoritative database of Hungarian scientific achievements and performance. Citation count is a significant indicator of research performance, and MTMT collects citation data for this purpose. Citation data cannot always be obtained or purchased centrally, so uploading these data often falls to the authors and MTMT administrators. The occasional need to upload several thousand new citation records places a substantial additional burden on researchers and research support staff. To provide machine-assisted support for this task, the Department of Distributed Systems (DSD) of HUN-REN SZTAKI has long been experimenting with various solutions. Advances in artificial intelligence (AI) over the past 1–2 years now make it possible for a large language model (LLM) to intelligently collect metadata from web pages. To leverage this opportunity, we have developed a command-line–driven bulk citation processing script called Metaxa (Metadata Extractor), whose basic operating principles are presented here.
| Item Type: | Book Section |
|---|---|
| Uncontrolled Keywords: | NWS 2026, MTMT, Tudománymetria, Metaadat-kinyerés, Nagy nyelvi modell, LLM, Hungarian Science Bibliography, Scientometrics, Metadata extraction, Large Language Model, Networkshop 2026 |
| Subjects: | Q Science / természettudomány > QA Mathematics / matematika > QA75 Electronic computers. Computer science / számítástechnika, számítógéptudomány Z Bibliography. Library Science. Information Resources / könyvtártudomány > Z7405.C6 Communication in science / tudományos kommunikáció |
| SWORD Depositor: | MTMT SWORD |
| Depositing User: | MTMT SWORD |
| Date Deposited: | 01 Aug 2026 06:43 |
| Last Modified: | 02 Aug 2026 14:49 |
| URI: | https://real.mtak.hu/id/eprint/243594 |
Actions (login required)
![]() |
Edit Item |




