REAL

A RAG rendszer lehetőségei a levéltári kutatástámogatásban = The Applicability of RAG Technology in the Hungarian National Archives

Varga, Emese and Havas, Ádám and Bánki, Zsolt (2026) A RAG rendszer lehetőségei a levéltári kutatástámogatásban = The Applicability of RAG Technology in the Hungarian National Archives. In: A tudomány, az oktatás és a közgyűjteményi kiszolgálás új informatikai szinergiái : NETWORKSHOP 2026 : 35. Országos Informatikai Konferencia : 2026. március 31-április 2. Debreceni Egyetem, Debrecen. Hungarnet Egyesület, Budapest, pp. 233-242. ISBN 9786156792297 (In Press)

[img]
Preview
Text
nws_2026_inpress_varga.pdf - Published Version
Available under License Creative Commons Attribution.

Download (559kB) | Preview

Abstract

A mesterségesintelligencia-alapú technológiák egyre hangsúlyosabban jelennek meg a közgyűjteményi digitális szolgáltatásokban. A felhasználói igények már nem csupán a digitalizált források elérésére, hanem azok mélyebb, tartalmi feltárhatóságára, az eddigi kutatási módszertanokkal nehezen átlátható összefüggések felszínre hozatalára és célzott kereshetőségére irányulnak. Erre a kihívásra kínál új lehetőséget a RAG (Retrieval-Augmented Generation) technológián alapuló szolgáltatás. Az alkalmazás egy felhasználói kérdésre levéltári források alapján szemantikus keresést futtat, majd egy nagy nyelvi modell (LLM) segítségével választ generál. A megbízható válasz előfeltétele az intézmény által biztosított jó minőségű forrás. A tanulmány a Magyar Nemzeti Levéltár és a HELION Kft. együttműködésében fejlesztett alkalmazás levéltári integrálhatóságát mutatja be, tekintettel arra, hogy a RAG-alapú megoldás miként illeszkedik a meglévő online tartalomszolgáltatásokhoz. Fókuszba kerül a RAG fejlesztésének és levéltári implementálásának folyamata is. E téren bemutatásra kerül, hogy a kétlépcsősen működő RAG-alkalmazás az első nyelvi modellhívás során megvizsgálja a kontextust, majd a felhasználói kérdésből kulcsszavakat és név entitásokat (NER) nyer ki, amelyek a dokumentumkeresés alapját képezik. FAISS (Facebook AI Similarity Search)-alapú szemantikus keresést kombinál Oracle adatbázis context indexre támaszkodó szűréssel. A keresés eredményeként kapott szövegrészek adják a második nyelvi modellhívás bemenetét. Mindkét híváshoz az OpenAI gpt-4.1 modelljét használja, a kérdésre adott végleges válasz streamelt formában érkezik. | Artificial intelligence-based technologies are becoming increasingly prominent in public collection digital services. User demands are no longer limited to accessing digitized resources, but also include deeper content exploration, the uncovering of connections that are difficult to discern using existing research methodologies, and targeted searchability. A service based on RAG (Retrieval-Augmented Generation) technology offers a new opportunity to meet this challenge. The application runs a semantic search based on archival sources and then generates answers to user questions using a large language model (LLM). A prerequisite for reliable answers is the high quality of the sources provided by the institution. The article will discuss the archival integration of the application developed in collaboration between the Hungarian National Archives and HELION Kft., with a focus on how the RAG-based solution fits into existing online content services. It will focus on the development of RAG, the process of its implementation in archives, and the experiences of its developers. In this context, we will demonstrate that the two-stage RAG application examines the input during the first language model call, then extracts keywords and named entities (NER) from the user’s question, which form the basis for document search. It combines FAISS (Facebook AI Similarity Search)-based semantic search with Oracle database context index-based filtering. The text fragments obtained as a result of the search provide the input for the second language model call. It uses the OpenAI gpt-4.1 model for both calls, and the final answer to the question is delivered in streamed form.

Item Type: Book Section
Uncontrolled Keywords: Networkshop 2026, mesterséges intelligencia, RAG, szemantikus keresés, nagy nyelvi modellek, levéltári digitalizáció, artificial intelligence, RAG, semantic search, large language models, archival digitization
Subjects: C Auxiliary Sciences of History / történeti segédtudományok > CD Diplomatics. Archives. Seals / oklevéltan, levéltárak, pecséttan > CD921 Archives / levéltár, levéltári gyűjtemény
Z Bibliography. Library Science. Information Resources / könyvtártudomány > Z701.3.D54 Digitalisation/ICT and cultural heritage / Digitalizálás, ICT és kulturális örökség
SWORD Depositor: MTMT SWORD
Depositing User: MTMT SWORD
Date Deposited: 06 Aug 2026 14:41
Last Modified: 06 Aug 2026 14:54
URI: https://real.mtak.hu/id/eprint/243843

Actions (login required)

Edit Item Edit Item