Ujhelyi, Gábor (2026) Számonkérések automatikus értékelési lehetősége nagy nyelvi modellek felhasználásával = Automatic evaluation of assessments using large language models. In: Agria Média 2025 : „Oktatás 5.0: Az ember és a technológia harmóniája”. Eszterházy Károly Katolikus Egyetem Digitális Technológia Intézet, Eger, pp. 209-214. ISBN 9789634963400
|
Text
209Ujhelyi.pdf - Published Version Download (1MB) | Preview |
Abstract
A mesterséges intelligencia – köztük a nagy nyelvi modellek (LLM-ek) – gyors fejlődése érdemben alakítja az oktatási értékelés területét: a részfolyamatok automatizálásának ígérete mellett új kockázatokat és módszertani kérdéseket is felvet. Kutatásomban az instruktív, lépésről lépésre megfogalmazott Microsoft Wordszövegszerkesztési feladatok automatikus értékelhetőségét vizsgáltam felhőszolgáltatásként elérhető LLM-ekkel. Hallgatóim ZH-ként beadott megoldásait először manuálisan, majd több iterációban különböző promptstratégiákkal LLM-ek segítségével értékeltem, és az eredményeket egymással, illetve a manuális pontozással hasonlítottam össze. A vizsgálat alapján az LLM-ek a viszonylag egyszerűbb formázási követelményeket többnyire megbízhatóan észlelik, ám a komplexebb, funkcionális elemek (pl. tartalomjegyzék, ábrajegyzék, irodalomjegyzék) esetén gyakoriak a hamis pozitív és hamis negatív döntések. A modellek közül a ChatGPT és a Claude eredményei közelítettek leginkább a manuális értékeléshez; a Gemini, a Perplexity és a DeepSeek sokszor túlzottan optimistán pontozott, míg a Manus teljesítménye maradt el a leginkább. Következtetésem szerint az LLM-ek önálló, zárt láncú értékelésre még nem alkalmasak, de jól körülhatárolt részfeladatokra, a tanári döntést támogató eszközként már most hasznosíthatók. Eredményeim megerősítik, hogy a promptolás strukturálása („lépésenkénti” gondolatvezetés) javíthatja a konzisztenciát, ugyanakkor a nyelvi megfogalmazásra – az instrukciók nyelvére és precizitására – érzékeny a teljesítmény. A továbblépéshez többlépéses feldolgozási csővezetékek, integrációs megoldások és további modellvariánsok vizsgálatát tartom ígéretesnek. | The rapid development of artificial intelligence – including large language models (LLMs) – is significantly changing the field of educational assessment: in addition to the promise of automating sub-processes, it also raises new risks and methodological issues. In my research, I examined the automatic assessment of instructive, step-by-step Microsoft Word word processing tasks using LLMs available as a cloud service. I first assessed my students’ solutions submitted as ZH manually, then in several iterations using different prompting strategies using LLMs, and compared the results with each other and with manual scoring. Based on the study, LLMs mostly reliably detect relatively simple formatting requirements, but false positive and false negative decisions are common in the case of more complex, functional elements (e.g. table of contents, list of figures, bibliography). Of the models, the results of ChatGPT and Claude came closest to manual assessment; Gemini, Perplexity and DeepSeek often scored too optimistically, while Manus' performance was the most lacking. I conclude that LLMs are not yet suitable for independent, closed-loop assessment, but they can already be used for well-defined subtasks, as a tool to support teacher decisions. My results confirm that structuring prompting (“stepby-step” thought guidance) can improve consistency, but performance is sensitive to linguistic formulation – the language and precision of the instructions. I consider the examination of multi-step processing pipelines, integration solutions and further model variants to be promising for further progress.
| Item Type: | Book Section |
|---|---|
| Uncontrolled Keywords: | large language model, automatic assessment, text editing, educational technology, higher education, nagy nyelvi modell, automatikus értékelés, szövegszerkesztés, oktatástechnológia, felsőoktatás |
| Subjects: | L Education / oktatás > LB Theory and practice of education / oktatás elmélete és gyakorlata > LB2300 Higher Education / felsőoktatás Q Science / természettudomány > QA Mathematics / matematika > QA75 Electronic computers. Computer science / számítástechnika, számítógéptudomány |
| SWORD Depositor: | MTMT SWORD |
| Depositing User: | MTMT SWORD |
| Date Deposited: | 16 Sep 2026 13:23 |
| Last Modified: | 16 Sep 2026 13:23 |
| URI: | https://real.mtak.hu/id/eprint/246447 |
Actions (login required)
![]() |
View Item |




