Ujhelyi, Gábor (2026) Számonkérések automatikus értékelési lehetősége nagy nyelvi modellek felhasználásával In: Agria Média 2025 : „Oktatás 5.0: Az ember és a technológia harmóniája”. Eger, Eszterházy Károly Katolikus Egyetem (Digitális Technológia Intézet). pp. 209-214.
|
pdf
209Ujhelyi.pdf Download (1MB) [error in script] |
Absztrakt (kivonat)
A mesterséges intelligencia – köztük a nagy nyelvi modellek (LLM-ek) – gyors fejlődése érdemben alakítja az oktatási értékelés területét: a részfolyamatok automatizálásának ígérete mellett új kockázatokat és módszertani kérdéseket is felvet. Kutatásomban az instruktív, lépésről lépésre megfogalmazott Microsoft Wordszövegszerkesztési feladatok automatikus értékelhetőségét vizsgáltam felhőszolgáltatásként elérhető LLM-ekkel. Hallgatóim ZH-ként beadott megoldásait először manuálisan, majd több iterációban különböző promptstratégiákkal LLM-ek segítségével értékeltem, és az eredményeket egymással, illetve a manuális pontozással hasonlítottam össze. A vizsgálat alapján az LLM-ek a viszonylag egyszerűbb formázási követelményeket többnyire megbízhatóan észlelik, ám a komplexebb, funkcionális elemek (pl. tartalomjegyzék, ábrajegyzék, irodalomjegyzék) esetén gyakoriak a hamis pozitív és hamis negatív döntések. A modellek közül a ChatGPT és a Claude eredményei közelítettek leginkább a manuális értékeléshez; a Gemini, a Perplexity és a DeepSeek sokszor túlzottan optimistán pontozott, míg a Manus teljesítménye maradt el a leginkább. Következtetésem szerint az LLM-ek önálló, zárt láncú értékelésre még nem alkalmasak, de jól körülhatárolt részfeladatokra, a tanári döntést támogató eszközként már most hasznosíthatók. Eredményeim megerősítik, hogy a promptolás strukturálása („lépésenkénti” gondolatvezetés) javíthatja a konzisztenciát, ugyanakkor a nyelvi megfogalmazásra – az instrukciók nyelvére és precizitására – érzékeny a teljesítmény. A továbblépéshez többlépéses feldolgozási csővezetékek, integrációs megoldások és további modellvariánsok vizsgálatát tartom ígéretesnek. ----- Automatic evaluation of assessments using large language models ----- The rapid development of artificial intelligence – including large language models (LLMs) – is significantly changing the field of educational assessment: in addition to the promise of automating sub-processes, it also raises new risks and methodological issues. In my research, I examined the automatic assessment of instructive, step-by-step Microsoft Word word processing tasks using LLMs available as a cloud service. I first assessed my students’ solutions submitted as ZH manually, then in several iterations using different prompting strategies using LLMs, and compared the results with each other and with manual scoring. Based on the study, LLMs mostly reliably detect relatively simple formatting requirements, but false positive and false negative decisions are common in the case of more complex, functional elements (e.g. table of contents, list of figures, bibliography). Of the models, the results of ChatGPT and Claude came closest to manual assessment; Gemini, Perplexity and DeepSeek often scored too optimistically, while Manus' performance was the most lacking. I conclude that LLMs are not yet suitable for independent, closed-loop assessment, but they can already be used for well-defined subtasks, as a tool to support teacher decisions. My results confirm that structuring prompting (“step-by- step” thought guidance) can improve consistency, but performance is sensitive to linguistic formulation – the language and precision of the instructions. I consider the examination of multi-step processing pipelines, integration solutions and further model variants to be promising for further progress.
| Mű típusa: | Könyvrészlet - Book section |
|---|---|
| Szerző: | Szerző neve Email MTMT azonosító ORCID azonosító Közreműködés Ujhelyi, Gábor NEM RÉSZLETEZETT NEM RÉSZLETEZETT NEM RÉSZLETEZETT Szerző |
| Megjegyzés: | A Kulturális és Innovációs Minisztérium EKÖP-24 kódszámú Egyetemi Kutatói Ösztöndíj Programjának a Nemzeti Kutatási, Fejlesztési és Innovációs Alapból finanszírozott szakmai támogatásával készült. |
| Kapcsolódó URL-ek: | |
| Kulcsszavak: | nagy nyelvi modell, automatikus értékelés, szövegszerkesztés, oktatástechnológia, felsőoktatás ----- large language model, automatic assessment, text editing, educational technology, higher education |
| Nyelv: | magyar |
| DOI azonosító: | 10.17048/AM.2025.209 |
| Felhasználó: | Tibor Gál |
| Dátum: | 02 Szep 2026 13:33 |
| Utolsó módosítás: | 14 Szep 2026 09:00 |
| URI: | http://publikacio.uni-eszterhazy.hu/id/eprint/9404 |
![]() |
Tétel nézet |
