Számonkérések automatikus értékelési lehetősége nagy nyelvi modellek felhasználásával

Ujhelyi, Gábor (2026) Számonkérések automatikus értékelési lehetősége nagy nyelvi modellek felhasználásával In: Agria Média 2025 : „Oktatás 5.0: Az ember és a technológia harmóniája”. Eger, Eszterházy Károly Katolikus Egyetem (Digitális Technológia Intézet). pp. 209-214.

[thumbnail of 209Ujhelyi.pdf] pdf
209Ujhelyi.pdf

Download (1MB) [error in script]
Hivatalos webcím (URL): https://doi.org/10.17048/AM.2025.209

Absztrakt (kivonat)

A mesterséges intelligencia – köztük a nagy nyelvi modellek (LLM-ek) – gyors fejlődése érdemben alakítja az oktatási értékelés területét: a részfolyamatok automatizálásának ígérete mellett új kockázatokat és módszertani kérdéseket is felvet. Kutatásomban az instruktív, lépésről lépésre megfogalmazott Microsoft Wordszövegszerkesztési feladatok automatikus értékelhetőségét vizsgáltam felhőszolgáltatásként elérhető LLM-ekkel. Hallgatóim ZH-ként beadott megoldásait először manuálisan, majd több iterációban különböző promptstratégiákkal LLM-ek segítségével értékeltem, és az eredményeket egymással, illetve a manuális pontozással hasonlítottam össze. A vizsgálat alapján az LLM-ek a viszonylag egyszerűbb formázási követelményeket többnyire megbízhatóan észlelik, ám a komplexebb, funkcionális elemek (pl. tartalomjegyzék, ábrajegyzék, irodalomjegyzék) esetén gyakoriak a hamis pozitív és hamis negatív döntések. A modellek közül a ChatGPT és a Claude eredményei közelítettek leginkább a manuális értékeléshez; a Gemini, a Perplexity és a DeepSeek sokszor túlzottan optimistán pontozott, míg a Manus teljesítménye maradt el a leginkább. Következtetésem szerint az LLM-ek önálló, zárt láncú értékelésre még nem alkalmasak, de jól körülhatárolt részfeladatokra, a tanári döntést támogató eszközként már most hasznosíthatók. Eredményeim megerősítik, hogy a promptolás strukturálása („lépésenkénti” gondolatvezetés) javíthatja a konzisztenciát, ugyanakkor a nyelvi megfogalmazásra – az instrukciók nyelvére és precizitására – érzékeny a teljesítmény. A továbblépéshez többlépéses feldolgozási csővezetékek, integrációs megoldások és további modellvariánsok vizsgálatát tartom ígéretesnek. ----- Automatic evaluation of assessments using large language models ----- The rapid development of artificial intelligence – including large language models (LLMs) – is significantly changing the field of educational assessment: in addition to the promise of automating sub-processes, it also raises new risks and methodological issues. In my research, I examined the automatic assessment of instructive, step-by-step Microsoft Word word processing tasks using LLMs available as a cloud service. I first assessed my students’ solutions submitted as ZH manually, then in several iterations using different prompting strategies using LLMs, and compared the results with each other and with manual scoring. Based on the study, LLMs mostly reliably detect relatively simple formatting requirements, but false positive and false negative decisions are common in the case of more complex, functional elements (e.g. table of contents, list of figures, bibliography). Of the models, the results of ChatGPT and Claude came closest to manual assessment; Gemini, Perplexity and DeepSeek often scored too optimistically, while Manus' performance was the most lacking. I conclude that LLMs are not yet suitable for independent, closed-loop assessment, but they can already be used for well-defined subtasks, as a tool to support teacher decisions. My results confirm that structuring prompting (“step-by- step” thought guidance) can improve consistency, but performance is sensitive to linguistic formulation – the language and precision of the instructions. I consider the examination of multi-step processing pipelines, integration solutions and further model variants to be promising for further progress.

Mű típusa: Könyvrészlet - Book section
Szerző:
Szerző neve
Email
MTMT azonosító
ORCID azonosító
Közreműködés
Ujhelyi, Gábor
NEM RÉSZLETEZETT
NEM RÉSZLETEZETT
NEM RÉSZLETEZETT
Szerző
Megjegyzés: A Kulturális és Innovációs Minisztérium EKÖP-24 kódszámú Egyetemi Kutatói Ösztöndíj Programjának a Nemzeti Kutatási, Fejlesztési és Innovációs Alapból finanszírozott szakmai támogatásával készült.
Kapcsolódó URL-ek:
Kulcsszavak: nagy nyelvi modell, automatikus értékelés, szövegszerkesztés, oktatástechnológia, felsőoktatás ----- large language model, automatic assessment, text editing, educational technology, higher education
Nyelv: magyar
DOI azonosító: 10.17048/AM.2025.209
Felhasználó: Tibor Gál
Dátum: 02 Szep 2026 13:33
Utolsó módosítás: 14 Szep 2026 09:00
URI: http://publikacio.uni-eszterhazy.hu/id/eprint/9404
Műveletek (bejelentkezés szükséges)
Tétel nézet Tétel nézet