Automatizirano vrednovanje u visokom obrazovanju
7. Može li ChatGPT ocjenjivati studentske ispite?
Kontekst
U sve većem opterećenju visokoškolskih nastavnika administrativnim i evaluacijskim zadacima raste interes za automatizaciju vrednovanja. U toj situaciji švedski istraživač Jonas Flodén (2025) postavlja praktično pitanje: može li umjetna inteligencija – konkretno ChatGPT – pouzdano ocjenjivati studentske ispite u visokom obrazovanju?
Na jednom kolegiju u Švedskoj Flodén je analizirao 463 odgovora studenata na otvorena ispitna pitanja, koji su zatim ocijenili ljudski ocjenjivači i ChatGPT-om (verzija 3.5). Svaki odgovor ocijenjen je više puta, a ukupno je prikupljeno 1389 ocjena. Cilj je bio usporediti točnost, konzistentnost i tendencije ocjenjivanja između ljudi i umjetne inteligencije.
Ključni nalazi
- ChatGPT je u 70 % slučajeva dao ocjenu unutar ±10 % od očekivane ljudske ocjene, a u 31 % slučajeva bio je unutar ±5 %.
- UI je izbjegavao krajnje ocjene (vrlo visoke ili vrlo niske) i blago favorizirao ocjene malo više od prosjeka.
- UI je bolje ocjenjivao općenita pitanja, dok je imao više poteškoća s pitanjima povezanima s detaljima s predavanja.
- Nastavnici su se iznenadili podudarnošću ocjena, no istaknuli su zabrinutost oko netransparentnosti kriterija kojima se UI koristi.
Pitanja za promišljanje:
- U kojim slučajevima bi korištenje UI-a za ocjenjivanje bilo prihvatljivo na vašem kolegiju?
- Možete li zamisliti upotrebu UI-a za prvu procjenu studentskih eseja, uz kasniju ljudsku provjeru?
- Kako biste studentima objasnili kriterije ako ocjenu djelomično daje UI?
Boja pozadine
Font
Veličina fonta
Boja teksta
Font Kerning
Image Visibility
Letter Spacing
Line Height
Link Highlight
Paragraph Width
Text Alignment