7. Može li ChatGPT ocjenjivati studentske ispite?

Kontekst

U sve većem opterećenju visokoškolskih nastavnika administrativnim i evaluacijskim zadacima raste interes za automatizaciju vrednovanja. U toj situaciji švedski istraživač Jonas Flodén (2025) postavlja praktično pitanje: može li umjetna inteligencija – konkretno ChatGPT – pouzdano ocjenjivati studentske ispite u visokom obrazovanju?

Na jednom kolegiju u Švedskoj Flodén je analizirao 463 odgovora studenata na otvorena ispitna pitanja, koji su zatim ocijenili ljudski ocjenjivači i ChatGPT-om (verzija 3.5). Svaki odgovor ocijenjen je više puta, a ukupno je prikupljeno 1389 ocjena. Cilj je bio usporediti točnost, konzistentnost i tendencije ocjenjivanja između ljudi i umjetne inteligencije.

Ključni nalazi

  • ChatGPT je u 70 % slučajeva dao ocjenu unutar ±10 % od očekivane ljudske ocjene, a u 31 % slučajeva bio je unutar ±5 %.
  • UI je izbjegavao krajnje ocjene (vrlo visoke ili vrlo niske) i blago favorizirao ocjene malo više od prosjeka.
  • UI je bolje ocjenjivao općenita pitanja, dok je imao više poteškoća s pitanjima povezanima s detaljima s predavanja.
  • Nastavnici su se iznenadili podudarnošću ocjena, no istaknuli su zabrinutost oko netransparentnosti kriterija kojima se UI koristi.

Pitanja za promišljanje:

  • U kojim slučajevima bi korištenje UI-a za ocjenjivanje bilo prihvatljivo na vašem kolegiju?
  • Možete li zamisliti upotrebu UI-a za prvu procjenu studentskih eseja, uz kasniju ljudsku provjeru?
  • Kako biste studentima objasnili kriterije ako ocjenu djelomično daje UI?
Accessibility

Boja pozadine Boja pozadine

Font Font

Veličina fonta Veličina fonta

1

Boja teksta Boja teksta

Font Kerning Font Kerning

Image Visibility Image Visibility

Letter Spacing Letter Spacing

0

Line Height Line Height

1.2

Link Highlight Link Highlight