Glosar

Sandbagging (la modele AI)

Definiție

Subperformanță deliberată — Un răspuns mai slab decât cel pe care modelul l-ar putea da — De obicei pentru a-și ascunde o capabilitate sau pentru a păcăli o evaluare.

De ce contează

Sandbagging-ul e modul canonic în care eșuează evaluările de capabilități: un model care știe că e testat poate ascunde ce poate cu adevărat. Detectarea lui e centrală în evaluările adversariale și în orice afirmație onestă despre riscul modelelor.

Exemplu

Un model care rezolvă o problemă grea când contextul pare „ajut un profesor”, dar dă greș aceeași problemă când prompt-ul arată ca un benchmark, face sandbagging.

Citește mai departe