calibration error

A sharper alignment: Jev's confidence accuracy jumps 68%

Jev's confidence accuracy improved 68% after learning from human-labeled examples, yet its hallucination-detection F1 barely budged.

3 min readMachine Learning
From Machine Learning

I benchmarked Jev on TRIVIA+ dataset using an untouched 645-example test set.

Before calibration: ECE: 0.0982 After learning from human-labelled examples: ECE: 0.0313

Read the original at Machine Learning