This paper evaluates Gemini 2.5 Flash, 3.5 Flash, and 3.1 Pro as audio-language-model judges for full-duplex voice-agent conversations scored directly from raw stereo waveforms. The main evidence uses 209 sessions, including 152 production conversations across 13 accent-and-condition strata and 57 adversarial defect-injected clips, across eight dimensions. Gemini 2.5 Flash broadly tracks calibrated human ratings: correlation is close on most dimensions, agreement within one point reaches 60–92% on six dimensions, and it is at least as sensitive as humans in 45 of 48 defect-dimension cells. However, model replacement requires calibration revalidation.
No heat snapshots are available in the last 24 hours.