Skip to yearly menu bar Skip to main content


Workshop

Can We Trust the Judge? Building Reliable Evaluation for Language Models

Jayash Koshal ⋅ Meghana Makhija ⋅ Amjad A Jbara ⋅ Hui Wan ⋅ Shanu Sushmita

Abstract

Chat is not available.