MUD evaluation frameworks reveal LLM-judge blind spots that aggregate metrics miss
Researchers identify how LLM-based evaluation can systematize AI model assessment while exposing vulnerabilities in Cohen's kappa and similar aggregate metrics.
Researchers identify how LLM-based evaluation can systematize AI model assessment while exposing vulnerabilities in Cohen's kappa and similar aggregate metrics.
Founders and investors are systematically inflating ARR figures by substituting contracted revenue, creating a credibility crisis in AI startup valuations.