跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分39

TestPrism:重新思考超越单一参考答案的测试评估

TestPrism: Rethinking Test Evaluation Beyond a Single Reference

AI 导读

TestPrism 提出用 300 个测试任务和 3000 个候选实现评估 LLM coding agents 的测试生成质量,避免单一参考答案高估结果。14 种基线配置的 Joint Success Function 仅为 28.00%,而单一参考成功率达 59.67%。

来源:Hugging Face Daily Papers · arxiv.org