跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分38

CheckerBench:长程智能体能否合成静态分析检查器?

CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?

AI 导读

CheckerBench 是一个评估长程 coding agents 合成静态分析检查器的可执行 benchmark,包含来自 297 个 CVE、167 个代码库、85 个 CWE 和 5 种语言生态的 300 个任务。

来源:Hugging Face Daily Papers · arxiv.org