Hugging Face Daily Papers·· 2 天前AI 评分38
CheckerBench:长程智能体能否合成静态分析检查器?
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
AI 导读
CheckerBench 是一个评估长程 coding agents 合成静态分析检查器的可执行 benchmark,包含来自 297 个 CVE、167 个代码库、85 个 CWE 和 5 种语言生态的 300 个任务。
来源:Hugging Face Daily Papers · arxiv.org