跳到正文
原文
Hugging Face Daily Papers·· 3 天前AI 评分59

论文提出 LibraryDesignBench,评估 AI 智能体为其他智能体设计库的能力

Can Agents Design Libraries for Agents?

AI 导读

论文提出 LibraryDesignBench,用于评估 AI 智能体能否为其他智能体设计可复用的代码库。该基准包含 242 个专家验证的编程问题,覆盖 15 个库设计任务和四种语言,并用来自不同模型家族的三个用户智能体评估库的正确性和程序简洁性。

来源:Hugging Face Daily Papers · arxiv.org