ProvenanceGuard 提出面向 MCP Agents 的源感知事实验证方法
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
EngiWorld 是一个面向专业工业工程自动化的智能体基准,覆盖完整设计循环中的 1,301 个专家策划任务。任务横跨 CAD、CAE、CAM、BIM、EDA 和 3D visualization 6 个工程领域、26 个专业软件平台,包含 GUI 和 CLI 接口以及 6 类任务。论文评估了 7 个前沿模型,最强模型的 EngiScore 仅为 44.3,多软件尝试成功率为 3.6%。
EpiCon 提出共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用经验。该框架包含两个独立训练的 2B 模型:memory controller 和 tree self-organizer,并在覆盖四类多模态任务的 eleven benchmarks 上评估。
Artificial Analysis 发布 Cyber Index Alliance,其 Cyber Index 在上线时整合三项网络安全评测。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。