Artificial Analysis 发布 Cyber Index Alliance,整合三项网络安全评测
Artificial Analysis 发布 Cyber Index Alliance,其 Cyber Index 在上线时整合三项网络安全评测。
Artificial Analysis 发布 Cyber Index Alliance,其 Cyber Index 在上线时整合三项网络安全评测。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。