InternLM 发布 AdvancedMathBench 高等数学证明生成与验证基准套件
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
Sakana AI 与东京大学提出 SAIL,用测试时扩展提升 VLM 生成机器人轨迹的可靠性,并将在 IROS2026 展示。SAIL 让 policy VLM 生成轨迹、在模拟器测试,再由 evaluation VLM 反馈并结合 MCTS 修正;在 6 个模拟操作任务中,搜索预算从 1 个候选增至 45 个后,成功轨迹发现率从 25% 升至 73%。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
Google 在 Hugging Face 发布 GNM v3.0 官方权重,这是用于人类头部的参数化 3D 统计模型,支持对面部身份、表情、头部姿态和眼球、牙齿、舌头等内部解剖结构进行解耦控制。
Google Research 发布 TimesFM 3.0 的官方 PyTorch 权重和配置,这是一个用于时序预测的预训练时序基础模型。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
BeTTER 公开官方代码,用于诊断 Vision-Language-Action 模型中的具身推理幻觉。该 ECCV 2026 项目提供基于 Isaac Sim 的 benchmark 和任务编辑工具栈,包含 Task Editor、Assets Editor、Variation Editor、检索服务器、遥操作与渲染工具。