InternLM 发布 AdvancedMathBench 高等数学证明生成与验证基准套件
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
InternLM 发布 AdvancedMathBench,用于评估语言模型能否构造并验证高等数学的自然语言证明。该套件包含 ProverBench 的 245 道专家审阅证明生成题、VerifierBench 的 888 条带全链路专家标注的证明轨迹,以及用于自动评估 ProverBench 的 AutoVerifier。
ProvenanceGuard 是一篇面向 MCP-based LLM agents 的源感知事实验证论文,关注事实存在但被归因到错误来源的 cross-source conflation 问题。
EngiWorld 是一个面向专业工业工程自动化的智能体基准,覆盖完整设计循环中的 1,301 个专家策划任务。任务横跨 CAD、CAE、CAM、BIM、EDA 和 3D visualization 6 个工程领域、26 个专业软件平台,包含 GUI 和 CLI 接口以及 6 类任务。论文评估了 7 个前沿模型,最强模型的 EngiScore 仅为 44.3,多软件尝试成功率为 3.6%。
EpiCon 提出共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用经验。该框架包含两个独立训练的 2B 模型:memory controller 和 tree self-organizer,并在覆盖四类多模态任务的 eleven benchmarks 上评估。
PanoVLN提出面向全景观测的视觉语言导航方法,针对直接用全景图替换透视图收益有限的问题,改造动作预测、训练监督和视觉表示。其CGE策略动态决定重规划前执行多少预测动作,并结合RGB全景的语义与几何特征,不增加visual tokens。在4B backbone和RGB-only输入下,PanoVLN在R2R-CE和RxR-CE Val-Unseen成功率较此前SOTA高11.9%和8.7%。
Braco 提出面向视觉语言模型的 token 参数化压缩,在 23×--64× 压缩下形成较优准确率-效率前沿,144× 时仍具竞争力。其达到 95.2% 准确率,相比未压缩上界减少 84.2%--86.7% prefill FLOPs,并实现最高约 36% 端到端加速。
MarginFlow 将固定行列和二元矩阵的 SIS proposal 设计转为 GFlowNet 学习问题,并跨 margins 摊销实现零样本泛化。它在 1904 个 margins 上训练,在 1190 个保留 margins 上评估,规模覆盖 $3\times3$ 到 $870\times6$。
ROSS 保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失,用于从自生成 rollouts 中再学习。其在 Qwen3.6-35B-A3B 上将六项 MOPD 平均分从 58.40% 提至 62.20%,SWE-bench Verified 从 64.20% 提至 68.40%,且无需额外 policy rollouts。
Sakana AI 与东京大学提出 SAIL,用测试时扩展提升 VLM 生成机器人轨迹的可靠性,并将在 IROS2026 展示。SAIL 让 policy VLM 生成轨迹、在模拟器测试,再由 evaluation VLM 反馈并结合 MCTS 修正;在 6 个模拟操作任务中,搜索预算从 1 个候选增至 45 个后,成功轨迹发现率从 25% 升至 73%。
Raven 是一个开源多智能体生态系统,用于自动构建并演化面向特定模型和领域的模块化 harness。其 Host Agent 会分解目标、匹配子任务到专门智能体、协调执行依赖并整合结果,host archive、EverOS 和 Skill Forge 用于保留经验并转化为可复用过程。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
BeTTER 公开官方代码,用于诊断 Vision-Language-Action 模型中的具身推理幻觉。该 ECCV 2026 项目提供基于 Isaac Sim 的 benchmark 和任务编辑工具栈,包含 Task Editor、Assets Editor、Variation Editor、检索服务器、遥操作与渲染工具。