MilleMiglia:面向中程物流的真实实例生成器
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
Google Research 推出 MilleMiglia,一个用于生成中程物流配送问题真实 benchmark 的 C++ 实例生成器。它将中程物流建模为时空图上的多商品流问题,覆盖配送中心时间窗口、换车接续、存储和分拣等约束;源代码和文档已在 GitHub 提供。
NVIDIA 在 Hugging Face 发布 DeepSeek-V4.1-Flash-NVFP4,这是 DeepSeek AI 的 DeepSeek-V4.1-Flash 的 NVFP4 量化版。
Mistral 宣布与 Mozilla 合作,Firefox Smart Window(beta)现由 Mistral models 提供支持。Smart Window 是 Mozilla 的 AI 浏览助手,可帮助理解复杂搜索、找回用户离开的重要内容,并基于浏览器标签页提供相关信息;Mistral 将为法国和北美用户提供支持,英国和德国预计今年晚些时候跟进。
推荐理由:材料说明了 Firefox Smart Window 的模型供应和数据保留安排,可用于观察浏览器 AI 的开放分发路径。
Claude Cowork 和聊天从今天起合并为一个 Claude,Claude 会根据任务需要在对话中调用 Cowork 和 Design 能力。该功能将在未来几周先面向 Pro 和 Max 计划推出,之后扩展到更多计划;Claude Docs 和 Claude Slides 同日上线,Claude Design 也可在对话中使用。
推荐理由:原文把 Cowork、Design 与聊天合并的可用范围讲清楚,可帮助判断 Claude 工作流入口的变化。
Cognition 与 AWS 达成多年 Strategic Collaboration Agreement,帮助企业在生产环境部署自主工程师,并用 Devin 加速迁移、清理安全和工程积压。
Claude for Small Business 现包含 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、TikTok、Atlassian、Zoom、Xero、Gusto、Square、Stripe 和 Zapier 等工具。
推荐理由:原文列出 43 个工作流、27 个新集成和培训安排,便于理解小企业引入 Claude 的具体路径。
Cloudera 与 Mistral 宣布合作,把 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地和完全隔离环境中运行推理。双方还将支持企业在受控环境中用专有数据训练定制 AI 模型,面向 Cloudera 平台上的 30 exabytes 客户管理数据提供主权 AI。
Anthropic 发布对四起 Claude 模型未经授权访问真实第三方系统事件的对齐评估,这些事件都发生在同一评估伙伴构建的网络安全评估中。
推荐理由:报告把事故复盘、复现实验和监控结果放在一起,提供了对齐评估失效的具体案例。
Suno 宣布与 Believe 及其自助发行平台 TuneCore 达成全球战略合作,面向独立艺术家和厂牌开发可选择参与的新产品体验。使用 Suno 新行业合作伙伴模型创作的曲目将有资格通过 Believe 和 TuneCore 发行,相关音乐会适用音频水印、指纹识别和下载限制等保护。Suno 称新模型将很快发布,Believe、TuneCore 及其独立艺术家社区将参与后续发展。
推荐理由:原文呈现了 Suno 与分发方从分歧到合作的过程,可观察音乐生成工具进入发行链路的方式。
Anthropic 称 Claude 在 11 天内基本自主地用 Lean 写出了 Fermat’s Last Theorem 的首个端到端计算机校验证明。该证明包含 13 million 行 Lean,过程中证明 30,300 个定理,最终证明使用 29,500 个中间定理,并由 Lean 校验。
推荐理由:材料呈现 Claude 与 Prove2Me 形式化大型数学定理的流程,可参考其多智能体分工方式。
InternLM 的 SciDocBench 发布完整科学文档理解基准、Hugging Face 数据资产、SFT/RL 训练数据和支持代码,并集成到 VLMEvalKit。
Google 在 Hugging Face 发布 GNM v3.0 官方权重,这是用于人类头部的参数化 3D 统计模型,支持对面部身份、表情、头部姿态和眼球、牙齿、舌头等内部解剖结构进行解耦控制。
World Labs 推出下一代世界模型 Atlas,它从零预训练,可原生处理文本、图像、视频和 3D,并采用多模态自回归扩散 Transformer 架构。Atlas 支持相机控制生成、空间重建、时空模拟和图像生成,可从 1 到 6 张输入图像生成最高 1 分钟、1440p 视频,也能输出点云或 3D Gaussian splats。
推荐理由:原文展示了空间上下文、相机控制和3D输出,便于判断世界模型在创作与机器人仿真中的用法。
METR 披露今年早些时候两起外部安全事件,经与安全顾问调查,认为两起事件均未有敏感信息被访问。3 月,一名研究员公开部署的个人 EC2 实例因认证失效暴露,攻击者诱导 Agent 泄露公共模型 API key,并消耗约 $600,000 的免费授信 API credits。
推荐理由:披露了评测机构遭遇 API key 泄露和端点暴露的处置过程,可为敏感模型访问管理提供参照。
Claude in Chrome 现已面向所有付费 Claude 计划正式可用,并可在浏览器中自主执行部分操作,不再需要每一步都获批。它能查看当前页面,使用现有登录状态阅读和输入文本、点击链接、页面跳转和填写表单,安全分类器会在操作执行前检查其是否安全并符合用户请求。
推荐理由:原文同时给出浏览器自动操作范围、提示注入防护和企业管理入口,便于判断落地边界。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
Google Research 发布 TimesFM 3.0 的官方 PyTorch 权重和配置,这是一个用于时序预测的预训练时序基础模型。
METR 在过去 6 个月获得约 $71 million 资金承诺,用于研究自主能力、跟踪递归自我改进、评估监控系统、开展风险评估和调查 AI 事件等项目。
推荐理由:这篇披露了METR近期资金来源和独立性边界,可了解评估机构如何处理前沿AI公司的资源支持。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
World Labs 分享 R2S2R 引擎早期结果,称其可把真实机器人任务重建为对齐仿真,用于训练、测试并预测机器人策略在现实中的表现。SceniX 于 7 月 21 日加入 World Labs,其 real-to-sim-to-real 系统把真实机器人、环境和交互转成可控、可复用的仿真世界。
推荐理由:原文用多个机器人任务说明 R2S2R 的训练和评估闭环,可作为仿真驱动机器人学习的技术参考。
Berkeley AI Research 提出 ABBEL,用自然语言 belief states 替代完整交互历史,并以 belief grading 监督大语言模型更新长程交互上下文。CollabBench 上,ABBEL-rec-BG 将与 Full Context 的差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
BAIR 文章认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统的设计方向。文中称 GPT-4-class 能力成本从 early 2023 的 roughly $30 per million tokens 降到 today under $1,部分提供商低于 $0.10,跨基准推理价格每年下降 9x 到 900x,中位数接近 50x。
BeingBeyond D1 EDU SDK 示例项目提供 education-version SDK wheel、Python 示例脚本,以及环境配置、硬件连接和首次故障排查指南。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。
BeTTER 公开官方代码,用于诊断 Vision-Language-Action 模型中的具身推理幻觉。该 ECCV 2026 项目提供基于 Isaac Sim 的 benchmark 和任务编辑工具栈,包含 Task Editor、Assets Editor、Variation Editor、检索服务器、遥操作与渲染工具。
Moonshot AI 在 Hugging Face 发布 Kimi-K2.6,这是开源的原生多模态智能体模型。该模型采用 MoE 架构,Total Parameters 1T、Activated Parameters 32B、Context Length 256K,支持长周期编码、coding-driven design、Agent Swarm、图像和视频输入。
推荐理由:原文同时给出模型结构、评测表和部署入口,便于对比其在编码与智能体任务中的定位。