Amazon Bedrock 将 Claude 模型可用性扩展至印度境内推理
Amazon Bedrock 在印度提供 Anthropic Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,可通过印度地理跨 Region 推理访问。该配置仅在 ap-south-1 与 ap-south-2 间路由请求,支持 Anthropic Messages API、InvokeModel API 和 Converse API。
Amazon Bedrock 在印度提供 Anthropic Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,可通过印度地理跨 Region 推理访问。该配置仅在 ap-south-1 与 ap-south-2 间路由请求,支持 Anthropic Messages API、InvokeModel API 和 Converse API。
Amazon Bedrock 现支持 Anthropic Claude Opus 5、Claude Sonnet 5 在首尔,以及 Claude Sonnet 5 在新加坡通过 bedrock-runtime 进行区域内推理。
NVIDIA TensorRT Model Connect 是基于 NVIDIA TensorRT 的开源 C++ AI 模型参考实现集合,围绕 coding agents 设计。项目经验强调并行工作、模型族隔离、可逆变更和 GPU 支持的验证,目标是让 NVIDIA 推理栈性能更易被使用。
NVIDIA VSS Blueprint 3.3 面向视觉 AI 智能体,旨在降低构建和运行可维护视频理解系统的成本。NVIDIA Metropolis Blueprint for Video Search and Summarization (VSS) 及其 agent skills 支持摄取、流处理、事件检测、检索、摘要和报告等环节。
Microsoft 在欧洲 Microsoft Fabric + SQL Community Conference 上推出 Microsoft Fabric 和 Azure Databases 多项更新,把企业数据、业务上下文和治理能力接入 AI 工作流。
推荐理由:原文集中列出 Fabric 与 Azure Databases 的更新,可帮助判断微软如何把企业数据治理接入 Copilot 与智能体工作流。
Google AI Dev 介绍了生产环境中加固 AI 智能体沙盒的 7 种方法,强调标准 Docker 容器无法充分防止内核逃逸、凭证泄露和间接 Prompt injection。
推荐理由:文章把隔离、密钥、网络和审计拆成可执行控制点,适合在编码 Agent 迁移生产环境前对照检查。
NVIDIA Open Agent Safety Platform 被定位为持续芯片内监控 AI 智能体的参考方案,面向智能体 AI 的安全风险。文章将当前智能体 AI 类比 90 年代互联网:机会巨大,但也伴随大量风险。
World Labs 已签署最终协议加入 AMD,交易预计在 2026 年底前完成,需获监管批准并满足惯常交割条件。双方此前从 AMD GPU 上的模型训练和推理优化开始技术合作,计划建设覆盖硬件、软件、平台和广泛可访问开放模型的端到端开放 AI 生态。
推荐理由:交易把 World Labs 的空间智能研究与 AMD 硬件体系连接起来,后续重点落在开放 AI 生态。
Intern-Decision 将状态、可选图像和多类问题转换为带概率的决策,并微调 Qwen3.5 语言骨干。Intern-Decision-4B 在七个测试套件平均准确率达 90.02%,RTX 4090 本地平均延迟为 44.16 ms。
NVIDIA 加入 Google DeepMind、EMBL-EBI 等全球研究机构联盟,在 AlphaFold Database 开放发布 2,800 多种病毒的蛋白复合体预测 3D 结构。
推荐理由:原文展示了开放数据集与生成流程,能帮助理解 AI 蛋白结构预测在疫情准备中的应用。
Microsoft Research 研究显示,现实物理 AI 机器人只依赖板载 GPU 推理会限制性能、电池寿命和扩展性,将推理卸载到边缘或云端 GPU 可带来优势。
推荐理由:原文用机器人任务对比板载、边缘和云端推理,为物理 AI 推理基础设施设计提供参考。
Google DeepMind 介绍了 Private AI Compute 的新架构,将在服务端提供私有、持久、跨设备的 AI 记忆,同时维持接近端侧处理的隐私标准。
NVIDIA 在 Hugging Face 发布 DeepSeek-V4.1-Flash-NVFP4,这是 DeepSeek AI 的 DeepSeek-V4.1-Flash 的 NVFP4 量化版。
Cognition 与 AWS 达成多年 Strategic Collaboration Agreement,帮助企业在生产环境部署自主工程师,并用 Devin 加速迁移、清理安全和工程积压。
InternLM 发布 Intern-S2-397B,称其是面向科学智能和长周期 Agent 的多模态基础模型。该模型结合新的视觉语言预训练范式、大规模多任务强化学习和长周期 Agent 强化学习,覆盖 20 多个科学领域,并在文本推理评测中使用最高 256K tokens、在多模态评测中使用最高 64K tokens。
推荐理由:材料同时给出训练方向、评测设置和部署入口,便于比较科学智能模型的工程落地路径。
Cloudera 与 Mistral 宣布合作,把 Mistral 模型集成进 Cloudera 混合数据平台,支持企业在私有云、公有云、本地和完全隔离环境中运行推理。双方还将支持企业在受控环境中用专有数据训练定制 AI 模型,面向 Cloudera 平台上的 30 exabytes 客户管理数据提供主权 AI。
zai-org 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数。官方称它在基准和真实工作负载中超过 GLM-5.2,价格为其十分之一,并在编码和智能体基准上接近 Claude Opus 4.8。
推荐理由:原文同时给出参数规模、架构变化和本地部署框架,便于比较其成本与落地路径。
美团 LongCat 在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,这是基于 LongCat-Flash-Lite 的非思考 MoE 模型,拥有 69B 总参数、每 token 约 3B 激活参数,并原生支持最高 1M tokens 上下文。
推荐理由:原文同时给出架构改动、长上下文设定和多项基准,便于比较稀疏版与密集前代的取舍。
BAIR 介绍了将 K-Search 扩展到 MLX 的研究,用结构化 CUDA-to-MLX 翻译层把既有 CUDA 内核优化经验迁移到 Apple Silicon。
MiniMaxAI 在 Hugging Face 发布 MiniMax-H3,这是一个通用全模态生成系统,支持文本、图像、视频和音频组成的多模态上下文理解,并可生成带原生立体声音频的视频。
推荐理由:原文披露了模块拆分、输入规格和本地部署路径,可帮助开发者评估接入成本与适用场景。
World Labs 分享 R2S2R 引擎早期结果,称其可把真实机器人任务重建为对齐仿真,用于训练、测试并预测机器人策略在现实中的表现。SceniX 于 7 月 21 日加入 World Labs,其 real-to-sim-to-real 系统把真实机器人、环境和交互转成可控、可复用的仿真世界。
推荐理由:原文用多个机器人任务说明 R2S2R 的训练和评估闭环,可作为仿真驱动机器人学习的技术参考。
BAIR 文章认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统的设计方向。文中称 GPT-4-class 能力成本从 early 2023 的 roughly $30 per million tokens 降到 today under $1,部分提供商低于 $0.10,跨基准推理价格每年下降 9x 到 900x,中位数接近 50x。
BeingBeyond D1 EDU SDK 示例项目提供 education-version SDK wheel、Python 示例脚本,以及环境配置、硬件连接和首次故障排查指南。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE,用于为 Mistral Medium 3.5 执行推测解码。
推荐理由:原文同时给出模型规格、替代关系和 vLLM/SGLang 部署方式,便于评估统一模型的接入成本。