更多选择,更少决策:类 JEV 直接决策模型中的序数尺度偏差
研究分析 JEV 1.13 和 3 个开源 KEV 模型,发现直接决策模型存在序数尺度利用偏差,会压缩候选决策空间。在 ANLI 上,JEV 虽有 74.95% 准确率,却将 38.8% 预测和 51.3% 错误归为 Neutral;36 个序数数据集上最终决策仅使用 67--76% 有效 gold support。BA-LoRA 后训练在 8 个监督尺度上将利用率从约 47% 提至 86%。
研究分析 JEV 1.13 和 3 个开源 KEV 模型,发现直接决策模型存在序数尺度利用偏差,会压缩候选决策空间。在 ANLI 上,JEV 虽有 74.95% 准确率,却将 38.8% 预测和 51.3% 错误归为 Neutral;36 个序数数据集上最终决策仅使用 67--76% 有效 gold support。BA-LoRA 后训练在 8 个监督尺度上将利用率从约 47% 提至 86%。
一项实证研究评估 TypeSafe AI 所称“System One Model”的 Jev 用于个性化推荐重排序,并与推荐专用模型及 pointwise、listwise Qwen rerankers 比较。实验覆盖多个 Amazon Reviews 领域和候选集大小,结果显示 Jev 推荐效果较强,延迟增长比 pointwise Qwen rerankers 更平缓,但仍显著高于推荐专用模型。
WorldAuditBench 是一个 3D 世界审计基准,包含 Unreal Engine 5 构建的 13 个环境、213 个异常任务和五类异常。论文评估 5 个前沿模型的两种审计范式,成功率为 6.6% 至 42.3%,显著低于人类表现 83.4%。
A2Z GameSpec-Bench 提供 100 份长篇 GDD,用于评估编码智能体端到端生成游戏时对设计规范的忠实度。它将每份 GDD 转为包含规则、约束和前置关系的依赖感知契约,并结合源码检查、场景回放和自适应游玩测试。评估显示,当前智能体难以同时满足代码实现和实际游玩中的相互依赖需求,基于需求的反馈两轮后使 GDD Fidelity 相比自我修订提升 10.9%。
APM-Bench 将真实流式交互重构为多会话生活轨迹,用于评测第一视角流式视频助手的跨会话持久记忆。该基准包含 549 sessions、104 trajectories 和 2,719 candidates,覆盖客观与开放式问题。评测显示,现有方法仍难以同时实现可靠长期回忆、低开销和有效的跨会话主动辅助。