跳到正文

#评测/基准

今日 0 条
10月1日周四
  1. Hugging Face Daily Papers49

    更多选择,更少决策:类 JEV 直接决策模型中的序数尺度偏差

    研究分析 JEV 1.13 和 3 个开源 KEV 模型,发现直接决策模型存在序数尺度利用偏差,会压缩候选决策空间。在 ANLI 上,JEV 虽有 74.95% 准确率,却将 38.8% 预测和 51.3% 错误归为 Neutral;36 个序数数据集上最终决策仅使用 67--76% 有效 gold support。BA-LoRA 后训练在 8 个监督尺度上将利用率从约 47% 提至 86%。

  2. Hugging Face Daily Papers33

    面向决策的推荐重排序:Jev 的实证研究

    一项实证研究评估 TypeSafe AI 所称“System One Model”的 Jev 用于个性化推荐重排序,并与推荐专用模型及 pointwise、listwise Qwen rerankers 比较。实验覆盖多个 Amazon Reviews 领域和候选集大小,结果显示 Jev 推荐效果较强,延迟增长比 pointwise Qwen rerankers 更平缓,但仍显著高于推荐专用模型。

  3. Hugging Face Daily Papers47

    A2Z GameSpec-Bench:编码智能体能多忠实地根据游戏设计规范生成游戏?

    A2Z GameSpec-Bench 提供 100 份长篇 GDD,用于评估编码智能体端到端生成游戏时对设计规范的忠实度。它将每份 GDD 转为包含规则、约束和前置关系的依赖感知契约,并结合源码检查、场景回放和自适应游玩测试。评估显示,当前智能体难以同时满足代码实现和实际游玩中的相互依赖需求,基于需求的反馈两轮后使 GDD Fidelity 相比自我修订提升 10.9%。

9月30日周三
  1. Hugging Face Daily Papers43

    APM-Bench:面向第一视角流式视频助手的跨会话持久记忆基准

    APM-Bench 将真实流式交互重构为多会话生活轨迹,用于评测第一视角流式视频助手的跨会话持久记忆。该基准包含 549 sessions、104 trajectories 和 2,719 candidates,覆盖客观与开放式问题。评测显示,现有方法仍难以同时实现可靠长期回忆、低开销和有效的跨会话主动辅助。