Hugging Face Daily Papers·· 4 天前AI 评分51
Mid-Harness 通过动作采样与验证提升终端智能体执行可靠性
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
AI 导读
Mid-Harness 研究在模型与 harness 边界分配测试时计算,以在执行前采样并验证候选动作,提高终端智能体的动作可靠性和轨迹成功率。使用 TMAX-9B 生成器时,弱验证下更多动作采样收益有限;在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器配合 8 个采样动作将 Pass@1 从基础智能体的 50.00% 提高到 68.03%。
来源:Hugging Face Daily Papers · arxiv.org