Apple ML·2026-10-01 08:00· 1 天前AI 评分49RLTL;DR:通过内化自生成反馈实现自我改进RLTL;DR: Self-Improvement by Internalizing Self-Generated FeedbackAI 导读Apple ML 论文提出 RLTL;DR,让模型在失败后基于 verifier 输出生成 TL;DR insight,并通过反向传播内化 task → insight 映射。来源:Apple ML · machinelearning.apple.com#论文/研究#Agent#编码#推理#MCP/工具调用查看事件全部后续