跳到正文
原文
Apple ML·· 1 天前AI 评分49

RLTL;DR:通过内化自生成反馈实现自我改进

RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback

AI 导读

Apple ML 论文提出 RLTL;DR,让模型在失败后基于 verifier 输出生成 TL;DR insight,并通过反向传播内化 task → insight 映射。

来源:Apple ML · machinelearning.apple.com