微信扫码
添加专属顾问
我要投稿
文章的出发点:LLMs通常被训练为通用工具,但在实际应用中,它们往往需要针对特定用户或任务进行调整。现有的方法如sft或rl,需要大量的数据集,这对新任务来说成本过高。本文通过少量用户提供的监督数据来快速定制和对齐大型语言模型,以满足特定用户或任务的需求。
文章标题:Show, Don’t Tell: Aligning Language Models with Demonstrated Feedback
https://arxiv.org/html/2406.00888v1
https://github.com/SALT-NLP/demonstrated-feedback
循环3,4,5,伪代码如下图:
DITTO 性能相对较高的原因之一是它通过生成比较使用的数据远多于 SFT。另一个是,在某些情况下,online imitation learning 比 SFT形式的 demonstrator 表现得更好。
迭代次数1->4,逐渐变优;增加negative sample,2->10逐渐变优;增加演示样本数量,逐渐边优,但是收益越来越低。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-01-16
别被分数骗了:拆解 Anthropic 的 Agent 评估方法论
2026-01-16
极速开发出一个高质量 Claude Agent Skills 最佳实践
2026-01-16
Anthropic 为什么推出 Skills?它会革谁的命!
2026-01-16
Manus 官方首度揭秘 Sandbox 核心机制!
2026-01-16
阿里升级千问:超级 Agent,开始接管超级 App
2026-01-16
“Claude Cowork 杀死了我的创业公司”
2026-01-16
ChatGPT发了个“谷歌翻译”,但我只觉得多余...
2026-01-15
Claude Code 的"懒加载"更新:AI 终于学会了"随叫随到"
2025-10-26
2025-11-19
2025-11-13
2025-10-20
2025-10-18
2025-10-21
2025-11-03
2025-10-23
2025-10-22
2025-10-20
2026-01-12
2026-01-12
2026-01-11
2026-01-10
2026-01-10
2026-01-08
2026-01-02
2025-12-31