微信扫码
添加专属顾问
我要投稿
这是关于 AI 智能体的精彩探讨,Meta 专家提出颠覆性观点,不容错过! 核心内容: 1. 专家认为 LLM 构建 Agent 走偏,RL 才是核心 2. 当前 Agent 的痛点与问题分析 3. RL 解决问题的平行宇宙思维
今天给家人们聊一期播客总结,四十二章经最新一期播客请到了在Meta工作了七年的应用强化学习组负责人朱哲清Bill。作为斯坦福大学强化学习专业博士,现在创业做Agent的他,抛出了一个巨大的反共识观点:
"LLM只是一个翻译官,真正的Agent核心应该是RL。"
等等,这是什么意思?
在2024年,我们见证了GPT-4掀起的Agent热潮。Claude、GPTs、Copilot...几乎所有大公司都在用LLM构建Agent。
但Bill却说,这条路走偏了?
并且,他用自己的技术路线,只花了不到1万美金就训练出了一个能在电商领域超越GPT-4的Agent。
这背后到底有什么玄机?
要理解Bill的观点,我们先问自己一个问题:当前的Agent真的在"思考"吗?
播客里边给出了一个非常形象的类比:想象你在一个复杂的迷宫里。
如果是人类,会怎么做?
但当前的LLM Agent呢?它就像一个只会背诵地图的人:
这就是为什么你会发现:
Agent常常重复同样的错误;遇到新情况就抓瞎;效率始终无法提升等等问题
那RL是如何解决这个问题的?
这里有个有趣的概念:平行宇宙。
想象你在玩《王者荣耀》,每次决策都可以看到未来5分钟会发生什么,这边走会被抓,那边走能拿龙 ,支援上路能赢团战。
这就是RL的核心能力:
就像,AlphaGo能在没有人类棋谱的情况下,可以通过自我对弈达到超越人类的水平了;DeepSeek-R1最新的模型,没有PRM(过程奖励),没有MCTS(蒙特卡洛),Zero模型可以直接开始RL,训出来推理能力。
这是不是意味着LLM就没用了?
恰恰相反。
Bill提出了一个绝妙的比喻:LLM就像一个优秀的"翻译官"。
想象你是一个天才的围棋选手,但只会下棋,不会说话。你需要有人帮你理解对手的意图,帮你表达想法。
这就是LLM的完美定位:
Bill预测,2025年会出现三个重要趋势:
但更重要的是,这个技术路线给了我们一个全新的视角:
也许,真正的AI智能体,应该像人类一样:
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-14
多轮 Agent 场景下,滴滴的 EAGLE-3 训推加速实践
2026-05-06
谁说 Mac 只能写代码?Google 官宣:M 芯片本地微调 Gemma 4 时代开启!
2026-04-20
用 Unsloth 微调 Embedding 模型,让你的 RAG 检索不再答非所问
2026-04-15
ComfyUI v0.19.0 更新:大量新节点、新模型、新修复与性能优化全面落地,工作流与训练能力再升级
2026-04-13
Agent 持续学习落地路径:先做 Traces,再做 Context,最后才微调模型 | Jinqiu Select
2026-03-23
养死四只龙虾的小白有感
2026-03-22
Mistral Forge 的真正意义:企业AI从“租用”走向“拥有”
2026-03-21
马斯克再次站台Kimi,扒掉了Cursor 500亿估值的底裤
2026-03-19
2026-04-15
2026-03-21
2026-03-03
2026-03-23
2026-03-22
2026-03-17
2026-04-13
2026-04-20
2026-05-06
2026-01-02
2025-11-19
2025-09-25
2025-06-20
2025-06-17
2025-05-21
2025-05-17
2025-05-14