Agent 如何在环境和反馈中学习
从 Reward、State、Credit 三个角度理解 Agent 训练闭环:Reward 决定学习方向,State 决定训练发生的位置,Credit 决定结果归因于哪些行动。
Writing
Notes, essays, and research-adjacent writing.
从 Reward、State、Credit 三个角度理解 Agent 训练闭环:Reward 决定学习方向,State 决定训练发生的位置,Credit 决定结果归因于哪些行动。
这个博客是一次蓄谋已久的冒险。我不止一次地和朋友们提起过我想写博客,我也不止一次地尝试开始写类似的东西。知乎、小红书、一个注册后一篇也没发过的公众号,在零零碎碎的尝试后,我又一次回到起点。