Writing

Blogs

Notes, essays, and research-adjacent writing.

Agent 如何在环境和反馈中学习

从 Reward、State、Credit 三个角度理解 Agent 训练闭环:Reward 决定学习方向,State 决定训练发生的位置,Credit 决定结果归因于哪些行动。

Post-training Agents Reinforcement Learning

先声的幻觉——关于语言、思想和表达

这个博客是一次蓄谋已久的冒险。我不止一次地和朋友们提起过我想写博客,我也不止一次地尝试开始写类似的东西。知乎、小红书、一个注册后一篇也没发过的公众号,在零零碎碎的尝试后,我又一次回到起点。

Musings