龙心尘
- 我是 龙心尘,一名深耕 AI 领域的实践者。曾担任百度资深AI算法工程师(T8),也曾是红杉天使轮创业项目的合伙人。
- 我的技术轨迹完整覆盖了从 传统深度学习 NLP 到 大模型(LLM) 的演进历程。目前,我的核心研究方向聚焦于 后训练(Post-Training)与对齐技术,具体包括 SFT、强化学习(RLHF/RL),以及 多智能体(Multi-Agent)策略架构。近期重点关注流式异步有状态工具调用、长程规划与复杂轨迹生成等课题。
- 这里是我沉淀技术思考的主阵地。由于精力分配有限,本站将始终保持内容的最全更新、最快勘误与最佳排版阅读体验。
- 🔍 同频链接:知乎 | 微信公众号 | 小红书 同名账号:@龙心尘
latest posts
| Mar 12, 2026 | 一张图串讲dpsk-math-v2的十几种强化学习提分思路 |
|---|---|
| Mar 10, 2026 | LLM强化学习中KL正则到底能不能去掉? |
| Feb 11, 2026 | 一张表串讲LLM-RL中KL散度正则的正确与错误用法 |
| Feb 10, 2026 | 一图串讲GRPO十几种主流变体算法 |