Blogs
欢迎来到我的博客!这里记录我对前沿技术的思考与探索,包括技术解读、工具实践和研究笔记。
递归如何闭环?——从可修改范围到 Agent as Service
“走向递归自我改进”系列下篇:沿可修改范围的扩张理解递归依赖,并讨论可验证、可归因的 RSI 实验系统。
什么在进化?——Model、Harness 与 Artifact 的三层地图
“走向递归自我改进”系列上篇:从 Artifact、Agent Harness 与 Model 三种优化对象出发,建立 Self-Evolving Agents 的领域地图。
Memory Benchmark 演化
系统梳理 Agent Memory Benchmark 的演化脉络,对比历史来源、Agent 场景、任务闭环、监督粒度与诊断能力。
On-Policy Distillation 的前世今生
对比 on-policy RL、off-policy SFT 与逐 token 蒸馏,讨论奖励密度、数据复用、持续学习和 Self-Distillation。
RLVR 实战手册 — 从强化学习理论到 Slime 框架
从 RL 理论基础到 LLM 强化学习训练框架 Slime 的实战使用,涵盖 Policy Gradient、PPO、GRPO 和完整训练流程。
Arxiv Daily Papers Agent
自动追踪 arXiv 最新论文,按研究方向分类并生成中文 TL;DR,帮助你快速掌握当日研究动态。
