yuzheng310

yuzheng310

写代码,研究一些系统问题。

最近的工作围绕大模型推理、代码 Agent 和数据库展开。
这里整理做过的项目,也记录实现过程中的问题和取舍。

GitHub

项目

Qwen3 Runtime

推理系统

面向多轮 Agent 的单 GPU 推理运行时。实现请求调度、分页 KV、会话暂停与恢复,并沿着完整执行路径做性能分析。

RepoCompass

Agent 后训练

仓库级代码定位 Agent。围绕文件与函数定位,整理多轮环境、可验证奖励,以及 RFT → GSPO 的训练流程。

笔记

最近

在梳理会话 KV 的生命周期、CPU offload 的适用边界,以及推理层和上层 Agent 的职责划分。

更多背景在关于页面