← Agentic RL
全部项目
技术阅读库 · ByteTech
Agentic RL · 多轮强化学习阅读库
围绕多轮 Agent 强化学习、long-horizon 稳定性、SWE Agent RL、用户模拟器、训练框架、Reward 与评测闭环整理。
需 ByteTech 权限访问
Agentic RL / Long-horizon
说明:本页仅做外部链接索引与一句话摘要,不转载 ByteTech 全文内容。
Agentic RL · 全链路训练
Agentic RL
Agentic RL 范式总览,覆盖多轮工具调用 Agent 的强化学习训练框架与关键难点。
从语言到行动:现代大模型 Agentic 能力全链路训练解析
解释从语言模型到行动 Agent 的训练链路,支撑“评测→训练闭环”的方法论。
端到端强化学习在 LLM Agent 中的应用
端到端 RL 训练 Agent 的方法和实践,对应多轮 agentic rollout 的实现。
Long-horizon · 多轮 RL 训练难点
从 Chatbot 到 Long-horizon Agent
长程 Agent 相比对话模型的范式转变,可用于解释长轨迹稳定性挑战。
长上下文、多轮交互的软件工程 Agent 的强化学习训练
长上下文 + 多轮 SWE Agent 的 RL 训练,对应向真实代码 Agent 任务迁移的设计。
多轮对话 RL 最新进展调研:用户模拟器、训练框架、Reward 与评测
多轮 RL 的用户模拟器、训练框架与 reward 设计,对应信用分配与可验证奖励设计。
相关背景 · Coding Agent 生态
智能体三巨头解析 · 2|Claude Code 深度解析
外部微信文章,介绍终端原生 Coding Agent 的代理循环、MCP 与沙箱执行,可作为真实 Agent 任务训练的场景背景。
← 返回项目详情