<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Reinforcement Learning on zzszmyf</title><link>https://zzszmyf.github.io/tags/reinforcement-learning/</link><description>Recent content in Reinforcement Learning on zzszmyf</description><generator>Hugo</generator><language>zh-CN</language><copyright>© 2026 zzszmyf</copyright><lastBuildDate>Wed, 17 Apr 2024 00:00:00 +0800</lastBuildDate><atom:link href="https://zzszmyf.github.io/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>VC-FCST Benchmark 落地方案：Code Agent 标准化测评</title><link>https://zzszmyf.github.io/notes/vc-fcst-benchmark/</link><pubDate>Wed, 17 Apr 2024 00:00:00 +0800</pubDate><guid>https://zzszmyf.github.io/notes/vc-fcst-benchmark/</guid><description/></item><item><title>《KIMI K2.5: VISUAL AGENTIC INTELLIGENCE》阅读笔记</title><link>https://zzszmyf.github.io/notes/kimi-k2-5-visual-agentic-intelligence/</link><pubDate>Sat, 06 Apr 2024 00:00:00 +0800</pubDate><guid>https://zzszmyf.github.io/notes/kimi-k2-5-visual-agentic-intelligence/</guid><description/></item><item><title>百花齐放的 Diffusion-RL：技术路线综述</title><link>https://zzszmyf.github.io/notes/diffusion-rl-methods/</link><pubDate>Wed, 03 Apr 2024 00:00:00 +0800</pubDate><guid>https://zzszmyf.github.io/notes/diffusion-rl-methods/</guid><description/></item><item><title>Claude Code Agent Teams 运行机制深度分析</title><link>https://zzszmyf.github.io/notes/claude-code-agent-teams-deep-dive/</link><pubDate>Tue, 02 Apr 2024 00:00:00 +0800</pubDate><guid>https://zzszmyf.github.io/notes/claude-code-agent-teams-deep-dive/</guid><description/></item><item><title>从各家技术文章看26年Agentic RL Infra优化方向</title><link>https://zzszmyf.github.io/notes/agentic-rl-infra-optimization-2026/</link><pubDate>Mon, 01 Apr 2024 00:00:00 +0800</pubDate><guid>https://zzszmyf.github.io/notes/agentic-rl-infra-optimization-2026/</guid><description/></item></channel></rss>