<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Reinforcement Learning | Jiakang Yuan</title><link>https://jiakangyuan.github.io/tags/reinforcement-learning/</link><atom:link href="https://jiakangyuan.github.io/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><description>Reinforcement Learning</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Thu, 07 May 2026 00:00:00 +0000</lastBuildDate><image><url>https://jiakangyuan.github.io/media/icon_hu_9c4aa5876d5401cd.png</url><title>Reinforcement Learning</title><link>https://jiakangyuan.github.io/tags/reinforcement-learning/</link></image><item><title>Segment-Aligned Policy Optimization for Multi-Modal Reasoning</title><link>https://jiakangyuan.github.io/publications/sapo/</link><pubDate>Thu, 07 May 2026 00:00:00 +0000</pubDate><guid>https://jiakangyuan.github.io/publications/sapo/</guid><description/></item><item><title>Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges</title><link>https://jiakangyuan.github.io/publications/hacking-survey/</link><pubDate>Wed, 15 Apr 2026 00:00:00 +0000</pubDate><guid>https://jiakangyuan.github.io/publications/hacking-survey/</guid><description/></item><item><title>Omniquality-R: Advanced Reward Models through All-Encompassing Quality Assessment</title><link>https://jiakangyuan.github.io/publications/omniquality-r/</link><pubDate>Sun, 12 Oct 2025 00:00:00 +0000</pubDate><guid>https://jiakangyuan.github.io/publications/omniquality-r/</guid><description/></item></channel></rss>