影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
31.5/100
前 22.8%
全站排名 #14,664
发表论文5 篇
平均评分
年均产出2.5 篇/年
23
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
ICLR 2026Rejected
27
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
ICLR 2026Poster
21
Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
ICLR 2026Poster
二作