影响力指数
96.34/100
前 0.2%
全站排名 #120
发表论文53
平均评分5.3
年均产出17.7 篇/年

Yaodong Yang

Assistant Professor@Peking University·中国·OpenReview
研究方向

Reinforcement Learning · AI Alignment

8.2
24

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

NeurIPS 2025Spotlight
通讯
7.8
30

Generative RLHF-V: Learning Principles from Multi-modal Human Preference

NeurIPS 2025Poster
通讯
7.8
24

DexFlyWheel: A Scalable and Self-improving Data Generation Framework for Dexterous Manipulation

NeurIPS 2025Spotlight
7.6
22

Social World Model-Augmented Mechanism Design Policy Learning

NeurIPS 2025Poster
7.3
35

Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback

NeurIPS 2025Poster
通讯
7.0
17

Risk-aware Direct Preference Optimization under Nested Risk Measure

NeurIPS 2025Poster
7.0
23

In-Context Editing: Learning Knowledge from Self-Induced Distributions

ICLR 2025Poster
6.5
37

Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization

ICLR 2025Poster
三作
6.5
25

Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment

ICLR 2025Poster
通讯
6.4
23

STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization

NeurIPS 2025Poster
通讯
6.4
21

Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning

NeurIPS 2025Poster
5.8
24

Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs

ICLR 2025Poster
通讯
5.5
11

SAE-V: Interpreting Multimodal Models for Enhanced Alignment

ICML 2025Poster
通讯
5.5
17

Falcon: Fast Visuomotor Policies via Partial Denoising

ICML 2025Poster
通讯
5.3
9

Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models

ICLR 2025Poster
4.9
9

Risk-aware Direct Preference Optimization under Nested Risk Measure

ICML 2025Rejected
4.3
13

Random Feature Models with Learnable Activation Functions

ICLR 2025Rejected
三作
4.3
6

Iterative Training of Language Models with Opponent Modeling for Red Teaming Data Generation

ICLR 2025Rejected
通讯
4.0
4

Computing Ex Ante Equilibrium in Heterogeneous Zero-Sum Team Games

ICLR 2025Withdrawn
3.7
4

Mixed Hierarchical Oracle and Multi-Agent Benchmark in Two-player Zero-sum Games

ICLR 2025Withdrawn