影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
96.34/100
前 0.2%
全站排名 #120
发表论文53 篇
平均评分
年均产出17.7 篇/年
Yaodong Yang
研究方向
Reinforcement Learning · AI Alignment
25
PoliCon: Evaluating LLMs on Achieving Diverse Political Consensus Objectives
ICLR 2026Poster
通讯18
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
ICLR 2026Poster
16
Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment
ICLR 2026Poster
22
MVR: Multi-view Video Reward Shaping for Reinforcement Learning
ICLR 2026Poster
15
Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning
ICLR 2026Rejected
11
Adversarial Policy Transfer in Mixed Cooperative-Competitive Games
ICLR 2026Rejected
5
Dexterous Non-Prehensile Manipulation for Ungraspable Objects via Extrinsic Dexterity
ICLR 2026Withdrawn
19
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
ICLR 2026Withdrawn
34
Debate with Image: Detecting Deceptive Behaviors in Multimodal Large Language Models
ICLR 2026Rejected
32
Mesa and Mask: A Benchmark for Detecting and Classifying Deceptive Behaviors in LLMs
ICLR 2026Rejected
24
Fault Tolerant Multi-Agent Learning with Adversarial Budget Constraints
ICLR 2026Rejected
通讯14
Safe Reinforcement Learning with ADRC Lagrangian Method
ICLR 2026Rejected
5
Communication-Efficient Desire Alignment for Embodied Agent–Human Adaptation
ICLR 2026Withdrawn
5
SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing
ICLR 2026Withdrawn
5
Mitigating Deceptive Alignment via Self-Monitoring
ICLR 2026Rejected
通讯24
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
NeurIPS 2025Spotlight
通讯30
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
NeurIPS 2025Poster
通讯24
DexFlyWheel: A Scalable and Self-improving Data Generation Framework for Dexterous Manipulation
NeurIPS 2025Spotlight
22
Social World Model-Augmented Mechanism Design Policy Learning
NeurIPS 2025Poster
35
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
NeurIPS 2025Poster
通讯17
Risk-aware Direct Preference Optimization under Nested Risk Measure
NeurIPS 2025Poster
23
In-Context Editing: Learning Knowledge from Self-Induced Distributions
ICLR 2025Poster
37
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
ICLR 2025Poster
三作25
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
ICLR 2025Poster
通讯23
STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
NeurIPS 2025Poster
通讯21
Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning
NeurIPS 2025Poster
24
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
ICLR 2025Poster
通讯11
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
ICML 2025Poster
通讯17
Falcon: Fast Visuomotor Policies via Partial Denoising
ICML 2025Poster
通讯9
Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models
ICLR 2025Poster
9
Risk-aware Direct Preference Optimization under Nested Risk Measure
ICML 2025Rejected
13
Random Feature Models with Learnable Activation Functions
ICLR 2025Rejected
三作6
Iterative Training of Language Models with Opponent Modeling for Red Teaming Data Generation
ICLR 2025Rejected
通讯4
Computing Ex Ante Equilibrium in Heterogeneous Zero-Sum Team Games
ICLR 2025Withdrawn
4
Mixed Hierarchical Oracle and Multi-Agent Benchmark in Two-player Zero-sum Games
ICLR 2025Withdrawn