影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
68.24/100
前 2.9%
全站排名 #1,886
发表论文12 篇
平均评分
年均产出4.0 篇/年
Jiaming Ji
研究方向
Reinforcement Learning from Human Feedback · Large Language Models · AI Safety
18
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
ICLR 2026Poster
32
Mesa and Mask: A Benchmark for Detecting and Classifying Deceptive Behaviors in LLMs
ICLR 2026Rejected
34
Debate with Image: Detecting Deceptive Behaviors in Multimodal Large Language Models
ICLR 2026Rejected
通讯14
Safe Reinforcement Learning with ADRC Lagrangian Method
ICLR 2026Rejected
三作5
Mitigating Deceptive Alignment via Self-Monitoring
ICLR 2026Rejected
一作24
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
NeurIPS 2025Spotlight
三作30
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
NeurIPS 2025Poster
二作35
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
NeurIPS 2025Poster
一作11
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
ICML 2025Poster
三作