影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
51.9/100
前 7.6%
全站排名 #4,906
发表论文7 篇
平均评分
年均产出2.3 篇/年
Udari Madhushani Sehwag
研究方向
Scalable oversight · Frontier safety · Foundation model based agents · Alignment · collective alignment · Evaluations and benchmarking foundation models · Jailbreak · safety and responsible generative AI · Multi-agent learning · multi-agent RL
24
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
ICLR 2025Poster
19
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-Time Alignment
ICLR 2025Poster
二作31
Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
ICLR 2025Poster
三作24
AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment
ICLR 2025Rejected
二作