影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
69.81/100
前 2.7%
全站排名 #1,726
发表论文8 篇
平均评分
年均产出2.7 篇/年
Peter Henderson
研究方向
foundation models · law · reinforcement learning · machine learning
29
Safety Alignment Should be Made More Than Just a Few Tokens Deep
ICLR 2025Oral
通讯24
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
ICLR 2025Poster
30
On Evaluating the Durability of Safeguards for Open-Weight LLMs
ICLR 2025Poster
通讯17
Fantastic Copyrighted Beasts and How (Not) to Generate Them
ICLR 2025Poster
通讯