Paper
Hub
学术助手
数据洞察
排行榜
获奖论文
搜索
Toggle language
影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
39.63
/100
前 14.7%
全站排名 #9,449
发表论文
8
篇
平均评分
5.6
年均产出
2.7
篇/年
Rohin Shah
Researcher
@
Google DeepMind
·
英国
·
OpenReview
研究方向
ai safety · preference learning · ai alignment · interpretability
发表论文
8
合作网络
学术分析
2026
2 篇
ICLR
ICML
NeurIPS
已接收
未接收
评分
5.5
14
Consistency Training Helps Stop Sycophancy and Jailbreaks
ICLR 2026
Rejected
通讯
4.0
11
Evaluating LLM Goal-Directedness
ICLR 2026
Rejected
通讯
2025
2 篇
7.0
9
MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking
ICML 2025
Poster
通讯
6.4
24
Evaluating Frontier Models for Stealth and Situational Awareness
NeurIPS 2025
Rejected
通讯
2024
4 篇
合作者 (20)
VV
Vikrant Varma
4 篇
JK
Janos Kramar
3 篇
ZK
Zachary Kenton
3 篇
DL
David Lindner
3 篇
DE
David Elson
2 篇
SF
Sebastian Farquhar
2 篇
RK
Ramana Kumar
1 篇
AD
Allan Dafoe
1 篇
查看全部 20 位合作者