影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
38.27/100
前 15.7%
全站排名 #10,107
发表论文8 篇
平均评分
年均产出4.0 篇/年
Julian Michael
研究方向
alignment · truthfulness · debate · interpretability · explainability · benchmarks · evaluation · linguistic analysis · semantics · semantic roles · semantic formalisms · structure prediction · parsing · ccg
12
Why Do Some Language Models Fake Alignment While Others Don't?
NeurIPS 2025Spotlight
三作32
AI Debate Aids Assessment of Controversial Claims
NeurIPS 2025Poster
15
Quantifying Elicitation of Latent Capabilities in Language Models
NeurIPS 2025Poster
6
Rapid Response: Mitigating LLM Jailbreaks With A Few Examples
ICLR 2025Rejected
二作7
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
ICLR 2025Rejected
三作5
Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought
ICLR 2025Withdrawn
7
Evaluating Oversight Robustness with Incentivized Reward Hacking
ICLR 2025Withdrawn
通讯