影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
90.03/100
前 0.6%
全站排名 #371
发表论文22 篇
平均评分
年均产出7.3 篇/年
20
LLMs Process Lists With General Filter Heads
ICLR 2026Poster
通讯15
Discovering Forbidden Topics in Language Models
ICLR 2026Rejected
通讯17
In-Context Algebra
ICLR 2026Poster
通讯20
Language Models Use Lookbacks to Track Beliefs
ICLR 2026Poster
12
Eliciting and evaluating generalizable explanations from large reasoning models
ICLR 2026Rejected
二作13
In-Context Learning Without Copying
ICLR 2026Rejected
18
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
ICLR 2025Oral
29
LLMs Encode Harmfulness and Refusal Separately
NeurIPS 2025Poster
23
One-Step is Enough: Sparse Autoencoders for Text-to-Image Diffusion Models
NeurIPS 2025Poster
通讯13
The Dual-Route Model of Induction
COLM 2025Poster
通讯27
NNsight and NDIF: Democratizing Access to Open-Weight Foundation Model Internals
ICLR 2025Poster
通讯21
Erasing Conceptual Knowledge from Language Models
NeurIPS 2025Poster
通讯12
MIB: A Mechanistic Interpretability Benchmark
ICML 2025Poster
27
When Are Concepts Erased From Diffusion Models?
NeurIPS 2025Poster
5
Art-Free Generative Models: Exploring Art Creation Without Prior Artistic Knowledge
ICLR 2025Withdrawn
15
Erasing Conceptual Knowledge from Language Models
ICLR 2025Rejected
通讯