影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
65.59/100
前 3.5%
全站排名 #2,233
发表论文9 篇
平均评分
年均产出4.5 篇/年
Jing Huang
研究方向
interpretability · memorization · generalization
11
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
ICML 2025Spotlight
19
Blackbox Model Provenance via Palimpsestic Membership Inference
NeurIPS 2025Spotlight
二作15
The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning
COLM 2025Poster
二作16
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
ICML 2025Poster
一作29
LLMs Encode Harmfulness and Refusal Separately
NeurIPS 2025Poster
二作23
HyperDAS: Towards Automating Mechanistic Interpretability with Hypernetworks
ICLR 2025Poster
二作12
MIB: A Mechanistic Interpretability Benchmark
ICML 2025Poster