影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
52.36/100
前 7.4%
全站排名 #4,759
发表论文11 篇
平均评分
年均产出3.7 篇/年
Andy Zou
研究方向
ml safety · ai safety · alignment · robustness · monitoring · transparency
28
Safety Pretraining: Toward the Next Generation of Safe AI
NeurIPS 2025Poster
19
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
ICLR 2025Poster
34
Tamper-Resistant Safeguards for Open-Weight LLMs
ICLR 2025Poster
5
Transferable Adversarial Attack on Vision-enabled Large Language Models
ICLR 2025Withdrawn
5
Which Network is Trojaned? Increasing Trojan Evasiveness for Model-Level Detectors
ICLR 2025Withdrawn
二作