影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
62.81/100
前 4.1%
全站排名 #2,618
发表论文11 篇
平均评分
年均产出3.7 篇/年
15
AIR-BENCH 2024: A Safety Benchmark based on Regulation and Policies Specified Risk Categories
ICLR 2025Spotlight
一作24
MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models
ICLR 2025Poster
19
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
NeurIPS 2025Poster
24
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
ICLR 2025Poster
三作42
Mind Control through Causal Inference: Predicting Clean Images from Poisoned Data
ICLR 2025Poster
三作15
SCOPE: Scalable and Adaptive Evaluation of Misguided Safety Refusal in LLMs
ICLR 2025Rejected
一作16
AutoRedTeamer: An Autonomous Red Teaming Agent Against Language Models
ICLR 2025Rejected
三作