影响力指数
论文质量、代表作、近期表现、广度与样本量置信度综合计算
61.2/100
前 4.5%
全站排名 #2,913
发表论文8 篇
平均评分
年均产出4.0 篇/年
Xiangyu Qi
研究方向
Adversarial Machine Learning · AI Safety · AI Alignment · Large Language Models
29
Safety Alignment Should be Made More Than Just a Few Tokens Deep
ICLR 2025Oral
一作24
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
ICLR 2025Poster
二作30
On Evaluating the Durability of Safeguards for Open-Weight LLMs
ICLR 2025Poster
一作5
Defensive Prompt Patch: A Robust and Generalizable Defense of Large Language Models against Jailbreak Attacks
ICLR 2025Withdrawn
二作6
Lottery Ticket Adaptation: Mitigating Destructive Interference in LLMs
ICLR 2025Withdrawn
三作27
Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
ICLR 2024Oral
一作29
BaDExpert: Extracting Backdoor Functionality for Accurate Backdoor Input Detection
ICLR 2024Poster
二作18
BackdoorAlign: Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
NeurIPS 2024Poster