标签: OpenAI

一个根本性缺陷让LLMs极易受到攻击

一个根本性缺陷让LLMs极易受到攻击

国际机器学习大会(ICML)一篇论文指出,大语言模型存在一个根源性缺陷——它们无法可靠区分指令来自系统还是用户,导致越狱攻击难以根除。研究人员已成功让多款主流模型输出被禁止的危险信息,且认为该问题可能无法通过训练彻底解决。