标签: API

语言不可读性对 LLM 安全的影响

语言不可读性对 LLM 安全的影响

MIT 学者 James Mickens 在 9 月 2 日提交的 arXiv 论文中提出“语言不可读性”概念,认为大模型的外部语言输出与内部真实计算之间存在结构性偏差,因此所有依赖模型“自我汇报”的安全机制都不可能完全可靠,沙箱必须建立在与语言无关的隔离与污点追踪之上。