检查大型语言模型对数据中毒的脆弱性

enter image description here

大型语言模型 (LLM) 完全依赖于训练这些模型的输入数据的质量。虽然人们吃石头的暗示对你我来说很有趣,但对于旨在帮助医疗专业人士的 LLM 来说,任何从此类 LLM 中流露出的虚假声明或陈述都可能带来严重后果,从错误诊断到更糟糕的后果。 [Daniel Alexander Alber] 等人最近在《自然医学》上发表的一项研究 中证明了这种数据中毒很容易发生。

根据他们的研究结果,只需用医学错误信息替换 0.001% 的训练标记,即可创建可能产生医学错误陈述的模型。最令人担忧的是,使用标准医学 LLM 基准测试无法轻易发现这种损坏的模型。有针对错误内容的过滤器,但由于开销较大,这些过滤器的范围往往有限。可以进行训练后调整,也可以添加RAG,但这些都无助于解决因损坏而产生的自信废话。

研究人员开发的缓解方法将 LLM 输出与生物医学知识图谱进行交叉引用,以减少 LLM 主要用于生成自然语言的时间。在这种方法中,LLM 输出与图谱进行匹配,如果无法验证 LLM“事实”,则将其标记为潜在的错误信息。在对 1,000 个随机段落进行的测试中,检测到的问题声称有效性为 91.9%。

当然,这并不能保证错误信息不会通过这些知识图谱,并且很大程度上保留了 LLM 的原始问题,即其输出永远无法完全信任。这项研究还清楚地表明,通过输入训练数据破坏 LLM 是多么容易,同时也强调了更广泛的问题,即人工智能正在犯我们意想不到的错误。

enter link description here

评论