研究人员发现,让一些大模型中毒实际上非常容易。
基于对模型Llama 3.1、GPT 3.5-Turbo 和开源模型 Pythia的渗透测试,研究团队构建了一系列长度从 0 到 1,000 个字符不等的合法训练文档,实现了给大模型投毒。
对于一个有 130 亿参数的大模型而言,只需要狗仔250 个恶意文档(大约有 42 万token)就可以让大模型中毒,仅仅占总训练数据的 0.00016%。
研究人员发现,让一些大模型中毒实际上非常容易。
基于对模型Llama 3.1、GPT 3.5-Turbo 和开源模型 Pythia的渗透测试,研究团队构建了一系列长度从 0 到 1,000 个字符不等的合法训练文档,实现了给大模型投毒。
对于一个有 130 亿参数的大模型而言,只需要狗仔250 个恶意文档(大约有 42 万token)就可以让大模型中毒,仅仅占总训练数据的 0.00016%。
有实操的吗?
中毒后会怎样?
@good #2
主人,我是你的猫娘《震惊!知名论坛管理现猫娘真身》
@shc #4
!
好活
这不就近似微调?
感谢分享
训练前不是清洗数据吗