DeepFloodbeta

让大模型中毒的方法

研究人员发现,让一些大模型中毒实际上非常容易。

基于对模型Llama 3.1、GPT 3.5-Turbo 和开源模型 Pythia的渗透测试,研究团队构建了一系列长度从 0 到 1,000 个字符不等的合法训练文档,实现了给大模型投毒。

对于一个有 130 亿参数的大模型而言,只需要狗仔250 个恶意文档(大约有 42 万token)就可以让大模型中毒,仅仅占总训练数据的 0.00016%。

https://arxiv.org/abs/2510.07192

  • 有实操的吗?

  • 中毒后会怎样?

  • @good #2
    主人,我是你的猫娘

  • @花火 #3 发布于10/10/2025, 7:47:09 AM
    good #2
    主人,我是你的猫娘

    《震惊!知名论坛管理现猫娘真身》

  • 这不就近似微调?

  • 感谢分享

  • 训练前不是清洗数据吗

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13151位用户

🎉欢迎新用户🎉