上一篇 下一篇 分享链接 返回 返回顶部

训练数据投毒:模型后门的隐蔽威胁

发布人:小亿 发布时间:2026-07-07 00:18 阅读量:799

攻击的基本形式

模型的能力来自训练数据。如果攻击者能够影响训练数据的构成,就可以塑造模型的行为。最典型的形式是植入后门:在大量正常样本中掺入少量带有特定触发条件的样本,训练后的模型在正常输入下表现与预期一致,只有输入包含触发条件时才会输出攻击者期望的结果。这种特性使后门极难通过常规测试发现。

投毒的可能路径

第一,公开数据源污染。如果训练数据来自网络抓取,攻击者可以在可控的网站上投放特定内容,等待被抓取。

第二,标注环节污染。数据标注通常外包,标注人员可能被收买或疏忽,导致标签被系统性篡改。

第三,反馈数据污染。使用用户交互数据做持续训练时,攻击者可以批量提交精心构造的交互,影响模型后续行为。

第四,模型微调环节。企业基于开源模型做微调时,若使用了来源不明的数据集,同样会继承其中的后门。

检测难点

投毒样本在整体数据中占比极低,统计上不显著;触发条件可以是特定的短语、格式或组合,在正常使用中很少出现;模型在测试集上表现良好,常规评估无法暴露问题。这些特点使得检测需要依赖数据治理手段而非事后测试。

治理对策

第一,数据来源可追溯。记录每批训练数据的来源、采集方式和处理过程,避免使用完全不可追溯的公开数据集。

第二,数据审核与抽检。对新增数据做抽样人工检查,关注异常表述、重复模式和来源集中度。

第三,标注质量控制。通过交叉标注和一致性校验发现标注异常,对标注人员的行为做审计。

第四,输出监测。上线后持续监测模型输出,对异常高频内容、异常触发模式保持告警。

第五,限制反馈数据影响。对用于持续训练的用户反馈做严格过滤,避免被批量操纵。

结语

数据投毒的防御重点在数据供应链治理,而不是模型本身。把数据当作需要管理的资产来对待,是应对这类威胁的基础。

目录结构
全文
售后客服 售后客服
企业微信 企业微信
服务热线: 15368564009
电子邮箱: yihwlkj@163.com