训练数据投毒:模型后门的隐蔽威胁
攻击的基本形式
模型的能力来自训练数据。如果攻击者能够影响训练数据的构成,就可以塑造模型的行为。最典型的形式是植入后门:在大量正常样本中掺入少量带有特定触发条件的样本,训练后的模型在正常输入下表现与预期一致,只有输入包含触发条件时才会输出攻击者期望的结果。这种特性使后门极难通过常规测试发现。
投毒的可能路径
第一,公开数据源污染。如果训练数据来自网络抓取,攻击者可以在可控的网站上投放特定内容,等待被抓取。
第二,标注环节污染。数据标注通常外包,标注人员可能被收买或疏忽,导致标签被系统性篡改。
第三,反馈数据污染。使用用户交互数据做持续训练时,攻击者可以批量提交精心构造的交互,影响模型后续行为。
第四,模型微调环节。企业基于开源模型做微调时,若使用了来源不明的数据集,同样会继承其中的后门。
检测难点
投毒样本在整体数据中占比极低,统计上不显著;触发条件可以是特定的短语、格式或组合,在正常使用中很少出现;模型在测试集上表现良好,常规评估无法暴露问题。这些特点使得检测需要依赖数据治理手段而非事后测试。
治理对策
第一,数据来源可追溯。记录每批训练数据的来源、采集方式和处理过程,避免使用完全不可追溯的公开数据集。
第二,数据审核与抽检。对新增数据做抽样人工检查,关注异常表述、重复模式和来源集中度。
第三,标注质量控制。通过交叉标注和一致性校验发现标注异常,对标注人员的行为做审计。
第四,输出监测。上线后持续监测模型输出,对异常高频内容、异常触发模式保持告警。
第五,限制反馈数据影响。对用于持续训练的用户反馈做严格过滤,避免被批量操纵。
结语
数据投毒的防御重点在数据供应链治理,而不是模型本身。把数据当作需要管理的资产来对待,是应对这类威胁的基础。