OriginBlame:用于AI训练数据集的记录级和标记级数据溯源
本文介绍了OriginBlame(ob),一种实现作者身份传播并支持精确数据撤销请求的记录级和标记级数据溯源系统。该系统解决了现有溯源工具仅支持文件或数据集级别导致过度删除的问题,使用确定性查询精准定位需要“遗忘”的训练记录。对219,555个维基百科页面的评估显示,记录级溯源将数据集级过度删除从101倍降至1.3倍,同时在不同平台上带来的吞吐量开销较低。基于1.7B参数模型,溯源生成的“遗忘集”相比随机基准提高了42%的去学习效果。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。