国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:何黎松, 杨洋
单位:1. 西安交通大学 管理学院,西安 7100492. 西安欧亚学院 金融与数据科学学院,西安 710065
关键词:数据隐私保护,遗忘学习,可认证性,统一框架
为了有效保护数据隐私并实现“被遗忘的权力”,需要从机器学习模型中消除特定训练数据子集的影响,并确保这些数据不会被反向推测。为了解决这一问题,近年来形成了“遗忘学习”的研究领域。从定义、度量方法和算法三个方面全面介绍遗忘学习的研究进展。梳理了遗忘学习的核心概念定义和评价指标,并着重分析了可认证性指标的重要意义。按照算法设计原理将遗忘算法划分为结构化初训练、影响函数近似估计、梯度更新、噪声遗忘、知识蒸馏遗忘和边界遗忘六大类,并详细介绍了其中九种代表性的遗忘学习算法及其演变。在总结比较已有算法优劣基础上,讨论了遗忘学习统一框架的意义,并分析了遗忘学习研究与隐私保护的理论和实践关系。展望了遗忘学习未来的研究方向,包括:机器学习的公平性、迁移学习和强化学习等子领域尚需拓展遗忘学习算法;未来遗忘算法有可能综合多种设计思路;遗忘实践需要技术与法规的协同合作;遗忘学习与增量学习的统一将有助于提高机器学习模型的管理和运营效率。
来源:2024年第11期
《计算机科学与探索》期刊编辑部