联邦学习近似遗忘方向文献综述
摘要
联邦学习(Federated Learning, FL)允许多客户端在不共享原始数据的情况下协同训练模型,但训练完成后的全局模型仍可能保留用户样本、类别特征、敏感属性或后门触发器等信息。当用户提出删除数据、退出系统或行使“被遗忘权”时,仅删除客户端本地数据并不能消除其对全局模型的历史影响,因此联邦遗忘(Federated Unlearning, FU)成为隐私保护机器学习的重要研究方向。最直接的精确遗忘方法是排除待遗忘客户端或数据后重新训练模型,但完整重训在跨设备联邦学习、工业物联网、推荐系统和大模型联邦微调中通常代价过高。近似联邦遗忘由此成为近五年研究的主流方向:它不要求遗忘模型与重训练模型在参数层面完全一致,而是通过历史更新校准、梯度上升、子空间投影、知识蒸馏、主动遗忘、表示变换、生成式扰动或参数高效恢复等机制,以较低成本实现接近重训练的遗忘效果。[1][2][3][4][5][6]
本文围绕“近似遗忘”展开,首先介绍联邦遗忘的背景、定义、研究动机和核心挑战;随后按照技术机制构建分类体系,将近五年方法归纳为五大范式:基于历史信息回放的遗忘、基于优化的梯度导向遗忘、基于知识蒸馏的模型修正遗忘、基于表示/结构变换的细粒度遗忘,以及面向隐私可验证、公平性和新型联邦场景的增强型遗忘。在代表性方法部分,重点展开 FedEraser、FedRecovery、FedOSD、FUGAS、FUPareto、FunCF、FRU、FedQUIT、FedAF、Ferrari、FUCRT、PAR、FedCARE、FedRazor、REMISVFU、FedShard 等工作,并对用户特别关注的 FUGAS、FedOSD、FUPareto 和 FunCF 进行更细致的机制分析。最后,本文总结评估指标、常用数据集、实验洞见和未来研究方向,指出联邦近似遗忘正从“删除单个客户端贡献”逐步走向“长期、可验证、公平、跨范式的模型治理”。[1:1][3:1][7][8][4:1][9][10][11][12][13][14][15][16]
关键词:联邦学习;联邦遗忘;近似遗忘;梯度冲突;知识蒸馏;主动遗忘;帕累托优化;灾难性遗忘
引言
研究背景
联邦学习由 McMahan 等人提出后,迅速成为隐私保护分布式机器学习的代表性范式。其基本流程是:服务器维护全局模型,在每轮通信中向部分客户端下发模型参数;客户端在本地数据上训练若干 epoch 后上传模型更新;服务器通过 FedAvg、FedProx、FedOpt 等聚合策略更新全局模型。由于原始数据不离开本地,联邦学习被广泛应用于移动键盘、医疗影像、金融风控、智能交通、工业物联网和推荐系统等场景。[17]
然而,“数据不出本地”并不意味着“模型不记忆数据”。大量研究表明,训练后的模型参数和梯度更新可能泄露成员信息、属性信息或类别偏置;模型也可能记住恶意客户端植入的后门触发器。当某个用户或组织要求删除其数据时,合规系统不仅要删除本地样本,还要消除这些样本已经写入模型参数的统计影响。这一问题在 GDPR 第 17 条“被遗忘权”、CCPA/CPRA 等隐私法规背景下具有明确现实需求。
在集中式机器学习中,机器遗忘通常可通过重训、影响函数、充分统计量删除、模型切片或参数修正实现;但联邦学习场景更复杂:训练数据分散在客户端,本地数据不可访问;客户端可能离线;数据高度 non-IID;历史训练轨迹由多轮聚合耦合而成;服务器保存历史更新又会引入新的隐私风险。因此,联邦遗忘不是普通机器遗忘的简单迁移,而是同时涉及优化、隐私、安全、系统效率和多主体公平性的综合问题。[5:1][6:1][18][19]
联邦遗忘的定义与研究动机
设联邦系统中客户端集合为 $\mathcal{C}$,第 $i$ 个客户端持有本地数据 $D_i$。标准联邦训练得到全局模型 $w$。当目标客户端 $u$、目标样本集合 $D_f$、目标类别 $y_f$ 或目标特征 $z_f$ 需要被遗忘时,理想遗忘模型 $w^{-f}$ 应尽可能接近只用保留数据训练得到的重训练模型:
$$ w^{-f} \approx w_{\operatorname{retrain}} = \operatorname{Train}(\mathcal{D}\setminus D_f). $$
按照实现强度,联邦遗忘可分为两类:
- 精确遗忘(Exact Federated Unlearning):要求遗忘模型在参数或输出分布上与排除目标数据后重新训练得到的模型严格一致或具有强认证保证。该类方法通常具有较强理论性质,但成本接近重训,或要求训练阶段预先采用分片、检查点、可删除充分统计量等特殊结构。
- 近似遗忘(Approximate Federated Unlearning):不追求完全等价,而是通过高效修正使模型在目标数据上的行为接近重训练模型,同时尽量保持保留数据性能。近似遗忘通常以目标数据准确率、成员推理攻击成功率、后门 ASR、输出 KL 散度、保留数据准确率和通信开销等指标衡量。
近似遗忘成为近五年主流研究方向,主要有三点原因。第一,完整重训需要重新调度大量客户端,在跨设备 FL 中不现实。第二,深度模型训练路径高度非凸且路径依赖,准确扣除某个客户端的影响非常困难。第三,实际系统往往更关心可部署性和经验风险,例如目标用户成员推理风险是否下降、后门是否失效、保留客户端精度是否保持,而不是遗忘模型与重训练模型逐参数相同。[1:2][20][5:2][6:2]
核心挑战
1. 遗忘与效用的固有冲突 最简单的遗忘方式是让模型在目标数据上表现变差,例如梯度上升最大化目标损失;但目标数据通常与保留数据共享特征和类别边界,过强遗忘会破坏保留知识。如何“只忘该忘的,不忘不该忘的”是所有近似遗忘方法的核心难题。
2. 数据异构导致梯度冲突 真实 FL 中客户端数据往往 non-IID。目标客户端的梯度方向可能与部分保留客户端相似,也可能与其他保留客户端冲突。遗忘目标客户端时,如果直接反向更新,很容易伤害分布相近的保留客户端。FedOSD、FUGAS、FUPareto、FedCARE、FedRazor 等近期方法都把“梯度冲突缓解”作为重点。[4:2][9:1][10:1][12:1][13:1]
3. 历史信息存储与隐私泄露 FedEraser、FedKDU、FedRecovery 等历史回放类方法需要保存客户端历史更新。历史更新有助于快速回滚,但也可能被服务器或攻击者用于梯度反演、成员推理或属性推断。Starfish、FedRecovery 等方法尝试用差分隐私、安全计算或认证边界缓解该风险。[1:3][2:1][3:2][21]
4. 目标数据不可访问 合规场景中,数据删除请求可能意味着目标数据不能再被用于任何后续训练。许多梯度上升和知识蒸馏方法假设目标客户端仍能本地计算遗忘梯度,这在严格合规环境下可能受限。PAR、Zero-shot FU、FedCARE 等生成式或数据自由方法试图解决这一问题。[12:2][14:1][22]
5. 遗忘后继续训练的“再学习”问题 遗忘不是一次性终点。模型遗忘后通常还要继续参与联邦训练以恢复效用,但恢复训练可能把目标知识重新学回来。FedOSD 的后训练梯度投影、FedCARE 的 relearning-resistant recovery、FedRazor 的恢复阶段方向裁剪都说明该问题正在成为新焦点。[4:3][12:3][13:2]
6. 可验证性与公平性不足 多数工作依赖经验指标证明遗忘有效,但监管和审计更需要可验证保证。此外,连续遗忘请求可能让部分保留客户端承担更多性能损失,FedShard、FUPareto、FedCCCU 等工作开始关注遗忘公平性。[23][21:1][5:3][6:3]
近似遗忘的技术分类体系
根据遗忘时使用的信息、优化目标和模型修正方式,近五年联邦近似遗忘可归纳为以下五类。
| 技术范式 | 核心思想 | 代表方法 | 优点 | 局限 |
|---|---|---|---|---|
| 基于历史信息回放的遗忘 | 训练阶段保存客户端更新,遗忘时扣除目标更新或重放保留更新 | FedEraser, FedKDU, FedRecovery, Fast-FedUL, Starfish | 接近重训练轨迹,遗忘速度快 | 高存储;历史更新泄露风险;动态客户端困难 |
| 基于优化的梯度导向遗忘 | 在目标数据上最大化损失,或沿受约束方向削弱目标贡献 | FUPGA, SFU, FedOSD, FUGAS, FUPareto, FunCF, FedCARE, FedRazor | 无需完整重训;可低存储;适合深度模型 | 梯度爆炸、效用下降、再学习和超参数敏感 |
| 基于知识蒸馏的模型修正遗忘 | 用教师模型、虚拟教师或软标签恢复保留知识并削弱目标知识 | FedKDU, FRU, FedQUIT, FedAF, SeFUL | 有利于效用恢复;可在端侧执行 | 教师质量关键;可能蒸馏目标残留 |
| 基于表示/结构变换的细粒度遗忘 | 从通道、特征、表示流形、辅助头或适配器层面删除目标知识 | Class-Discriminative Pruning, Ferrari, FUCRT, FedDAM, FeaUn, REMISVFU | 支持类别/特征/垂直联邦等细粒度目标 | 任务和架构依赖较强 |
| 可验证、公平与场景增强遗忘 | 将隐私、安全、审计、公平、多客户端连续遗忘纳入设计 | VeriFi, Starfish, FedShard, FedCCCU, Lethe | 更贴近真实部署 | 系统复杂度高,基准尚未统一 |
从时间脉络看,2021—2022 年的研究以历史更新回放和初步梯度上升为主;2023—2024 年开始关注差分隐私、推荐系统、子空间约束、特征级遗忘和训练自由遗忘;2025—2026 年的重点则转向冲突感知优化、主动遗忘、帕累托多目标、灾难性遗忘利用、垂直联邦遗忘和公平可验证机制。
主流近似遗忘技术范式与代表性工作
基于历史信息回放的遗忘
基于历史信息回放的方法将联邦训练看作一条由客户端更新组成的轨迹。若服务器能够保存训练过程中的模型检查点、客户端梯度或参数差分,那么遗忘目标客户端时,可以跳过该客户端更新、扣除其累积贡献,或重构只包含保留客户端的训练轨迹。这类方法最接近“近似重训”,是联邦遗忘早期研究的主线。
FedEraser
FedEraser 是联邦遗忘领域的开创性工作之一。其基本思想是:服务器在原始 FL 训练过程中保存各轮客户端本地更新;当某个客户端提出遗忘请求后,服务器不重新调度所有客户端从头训练,而是使用已保存的保留客户端历史更新重放训练过程,同时跳过目标客户端的所有贡献。[1:4]
具体流程如下。首先,在训练阶段,服务器记录每轮参与客户端上传的参数更新 $\Delta_i^t$ 或本地模型。其次,在遗忘阶段,服务器从初始模型或早期检查点出发,按时间顺序重新聚合非目标客户端更新。由于原训练轨迹中每轮全局模型已经受到目标客户端影响,简单跳过目标更新会产生轨迹偏差,因此 FedEraser 引入更新校准,对保留客户端历史更新进行方向或幅度修正,使重放后的模型更接近排除目标客户端后的重训练模型。最后,系统可执行少量恢复训练以提升保留数据性能。
FedEraser 的优点是直观、高效,能够显著缩短遗忘时间,并为后续大量工作提供“历史更新回放”基线。其不足也很典型:服务器需要保存大量历史更新,存储成本随客户端数量、模型规模和通信轮次线性增长;历史梯度可能泄露隐私;当客户端选择是随机的、数据分布强 non-IID 或训练环境发生变化时,历史回放轨迹与真实重训练轨迹之间的误差会扩大。
FedKDU
Federated Unlearning with Knowledge Distillation(FedKDU)在历史更新扣除的基础上加入知识蒸馏恢复。它将遗忘分为两个阶段:第一阶段估计目标客户端在历史训练中的累计贡献,并从当前全局模型中扣除;第二阶段用教师模型的软标签引导遗忘后模型恢复保留知识。[2:2]
该方法的关键在于,它承认“扣除更新”本身会破坏模型决策边界。目标客户端更新不是独立叠加项,而是在多轮 FedAvg 中与其他客户端更新相互耦合。因此,直接减去目标贡献后,模型可能在保留数据上出现明显性能下降。知识蒸馏的作用是让被修正后的学生模型重新学习原模型或代理教师中的通用知识,同时尽量不恢复目标客户端的特定记忆。
FedKDU 的优势是把历史更新法和模型修正法结合起来,比纯回放更注重效用恢复。局限在于它仍依赖历史记录,并且教师模型若含有目标客户端知识,蒸馏过程可能把一部分目标信息重新传回学生模型。
FedRecovery
FedRecovery 关注历史梯度回滚中的隐私保护问题。它通过记录或估计客户端历史梯度,计算目标客户端对全局模型的累积影响,并在遗忘阶段移除该影响。与 FedEraser 不同的是,FedRecovery 明确引入差分隐私机制,希望遗忘后模型在统计意义上降低目标客户端成员信息泄露。[3:3]
FedRecovery 的主要机制包括:一是根据历史梯度构建目标客户端影响估计;二是执行梯度或参数校正以消除目标影响;三是在校正和恢复过程中加入差分隐私噪声,限制单个客户端对输出模型的可识别贡献。差分隐私使方法具备更强隐私解释力,但也带来不可避免的效用损失。若隐私预算设置过严,模型准确率下降;若预算过松,隐私保证有限。
Fast-FedUL 与 Starfish
Fast-FedUL 进一步追求 training-free 遗忘。它试图分析目标客户端在每一轮 FedAvg 中对最终模型的跨轮影响传播,并从最终模型中系统性移除该影响,而不再执行额外训练。该方法具有极高效率,并给出遗忘模型与重训练模型之间的理论界。它的问题是对训练动态的近似质量要求较高,尤其在强 non-IID、部分参与和学习率变化场景中需要谨慎评估。[24]
Starfish 则从隐私和认证角度增强历史类方法。它指出保存历史梯度本身会制造隐私攻击面,因此利用两个非合谋服务器和安全双方计算拆分存储历史信息,并给出认证客户端移除的理论边界。Starfish 的意义不是替代 FedEraser,而是说明“为了遗忘而存储历史信息”必须与安全计算、差分隐私或审计机制结合。[21:2]
基于历史信息回放方法的综合评述
历史信息回放类方法的优势是最容易解释:它们近似模拟“没有目标客户端参与的训练轨迹”,因此在客户端级遗忘中具有天然吸引力。它们也适合作为其他近似方法的评估基线。然而,随着模型规模增大和训练轮次增加,高存储和隐私泄露风险会迅速放大。未来该方向的关键问题是:如何压缩历史更新、如何安全保存历史轨迹、如何在不完整历史信息下仍获得可验证的近似遗忘。
基于优化的梯度导向遗忘
基于优化的方法把遗忘看作一个新的优化问题:在目标数据上削弱模型记忆,同时在保留数据上维持性能。早期方法直接执行梯度上升最大化目标损失;近期方法则强调有界遗忘损失、正交投影、帕累托多目标、曲率自适应和防再学习恢复。
FUPGA / Halimi et al.:受约束梯度上升
Halimi 等人的工作是无历史存储梯度遗忘的早期代表。其核心思想是让待删除客户端在本地执行反学习:给定当前全局模型,目标客户端最大化其本地经验损失,使模型远离目标数据。为了防止普通梯度上升造成参数爆炸,方法将更新限制在参考模型附近的 $\ell_2$ 球内,通过投影梯度上升获得局部遗忘模型。随后,服务器可让保留客户端执行少量联邦训练以恢复效用。[20:1]
该方法的优点是不需要服务器保存历史更新,计算主要发生在目标客户端本地,隐私和存储压力较低。但它依赖目标客户端在线并诚实执行遗忘;同时,目标数据与保留数据共享特征时,最大化目标损失很容易破坏保留类别边界。
SFU:子空间约束的联邦遗忘
Subspace-based Federated Unlearning(SFU)试图解决梯度上升伤害保留知识的问题。它认为,目标客户端的反向梯度并非所有方向都应被采用,只有那些落在保留数据影响较小子空间中的方向才适合作为遗忘更新。[25]
具体来说,保留客户端本地计算输入梯度或表示矩阵,用于估计保留任务的梯度子空间;目标客户端计算遗忘梯度;服务器将遗忘梯度投影到保留子空间的正交补上,使更新主要沿着对保留数据影响较小的方向移动。SFU 也可结合差分隐私保护保留客户端上传的表示矩阵。
SFU 的意义在于较早把“保留知识子空间”纳入联邦遗忘优化。它与 FedOSD、FUGAS、FedCARE 等方法共同说明,近似遗忘不能只看目标损失,还必须显式考虑保留分布的梯度结构。
FedOSD:基于正交最速下降的联邦遗忘
FedOSD(Federated Unlearning with Gradient Descent and Conflict Mitigation)是近期优化型联邦遗忘的代表性工作。它针对传统梯度上升的两个痛点提出改进:其一,普通交叉熵损失最大化可能无界,导致梯度爆炸;其二,遗忘梯度可能与保留客户端梯度冲突,造成模型效用急剧下降。[4:4]
FedOSD 的第一项设计是 Unlearning Cross-Entropy(UCE)。与直接最大化标准交叉熵不同,UCE 采用有界形式降低模型对目标真实标签的置信度,使目标损失不会无限增大。这样做的直观效果是:模型被鼓励“不要再自信地预测目标标签”,但不会被推向数值不稳定区域。
第二项设计是 Orthogonal Steepest Descent(OSD)。FedOSD 不直接沿目标客户端遗忘梯度更新,而是把更新方向写成约束优化问题:在最大化遗忘效果的同时,要求该方向尽量与保留客户端梯度正交或不冲突。换言之,算法会从目标遗忘梯度中剔除伤害保留客户端的分量,保留对目标数据有效、对保留数据相对安全的方向。
第三项设计是 后训练阶段梯度投影。遗忘完成后,为恢复保留数据精度,系统通常会继续进行联邦训练。但普通恢复训练可能让模型重新靠近遗忘前状态,导致目标知识回流。FedOSD 在恢复阶段继续对梯度方向施加约束,减少模型“再学习”已遗忘信息的可能。
FedOSD 的贡献在于把联邦遗忘从粗暴梯度上升推进到稳定、冲突感知的优化框架。它特别适合 non-IID 场景,因为 non-IID 下不同客户端梯度冲突更严重。其局限是需要收集或估计保留客户端梯度,投影计算和通信开销不可忽略;当参与保留客户端不能代表整体保留分布时,正交方向也可能偏差。
FUGAS:基于梯度屏蔽的联邦遗忘
FUGAS(Federated Unlearning with Gradient Shielding)与 FedOSD 同属梯度冲突缓解路线,但它从“偏好优化”和“梯度屏蔽”角度重新设计遗忘过程。需要注意的是,该工作目前为 OpenReview 上的 withdrawn submission,因此在正式论文中应谨慎引用,可作为近期研究思路而非稳定结论。[9:2]
FUGAS 的第一部分是 偏好优化式遗忘目标。传统梯度上升通常最大化目标数据真实标签损失,而 FUGAS 更关注模型是否继续偏好遗忘前的输出。它将原模型在目标数据上的预测视为待抑制的参考偏好,优化目标鼓励遗忘模型偏离这些旧预测。这样做的好处是,遗忘不是简单地把目标样本推向随机错误,而是让模型摆脱对目标客户端历史贡献的依赖。
第二部分是 Gradient Shielding(梯度屏蔽)。服务器利用保留客户端梯度估计一个动态兼容子空间,再将遗忘梯度投影到该子空间中或剔除与保留梯度冲突的分量。屏蔽机制相当于给遗忘更新加了一层保护罩:目标客户端相关记忆被削弱,但保留客户端已有知识尽量不被破坏。
FUGAS 与 FedOSD 的相同点是都把梯度冲突作为核心问题;不同点在于 FedOSD 强调有界 UCE、正交最速下降和后训练防回退,FUGAS 则强调偏好式损失和更灵活的梯度屏蔽。若后续有正式发表版本,该方向值得与 FedOSD、SFU、FedCARE 共同比较。
FUPareto:基于帕累托增强优化的联邦遗忘
FUPareto 将联邦遗忘明确表述为多目标优化问题。它认为遗忘有效性、保留效用、成员推理风险和多客户端公平性之间不存在单一最优解,合理目标应是寻找帕累托改进方向:在增强遗忘的同时尽量不损害其他目标。[10:2]
FUPareto 的核心由三部分组成。
Minimum Boundary Shift(MBS)损失。普通梯度上升会过度扰动目标样本周围的决策边界,导致保留数据性能下降。MBS 损失只要求目标类别 logit 被压到最高非目标类别 logit 以下,从而实现“最小必要边界移动”。它的直观含义是:模型不再把目标样本判为原类别即可,不必把整个表示空间推得很远。
Pareto Improvement。遗忘更新需要同时考虑遗忘目标和保留目标。FUPareto 寻找能带来帕累托改进的方向,即至少改善一个目标且不显著恶化其他目标。相比单一损失加权,帕累托优化更适合处理不同客户端、不同评估指标之间的冲突。
Pareto Expansion 与 Null-Space Projected MGDA。当多个客户端同时请求遗忘时,不同遗忘目标之间也可能冲突。FUPareto 使用空空间投影的多梯度下降算法,在多个目标客户端之间寻找公平且稳定的更新方向,缓解“某些客户端遗忘充分、某些客户端遗忘不足”的问题。
FUPareto 的贡献在于把 FU 的核心矛盾从“遗忘—效用”二元权衡扩展为“遗忘—效用—隐私—公平”的多目标权衡。它非常适合讨论多客户端同时遗忘、强 non-IID 和公平性场景。局限是优化复杂度较高,实际部署需要控制梯度收集、MGDA 求解和超参数选择成本。
FunCF:基于灾难性遗忘的联邦遗忘
FunCF(Enhancing Federated Unlearning Using Catastrophic Forgetting in Heterogeneous Industrial Internet of Things)面向异构工业物联网(IIoT)场景,提出一个与传统持续学习相反的观点:灾难性遗忘通常被视为需要避免的问题,但在联邦遗忘中可以被利用为工具。[11:1]
IIoT 中的客户端往往是传感器、边缘设备或工业控制节点,数据分布高度异构,设备资源有限,且对响应延迟敏感。直接梯度上升可能导致模型漂移,使保留设备上的检测或分类性能下降。FunCF 通过曲率自适应更新来利用灾难性遗忘,同时避免过度破坏全局模型。
其关键机制是用梯度二阶矩近似 Hessian 对角线:
$$ v_t=\beta v_{t-1}+(1-\beta)g_t^2. $$
这里 $v_t$ 反映每个参数方向的历史梯度强度和局部曲率。对于曲率大的方向,FunCF 使用较小学习率,以避免遗忘更新造成震荡;对于曲率小的方向,使用较大学习率,加速遗忘收敛:
$$ \eta_i=\frac{\eta_0}{\sqrt{v_i+\epsilon}}. $$
这种机制可以理解为“精细雕刻参数空间”:不是对所有参数执行同等强度的反学习,而是根据参数敏感性自适应调整。FunCF 还给出非凸场景下的收敛分析,并在工业数据集上验证其在遗忘效果和泛化能力之间的平衡。
FunCF 的独特价值在于把灾难性遗忘、曲率近似和工业异构联邦学习结合起来。它提醒研究者:联邦遗忘不一定只能通过删除、扣除或反向梯度实现,也可以利用模型训练本身的自然遗忘趋势。其局限是方法设计与 IIoT 异构场景联系较紧,曲率估计质量和超参数对效果有较大影响。
FedCARE 与 FedRazor:冲突感知恢复与防再学习
FedCARE 总结了近期近似遗忘的两个核心痛点:遗忘时目标梯度与保留知识纠缠,恢复时模型可能重新学回目标知识。它提出数据自由伪样本生成、冲突感知投影梯度上升和防再学习恢复三部分机制,可支持客户端级、实例级和类别级遗忘。[12:4]
FedRazor 则采用两阶段框架。第一阶段使用 Divergence-Smoothing Loss 降低目标样本原标签置信度,用 Feature Mean Divergence 将目标表示推离保留特征中心,并通过 PCGrad Razor 裁剪与保留梯度冲突的分量。第二阶段在恢复训练中识别遗忘位移方向,去除过度对齐该方向的保留梯度,从而减少目标知识回流。[13:3]
这两项工作说明,优化型联邦遗忘正在从“如何执行一次遗忘”转向“如何让遗忘长期保持”。
基于优化方法的综合评述
优化型方法是当前近似联邦遗忘最活跃的方向。其最大优势是无需保存完整历史更新,适合深度模型和动态客户端系统。FedOSD、FUGAS、FUPareto 和 FunCF 分别代表了四种关键思路:FedOSD 用有界损失和正交方向解决梯度爆炸与冲突;FUGAS 用偏好优化和梯度屏蔽增强遗忘稳定性;FUPareto 用帕累托多目标框架处理遗忘、效用、隐私和公平;FunCF 利用灾难性遗忘和曲率自适应机制面向 IIoT 异构场景。未来优化型方法的关键,是降低梯度收集成本、提高防再学习能力,并建立更严格的理论保证。
基于知识蒸馏的模型修正遗忘
知识蒸馏类方法把遗忘后模型视为学生模型,通过教师模型、虚拟教师或软标签分布,引导学生保留有用知识并削弱目标知识。与梯度上升相比,蒸馏方法通常更关注“效用恢复”,适合遗忘后模型性能下降明显的场景。该方向也受到联邦持续学习蒸馏和通信高效蒸馏研究的影响。[26][27]
FRU:联邦推荐遗忘
FRU(Federated Unlearning for On-Device Recommendation)是面向端侧推荐系统的联邦遗忘方法。推荐场景中的用户行为序列、点击记录、评分数据具有高度隐私性,而且推荐模型通常高度个性化,完整重训代价很高。[7:1]
FRU 借鉴数据库日志回滚思想,在训练过程中保存关键本地更新。当用户请求删除时,系统通过更新修订移除目标用户贡献,再利用推荐系统中的用户—物品交互结构恢复模型效用。相比通用分类任务,推荐遗忘的评估不能只看准确率,还要看 Recall@K、NDCG@K、Hit Ratio 等排序指标。
FRU 的价值在于把联邦遗忘从图像分类扩展到推荐系统,说明不同应用场景需要不同遗忘粒度和评估标准。其局限是方法机制与推荐任务耦合较强,不一定直接适用于通用分类或检测任务。
SeFUL:选择性联邦遗忘
SeFUL 关注客户端数据异构环境下的选择性遗忘。它首先根据客户端数据分布或表示特征进行聚类,使相似客户端处于同一簇;遗忘时通过信息论约束和特征空间调整,将待遗忘数据表示推离原类别中心,同时拉近保留数据表示。[28]
SeFUL 的思想类似一种自蒸馏或表示级蒸馏:模型不是简单破坏目标样本预测,而是在特征空间中重塑目标与保留数据的关系。它适合智能无线网络等客户端分布差异明显的环境,但需要较好的聚类和表示估计。
FedQUIT:设备端联邦遗忘
FedQUIT 是一种无需历史更新、无需公共代理数据的端侧遗忘方法。它构造“准胜任虚拟教师”(Quasi-Competent Virtual Teacher),在目标客户端本地引导学生模型遗忘。[8:1]
FedQUIT 的关键观点是:遗忘后模型不应在目标数据上表现得完全随机。重训练模型虽然没有见过目标客户端数据,但仍可能基于通用特征做出合理预测。因此,虚拟教师不能是完全随机教师,而应在降低目标真实标签置信度的同时保留基本语义判断能力。
流程上,目标客户端下载当前全局模型,以其为基础修改软标签分布,降低真实类别概率或调整目标输出;学生模型通过 KL 散度等蒸馏损失拟合修改后的教师输出,从而实现本地遗忘。FedQUIT 的优势是无需保存历史、无需代理数据,适合端侧部署;缺点是虚拟教师设计决定了遗忘强度和效用保持之间的平衡。
FedAF:基于主动遗忘的联邦遗忘
FedAF / Class-wise Federated Unlearning via Active Forgetting 受神经科学主动遗忘机制启发,提出“用新记忆覆盖旧记忆”。它尤其适合类别级和样本级细粒度遗忘。[29]
FedAF 包含两个核心模块。第一是 Memory Generator,用于生成“无知识但易学习”的新记忆。典型做法是用教师—学生机制为目标数据构造虚假标签或冲突标签,使这些新记忆与原有类别关联相矛盾。第二是 Knowledge Preserver,通过改进的 Elastic Weight Consolidation(EWC)保护对保留知识重要的参数,避免在覆盖目标知识时发生不必要的全局灾难性遗忘。
FedAF 的创新点在于,它不再试图精确估计目标数据贡献,而是主动引入冲突记忆来覆盖原有记忆。它与 FunCF 都把“遗忘”视为可被利用的学习现象,但 FedAF 更偏向仿生和教师—学生生成,FunCF 更偏向曲率自适应优化。
基于知识蒸馏方法的综合评述
知识蒸馏方法的最大优势是效用恢复能力强。它们通过软标签、虚拟教师或主动生成的新记忆,使遗忘后模型不至于完全丧失通用知识。缺点是教师模型可能残留目标信息,蒸馏数据或代理数据可能带来额外隐私风险。未来该方向可与数据自由生成、参数高效微调和可验证遗忘结合,形成更适合大模型和端侧系统的轻量遗忘框架。
基于表示、结构与生成式扰动的细粒度遗忘
除客户端级遗忘外,真实系统还可能要求删除某个类别、某些样本、某个敏感特征、某个后门触发器或垂直联邦中的某一特征方贡献。此时,仅从客户端维度扣除更新是不够的,需要在通道、表示、特征和模型结构层面进行细粒度修正。
Class-Discriminative Pruning:类别判别剪枝
该方法面向类别级遗忘,认为 CNN 不同通道对不同类别具有不同判别贡献。客户端本地统计各通道在不同类别上的激活,服务器聚合后使用类似 TF-IDF 的评分识别目标类别专属通道,并剪除这些通道。随后,保留客户端进行少量微调恢复非目标类别性能。[30]
该方法直观、细粒度,适合图像 CNN。局限是对模型结构依赖较强,对 Transformer、推荐模型或表格模型不一定适用;如果目标类别与保留类别共享大量底层特征,剪枝也可能损害保留效用。
Ferrari:特征敏感度优化
Ferrari 研究特征级遗忘,例如删除敏感属性、后门触发特征或偏置特征。其核心是特征敏感度:若模型输出对某个目标特征扰动高度敏感,说明该特征仍被模型利用。Ferrari 基于 Lipschitz 连续性度量模型对目标特征的敏感程度,并让请求客户端本地优化模型以降低该敏感度。[31]
Ferrari 的优势是遗忘对象不再局限于客户端或样本,而可以是跨样本存在的敏感特征。这对公平性、后门防御和属性隐私具有重要意义。其挑战在于如何准确定义目标特征,以及如何避免删除敏感特征时破坏与其相关的有用特征。
FUCRT:类别感知表示变换
FUCRT(Forgetting Through Transforming)提出,理想遗忘并不一定意味着目标样本输出随机化。对于类别级遗忘,重训练模型可能会把目标类样本映射到语义相近的保留类别附近。因此,FUCRT 不是破坏目标表示,而是学习将目标数据表示变换到合适的保留类别区域。[32]
FUCRT 包括三步:Transformation Class Identification 选择语义相近的转换类别;Targeted Transformation Learning 学习目标表示到转换类别表示的映射;Cross-Class Fusion 融合不同客户端上的跨类别变换,缓解 non-IID 下局部偏差。该方法与 FedQUIT 的“准胜任教师”观点相似,都认为遗忘后模型不应简单胡乱预测,而应保持合理语义。
PAR 与 Zero-shot FU:无目标数据的生成式遗忘
PAR(Perturb and Restore)面向类别级 zero-shot 遗忘,假设目标类别真实数据不可访问。服务器通过生成器构造 dummy anti-samples,用这些反样本扰动模型对目标类别的记忆,然后利用保留数据恢复非目标性能。[14:2]
Zero-shot Federated Unlearning 则更广泛地探索从数据依赖方法转向模型中心方法:在目标数据不可访问时,通过模型反演、伪样本、类别原型或个性化模型中心信息估计目标知识,再执行遗忘更新。这类方法更符合严格删除场景,但其效果高度依赖生成样本是否覆盖真实目标分布。[22:1]
FedDAM 与 Lethe:参数高效遗忘
FedDAM 冻结主干网络和主分类器,只更新轻量辅助头,并为 retain 与 forget 目标维护双非对称动量。遗忘过程只通信辅助头参数,因此非常适合边缘设备固定预算场景。[33]
Lethe 则采用 adapter-augmented dual-stream update 思路,用适配器或轻量模块承载遗忘更新和持久擦除逻辑。它代表了联邦大模型遗忘的一个趋势:未来未必每次都修改全模型,而是通过 adapter、LoRA、prompt 或辅助头进行参数高效遗忘。[34]
垂直联邦遗忘:VFU、FeaUn 与 REMISVFU
多数联邦遗忘工作默认横向 FL,即客户端样本不同但特征空间相同。垂直联邦学习(VFL)中,各方拥有同一批样本的不同特征,遗忘对象可能是某一特征方、某些敏感特征或中间表示。
Vertical Federated Unlearning on Logistic Regression 针对垂直联邦逻辑回归,利用中间参数和梯度关系删除目标参与方贡献。FeaUn 面向 IIoT 中的 VFL 特征推理攻击,通过构造敏感特征扰动数据集估计敏感特征影响,再用一阶更新删除该影响。REMISVFU 在 splitVFL 中提出表示误导:遗忘方把编码器输出塌缩到随机锚点,服务器联合优化保留损失和遗忘损失,并用正交投影减少对保留方效用的破坏。[15:1][35][36]
这些方法表明,垂直联邦遗忘必须关注中间表示、特征隐私和跨方协作结构,不能简单套用横向客户端遗忘算法。
表示与结构方法的综合评述
表示/结构类方法使联邦遗忘从客户端级扩展到类别级、特征级、样本级和垂直联邦场景。它们通常更细粒度,也更贴近实际需求。但这类方法往往依赖任务结构、模型架构或特征定义。未来应探索统一表示空间中的遗忘理论,并将这些方法与梯度投影、蒸馏和参数高效微调结合。
可验证、公平与安全增强的联邦遗忘
VeriFi 与认证遗忘
VeriFi 较早强调,联邦遗忘不仅要执行删除,还要能验证删除是否有效。它将遗忘机制和验证指标结合,为后续审计型 FU 提供思路。认证遗忘的目标是向用户、平台或监管者证明:目标数据对模型输出的影响已经低于可接受阈值。
FedShard 与公平性
FedShard 关注遗忘公平性。传统 FU 常报告平均准确率和平均遗忘时间,但在多客户端系统中,遗忘请求可能不公平地损害某些保留客户端。FedShard 提出效率公平和性能公平指标,并设计兼顾收敛、效率和公平性的遗忘机制。FUPareto 和 FedCCCU 也从多目标优化和跨客户端约束角度关注类似问题。[10:3][16:1][37]
投毒攻击与鲁棒遗忘
联邦遗忘机制本身可能成为攻击面。恶意客户端可以提交特殊数据后请求遗忘,掩盖投毒痕迹;也可以反复发起遗忘请求造成模型退化或服务拒绝。BadUnlearn 等研究表明,联邦遗忘需要与鲁棒聚合、异常检测、访问控制和审计日志结合,否则“遗忘接口”可能被滥用。
安全增强方法的综合评述
可验证、公平和安全增强方法说明,联邦遗忘正在从算法问题走向系统治理问题。仅有高准确率和低目标性能不足以支撑真实部署;未来需要形成包括合规证明、攻击防御、公平约束和长期审计在内的完整框架。
评估标准、基准数据集与实验分析
核心评估维度
遗忘有效性 常用指标包括目标客户端/目标样本准确率、目标损失、目标类别召回率、后门攻击成功率(ASR)、成员推理攻击成功率(MIA)和遗忘模型与重训练模型的输出距离。需要注意的是,目标准确率并非越低越好;理想情况是接近重训练模型行为,而不是让模型对所有相关输入都崩坏。
模型效用保持 对分类任务,常用保留测试准确率、macro-F1、balanced accuracy;对推荐系统,常用 Recall@K、NDCG@K、Hit Ratio;对后门清除任务,需要同时报告 clean accuracy 和 ASR;对 VFL/IIoT,可能需要报告检测精度、延迟、特征推理攻击成功率。
效率 应比较完整重训、原始模型、遗忘模型之间的通信轮次、客户端本地 epoch、服务器计算量、目标客户端是否必须在线、是否需要全体保留客户端参与、是否保存历史更新或检查点。
隐私与安全 成员推理、属性推理、梯度反演和后门触发是常见隐私/安全评估。对于历史更新类方法,还应评估保存历史信息本身带来的泄露风险。
公平性与长期稳定性 在多客户端系统中,平均性能可能掩盖个别客户端损失。未来评估应加入客户端级性能分布、最差客户端性能、多轮连续删除、遗忘后继续训练和恶意遗忘请求。
常用基准数据集与模型
图像分类 MNIST、Fashion-MNIST、CIFAR-10、CIFAR-100、SVHN 是最常用数据集。模型通常包括 LeNet、CNN、ResNet-18、VGG 或轻量卷积网络。
自然语言处理 Shakespeare、Stack Overflow 等常用于联邦语言建模或文本分类,但相比图像任务,NLP 场景的联邦遗忘基准仍较少。
推荐系统 MovieLens-100K、MovieLens-1M、Amazon Reviews 等可用于 FRU 类推荐遗忘,评价指标以排序质量为主。
工业物联网 FunCF、FeaUn 等工作使用工业传感器、异常检测或 IIoT 数据集,强调设备异构、实时性和边缘资源限制。
数据划分 IID 划分常作为基础对照,non-IID 划分更接近真实 FL。常见 non-IID 设置包括 pathological label split、Dirichlet 分布划分、客户端类别不均衡、样本数量不均衡和特征分布偏移。
代表性方法综合对比
| 方法 | 年份 | 主要范式 | 遗忘粒度 | 是否依赖历史更新 | 核心机制 | 适用场景 |
|---|---|---|---|---|---|---|
| FedEraser | 2021 | 历史回放 | 客户端 | 是 | 历史更新回放与校准 | 客户端级删除 |
| FedKDU | 2022 | 历史 + 蒸馏 | 客户端 | 是 | 累积更新扣除 + KD | 通用 FL |
| FUPGA | 2022 | 优化 | 客户端 | 否 | 受约束梯度上升 | 目标客户端在线 |
| Class-Discriminative Pruning | 2022 | 结构 | 类别 | 否 | TF-IDF 通道剪枝 | CNN 图像分类 |
| FedRecovery | 2023 | 历史 + 隐私 | 客户端 | 是 | 梯度移除 + DP | 隐私增强 FU |
| FRU | 2023 | 历史 + 蒸馏 | 用户/推荐 | 部分 | 日志回滚 + 恢复 | 端侧推荐 |
| SFU | 2023/2025 | 优化 | 客户端 | 否 | 子空间投影梯度上升 | non-IID FL |
| FedQUIT | 2024 | 蒸馏 | 客户端 | 否 | 准胜任虚拟教师 | 端侧遗忘 |
| Fast-FedUL | 2024 | 历史/影响 | 客户端 | 轻量 | training-free 影响移除 | 高效率删除 |
| Ferrari | 2024 | 表示/特征 | 特征 | 否 | 特征敏感度最小化 | 敏感属性/后门 |
| FedOSD | 2025 | 优化 | 客户端 | 否 | UCE + OSD + 防回退 | 梯度冲突场景 |
| FedAF | 2025 | 主动遗忘 | 类别/样本 | 否 | 新记忆覆盖 + EWC | 细粒度遗忘 |
| FUCRT | 2025 | 表示变换 | 类别 | 否 | 类别感知表示变换 | 类别撤销 |
| FedTune[38] | 2025 | 参数调节 | 客户端/样本 | 部分 | Fisher 重要性调节 | 快速参数遗忘 |
| FUGAS | 2025/2026 | 优化 | 客户端 | 否 | 偏好损失 + 梯度屏蔽 | 梯度冲突缓解 |
| FUPareto | 2026 | 优化/公平 | 多客户端 | 否 | MBS + Pareto + MGDA | 多目标遗忘 |
| FunCF | 2026 | 优化/灾难性遗忘 | IIoT 设备 | 否 | Hessian 近似 + 自适应学习率 | 工业物联网 |
| FedCARE | 2026 | 优化/生成 | 客户端/实例/类别 | 否/少量 | 伪样本 + 冲突投影 + 防再学习 | 统一 FU |
| FedRazor | 2026 | 优化/表示 | 客户端 | 否 | DSL + FMD + PCGrad Razor | 防再学习 |
| PAR | 2026 | 生成式 | 类别 | 否 | 反样本扰动 + 恢复 | zero-shot 类别遗忘 |
| REMISVFU | 2026 | VFL/表示 | 特征方 | 否 | 表示误导 + 正交投影 | 垂直联邦 |
| FedShard | 2026 | 公平增强 | 客户端 | 依设置 | 效率公平 + 性能公平 | 多客户端治理 |
实验观察与洞见
不存在单一最优方法 历史回放类方法在客户端级删除中直观有效,但存储和隐私代价高;优化类方法低存储,但需要精心控制梯度冲突;蒸馏类方法效用恢复好,但教师质量决定上限;生成式方法适合目标数据不可访问,但依赖伪样本质量。
重训练模型应作为关键参照 许多论文只报告目标准确率下降,这是不充分的。更合理的评估是比较遗忘模型与排除目标数据重训练模型在目标数据、保留数据和输出分布上的差异,同时结合模型记忆程度来解释遗忘是否真正发生。[39]
non-IID 是决定性变量 IID 场景下许多方法都能取得不错效果,但强 non-IID 下梯度冲突和公平性问题会明显放大。FedOSD、FUGAS、FUPareto、FunCF、FedShard 等近期工作都直接或间接回应这一问题。
遗忘后恢复阶段非常关键 遗忘操作本身往往会降低模型效用,恢复训练可以弥补损失,但也可能让模型重新学习目标知识。因此,后训练防回退正在成为优化型近似遗忘的重要组成部分。
挑战与未来研究方向
可扩展性与系统级部署
当前多数实验仍集中在中小模型和标准数据集上。真实系统中,客户端数量、模型参数量、通信不稳定性和连续删除请求都会放大成本。未来需要研究低通信、低存储、可并行、支持客户端掉线的遗忘协议,尤其是在边缘网络和资源受限设备中的可部署性。[40]
可验证性与理论保证
近似遗忘目前主要依赖经验评估。未来需要更强的可验证机制,例如认证遗忘界、输出分布等价检验、成员推理风险上界、审计日志和密码学证明。没有可验证性,联邦遗忘很难真正满足合规审计需求。
高级攻击防御与鲁棒性
遗忘接口可能被恶意客户端利用。攻击者可通过投毒后遗忘隐藏痕迹,或反复发起删除请求破坏模型。未来应把 FU 与鲁棒聚合、异常客户端检测、遗忘请求频率控制和安全审计结合。
联邦学习新范式的适应性
联邦遗忘需要适配更多 FL 范式,包括垂直联邦学习、联邦推荐、联邦图学习、联邦持续学习、个性化联邦学习和边缘智能。不同范式下,遗忘对象、可访问数据、通信结构和评估指标都不同。
联邦大模型中的遗忘
随着联邦微调和多模态大模型发展,完整参数遗忘越来越不可行。未来方向包括 LoRA/adapter/prompt 级遗忘、稀疏子网络遗忘、模型编辑与联邦遗忘结合,以及在保留通用能力的同时删除特定用户知识。
数据不可访问与零样本遗忘
严格删除场景中,目标数据可能不能再被访问。如何在没有目标样本的情况下验证和执行遗忘,是未来重点。PAR、Zero-shot FU、FedCARE 等生成式方法提供了早期探索,但伪样本覆盖性和理论保证仍不足。
公平性与长期治理
联邦系统会长期运行并接收连续删除请求。未来应关注遗忘成本如何在客户端间分配、遗忘后模型是否持续稳定、保留客户端最差性能是否下降,以及多客户端同时遗忘时是否公平。
结论
近五年联邦近似遗忘技术经历了从历史更新回放到冲突感知优化、从客户端级删除到类别/特征/垂直联邦细粒度遗忘、从一次性遗忘到长期可验证治理的演进。FedEraser、FedKDU、FedRecovery 奠定了历史信息回放和校准的基础;FUPGA、SFU、FedOSD、FUGAS、FUPareto、FunCF、FedCARE、FedRazor 推动了优化型遗忘的发展;FRU、FedQUIT、FedAF 展示了知识蒸馏和主动遗忘在效用恢复中的价值;Ferrari、FUCRT、PAR、FedDAM、REMISVFU 则拓展了特征、表示、生成式和垂直联邦场景。
总体来看,近似联邦遗忘的核心不再是简单“让目标数据表现变差”,而是如何在遗忘有效性、保留效用、隐私安全、通信效率和公平性之间取得可验证的平衡。未来更有前景的方向,是将生成式数据自由遗忘、梯度冲突投影、帕累托多目标优化、参数高效微调和可验证审计结合起来,形成可部署、可解释、可持续运行的联邦遗忘系统。
参考文献
Gaoyang Liu, Xiaoqiang Ma, Yang Yang, Chen Wang, Jiangchuan Liu. FedEraser: Enabling Efficient Client-Level Data Removal from Federated Learning Models. IWQoS 2021. DOI: 10.1109/IWQOS52092.2021.9521274. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
Chen Wu, Sencun Zhu, Prasenjit Mitra. Federated Unlearning with Knowledge Distillation. arXiv:2201.09441, 2022. ↩︎ ↩︎ ↩︎
Lefeng Zhang, Tianqing Zhu, Haibin Zhang, Ping Xiong, Wanlei Zhou. FedRecovery: Differentially Private Machine Unlearning for Federated Learning Frameworks. IEEE Transactions on Information Forensics and Security 18, 2023. ↩︎ ↩︎ ↩︎ ↩︎
Zibin Pan, Zhichao Wang, Chi Li, Kaiyan Zheng, Boqi Wang, Xiaoying Tang, Junhua Zhao. Federated Unlearning with Gradient Descent and Conflict Mitigation. AAAI 2025. DOI: 10.1609/aaai.v39i19.34181. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
Nicolo Romandini, Alessio Mora, Carlo Mazzocca, et al. Federated Unlearning: A Survey on Methods, Design Guidelines, and Evaluation Metrics. IEEE TNNLS 36(7), 2025. ↩︎ ↩︎ ↩︎ ↩︎
Ziyao Liu, Yu Jiang, Jiyuan Shen, Minyi Peng, Kwok-Yan Lam, Xingliang Yuan, Xiaoning Liu. A Survey on Federated Unlearning: Challenges, Methods, and Future Directions. ACM Computing Surveys 57(1), 2025. ↩︎ ↩︎ ↩︎ ↩︎
Wei Yuan, Hongzhi Yin, Fangzhao Wu, Shijie Zhang, Tieke He, Hao Wang. Federated Unlearning for On-Device Recommendation. WSDM 2023. DOI: 10.1145/3539597.3570463. ↩︎ ↩︎
Alessio Mora, Lorenzo Valerio, Paolo Bellavista, Andrea Passarella. FedQUIT: On-Device Federated Unlearning via a Quasi-Competent Virtual Teacher. arXiv:2408.07587, 2024. ↩︎ ↩︎
Siyin Huang, Yufan Liao, Yuelin Du, Yu Zhang. Federated Unlearning with Gradient Shielding. OpenReview ICLR 2026 withdrawn submission. ↩︎ ↩︎ ↩︎
Zeyan Wang, Zhengmao Liu, Yongxin Cai, Chi Li, Xiaoying Tang, Jingchao Chen, Zibin Pan, Jing Qiu. FUPareto: Bridging the Forgetting-Utility Gap in Federated Unlearning via Pareto Augmented Optimization. arXiv:2602.01852, 2026. ↩︎ ↩︎ ↩︎ ↩︎
Zhenguo Ma, Zixuan He, Yanjing Sun, et al. Enhancing Federated Unlearning Using Catastrophic Forgetting in Heterogeneous Industrial Internet of Things. Computer Communications, 2026. DOI: 10.1016/j.comcom.2026.108497. ↩︎ ↩︎
Yue Li, Mingmin Chu, Xilei Yang, Da Xiao, Ziqi Xu, Wei Shao, Qipeng Song, Hui Li. FedCARE: Federated Unlearning with Conflict-Aware Projection and Relearning-Resistant Recovery. arXiv:2601.22589, 2026. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
Yanxin Hu, Xiaoman Liu, Yan Huang, Junjie Pang, Chao Cheng, Gang Liu. FedRazor: Two-Stage Federated Unlearning via Representation Divergence and Gradient Conflict Trimming. Information 17(2), 2026. ↩︎ ↩︎ ↩︎ ↩︎
Ning Pang, Zou Li, Pengcheng Wan, Hongchao Wu, Yuchen Bing, Xiang Zhao. Perturb and Restore: Efficient Category Revocation in Federated Unlearning. Information Fusion 128, 2026. ↩︎ ↩︎ ↩︎
Wenhan Wu, Zhili He, Huanghuang Liang, Yili Gong, Jiawei Jiang, Chuang Hu, Dazhao Cheng. REMISVFU: Vertical Federated Unlearning via Representation Misdirection for Intermediate Output Feature. AAAI 2026. DOI: 10.1609/aaai.v40i32.39911. ↩︎ ↩︎
Siyuan Wen, Meng Zhang, Yang Yang, Ningning Ding. FedShard: Federated Unlearning with Efficiency Fairness and Performance Fairness. AAAI 2026. DOI: 10.1609/aaai.v40i32.39895. ↩︎ ↩︎
Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson, Blaise Aguera y Arcas. Communication-Efficient Learning of Deep Networks from Decentralized Data. AISTATS 2017. ↩︎
Lucas Bourtoule, Varun Chandrasekaran, Christopher A. Choquette-Choo, et al. Machine Unlearning. IEEE Symposium on Security and Privacy, 2021. ↩︎
Yinzhi Cao, Junfeng Yang. Towards Making Systems Forget with Machine Unlearning. IEEE Symposium on Security and Privacy, 2015. ↩︎
Anisa Halimi, Swanand Kadhe, Ambrish Rawat, Nathalie Baracaldo. Federated Unlearning: How to Efficiently Erase a Client in FL? arXiv:2207.05521, 2022. ↩︎ ↩︎
Ziyao Liu, Huanyi Ye, Yu Jiang, Jiyuan Shen, Jiale Guo, Ivan Tjuawinata, Kwok-Yan Lam. Privacy-Preserving Federated Unlearning with Certified Client Removal. arXiv:2404.09724, 2024. ↩︎ ↩︎ ↩︎
Zero-shot Federated Unlearning via Transforming from Data-Dependent to Personalized Model-Centric. IJCAI 2025. ↩︎ ↩︎
Ruinan Jin, Minghui Chen, Qiong Zhang, Xiaoxiao Li. Forgettable Federated Linear Learning with Certified Data Unlearning. arXiv:2306.02216, 2023. ↩︎
Thanh Trung Huynh, Trong Bang Nguyen, Phi Le Nguyen, Thanh Tam Nguyen, Matthias Weidlich, Quoc Viet Hung Nguyen, Karl Aberer. Fast-FedUL: A Training-Free Federated Unlearning with Provable Skew Resilience. ECML PKDD 2024 / arXiv:2405.18040. ↩︎
Guanghao Li, Li Shen, Yan Sun, Yue Hu, Han Hu, Dacheng Tao. Subspace based Federated Unlearning. arXiv:2302.12448; TMLR version, 2025/2026. ↩︎
Yuhang Ma, Zhongle Xie, Jue Wang, Ke Chen, Lidan Shou. Continual Federated Learning Based on Knowledge Distillation. IJCAI 2022. ↩︎
Chuhan Wu, Fangzhao Wu, Lingjuan Lyu, Yongfeng Huang, Xing Xie. Communication-Efficient Federated Learning via Knowledge Distillation. Nature Communications 13, 2022. ↩︎
Yujun Cheng, Weiting Zhang, Tao Zheng, et al. SeFUL: A Selective Federated Unlearning Framework for Client Data Heterogeneity in Intelligent Wireless Networks. IEEE Transactions on Mobile Computing, 2026. ↩︎
Yuyuan Li, Jiaming Zhang, Yixiu Liu, Chaochao Chen. Class-wise Federated Unlearning: Harnessing Active Forgetting with Teacher-Student Memory Generation. Knowledge-Based Systems 316, 2025. DOI: 10.1016/j.knosys.2025.113353. ↩︎
Junxiao Wang, Song Guo, Xin Xie, Heng Qi. Federated Unlearning via Class-Discriminative Pruning. WWW 2022. DOI: 10.1145/3485447.3512222. ↩︎
Hanlin Gu, Win Kent Ong, Chee Seng Chan, Lixin Fan. Ferrari: Federated Feature Unlearning via Optimizing Feature Sensitivity. NeurIPS 2024. ↩︎
Qi Guo, Zhen Tian, Minghao Yao, Saiyu Qi, Yong Qi, Bingyi Liu. Forgetting Through Transforming: Enabling Federated Unlearning via Class-Aware Representation Transformation. ICCV 2025. ↩︎
Dual Asymmetric Momentum Improves Federated Class Unlearning in Edge Systems. Scientific Reports, 2026. ↩︎
Lethe: Adapter-Augmented Dual-Stream Update for Persistent Knowledge Erasure in Federated Unlearning. arXiv:2601.22601, 2026. ↩︎
Zihao Deng, Zhaoyang Han, Chuan Ma, Ming Ding, Long Yuan, Chunpeng Ge, Zhe Liu. Vertical Federated Unlearning on the Logistic Regression Model. Electronics 12(14), 2023. ↩︎
FeaUn: Feature Unlearning in Vertical Federated Learning for IIoT Against Feature Inference Attacks. Neurocomputing 652, 2025. ↩︎
Federated Unlearning in the Wild: Rethinking Fairness and Data Discrepancy. arXiv:2510.07022, 2025. ↩︎
Fengda Zhao, Qianyi Xu, Hao Wang, Dingding Guo. Rapid Federated Unlearning with Tuning Parameters Based on Fisher Information Matrix. Applied Intelligence 55, 2025. ↩︎
Rethinking Federated Unlearning via the Lens of Memorization. arXiv:2605.24545, 2026. ↩︎
Jer Shyuan Ng, Wathsara Daluwatta, Shehan Edirimannage, et al. Federated Unlearning in Edge Networks: A Survey of Fundamentals, Challenges, Practical Applications and Future Directions. arXiv:2601.09978, 2026. ↩︎





