全文转载于《法学论坛》2026年第5期
作者单位:齐英程,法学博士,吉林大学法学院副教授
【摘要】:既有的“结果本位”的匿名化处理规则难以契合数据流通实践的动态性且欠缺可操作性,无法有效平衡个人数据的保护与利用。因应数据流通的动态性,匿名化处理规则应从关注静态处理结果转向对再识别风险的动态把握与过程管控。在前端,通过构建“流通场景依存”的匿名化认定标准体系,明确判定匿名化的主体基准、成本基准、风险阈值基准、数据范围基准与识别形式基准,提升匿名化处理规则的可操作性;同时,通过赋予匿名化处理者覆盖整个数据流通过程的再识别风险评估与控制义务,并引入禁止再识别义务的方式,实现对数据流通过程中再识别风险的动态控制,以此建立起“过程本位”的匿名化处理规则体系,实现匿名化处理规则在大数据时代的更生。
【关键词】:匿名化;匿名数据;过程本位;结果本位;数据流通;再识别
一、问题的提出
当前,大数据已进入从概念到应用的关键转折期,数据流通成为进一步扩大数据共享范围,激发数据要素价值的关键。数据流通即是实现数据社会化利用和实现数据资源价值的必然路径,正是有社会化数据流通和利用,才能形成数据经济。个人数据作为最具价值的数据要素,面临巨大的市场流通需求。此类数据因具有“可识别性”,能够揭示特定自然人的行为特征、内在偏好和价值取向,在流通过程中面临更高安全风险。匿名化提供了平衡个人数据流通与保护的重要制度工具,可被视作数据流通场景下的“避风港规则”。经过匿名化处理的个人数据丧失了识别特定自然人的可能,可以自由安全地进行流转使用。从表面看,这一规则无疑为充满风险与变化的数据流通实践注入了亟需的确定性:数据处理者遵循匿名化要求即可驶入“避风港”,无需再履行繁复的数据保护义务,并时刻担心因数据泄露造成损害。在当前我国数据合规实体标准高度模糊的整体背景下,上述规则对促进数据流通本质具有极为重要的价值。然而,经验事实却呈现与制度预期截然相反的趋势。实践中,数据处理者极少借助匿名化处理免除自身在数据流通过程中负有的数据保护职责,在因个人数据流通引发的纠纷中,亦少见到有企业以匿名化作为“避风港”主张免责。原本用于保护数据处理者的一项制度却对适用者缺乏基本的吸引力,其背后原因何在?上述由实践引发的问题意识成为本文研究的初衷。通过深入挖掘既有匿名化处理规则在数据流通实践中“遇冷”的根源,本文尝试有针对性地对我国匿名化处理规则进行体系化再造,通过构建“流通范围依存”的匿名化认定标准及其判定基准,并引入数据流通场景下的再识别风险评估义务与禁止再识别义务等方式,塑造起一套“过程本位”的匿名化处理规则体系,以此破解“匿名化的迷思”,重新唤醒这一制度的活力。
二、“结果本位”视域下匿名化处理规则的“冷遇”及其成因
(一)实践理性驱动下匿名化处理规则的“冷遇”
匿名化处理规则自诞生起即担负着平衡数据流通与保护的功能期待。近年来,我国个人数据保护制度进入快速建设期。在党中央的大力推动下,各部门陆续出台大量个人数据保护立法文件,迅速搭建起繁复的个人数据保护义务体系。同时,为适度减轻数据处理者在使用数据时负有的义务负担,提升数据流通使用效率,立法特设匿名化处理规则,为数据处理者基于匿名化处理,免除原本受到的规则约束提供可能。数据处理者只要证明经过技术处理的个人数据已经无法识别特定自然人且无法复原,即可免于承担个人数据保护义务,并自由地对匿名数据进行存储、使用和传输。
然而,这一制度并未实现预期初衷。考察既有的数据流通实践不难发现,数据企业鲜少主张其传输使用的个人数据经过处理已转化为匿名数据。天猫网、新浪微博、腾讯微信等网站与APP服务协议与隐私政策中,均未出现“匿名化”“匿名数据”等字眼。相反,诸多互联网企业和数据交易机构均将是否经过“去标识化”作为判定个人数据能否合规流通的重要依据。例如,上海数据交易所的管理规则仅要求数据供方“对涉个人信息的数据进行去标识化处理”,即可进行交易。《深圳市数据交易管理暂行办法》则进一步在正式规则层面规定“危害国家安全、公共利益,侵犯个人、组织合法权益,包括不借助其他数据的情况下可以识别特定自然人的数据,不得作为交易标的。”易言之,只要经过去标识化处理无法直接识别特定自然人的数据,即可在不同主体间进行流通。此外,还有部分企业允许在未经自然人同意的情况下,将经过去标识化的假名数据用于非以再识别为目的的其他用途。例如,《天猫基本功能隐私政策》“收集和使用个人信息的其他规则”部分约定“在经安全加密技术处理严格去标识化且无法重新识别特定个人的前提下,我们会将所收集的数据用于机器学习、算法模型训练或其他数据分析和挖掘处理,以更好地保障我们的产品体验、辅助商业决策分析。”《微博个人信息保护政策》也约定“单独的搜索关键字信息无法识别您的个人身份,其不属于您的个人信息,因此我们有权以其他的目的对其进行使用;只有当您的搜索关键字信息与您的其他信息互有联系并可以结合识别您的个人身份时,我们会将您的搜索关键字信息作为您的个人信息,与您的搜索历史记录一同按照本政策进行处理与保护。”这表明,在数据流通实践中,数据处理者鲜少追求完全的匿名化效果,而倾向于通过适度的去标识化处理并控制重新识别的方式,降低数据安全风险并减轻数据流通使用中的义务负担。此种鸵鸟式做法在一定程度上背离了《个人信息保护法》的要求,并增加了个人数据流通使用的潜在风险。
(二)匿名化处理规则“遇冷”的成因:“结果本位”匿名化处理规则与数据流通实践的适配障碍
数据处理者对匿名化处理规则弃之不用,转而强调去标识化处理的现象具有复杂的形成机理,并体现了当前数据处理行业的“实践理性”。
首先,匿名化认定标准的模糊使得谨慎的数据处理者难以放心将其作为免除责任的“避风港”,由此造就了匿名化处理规则的虚置。我国的匿名化处理规则采取“结果本位”,强调经过匿名化处理所达到的静态效果,即“个人信息经过处理无法识别特定自然人且不能复原”。然而,如何认定“无法识别且不能复原”?应以具备何种知识水平或何种范围的主体来判定特定数据是否无法识别且不能复原?在判定数据可识别性时是否应考虑再识别行为的成本限度?对于上述问题,立法始终未能给出具体标准,折损了匿名化处理规则本应具有的行为指引功能。
立法标准的模糊意味着需要由法院承担认定匿名数据的重任,这对司法机关造成了严峻挑战。法官作为“外行”,往往缺少判定数据可识别性所需的技术背景与场景知识,数据流通实践的高度复杂性与数据再识别技术的快速变化导致其很难凭借个案中有限的信息、时间和精力对数据是否能够被重新识别作出准确判断。在已有的数起围绕特定数据是否达到匿名标准的案件中,法院均表现出在认定数据性质方面的困难,且其裁判逻辑存在明显差异。在认定“不可识别”的主体基准方面,存在“一般理性人标准”“数据处理者标准”“一切主体标准”的分歧。例如,在“余某与北京酷车易美网络科技有限公司隐私权纠纷案”中,余某主张,案涉车辆的行驶数据、维保数据等历史车况信息属于其个人信息,酷车易美公司未经同意,擅自有偿向他人提供,侵犯其个人信息权益及隐私权。酷车易美公司则主张,案涉历史车况数据仅能反映汽车作为物品本身的使用情况,无法识别余某身份,属于匿名数据。该案中,法院采取“一般理性人标准”对案涉数据是否达到“无法识别”的程度进行认定,一方面承认“不可否认,实践中存在通过第三方信息与车况信息结合识别到特定自然人的可能性”,另一方面则认为“一般理性人在实现上述目的时会综合考虑行为成本,酷车易美公司与数据提供方采用脱敏化技术传输数据,降低了一般公众将车况信息与第三方信息结合重新识别特定自然人的可能性,因此,在车辆交易场景下,案涉车况信息与其他信息结合进行关联识别的可能性较低,不能以此认定为个人信息”。而在“朱某与北京百度网讯科技有限公司隐私权纠纷案”中,对于原告朱某在浏览网页时产生的搜索关键词、网络浏览记录等数据是否构成匿名数据,二审法院则采取“数据处理者标准”,认为百度网讯公司“在提供个性化推荐服务中没有且无必要将搜索关键词记录和朱某的个人身份信息联系起来”,因此,其收集的数据属于匿名数据。此外,在“不可识别”的具体形式方面,同样存在“不能直接识别”“不能单独或与其他信息结合以识别到特定自然人”“不能单独或与其他信息结合以识别或关联到特定自然人”等裁判标准的分歧。上述匿名数据认定标准的差异可能导致不同法院针对同一数据的性质作出完全不同的判定,从而进一步削弱匿名化处理规则的确定性,并造就匿名化领域的“合规困境”。
其次,理性的数据处理者已然认识到,绝对的匿名化状态只能是一种美好的想象,无法真正在实践中实现。“结果本位”的匿名化处理规则想要一劳永逸地斩断特定数据与数据主体间的关联,其假定个人数据一旦经过匿名化处理即不再具有任何识别可能。但现实是,“匿名化不是一次性行为,剩余风险总是如影随形地伴随着匿名化数据”。随着数据加总(data aggregation)和再识别技术的不断发展,个人数据与匿名数据间的边界呈现流动状态,经过匿名化处理的数据仍存在被使用和流转的需要。在此过程中,随着可结合数据来源的不断增加以及数据再识别技术的持续进步,现有的匿名化处理措施随时面临被突破的可能。研究表明,已有的匿名化处理技术均存在不可避免的缺陷和失效的风险。当前最常见的两种匿名化处理技术为扰乱技术(randomization)与泛化技术(generalization),前者主要通过在原始数据上加入噪音或对其真值进行扭曲等方式实现数据的匿名化;后者则通过用模糊的一般值替代原始数据或是对原始数据进行概括以实现匿名化。基于上述技术,计算机科学领域目前形成了几种主流的数据匿名化模型,如k-anonymity模型、l-diversity模型等,但每一种模型均无法完全防范数据被再识别的风险。即使将其叠加使用,亦难以达到完全消除可识别性的程度。因此,即使绝对的匿名化状态在目标上是可欲的,其在现有技术层面亦无法达成。
另一方面,实现绝对的匿名化所付成本与可得收益间的不成比例,也使得此种尝试对数据处理者而言并不“划算”。如果对匿名化标准采取严格解释,则此种处理必须达到使数据处理者和任何第三方主体在使用“所有具有合理可能性的方法”后仍无法识别数据主体的程度。这意味着数据处理者必须对所有场景下各种类型的主体可能使用的再识别方法及其可能用于结合的数据等因素作出评估,并时刻随着技术的发展和数据可得性的变化进行调整,否则悬挂在其头顶的“达摩克利斯之剑”随时可能落下。与此同时,经过此种严格匿名化处理的数据却丧失了基本的商业效用。个人数据的价值即在于其内含的关于特定主体的潜在信息,彻底丧失可识别性的数据亦不再具有任何分析价值。正如Paul Ohm所言“个人数据或者是有用的,或者是被完全匿名化的,但绝不可能二者得兼”。对此,无法指望理性的数据处理者以极高的成本换取此种不具有任何市场价值的匿名数据。这也合理地解释了当前“结果本位”的匿名化处理规则备受冷落的行为机理。
三、“过程本位”视域下匿名化认定标准体系的构建
关于数据流通场景下匿名化处理规则“遇冷”的成因分析表明,一项制度的设计必须以事实为依据,而非仅从观念出发,其必须充分考虑适用时的限制性条件、制度执行者的心智能力与客观约束,否则,看似美好的方案必将带来适得其反的后果,而离其原有的目标越来越远。“结果本位”的匿名化处理规则过度强调此种处理的客观效果,追求对再识别风险的彻底根除,忽视了制度适用者的技术能力与行动成本。破解“匿名化迷思”的关键即在于构造起一套“过程本位”的匿名化处理标准:一方面,应避免模糊的表述使规则解释者与适用者无所适从,并为个别处理者随意解释匿名化标准从而逃避履行个人数据保护义务留有余地;另一方面,立法者应当清楚地认识到,匿名化并非数据固有的一种客观状态,而需要结合数据流通实践的具体情况予以动态化、场景化的认定。数据流通实践的动态性决定了匿名化处理规则不应单纯追求静态的匿名化标准设定,而应更多关注对特定场景下数据蕴含的识别能力及安全风险的动态把握,以此判定其是否达到“无法识别且不能复原的”的实际效果。
(一)匿名化处理标准的比较考察
匿名化处理标准如同“普罗透斯的脸”,不同国家基于在平衡个人数据保护与流通利用方面的不同价值立场选择,采取了判然有别的立法标准。但其共同之处在于均对认定匿名化的主体基准、成本基准等作出了较为详细的规定,以提升规则的可操作性。通过提炼各国匿名化处理标准所凝结的共性智慧,并深入思考其差异背后的形成原理,可为我国匿名化处理标准体系的构建提供智识上的支持。
1.欧盟的“穷尽合理识别可能性”标准。所谓的“穷尽合理识别可能性”标准,即在认定匿名数据是否达到“无法识别”的程度时,应穷尽数据控制者以及任何第三人在识别数据主体时可能直接或间接使用的“所有具有合理可能性的方法”。这要求匿名化处理者应考虑到所有可能影响数据再识别风险的因素,包括数据处理的具体目的与方式、有可能被合理地使用以复原匿名数据的方法及其可能发展、进行再识别的成本和可能涉及的知识产权问题,以及数据处理者已采取的组织或技术保护措施被攻破的可能性等,并将再识别技术的发展潜力纳入考量。再识别的形式并不限于准确地得知数据主体的真实身份,而是包括以下任何一种形式:(1)选出(single out),即能够根据该数据从特定群体或种类中将对应的主体辨别出来;(2)联结(linkability),即能够在该数据与数据主体间构建起关联,即使无法知晓该主体的确切身份;(3)推断(inference),即能够从该数据中推断出数据主体的特定属性与特征。只要仍存在上述任何一种可能,该数据即未达到匿名化的程度,仍需被视作个人数据予以保护。
此外,在主体层面,“穷尽合理识别可能性”标准要求匿名数据必须达到使包括匿名化处理者本人在内的任何主体均无法实现再识别的程度,包括基于恶意攻击而获取数据者,因此也有学者将此种标准总结为“一切主体视角”标准。这一主体基准要求匿名化处理者应将所有人均视作潜在的“积极侵权人”,并对其可能采取的技术手段和获取的外部信息等因素作出判定,这实际向匿名化处理者施加了几乎不可能完成的义务负担。同时,第29条工作组明确强调了匿名化处理的场景要素。《关于匿名化技术的意见》中强调,匿名化处理实践应充分考虑场景要素,无论是设计匿名化处理技术方案,还是评估匿名数据的再识别风险,均应立足个案,结合具体场景中原始数据的性质、现有的控制机制和公共资源的可获得性等因素,评估并降低再识别风险。同时,可结合数据本身的性质等因素判断可能的入侵者,并将数据对入侵者的吸引力纳入再识别风险的评估考量。
2.英国的“蓄意入侵者”标准。“穷尽合理识别可能性”标准对匿名化处理者设置了极为严苛的要求,虽有助于在最大程度上保障个人数据权益与数据流通安全,但因在判定数据可识别性方面设置了过于宽泛的标准要求而缺乏可操作性,故而饱受诟病。相比之下,英国信息专员办公室(Information Commissioner's Office,简称ICO)则采取“蓄意入侵者”标准对匿名数据进行认定。根据ICO的官方报告,匿名化处理并不要求达至100%匿名效果,在判定特定数据是否匿名时,无需考虑任何纯粹假设或理论上的识别可能性,关键在于就当下的特定环境而言,识别是否是合理可能的。数据处理者应充分考虑现实层面的合理可能性,既包括技术和法律上的可识别性,又包括客观层面的合理可能,诸如识别的代价、识别所需的时间、处理数据时的技术发展状况以及未来的技术发展前景。在此基础上,有效的匿名化仅需将再识别风险降低至一个“足够遥远的水平”(a sufficiently remote level)。
在主体基准方面,ICO提出“蓄意入侵者测试”(Motivated Intruder Test),即以一个蓄意从事识别行为的入侵者能否成功为标准,对匿名数据进行认定。“蓄意入侵者”具有一般理性人所具备的合理能力与资源(如能够使用因特网、图书馆和公开文件),且仅使用一般而言合理的调查手段。其既不应被假设为缺乏基本知识的外行(relatively inexpert),亦不应达到具备显著的专业知识、分析能力或信息优势的专家程度。“蓄意入侵者”具有主观上的故意甚至恶意,希望通过再识别牟取经济利益或不法利益,但并不具备相比一般人更高的专业知识和专业设备,亦不会诉诸犯罪行为以获取数据。此外,在考虑“蓄意入侵者”可能具备的知识背景和技能水平时,应结合数据的属性和应用场景等因素予以确定。例如,对于金融数据等高价值数据而言,应当假设此时入侵者具有更强的知识储备、设备与资源支持等。
相较于“穷尽合理识别可能性”标准,“蓄意入侵者”标准无疑降低了对匿名化处理标准的要求,更有望成就匿名数据的流通与利用。但这一标准的关键缺陷在于,“蓄意入侵者”的标准过于抽象又缺乏统一性。根据英国ICO最新发布的《匿名化、假名化和隐私增强技术指南(草案)》(Draft Anonymisation, Pseudonymisation and Privacy Enhancing Technologies Guidance),蓄意入侵者既可能是没有数据访问权限的人,也可能是被授权访问数据进而有意或无意地进行再识别的人;既可能是与数据主体没有任何关联的人,也可能是拥有关于数据主体的“特定个人知识”(particular personal knowledge)的人,如伴侣、同事、医生等。同时,这一标准本身还预设存在普通的“蓄意入侵者”与更有决心(more determined)的“蓄意入侵者”两种不同类型,二者在开展再识别行为时能够投入的时间与成本有所不同。究竟应当如何确定“蓄意入侵者”具备的识别能力颇令人困扰,也使得这一标准显得难以捉摸。
3.美国的“没有合理理由相信可识别”标准。相比之下,美国立法则以数据处理者为主体基准判定特定数据是否具有可识别性。2023年1月1日生效的《加州隐私权法》(The California Privacy Rights Act of 2020,CPRA)作为美国在隐私权保护方面的最新立法成果,将“去身份化”(de-identification)定义为“使信息不能合理地确定、联系、描述某一特定消费者,或直接或间接与该消费者相关联的处理过程”。欲实现上述效果,信息处理者需要满足三方面的要求:(1)采取合理措施,确保该信息不能与某一消费者或家庭相关联;(2)公开承诺以去身份化的形式维护和使用信息,不试图重新识别信息,但数据处理者为检验去身份化过程是否符合要求可以尝试重新识别信息;(3)在合同中规定信息的任何接收者必须遵循关于消费者信息去身份化的规定。若能满足上述要求,即可推定其达到去身份化标准。美国《健康保险携带和问责法》(Health Insurance Portability and Accountability Act,HIPPA)也规定,只要数据处理者“并不实际知悉经过处理后的信息可以单独或与其他信息相结合用于识别信息主体”且“没有合理理由相信该信息可被用于识别特定个体”,即视为此种数据已经过去身份化,不再属于个人数据的范畴。美国之所以在去身份化处理方面采取更为宽松的策略,与其积极倡导数据自由流通的意识形态密不可分。数据流通构成美国数据要素市场构建和数字产业发展的重要根基。为避免过于严苛的去身份化标准抑制数据价值与实用性的发挥,从而削弱数字产业的国际竞争力,美国立法倾向于以行业友好且富有可操作性的标准,尽可能鼓励数据的有序流通与充分利用。
在具体的去身份化方式上,美国立法也致力于为数据处理者提供更容易理解和执行的操作机制。HIPPA规定了两种具体的去身份化处理方法:“专家决定法”(expert determination method)与“安全港法”(safe harbormethod)。上述去身份化处理方法相比于抽象的“穷尽合理识别可能性”标准与“蓄意入侵者”标准无疑更具确定性与可操作性,但其在彻底消除数据可识别性方面的效果却相对较差。去身份化数据仅需达到使数据处理者“不能识别特定个体并且没有合理理由相信可以识别特定个体”的程度,难以充分预防数据流转过程中其他主体进行再识别的风险。
(二)“流通范围依存”匿名化处理标准体系的构建
当前,各国的匿名化处理规则普遍侧重静态的匿名化认定标准设定,而忽视了数据流通对匿名数据再识别可能性的影响。数据是否具有可识别性是一个高度场景化的问题,必须结合数据的流通范围、处理目的、方式与场景、数据处理者可能掌握的其他数据和识别技术及其发展可能等诸种因素予以认定。这决定了相比于追求一种静态的匿名标准,从而一劳永逸地规避个人数据蕴含的再识别风险,更务实的策略在于建立一种“流通范围依存”的匿名化处理标准,以此实现对不同场景下数据所蕴含之再识别风险的准确把握以及数据流通与保护需求的动态平衡。
我国既有立法对匿名化认定标准仅设定了“无法识别且不能复原”这一原则性要求。为使这一规则发挥实效,一方面,必须进一步澄清认定数据是否“无法识别且不能复原”的考量基准,包括主体基准、成本基准、可结合的数据范围基准与识别形式基准。同时,鉴于绝对的无法识别在技术上难以实现,应当设定可接受的风险阈值基准,即当匿名数据被重新识别的风险低于这一阈值时,即应被视作已经达到无法识别的程度。另一方面,在设定上述基准时应充分体现对数据流通范围与场景的考量,结合数据流通利用的具体范围和场景就识别的可能性作出个案式认定。此种“流通范围依存”的认定标准更有助于在动态的数据流通过程中实现数据保护与利用的充分平衡,并为规则适用者提供更强的可预测性。
1.主体基准。主体基准构成了认定匿名化的核心基准。针对匿名化判定的主体基准,目前存在“一切主体标准”“蓄意入侵者标准”与“数据处理者标准”三种模式。其中,前两者因过于宽泛抽象而难以把握,缺少对匿名化处理者的指导作用;后者则因过于狭窄而难以充分预防数据在流转过程中被再识别的风险,且其均未能准确反映数据流通的动态特质,存在“一刀切”的规则适用弊端。数据处理者对个人数据进行匿名化处理的目的不仅限于提高数据的静态安全性,更是为了预防在共享、流转数据时面临的潜在风险。在设定匿名化认定的主体基准时,不应仅考虑数据处理者本身是否实际知悉或能够识别数据主体的真实身份或与其建立关联,亦不应勉强其就任何主体或不确定的主体是否有可能对匿名数据进行再识别作出准确判断,而应结合数据流通利用的具体范围,将匿名化所要求的“无法识别”解释为“所有已经掌握或在可预见范围内可能掌握数据的主体均不具有识别特定个人的合理可能性”,并结合匿名数据的流通范围进一步判定“所有已经掌握或在可预见范围内可能掌握个人数据的主体”。
具体而言,当匿名数据仅限于处理者内部存储和使用或向特定的数据接收者提供时,此种数据只需达到使数据处理者和数据接收者均无法重新识别数据主体的程度即可;相反,如果匿名数据向整个社会公开,此时则应以所有能够获取此种数据的主体为标准,对数据是否存在被重新识别的可能进行认定。只要存在具有较高技术能力与专业知识,或对数据主体较为熟悉的第三人能够凭借此种数据进行再识别,即仍需将其视为个人数据予以规制和保护。鉴于数据流通具有扩散性,数据处理者在初始阶段难以完全预判匿名数据的下游流通路径与范围。对此,应基于“合理可预见性”标准就主体基准的范围作出认定,数据处理者仅需对可预见范围内的流通场景、潜在获取主体的识别能力进行判断,无需对超出预见范围的流通扩散承担责任。当数据流通范围发生扩散,例如数据接收者将数据进一步流转至第三方时,其应当以合同约定等形式要求下级数据接收者承诺不得从事再识别行为,并采取同等水平的技术与组织保护措施以确保数据处于不可识别状态。而对黑客攻击等超出合理预见范围的风险,不应纳入匿名化认定的主体基准范围内。但匿名化处理者须采取合理的安全防护措施,尽到对非预期入侵的预防义务,如此方符合“过程本位”的匿名化认定逻辑。此种“流通范围依存标准”显著提升了匿名化处理规则的可操作性,使匿名化处理规则的适用更加契合不同数据流通场景下的实际要求,有助于在确保数据安全的前提下最大程度地保留匿名数据的利用价值。
2.成本基准。在明确认定匿名化的主体基准之基础上,应进一步结合特定场景下上述主体从事再识别行为的成本,判定经过匿名化处理的数据是否仍具有再识别的可能性。当前,各国在设定匿名化认定标准时,普遍要求考虑用于进行重新识别的成本限度。例如,德国《联邦数据保护法》(Federal Data Protection Act)就将匿名化界定为“修改个人信息使有关个人或具体情况之信息无法对应至已识别或可识别之个人,或需耗费过大或耗时过久才能识别”。意大利、斯洛维尼亚的数据保护立法亦均采取所谓的“不合法例投入”标准(disproportionate effort),对匿名数据被重新识别的可能性进行限定。严格如欧盟的“穷尽合理识别可能性”标准,也将耗时过长、成本过高或需要消耗显著的人力或资源投入的识别方法认定为“不具有现实可能性”(practically impossible)。虽然实践中不能排除极个别主体为了达到再识别目的而不惜投入明显超出合理范围的成本与精力,但基于此种极端概率设置匿名化处理的一般性标准有违理性。因此,解释匿名化认定标准时,应当将“合理成本限制”作为判定基准,即只要经过处理的数据在合理成本限度内无法被重新识别,即可认定其已实现匿名化。此种“合理成本”应结合再识别可能获得的收益进行场景化认定。例如,如果匿名数据关系到某位具有高知名度的公众人物,那么很可能会有人愿意投入更高的成本进行再识别,即使在涉及普通人的情况下通常不会如此。当为了从事再识别付出的成本明显超出因成功识别而可以取得的收益时,即可推定此时的可识别性只是一种假设存在而非现实风险。
3.可结合的数据范围基准。在评估匿名数据是否可被成功再识别时,还应考虑从事此种再识别行为的主体所可能结合以用于再识别的数据来源。新加坡个人信息保护公署(PDPC)发布的《PDPA下基于特定主题的建议指南》即明确提出,在判定数据性质时,应考虑匿名数据与哪些数据相结合会导致重新识别,这些结合数据是否容易访问。在进行这一评估时,有必要了解匿名数据的预期用途和接收者。因此,在认定匿名数据时,应当结合数据流通的具体范围,考虑“所有已经掌握或在可预见范围内可能掌握数据的主体”已经掌握的关于数据主体的数据,以及一般公众可以通过公开渠道合法获取的数据(如图书馆、互联网等),对于需要通过犯罪手段或明显不合理的成本获取的数据,不应将其作为认定再识别可能性的考量标准。
4.可接受的风险阈值基准。鉴于绝对的不可识别在现实中无法达到,接受适度的剩余风险即成为了必须面对的现实。有学者提出“匿名化的定量标准并非追求绝对的零风险,而是将可识别风险控制在风险阈值之下”。Berner和Knoppers率先提出以“定量标准”界定匿名数据的尝试。其指出,传统的“穷尽合理识别可能性”标准等“定性标准”要求规则适用者就特定数据是否存在实质的再识别风险进行主观判断,容易引发规则适用不一致等问题。相比之下,“定量标准”则通过使用统计措施和数学模型来对数据含有的重新识别风险作出客观评估,从而为匿名化处理规则的适用提供更多确定性。此种“定量标准”的核心在于设定一个“最高重新识别风险阈值”(maximum percentile re-identification risk scores),当特定数据经处理后被重新识别的可能概率低于这一阈值时,即被认为构成匿名数据。我国2023年发布的国家标准《信息安全技术个人信息去标识化效果评估指南》亦采用了“可接受风险阈值”的概念,即根据去标识化数据的重标识风险是否低于可接受风险阈值决定特定数据是否处于风险可控的状态。此种可接受风险阈值可以为匿名化处理者与监管部门、司法机关判定特定数据是否“无法识别”提供一种客观化的形式标准和基本共识,提升匿名化处理规则的可预期性与可操作性,同时亦有利于在管理数据安全风险与保持数据可用性方面获取平衡。
目前,技术部门已开发出利用软件对特定数据的再识别风险进行定量评估的自动化手段。未来,我国各行业主管部门应当根据本部门的实际情况,设定本行业领域匿名数据的风险阈值,为匿名化处理者借助技术手段和风险阈值开展数据性质判定提供基准。此种可接受风险阈值的设定应当综合考虑具体场景下数据的安全要求与应用需求,对匿名数据的安全系数与使用价值予以平衡,而非采取一刀切的标准。同时,可接受风险阈值的设定还应考虑不同数据的特质。例如,对于敏感个人数据或私密个人数据,因其具有“更高风险兑现概率”或与自然人人格关联更为紧密,此类数据在匿名化处理时应设定相比一般个人数据更低的可接受风险阈值,以尽可能降低数据被再识别的可能性。
5.识别形式基准。在评估匿名数据再识别的可能性时,还应进一步囊括对不同识别形式的考量。目前,我国司法实践中已有法院明确提出判定特定数据是否具有可识别性时,“可分别从识别说和关联说的角度,结合其具体的使用场景、处理方式、信息处理主体情况等因素予以判定”。一方面需考虑特定数据是否能够单独或与其他数据结合以重新识别特定自然人,即是否达到了可识别的程度;另一方面还需考虑此种数据能否与特定自然人间建立起关联,从而揭示关于特定主体的信息。不同于以往立法在个人信息界定方面所采取的“识别说”,《个人信息保护法》在个人信息的界定方面采取了“关联说”,从而将个人信息的范围从“以电子或者其他方式记录的能够单独或者与其他信息结合识别自然人个人身份的各种信息”扩展至“以电子或者其他方式记录的与已识别或者可识别的自然人有关的各种信息”。相应地,匿名数据的界定标准当然应发生调整,即特定数据如果能够与特定自然人建立关联,即使无法识别其真实身份,仍属于个人信息的范畴。此外,对于能够推断出特定主体所具有的属性与特征的数据,因其处理仍会对特定主体产生影响,亦不构成匿名数据。
四、“过程本位”视域下匿名化处理者义务体系的构造
数据流通的动态性特征决定了匿名化处理规则不应仅关注数据当下的静态状态,而应通过赋予数据处理者针对整个数据流通过程的风险评估与控制义务,建立起类似数据安全保护制度的过程本位式(process-based approach)匿名数据规制模式,从而充分应对数据流通过程中再识别风险的变化。此种过程本位的规制模式更有利于应对变动不居的数据流通实践,其并不事先给出一个预定的结果和状态,而是明确匿名化处理者应当履行的程序性义务。程序规范的重点不是决定的内容、处理的结果,而是谁按照什么步骤、顺序、方式和时限来作出决定。匿名化处理规则为数据处理者在数据流通过程中免于履行繁复的个人数据保护义务并承担因个人数据泄漏、滥用等引发的法律责任提供了“避风港”。相应地,数据处理者在享受此种“红利”的同时,亦应妥善履行对用户数据的善管义务。为充分应对匿名数据在动态流通过程中面临的潜在风险,应赋予匿名化处理者覆盖事前、事中、事后各个阶段的过程本位式数据再识别风险评估与控制义务,实现数据流通全过程的动态管理,以此落实“在合规流通使用中激活数据价值”的制度目标。同时,在过程本位规制模式下,法律责任的配置并不以特定结果(如匿名数据的再识别)的发生为必要条件,当数据处理者未能履行适当的程序性义务时,即足以成立相应的法律责任。反之,若其充分履行了程序性义务,即使发生再识别事件,亦不应苛责数据处理者为此承担责任。
1.再识别风险评估义务。各国关于匿名化处理的立法政策均体现了对再识别风险的重视。欧盟第29条工作组《关于匿名化技术的意见》指出,负责任的匿名化处理者不应采取“发布并遗忘”(release and forget)的态度,而必须周期性地对匿名数据面临的再识别风险进行再评估,并根据风险评估的结果及时调整自身采取的控制措施,以确保能够充分应对新产生的风险。OECD发布的《21世纪数据保护原则》(Data Protection Principles for the 21st Century)也提出“风险识别是风险管理的首要步骤,只有全盘了解个人信息匿名化相关的各种风险,包括匿名化技术本身的风险和再识别风险,才能够预测可能造成的危害,进而选择处理风险的有效方法”。对再识别风险的准确评估构成了有效控制此种风险的前提,应当成为数据流通场景下匿名化处理者负有的首要义务。
如前所述,如果我国立法将匿名化认定标准设定为“使所有已经掌握或在可预见范围内可能掌握数据的主体均不具有识别特定个人的合理可能性”,则意味着数据处理者无需使经过处理的个人数据达到使任何第三方主体均无法识别特定自然人且不能复原的程度,即可对其进行流转。其允许经过处理的匿名数据保有不超过可接受风险阈值的再识别可能。这一标准调整减轻了匿名化处理者在追求绝对的不可识别方面的负担,也内在地要求其必须对匿名数据被重新识别的风险进行评估,并以此为基础,采取相应的风险预防与控制措施。匿名化处理者应当以年度为单位对匿名数据面临的再识别风险进行系统性评估,此外,当匿名数据的流通范围发生明显变更、可结合的数据来源出现重大变化或再识别技术出现显著进步时,应当即时启动再评估。但对再识别风险的评估不应勉强匿名化处理者照顾到全部的潜在识别风险,而仅需结合数据流通的范围,以所有“已经掌握或在可预见范围内可能掌握数据”的接收者作为判定再识别风险的参考基准,对上述主体的数据处理目的与方式、是否存在进一步扩大数据流通范围的计划,在确保数据安全方面采取的技术措施、组织措施的有效性与既往在数据安全保护方面的表现,以及获得额外信息以用于再识别的可能性等因素进行考量,以此确定潜在的再识别可能,并采取相匹配的控制措施。数据接收者负有配合上述评估过程的义务,并应在必要情况下提交再识别风险的自评估报告。而当匿名数据面向社会公开时,则需要就所有可获取此种数据的主体,尤其是与匿名数据所指向的个体具有密切联系的人将此种数据用于进行再识别的可能性作出全面评估,并以重新识别的最高风险是否超出可接受风险阈值为依据来判定经过处理的数据是否仍符合匿名化的要求。当评估结果显示再识别风险超出可接受风险阈值范围时,匿名化处理者应当及时采取追加技术处理措施、完善风险控制机制、收紧数据访问权限与流通范围等手段,并在必要的情况下终止相关数据流通活动。经处理仍无法将再识别风险降至可接受阈值范围内的,数据处理者应当将相关数据重新归入个人数据的范围予以保护。匿名化处理者未能充分履行评估义务导致再识别风险超出可接受范围的,其应当对再识别行为所引发的损害承担相应的补充责任。此时,应由非法从事再识别行为的主体就其对数据主体权益造成的损失进行赔偿,仅在主责任人不能承担完全赔偿责任时,方由匿名化处理者在其过错与原因力范围内承担限额补充责任。
2.采取技术与组织保护措施的义务。匿名化处理标准强调“无法识别且不能复原”。然而,匿名化处理技术的可破解性内在地决定了技术层面的绝对无法识别与不能复原是难以实现的,故此“不能复原”应被理解为法律层面的不能复原,即通过采取相应的保护措施并规定禁止再识别义务,保证匿名数据不会被复原。上海数据交易所的“术语规范”中即规定“依据个保法,匿名化信息属于非个人信息。但是,如果仅对特定数据集中的直接识别符进行处理且不能复原,仍然无法杜绝匿名化信息用于识别个人,除非有控制再识别或重识别的控制措施”,从而将是否采取再识别或重识别控制措施作为判定匿名数据是否无法复原的重要考量。
具体而言,为有效控制匿名数据被再识别的风险,匿名化处理者应当在履行再识别风险评估义务的基础上,进一步采取与再识别风险相匹配的技术措施与组织措施,防止匿名数据被用于重新识别。在技术层面,应通过物理或逻辑隔离的方式将匿名数据与可识别数据分开存储,且不得将匿名数据与可用于重新识别的密钥信息再次结合。欧盟第29条工作组《关于匿名化技术的意见》与英国ICO的《匿名化、假名化和隐私增强技术指南(草案)》均要求匿名化处理者彻底删除可以用于重新识别的密钥信息,否则此类数据仍将被视作具有间接识别能力的假名数据。密钥信息的删除包括但不限于删除或销毁用于假名化映射的编码对照表、清除数据处理系统中残留的关联密钥及其备份、终止可用于反向映射的算法接口的运行权限。对于因业务或接受监管需要,暂时无法删除密钥信息的情形,匿名化处理者应将密钥信息与匿名数据实行物理隔离存储,将密钥交由独立第三方托管,并在数据使用协议中明确约定密钥仅在法定情形下方可被调取。此外,匿名化处理者还应加强对匿名数据处理系统、数据存储环境、数据传输网络、数据访问接口等物理和网络环境的安全防护。在数据传输环节,应采用端到端加密传输(end-to-end encryption)、传输层加密,配合接收者身份验证机制等方式,降低匿名数据发生泄漏或被非法获取的风险,有效防范非法再识别行为的发生。
在组织层面,应严格控制匿名数据的访问与操作权限,尽可能以提供API而非直接转移数据等更有利于控制访问环境的方式向数据接收者提供数据,并借助签订保密协议等形式限制访问人员进行再识别。为进一步管理再识别风险,匿名化处理者还可以考虑采取其他适当的控制措施,例如限制数据接收者的数量和可以访问该数据的人数,对数据接收者在使用与披露数据方面施加限制等。此外,过程本位的匿名化处理规则以匿名化处理者是否在数据流通过程中尽到合理的注意义务作为责任认定的核心依据。基于此,还应赋予匿名化处理者留存处理记录的法定义务。匿名化处理者应完整记录匿名化处理的方法与参数、再识别风险评估结论、技术与组织保护措施清单等内容。对涉及匿名数据的任何操作都应当保留明确的记录,以便确保数据流通过程的可追溯性与可审计性。匿名化处理者应当定期审查此种操作记录,以便及时发现潜在的危险并对控制措施予以调整。未留存处理记录的匿名化处理者需承担举证不能的不利后果,即因无法证明已尽到合理的过程管控义务而无法获得责任层面的“避风港”保护。
五、“过程本位”视域下禁止再识别义务的确立
再识别行为构成了匿名数据的主要风险来源。再严密的匿名化处理技术在数字分析技术飞速发展的背景下均存在被突破的可能。美国联邦贸易委员会即注意到,美国企业普遍具有对匿名信息进行再识别的倾向,并时常能够成功实现对匿名信息的再识别。相比于单纯追求绝对无法识别和不能复原的静态效果,更具效率的规制策略在于通过在数据流通场景下引入禁止再识别义务,并对非法从事再识别的行为予以制裁,从源头斩断匿名数据面临的风险。
具体而言,可以通过约定与法定两种形式创设数据流通场景下的禁止再识别义务。在约定层面,数据处理者在对匿名数据进行传输共享时,应当承担起相应的数据安全保护义务,并对数据接收者的再识别行为作出限制。OECD21世纪数据保护原则即规定,在确定特定数据是否构成匿名数据时,应考虑以下因素:(a)用于移除或隐藏识别特征的方法、技术和工具,以及重新识别特定数据的可能性和所需努力;(b)是否存在法律要求或合同或其他有约束力的承诺不得重新识别数据;(c)个人数据的敏感性以及如果数据被不当重新识别对个体的潜在影响。可见,是否存在禁止再识别的法律要求或合同约定本身即构成判定数据“可识别性”的重要标准。就匿名化处理者而言,其作为个人数据的初始收集者,应当保证用户数据在流通过程中始终受到同等水平的保护。《个人信息保护法》《个人信息安全规范》也规定,个人数据处理者向他人共享、转让个人数据时,应当以合同等方式规定数据接收者的责任和义务,数据接收者应当在合同约定的处理目的、处理方式等范围内处理个人数据,不得随意变更原本的处理目的与方式。在匿名数据流通过程中,数据提供者应以具有法律约束力的数据使用协议等形式,明确要求数据接收者不得在未经数据主体及其同意的情况下从事再识别行为,以及违反此种义务的法律责任。数据接收者在向其他主体传输匿名数据或允许他人访问匿名数据时,亦应与之签订同样的协议条款,从而将“同等水平保护原则”贯彻整个数据流转过程。此外,数据提供者与数据接收者间围绕匿名数据的共享协议因关系可识别数据主体的利益,具有一定的涉他性。因此,数据提供者应以适宜的方式告知数据主体,并接受数据主体和监管机构的监督。当数据接收者违反协议对匿名数据进行再识别时,数据主体可以向数据提供方或监管机构举报、投诉,并主张损害赔偿。数据提供者应当采取适当的技术措施与组织措施对数据接收者进行必要监督,当其明知或应知数据接收者从事再识别行为而不予制止时,二者应对侵害数据主体权益所造成的损失承担连带责任。
通过约定形式仅能在特定的数据提供者与数据接收者间创设禁止再识别义务,因此,针对实践中存在的不特定第三方从事的再识别行为,还需以立法形式进行规制。英国《数据保护法案》(Data Protection Act 2018)即将没有正当理由而在未经去标识化处理者授权同意的情况下对去标识化数据进行再识别的行为规定为刑事犯罪。然而,直接将基于不同目的与方式的再识别行为概括性地规定为犯罪行为,不仅有违罪刑相适应原则,还可能引发数据共享领域的“寒蝉效应”。对此,现阶段更稳妥的方式是以行政责任形式对违反禁止再识别义务的情形作出规制。我国立法可以行政法规范形式确立针对匿名数据的禁止再识别义务,违反相关义务的法律责任则可参照《个人信息保护法》第66条关于“违法处理个人信息”的规定进行设置。此外,对于以恶意攻击计算机系统、非法获取计算机信息系统数据、窃取等非法手段实施再识别行为的,或将再识别后的个人数据用于出售等非法目的的情况,还可根据《刑法》关于“非法获取计算机信息系统数据罪”“破坏计算机信息系统罪”“侵犯公民个人信息罪”之规定予以刑事制裁,以此强化对非法再识别行为的威慑力度。
结语
匿名化处理标准的模糊必然阻碍数据的流通与再利用。当前,数据处理者对匿名化处理规则的冷漠已经表明这一意在促进数据流通的制度工具未能如期发挥作用。“数据二十条”明确提出,要“创新技术手段,推动个人信息匿名化处理,保障使用个人信息数据时的信息安全和个人隐私”。然而,单纯依赖技术手段的升级创新,尚不足以达到理想的效果。对此,必须跳出追求匿名化处理之静态效果的结果本位思维,构建起与数据流通实践的动态化特质相契合的过程本位式匿名化处理规则体系,通过设定流通范围依存的匿名化处理标准并明确其评估基准,引入针对匿名化处理的再识别风险评估义务与控制体系,并辅之以对下游再识别行为的法律规制,重新激发匿名化处理规则的制度活力,使其成为平衡数据流通与保护的重要支点。此种“过程本位”的匿名化处理规则将“可望不可及”的绝对匿名标准转化为具有可达性与可操作性的相对匿名标准,使数据处理者从被动规避匿名化义务转向主动选择匿名化路径。2025年9月出台的《个人信息保护国家标准体系(2025版)》中,将加快研制出台个人信息匿名化等标准明确列入下一步标准化工作重点。在此背景下,构建过程本位式匿名化处理规则体系恰逢其时。