让 AI 修改真人影像之前:创始人的同意边界发布门槛
面向 AI 图片与视频应用的实操发布门槛,覆盖真人授权、未成年人、敏感变换、来源记录、举报、删除与事件响应。
用户上传一张人像,让 AI 换衣服、换背景,再把结果分享出去——这可以只是普通的创作流程。但如果上传者并非照片中的人、画面里有未成年人、修改带有私密或羞辱意味,或者原本只供私下使用的结果被公开传播,同一个功能就可能变成冒充、羞辱、性影像侵害或未成年人剥削的工具。
这篇文章写给准备上线照片编辑、AI 头像、视频生成、虚拟试穿、人脸动画或角色创作功能的创始人和小团队。核心判断只有一句:“能够上传”不等于“已经取得同意”,内容过滤器也不是同意机制。只要产品能够修改可识别的真人,上线前就必须分别判断画面里是谁、要做什么修改、结果会流向哪里,以及这一风险等级需要什么证据和补救能力。
读完你会得到一套真人影像同意边界门槛,包括具体上线场景、能力矩阵、最小化同意记录、滥用测试集、事件响应流程,以及小团队不应支持哪些能力的明确边界。这是一套产品风险框架,不是法律意见,也不承诺任何年龄、人脸或身份检测器能准确判断年龄、身份与真实意愿。业务所在司法辖区、目标用户、传播方式和具体功能,仍需要合格的法律与未成年人安全专业人士判断。
风险并非抽象假设。美国国家失踪与受虐儿童中心(NCMEC)表示,其 CyberTipline 在两年内收到超过 7,000 宗与生成式 AI 儿童剥削有关的报告,并提醒已知报告并不能覆盖全部事件。创始人真正要问的,不是“我们有没有打算让用户作恶”,而是产品的功能、默认设置和处理流程,能否让可预见的滥用更难发生、更难扩散,并让受害者真的有办法阻止它。
先把对象分清,再谈“用户已同意”
不少团队只加一个“我有权使用这张图片”的勾选框,就认为授权问题已经解决。问题是,这句话把几种完全不同的许可压缩成了一次含糊点击。
至少要把以下对象和权限分开:
- 上传者:把源文件提交给产品的账号。上传者不一定在画面里。
- 影像主体:输入或输出中可以被认出的真人。
- 源文件使用权:上传者是否有权持有并提交这份文件。
- 变换同意:影像主体是否同意这一类修改,例如让照片动起来、改变年龄、替换衣服或同步声音。
- 传播同意:影像主体是否同意下载、公开发布、商业使用或转发给别人。
- 撤回与补救:在适用情况下,影像主体如何撤回许可、举报滥用、要求移除内容或处置账号。
- 来源与修改记录:媒体怎样生成、经历过哪些修改。这类记录有助于透明,却不能自动证明影像主体同意了修改。
因此,产品不应把“同意”当成账号身上的永久标签,而应把它设计成一个有范围的决定:绑定到具体主体、源文件、变换类别、传播目的地、时间和政策版本。
先列能力地图,不要先写审核提示词
在选模型或编写安全提示词之前,先把产品真正能做的事逐项列出来。检查从输入到输出的每一条路径,也包括那些看似附带的小功能:从网址导入图片、处理共享相册、二创社区作品、复制旧项目、无标识导出、生成公开链接,以及通过 API 调用模型。
NIST 生成式 AI 风险管理框架画像把合成儿童性虐待材料、成年人非自愿私密影像等淫秽、贬损或虐待性内容列为生成式 AI 风险,并要求在整个生命周期管理风险,而不是只检查某一次模型调用。对小团队来说,这意味着上传表单、任务队列、模型供应商、对象存储、作品广场、客服入口和删除任务共同组成一个安全系统。可以先用下面的表逐项盘点:
| 产品能力 | 是否可能输入真人 | 是否可能产生敏感修改 | 能否公开或下载 | 最低上线立场 |
|---|---|---|---|---|
| 根据文字生成虚构插画角色 | 通常否 | 低 | 可下载 | 配合常规内容控制后允许 |
| 把用户本人证件照做成职业头像 | 是 | 通常较低 | 可下载 | 明确声明用途,默认私密 |
| 让另一名成年人的肖像动起来 | 是 | 中 | 可下载或分享 | 限定授权范围并配置滥用控制 |
| 改变可识别真人的身体或衣着 | 是 | 高 | 任意 | 严格限制;禁止性化或羞辱性修改 |
| 对真人“脱衣”、性化或伪造亲密场景 | 是 | 极高 | 任意 | 不提供 |
| 在色情、剥削语境下修改确定或疑似未成年人 | 是 | 极高 | 任意 | 阻断;最小化保存事件证据并履行报告义务 |
| 建立可搜索的真人 AI 作品广场 | 是 | 高 | 公开 | 单独审查、举报、移除与防重复上传机制 |
| 通过 API 或批处理大量肖像 | 是 | 规模化后风险高 | 外部系统 | 合同约束、限速、监测、审计与快速停用 |
这不是适用于所有地区的法律结论,而是保守的产品起点。关键不是表里的文字一字不改,而是团队必须在上线前说清楚:到底开放哪些能力、谁能用,而不能等用户靠一条巧妙提示词把未定义的边界变成事实功能。
一个具体失败场景:看起来无害的活动头像工具
假设两位创始人准备上线一款“活动头像”应用。用户上传照片,选择主题,就能得到风格化头像。团队觉得风险不高:产品没有宣传裸露内容,上游模型自带安全过滤,所有上传者也都接受了服务条款。
但第一版藏着五个缺口。
第一,上传页写的是“你的照片”,却没有阻止用户上传同学、同事、前任或陌生人的照片。第二,预设菜单看起来很正常,但自由输入框仍然可以改变衣服与身体。第三,分享链接虽然标记为“不公开”,实际却是任何拿到网址的人都能访问,分析服务和链接预览也会读取它。第四,用户删除项目后,原图和结果仍留在对象存储里。第五,举报表单要求填写账号邮箱,因此从未注册过产品的被拍摄者无法顺利投诉。
攻击者上传一张班级合照,裁出其中一张脸,再通过不断改写提示词逐步改变衣着。单次生成偶尔被拒绝,但重试足够多次后还是出现有害结果,并通过链接流出。照片中的人从第三方得知此事,却因为没有创作者的项目编号,客服无法定位内容。团队只删掉了一条网址,没有删除底层文件,也没有检查重复链接和缩略图。
这起事故不是某一个分类器漏判造成的。产品文案、输入权限、提示词控制、重试机制、分享默认值、文件存储、客服身份和移除范围一起失效。“我们的模型供应商已经过滤提示词”无法解决当事人此刻面临的问题。
如果提前设置同意边界门槛,路径会完全不同:
- 产品先把输入识别为真人影像,并询问上传者本人是否在画面中,或者是否拥有限定范围的许可。
- 真人输入叠加衣着或身体修改时,任务进入受限路径,而不是通用提示词队列。
- 安全判断同时检查文字、源图、中间修改和最终输出,而不是只看提示词。
- 新建真人项目默认私密,公开分享必须再次操作并看到清晰提示。
- 系统保留保护隐私的处理记录,把源文件摘要、输出编号、政策版本和分享位置关联起来。
- 未注册产品的被拍摄者也能凭网址或文件举报、取得案件编号,并触发对已知副本的统一处置。
建立真人影像同意边界门槛
下面七道检查应发生在生成之前,而不是结果已经交付以后。
门槛一:保守识别真人路径
结合产品场景、用户结构化选择和可用的媒体信号,判断画面是否可能包含可识别真人。不要把年龄或人脸分类器的输出包装成事实。如果系统无法区分真人与高度写实的合成人物,遇到敏感修改时就走更安全的路径。
判断也不应完全躲在后台。可以直接问:“这张图片里是你本人、另一位真人,还是虚构/合成角色?”并解释答案为何会影响可用功能。用户声明与系统信号冲突时,结论应该是“不确定”,而不是自动放行。
门槛二:把授权绑定到具体用途
对于低风险的本人修图,清楚的主动声明可能已经与风险相称。对于另一位可识别真人,应使用更窄的表述:上传者确认自己获得了针对本次修改类型和预定传播范围的许可。不要默认勾选,更不要藏进一大段通用条款。
声明只能证明上传者说过什么,不能证明他说的是真的。它的价值在于划清规则、支持后续处置,并阻止一部分随手滥用。风险更高的流程需要更强控制;如果团队做不到,就不应开放。
门槛三:判断“修改行为”,不能只过滤文字
无害提示词可能配上敏感源图,规避者也能用隐晦表达绕过关键词。产品需要判断用户实际要求的操作以及最终输出:性化、模拟裸露、改变年龄或身体、受伤、羞辱、仇恨、伪造政治背书、虚构疾病、捏造犯罪和商业冒充,应有各自独立的处理规则。
Google Play 的官方《AI 生成内容政策说明》明确覆盖图生图应用以及生成真人声音或视频的产品,并把 AI 生成的非自愿性深度伪造材料列为违规示例。Apple 的《App 审核指南》要求含用户生成内容的应用过滤不当材料、提供举报与屏蔽能力、及时响应,并在向第三方 AI 分享个人数据时明确披露并取得许可。因此,上游模型没有拒绝一次请求,并不代表你的产品已经履行了传播和响应责任。
门槛四:给未成年人单独设立安全边界
“看起来像成年人”不是成年证明。年龄估计存在误差、偏差,也可能被刻意规避。如果源图确定或可能包含未成年人,就应关闭敏感修改和高风险分享路径。不要让儿童通过一次点击“同意”来承担本应由产品控制的严重风险。
英国 ICO 的《儿童守则》要求把儿童最佳利益放在首位,默认采用高隐私设置、减少数据收集,并避免用诱导设计削弱隐私。欧盟委员会依据 DSA 发布的未成年人保护指南同样强调安全与隐私内建,并建议默认私密、方便屏蔽,以及防止私密材料被擅自传播。具体适用范围取决于业务和地区,但产品原则很清楚:年龄越不确定,越应谨慎,而不是越容易放行。
门槛五:生成许可与传播许可分开处理
对真人修改,最安全且仍有实用性的默认值是私密工作区。下载、作品广场、可搜索主页、二创和分享链接都是新的能力,应分别做决定。用户需要清楚知道链接是否公开、是否容易猜测、是否会过期、能否下载,以及链接预览服务能否访问。
“不列出”不等于“私密”。这类网址可能被转发、写入日志、截图,或通过来源信息泄露。高风险媒体可以完全关闭公开链接;较低风险媒体则可以采用到期、随时撤销、必要时登录验证,以及按单个素材立即停用的能力。
门槛六:保存最少且保护隐私的处理记录
记录应足以复现一次安全决定并在事故中控制影响,但不能顺手建成新的生物特征资料库。可以保留带密钥的摘要、内部素材编号、政策与模型版本、上传者声明的关系、修改类别、分享状态、决定代码和删除期限。访问权限与留存时间必须明确。
C2PA 的《Content Credentials 说明》有助于理解来源记录:凭证可以用加密绑定的结构记录素材来源、修改过程和 AI 参与情况。但它也明确指出一个限制:来源记录并不判断其中事实是好是坏、是真是假。把它当作透明度信号之一,不要拿它替代影像主体的许可、滥用预防或删除机制。
门槛七:让从未注册的当事人也能获得补救
被拍摄者可能不知道上传者是谁,也不知道项目编号和模型提示词。举报入口应允许使用公开网址、输出文件,或足够定位素材的信息。不要强迫当事人先注册账号,也不要让他们反复上传有害文件。收到举报后返回案件编号,并说明接下来的处理步骤。
在美国,FTC 对《TAKE IT DOWN 法案》的企业说明指出,受该法覆盖的平台必须提供清晰流程,并在收到有效请求后 48 小时内移除适用的非自愿私密影像及已知相同副本。具体法律范围必须由律师结合业务判断,但任何影像产品都应该提前练好这些运营能力:接收、与请求相称的核验、先控制扩散、查找副本、跟踪状态、升级处理和记录结案。
使用不能“平均掉严重伤害”的决策矩阵
不要做一个总安全分,让画质优秀或主题正常抵消严重失败。真人影像应采用分类决策。
| 条件 | 是否生成 | 是否导出/分享 | 人工复核 | 默认结论 |
|---|---|---|---|---|
| 虚构或合成主体,普通修改 | 允许 | 按常规政策允许 | 抽样 | 继续 |
| 用户本人,普通修改,私下使用 | 允许 | 目的地提示清楚后允许 | 抽样 | 留记录后继续 |
| 另一名成年人,有可信的限定授权,修改内容正常 | 有限允许 | 默认仅私密/下载 | 按风险 | 带限制继续 |
| 真人叠加敏感身体、色情、羞辱或欺骗性修改 | 不允许 | 不允许 | 安全升级 | 阻断 |
| 确定或疑似未成年人叠加敏感修改 | 不允许 | 不允许 | 未成年人安全升级 | 阻断 |
| 敏感路径中无法确定是否真人或是否成年 | 暂停 | 不允许 | 必须 | needs_review 或阻断 |
| 反复规避、裁图、改写提示词或轮换账号 | 不允许 | 撤销已有分享 | 必须 | 停用并调查 |
| 当事人举报指向平台托管的输出 | 依政策冻结访问 | 关闭已知分享 | 必须 | 完整判定前先控制扩散 |
“交给人工”也不能只是一个按钮。需要明确审核人员的培训、可见证据、敏感数据保护、响应时间、决定选项和升级路径。信息不足时,审核人员必须可以返回 insufficient_evidence,而不是被迫二选一。
保存一份同意与安全处理记录
下面的 YAML 是实现模板,不是合规证书。不要把原始媒体塞进记录本身;字段与保留期限需要经过隐私和法律审查。
real_person_gate:
receipt_id: rpm-2026-08-16-00192
policy_version: real-person-v3
owner: trust-and-safety
source_asset_id: asset-internal-1842
source_keyed_hash: hmac-sha256:...
subject_path:
declared_subject: self | another_adult | possible_minor | synthetic | unknown
machine_signal: real_person_possible
resolution: restricted_real_person_path
raw_biometric_template_stored: false
authorization:
source_authority_attested: true
transformation_scope: professional_avatar
destination_scope: private_and_download
attestation_text_version: consent-v2
attested_at: 2026-08-16T02:40:00Z
safety_decision:
prompt_class: ordinary_portrait_edit
source_class: non_explicit
output_class: non_explicit
retry_risk: normal
result: allow_restricted
decision_codes: [REAL_PERSON, PRIVATE_DEFAULT, NO_PUBLIC_GALLERY]
distribution:
public_share: false
downloadable: true
provenance_attached: true
known_output_ids: [output-771]
retention:
source_delete_after: 24h
output_delete_after: account_policy
receipt_delete_after: risk_and_legal_policy
deletion_job_id: delete-551
remedy:
subject_report_url: /safety/report
disable_asset_capability: enabled
duplicate_lookup_capability: enabled
escalation_playbook: ncii-csam-v2
这份记录最重要的是约束,而不是一句“已取得同意”。它应清楚显示上传者声称了什么、系统判断了什么、哪些功能仍被禁止,以及团队在声明受到质疑时如何处置。
测试完整滥用路径,而不只是模型会不会拒绝
上线测试应覆盖从输入到传播和补救的完整旅程,至少包含下面十二种情况:
- 用户如实声明照片中是另一名成年人。
- 用户对第三方肖像谎称“这是我本人”。
- 用户从合照中裁出一名疑似未成年人。
- 第一次提示词正常,后续修改逐步变得敏感。
- 被阻断的表达被改写、拼错、翻译,或通过参考图表达。
- 同一份被阻断源图跨账号、会话、API 密钥或裁剪版本反复提交。
- 一次安全生成通过局部重绘或二创功能变成有害结果。
- 私密输出通过链接预览、分析日志、作品广场或复制网址变得可访问。
- 用户删除项目后,源图、缩略图、CDN 文件、备份或分享记录仍然存在。
- 一名未注册产品的被拍摄者,在不知道创作者与项目编号的情况下举报。
- 有效举报只指出一个文件,但平台还存在重复分享和缩放变体。
- 生成过程中模型供应商、分类器或审核队列不可用。
OpenAI 公开的未成年人安全做法包括上线前与生产环境防护、哈希匹配、报告和外部合作。使用托管模型的小公司不可能复制大型供应商的完整体系,但架构结论同样成立:供应商拒绝、应用自身政策、存储控制、滥用监测和事件响应分别覆盖不同的失败位置。
把留存与删除当作安全控制
真人影像不能按普通生成文本处理。原图可能暴露脸、住所、学校、工牌、证件、位置和人物关系;生成结果即使在技术上是合成的,仍然可能持续伤害当事人。
分别定义以下对象的留存规则:
- 原始上传文件;
- 标准化或裁剪后的派生文件;
- 模型供应商保存的副本;
- 正向与负向提示词;
- 向量或类似生物特征的表示;
- 生成结果与缩略图;
- 公开或“不列出”的分享;
- 审核证据;
- 同意处理记录;
- 日志、备份和 CDN 副本。
哈希匹配可以帮助发现已知副本,避免让受害者为了举报而反复传递影像。StopNCII 的工作方式是在当事人设备上生成数字指纹,再让参与平台依据自身政策查找匹配内容。精确哈希也有边界:裁剪、重新编码、截图和修改可能无法匹配;感知哈希又会带来误判和治理问题。副本检测是控制扩散的辅助工具,不应直接被当作违规的自动证明。
在接收第一张图片前准备事件处理路径
趁团队还冷静时把事件手册写好。最小流程如下:
- 接收:用户和未注册的被拍摄者都能举报,并获得案件编号。
- 分级:优先识别疑似未成年人、即时威胁、敲诈、私密影像和大范围传播。
- 控制:在政策允许时暂停访问和分享,停止队列中的变体,限制相关账号或 API 密钥。
- 最小化保全:只在调查、法定报告、申诉或法律义务需要时,以受控方式保存必要证据。
- 查找已知副本:检查输出编号、分享记录、精确哈希,并谨慎使用经过治理的相似度工具。
- 升级:把未成年人安全、执法机关、平台、供应商和法律问题交给明确负责人。
- 沟通:告知举报人已收到什么、平台可以披露什么、当前状态与下一步。
- 补救:移除确认违规内容,撤销链接,处理缓存,执行账号措施,并验证完成情况。
- 复盘:把这条路径变成回归测试,但不要因此长期保留不必要的有害媒体。
明确这套门槛解决不了什么
这套框架可以减少可预见的产品失误,但无法百分之百确认身份、年龄、授权或真实意愿。勾选框可能造假,身份证明可能被盗,还会带来高风险留存责任;人脸匹配会认错人,年龄估计只是概率;来源凭证可能被移除,也可能如实记录一条从未获得授权的处理流程;水印可以被裁掉,私密输出可以被翻拍,人工审核也会出错并承受长期接触有害内容的伤害。
这套门槛也不是“尽量收集更多个人数据”的理由。如果某个能力必须依赖小团队无法保护和治理的侵入式身份核验,正确的上线决定可能是收窄或取消功能。“技术上能做”与“能够负责任地长期运营”是两道不同的题。
以下产品在上线前通常需要专项审查:面向儿童的工具;性或恋爱体验;医疗、法律、政治或雇佣场景冒充;生物特征识别;公众人物生成;开放模型托管;公开作品广场;产品声称看不到内容却又承诺全面审核的加密服务;以及跨多个互相冲突司法辖区运营的产品。
最后,接入模型供应商不能转移产品责任。供应商控制会变化、会失效,也可能只覆盖生成接口。谁可以上传、能重试多少次、哪些编辑可以串联、保存什么、什么会公开、当事人能否真正获得补救,仍由你的产品决定。
两天内完成的创始人实施计划
第一天,完成能力与后果盘点。列出所有真人输入、修改、导出、分享、二创、API 和删除路径。标记必须阻断的能力:对真人进行性化或伪造私密场景、任何剥削未成年人的处理,以及团队无法安全审核的修改。把真人项目设为默认私密;在风险相称时,分别要求源文件、变换和传播声明;指定一名安全负责人和一名替补。
第二天,让每个决定可追踪。实现不含原始媒体的版本化记录、稳定的素材编号、面向非用户的举报入口、单素材停用能力、删除任务和一个小型滥用测试集。跑完前述十二条完整路径。直接核对供应商当前政策和数据保留方式,不要凭印象假设。文档还要写清分类器、队列或供应商失效时怎么办:敏感路径应默认关闭,而不是静默放行。
普通头像路径通过,不代表作品广场、批量 API 或敏感编辑也可以一起上线。这些能力各自扩大威胁面,需要单独过门槛。先上线能满足用户核心价值的最窄能力,观察真实滥用尝试与正常用户受到的阻力;模型、政策、受众、分享方式或市场发生实质变化时,重新审查。
最终上线检查清单
开放真人影像修改前,逐项确认:
- [ ] 我们区分了上传者、影像主体、源文件使用权、变换同意和传播同意。
- [ ] 我们掌握所有真人入口,包括网址导入、二创、API、批处理和共享项目。
- [ ] 敏感真人与疑似未成年人修改采用分类阻断,不会被平均分抵消。
- [ ] 真人项目默认私密,分享是单独且有充分提示的操作。
- [ ] 系统在合适层级检查提示词、源图、输出、重试模式和传播状态。
- [ ] 同意与安全记录保留声明和约束,但不假装已经证明真实同意。
- [ ] 原图、派生文件、缩略图、供应商副本、日志、分享和备份都有明确保留规则。
- [ ] 未注册的被拍摄者可以凭网址或文件举报并取得案件编号。
- [ ] 团队可以停用单个素材和已知分享,查找已知副本,并验证删除完成。
- [ ] 未成年人安全、私密影像、勒索与即时伤害都有明确升级路径。
- [ ] 供应商或分类器失效时,敏感路径默认关闭,不会悄悄放行。
- [ ] 模型、政策、受众、能力或传播方式有实质变化后会重新跑门槛。