核心要点:负责审查微软 Copilot 图像编辑功能的人工承包商,有权查看用户的提示词、上传照片及 AI 生成的编辑结果。文件显示,审核任务中夹杂大量色情、令人不安甚至可能违法的内容。需明确的是,这些人员的职责并非拦截违规内容,而是评估 Copilot 执行请求的质量。

在典型工作流程中,承包商需对比 Copilot 生成的两个编辑版本,判断哪一个更精准地遵循了指令。评估维度包括:是否完成指定编辑、是否保持非相关区域不变、有无可见缺陷以及整体画质。例如,若提示要求在桌上添加杯子,除杯子外其余部分应保持不变。

据媒体查阅的内部指令,微软鼓励承包商依赖主观直觉。“相信你的直觉——哪一张立刻感觉更好?人类观众的本能反应至关重要。”指令写道,“如有疑问,请坚持第一印象,因为人类直觉擅长捕捉难以言喻的细微质量差异。”

审核边界模糊:从图像优化到有害内容

然而,许多任务远超常规图像编辑范畴。多名承包商透露,他们曾处理过要求放大女性胸部、缩短裙摆、暴露更多肢体或将人物置于性暗示姿势的请求。其他任务更涉及偷拍裙底、宣扬厌食症材料,以及涉及儿童卡通角色的恋物癖图像。

“面部通常未经审查,许多提示本质上是色情的,且存在同意权模糊问题。”一名匿名承包商向媒体表示。由于未获授权接受采访,该人士要求匿名。

招聘这些审核员的目的并非为了过滤请求或决定 Copilot 是否应拒绝执行,而是评判其响应质量。在某些极端情况下,这意味着承包商需判定哪个输出结果更贴合用户对色情化编辑的要求。

“谁在编写这些提示?当我的注意力必须集中在模型是否生成了‘合适’的胸围尺寸,或中年女性被置于何种性暗示姿势时,很难认真对待这份工作。”一名承包商在内网论坛写道。

部分承包商表示,有时他们在未知内容的情况下便打开了任务。“我刚遇到一组由八张偷拍裙底照片组成的图像,”一名审查员在请求不安全内容警告时写道。另有帖子提及疑似动物献祭内容及涉及性行为的提示。一名接触厌食症内容的承包商表示:“我感到震惊并产生退缩反应。”

数据隐私与厂商回应

文件表明,至少有数百名人工审查员会查看 Copilot 的提交内容。这意味着,用户为编辑而上传的照片,可能作为微软评估模型流程的一部分被第三方承包商检视。

Prolific 是参与招聘承包商的公司之一,主要提供用于偏好调整、安全评估和 AI 基准测试的人类反馈服务。其指南承认,生成式 AI 可能让工作人员接触到研究人员未预料到的内容。Prolific 未回应置评请求。

微软发言人回应称:“微软按照使用条款描述的方式使用客户数据,包括改进我们的产品和执行行为准则。”

科技公司长期利用承包商审核在线内容或标记训练数据,但 Copilot 的此类任务目的不同:承包商并非为了安全筛选,而是通过比较输出结果,帮助提升图像编辑器的准确性、一致性及指令遵循能力。