OpenAI以Lily项目人工审核ChatGPT对话

9月15日 09:54
OpenAI内部评估项目Project Lily安排数百名外包人员审阅经过匿名处理的ChatGPT对话并打分,以减少谄媚和拟人化表达,也暴露出默认训练设置下敏感信息过滤和用户记忆摘要带来的隐私争议。

OpenAI 一项代号 Project Lily 的内部评估流程被公开。外包人员读取真实用户的 ChatGPT 会话并进行分项评价,以压低模型的过度迎合、拟人化倾向和不合时宜的亲近感话术。由于脱敏后的记录仍可能残留个人线索,这组机制同时折射出模型人工反馈与用户隐私边界之间的紧张关系。

提示词审核员是这套流程中的执行角色,他们查看经匿名化处理的真实对话,判断回复是否回应问题,并排查过分客套、说教式语气、表情符号堆叠、谄媚口吻等表现。回复被置于 1 至 7 分的评分体系中。项目要求避免虚拟个人经验:可以说查到信息,但不能把自己描述成具备职业身份、口味或情感经历的主体。审核岗位由 Crossing Hurdles 招募,Mercor 支付酬劳;一位北美审核者称时薪高于 50 美元。相关人员也提到规则常变,不同版本间可能出现相互抵牾之处。

针对隐私处理,OpenAI 说明送审内容已隐去用户名并完成去标识化,但承认过滤可能失效,简短对话更易遗漏个人信息。审核样本还会附随一份用户记忆摘要,汇集历史兴趣、上下文及潜在位置线索。个人用户默认开启对话记录改进产品选项,关闭后可阻止新建立的内容再进入训练和配套人工审核;企业、商业与教育版默认不开启。临时聊天不用于模型训练。关闭开关不具备回溯效力。该项目不做系统性事实核验,只标记显而易见错误,安全评估由独立团队负责。

这种人工参与并非 OpenAI 独有。Anthropic 确认会对启用相应隐私设置的 Claude 对话安排人工审阅并先行匿名化;Google 也允许人工检查部分 Gemini 记录。帮助文档自 2023 年起即写明授权人员和服务商可能接触用户数据以改善模型,只是外界对其规模和数据颗粒度了解有限。随着聊天机器人更多承担咨询与情感倾诉功能,后台抽样和记忆聚合更容易牵出高敏内容。公开诉讼中也出现过关于 GPT-4o 过度顺从与自杀事件相关联的指控,使降低迎合倾向兼具产品安全和舆情治理考量。