首页文章详情

OpenAI“Lily计划”曝光,你的聊天记录可能正在被人工审核

36氪的朋友们2026-09-16 16:03
一套藏在幕后的人工审核机制曝光。

美国当地时间9月14日消息,据外媒报道,OpenAI正在推进一项代号为“Lily计划”(Project Lily)的内部项目。

据介绍,在该项目下,数百名外包人员正在悄悄阅读真实用户的ChatGPT对话内容,甚至可以看到完整的上下文记录。他们的工作,是对ChatGPT生成的回复进行评分和点评,而这些对话中不乏极为敏感的个人隐私。

审核人员的核心任务之一,是训练ChatGPT避免产生拟人化倾向,并降低“讨好型”人格。对OpenAI而言,“过度讨好”已经成为一个核心隐患,因为多起诉讼指控称,其GPT-4o模型此前正是由于过度顺从用户,在一定程度上诱发了多起自杀事件。

然而,在ChatGPT全球超过9亿的用户群体中,绝大多数人或许根本没有意识到,自己的聊天记录可能会被人类阅读。许多用户已经习惯将ChatGPT当作心理咨询师、专业助理或虚拟好友,向它倾诉生活中的各种私密细节。

尽管OpenAI表示,会在提交给审核员之前对提问进行脱敏(de-identified)处理,且外包人员看不到用户名,但该公司也承认,部分敏感信息和用户背景(如“记忆汇总”)仍可能被遗漏。

这一调查也揭开了大模型发展过程中一个长期不为外界所熟知的环节。人们往往认为,AI的快速进步主要来自海量互联网数据、顶尖工程师的算法突破,或者新模型自身不断提升的性能。

但实际上,AI公司还在持续付费聘请外部承包人员,通过人工干预来纠正和塑造AI的回复。竞争对手Anthropic也证实,他们同样在利用人工审核来优化自家模型。

针对用户是否知情,一位参与提问处理的工作人员在接受采访时直言:“不,我不认为他们会想到某个地方的外包人员正在分析这些对话。”

01 一套藏在幕后的人工审核机制

有外媒表示获得了大量关于OpenAI使用人工审核员的详细资料,其中包括指导手册、Slack内部频道、真实的ChatGPT用户提问,以及一套完整的评分体系。

目前泄露的材料里,只知道OpenAI该项目的名称为“Lily计划”,但没有透露具体在训练哪个模型。

这种以模型训练为目的的提问审查,与ChatGPT此前公开的安全举措存在明显区别。后者包括在监测到用户计划伤害他人时,对聊天记录进行审查。

指导手册明确写道:“优质的回复应当精准理解用户意图,提供有用且准确的帮助,同时行文须清晰自然、温和得体。”

外包人员的操作主要分为三个步骤:首先阅读真实用户的提问;接着总结用户的实际需求;最后对系统生成的回复进行评分与点评

在工作仪表盘中,审核员可以自主选择领取的“任务”。点击后,页面便会呈现真实用户的提问内容。在这些部分提问中,有用户明确要求ChatGPT对内容保密,这表明用户根本未料到自己的对话最终会被人类审查。

阅读提问后,审核员需要先撰写一份简短摘要,归纳用户的真实意图。指导手册给出的示例是:“用户寻求修改工作Slack信息的帮助,希望语气更具协作性,并能引导被@的同事提供建议。”

随后,审核员会评估ChatGPT生成的四种回复,指出哪些部分与训练要求“符合或不符合”,并至少标注三处具体内容说明理由。

文件指出,当“AI腔调”和“表情符号滥用”损害用户体验时会扣分。表情符号的使用必须结合具体语境:“比如在规划植树节活动时加入树木表情是恰当的;但在讨论死亡时使用骷髅头表情,或在发布致命空难更新时使用飞机表情,则属于不当使用。”

同时,规则要求回复避免使用“个人化”的经验表述,比如“作为一名厨师,我喜欢……”或“我懂那种感受”。但可以使用“让我来看一下”这类第一人称口吻。

在评分环节,审核员需为每条回复打出1到7分。1分代表最差,即“不可接受、无法使用”;7分代表最佳,即“几乎没有进一步优化的空间”。即便内容有用,若篇幅过长或版面杂乱,仍可能获得低分。

另一份标注“机密与专有”的文件说明,模型的回复语气“总体上应与用户相符,但强度需略低一些”。

文件进一步要求:“回答应保持自然、克制且专业,不得暗示自己是人类或拥有情感。若出现谄媚讨好、强行模仿风格、利用诱导互动的结尾、放大用户的沮丧情绪,或带有高高在上的说教假设,只要削弱了回复的可信度或自然度,均应予以标记。”

相反,回复应当做到“有益”“诚实守信”“赋予力量”以及“睿智而谦逊”。

打分后,审核员还需说明评分依据。依据可长可短,既可以是两三句话,也可以是一整段详细分析。此外,审核员常见问题解答显示,OpenAI并不要求他们通过外部检索来核查准确性,另有专门团队负责内容核验。不过,公司仍要求审核员标出注意到的事实错误。在医疗、法律和财务等高风险领域的回复缺少引用来源时,也要予以扣分。

02 匿名化处理之外:对话仍可能透出敏感信息

据知情人士透露,这些提问经过了去标识化处理,仪表盘上不会显示提问者的用户名。尽管如此,提问本身仍可能包含敏感信息。

提问上方有时还会附带一段“用户记忆汇总”,概述该用户过往使用聊天机器人的用途,甚至包含其居住地及其他个人背景。

审核指南要求外包人员将涉及“潜在安全隐患”或个人信息的任务向上提报。OpenAI表示,对话提交给外包人员前,会先通过内部的“隐私过滤器”(Privacy Filter)模型进行预处理,旨在识别并删除个人信息。

OpenAI官网关于模型的说明页面也承认:“与所有模型一样,隐私过滤器也会出错。它可能会遗漏罕见的标识符或模棱两可的私密表述;在上下文有限(尤其是短句)的情况下,还可能出现过度删减或删减不足的情况。”

关于是否曾明确告知用户其提问会被人工审核以优化回复,以及具体的告知入口,外媒曾专门询问OpenAI,但对方未给出明确答复。

其官网仅说明,在处理违规或安全风险时人工可能会介入,这与模型优化审核是两回事。其隐私政策虽提及可能会使用“个人数据”改善模型,并声称用户删除对话后数据会在30天内清除,但也补充了一项例外,即除非用户已允许将内容用于优化模型,且该内容已被去标识化并解绑账户。

相关外媒报道发表后,OpenAI才指出了官网上关于人工审查可能用于“提高模型性能”的说明。

OpenAI补充道,若用户关闭“为所有人改进模型”选项,其聊天记录就不会被用于优化模型。但该选项在免费版、Plus及Pro账户中默认为开启状态,用户必须手动关闭,且该设置仅适用于关闭后产生的新对话,无法追溯既有记录。

至于企业版(Enterprise)、商业版(Business)和教育版(Edu)用户,该选项默认处于关闭状态。

面对外媒的置评请求,OpenAI随后更新了帮助页面,增加了退出该设置的详细说明,但对于“真人介入阅读”一事仍未明确回应。

03 时薪超50美元,审核员究竟在做什么

有外媒采访到了一位居住在北美的提问处理人员,他透露自己的时薪超过50美元。

据他介绍,这份工作是通过招聘机构Crossing Hurdles获取的。该机构官网显示,其业务旨在“在全球AI经济中,将专业人才与AI训练、评估、研究及贡献者岗位连接起来”,并宣称“人类智慧是推动AI进步的基石”。

不过在论坛Reddit上,多名用户表示曾收到过来自该公司的离奇招聘邮件,甚至有人怀疑这是一种网络诈骗。

目前,Crossing Hurdles的LinkedIn页面正在招募多个AI相关岗位,包括AI数据审核员、数据标注员和“聊天机器人评估员”。

尽管招聘信息未提及OpenAI或ChatGPT,但工作职责包括“评估AI回复的个性化、事实依据、整合度与实用性”,以及“并排对比模型回复并评估其整体质量”。

其现有的项目还包括招募外包人员记录自己做家务的过程。这项数据收集工作对于开发AI驱动的机器人至关重要。

据知情人员透露,Crossing Hurdles随后会将招募到的人员转送至AI训练公司Mercor,后者才是最终向ChatGPT提问审核员发放薪水的实际主体。

此外,由于Mercor在2026年4月遭遇了严重的数据泄露事件,Meta已经终止了与该公司的合作。

长期以来,人工审核一直是AI训练中重要却隐蔽的一环。这并非OpenAI独有,谷歌Gemini的免责声明明确提到,为改进Google AI,人类审核员可能会审查部分保存的聊天记录;Anthropic也确认,会通过人工审核部分用户对话来改进Claude,并在审核前移除邮箱地址等账户标识符。

这意味着,即使经过脱敏处理,用户与AI之间看似一对一、私密的聊天,也可能被真人审核员看到。民主与技术中心高级研究员米哈尔·卢里亚(Michal Luria)认为,人工审核对于确保聊天机器人安全可能至关重要,但这种机制也容易与用户对聊天机器人的隐私感产生冲突。

加州大学洛杉矶分校教授莎拉·T·罗伯茨(Sarah T. Roberts)将这一现象比作《绿野仙踪》:看似神奇的AI背后,依然有人在“拉动拉杆”。她认为,这些AI产品仍需要人类持续介入。

而对于审核员来说,这份工作虽然时薪超过50美元,工作内容却被形容为“非常机械”。罗伯茨认为,这种高薪可能只是暂时的,而AI持续依赖的人类智慧,反而是最容易被低估的一环。

本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。