OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

OpenAI“Lily计划”曝光:你的ChatGPT聊天记录正被人工审核

AI 资讯 来源:新闻/公众号 发布时间:2026-09-16 更新于 2026-09-16 预计阅读 6 分钟

美国当地时间9月14日消息,据外媒报道,OpenAI正在推进代号“Lily计划”的内部项目。数百名外包人员正阅读真实用户的ChatGPT对话内容,包括完整上下文记录,对回复进行评分和点评,其中不乏敏感个人隐私。审核人员核心任务之一是训练ChatGPT避免拟人化倾向并降低“讨好型”人格。对OpenAI而言,“过度讨好”已成核心隐患,多起诉讼指控GPT-4o因过度顺从用户,在一定程度上诱发多起自杀事件。

在ChatGPT全球超9亿用户中,绝大多数人或许根本未意识到聊天记录可能被人类阅读。许多用户习惯将其当作心理咨询师、助理或虚拟好友,倾诉私密细节。尽管OpenAI表示提交审核前会对提问脱敏,外包人员看不到用户名,但也承认部分敏感信息和用户背景(如“记忆汇总”)仍可能被遗漏。

这揭开了大模型发展中长期不为人知的环节:AI进步不仅来自海量数据、算法突破,还依赖付费聘请外部人员人工干预纠正和塑造AI回复。竞争对手Anthropic也证实同样利用人工审核优化模型。一位工作人员直言:“我不认为他们会想到某个地方的外包人员正在分析这些对话。”

OpenAI“Lily计划”曝光 你的聊天记录可能正在被人工审核

外媒获得大量相关资料,包括指导手册、Slack内部频道、真实用户提问及完整评分体系。材料只披露项目名称为“Lily计划”,未透露训练哪个模型。这种以模型训练为目的的审查,与公开安全举措(如监测用户计划伤害他人时审查记录)存在明显区别。

指导手册明确:“优质回复应精准理解用户意图,提供有用准确帮助,行文清晰自然、温和得体。”外包人员操作分三步:阅读真实提问;总结用户实际需求;对系统生成的回复评分点评。工作仪表盘中,审核员可自主领取“任务”,点击后呈现真实提问。部分提问中用户明确要求保密,表明其未料到对话会被人类审查。审核员需先写简短摘要归纳意图,再评估四种回复,指出符合或不符合训练要求之处,并至少标注三处具体内容说明理由。

文件指出,“AI腔调”和“表情符号滥用”损害体验时会扣分。表情符号须结合语境:规划植树节活动加树木表情恰当;讨论死亡用骷髅头、发布空难更新用飞机表情则不当。规则要求避免“个人化”经验表述,如“作为一名厨师,我喜欢……”或“我懂那种感受”,但可用“让我来看一下”这类第一人称口吻。评分环节需打1到7分,1分最差“不可接受、无法使用”,7分最佳“几乎没有进一步优化空间”。即便内容有用,篇幅过长或版面杂乱仍可能低分。

OpenAI“Lily计划”曝光 你的聊天记录可能正在被人工审核

另一份标注“机密与专有”的文件说明,模型回复语气“总体上应与用户相符,但强度需略低”。文件要求:“回答应保持自然、克制且专业,不得暗示自己是人类或拥有情感。若出现谄媚讨好、强行模仿风格、利用诱导互动的结尾、放大用户沮丧情绪,或带有高高在上的说教假设,只要削弱可信度或自然度,均应标记。”回复应做到“有益”“诚实守信”“赋予力量”及“睿智而谦逊”。打分后需说明依据,可长可短。常见问题解答显示,OpenAI不要求审核员外部检索核查准确性,另有专门团队负责核验,但仍要求标出事实错误。医疗、法律、财务等高风险领域回复缺少引用来源时也要扣分。

据知情人士透露,提问经去标识化处理,仪表盘不显示用户名,但提问本身仍可能含敏感信息。提问上方有时附带“用户记忆汇总”,概述该用户过往用途,甚至包含居住地及其他个人背景。审核指南要求外包人员将涉及“潜在安全隐患”或个人信息的任务向上提报。OpenAI表示,对话提交前会先通过内部“隐私过滤器”模型预处理,识别并删除个人信息。其官网说明也承认:“与所有模型一样,隐私过滤器也会出错。它可能会遗漏罕见的标识符或模棱两可的私密表述;在上下文有限(尤其是短句)的情况下,还可能出现过度删减或删减不足。”

关于是否明确告知用户提问会被人工审核以优化回复及具体告知入口,外媒曾询问OpenAI,但对方未明确答复。其官网仅说明处理违规或安全风险时人工可能介入,这与模型优化审核是两回事。隐私政策虽提及可能使用“个人数据”改善模型,并称用户删除对话后数据30天内清除,但也补充例外:除非用户已允许将内容用于优化模型,且内容已被去标识化并解绑账户。相关报道发表后,OpenAI才指出官网上关于人工审查可能用于“提高模型性能”的说明。OpenAI补充道,若用户关闭“为所有人改进模型”选项,聊天记录就不会被用于优化模型。但该选项在免费版、Plus及Pro账户中默认为开启,用户须手动关闭,且仅适用于关闭后产生的新对话,无法追溯既有记录。企业版、商业版和教育版用户该选项默认关闭。面对置评请求,OpenAI随后更新帮助页面,增加退出设置详细说明,但对“真人介入阅读”仍未明确回应。

有外媒采访到一位居住在北美的提问处理人员,时薪超过50美元。他介绍,这份工作通过招聘机构Crossing Hurdles获取。该机构官网显示,其业务旨在“在全球AI经济中,将专业人才与AI训练、评估、研究及贡献者岗位连接起来”,并宣称“人类智慧是推动AI进步的基石”。不过在Reddit上,多名用户表示曾收到该公司离奇招聘邮件,甚至有人怀疑是网络诈骗。目前

标签: AI 资讯 AI

更多推荐阅读

把记忆交给CPU,大模型推理能快多少?

把记忆交给CPU,大模型推理能快多少?

拿Agent做Coding已经很常见,但把目光移到背后的数据中心,事情就没那么简单了。一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。任务越跑越久,系统要处理的历史信息也越积越多。当成千上万个Agent同时干活,运营方就可能遇到一个头疼问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等很久。 问题的根儿不在GPU,而在记忆。大模...

2026-09-16
MIT报告追问:AI时代,大学还值得上吗?

MIT报告追问:AI时代,大学还值得上吗?

MIT与AI发展深度绑定,但如今它开始反思:AI会不会颠覆大学教育本身?在MIT一场教师听询会上,有人提出:既然AI Agent做研究助理又快又便宜,UROP(本科生研究项目)是否还要招学生?对经费紧张的实验室,这很难不心动;但对校长而言,必须回答大学为何要让学生花四年聚在一起。 2026年8月,MIT发布38页内部报告《AI在教学、学习与研究训练中的使用》,由五个学院的教授、学生和行政人员历时...

2026-09-16
机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞一年了,何时能替我们上班?

机器人打拳跳舞火了一年,它什么时候才能替我们上班? 宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击,UnifoLM-X2-1.0能实时预测未来状态,完成规划、决策和动态交互。但换成药房取放商品等场景,包装各异的药品、有人走动的货架通道、长时间运行中的意外,都是新难题。 APPSO在2026外滩大会现场与蚂蚁灵波CEO朱兴交流。谈到机器人为何连小卖部都未大规模落地,他直言:...

2026-09-16
菲尔兹奖得主联名警告AI数学错位

菲尔兹奖得主联名警告AI数学错位

上周六,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》,引发广泛讨论。陶哲轩表示“事态紧迫”,未等待更广泛协商便先行发布。声明并不反对AI进入数学,而是反对AI公司把“攻克著名难题”当基准来刷,导致数学共同体真正在意的理解、概念和可复用思路被更容易量化的目标挤掉。 三天前,OpenAI宣布一个尚未发布的内部模型用约一万个智能体协同工作、耗时88小时,完成...

2026-09-16
谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌深夜放大招:Gemini 3.8 Live语音模型登顶榜首

谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,称其为迄今最先进的实时对话模型。Extended Thinking 在 Artificial Analysis 语音质量榜以 82.6 分拿下总榜第一;在 ServiceNow 语音 Agent 测试中,两模型首次同时提升准确性与对话流畅度。 此前 AI 圈因泄密账...

2026-09-16
英伟达点名的杭州团队,补上AI科研最后一公里

英伟达点名的杭州团队,补上AI科研最后一公里

AI for Science的竞争,正在向科研闭环延伸。 以蛋白设计为例,蛋白模型虽越来越强,但真正设计一个分子,研究人员仍需查文献、找结构、下载权重、配置环境,再将计算任务送上服务器。模型给出结果后,还要换工具看结构、做筛选,判断哪些候选值得继续。一次计算跑完,下一步从哪里开始,往往仍靠人把各环节接起来。 如今,这些隐藏在模型前后的工作,开始被AI公司重新审视。今年4月,OpenAI推出面向...

2026-09-16
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部