在全球倡导程序员、作家和职场人士广泛应用人工智能的背景下,负责训练这些AI模型的外包人员却因使用AI而遭到解雇,这一情节听起来似乎匪夷所思。然而,根据404 Media的最新调查,这一戏剧性的事件确确实实发生在OpenAI的模型训练体系内。近期,404 Media揭露多个参与OpenAI AI模型训练的外包人员,因在工作过程中申请AI的帮助而被迫离开项目。
要想理解这一事件,就必须深入了解这些外包人员的工作内容。9月中旬,404 Media披露了OpenAI内部名为“Project Lily”的项目,该项目涉及数百名外包人员日复一日地阅读真实用户与ChatGPT之间的对话,并对ChatGPT的回答进行评分。他们需要判断AI的回答是否准确、是否不过度迎合用户,以及是否在过于拟人化等方面表现得当。简单来说,这正是一个典型的人工反馈流程:AI生成回复后,人类负责评定其质量并将反馈信息回馈给模型。
值得一提的是,这项工作的规模并不小,404 Media通过内部文件了解到,OpenAI某些相关项目的参与者实际上可能超过一万人。虽然并非所有人都在执行“Project Lily”,但这足以表明,人类外包劳动依然在大型AI模型的训练体系中扮演着举足轻重的角色。同时,处理的内容并不全是OpenAI自创的测试数据,部分可能是来自真实用户提交给ChatGPT的实时反馈。即便经过隐私保护机制,仍然有可能出现敏感信息,OpenAI对此的回应是,承认其过滤系统可能偶尔漏掉罕见的标识符,或对模糊私密表述的把控不足。这意味着,用户在寻求情感支持或心理咨询时的对话,可能正在被远在他乡的外包工作人员一字一句地审阅。 吉祥体育下载
除了直接评价ChatGPT回答质量的外包人员,OpenAI项目还有另一类外包人员:他们专责审核前者的工作。这两种角色虽然都参与模型训练,但职责截然不同。前者主要是处理「训练数据」,具体工作包括评估ChatGPT的回答质量并提供人工反馈;而后者则负责「质量监督」,审查外包人员提交的工作是否符合标准,确保没有违规使用AI的行为。404 Media获取的一份内部工作指南明确规定,审核人员同样禁止使用AI工具。文件指出,审核人员不能借助任何AI检测工具,包括Grammarly和AI翻译工具,来撰写反馈或完成审核任务。显而易见,若审核人员自己依赖AI,那么监督机制也将失去意义。
这样一来,整个流程就形成了一个闭环:训练人员负责给AI评分,审核人员则检验这些评分是否合规,并确保所有工作均由人力完成。为此,审核人员还需持有一份专门的“AI使用痕迹”指南,警惕那些可能表明AI介入的特征,如重复性措辞、可疑的写作风格或者完成作业的异常速度。连标点符号的使用都可能成为判断的依据,例如过度使用破折号等。不过,该文件也特别提醒审核人员不应依赖单一的线索,因此避免草率下结论。
在404 Media采访的外包人员中,有人坦言在参与OpenAI模型训练时曾借助AI的帮助。其中一位甚至向媒体提供了自己的解雇通知,通知中写道,其工作在“真实度”方面存在问题。这位外包人员感慨:“我并非是坏人,也不是糟糕的员工,只是想寻求一些帮助,最终却走向了失败。”他透露,长时间以来,这份工作已经不再给他带来快乐,也让他对自己是否对社会有所贡献产生了怀疑。 吉祥体育下载
此外,在参与采访的人中,还有两位曾为名为Mercor的公司工作,这是一家专注于招募专家和外包人员参与AI模型训练的公司,对于外包人员的AI使用问题,Mercor的发言人向媒体表明,公司所寻找的正是这些专家的专业知识和判断能力,并在合同中明确规定禁止使用大型语言模型(Large Language Model)来完成项目,确保工作的质量和诚信。