个人随笔
当我们说「AI-generated」,我们在说什么?
最近围绕一个数据可视化的讨论,让我一直在想:当我们说一件作品是「AI-generated」时,到底在描述什么,又在判断什么?
我想把几个容易混在一起的问题拆开,尤其是两条线:工作如何被理解(the perception of the work),以及工作究竟如何完成(how the work is done)。 下面是我目前感受到的一些含义和想法,也欢迎补充或纠正。
1. AI 标签里的几种含义
字面上,「AI-generated」是在描述制作方式,并不一定带有批评。但在具体交流中,我感觉它有时还承载着这些 connotations:
- 质量低。 内容空泛、重复、没有新信息,或者看起来完整,却解决不了实际问题。
- 不走心。 作者是不是没有认真参与,只是把生成结果直接交了出来?那些话是否真的表达了本人的想法?
- 没有事实依据(ungrounded)。 文字或图片看起来可信,但背后有没有研究、数据和验证?是在表达真实经历,还是编出一个像经历的故事?
- 语言或审美上的不适。 句子的节奏、用词和结构让人觉得熟悉得厌倦,或者陌生得不自然。
- 公平感与其他顾虑。 对工作被替代、技能被贬值的担心,或者觉得借助工具取得优势,改变了努力与回报之间的关系。这里也可能涉及训练素材、创作权益和社区规则等具体问题,不能全部归结为情绪。
这些是我猜想这个词可能承载的意思,并不代表我知道某个评论者的真实动机。
尤其是「不走心」和「没有依据」,需要分开。一个人可能认真做了研究,结论仍然出错;也可能用 AI 翻译一份已有充分依据的分析。作者投入了多少,与内容有多少证据,并不是同一个问题。
如果关心的是事实,就需要讨论事实。如果关心的是就业、公平或创作过程,也值得把那个问题直接说出来。一个笼统的 AI 标签,很难告诉对方应该回答哪一种疑问。
2. Perception:表达如何被理解
我能改进的一部分,是别人如何感知我的表达。重复的句式、空泛的铺垫和不自然的节奏,都可以通过更好的写作辅助、反馈和编辑去调整。让人读懂,是沟通中需要做的工作。随着工具和使用经验变化,人们对这些表达的熟悉程度和偏好也可能变化。
但我也想区分几个标准:
- 是否清楚。 读者能不能理解我在说什么,找到具体的事实和论点?
- 是否忠实。 翻译或润色有没有改变我的意思,把犹豫写成确信,或者替我加入没有说过的承诺?
- 是否只是符合某种偏好。 一段话的节奏不符合我的习惯,是否就足以判断它没有诚意,或者认定它来自机器?
作为一个用英语表达的非母语者,我希望找到的是一种我们都能理解的语言。如果 AI 帮我把中文里想清楚的东西表达出来,比较对象有时还包括:没有这层帮助,我可能只能说得更少、更含糊,甚至没有开始这场交流。
这里有实际的取舍。语言辅助可以降低交流门槛,也可能把个人声音磨平。如果陌生的节奏被怀疑是机器,借助工具变得流畅又被怀疑不真诚,非母语者就可能被夹在两种要求之间。
2023 年的一项研究发现,所测试的 GPT 检测器经常把一组非母语者写的英语作文误判为 AI 文本。它测试的是自动检测器,不能据此判断网友凭语感识别来源的准确率;但来源判断本身,也需要接受检验。1
我愿意改进表达,也希望我们在要求清楚、具体的同时,给不同的语言背景留出空间。
3. How the work is done:工作如何完成
如果一份内容空泛、错误、无法指导行动,那么由人写出来,它仍然有这些问题。用了 AI,也不能替它免去检查。
但「使用了多少 AI」同样不足以判断质量。改写八成句子,与编造唯一支撑结论的数据,影响可能完全不同。需要看它参与了哪里,以及那部分承担了什么作用。亲历叙述或技能考核等场景,也会把来源和过程本身作为评价的一部分。
最初做文件分类的可视化时,我觉得技术实现并不复杂:调用一个 Python 包,很快就能画出原型,接下来主要是把它变得好看。AI 在这里是个很好的助手。它能帮我排错,处理那些不想反复查的颜色参数和绘图库语法,让熟悉的想法更快变成可以试用的东西。
这种帮助也不限于画图。让 AI 帮忙跑一个 XGBoost、比较几种模型,或者尝试不同的特征聚合方式,都可以让探索快很多。它能帮助查找资料、尝试方法,让我更快获得新的信息和实验结果。但这些结果具体怎么用,仍然需要花时间思考和验证。
我在文件分类上也试过训练模型、做聚类,效果却很一般。当时遇到的一个问题是分类结果会漂移,很难稳定地对应用户的使用场景。即使已经分出了几类,连我自己作为用户,也不能据此直接判断哪些文件该保留、哪些值得清理。这让我开始重新考虑:下一步是继续训练模型、增加特征,还是先弄清楚用户到底需要做什么决定?
这也让我觉得,参与程度不能只按亲手写了多少代码来算。关键是流程里的这些选择有没有被想清楚、检验过:
- 数据:什么才算可接受的输入? 比如分析访问数据,要不要排除 bot?去重是按请求、访问、设备,还是用户?时间范围和缺失数据怎么处理?代码成功跑完,不能替我决定统计口径。
- 分类:为什么这样分? 回到文件问题,不同文件夹里的内容可能有不同用途和生成原因。我需要了解来源、依赖和特征,再决定哪些规则或模型适合这个任务。分出四类,不等于这四类有意义;还要检查重复运行是否稳定,标签含义有没有漂移。
- 展示与行动:用户看完能做什么? 图形可以用不同工具画出来,但用户需要的可能是决定哪些可以清理、哪些应当保留,以及哪些需要自己选择。颜色和动画无法代替这些判断。
- 验收:怎样才算完成? 每一步都应有与目标对应的标准,最后还要验证整条路径确实产生了用户需要的结果。
仅仅是“清理”这件事,也很难用一个 1 或 0 概括:
- 不可轻易恢复的内容,例如没有确认备份的日记和个人记录,不能只凭一个分类标签就当作垃圾。
- 可以重新下载或恢复的内容,仍然需要检查恢复来源是否可用、版本能否找回,以及恢复的代价。
- 可以重新生成的内容,也要确认删除会不会影响正在进行的工作,重建是否可行、成本是否可以接受。
- 需要用户判断的内容,可以把用途、占用空间和后果列清楚,让用户决定,而不是让“可删除”自动变成“应该删除”。
这些关于可逆性的选择,需要在设计和测试中逐步完善。AI 可以帮助整理特征、比较规则、实现方案;我仍然需要知道我们最终采用了什么依据。
表达与质量会相互影响:清楚的表达帮助别人检查工作,扎实的工作也能建立信任。但调整语言节奏,不能替代对数据和结果的核查。
4. Workflow:把回答接回事实
我越来越觉得,工作质量和整个流程有关。仅仅说「我要这个结果」,然后等它出现,中间会漏掉很多需要验证的环节。
假设 AI 告诉我:「把用户的订阅暂停,没有关系,下个月还会定时收费。」我不能因为它回答得快、解释得完整,就把这句话当成已经确认的规则。这一步得到的仍然只是一个待验证的说法。
这里至少需要几个检查点:
- 先把说法变成明确的问题。 暂停会改变哪些状态?何时恢复?下个账期到底应该发生什么?依据是什么?
- 在合适的测试环境复现。 用测试账户执行相同操作,观察真实保存的状态,而不是只看一个「操作成功」的提示。
- 检查后续行为。 暂停成功并不能证明下个账期会怎样;需要进一步检查周期变化、账单或事件记录。没有观察到的部分,仍然要标为未验证。
- 根据结果修正判断。 实际行为与预期不一致,就继续查原因、改实现、再验证。一个测试账户通过,也不能自动覆盖所有用户状态。
通过这些检查点,我才能把判断建立在可以观察、核对的事实之上。这是我说的 ground truth。「另一个 AI 也这样说」,或者同一个 AI 重复保证一次,都不能替代这些依据。我需要说清楚哪些验证过了,哪些还没有。
AI 可以帮忙设计这些检查、执行测试、解释结果。但测试本身也可能漏掉关键情况,所以「测试通过」仍然需要对应一个明确、合适的验收标准。
把工作拆成可以检查的步骤,为每一步设计验证,再用结果修正下一步,也是我建立对自己工作信任的方式。我需要知道某个判断为什么成立、在什么条件下成立,还有哪些地方没有把握。
5. 让 AI 加快研究与验证
我有时觉得,AI 像一个自助餐。许多原本要自己从头准备的东西,现在已经摆在面前。我可以每次只拿奶油甜点,也可以搭配一顿均衡的饭。选择变多、取得变快,并不保证最后吃到了自己需要的东西。怎么搭配,仍然值得认真考虑。
在工作里也是这样:更多模型、更多特征、更漂亮的图,都很容易成为下一步。AI 也能帮我比较这些选择,但我需要结合实际使用中的反馈,决定哪些值得继续做。
我也需要提防另一种情况:它给出的答案很完整,于是我误以为它已经覆盖了整个问题;我只在它列出的选项里比较,就误以为那些选项是全部可能。
所以我希望自己的工作方式包括:
- 用 AI 提出更多假设,帮助我看到原来没有想到的问题。
- 把这些假设带回数据、实际使用和测试环境中检查。
- 让检查结果改变下一步,而不是一直围绕最初那个看起来合理的答案打转。
在这样的流程里,我并不介意 AI 参与。它既能出点子,也能承担执行,让我有时间探索更多问题。工作值得被信任到什么程度,很大程度上取决于我们最终验证了什么,以及验证覆盖到哪里。
这也是我想邀请的讨论:
- 你说或听到「AI-generated」时,首先想到的是哪一种含义?这份清单还遗漏了什么?
- 在一个具体场景里,你更在意表达的感受、工作的质量,还是创作过程?为什么?
- 哪些证据或工作方式,会让你更愿意信任一份有 AI 参与的作品?
写作说明:本文根据我的口述和个人笔记整理,AI 参与了结构整理、论点推敲和中英文本起草。