Nature子刊:当8亿人都在用AI写作,语言多样性正在快速消失
“我们正在把语言塑造成它最终的形态,即当没有人再说别的语言时的那种形态。”英国作家乔治·奥威尔(George Orwell)在反乌托邦小说《1984》中如是说。
如今,某种类似的趋势,可能正在真实世界发生。
本周,一篇由南加州大学(USC)团队及其合作者发表在 Nature 子刊 Nature Human Behaviour 上的研究论文揭示:大语言模型(LLM)作为写作助手的普及,正在与语言多样性的下降联系在一起。
简单来说就是,LLM 正在让来自我们不同人的文字“越来越像”。
论文链接:https://www.nature.com/articles/s41562-026-02550-0
语言,是每个人的特殊“指纹”
语言远不只是交流工具。一个人说什么、怎么说,往往也会透露他的身份、心理状态和社会背景。从地域方言到日常交流中的细微表达,语言始终与个体及其所处的群体紧密相关。
因此,语言也成为许多领域观察人的重要线索。心理学家通过语言分析追踪心理健康状况,社会科学家借此研究道德价值观和社会偏见,营销行业则利用语言进行大规模个性化,临床研究甚至尝试用语言辅助识别抑郁症等疾病。
但这些应用都有一个前提:人们表达同样的意思时,使用的语言并不完全相同。每个人都有自己的表达习惯,而这种差异恰恰让语言能够反映个人身份、性格和心理状态。
那么问题来了:LLM 的训练目标是生成“统计上最可能的续写”,这个机制天然偏爱主流的语言模式。当 ChatGPT、Claude 等工具的服务用户超过 8 亿,从邮件、代码到论文、文案都在被 AI 助手“润色”时,人类语言的多样性还会继续存在吗?
在这项研究中,研究团队分析了超过 88 万篇文本,涵盖新闻文章、学术论文、议论文、社交媒体帖子和演讲等不同类型,并通过三项研究发现:使用 LLM 确实可能削弱语言中与个人身份、性格和心理健康相关的线索,使人们更难仅凭语言识别这些特征。
研究一:ChatGPT发布后,写作复杂度方差明显下降
这项子研究考察了 LLM 使用量的增长是否与写作风格的同质化相关。该研究分为两步。
第一步是观测真实世界的数据。研究团队分析了三个大规模纵向数据集:arXiv 论文摘要(约 8 万篇)、Patch News 文章(约 37.96 万篇)、Reddit 创意故事(约 31.8 万篇),时间跨度为 2018-2024 年。他们用高精度检测工具 Binoculars 判断文本是否为 AI 所写,并追踪“写作复杂度”这一指标的方差变化。结果非常一致:
- arXiv:ChatGPT 发布后,写作复杂度方差出现显著且持续的下降,且 AI 使用率的变化能显著预测后续方差的变化。也就是说,使用 AI 的频次越多,学术写作的风格就越趋同。
- Patch News:ChatGPT 上线时方差出现明显骤降,但 Granger 因果检验不显著。研究团队认为,专业编辑流程和机构规范可能缓冲了 AI 的均质化效应,不过微妙的影响仍然存在——也许不是直接使用,而是 AI 生成内容通过影响整体写作规范间接起作用。
- Reddit:同样,在 ChatGPT 发布后出现持续的方差下降,AI 使用率对方差下降同样有显著的预测作用,只是滞后更长(约 20 个月)。他们推测,这可能因为 Reddit 用户群体更广泛多元,采纳 AI 工具比科研人群更慢。
第二步是控制实验。他们从 Reddit 和 arXiv 中随机抽取了 1000 篇 ChatGPT 发布前的人类原创文本,并用 GPT-3.5、Llama 3 70B、Gemini Pro 以中性提示词(如“改写”“改善语法”)润色,然后对比润色前后的写作复杂度方差。结果显示:LLM 在保持原意的前提下(87% 的文本相似度超过 0.95),显著压缩了写作风格的方差。
研究二:从文字里“读人”,变难了
如果说研究一讨论的是“大家写得越来越像”,研究二则追问了一个更尖锐的问题:我们还能从文字中认出写字的人吗?
研究团队先是收集了与作者心理测量数据配对的文本语料,包括年龄、性别、Big Five 人格、共情能力和道德价值观等,然后训练分类器根据文本特征预测这些个人特质,再比较原始文本与 LLM 改写文本的预测准确率。他们发现:
第一,预测准确率平均下降约 6%(F1 绝对值)。六类特质的预测性能均显著下降,其中年龄受到的影响最大:F1从 0.351 跌到 0.260。不过,分类器的表现仍高于随机水平。这说明 AI 并没有完全抹去文本中的身份信号,只是削弱了这些信号。
第二,这种改变不是随机的,而是系统性地偏向特定画像。LLM 改写后的文本更常被判定为:年龄更大、道德感更强、共情水平更低、外向性更低,而开放性和宜人性更高。
第三,这个趋势跨模型、跨提示词都成立。无论更换 LLM,还是调整改写指令,身份特征的偏移方向都保持一致。
换句话说,LLM 不是简单地“擦除”身份信号,而是在引入新的偏差,把不同作者的文字逐渐推向某种相似的“默认人设”。
研究三:那些经典的“词-人”关联,正在被冲掉
社会语言学和心理学积累了大量“某个词类与某种特质相关”的成熟结论。研究三旨在检验:这些关联经过 LLM 改写后还在吗?
在原始文本中,研究团队成功复现了许多经典发现,如“外向者更多用积极情绪词”“开放性与复杂词汇相关”等。然而,经过 LLM 改写后,许多关联被“冲掉”了。比如:
- 外向性与代词使用的关联:显著消失;
- 忠诚度与朋友类词汇的关联:显著消失;
- 年龄与未来导向词汇的关联:显著消失。
诸如“神经质与负性情绪词”等另一些关联却保留了下来。这说明,LLM 带来的影响更接近一种选择性侵蚀,而非“一刀切”式的噪音。
对依赖词汇线索开展研究的学科来说,这可能比全面失真更麻烦——哪些关联还可靠、哪些已经失效,需要逐一检验,否则研究者可能得出关于身份、群体差异或文化模式的偏差结论。
意味着什么?
既然 LLM 的大规模采用已经带来了这些变化,那对我们会产生哪些潜在影响呢?研究团队给出了一部分示例,如下:
1.临床与心理健康:写作风格高度同质化后,通过文本识别抑郁等关键标记可能变得更难,妨碍早期发现与干预;
2.个性化与营销:依赖细微语言差异的定向分析可能失效;
3.招聘:AI 润色过、符合主流风格期待的申请者可能比写作风格独特但“不够圆熟”的申请者更占便宜,加剧不公平;
4.文化保护:语言承载的文化标记被抹平,语言遗产面临威胁。
更值得警惕的是一个反馈循环:LLM 影响过的文本不断进入在线语料库,而这些语料库又将被用于训练下一代模型,这将可能使得语言多样性的流失逐步自我强化。
最后,研究团队还提出了一个更深远的问题:鉴于语言与思维密不可分,语言的均质化可能最终限制认知的灵活性与创造力。在极端情况下,正如奥威尔所警示的,这可能会“缩小思想的范围”。
当然,这项研究并非意在否定 LLM 的价值。它们确实能够让写作更加清晰,也让更多人更容易完成表达。
然而,当来自数以亿计人的文字都流经同一套统计模型,个体表达的独特性正在被悄然稀释。它并非源于审查或删除,而是在一次次“帮我润色一下”中,被温柔地抹平。
如何让 AI 工具成为放大人类表达多样性的积极力量,同时避免所有人逐渐写出同一种“AI 腔”,将成为 AI 时代必须回答的问题。
本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:学术君,36氪经授权发布。