这篇 CMU 2026 博士论文《Causal Foundations for Language Data and Models》来自 Victoria Lin,由卡内基梅隆大学统计与数据科学系、机器学习系联合培养完成。论文聚焦一个正在变得越来越重要的问题:当自然语言既是人类行为和社会现象的记录,也是大语言模型的输入、输出和训练材料时,我们能否用因果推断来更严谨地理解语言、评估模型并优化模型? 论文将这个方向称为 Causal NLP,即面向语言的因果推断。它并不满足于把文本送进语言模型做相关性预测,而是追问更难的问题:哪些语言表达真正导致了某个外部结果?从一个文本平台上学到的语言效应能否迁移到另一个平台?如果一个评论里的“网语”“情绪”“家庭话题”等属性与其他上下文纠缠在一起,如何估计其中某个属性的孤立因果效应?当语言模型在分布转移下被遗漏变量影响时,评估和优化是否会产生系统性偏差?当我们让大模型模拟用户或用偏好数据对齐模型时,因果假设是否仍然成立? 作者把论文组织为两条主线。第一条主线是“用语言数据做因果推断”,包括可解释语言干预表示、文本实验的效应迁移,以及自然语言属性的孤立因果效应估计。第二条主线是“用因果原则改进语言模型”,包括语言模型评估与优化中的遗漏变量偏差、合成实验中的有效反事实模拟,以及把语言模型对齐重新表述为因果推断问题。整体来看,这篇论文为 NLP、因果推断和大模型对齐之间搭了一座很实用的桥。
论文开篇指出,现代 NLP 的变化不仅来自模型能力提升,也来自语言数据和语言模型的全面普及。文本已经不只是研究者采集的小规模语料,而是大规模在线互动、社交媒体、心理健康对话、产品评论、政治意见、模型响应和人机交互记录的共同载体。与此同时,语言模型通过 Web 界面和 API 进入普通用户环境,使机器生成语言也成为社会数据的一部分。 这带来三个直接需求:语言系统需要可解释,需要结论正确,需要与社会价值对齐。因果推断在统计学中正是为这些目标服务的:它刻画变量之间的因果关系,估计干预效果,并寻找能产生更好结果的策略。作者认为,因果推断同样能帮助 NLP 回答“什么语言导致什么结果”以及“怎样生成更优语言”的问题,但直接移植传统方法并不容易。 困难在于,文本是高维、非结构化、语义丰富的对象,而传统因果推断通常假设干预、协变量和结果可以被清楚表示。另一方面,大多数语言模型也没有显式建模因果关系,容易把相关性、分布偏移和未观测混杂误当成有效信号。因此,Causal NLP 的核心挑战,是同时处理语言的表达复杂性和因果识别的统计严谨性。
论文提出两个基础目标。第一个目标是基于语言数据进行因果推断,重点关注语言编码的干预如何影响文本之外的结果。例如,什么类型的表达更能影响政治观点,治疗师说什么更能改善患者心理状态,评论中的哪些语言属性会提升读者认为其“有帮助”的概率。 第二个目标是用因果原则改进语言模型。这里的关注点从文本作为数据,转向语言模型作为决策和生成系统。模型评估可能受到遗漏变量偏差影响,合成用户实验可能产生无效反事实,偏好优化可能把有偏 outcome model 的信号当成真实偏好。论文后半部分正是围绕这些风险展开。
第二章解决 Causal NLP 的第一个基础问题:如果“语言”是干预,我们该如何表示这种干预?传统词典方法如 LIWC、Empath 或情感词典具有可解释性,可以把文本映射到心理、情绪、社会关系等人工定义类别。但这类表示通常信息损失较大,无法充分捕捉上下文。深度语言模型嵌入信息丰富,却难以解释,不适合作为清晰的因果干预描述。 作者提出 SenteCon 和 SenteCon+,试图在可解释性和表达能力之间取得平衡。基本思想是:保留词典类别的可解释语义,同时利用上下文语言表示来构造更丰富的句子级类别编码。这样,研究者既能说清楚“干预”对应哪个语言属性,又能减少传统词典表示过于粗糙的问题。
SenteCon 的价值在于,它把文本表示从黑盒向量拉回到可解释类别空间,但又不完全退回简单词频统计。对因果推断来说,这一点非常关键。因果问题往往需要研究者明确说明干预是什么,如果干预只是一个不可解释 embedding 方向,那么即使估计出效果,也很难解释或指导现实行动。 实验部分显示,SenteCon 系列表征在人工评价和下游任务中能保留较好的语义信息,同时具备更强解释性。这为后续章节提供了基础:只有语言干预能被合理表示,才有可能进一步估计其跨域效果或孤立效果。
第三章讨论文本因果效应的跨域泛化。现实中,研究者可能在一个源域中获得较可靠的文本实验结果,例如通过随机实验测量某些语言属性对读者反应的影响。但目标域往往不同,例如从 Reddit 迁移到 Gab,从一个群体迁移到另一个群体。直接使用源域效应可能出错,因为不同平台、群体和语言分布会改变因果效应。 作者提出 Text-Transport,用于把源域中估计出的文本因果效应迁移到目标域。它利用分布转移思想,将源域中的有效因果信息通过重要性权重等机制转移到目标分布,从而估计目标域中的效应。这不是简单地训练一个预测器,而是在保留因果识别假设的基础上处理域差异。
文本平台之间的差异很大。同一个词语、语气或话题,在不同社区中的社会含义可能完全不同。例如,在一个平台上“家庭”相关语言可能降低仇恨感知,在另一个平台上则可能与不同话题结构绑定。Text-Transport 的目标是回答:当我们只有源域实验和目标域文本分布时,怎样更可靠地估计目标域中的文本效应。 这章的重要性在于,它把 Causal NLP 从“单一数据集上的效应估计”推进到“跨语境因果泛化”。对实际应用来说,语言政策、内容治理、心理健康干预和在线社区研究都需要面对跨域泛化问题,不能默认一个数据集上的结论自动成立。
第四章进一步处理语言内部的混杂。文本不是由彼此独立的属性组成的,一个评论中的语气、主题、风格、情绪、长度和语法往往同时变化。如果研究者想知道“网语是否让评论更有帮助”,就必须把“网语”从其他语言上下文中隔离出来,否则估计到的可能是话题、情绪或作者群体的综合效应。 作者将问题形式化为自然语言属性的孤立因果效应。核心思路是把文本分解为焦点语言属性和非焦点语言部分:前者是研究者关心的干预,后者是需要控制或近似的上下文。由于非焦点语言无法被完美观测和固定,任何近似方式都可能引入遗漏变量偏差。
这章的关键洞察是,语言属性的因果效应不能简单通过“包含某词”和“不包含某词”的文本比较得到。因为文本中的属性高度相关,改变一个属性往往伴随其他属性变化。作者因此提出识别、估计和敏感性分析框架,用于评估不同非焦点语言近似方法对孤立效应估计的影响。 实验包括 Amazon 评论和减重药物相关数据。结果表明,孤立语言效应估计需要同时考虑 overlap、fidelity 和鲁棒性:近似空间与真实文本分布的重叠程度、结果模型对非焦点语言的拟合质量,以及遗漏变量偏差可能造成的影响。对 NLP 应用而言,这比普通特征重要性分析更严格,因为它问的是“改变某个语言属性是否会导致结果变化”。
第五章从语言数据转向语言模型本身。语言模型评估经常依赖 benchmark 或 reward model,但这些评估并不总是反映真实目标分布。尤其在分布转移下,模型可能遗漏某些影响结果的重要变量,从而导致评估和优化偏差。作者将这一问题表述为语言模型中的遗漏变量偏差。 本章提出一种基于 doubly robust loss 的分析与优化框架,用于评估模型在最坏情况下的泛化表现。论文特别讨论了广义线性模型对数似然损失与语言模型输出之间的对应关系,并将理论框架应用到数学推理、情感/评论等任务中。
这章最值得注意的是,它提醒我们:模型在基准测试上的表现差异,可能不仅来自能力差异,也可能来自评估分布中未被建模的混杂因素。对于数学推理等任务,表面扰动和深层逻辑扰动会产生不同强度的遗漏变量偏差。强模型可能更能识别深层分布差异,而较弱模型可能把某些表面特征当成有效线索。 对模型优化来说,遗漏变量偏差会进一步放大。如果优化目标本身有偏,模型会朝着错误方向被强化。作者的方法试图用稳健目标和敏感性参数描述这种风险,使模型评估不只给出一个分数,还能指出这个分数在分布转移和未观测变量下有多可靠。
第六章讨论一个非常现实的大模型应用:用 LLM 模拟用户来做实验。研究者和产品团队越来越希望用合成用户评估对话代理、推荐系统或干预策略。但如果同一个 persona 在不同干预条件下被模型模拟成了不同类型的用户,那么所谓“反事实比较”就不再有效。 作者指出,LLM 合成实验容易出现 user drift 和 selection bias。即使两个合成用户最初被赋予相同 persona,不同干预对话也可能让模型隐式推断出不同潜在属性。例如,一个健康教练问的是“乳酸阈值配速”,另一个问的是“每天站立多久”,模型可能把前者模拟成认真运动者,把后者模拟成久坐用户。这样最终结果比较的就不是同一个用户在不同干预下的反事实,而是两个不同潜在人群。
论文用负控制结果来检测混杂:某些用户属性本应不受干预影响,如果这些属性在不同干预条件下发生系统性变化,就说明合成用户发生了漂移。随后,作者通过迭代补充 persona 属性来调整混杂,使模拟用户在关键潜在变量上更稳定。 这一章对当前 LLM agent 评测很有启发。很多“模拟用户”实验默认模型可以生成有效反事实,但因果视角表明,这个假设需要被检验。否则,系统可能误以为某个代理更好,实际只是它诱导模型生成了更容易满意的用户。
第七章将语言模型对齐重新表述为因果推断问题。传统 RLHF 或偏好优化通常依赖人类偏好、奖励模型或 outcome model,但这些信号可能来自有偏数据。若 outcome model 学到的是混杂后的相关性,而不是文本响应对目标结果的真实因果影响,优化就可能产生偏差。 作者提出 Causal Preference Optimization 和 Doubly Robust Causal Preference Optimization,即 CPO 与 DR-CPO。它们把偏好优化放入因果框架中,关注文本响应作为干预时对目标结果产生的因果影响。DR-CPO 进一步结合 doubly robust 思想,使优化在某些模型组件不完美时仍具备更强稳健性。
这章的核心观点是,对齐不应只被看作“让模型输出更像偏好数据中的好答案”,还应被看作“让模型生成会因果上带来更好结果的答案”。这一区别很重要。偏好数据中的选择可能受到标注者背景、任务分布、上下文呈现和 outcome model 偏差影响,如果直接优化相关性信号,模型可能学到错误方向。 实验中,CPO 和 DR-CPO 在仇恨言论和香港相关数据上与 OO-RLHF、微调等方法比较。结果显示,因果偏好优化能够在目标结果上取得更有竞争力的表现,尤其 DR-CPO 展现了利用稳健估计抵消偏差的潜力。
论文最后回到 Causal NLP 的总体目标:用因果推断帮助我们更好地理解语言数据,也用因果原则帮助我们构建更可靠的语言模型。前半部分强调文本作为干预和协变量时的表示、迁移与孤立效应估计;后半部分强调语言模型作为评估、生成和决策系统时面对的偏差、反事实和对齐问题。 这篇论文的一个重要贡献,是把许多看似分散的问题放入同一套因果语言框架中。可解释文本表示解决“干预是什么”;Text-Transport 解决“效应能否跨域”;孤立因果效应解决“语言属性如何从上下文中剥离”;遗漏变量偏差解决“评估和优化是否可靠”;合成反事实解决“模拟用户是否真的可比”;因果偏好优化解决“对齐目标是否具有因果意义”。
第一,语言不是普通特征。文本中的语义、风格、主题和社会语境彼此纠缠,因此 NLP 中的因果问题必须认真定义干预、控制混杂,并进行敏感性分析。 第二,大语言模型评估需要因果意识。一个 benchmark 分数或 reward 分数并不自动代表真实目标表现,尤其在分布转移和遗漏变量存在时,评估结论可能被系统性扭曲。 第三,合成实验不能默认产生有效反事实。LLM 模拟用户看似方便,但如果用户状态会随干预漂移,实验比较就会失去因果解释。 第四,对齐应从相关性偏好走向因果结果。真正可靠的模型优化,不只是拟合“人们在数据里喜欢什么”,而是尽可能学习“什么输出会导致更好的结果”。 总的来说,这篇博士论文为 Causal NLP 提供了从方法到应用的一套基础框架。它提醒我们,在语言模型越来越多地参与社会决策、科学分析和人机交互时,因果推断不是一个外部统计工具,而应成为理解语言数据和构建语言模型的底层原则之一。