Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER H 14 约 7 分钟

混合类型变量,怎样统一量关联

一种不怕类别改名的关联量尺,让数值列与类别列能在同一把尺上比较。

你想知道收入与职业有没有关系。收入是连续数字,职业却是没有天然顺序的类别。若把职业编码成 1、2、3,再套用面向数值的相关系数,结果可能随着编号方式改变:同一批人,只是交换两个职业的号码,关联强度就变了。

Yongjae Kim、Haeun Moon 和 Sungkyu Jung 提出的关联度量 ξ,正是为这种“实值变量—类别变量”配对设计的。它不在乎类别叫什么、排第几,也不要求预先假定某种分布模型。论文同时给出样本估计量 ξn,希望把关联强度、独立性检验和置信区间放进一套工具里。

需要先说明:这是一篇 arXiv 预印本,理论、模拟和应用结论都来自作者团队,尚无独立信源交叉验证。

不给类别强行排队

混合类型数据很常见。基因表达量是数值,临床亚型是类别;年龄和收入是数值,人口分组是类别。Pearson 相关系数原本为两个数值变量设计,不能直接照搬到这里。

已有工具各有边界。点二列相关只适合二分类;polyserial correlation 假定类别有顺序,并依赖潜在正态模型;相关比主要概括组间均值差异,可能漏掉均值之外的依赖;ANOVA 的 F 统计量用于检验均值差异,却不是固定在 0 到 1 之间的关联量尺。

实践中,人们常把类别编码成整数,或者把连续数值切成若干区间。前者凭空制造顺序和间距,后者可能丢失信息,并让结果受分箱方式影响。论文要解决的核心问题因此很朴素:类别改名或换编码以后,答案不该跟着变。

ξ 具有这种“标签置换不变性”。把“红、蓝、绿”重新编号,或任意交换类别名称,群体量 ξ 与样本量 ξn 都不变。对数值变量做严格单调变换——也就是改变刻度但不打乱大小顺序——结果同样不变。

它数的是相邻样本有多像

理解 ξn,可以想象先按收入从低到高排好所有人,再观察相邻两人的职业是否相同。如果收入和职业毫无关系,排完之后的职业标签仍像随机打乱,相同职业不会特别容易挨在一起。若职业随收入明显变化,相近收入的人更可能落入同一类别,相邻匹配便会增多。

估计量先计算这种“相邻同类”的频率,再减去各类别仅凭总体占比就会产生的偶然匹配基线,最后做归一化。论文还指出,它与经典的 runs statistic 有直接关系。所谓 run,是排序后的标签序列中一段连续相同的类别;run 越少,说明同类越集中,ξn 越大。

群体层面的思路与此呼应。作者考察:知道数值变量以后,类别分布是否变得更集中。这里的集中度是各类别概率平方之和,也称 Herfindahl–Hirschman Index。换一种统计学习里的说法,ξ 衡量观察数值变量后,类别的 Gini impurity——类别混杂程度——相对下降了多少。

这个角度避开了人为编码。它直接使用“属于哪个类别”的指示信息,再把各类别的贡献汇总起来。作者选择不额外按类别流行程度加权的版本,让类别标签受到对称对待。论文中的构造例子显示,当关联主要藏在少数类别里时,这种汇总方式可能比按类别占比加权更敏感;但这一判断来自作者设定的场景。

0 和 1 分别意味着什么

论文证明,ξ 位于 0 和 1 之间。ξ=0 当且仅当两个变量独立。独立的意思是:知道数值以后,对类别的概率分布毫无帮助。这比“没有线性相关”更严格,因为非线性依赖也不能被算作独立。

ξ=1 当且仅当类别变量是数值变量的可测函数。说白了,给定数值,就能确定类别。这个结论有明确方向:它说的是“类别可由数值确定”,不能反过来理解成数值也一定能由类别确定。因此,ξ 是有方向的关联量,而不是对调两个变量仍保持不变的对称相关系数。

在二分类的群体情形下,ξ 与 Chatterjee’s coefficient 相同;若两个变量本身都是二元变量,它还等于用数值变量解释类别变量所得的决定系数 R2。但类别超过两个后,作者强调它不应被看作对 Chatterjee 系数的简单编码扩展。

不靠反复洗牌做检验

ξn 的计算复杂度为 O(nlogn),主要工作是排序。作者证明它具有强一致性:样本持续增加时,估计值会几乎必然趋近群体量。论文还分别研究了独立和一般依赖情形下的渐近正态性,也就是样本足够大后,经过标准化的误差趋近正态分布。

这套理论带来两个实用结果。其一,可以构造单侧 Wald 独立性检验——利用估计值及其标准误判断关联是否显著——无需每次反复打乱标签做置换检验。其二,可以给 ξ 构造渐近置信区间,表达估计的不确定程度。一般依赖下的方差需要估计未知的条件类别概率,论文采用 k-nearest neighbors,即利用数值上最近的一批样本估计局部类别比例。

作者也处理了有限样本细节。独立时,原始统计量存在精确的条件负偏差,因此检验使用经过有限样本中心化的版本。模拟表中,样本量从 50 增至 400 时,中心化统计量的单侧拒绝率为 0.046、0.055、0.045 和 0.050,接近设定的 5% 水平。

在六类别的分块模拟中,95% 置信区间的覆盖率随样本量增加总体接近名义水平。例如样本量为 1600 时,五档信号强度对应的覆盖率在 0.946 到 0.963 之间。另一个中等信号、1000 次重复的实验里,标准化统计量均值为 -0.021,标准差为 1.031,与标准正态分布所要求的 0 和 1 接近。不过这些数字只说明方法在论文设定的模拟中表现如此。

为什么值得关注

探索分析和特征筛选经常需要把大量变量两两比较。若数值—数值、类别—类别和数值—类别各用一套含义不同、范围不同的统计量,结果很难横向阅读。ξ 至少为其中的实值—名义类别配对提供了清晰刻度:0 精确对应独立,1 对应有方向的完全确定,中间值表达观察数值后类别不确定性减少了多少。

更重要的是,它把编码稳定性放在了定义里,而不是把“多试几种编码”当作补救措施。论文称,模拟和 TCGA 乳腺癌数据应用显示,该方法能够发现包括方差异质性在内的一般依赖,并具有竞争性的检验功效和明显的计算优势。这些仍是作者团队的概括,供稿未给出 TCGA 应用的具体数值,也不足以判断优势在不同数据条件下是否稳定存在。

局限与未知

  • 标题里的 mixed-type variables 范围较宽,但本文实际聚焦实值变量与名义类别变量的配对,并未统一覆盖任意混合数据类型。
  • O(nlogn)、一般依赖下的渐近正态性、方差估计和 Wald 推断都有适用条件;例如一般情形要求条件类别概率满足论文给出的局部波动控制条件。小样本表现仍需按具体数据检验。
  • 标准 bootstrap 会因重复抽样在排序后制造人为的相邻匹配,论文认为并不适合 ξn,并在数值实验中考虑无放回的 m-out-of-n 方案。模拟优势、检验功效与 TCGA 结论目前都尚待独立复核。

供稿材料 SOURCES — 1

← 返回 2026-08-02 · 数据板块