把血型、地区、满意度等级塞进普通热图,就像硬给不同口味标上远近:颜色看似连续,实际可能制造并不存在的距离。cGAP 想解决的正是这类高维类别数据难看、也容易看错的问题。它不丢掉原始数据表,而是在表上补一层更容易辨认的结构。
关键一步是 HOMALS——一种为样本和类别寻找低维位置的方法。论文把它们放进三维空间,再将三个坐标映射为红、绿、蓝:回答模式相近的样本和类别,会呈现相近颜色。每个样本的位置又是其所选类别位置的平均,因此图上的颜色仍能追溯到原始回答。随后,cGAP 用排序算法重排行列,让相似样本和变量靠在一起,并配合样本、变量两张邻近矩阵,帮助显出成片结构、离群点和局部关联。
这套方法覆盖名义、有序和二元变量。作者用动物分类、哺乳动物牙齿、蘑菇记录和基因数据库作了展示。不过,三维颜色必然压缩信息;论文因此提供“保留变异比例”作为检查,提醒使用者先判断三维表示是否足够。