[omscs] ML-clustering

Dimentionality reduction (DR)

本质上先DR: PCA, ICA, RP

PCA

criteria:

  • PCA selects the smallest dimension retaining at least 95% cumulative variance.

  • max mean silhouette

ICA:

RP:

然后针对original和DR之后的feature进行unsupervised clustering: K-Means & GMM

不同的组合选不同的k,而不是用同一个k 比如original + K-Means用k=2 但是ICA-14 + K-Means 用k=8

怎么选K-Means 和GMM的number of cluster (k) 的参数

Clustering

K-Means

siluette score最大的k, 测k=2 to 10

siluette score for each seed in each k then get the mean of the seeds for each k

GMM

cluster evaluation metrics

选完之后看几个metric siluette DBI ARI NMI Stability 来evaluate这些clustering.

Training on DR feature MLP model

类别指标说明
外部(直接"匹配 subfamily")ARI、AMI/NMI、V-measure(homogeneity/completeness)、Fowlkes-Mallows把树剪成 K 个簇,和 subfamily 标签比;chance-adjusted 的 ARI/AMI 是主指标
内部(距离把已知 subfamily 分得多开)silhouette(可用预算距离)、Davies-Bouldin、Calinski-Harabasz后两个是欧氏空间定义的,对相关距离不太贴,主看 silhouette
稳定性bootstrap ARI / 每簇 Jaccard(clusterboot 式)重采样激酶重聚类,看簇分配多稳
  • NMI 和 AMI 测的是同一个东西(互信息),但 NMI 没做 chance 校正 → 簇越多、NMI 越虚高。看你表里 subfamily(130 类)那栏:三个方法 NMI 全是 0.90 上下,根本区分不开——就是被 cluster 数灌上去的假高。AMI 是"做对了的 NMI",所以 NMI 完全被 AMI 取代,冗余,删掉。
  • ARI vs AMI:都做了 chance 校正,但机制不同——ARI 基于成对一致(pair-counting),AMI 基于互信息。互补,且我们的数据里两者排序一致(group→CDDM,family→MLP-attr,subfamily→PSPA),互相印证。所以两个一起报最稳妥。