Dimentionality reduction (DR)
本质上先DR: PCA, ICA, RP
PCA
criteria:
-
PCA selects the smallest dimension retaining at least 95% cumulative variance.
-
max mean silhouette
ICA:
RP:
然后针对original和DR之后的feature进行unsupervised clustering: K-Means & GMM
不同的组合选不同的k,而不是用同一个k 比如original + K-Means用k=2 但是ICA-14 + K-Means 用k=8
怎么选K-Means 和GMM的number of cluster (k) 的参数
Clustering
K-Means
siluette score最大的k, 测k=2 to 10
siluette score for each seed in each k then get the mean of the seeds for each k
GMM
cluster evaluation metrics
选完之后看几个metric siluette DBI ARI NMI Stability 来evaluate这些clustering.
Training on DR feature MLP model
| 类别 | 指标 | 说明 |
|---|---|---|
| 外部(直接"匹配 subfamily") | ARI、AMI/NMI、V-measure(homogeneity/completeness)、Fowlkes-Mallows | 把树剪成 K 个簇,和 subfamily 标签比;chance-adjusted 的 ARI/AMI 是主指标 |
| 内部(距离把已知 subfamily 分得多开) | silhouette(可用预算距离)、Davies-Bouldin、Calinski-Harabasz | 后两个是欧氏空间定义的,对相关距离不太贴,主看 silhouette |
| 稳定性 | bootstrap ARI / 每簇 Jaccard(clusterboot 式) | 重采样激酶重聚类,看簇分配多稳 |
- NMI 和 AMI 测的是同一个东西(互信息),但 NMI 没做 chance 校正 → 簇越多、NMI 越虚高。看你表里 subfamily(130 类)那栏:三个方法 NMI 全是 0.90 上下,根本区分不开——就是被 cluster 数灌上去的假高。AMI 是"做对了的 NMI",所以 NMI 完全被 AMI 取代,冗余,删掉。
- ARI vs AMI:都做了 chance 校正,但机制不同——ARI 基于成对一致(pair-counting),AMI 基于互信息。互补,且我们的数据里两者排序一致(group→CDDM,family→MLP-attr,subfamily→PSPA),互相印证。所以两个一起报最稳妥。