为什么在生物嵌入中保留密度
低维表示已成为研究单细胞数据的标准工具:它们可以让我们看到细胞如何聚集成群体,并追踪过渡状态。然而,t-SNE或UMAP等经典可视化方法能很好地保留局部邻域,但常常扭曲点的可见密度。结果,密集的细胞聚集看起来稀疏,而稀有状态反而融合成一片云。这严重阻碍了对连续细胞轨迹和少量过渡群体的解读。
当原始分布的密度丢失时,研究者可能将随机噪声误认为独立群体,或错过重要的过渡表型。因此产生了这样的任务:构建一种同时保留邻域结构和局部点密度的可视化方法。

DMT-Dens的工作原理
一组研究人员提出了一种参数化可视化方法,直接优化密度保留。名为DMT-Dens的模型基于latent-token Transformer编码器构建。网络学习将高维生物数据映射到二维空间,使原始空间和投影中最近邻的排序保持一致。
为此,结合了两种机制:
- 流形秩对齐 — 模型学习保留对象之间距离的顺序,而非距离本身;
- 硬对聚合 — 特别关注那些位于密集与稀疏区域过渡边界上的点对。
损失函数的核心思想是原始空间中k个最近邻的对数半径与所得二维嵌入之间的皮尔逊相关性。这使模型能够惩罚投影中密度与原始不匹配的情况。对半径取对数使估计对异常值和数据缩放具有鲁棒性。

基准测试结果
作者在多个生物数据集上测试了该方法。主要结论是:DMT-Dens确实比传统可视化方法显著更好地保留密度,同时细胞类型标签的可分性保持在有竞争力的水平。这意味着密集簇不会被模糊,稀有过渡状态也不会在整体背景中丢失。
重要的是,密度的改善并非以牺牲基本可视化质量为代价:分离不同群体所需的邻域数据结构得以保留。这种平衡对于分析复杂生物系统尤其宝贵,因为全局规律和局部细节都至关重要。
可用性与细节
源代码、数据处理脚本和实验配置可在项目仓库中获取。论文本身共22页,包含5张图、2张表和补充材料。得益于开放的实现,该方法可以被复现并适配到自己的数据集,也可以与其他密度保留可视化方法进行比较。



