Por qué preservar la densidad en los embeddings biológicos
Las representaciones de baja dimensión se han convertido en una herramienta estándar para estudiar datos unicelulares: permiten ver cómo las células se agrupan en poblaciones y rastrear estados transitorios. Sin embargo, los métodos clásicos de visualización como t-SNE o UMAP preservan bien las vecindades locales, pero a menudo distorsionan la densidad aparente de los puntos. Como resultado, los grupos densos de células parecen dispersos, mientras que los estados raros, por el contrario, se fusionan en una sola nube. Esto dificulta seriamente la interpretación de trayectorias celulares continuas y de poblaciones transitorias poco numerosas.
Cuando se pierde la densidad de la distribución original, el investigador puede confundir ruido aleatorio con una población distinta o pasar por alto un fenotipo transitorio importante. Por eso surge el reto: construir una visualización que preserve simultáneamente la estructura de vecindad y la densidad local de los puntos.

Cómo funciona DMT-Dens
Un grupo de investigadores propuso un método paramétrico de visualización que optimiza directamente la preservación de la densidad. El modelo, llamado DMT-Dens, está construido sobre un codificador Transformer de tokens latentes. La red se entrena para mapear datos biológicos de alta dimensión a un espacio bidimensional de manera que la clasificación de los vecinos más cercanos en el espacio original y en la proyección permanezca consistente.
Para ello se utiliza una combinación de dos mecanismos:
- alineación de rangos de variedades — el modelo aprende a preservar el orden de las distancias entre objetos, no las distancias en sí;
- agregación de pares rígidos — se presta especial atención a aquellos pares de puntos que se encuentran en el límite de transición entre regiones densas y dispersas.
La idea clave de la función de pérdida es la correlación de Pearson entre los radios logarítmicos de los k vecinos más cercanos en el espacio original y en el embedding bidimensional resultante. Esto permite al modelo penalizar los casos en los que la densidad en la proyección no corresponde a la original. El logaritmo de los radios hace que la estimación sea robusta frente a valores atípicos y al escalado de los datos.

Resultados de los benchmarks
Los autores probaron el método en varios conjuntos de datos biológicos. La conclusión principal: DMT-Dens realmente preserva la densidad mucho mejor que los métodos de visualización tradicionales, mientras que la separabilidad de las etiquetas de tipos celulares se mantiene en un nivel competitivo. Esto significa que los clusters densos no se difuminan y los estados transitorios raros no se pierden en el fondo general.
Es importante que la mejora de la densidad no se logre a costa de empeorar la calidad básica de la visualización: la estructura de vecindad de los datos, necesaria para separar diferentes poblaciones, se conserva. Este equilibrio es especialmente valioso para el análisis de sistemas biológicos complejos, donde importan tanto los patrones globales como los detalles locales.
Disponibilidad y detalles
El código fuente, los scripts de procesamiento de datos y las configuraciones de los experimentos están disponibles en el repositorio del proyecto. El artículo en sí ocupa 22 páginas e incluye 5 figuras, 2 tablas y material complementario. Gracias a la implementación abierta, el método puede reproducirse y adaptarse a los propios conjuntos de datos, así como compararse con otros enfoques de preservación de la densidad en la visualización.



