OlmoEarth嵌入:如何从工作室输出卫星数据的矢量表示并应用于分析

21 八月 202618 视图

OlmoEarth Studio让你生成关于地球图像的紧凑数字描述,并保存为GeoTIFF. 这些矢量可用于在少数例子上找到类似的区域或火车分割模型.

OlmoEarth嵌入:如何从工作室输出卫星数据的矢量表示并应用于分析

卫星数据嵌入是什么,为什么需要这些数据?

卫星图像不仅仅是图片,而是多维数据:光谱波段,极化,时间序列. 直接与他们合作是困难的:一个模型可能会在噪音中迷路,分析师需要快速比较大面积. 这就是嵌入式——紧凑的矢量表示,将场景的精髓压缩成数字矢量. 这种矢量可以比较,集群,并用作机器学习的特性.

OlmoEarth嵌入物由接受地球观测数据培训的开放式基础模型建造。 它们的关键特征是源代码和权重是公开的——任何人都可以核实一个矢量是如何产生的,并且 必要时,自行复制计算。 这增加了信任和灵活性:结果不是一个"黑匣子".

OlmoEarth如何嵌入工作

奥尔莫地球工作室是什么

OlmoEarth Studio是一种服务,你可以计算地球表面特定区域的嵌入,并导出为即时使用的文件. 该工作室不是预先建立的全球矢量档案,而是按要求进行嵌入计算,量身定制,以适应具体情况. 这意味着你可以得到特定月份或季节的图像,而不是安顿在平均图片上.

可设定哪些参数

在启动计算时,用户指定了几个参数:

  • 兴趣领域 ——一个多边形,定义用于分析的地域.
  • 时间范围 从1个月到12个月。
  • 编码器变体 ——将图像转化为矢量的模型. 有三种选择: 纳诺 (128维,1.4M参数), 小声 (192维,6.2M参数)和 基础 (768维,89M参数). 模型越大,代表性越丰富,但计算要求也越高.
  • 决议 ——10,20,40,或每像素80米. 选择取决于任务的规模:精细的分辨率西服点级分析,而粗细的分辨率用于区域调查.
  • 图像来源 ——哨兵-2 L2A,哨兵-1RTC,或两者兼有. 前者提供光学数据,后者提供雷达数据.

所有这些设置都可以通过图形界面和API获得,因此这一过程可以很容易地集成到自动化管道中.

如何从 Studio 导出嵌入

OlmoEarth Studio的嵌入过程就像一个标准的预测工作流程: 首先,模型被配置和运行 ,然后下载结果。 不需要额外的出口步骤。

输出数据格式

结果被保存为Cloud-Optimized GeoTIFF(COG)——一种为云存储和流化而优化的格式. 在文件内部,一个波段对应一个嵌入维度. 例如,对于Tiny模型,这意味着192个波段——每个波段都有自己的数值.

数值以紧凑的形式存储——按签名的8位整数从−127到+127. 为缺失数据(无数据)保留了−128的特殊值. 这种编码大大缩小了文件大小,但分析可能需要恢复原来的浮向量. 为此, dequantize_embeddings 函数在 olmoearth_pretrain 软件包 – 它将整数转换回分数。

获得服务

要通过 Studio 导出自定义嵌入, 您需要请求访问此功能 。 对于不等待访问而自行计算矢量的人,有公开的模型——运行它们的指示在项目文件中公布.

嵌入分析的应用

嵌入的主要价值是,它们将原始卫星数据转化为方便的特征,可以用来解决实际任务,而不需要劳动密集型的大数据集的标签.

相似性搜索

通过将矢量相互比较,可以找到与给定引用相似的区域. 例如,在使用OlmoEarth-v1-Tiny模型(192维度,40米分辨率,Sentinel-2 L2A)的试验案例中,城市发展在没有单一标注样本的情况下成功从农田中分离出来. 您只需设置一个查询向量, 余弦相似度显示哪些区域与它最相似, 哪些区域则完全不同。

这种方法对快速领土清查很有用:异常探测、对照参考地貌类型分类以及检查季节间的变化。

几枪分割

嵌入在有限标签的任务中也表现良好. 在Ca Mau(越南)的一次实验中,研究人员使用一个线性分类器,仅培训了60个标有像素的像素——红树林、水和其他土地三个类别各20个。 加权的F1-分数达到0.84,这对这样一套规模不大的培训相当值得尊重。 值得注意的是,标签数量从30个增加到300个,准确性几乎没有改变,这意味着嵌入物已经包含足够的信息,可供模型迅速到达高原.

这使得该方法对专业知识昂贵或领土难以进入的项目具有吸引力:与其说是几千个贴标签的像素,不如说几十个就足够了.

常问问题

嵌入奥尔莫地球:卸载和应用分析