ओल्मोएर्थ एम्बेडिंग: स्टूडियो से उपग्रह डेटा के वेक्टर प्रतिनिधित्व का निर्यात कैसे करें और उन्हें विश्लेषण में लागू करें

21 अगस्त 202618 बार देखा गया

ओल्मोएर्थ स्टूडियो आपको पृथ्वी इमेजरी के कॉम्पैक्ट संख्यात्मक विवरण उत्पन्न करने और उन्हें जियोटीएफएफ के रूप में बचाने की सुविधा देता है। इन वैक्टरों का उपयोग उदाहरणों की एक छोटी संख्या पर समान क्षेत्रों या ट्रेन विभाजन मॉडल खोजने के लिए किया जा सकता है।.

ओल्मोएर्थ एम्बेडिंग: स्टूडियो से उपग्रह डेटा के वेक्टर प्रतिनिधित्व का निर्यात कैसे करें और उन्हें विश्लेषण में लागू करें

उपग्रह डेटा एम्बेडिंग क्या हैं और उन्हें क्यों चाहिए

सैटेलाइट इमेजरी सिर्फ चित्र नहीं बल्कि बहुआयामी डेटा है: वर्णक्रमीय बैंड, ध्रुवीकरण, समय श्रृंखला। उनके साथ सीधे काम करना मुश्किल है: एक मॉडल शोर में खो सकता है, और विश्लेषकों को बड़े क्षेत्रों की तुलना करने की आवश्यकता होती है। यह वह जगह है जहां एम्बेडिंग आती है - कॉम्पैक्ट वेक्टर प्रतिनिधित्व जो एक दृश्य के सार को संख्यात्मक वेक्टर में संपीड़ित करते हैं। इस तरह के वेक्टर की तुलना, क्लस्टर और मशीन लर्निंग के लिए सुविधाओं के रूप में इस्तेमाल किया जा सकता है।

ओल्मोएर्थ एम्बेडिंग को पृथ्वी अवलोकन डेटा पर प्रशिक्षित ओपन फाउंडेशन मॉडल द्वारा बनाया गया है। उनकी मुख्य विशेषता यह है कि स्रोत कोड और वजन सार्वजनिक रूप से उपलब्ध हैं - कोई भी वास्तव में यह सत्यापित कर सकता है कि वेक्टर कैसे बनाया गया था और कैसे किया गया था। , यदि आवश्यक हो, तो खुद गणना को पुन: उत्पन्न करें। यह विश्वास और लचीलापन जोड़ता है: परिणाम एक "ब्लैक बॉक्स" नहीं है।

कैसे ओल्मोएर्थ एम्बेडिंग काम करते हैं

ओल्मोएर्थ स्टूडियो क्या है?

ओल्मोएर्थ स्टूडियो एक ऐसी सेवा है जहां आप पृथ्वी की सतह के एक चयनित क्षेत्र के लिए एम्बेडिंग की गणना कर सकते हैं और उन्हें तैयार-से-उपयोग फ़ाइलों के रूप में निर्यात कर सकते हैं। वेक्टरों के पूर्व निर्मित वैश्विक संग्रह के बजाय, स्टूडियो मांग पर एम्बेड करता है, जो विशिष्ट स्थितियों के अनुरूप है। इसका मतलब यह है कि आप एक विशिष्ट महीने या मौसम के लिए इमेजरी प्राप्त कर सकते हैं, बजाय एक औसत चित्र के लिए बसने के बजाय।

क्या पैरामीटर सेट किया जा सकता है

कम्प्यूटेशन शुरू करते समय उपयोगकर्ता कई मापदंडों को निर्दिष्ट करता है:

  • ब्याज क्षेत्र - एक बहुभुज जो विश्लेषण के लिए क्षेत्र को परिभाषित करता है।
  • समय सीमा - एक से बारह महीने तक।
  • एनकोडर संस्करण - मॉडल जो वेक्टर में इमेजरी बदल जाता है। तीन विकल्प उपलब्ध हैं: नैनो (128 आयाम, 1.4M पैरामीटर) टिनी (192 आयाम, 6.2M पैरामीटर), और बेस (768 आयाम, 89M पैरामीटर)। मॉडल जितना बड़ा होगा, उतना ही अमीर प्रतिनिधित्व करता है, लेकिन कम्प्यूटेशनल आवश्यकताओं को भी उतना ही अधिक होगा।
  • संकल्प - 10, 20, 40, या 80 मीटर प्रति पिक्सेल। विकल्प कार्य के पैमाने पर निर्भर करता है: ठीक रिज़ॉल्यूशन पॉइंट-लेवल विश्लेषण को सूट करता है, जबकि क्षेत्रीय सर्वेक्षणों के लिए मोटे रिज़ॉल्यूशन काम करता है।
  • इमेजरी स्रोत - Sentinel-2 L2A, Sentinel-1 RTC, या दोनों। पूर्व ऑप्टिकल डेटा प्रदान करता है, बाद में रडार डेटा।

ये सभी सेटिंग्स ग्राफिकल इंटरफ़ेस और एपीआई के माध्यम से उपलब्ध हैं, इसलिए प्रक्रिया को स्वचालित पाइपलाइनों में आसानी से एकीकृत किया जा सकता है।

स्टूडियो से एम्बेडिंग कैसे निर्यात करें

ओल्मोएर्थ स्टूडियो में एम्बेडिंग प्राप्त करने की प्रक्रिया सिर्फ एक मानक भविष्यवाणी वर्कफ़्लो की तरह काम करती है: सबसे पहले, मॉडल को कॉन्फ़िगर और रन किया गया है फिर परिणाम डाउनलोड किए जाते हैं। अतिरिक्त निर्यात चरणों की आवश्यकता नहीं है।

आउटपुट डेटा प्रारूप

परिणाम क्लाउड-ऑप्टिमाइज्ड जियोटीएफएफ (COG) के रूप में सहेजे जाते हैं - क्लाउड स्टोरेज और स्ट्रीमिंग के लिए अनुकूलित एक प्रारूप। फ़ाइल के अंदर, एक बैंड एक एम्बेडिंग आयाम से मेल खाता है। उदाहरण के लिए, छोटे मॉडल के लिए इसका मतलब 192 बैंड है - प्रत्येक अपने संख्यात्मक मूल्य के साथ।

मानों को एक कॉम्पैक्ट रूप में संग्रहीत किया जाता है - जैसा कि साइन किए गए 8-bit integers से लेकर 127 to +127. -128 का एक विशेष मूल्य लापता डेटा (nodata) के लिए आरक्षित है। यह एन्कोडिंग फ़ाइल आकार को काफी कम कर देता है, लेकिन विश्लेषण को मूल फ्लोट वेक्टर को बहाल करने की आवश्यकता हो सकती है। इस उद्देश्य के लिए, dequantize_embeddings समारोह में प्रदान की जाती है olmoearth_pretrain पैकेज - यह पूर्णांक मूल्यों को आंशिक रूप से परिवर्तित करता है।

सेवा तक पहुंच

स्टूडियो के माध्यम से कस्टम एम्बेडिंग निर्यात करने के लिए, आपको इस सुविधा तक पहुंच का अनुरोध करना होगा। उन लोगों के लिए जो एक्सेस के लिए इंतजार किए बिना अपने आप में वेक्टरों की गणना करना चाहते हैं, सार्वजनिक मॉडल उपलब्ध हैं - उन्हें चलाने के लिए निर्देश परियोजना प्रलेखन में प्रकाशित किए जाते हैं।

विश्लेषण में एम्बेडिंग के अनुप्रयोग

एम्बेडिंग का मुख्य मूल्य यह है कि वे कच्चे उपग्रह डेटा को सुविधाजनक सुविधाओं में बदल देते हैं जिसका उपयोग बड़े डेटासेट के श्रम-गहन लेबलिंग के बिना व्यावहारिक कार्यों को हल करने के लिए किया जा सकता है।

समानता खोज

एक दूसरे के साथ वेक्टर की तुलना करके, आप दिए गए संदर्भ के समान क्षेत्रों को पा सकते हैं। उदाहरण के लिए, OlmoEarth-v1-Tiny मॉडल (192 आयाम, 40 मीटर संकल्प, Sentinel-2 L2A) के साथ एक परीक्षण मामले में, शहरी विकास को सफलतापूर्वक एक लेबल नमूने के बिना कृषि भूमि से अलग किया गया था। आप केवल एक क्वेरी वेक्टर सेट करते हैं, और कॉसिन समानता दिखाता है कि कौन से क्षेत्र इसके समान हैं और जो मौलिक रूप से अलग हैं।

यह दृष्टिकोण तेजी से क्षेत्र सूची के लिए उपयोगी है: anomaly का पता लगाने, एक संदर्भ के खिलाफ परिदृश्य प्रकार का वर्गीकरण, और मौसम के बीच परिवर्तन की जाँच।

Few-shot विभाजन

एम्बेडिंग भी सीमित लेबलिंग के साथ कार्यों में अच्छी तरह से प्रदर्शन करते हैं। Ca Mau (Vietnam) में एक प्रयोग में शोधकर्ताओं ने केवल 60 लेबल वाले पिक्सेल - 20 पर तीन वर्गों में से प्रत्येक के लिए प्रशिक्षित एक रैखिक वर्गीकार का इस्तेमाल किया: मैंग्रोव वन, पानी और अन्य भूमि। भारित F1-स्कोर 0.84 तक पहुंच गया, जो इस तरह के मामूली प्रशिक्षण सेट के लिए काफी सम्मानजनक है। विशेष रूप से, 30 से 300 तक लेबल की संख्या में वृद्धि हुई, जिसका अर्थ है एम्बेडिंग पहले से ही मॉडल के लिए पर्याप्त जानकारी प्राप्त करने के लिए एक पठार तक पहुंचने के लिए।

यह उन परियोजनाओं के लिए आकर्षक दृष्टिकोण बनाता है जहां विशेषज्ञता महंगी है या क्षेत्र का उपयोग करना मुश्किल है: हजारों लेबल वाले पिक्सल के बजाय, दर्जन पर्याप्त हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
एम्बेडिंग OlmoEarth: उतराई और आवेदन विश्लेषण