Як знаходити об’єкти та зміни на супутникових знімках швидше: нові можливості GeoAI в ArcGIS
Супутникових та аерофотознімків стає більше, їхня періодичність зростає, а завдання GIS-фахівця дедалі частіше полягає не просто у візуальному перегляді зображення, а у швидкому пошуку потрібних об’єктів і закономірностей у великих масивах даних.
Наприклад, потрібно знайти на великій території об’єкти, схожі на вже відомий, виявити ділянки із певним типом забудови, проаналізувати земний покрив, знайти подібні промислові майданчики або підготувати дані для автоматизованої класифікації. Для таких задач Esri розширює можливості GeoAI в ArcGIS і додає підтримку геопросторових foundation models - базових моделей, попередньо навчених безпосередньо на супутникових та аерофотознімках.
Чим foundation models відрізняються від традиційного підходу
Багато моделей комп’ютерного зору, які раніше застосовувалися для аналізу даних дистанційного зондування Землі, використовували як основу моделі, попередньо навчені на ImageNet - великому наборі звичайних фотографій людей, тварин, меблів, транспортних засобів та інших повсякденних об’єктів.
Такий підхід працює, але модель спочатку вчиться розуміти звичайні фотографії, а вже потім адаптується до супутникового зображення. Remote Sensing Foundation Models навчаються інакше - на великих масивах супутникових та аерофотознімків. Завдяки цьому вони від початку працюють із просторовими структурами, текстурами, спектральними характеристиками та контекстом, типовими саме для Earth Observation.
Це особливо важливо для задач, де потрібно аналізувати:
-
земний покрив;
-
забудову;
-
транспортну або інженерну інфраструктуру;
-
сільськогосподарські території;
-
ліси та водні об’єкти;
-
наслідки пожеж, затоплень або інших змін території;
-
об’єкти на високодетальних аерофото- та супутникових знімках.
У ArcGIS такі моделі можна використовувати двома основними способами: створювати embeddings для зображень або донавчати foundation model під конкретну задачу.
Що таке embeddings і навіщо вони GIS-фахівцю
Як працюють embeddings: модель перетворює зображення на числове представлення, що зберігає просторові, текстурні та контекстні характеристики об’єкта. Джерело: Esri.
Одна з ключових можливостей нового підходу - embeddings. Embedding - компактне числове представлення фрагмента зображення, яке зберігає його важливі характеристики: просторову структуру, текстуру, спектральні властивості та взаємозв’язки між об’єктами. Фактично це можна розглядати як своєрідний «геопросторовий відбиток» ділянки. Замість того щоб порівнювати між собою мільйони пікселів, система порівнює такі числові представлення.
Наприклад, GIS-фахівець знаходить на супутниковому знімку сонячну електростанцію і хоче знайти інші схожі об’єкти на значно більшій території. Піксельне порівняння у цьому випадку може бути ненадійним: знімки могли бути отримані різними сенсорами, у різний сезон, з іншими умовами освітлення або з різною кольоропередачею. Foundation model перетворює зображення на embedding, який описує не конкретний набір значень пікселів, а характерні властивості сцени. Тому подібні об’єкти можуть мати схожі embeddings навіть тоді, коли візуально окремі пікселі значно відрізняються. Саме це дозволяє виконувати similarity search — пошук схожих територій або об’єктів у великих масивах imagery.
Для користувачів це може бути корисно, наприклад, коли потрібно:
- для громад і містобудування - знайти території зі схожим типом забудови або просторовою структурою;
- для енергетики - шукати об’єкти певного типу або аналізувати території навколо енергетичної інфраструктури;
- для агросектору - групувати території зі схожими характеристиками поверхні або рослинності;
- для екологічного моніторингу - знаходити схожі ділянки лісу, водойм, берегової лінії або територій із певним типом земного покриву;
- для інфраструктурних проєктів - швидше аналізувати великі масиви аерофотознімків або супутникових даних замість послідовного ручного перегляду.
Які foundation models підтримує ArcGIS
Приклади різних типів даних дистанційного зондування, з якими можуть працювати remote sensing foundation models: SAR, RGB та multispectral imagery. Джерело: Esri.
ArcGIS інтегрує кілька open-source моделей для Earth Observation, серед яких:
-
TerraMind;
-
Prithvi EO 2.0;
-
Clay;
-
DOFA;
-
DINO.
Моделі відрізняються за архітектурою, типами даних і задачами, для яких вони найбільш придатні. Наприклад, Prithvi EO 2.0, розроблена IBM та NASA, навчалася на Harmonized Landsat Sentinel-2 imagery. ArcGIS підтримує версії моделі на 300 та 600 млн параметрів.
Моделі DINOv2 та DINOv3 добре працюють із високодетальними RGB-аеро- та супутниковими зображеннями і можуть використовуватися для створення сильних візуальних embeddings. DINOv3 також навчалася на високодетальних орторектифікованих супутникових зображеннях.
Це означає, що під час побудови workflow GIS-фахівець може підбирати модель не за принципом «яка AI-модель новіша», а залежно від типу imagery та конкретної аналітичної задачі.
Два основні сценарії роботи
1. Генерація embeddings
Перший сценарій - використати foundation model для створення embeddings із imagery.
Вони можуть бути основою для:
-
similarity search;
-
image retrieval;
-
кластеризації;
-
machine learning;
-
пошуку територій із подібними характеристиками.
Такий підхід корисний, коли немає потреби одразу створювати окрему модель object detection або pixel classification.
GIS-фахівець може спочатку перетворити великий набір imagery на embeddings, а потім шукати в ньому просторово схожі об’єкти та ділянки.
2. Fine-tuning під власну задачу
Другий підхід - донавчити foundation model на власних розмічених даних. Класична модель часто потребує значного набору training samples. Foundation model уже має базове розуміння супутникових та аерофотознімків, тому її можна адаптувати до конкретної задачі з меншою кількістю розмічених прикладів і меншими витратами часу на тренування.
Такі моделі можна використовувати разом із deep learning tools в ArcGIS Pro та через arcgis.learn Python API.
Вибір foundation model як Backbone Model під час навчання Deep Learning Model в ArcGIS Pro. На прикладі - Prithvi EO 2.0 600M. Джерело: Esri.
Наприклад, foundation model може бути backbone для подальшого навчання pixel classification model, коли потрібно виділяти певний тип земного покриву, або для інших задач feature extraction та object detection.
Але модель - лише половина задачі: важливий Grid Size
Для GIS-фахівця тут є принциповий момент. Результат similarity search залежить не лише від того, яку foundation model обрано.
Не менш важливим є Grid Size. Під час створення embeddings ArcGIS розділяє imagery на регулярну сітку. Кожна комірка обробляється незалежно та перетворюється на embedding vector. Тобто Grid Size фактично визначає, яку площу місцевості описуватиме один embedding. Якщо сітка занадто велика, до одного embedding можуть потрапити одразу декілька різних об’єктів і значна кількість фону.
Наприклад, якщо потрібно знайти автомобілі, великий Grid Size може одночасно охоплювати машину, асфальт, дерева, будівлі та інші елементи. У результаті embedding описуватиме вже не сам автомобіль, а цілий фрагмент міського середовища. Якщо Grid Size занадто малий, виникає інша проблема: великий об’єкт може бути розділений між кількома комірками. У такому випадку модель бачить лише окремі фрагменти об’єкта і гірше враховує його загальну структуру.
Esri показує це на прикладі автомобілів: дуже великі та дуже малі grid values погіршували similarity search, тоді як сітка близько 1,3 м краще відповідала масштабу об’єкта у конкретному наборі imagery. Це не універсальне значення для автомобілів - воно залежить від роздільної здатності конкретного зображення і параметрів задачі.
Загальний принцип такий:
|
Об’єкт |
Типова тенденція Grid Size |
|
автомобілі |
малий |
|
басейни |
малий |
|
окремі будівлі |
малий–середній |
|
сонячні електростанції |
середній |
|
аеропорти |
великий |
|
лісові масиви |
великий |
|
згарища |
дуже великий |
|
великі сільськогосподарські території |
дуже великий |
Тобто Grid Size потрібно підбирати відповідно до фізичного масштабу об’єкта, який аналізується.
Просторова роздільна здатність знімка також критично важлива
Ще одна типова помилка - очікувати, що сильніша AI-модель компенсує недостатню деталізацію вихідного imagery. Не компенсує. AI може аналізувати лише ту інформацію, яку фізично зафіксував сенсор. Наприклад, якщо потрібно стабільно виявляти невеликий об’єкт на знімку з недостатньою просторовою роздільною здатністю, збільшення складності моделі не поверне деталей, яких немає у вихідних пікселях.
Тому перед запуском GeoAI workflow потрібно співвіднести щонайменше три речі:
розмір об’єкта → spatial resolution imagery → Grid Size.
Особливо це важливо під час роботи з imagery різного походження - наприклад, Sentinel, комерційними супутниковими даними та аерофотозйомкою БПЛА. Одна й та сама задача може потребувати абсолютно різних параметрів залежно від просторової роздільної здатності джерела.
Коли Grid Size краще не задавати вручну
Для single-resolution raster datasets Esri рекомендує, як правило, залишати параметр Grid Size порожнім. У такому випадку ArcGIS автоматично розраховує значення на основі native image resolution. Це допомагає уникнути зайвого ресемплінгу та зберегти вихідні значення пікселів.
Для mosaic datasets та image services ситуація складніша, оскільки в одному джерелі можуть бути зображення з різною просторовою роздільною здатністю. У такому workflow Grid Size впливає не лише на масштаб embeddings, але й на те, imagery якої роздільної здатності ArcGIS вибере для обробки.
Тому для mosaic dataset цей параметр уже безпосередньо впливає і на просторовий контекст embedding, і на вихідні дані, на яких він буде сформований.
Чи можна просто збільшити зображення перед аналізом
Технічно raster можна ресемплити до меншого cell size, але це не створює нової реальної інформації. Esri наводить приклад DINOv2 із patch size 14. Якщо модель обробляє imagery з native resolution 10 см і розрахований cell size також становить приблизно 10 см, вихідні дані добре відповідають вимогам моделі. Якщо ж imagery має native resolution 1 м, але в процесі його доводиться ресемплити до 10 см, система фактично інтерполює відсутні значення. Це може створювати артефакти та погіршувати якість embeddings і similarity search.
Тому для GeoAI важливіше правильно підібрати джерело даних, ніж намагатися штучно збільшити деталізацію вже після отримання знімка.
Що це змінює у повсякденній роботі GIS-фахівця
Foundation models не замінюють класичні GIS-операції або deep learning workflows. Вони дають іншу точку входу в задачу. Раніше для автоматизованого пошуку певного типу об’єкта часто потрібно було:
підготувати training samples → вибрати architecture → навчити модель → перевірити accuracy → виконати inference.
Тепер для частини задач можна почати з foundation model, яка вже навчена працювати з Earth Observation imagery.
Якщо задача полягає у пошуку схожих територій, інколи достатньо embeddings і similarity search. Якщо ж потрібно отримати конкретні GIS-об’єкти або класи - foundation model можна використати як сильну основу для fine-tuning. ArcGIS інтегрує ці моделі безпосередньо у звичні GIS та deep learning workflows, тому фахівцю не потрібно будувати окремий ML pipeline лише для того, щоб почати працювати з сучасними Earth Observation models.
Для України це особливо актуально там, де GIS-фахівці регулярно працюють із великими обсягами супутникових та аерофотоданих: у моніторингу територій громад, землеустрої, агросекторі, екології, інфраструктурі, містобудуванні та аналізі змін території. Ключове питання тепер не лише в тому, яку AI-модель використати, а й у тому, чи відповідають їй вихідні дані, масштаб об’єкта та просторове розрізнення imagery. Саме від цього значною мірою залежатиме, чи знайде GeoAI потрібний об’єкт - чи просто побачить набір схожих пікселів.
Потрібна допомога з впровадженням GeoAI в ArcGIS?
ECOMM Co - офіційний партнер Esri в Україні. Ми допомагаємо підібрати та впровадити рішення ArcGIS під конкретні задачі організації: від роботи із супутниковими й аерофотознімками та налаштування GeoAI-інструментів до розгортання корпоративної GIS-інфраструктури.
Фахівці ECOMM Co надають консультації щодо вибору й ліцензування програмних продуктів ArcGIS, допомагають із впровадженням, проводять навчання користувачів та забезпечують технічну підтримку під час подальшої роботи із системою.
Якщо ви плануєте використовувати ArcGIS Pro, ArcGIS Enterprise, Image Analyst або GeoAI для аналізу даних дистанційного зондування, звертайтеся до нас - допоможемо визначити оптимальний набір інструментів і налаштувати workflow відповідно до ваших задач.
Працюєте з ArcGIS або GIS загалом? Тоді 13–14 жовтня вам точно є з ким зустрітися.
«GIS + AI: Нові горизонти розвитку» - єдина конференція ArcGIS в Україні. Два дні, коли в одному місці збираються люди, які працюють із тими самими даними, технологіями й задачами, що й ви.
Де ще за два дні побачити стільки практичних кейсів, знайомих задач і людей із вашого професійного середовища?