Classificação de cobertura do solo com séries temporais Sentinel-2 e rótulos MapBiomas

Preprintv1.0 · SBrT 2026 submission method note
João Leonardi MeloJoão Leonardi Melo, D. K. Magalhães, J. E. Kolodziej e E. V. KuhnORCID5 min
View on GitHub

Classificador Random Forest sobre features espectro-temporais Sentinel-2 L2A, com rótulos MapBiomas (Coleção 10) e validação cruzada espacial por blocos em três propriedades do oeste do Paraná — método do projeto GeoSense (SBrT 2026). A aposta é fenologia: uma única data confunde culturas; a trajetória temporal discrimina.

Neste post documentamos o empilhamento de bandas, o protocolo de CV espacial, a matriz de confusão e a retenção cumulativa de Soja ao longo do ciclo.

Motivação

A discriminação de culturas agrícolas a partir de uma única imagem é limitada. Culturas distintas podem apresentar resposta espectral semelhante em uma data isolada, mas trajetórias temporais diferentes ao longo do ciclo. O uso de séries temporais descreve cada pixel por sua assinatura espectro-temporal, o que baseia a classificação na dinâmica fenológica em vez da aparência instantânea.

Dados

  • Sentinel-2 L2A (ESA/Copernicus): 22 imagens multiespectrais adquiridas entre maio de 2024 e janeiro de 2026, bandas B02 (490 nm), B03 (560 nm), B04 (665 nm) e B08 (842 nm), resolução espacial de 10 m.
  • MapBiomas Coleção 10 (ano-base 2023, 30 m): rótulos de referência reamostrados para 10 m por interpolação Nearest Neighbor.

O estudo cobre três propriedades privadas na mesorregião oeste do Paraná, com rotações de cultura distintas documentadas pelos proprietários (soja no verão alternada com cereais de inverno).

Engenharia de features

Cada pixel é descrito por 80 features espectro-temporais, organizadas em três grupos:

  1. 42 estatísticas temporais de índices (NDVI, EVI, SAVI): média, desvio padrão, mediana, mínimo, máximo, amplitude, IQR, coeficiente de variação, assimetria, curtose e percentis 10/25/75/90, calculadas por índice.
  2. 16 estatísticas espectrais: média, desvio padrão, mínimo e máximo temporais das bandas B02, B03, B04 e B08.
  3. 22 valores brutos de NDVI: a série completa, um valor por data de aquisição.

O NDVI é a diferença normalizada entre as bandas do infravermelho próximo e do vermelho:

NDVI=ρNIRρREDρNIR+ρRED\mathrm{NDVI} = \frac{\rho_{NIR} - \rho_{RED}}{\rho_{NIR} + \rho_{RED}}

Classificador e validação

O classificador é um Random Forest com n_estimators=300, max_features igual à raiz do número de features e class_weight='balanced', treinado sobre os rótulos MapBiomas.

A avaliação usa StratifiedGroupKFold com 5 folds, em que os grupos são blocos espaciais de 10x10 pixels (100 m). O particionamento por blocos controla a autocorrelação espacial entre treino e teste. Pixels vizinhos, que tendem a compartilhar rótulo e assinatura, permanecem no mesmo fold, o que reduz a superestimação da acurácia por vazamento espacial. As predições são agregadas via cross_val_predict sobre o conjunto completo (N = 3010).

Resultados

Métricas globais

Valores obtidos com partição espacial por blocos, 5 folds, N = 3010 pixels da Propriedade A (5 classes):

MétricaValor
Acurácia global (OA)0,7625
Coeficiente Kappa0,6195
F1 macro0,6386
F1 ponderado0,7550
mIoU0,4965

IoU por classe

ClasseIoUn amostras
Soja0,81031679
Formação Florestal0,6667420
Área não Vegetada0,388996
Outras Lavouras Temporárias0,3599387
Mosaico Agricultura-Pastagem0,2568428

A classe Soja apresenta o maior IoU (0,8103). A matriz de confusão indica recall de 0,91 para Soja (1529 de 1679 amostras). As maiores confusões ocorrem entre classes com assinatura temporal próxima. O Mosaico de Agricultura e Pastagem dispersa-se por Formação Florestal, Soja e Outras Lavouras Temporárias, padrão consistente com o caráter heterogêneo dessa classe.

Matriz de confusão normalizada da validação cruzada espacial por blocos (5 folds, N = 3010, 5 classes). Valores absolutos e proporções por linha (classe verdadeira MapBiomas).
Matriz de confusão normalizada da validação cruzada espacial por blocos (5 folds, N = 3010, 5 classes). Valores absolutos e proporções por linha (classe verdadeira MapBiomas).

Validação com calendários dos proprietários

Além das métricas contra o MapBiomas, foi avaliado um protocolo de empilhamento temporal cumulativo. O classificador é aplicado a cada propriedade em etapas sucessivas. Na t-ésima etapa, o vetor de features é reconstruído apenas com as imagens entre a primeira data e a data t. A métrica é a retenção de Soja, definida como a fração dos pixels rotulados como Soja pelo MapBiomas que o classificador mantém nessa classe ao longo do ciclo.

A figura a seguir apresenta a classificação em cinco datas representativas por propriedade, com a retenção de Soja indicada em cada painel.

Classificação de cobertura do solo em cinco datas por propriedade (A, B, C). O rótulo "Soja ret." indica a retenção de Soja acumulada até a data. Legenda: Formação Florestal (verde), Mosaico Agricultura-Pastagem (amarelo), Área não Vegetada (vermelho), Soja (azul), Outras Lavouras Temporárias (roxo).
Classificação de cobertura do solo em cinco datas por propriedade (A, B, C). O rótulo "Soja ret." indica a retenção de Soja acumulada até a data. Legenda: Formação Florestal (verde), Mosaico Agricultura-Pastagem (amarelo), Área não Vegetada (vermelho), Soja (azul), Outras Lavouras Temporárias (roxo).

A partir de janeiro de 2025, a retenção de Soja converge para 84 a 98% nos ciclos subsequentes nas três propriedades, à medida que o empilhamento temporal se consolida. Na Propriedade C, os períodos de milho foram classificados predominantemente como Mosaico de Agricultura e Pastagem. Esse padrão sugere que o classificador captura a assinatura espectro-temporal da rotação soja-cereal de inverno, o que requer confirmação com verdade de campo independente.

Limitações

  • Dependência circular: treinamento e validação cruzada baseiam-se ambos no MapBiomas.
  • Defasagem temporal entre os rótulos de referência (ano-base 2023) e as imagens (2024-2026).
  • Possíveis pixels mistos decorrentes da reamostragem de 30 m para 10 m.
  • Ausência de métricas pixel a pixel contra verdade de campo independente. A validação com calendários documentados atenua parcialmente essa limitação, mas não a substitui.

Software

O método está empacotado no aplicativo desktop de código aberto TERRA (Wails + Python sidecar): AOI interativa, STAC/COG, Random Forest / Temporal Transformer / Prithvi, análise e comparação de runs. Releases em sabores FULL (Python embutido para o caminho espectral) e LITE. Documentação: Install, Roadmap.

Referências

  • Melo, J. L. S., Magalhães, D. K., Kolodziej, J. E., Kuhn, E. V. (2026). Classificação Automática de Cobertura de Solo com Séries Temporais do Sentinel-2 e do MapBiomas. XLIV Simpósio Brasileiro de Telecomunicações e Processamento de Sinais (SBrT 2026), Salvador, BA.
  • Breiman, L. (2001). Random forests. Machine Learning, 45(1), 5-32.

Related reading

  1. Classificação Automática de Cobertura de Solo com Séries Temporais do Sentinel-2 e do MapBiomasMelo, J. L. S., Magalhães, D. K., Kolodziej, J. E., Kuhn, E. V., 2026

Data availability

License
MIT

Sentinel-2 L2A and MapBiomas C10 labels; training/validation share MapBiomas labels (circularity caveat). Desktop software: TERRA (LITE/FULL releases).