Drone Görüntülerinde Nesne Tespiti İçin Derin Öğrenme Yöntemlerinin İncelenmesi
VisDrone ve COCO veri setleri üzerinde test edilen, İHA görüntülerinde gerçek zamanlı nesne tespiti için YOLO tabanlı derin öğrenme yöntemlerini inceleyen bir yüksek lisans projesi.

Bu çalışma, drone (İHA) görüntülerinde nesne tespiti için kullanılan derin öğrenme yöntemlerinin kapsamlı bir incelemesini sunan yüksek lisans araştırma makalemdir.
Motivasyon
Drone görüntüleri; kuş bakışı açı, yüksek ölçek değişkenliği, küçük nesne boyutları ve karmaşık arka plan gibi kendine özgü zorluklar barındırıyor. Bu özellikler, standart nesne tespiti yöntemlerinin doğrudan uygulanmasını zorlaştırıyor ve alana özgü çözümler gerektiriyor.

İncelenen Yöntem Kategorileri
Geleneksel görüntü işleme yöntemlerinden başlayarak üç ana kategori sistematik olarak ele alındı:
- İki aşamalı dedektörler (Faster R-CNN, Mask R-CNN): önce aday bölgeler öneriliyor, sonra bu bölgeler sınıflandırılıyor — yüksek doğruluk ama düşük hız.
- Tek aşamalı dedektörler (YOLO serisi v3'ten YOLO11'e, SSD, RetinaNet): tespiti tek adımda yapıyor, gerçek zamanlı uygulamalar için avantajlı.
- Transformer tabanlı mimariler (DETR, Swin Transformer): dikkat mekanizmalarıyla global bağlam yakalıyor, yüksek doğruluk sağlıyor ama hesaplama maliyeti yüksek.
Veri Setleri
Karşılaştırmalar, alanın temel benchmark veri setleri üzerinden yapıldı:
- VisDrone: 10.209 görüntü, 10 nesne kategorisi, görüntü başına ortalama 52 nesne — küçük nesne tespiti için kritik bir referans.
- UAVDT: kentsel trafik senaryolarına özel, 80.000 video karesi, ~850.000 bounding box.
- Ayrıca Stanford Drone Dataset, AU-AIR ve DOTA gibi ek veri setleri de değerlendirmeye dahil edildi.
Değerlendirmede kesinlik (precision), geri çağırma (recall), F1-Score ve özellikle mAP@0.5 / mAP@0.5:0.95 metrikleri kullanıldı; gerçek zamanlı kullanılabilirlik için FPS (kare/saniye) ayrıca raporlandı.
Sonuçlar — VisDrone Veri Seti
| Yöntem | Kategori | mAP@0.5 | mAP@0.5:0.95 | FPS |
|---|---|---|---|---|
| Faster R-CNN | İki Aşamalı | 23.5 | 12.3 | 7 |
| YOLOv4 | Tek Aşamalı | 26.3 | 14.2 | 62 |
| YOLOv7 | Tek Aşamalı | 30.1 | 16.8 | 83 |
| YOLOv8-m | Tek Aşamalı | 32.5 | 18.1 | 90 |
| YOLO11-m | Tek Aşamalı | 36.8 | 21.2 | 88 |
| DETR | Transformer | 25.6 | 13.9 | 28 |
| Swin-B | Transformer | 31.7 | 17.6 | 22 |
Sonuçlar — UAVDT Veri Seti (Araç Tespiti)
| Yöntem | Kategori | AP50 | FPS |
|---|---|---|---|
| Faster R-CNN | İki Aşamalı | 34.7 | 9 |
| YOLOv4 | Tek Aşamalı | 42.5 | 65 |
| YOLOv8-m | Tek Aşamalı | 52.1 | 92 |
| EfficientDet-D3 | Tek Aşamalı | 45.3 | 38 |
| DETR | Transformer | 41.0 | 30 |

Temel Bulgular
- YOLO11, hem doğruluk hem hız açısından en iyi dengeyi sunan yöntem olarak öne çıkıyor.
- Transformer tabanlı modeller (özellikle Swin-B) yüksek doğruluk sağlıyor ama hesaplama maliyeti gerçek zamanlı gömülü uygulamalar için hâlâ bir engel.
- Küçük nesne tespiti, drone görüntüleme senaryolarında en kritik açık araştırma problemi olmaya devam ediyor — Feature Pyramid Networks (FPN) ve dikkat mekanizmaları en umut verici yaklaşımlar arasında.
Gerçek Dünya Uygulanabilirliği
Bir drone sisteminde nesne tespit modeli, sınırlı hesaplama gücüne sahip gömülü bir platformda (örn. NVIDIA Jetson) çalışmak zorunda. Model sıkıştırma teknikleri (quantization, pruning, knowledge distillation) bu açığı kapatmada kritik rol oynuyor — YOLOv8-nano gibi kompakt modeller, yeterli doğruluğu korurken belirgin hız kazanımları sağlıyor. Ayrıca farklı iklim koşulları veya kentsel/kırsal ortam değişimlerine karşı bağlamsal uyarlama (domain adaptation) kapasitesi, modellerin gerçek dünyada güvenilir çalışabilmesi açısından önemini koruyor.
Sonuç
YOLO11 serisi, günümüzde drone uygulamaları için en iyi hız-doğruluk dengesini sunan yöntemler arasında öne çıkıyor. Transformer tabanlı modeller doğruluk açısından rekabetçi olsa da, hesaplama maliyeti gerçek zamanlı gömülü uygulamalar için hâlâ aşılması gereken bir engel oluşturuyor. Küçük nesne tespiti, alanın en kritik açık araştırma problemi olmaya devam ediyor.
Aşağıda COCO ve VisDrone veri setleri üzerindeki test videolarını, kullanılan görselleri ve makalenin/sunumların tam metnini bulabilirsiniz.
