The main objectives of this research are to fill a gap in PV inspection systems, which consist of convolutional detectors with a limited amount of global context or transformer classifiers with weak localization. Defects micro-cracks, broken electrodes, and degradation regions decrease the PV energy efficiency considerably, and this encourages the use of an automated computer vision algorithm for the classification of these defects extracted from electroluminescence (EL) images. These objectives were achieved by solving the following task: a novel dual-stage architecture is used to solve these tasks, which are performed sequentially, YOLOv8m followed by the Swin Transformer architecture. In comparison with previous CNN-Transformer PV models that combine features by concatenation or averaging with predefined weights, the proposed model implements a learnable cross-attention fusion probability merging ensemble, which dynamically weights the localization and global attention evidence for each defect. YOLOv8m localizes the exact positions of defects, then the Swin Transformer analyzes the region by window-swiping self-attention to return a long-range degradation pattern that CNNs can't pass. The model was trained using EL images in 12 classes, such as, intact cells, cracks, point defects, finger damage, and EL images were augmented to overcome the class imbalance problem and crossconditioning generalization. The most important results are a macro-averaged F1-score of 94.05% and 95.40% accuracy, with per-class F1 ranging from 98.98% (Mono-crystalline) to 89.04% (Micro-crack). The significance of the obtained results lies in the use of integrative localization-driven YOLOv8m convolutional features with transformer global attention and learnable cross-attention fusion instead of static cross-attention fusion, providing a new and more robust implementation to perform automated PV quality assessment than a single branch.
Principalele obiective ale acestei cercetări sunt de a umple o lacună în sistemele de inspecție fotovoltaică, care constau din detectoare convoluționale cu o cantitate limitată de context global sau clasificatoare de transformatoare cu localizare slabă. Micro-fisurile defectelor, electrozii rupți și regiunile de degradare reduc considerabil eficiența energetică a fotovoltaicului, iar acest lucru încurajează utilizarea unui algoritm automat de viziune computerizată pentru clasificarea acestor defecte extrase din imaginile de electroluminescență (EL). Aceste obiective au fost atinse prin rezolvarea următoarei sarcini: o nouă arhitectură cu două etape este utilizată pentru a rezolva aceste sarcini, care sunt efectuate secvențial, YOLOv8m urmată de arhitectura Swin Transformer. În comparație cu modelele fotovoltaice anterioare CNN-Transformer care combină caracteristici prin concatenare sau mediere cu ponderi predefinite, modelul propus implementează un ansamblu de fuziune a probabilității de fuziune a atenției încrucișate, care poate fi învățat, și care ponderează dinamic localizarea și dovezile atenției globale pentru fiecare defect. YOLOv8m localizează pozițiile exacte ale defectelor, apoi Swin Transformer analizează regiunea prin auto-atenție prin glisare pe fereastră pentru a returna un model de degradare pe termen lung pe care CNN-urile nu îl pot trece. Modelul a fost antrenat folosind imagini EL în 12 clase, cum ar fi celule intacte, fisuri, defecte punctuale, deteriorarea degetelor, iar imaginile EL au fost amplificate pentru a depăși problema dezechilibrului de clase și generalizarea condiționării încrucișate. Cele mai importante rezultate sunt un scor F1 macro-mediat de 94,05% și o precizie de 95.40%, cu un F1 per clasă variind de la 98.98% (monocristalin) la 89.04% (microfisură). Semnificația rezultatelor obținute constă în utilizarea caracteristicilor convoluționale YOLOv8m bazate pe localizare integrativă, cu atenție globală a transformatorului și fuziune încrucișată învățabilă în loc de fuziune statică încrucișată, oferind o implementare nouă și mai robustă pentru a efectua evaluarea automată a calității fotovoltaice decât o singură ramificare.
Основные цели данного исследования — восполнить пробел в системах контроля фотоэлектрических элементов, которые состоят из сверточных детекторов с ограниченным объемом глобального контекста или трансформерных классификаторов со слабой локализацией. Микротрещины, сломанные электроды и области деградации значительно снижают энергоэффективность фотоэлектрических элементов, что обуславливает необходимость использования автоматизированного алгоритма компьютерного зрения для классификации этих дефектов, извлеченных из изображений электролюминесценции (ЭЛ). Эти цели были достигнуты путем решения следующей задачи: для решения этих задач используется новая двухэтапная архитектура, которая выполняется последовательно: YOLOv8m, а затем архитектура Swin Transformer. По сравнению с предыдущими моделями CNNTransformer для фотоэлектрических элементов, которые объединяют признаки путем конкатенации или усреднения с предопределенными весами, предлагаемая модель реализует обучаемый ансамбль слияния вероятностей перекрестного внимания, который динамически взвешивает данные локализации и глобального внимания для каждого дефекта. YOLOv8m точно определяет местоположение дефектов, затем Swin Transformer анализирует область с помощью механизма самовнимания с использованием окна, чтобы получить дальний паттерн деградации, который не могут обработать сверточные нейронные сети (CNN). Модель обучалась с использованием изображений электролюминесценции (EL) в 12 классах, таких как целые клетки, трещины, точечные дефекты, повреждения пальцев, а изображения EL были дополнены для преодоления проблемы дисбаланса классов и обобщения с помощью перекрестного обусловливания. Наиболее важными результатами являются макроусредненный показатель F1-меры 94,05% и точность 95,40%, при этом показатель F1 для каждого класса варьировался от 98,98% (монокристаллический) до 89,04% (микротрещина). Значимость полученных результатов заключается в использовании интегративных локализационно-ориентированных сверточных признаков YOLOv8m с глобальным вниманием трансформера и обучаемым слиянием перекрестного внимания вместо статического слияния перекрестного внимания, что обеспечивает новую и более надежную реализацию для автоматизированной оценки качества фотоэлектрических систем, чем использование одной ветви.