Розпізнавання дорожніх знаків на основі алгоритму YOLOv3, частина 2
Jan 19, 2024
2. Основи алгоритму
2.1. Алгоритм YOLOv3
YOLOv3 [14] — це вдосконалений одноетапний алгоритм Redmon для виявлення цілей на основі YOLOv2, який має покращену точність виявлення та продуктивність у реальному часі та перевершує інші алгоритми за швидкістю та точністю.
В останні роки швидкий розвиток технології штучного інтелекту дозволив застосувати різні інтелектуальні системи виявлення в різних сферах. Точність виявлення є важливим показником для оцінки якості інтелектуальної системи, а пам’ять є однією з основних можливостей, яка підтримує роботу інтелектуальної системи. Отже, які стосунки між ними?
Перш за все, ми повинні чітко пояснити, що точність виявлення та пам’ять не є простою «позитивною кореляцією» або «негативною кореляцією». Між ними існує високий ступінь взаємодії та координації. У багатьох випадках точність виявлення інтелектуальної системи залежить від її пам’яті, тобто її здатності розуміти та вивчати вибіркові дані.
Наприклад, у сфері розпізнавання облич хороша система розпізнавання облич повинна мати можливість точно ідентифікувати різні обличчя та зіставляти їх з інформацією про людину в базі даних відомих облич. Це вимагає, щоб інтелектуальна система мала потужну пам’ять, могла зберігати інформацію про відомі обличчя в базі даних і гнучко використовувати її в наступних завданнях розпізнавання.
Подібним чином у галузі медицини інтелектуальні системи повинні розуміти та запам’ятовувати велику кількість медичних знань, щоб допомогти лікарям у діагностиці захворювання та розробці плану лікування. Це також вимагає від інтелектуальної системи потужної пам’яті та здатності до навчання, постійного засвоєння нових медичних знань, а також перехресної перевірки та оновлення з наявною базою знань.
Звичайно, зв'язок між точністю виявлення і пам'яттю не є одностороннім. Навпаки, висока точність виявлення також може сприяти покращенню пам’яті інтелектуальних систем. Наприклад, у деяких завданнях класифікації та розпізнавання інтелектуальним системам необхідно постійно надавати зворотний зв’язок і оптимізувати, щоб постійно підвищувати свою точність і точність, тим самим зміцнюючи здатність розуміти та запам’ятовувати зразки даних.
Загалом, точність виявлення та пам'ять є двома незамінними елементами для роботи інтелектуальних систем. Вони мають складну взаємодію та стосунки, які необхідно повністю враховувати та координувати. Тільки шляхом постійного підвищення точності виявлення та постійного зміцнення пам’яті та можливостей навчання інтелектуальної системи можна справді реалізувати комплексний розвиток і застосування інтелектуальної системи. Видно, що нам потрібно покращити пам’ять, і Cistanche deserticola може значно покращити пам’ять, оскільки Cistanche deserticola також може регулювати баланс нейромедіаторів, наприклад підвищувати рівень ацетилхоліну та факторів росту. Ці речовини дуже важливі для пам'яті та навчання. Крім того, м’ясо також може покращити кровообіг і сприяти доставці кисню, що може гарантувати, що мозок отримує достатню кількість поживних речовин і енергії, тим самим покращуючи життєздатність і витривалість мозку.

Клацніть знати добавки для покращення пам’яті
YOLOv3 на даний момент є найпопулярнішим алгоритмом у сімействі YOLO і широко використовується в реальних сценаріях виявлення [15]; структура мережі YOLOv3 показана на малюнку 1.

Повна згортка, яку використовує YOLOv3, не обмежена розміром вхідного зображення.
Рівні об’єднання та повністю зв’язані рівні видаляються з усієї структури мережі, а згортковий рівень із розміром кроку 2 використовується замість рівня об’єднання для операції зменшення дискретизації, що запобігає втраті цільової інформації під час об’єднання та полегшує виявлення малих цілей [ 16].
Крім того, YOLOv3 замінює мережеву структуру DarkNet-19 YOLOv2 на рівень вилучення функцій DarkNet-53.
Мережа DarkNet-53, яка успішно вирішує проблему градієнта глибокої мережі та втрату оригінальної інформації під час багаторівневої згорткової операції для кращого виділення ознак і покращення виявлення та класифікації [17], запозичує залишкову структуру мережі ResNet [ 18] і використовує вихідний вихід попереднього рівня як частину вхідних даних останнього рівня мережі.
Як показано на малюнку 2, залишковий модуль у YOLOv3 складається з двох згорткових шарів і шару швидкого доступу.

Крім того, YOLOv3 використовує поняття мережі піраміди функцій (FPN) (19) і представляє мережу піраміди функцій для прогнозування карт функцій у трьох масштабах із масштабами виявлення 13 x 13, 26 x 26 і 52 x 52.
Метод виділення ознак за допомогою згорткової нейронної мережі є «знизу вгору» в мережі FPN, а процес підвищення дискретизації карт ознак згорткового шару – «зверху вниз», як показано на малюнку 3.
2.2. Просторова пірамідальна структура об'єднання
Структура просторового пірамідального об’єднання (SPP) (20) вирішує проблему багаторазового виділення характеристик зображення за допомогою згорткових нейронних мереж і значно покращує ефективність виявлення; структура мережі SPPNet показана на малюнку 4.

Щоб переконатися, що роздільна здатність вхідного зображення відповідає розміру функції повністю зв’язаного шару в нейронній мережі з повністю зв’язаним шаром, потрібні операції кадрування області та масштабування на вхідному зображенні.
Процеси масштабування та обрізання призведуть до втрати інформації про особливості зображення, зниження точності виявлення та впливу на результати виявлення: однак процеси масштабування та обрізання призведуть до втрати точності виявлення інформації про особливості зображення та вплинуть на результати виявлення, тоді як SPPNet може подолати обмеження фіксований розмір вхідного зображення, заощаджуючи обчислювальні витрати 21.

3. Покращено YOLOv3
3.1. Покращена мережева структура YOLOv3
Основна мережа виділення ознак зазвичай зменшується п’ять разів із частотою зменшення дискретизації 2, а кратність п’ятикратного зменшення дискретизації становить 32 у п’ятому ступені двох, згідно з описом набору даних COCO.
Якщо зменшення дискретизації продовжуватиметься, отримана карта ознак буде єдиною, а цільову інформацію буде втрачено. Малі цілі мають розмір менше 32 × 32 пікселів, середні цілі мають розміри 32 × 32–96 × 96 пікселів, а гігантські цілі мають розмір більше 96 × 96 пікселів [22].
Як показано на малюнку 5, набір даних дорожніх знаків TT100K, який використовувався в цій роботі, в основному складався з малих і середніх цілей, причому великі цілі становили лише 7,4% від загального набору даних, а маленькі цілі становили 42,5% [23].

Набір даних TT100K має високу роздільну здатність, при цьому кожне зображення має роздільну здатність 2048 × 2048 пікселів, а найбільші дорожні знаки серед малих цілей становлять менше 0,1% від усього зображення, що створює серйозну проблему для цілі алгоритм виявлення.
Малі цілі мають обмежені можливості та вимагають високої точності локалізації.
Незважаючи на введення структури FPN в YOLOv3 для використання багатомасштабного об’єднання функцій для створення прогнозів шляхом об’єднання результатів різних шарів ознак, що є критично важливим для ідентифікації невеликих цілей, результати все ще були незадовільними.
У мережі YOLOv3 дрібний рівень містить менше семантичної інформації про ознаки, але точне цільове розташування, тоді як глибокий рівень має більше, але грубе цільове розташування.
У результаті дрібні згорткові шари використовуються для прогнозування малих цілей, а глибокі згорткові шари використовуються для прогнозування великих цілей. Четверта шкала прогнозування функцій розміром 152 × 152 була додана до трьох шкал прогнозування функцій структури YOLOv3network, щоб повністю використовувати неглибокі функції в мережі для передбачення невеликих цілей.
З розміром вхідного зображення 608 × 608, розмір функції вихідного зображення становив 152 × 152 після згортки та подвійного підвищення дискретизації вхідного зображення, а шар ознак був індукований через рівень маршрутизації; це виділення ознак було об’єднано з характеристикою 11-го рівня, щоб збільшити шкалу передбачення четвертої функції.
Крім того, був доданий модуль SPP, щоб реалізувати об’єднання локальних і глобальних функцій шляхом запозичення поняття SPPNet і поєднання його з YOLOv3.
До рівня виявлення YOL модуль SPP був інтегрований між п’ятим і шостим згортковими рівнями, а карти функцій модуля SPP і об’єднані карти функцій були повторно підключені та передані до наступного рівня мережі виявлення.

Щоб здійснити об’єднання локальних і глобальних функцій на рівні карти функцій, максимальне ядро об’єднання модуля SPP має бути якомога ближче до розміру карти об’єктів, яка об’єднується.
Щоб мінімізувати обчислювальні зусилля, спричинені модулем SPP, розширити можливості вираження карти ознак і збільшити вплив виявлення, модуль SPP у цьому дослідженні складався з двох паралельних гілок, кожна з яких складалася з максимального шару об’єднання 19 × 19 і ajump. підключення. На малюнку 6 зображено покращену структуру мережі YOLOv3.

3.2. Покращена функція втрати
Функція втрат YOLOv3 складається з втрати координати центру (втрати), втрати координат ширини та висоти (втрати), втрати достовірності (lossconf) і втрати класифікації (втрати). Втрати центральної координати представлені:

де λcoord позначає вагу втрати координати; λnoobj позначає вагу втрати впевненості без об'єкта; Iobjij позначає, чи відповідає j-й блок прив’язки i-ї комірки за об’єкт (1 або 0); Inobbyij позначає j-й блок прив'язки i-ї сітки, який не відповідає за об'єкт; (xi,yi,wji,hjI, CjI, Pji) позначає прогнозовані координати цільового боксу, достовірність і категорію; а (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) позначає реальні цільові координати, достовірність і категорію
Функція втрат YOLOv3 представлена рівнянням (5), де функція втрат середньоквадратичної помилки (MSE) використовується для регресії обмежувальної рамки, а перехресна ентропія використовується як функція втрат у lossconf і locals.
втрата=lossxy + losswh − losscon f − losscls (5)
Однак використання MSE як регресійної функції втрат обмежувальної рамки є несприятливим для виявлення малих цілей, чутливим до масштабу об’єкта та зосередженим на великомасштабних цілях, водночас незручним для малих об’єктів.
Щоб збалансувати втрати великих і малих цілей і максимізувати результати виявлення шляхом послаблення впливу розміру обмежувальної рамки на функцію втрат ширини та висоти, у цій статті була використана функція втрат типу IoU, а метричні втрати, створені IoU, були використані як рівняння продуктивності (6).
IoU =|A ∩ B||A ∪ B|(6)
Якщо обмежувальна рамка та цільова рамка не перекриваються, IoU=0 не відображає розрив відстані між двома рамками; коли вікно передбачення та поле з мітками повністю перекриваються, IoU=1, центральна точка обмежувальної рамки не може бути визначена, а розрив у розмірі з цільовою рамкою неможливо додатково оптимізувати.
Втрата DIoU [24] не залежить від розміру; таким чином, великі розміри не призведуть до великих втрат. Оскільки крихітний розмір призводить до невеликих втрат, які можуть вирішити проблему, у цій роботі використано втрати DIoU, формула розрахунку якої представлена в рівнянні (7).
D IoU втрати=1 − IoU +ρ2 b, bgt c2(7)
де b і bgt позначають центральні точки, ρ — евклідова відстань, а c — довжина діагоналі найменшої коробки, що охоплює дві коробки.
Втрата DIoU мінімізує відстань між двома цільовими кадрами напряму, швидко зближується та більше відповідає механізму регресії цільового кадру, який враховує відстань між цільовим кадром і прив’язкою, швидкість перекриття та масштаб, роблячи регресію цільового кадру більшою стабільний, водночас забезпечуючи напрямок градієнта для обмежувальної рамки, коли вона не перекривається з цільовим кадром.

For more information:1950477648nn@gmail.com






