Аномальне виявлення у відео великих даних за допомогою покращеного автокодувальника
Jul 12, 2023
1. Введення
Як завдання комп’ютерного зору високого рівня виявлення аномалій відео стосується автоматичного виявлення аномальних подій у певній відеопослідовності, що може ефективно розрізняти аномальну та звичайну діяльність і аномальні категорії у відео. За останні кілька років дослідники провели багато досліджень, пов’язаних з виявленням аномалій [1–9]. Порівняно зі звичайними подіями, події, які трапляються рідко або мають низьку ймовірність виникнення, зазвичай вважаються аномальними. Однак на практиці важко створити ефективну модель виявлення аномалій через невідомі типи подій і нечіткі визначення аномалій. Більшість існуючих методів виявлення аномалій розроблені на основі припущення, що будь-який шаблон, відмінний від вивченого нормального шаблону, розглядається як аномалія. Виходячи з таких припущень, одна й та сама діяльність у різних сценаріях може бути представлена як нормальна або аномальна подія. Наприклад, сцену бійки, де двоє людей б’ються на вулиці, можна вважати ненормальною, тоді як двоє людей є нормальними, коли вони боксують. Крім того, у високорозмірних відеоданих є велика кількість надлишкової візуальної інформації, що ускладнює представлення подій у відеопослідовності.

Китайська трава цистанка
Згідно з попередніми роботами методи виявлення аномалій можна загалом розділити на два типи. Деякі методи виявлення аномалій розроблені через помилки реконструкції, які зосереджені на моделюванні нормальних патернів у відеопослідовностях [3–5, 7, 8, 10, 11]. (ці методи вивчають модель представлення ознак нормального шаблону на етапі навчання та використовують відмінності між аномальними та нормальними зразками для визначення остаточної аномальної оцінки тестових даних під час фази тестування, таких як помилки реконструкції або певні порогові значення [7] –14]. Хоча методи виявлення аномалій на основі реконструкції добре справляються з реконструкцією нормальних шаблонів у відеопослідовностях, ключовою проблемою цих методів є те, що вони значною мірою покладаються на навчальні дані. Інший тип методу розглядає виявлення аномалій як проблему класифікації [ 15, 16]. Для цих методів оцінка аномалії відеопослідовності передбачається за допомогою навченого класифікатора для вилучення таких ознак, як гістограма оптичного помічника (HOF) або динамічна текстура (DT). (Ефективність цих методів є Щоб отримати задовільну продуктивність, виділення ефективних та дискримінаційних ознак є важливим для таких методів виявлення аномалій [17–20]. Однак ці два типи методів зазвичай моделюють зв’язки між подіями відносно простим способом [7, 10, 21–23]. Наприклад, розглядається лише лінійний зв’язок, якого недостатньо для складних, дуже нелінійних зв’язків у багатьох випадках реального світу.

Пустельний живий цистанх
В останні роки методи, засновані на глибокому навчанні, були застосовані в області відеодетектування і досягли значного прогресу [24–26]. Наприклад, автокодери (AE) використовують помилки реконструкції для виявлення аномалій, і на цій основі було вдосконалено ряд методів. Крім того, генеративні змагальні мережі (GAN) і довготривала короткочасна пам’ять (LSTM) також були застосовані для вирішення проблеми виявлення аномалій. Проте, AE може мати сильну здатність до узагальнення, що призводить до здатності реконструювати аномальні події. У [14] дослідники відзначили, що оскільки не існує аномальних навчальних зразків, реконструкція аномальних зразків має бути непередбачуваною, що може призвести до більших помилок реконструкції для аномальних зразків. Якщо деякі аномалії мають спільний шаблон композиції зі звичайними навчальними даними або декодер «занадто сильний» і не може добре декодувати коди деяких аномалій, тоді AE може добре реконструювати аномалію. Щоб подолати недоліки AE, у цьому документі використовується модуль пам’яті для покращення глибокого AE та розроблено метод AE з доповненою пам’яттю (Memory AE). Коли вводиться новий тестовий зразок, Memory AE не буде безпосередньо кодувати його та вводити в декодер, а використовуватиме його як запит для отримання відповідного вмісту в модулі пам’яті. (en, вміст агрегується та передається в декодер. (Цей процес реалізується за допомогою адресації уваги. Крім того, у цьому документі використовуються диференційовані оператори згортання, щоб викликати розрідженість ваг адресації пам’яті, що може спонукати вміст пам’яті наближатися до запитів у функції Під час фази навчання кодер і декодер одночасно оновлюють модуль пам’яті, щоб отримати меншу середню помилку реконструкції. На фазі тестування вивчений вміст пам’яті фіксується, і використовуватиметься невелика кількість звичайних елементів пам’яті. для реконструкції. Якщо їх вибрано як околиці вхідного коду, помилка реконструкції буде дуже очевидною. Експерименти на кількох публічних контрольних наборах даних показують, що продуктивність виявлення Memory AE досягла рівня техніки.

Основні хімічні складові Cistanche deserticola
2. Принцип Алгоритму
На малюнку 1 показано загальну мережеву структуру Memory AE, яка розділена на три підструктури: кодер (використовується для кодування вхідних даних і генерування запитів), декодер (використовується для реконструкції) і модуль пам’яті (з пам’яттю та пов’язаними операціями адресації). Як показано на малюнку 1, враховуючи подію, що перевіряється, кодер спочатку отримує її кодоване значення. Використовуючи кодоване значення як запит, модуль пам’яті отримує найбільш релевантний вміст у модулі пам’яті за допомогою оператора адресації на основі уваги, а потім передає його в декодер для реконструкції. Під час навчання кодер і декодер оптимізують параметри, щоб мінімізувати помилку реконструкції, і в той же час оновлюють модуль пам’яті для запису елементів прототипу закодованих нормальних даних. З огляду на тестовий зразок модель використовує лише обмежені звичайні зразки, записані в модулі пам’яті, для виконання реконструкції. Таким чином, реконструкція має тенденцію бути близькою до нормального зразка. Отже, помилка реконструкції нормального зразка мала, а аномальна помилка велика.
Малюнок 1: (e) блок-схема запропонованої пам’яті AE.

2.1. Кодери та декодери. (е кодер і декодер є двома частинами AE. (перший відображає вхідні дані в простір ознак, щоб отримати його закодоване значення, а другий реконструює закодоване значення у вхідні дані. (e AE складається з кодер fw1 (·) і декодер gw2 (·), які можуть бути виражені як

де x і x′ — вхід AE і реконструйований вхід, відповідно, z — результати кодування x, а W1 і W2 позначають параметри кодера і декодера, які можна отримати шляхом мінімізації помилки реконструкції між x і x′:

Реконструюючи похибку нормального зразка [19, 20], щоб визначити, чи є він аномальним, AE успішно використовували для вирішення завдання виявлення аномальних. Однак реконструкція аномальних зразків має бути непередбачуваною, що може призвести до більших помилок реконструкції аномальних зразків. Щоб вирішити цю проблему, у Розділі 2.2 до AE вводиться модуль пам’яті, а також пропонується AE пам’яті.
2.2. Модуль пам'яті. (Запропонований метод включає в себе модуль пам’яті для запису режиму кодування прототипу та операцію адресації для доступу до модуля пам’яті.
2.2.1. Уявлення на основі уваги. (модуль уваги розроблений як матриця M ∈ RN×C, що містить N векторів реального часу. Для простоти припустимо, що C є розмірністю z; тоді нехай Ζ � RC. Дано вектор-рядок mi, ∀i ∈ [ N], де [N] є цілим числом від 1 до N. Кожен представляє mi елемент пам’яті; заданий набір запитів z ∈ RC, мережа пам’яті отримує?z і відповідає вектором м’якої адреси w ∈ R1×N як слідує:

де w — вектор-рядок, а сума всіх елементів дорівнює 1, що представляє wi, елемент w із i. (e вектор ваги w може бути отриманий шляхом обчислення z. Як показано в рівнянні (4), вага адреси має бути близькою w до модуля пам’яті. (e змішаний параметр визначається як N, максимальна ємність модуля пам’яті. Незважаючи на те, що це N, непросто знайти найкращий для різних наборів даних; на щастя, Memory AE не чутливий до налаштування N. Достатньо велике N можна добре застосувати до кожного набору даних.
2.2.2. Увага для адресації пам'яті. У Memory AE модуль пам’яті призначений для детального запису вихідного нормального режиму M фази навчання. (e модуль пам’яті визначається як пам’ять з адресацією вмісту, z⌢, і його схема адресації обчислює w, вагу уваги, на основі подібності між запитом і елементом пам’яті. Як показано на малюнку 1, кожну вагу можна обчислити за допомогою операція softmax wi :

де d(·, ·) представляє міру подібності. (папір визначає це як косинусну подібність:

Подібно до рівнянь (4)–(6), модуль пам’яті отримує найбільш схожий елемент пам’яті, щоб отримати представлення z. Через обмеження розміру пам’яті та технологію розрідженої адресації одночасно можна адресувати лише невелику кількість елементів внутрішньої пам’яті. (отже, ефективну поведінку модуля пам’яті можна пояснити наступним чином. На етапі навчання декодер у Memory AE обмежено використанням дуже небагатьох адресованих елементів пам’яті для реконструкції, що вимагає ефективного використання елементів пам’яті. (отже, , під час реконструкції модуль пам’яті потрібно змусити записати найбільш репрезентативний режим прототипу у звичайному режимі введення.На етапі тестування, враховуючи навчену пам’ять, лише нормальний режим у пам’яті можна отримати для реконструкції.(отже , нормальні зразки можуть бути краще реконструйовані.І навпаки, закодоване значення аномального введення може бути замінено отриманим нормальним шаблоном, що призводить до великої помилки реконструкції в аномальному зразку.
2.3. Навчання. Дано набір даних, що містить зразки xi? ?TI�1, нехай xi′ позначає вибірки реконструкції xi у навчальних вибірках; мінімальний рефакторинг виконується наступним чином:

(норма e l2 використовується для вимірювання помилки реконструкції; wi′ представляє вагу адресації пам’яті кожного зразка xi. Для подальшого сприяння розрідженості w′ розріджену регуляризацію мінімізують під час навчання. Враховуючи, що всі w′ невід’ємні і ‖w′‖1 � 1, оптимізаційна задача формується наступним чином:

Об’єднавши функцію втрат рівняння (7) і рівняння (8), цільова функція пам’яті AE виглядає наступним чином:

ось гіперпараметр в процесі навчання. На практиці встановлено значення 0.0002. У процесі навчання пам'ять оновлюється шляхом зворотного поширення та градієнтного спуску. У зворотному поширенні ненульовим може бути лише градієнт елемента пам’яті з ненульовою вагою адресації.
2.4. Тест. Після навчання моделі похибка реконструкції пікселя в позиції (x, y) зубчастої рамки t може бути розрахована за наступним рівнянням:

де h(·) представляє всю модель. Враховуючи похибку реконструкції піксельного рівня десятого кадру, помилку реконструкції всього кадру зображення можна отримати шляхом підсумовування e(t) �. (x,y)e(x, y, t). (en, бал аномалії кадру можна розрахувати таким чином:

Нарешті, можна встановити поріг, щоб визначити, чи є він аномальним, якщо s(t) > θ.
3. Експеримент
У цьому розділі ефективність запропонованого методу перевіряється та порівнюється з іншими існуючими методами. Зараз для експериментів використовуються два загальнодоступних набори даних, тобто набір даних Avenue і набір даних ShanghaiTech. (в якості кількісних оціночних показників використовуються площа під кривою (AUC) і EER.
3.1. Підготовка. (Набір даних e Avenue використовує фіксовану камеру з роздільною здатністю 640 × 360 пікселів для зйомки та запису вуличних заходів у Міському університеті Гонконгу. (Набір даних e Computational Intelligence and Neuroscience 3 включає 16 навчальних відеокліпів, що містять звичайну людську поведінку та 21 тестові відеокліпи, що містять аномальні події та поведінку людей. Він має загалом 30652 кадри, і всі тестові відео мають анотації цільового рівня, тобто прямокутна область використовується для позначення аномалій у просторових розташуваннях. Нормальна поведінка – це люди, що ходять по тротуару, тоді як аномальні події – це люди, які смітять/викидають речі, блукають, йдуть до камери, ходять по траві та відкидають об’єкти. (Набір даних ShanghaiTech – це дуже складна колекція для виявлення аномальних подій. На відміну від інших наборів даних, він містить 13 різних сцени з різними умовами освітлення та кутами камери, включаючи загалом 330 навчальних відео та 107 тестових відео (тестовий набір містить загалом 130 аномальних подій із анотаціями на рівні пікселів. (Увесь набір даних містить загалом 316154 кадри, включаючи 274515 кадрів у навчальному наборі, 42883 кадри в тестовому наборі та 17090 кадрів у аномальному кадрі. (Роздільна здатність кожного відеокадру становить 480 × 856. (Модель є протестовано на платформі з апаратною платформою NVIDIA GTX1080TI і відеопам'яттю 8 ГБ, а програмне середовище - PyTorch і Python 3.6.Для вимірювання ефективності методу виявлення відеоаномалій, запропонованого в цій статті, AUC рівня кадру Крива робочої характеристики приймача (ROC) використовується як індекс оцінки. Для індикаторів оцінки на рівні кадру, якщо принаймні один піксель кадру позначено як ненормальний, кадр вважається ненормальним. А AUC рівня кадру обчислюється шляхом порівняння результат виявлення на рівні кадру з рівнем кадру реальної мітки.

Основні хімічні складові Cistanche deserticola
Натисніть тут, щоб переглянути продукти Cistanche
【Запитуйте більше】 Електронна пошта:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
3.2. Експериментальне встановлення. Усі відеокадри регулюються до 227 × 227, а потім перетворюються на зображення у відтінках сірого. (e вхідні дані моделі дорівнюють 227 × 227 × 5, тобто 5 послідовних кадрів використовуються як вхідні дані моделі. Після кожного згорткового шару є рівень пакетної нормалізації та рівень збудження ReLU. (e декодер містить 4 шари деконволюції (модуль уваги налаштований на те, щоб кожен сегмент пам’яті записував функцію на піксель на карті функцій, що відповідає підобласті відеосегменту. (отже, модуль пам’яті є 10) 00 × 64 матриця. (e Оптимізатор Адама вибрано для оптимізації всіх параметрів моделі. (e початкова швидкість навчання дорівнює 0,0001, а кількість ітерацій дорівнює 1000). (e параметр імпульсу дорівнює ρ1 � 0,9 і ρ2 � 0,999, а розмір партії 128.
3.3. Експериментальні результати. Щоб довести ефективність запропонованого методу виявлення аномалій відео, у цьому документі порівнюють його з 12 різними існуючими методами. Серед них MPPCA (гібрид імовірнісного аналізатора головних компонентів) плюс SF (соціальна влада) [17] і MDT (гібрид динамічної текстури) [18] є методами, заснованими на ручних функціях; Conv-AE [8], 3D Conv [19], Stacked RNN [20] і ConvLSTM-AE [21], MemNormality [10] і ClusterAE [22] — усі методи засновані на автокодерах; AbnormalGAN [7] і Pred plus Recon [23] засновані на методі генерації змагальних мереж. У таблиці 1 показано результати виявлення аномалій відео на рівні кадру різними методами. Можна помітити, що за результатами двох наборів даних метод, заснований на AE, зазвичай кращий, ніж метод, заснований на ручних функціях, і отримано вищі AUC на рівні кадру. (це тому, що створені вручну функції зазвичай витягуються на основі інших завдань, і тому вони можуть бути неоптимальними. У методах на основі AE ConvLSTM-AE кращий, ніж Conv-AE, оскільки перший може краще фіксувати інформацію про час. Крім того, він також може слід зазначити, що методи, засновані на GAN, працюють краще, ніж більшість базових методів.Нарешті, метод Memory AE, запропонований у цій статті, досягає 85,7 відсотка AUC на рівні кадру на наборі даних Avenue, що на 0,6 відсотка випереджає найефективніший Pred plus Recon [23]; у той час як метод, запропонований у цій статті, досяг 75,3 відсотка AUC на рівні кадру на наборі даних ShanghaiTech, що на 2 відсотки випереджає інші методи за AUC на рівні кадру, і ефект дуже очевидний (головним чином тому, що запропонований метод, заснований на пам’яті AE, використовує фрагменти пам’яті, які можуть добре реконструювати аномалії та вводити деякі випадкові помилки.Крім того, у порівнянні з набором даних Avenue, набір даних ShanghaiTech досяг вищого рівня AUC на рівні кадру (головним чином тому, що набір даних ShanghaiTech містить численні сцени та аномальні події, які раніше не з’являлися в інших наборах даних, що є більш складним. Щоб перевірити результати виявлення однієї сцени в наборі даних ShanghaiTech, для навчання та тестування використовується сегмент відео з однією сценою. 83 сегменти (25 відсотків) використовуються для навчання, а 34 сегменти (32 відсотки) використовуються для тестування, досягаючи 86.3% AUC на рівні кадру, який досяг рівня, подібного до рівня в наборі даних Avenue. Таким чином, запропонований метод пам’яті AE можна гнучко застосовувати до різних типів даних. Тільки використовуючи помилки реконструкції, запропонований метод може отримати кращі результати з найменшими специфічними знаннями. Щоб оцінити продуктивність попередньо визначеного модуля пам’яті у виявленні аномальних відеоподій, наступним кроком є зміна розміру модуля пам’яті та проведення експериментів із набором даних Avenue, а значення AUC на рівні кадру наведено в таблиці 2. Це Можна виявити, що за достатньо великого розміру модуля пам’яті метод Memory AE може забезпечити найкращі результати. Коли розмір модуля пам’яті перевищує 1000, вплив на результат виявлення невеликий, але використання більшого розміру модуля пам’яті призведе до більшої кількості обчислень, тому для розміру модуля пам’яті вибрано 1000. Рисунки 2(a) і 2(b), відповідно, показують деякі результати виявлення в наборі даних Avenue і наборі даних ShanghaiTech. (e Таблиця 1: Порівняння з сучасними методами щодо AUC.

краще, ніж метод, заснований на ручних функціях, і отримано вищі AUC на рівні кадру. (це тому, що створені вручну функції зазвичай витягуються на основі інших завдань, і тому вони можуть бути неоптимальними. У методах на основі AE ConvLSTM-AE кращий, ніж Conv-AE, оскільки перший може краще фіксувати інформацію про час. Крім того, він також може слід зазначити, що методи, засновані на GAN, працюють краще, ніж більшість базових методів. Нарешті, метод пам’яті AE, запропонований у цій статті, досягає 85,7 відсотка AUC на рівні кадру в наборі даних Avenue, що на 0.6 відсотка випереджає найефективніший метод Pred plus Recon [23]; тоді як метод, запропонований у цій статті, досяг 75,3 відсотка AUC на рівні кадру на наборі даних ShanghaiTech, що на 2 відсотки випереджає інші методи за AUC на рівні кадру, і ефект дуже очевидний .(головним чином тому, що запропонований метод, заснований на пам’яті AE, використовує фрагменти пам’яті, які можуть добре реконструювати аномалії та вносити деякі випадкові помилки. Крім того, порівняно з набором даних Avenue, набір даних ShanghaiTech досяг вищого рівня AUC на рівні кадру. (є головним чином тому, що набір даних ShanghaiTech містить кілька сцен і аномальних подій, які раніше не з’являлися в інших наборах даних, що є складнішим. Щоб перевірити результати виявлення однієї сцени в наборі даних ShanghaiTech, для навчання та тестування використовується сегмент відео з однією сценою. 83 сегменти (25 відсотків) використовуються для навчання, а 34 сегменти (32 відсотки) використовуються для тестування, досягаючи 86.3% AUC на рівні кадру, що досягло рівня, подібного до рівня в наборі даних Avenue. Таким чином, запропонований метод пам’яті AE можна гнучко застосовувати до різних типів даних. Тільки використовуючи помилки реконструкції, запропонований метод може отримати кращі результати з найменшими специфічними знаннями. Щоб оцінити продуктивність попередньо визначеного модуля пам’яті у виявленні аномальних відеоподій, наступним кроком є зміна розміру модуля пам’яті та проведення експериментів із набором даних Avenue, а значення AUC на рівні кадру наведено в таблиці 2. Це Можна виявити, що за достатньо великого розміру модуля пам’яті метод Memory AE може забезпечити найкращі результати. Коли розмір модуля пам’яті перевищує 1000, вплив на результат виявлення невеликий, але використання більшого розміру модуля пам’яті призведе до більшої кількості обчислень, тому для розміру модуля пам’яті вибрано 1000. Рисунки 2(a) і 2(b), відповідно, показують деякі результати виявлення в наборі даних Avenue і наборі даних ShanghaiTech. (кадри в зеленому полі – це звичайні кадри зі звичайних відеокліпів, а кадри в червоному полі – це нестандартні кадри з ненормальних відеокліпів. Деякі незвичайні події, такі як падіння конфетті, їзда на велосипеді по тротуару, побиття тощо, можуть бути виявлені.
Таблиця 2: (e вплив кількості розміру пам’яті на експериментальні результати набору даних Avenue (на рівні кадру AUC/відсоток).
![]()
Рисунок 2: Приклади результатів виявлення. (a) Приклад із набору даних Avenue. (b) Приклад із набору даних ShanghaiTech.

4. Висновок
(у документі пропонується Memory AE для покращення продуктивності виявлення аномалій у великих даних у відео. Враховуючи вхідні дані, запропонований метод Memory AE спочатку використовує кодер для отримання кодованого представлення, а потім використовує код як запит для отримання найбільш релевантних Оскільки модуль пам’яті навчений записувати типові нормальні шаблони, пропонований Memory AE може добре реконструювати нормальні зразки та збільшити помилку реконструкції аномалій, що посилює роль помилки реконструкції як стандарту виявлення аномалій. Експерименти на двох наборах даних доводять універсальність і ефективність запропонованого методу.У майбутньому ми будемо вивчати використання ваг адресації для виявлення аномалій.Враховуючи, що запропонований модуль пам'яті універсальний і не має нічого спільного зі структурою кодера та декодер, його буде інтегровано в більш складну базову модель і використовуватиметься в експериментах із більш складними наборами даних.

Добавка Cistanche поруч зі мною - покращує пам'ять
Список літератури
[1] F. Dong, Y. Zhang і X. Nie, "Dual diskriminator generative adversarial network for video anomaly detection", IEEE Access, vol. 8, стор. 88170–88176, 2020.
[2] K. Doshi та Y. Yilmaz, «Послідовне виявлення аномалій у будь-якому кадрі у відео спостереження», у Proceedings of the CVPRW, стор. 934-935, Сіетл, штат Вашингтон, США, червень 2020 р.
[3] K. Doshi та Y. Yilmaz, «Постійне навчання для виявлення аномалій у відеоспостереженнях», у Proceedings of the CVPRW, стор. 254-255, Сіетл, Вашингтон, США, червень 2020 р.
[4] К. Джаянта, «Дутта та Бонні Банерджі. Онлайн-виявлення ненормальних подій за допомогою інкрементної довжини кодування», у Працях AAAI, стор. 3755–3761, Остін, Техас, США, січень 2015 р.
[5] Y. Feng, Y. Yuan, and X. Lu, "Learning deep event models for crowd anomaly detection", Neurocomputing, vol. 219, стор. 548–556, 2017.
[6] D. Gong, L. Liu, V. Le et al., "Memorizing normality to detect anomaly: memory-augmented deep autoencoder for unsupervised detection anomaly", in Proceedings of the ICCV, pp. 1705–1714, Seoul, Корея, жовтень 2019 р.
[7] M. Ravanbakhsh, M. Nabi, E. Sangineto, L. Marcenaro, C. Regazzoni, and N. Sebe, "Abnormal event detection in videos using generative adversarial nets", in Proceedings of the IEEE International Conference on Image Processing , стор. 1577–1581, Пекін, Китай, вересень 2017 р.
[8] М. Хасан, Дж. Чой, Дж. Нойман, А. К. Рой-Чоудхурі та Л. С. Девіс, «Навчання часовій регулярності у відеопослідовностях», у матеріалах конференції IEEE з комп’ютерного зору та розпізнавання образів, стор. 733– 742, Лас-Вегас, Невада, США, червень 2016 р.
[9] W. Liu, W. Luo, D. Lian і S. Gao, "Future frame prediction for anomaly detection–a new baseline", in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, стор. 6536– 6545, Солт-Лейк-Сіті, Юта, США, червень 2018 р.
[10] H. Park, J. Noh та B. Ham, "Learning-media-guided normality for anomaly detection", in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 14 372–{{ 3}}, Сіетл, штат Вашингтон, США, червень 2020 р.
[11] MZ Zaheer, J.-h. Лі, М. Астрід і С.-І. Lee, "Old is gold: redefining the adversarially learned one-class classifier training paradigm", in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 14 183–214 193, Seattle, WA, США, червень 2020 р.
[12] X. Zhu, J. Liu, J. Wang, Y. Fang і H. Lu, «Виявлення аномалій у переповненій сцені за допомогою спільного моделювання зовнішнього вигляду та динаміки», у матеріалах Міжнародної конференції IEEE з обробки зображень, 2705–2708, Мельбурн, VIC, Австралія, вересень 2013 р.
[13] RVHM Colque, CAC J´unior і WR Schwartz, «Гістограми оптичної орієнтації та величини для виявлення аномальних подій у відео», у матеріалах конференції Sibgrapi з графіки, шаблонів і зображень, стор. 126–133. , Салвадор, Баїя, Бразилія, серпень 2015 р.
[14] Бо Цзун, С. Ці, Р. М. Мартін та ін., «Модель суміші Гауса з глибоким автокодуванням для неконтрольованого виявлення аномалій», у матеріалах Міжнародної конференції з уявлень про навчання, Ванкувер, Канада, квітень 2018 р.
[15] М. Сабокру, М. Файяз, М. Фаті, З. Моаед і Р. Клетте, "Глибока аномалія: повністю згорточна нейронна мережа для швидкого виявлення аномалій у переповнених сценах", Комп'ютерне бачення та розуміння зображення, том. 172, стор. 88–97, 2018.
[16] C. Li, Z. Han, Q. Ye та J. Jiao, "Візуальне виявлення аномальної поведінки на основі аналізу розрідженої реконструкції траєкторії", Neurocomputing, vol. 119, вип. 7, стор. 94–100, 2013.
[17] В. Махадеван, В. Лі, В. Бхалодіа та Н. Васконселос, «Виявлення аномалій у людних сценах», у матеріалах конференції IEEE з комп’ютерного зору та розпізнавання образів (CVPR), стор. 1975–1981, IEEE, Сан-Франциско, Каліфорнія, США, червень 2010 р.
[18] В. Лі, В. Махадеван і Н. Васконселос, «Виявлення та локалізація аномалій у людних сценах», Транзакції IEEE з аналізу шаблонів і машинного інтелекту, том. 36, С. 18–32, 2014.
[19] Y. Zhao, B. Deng, C. Shen, Y. Liu, H. Lu та X.-S. Хуа, «Просторово-часовий автокодер для виявлення аномалій відео», у матеріалах Міжнародної конференції ACM з мультимедіа (ACM MM), стор. 1933–1941, ACM, Маунтін-В’ю, Каліфорнія, США, жовтень 2017 р.
[20] W. Luo, L. Wen, and S. Gao, "A revisit of sparse coding based detection anomaly in stacked RNN framework," in Proceedings of the IEEE International Conference on Computer Vision (ICCV), Venice, Italy, October 2017 рік.
[21] W. Luo, L. Wen, and S. Gao, "Remembering history with convolutional LSTM for anomaly detection", in Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), pp. 439–444, IEEE, Гонконг, липень 2017 р.
[22] Y. Chang, Z. Tu, W. Xie та J. Yuan, "Clustering driven deep autoencoder for video anomaly detection", in Proceedings of the European Conference on Computer Vision (ECCV), pp. 329–345, Springer, Глазго, Велика Британія, серпень 2020 р.
[23] L. Wen, W. Luo, D. Lian і S. Gao, "Future frame prediction for anomaly detection – a new baseline", in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), стор. 6536–6545, IEEE, Солт-Лейк-Сіті, Юта, США, червень 2018 р.
[24] M. Song, "A mean field view of the land of two-layer neural networks", Proceedings of the National Academy of Sciences, vol. 115, вип. 33, стор. E7665–E7671, 2018.
[25] B. Ding і G. Wen, "Sparsity constraint nearest subspace classifier for target recognition of SAR images", Journal of Visual Communication and Image Representation, vol. 52, стор. 170–176, 2018.
[26] T. Wang і H. Snoussi, "Виявлення ненормальних візуальних подій за допомогою глобальної оптичної орієнтаційної гістограми", IEEE Transactions on Information Forensics and Security, том. 9, № 6, стор. 988–998, 2014.






