Увереността, че човек би разпознал фишинг, не е доказателство за умение. За да се оцени устойчивостта срещу такива съобщения, увереността трябва да се съпостави с действителното представяне, трудността на конкретния тест и начина, по който организацията измерва кликванията и докладванията. Един процент сам по себе си не дава пълна картина.
Това е важно и за специалистите по сигурност. Резултатите от симулация могат да покажат къде процесът има слабости, но не са автоматично мярка за качеството на отделния служител. Свръхувереност при разпознаване на фишинг е възможен риск, но не се установява само с въпроса „Смяташ ли, че ще го забележиш?“
Какво означава калибрация на увереността
Калибрацията на увереността описва доколко оценката на човек за собствената му точност съответства на реалните му резултати. Ако участник многократно заявява 80% увереност в решения от един и същ тип, добре калибрирана оценка би означавала, че приблизително 80% от тези решения са правилни. Това е смислено при множество сравними решения, а не като присъда върху единичен отговор.
Затова калибрацията не е равнозначна на общ резултат от тест. Човек може често да познава правилно, но да не е наясно кога знанията му са несигурни. Друг може да действа предпазливо и да докладва съмнителни съобщения, но да не умее да посочи убедително защо едно от тях е опасно. Точност, увереност и предпазливо поведение са свързани, но различни неща.
В изследването си Moore и Healy разграничават няколко форми на свръхувереност: надценяване на собственото представяне, завишена преценка за представянето си спрямо другите и прекомерна сигурност в точността на собствените преценки. Тази рамка помага да се задават по-точни въпроси, но изследването не е специфично за фишинг и не доказва, че определено ниво на увереност предсказва реакцията на служител при конкретна атака. Приложението ѝ към обученията по сигурност е полезна интерпретация, не пряк резултат от тяхната работа.
На практика е по-информативно участниците да посочват увереността си за конкретни решения, след което тя да се сравнява с резултатите им в серия от задачи. Важно е задачите да са достатъчно сходни, за да има смисъл сравнението. Ако тестът съдържа един лесен пример, той не позволява надеждно заключение за калибрацията или за поведението при разнообразни ситуации.
Трудността на теста променя значението на резултата
Еднакъв процент на кликване може да означава различни неща при съобщения с различна трудност. В една симулация писмото може да съдържа очевидни несъответствия, а в друга да използва контекст, който изглежда напълно обичаен за работата на получателя. Без описание на тестовите съобщения и условията резултатът е труден за тълкуване.
NIST Phish Scale е методика за оценяване на трудността на фишинг съобщения, предназначена да подпомага анализа на резултати от симулации. Сред разглежданите характеристики са забележимостта на признаците, които могат да насочат към измама, и доколко заложеният сценарий съответства на очакванията и контекста на получателя. Идеята е резултатът да се разглежда във връзка с предизвикателството, което е поставено пред участника, а не изолирано като оценка на неговите умения.
Това не прави скалата универсален измервател на „добрия фишинг“ или готов инструмент за класиране на служителите. Оценката зависи от конкретното съобщение, аудиторията и начина, по който признаците са разпознати и оценени. Една характеристика може да е очевидна за даден екип, но да не е такава за друг; контекстът на организацията има значение. NIST Phish Scale подпомага интерпретацията, но не премахва необходимостта от човешка преценка и описание на ограниченията.
При сравнение на кампании затова трябва да се пита не само „Какъв е процентът?“, а и „Какво точно беше изпратено, на кого и при какви условия?“. Ако тестовете се различават по трудност, аудитория, момент или начин на доставка, прякото сравнение може да бъде подвеждащо. Дори промяна между две кампании не доказва сама по себе си, че обучението е причинило подобрение или влошаване.
Кликванията и докладванията измерват различни поведения
Процентът на кликване обикновено описва дела на получателите или доставените съобщения, при които е отчетено кликване върху зададен елемент. Точната формула обаче се различава между методики: знаменателят може да включва доставени съобщения, уникални получатели или друга определена група, а „кликване“ може да означава различни действия. При сравнение организацията трябва да посочи собствената си дефиниция.
Този показател показва, че е настъпило конкретно действие, но не обяснява защо. Кликването може да е резултат от доверие в съобщението, навик, неясен процес, бързане или други обстоятелства. Само по себе си то не показва дали човек е забелязал признаците, дали е разбрал риска или дали би реагирал различно при реална атака.
Процентът на докладване обикновено описва дела на получателите или съобщенията, за които е регистрирано докладване чрез определения канал. И тук формулата има значение: броят на докладвалите уникални хора не е същото като броя на подадените доклади. Трябва да е ясно и дали се брои само използването на официалния бутон, или се включват и други канали, например сигнал до екипа по сигурността.
Докладването показва готовност за действие и може да помогне на организацията да забележи подозрителна кампания. То не доказва непременно, че човекът правилно е класифицирал съобщението. Възможни са и погрешни сигнали, а част от правилните сигнали може да не попаднат в отчетите, ако каналът за докладване е неудобен или непознат.
Кликванията и докладванията не бива да се събират в един общ показател без ясно обяснение. Едно и също лице може първо да кликне, а после да докладва; друг може да не кликне, но и да не подаде сигнал. Съответно нисък процент на кликване не гарантира висока видимост за екипа по сигурността, а висок процент на докладване не заличава риска от кликвания. Полезно е действията да се разглеждат отделно и в рамките на конкретен период за реакция.
Оценка без обвиняване
Фишингът използва обичайни човешки условия: ограничено време, голям обем съобщения, прекъсвания и задачи, които трябва да се изпълнят бързо. Ако симулацията измерва реакция в натоварен момент, резултатът отразява не само разпознаването на подозрителни признаци, а и средата, в която човекът работи. Това не отменя нуждата от внимание; помага да се определи къде контролните мерки трябва да подкрепят хората.
Оценката трябва да включва и качеството на самия тест. Съобщението съответства ли на обичайните процеси? Беше ли ясно как се докладва подозрителен имейл? Достигна ли симулацията до получателите по очаквания начин? Измерването обхвана ли докладите по всички реално използвани канали? Ако отговорът на тези въпроси е неизвестен, изводът за „невнимание“ е по-силен, отколкото данните позволяват.
Полезният анализ търси повтарящи се модели, а не виновник. Ако хората кликват при съобщения, които имитират обичайни работни задачи, може да е необходимо да се преразгледат процедурите за проверка или потвърждение. Ако малко хора докладват, проблемът може да е в липсата на лесен канал, не само в разпознаването. Ако сигналите се обработват бавно или не получават обратна връзка, мотивацията за докладване може да отслабне.
Как резултатите да водят до подобрения
За практична оценка е полезно да се съчетаят няколко показателя и да се документират условията на измерването:
-
Опишете дефинициите: какво се брои за кликване и докладване, какъв е знаменателят и какъв период се отчита.
-
Оценете трудността на тестовите съобщения и запазете информация за аудиторията и контекста им. При подходящи случаи използвайте NIST Phish Scale като помощ за интерпретацията, а не като окончателна оценка на служителя.
-
Разглеждайте кликванията, докладванията и други значими действия поотделно. Проверявайте дали каналът за сигнализиране е достъпен и дали отчетите могат да бъдат свързани с конкретно съобщение.
-
Съпоставяйте количествените резултати с качествена обратна връзка: кои признаци са били забелязани, какво е затруднило решението и какво би направило безопасната реакция по-лесна.
-
Повтаряйте измерването при сравними условия и описвайте ограниченията. Не представяйте промяна в един показател като доказателство за причинно-следствен ефект, ако дизайнът на оценката не позволява такъв извод.
Целта не е да се докаже, че хората никога няма да бъдат подведени. Целта е да се установи какво знаят, доколко преценките им са калибрирани и дали организацията им позволява да реагират безопасно. Увереността има стойност, когато се проверява срещу реални резултати и се тълкува в контекст; без това тя остава само самооценка.
Този подход се вписва в по-широкия модел, при който човекът е част от атакуваната система: входът, доверието, действието, предоставените права и наличният контрол влияят върху крайния риск. За общия преглед на този модел прочети и материала за човешкия фактор в AI сигурността.
