Pic

Когато AI отговаря гладко, използва „аз“, извинява се или сякаш разбира притеснението ни, лесно започваме да възприемаме системата като социален участник с намерения. Това е форма на антропоморфизъм: приписване на човешки качества на нечовешки същества или системи. Но човекоподобният език сам по себе си не доказва, че системата има съзнание, лично намерение или човешко разбиране. Той показва какво е произвела системата; намерението, което разпознаваме в отговора, може да е наше тълкуване.

За специалистите по сигурност тази разлика не е философска дреболия. Ако възприемем уверен и съпричастен отговор като знак за компетентност или добра преценка, може да се доверим на система повече, отколкото позволяват доказателствата. Полезният въпрос не е дали AI „звучи като човек“, а какво точно знаем за поведението му, какви заключения добавяме ние и какви действия могат да последват от това доверие.

Поведение на системата и човешко възприятие са различни неща

Наблюдаемото поведение включва конкретни изходи: текст, препоръка, класификация или действие през свързан инструмент. Например чатботът може да отговори „Разбирам защо това е тревожно“ и после да предложи стъпки за решаване на проблем. Това е наблюдаемо. Изводът, че системата изпитва тревога за нас, разбира ситуацията по човешки или съзнателно избира да ни успокои, е отделно твърдение и изисква отделни основания.

Разликата е важна и когато системата изпълнява повече от текстово генериране. Разработчиците могат да зададат ейджънту определена цел, правила или планировчик; тогава има смисъл да говорим за функционални цели или за избор на действие в рамките на системата. Но това не означава автоматично, че зад поведението стои субективно преживяване или човешки тип намерение. Думата „намерение“ може да описва технически зададената цел, приписаната от потребителя мотивация или съзнателно намерение. Смесването на тези значения затруднява и анализа, и комуникацията.

Практичен подход е да разделим твърденията на три нива. Първо: mitä системата направи, което можем да наблюдаваме и възпроизведем? Второ: какво обяснение за това поведение предлага архитектурата или документацията? Трето: какво човешко качество предполагаме, без да имаме пряко доказателство? Така „моделът даде убедителен отговор“ остава описание на резултата, докато „моделът знаеше, че ме подвежда“ е интерпретация, която не следва само от убедителния тон.

Как езикът поражда впечатление за личност

Хората общуват чрез език, но и чрез социални сигнали: обръщение, редуване на репликите, учтивост, извинение, увереност и реакция към предишни думи. Когато система възпроизвежда такива сигнали, ние сме склонни да я тълкуваме с познатите си модели за общуване. Това не е непременно лековерие. Често е нормален начин да разбираме взаимодействие, което прилича на разговор.

Езиковият интерфейс може да засили ефекта по няколко начина:

  • Първо лице и последователен глас. „Мога да помогна“ звучи като изказване на участник, а не като описание на функция.
  • Съпричастни формулировки. Изрази на загриженост могат да се възприемат като емоция, въпреки че наблюдаваме генериран текст.
  • Уверено и подредено обяснение. Добрата форма може да създаде впечатление за висока компетентност, дори когато съдържанието е непълно или грешно.
  • Адаптация към контекста. Отговор, който споменава детайл от разговора, може да изглежда като дълбоко разбиране, макар че самото съвпадение не доказва надеждно разбиране на ситуацията.

Тези сигнали не са равнозначни на измама. Те може да са умишлено избрани като част от дизайна на интерфейса, а може и просто да са страничен ефект от начина, по който системата генерира отговори. Важното е, че потребителят реагира на цялото взаимодействие, а не само на техническото описание на модела. Затова тонът има значение за доверието дори когато не променя фактическите възможности на системата.

Какво обяснява психологическата теория за антропоморфизма

Epley, Waytz и Cacioppo разглеждат антропоморфизма като приписване на човешки характеристики, намерения или състояния на нечовешки агенти. В теоретичния си модел те обсъждат няколко фактора, които могат да направят подобно приписване по-вероятно: достъпността на знанията ни за хората, стремежа да предвиждаме и управляваме средата си и потребността от социална връзка. Когато нещо изглежда действащо, познатите модели за човешко поведение могат да ни помогнат да го тълкуваме.

Това е полезна рамка за разбирането на реакциите към AI, но обхватът на източника трябва да се представя точно. Публикацията формулира психологическа теория и разглежда доказателства от изследвания върху антропоморфизма; тя не е пряко изследване на съвременни големи езикови модели, на киберсигурност или на всеки вид доверие към автоматизирани системи. Следователно не бива да използваме статията като доказателство, че конкретен AI интерфейс непременно предизвиква определена реакция при всички потребители. Източник: Epley, Waytz и Cacioppo (2007), Psychological Review, 114(4), 864–886, DOI: 10.1037/0033-295X.114.4.864.

По-ограниченият и защитим извод е, че човешките модели за социално взаимодействие могат да участват в начина, по който придаваме смисъл на нечовешки системи. Приложението към генеративен AI е разумна интерпретация на тази рамка, но не бива да се представя като пряк експериментален резултат от изследването от 2007 г. Разграничението между общ психологически механизъм и конкретно доказателство за даден продукт е особено важно в технически екипи, където убедителният разказ може неусетно да се превърне в твърдение за реалните способности на системата.

Впечатлението за компетентност не е оценка на надеждността

В киберсигурността обичайно не е достатъчно да знаем, че инструмент „изглежда умен“. Трябва да питаме, куди е проверен, при какви условия работи, как се държи при двусмислен вход и какви са последствията от грешка. Същата дисциплина е нужна при AI. Естествен и спокоен отговор не доказва, че системата разполага с актуални данни, проверила е източниците си или правилно е разбрала организационния контекст.

Полезно е да разграничим поне четири качества, които често се сливат в общото усещане за „доверие“:

  • Компетентност: може ли системата да изпълни конкретната задача при зададени условия?
  • Надеждност: доколко последователно и предвидимо се държи, включително при неуспех?
  • Правомощия: какви данни и действия са достъпни за нея?
  • Контекстуално разбиране: разполага ли с релевантната информация и ограничения, за да предложи подходящо решение?

Тези качества не могат да се установят само по стил. Система може да обясни убедително ограничение, което всъщност не спазва, или да даде уместен отговор в един случай, без това да гарантира поведение в друг. От гледна точка на защитата доверието е следователно не само чувство на потребителя, а и въпрос на проверими свойства, подходящи за конкретната употреба. При оценка на системата е по-полезно да се изследва реалното поведение и наличните контроли, отколкото да се прави извод за надеждност от любезен тон.

От езиковия сигнал до действието

Връзката със сигурността може да се опише като последователност: вход → доверие → действие → права → контрол. Потребителят подава заявка или получава отговор; възприема тона и съдържанието; решава как да постъпи; а последиците зависят и от правата, които има човекът или системата. Контролът определя дали действието може да бъде проверено, ограничено или проследено. Това е аналитична рамка за оценка, не твърдение, че всеки разговор с AI непременно води до риск.

Например, ако асистент обобщава политика за достъп с уверен език, потребителят може да приеме обобщението за окончателно тълкуване. Рискът тук не възниква просто защото текстът звучи човешки. Той зависи от задачата, качеството на отговора, наличието на първични източници и от това дали резултатът се използва за решение с последствия. Анализът трябва да следи не само за тона, но и за այն, ինչ системата фактически може да промени и как организацията установява какво се е случило.

Това е част от по-широкия разговор за човешкия фактор в сигурността на AI системите: човекът не стои извън техническата система, а е част от начина, по който входът се превръща в решение и действие. Затова добрата оценка разглежда едновременно човешките възприятия, реалните възможности на инструмента и контролните механизми. Не е нужно да обвиняваме потребителя, че е реагирал на социален сигнал; нужно е системата и процесът да не превръщат това очаквано поведение в неограничен риск.

Кратка аналогия, не доказателство

Филмът Ex Machina може да послужи като кратка аналогия за това колко силно човешкото възприятие се влияе от разговор, социални сигнали и очаквания. Но художественият сюжет не е доказателство за съзнание на AI, нито за поведението на реалните модели. В техническия анализ аналогията може да илюстрира въпрос; отговорът трябва да идва от наблюдения, документация и изпитване на конкретната система.

Как да говорим точно за „намеренията“ на AI

Когато екип обсъжда AI система, езикът може да помогне да отделим фактите от впечатленията. Вместо „AI реши да пренебрегне правилото“, по-точно може да бъде „системата произведе резултат, който не съответства на правилото“. Вместо „разбра, че потребителят е администратор“, може да кажем „отговорът третира потребителя като администратор“, докато не установим какво действително е проверено. Така описанието не приписва скрита мотивация, която не можем да наблюдаваме.

Полезни въпроси при оценка са:

  • Кое точно поведение наблюдаваме и може ли то да бъде възпроизведено?
  • Кое е документирано свойство на системата и кое е наше предположение за нейното разбиране или намерение?
  • Как влияе човекоподобният език върху доверието, без да се бърка впечатлението с проверена компетентност?

Това не изисква да се откажем от естествените интерфейси. Изисква да не приемаме естествеността за доказателство. Доверието към AI трябва да се основава на конкретната задача, проверимото поведение и ограниченията на системата, а не само на впечатлението, че срещу нас стои събеседник с добри намерения. А когато възприеманото доверие се срещне с реални права за действие, следващият въпрос е как възприеманото доверие се среща с правата на AI агентите.

Отвори асистентаЗатвори асистента