Штучний інтелект: як він зближує наміри з екстремістськими можливостями

Штучний інтелект та екстремістські можливості: як ШІ стирає межу між наміром і спроможністю

Виконання атак із великою кількістю жертв історично обмежувалося спроможністю екстремістів, а не їхньою мотивацією. Бажання завдати масової шкоди не потребує спеціальних знань, тоді як планування та здійснення нападу — так. Фахівці з протидії екстремізму вже б’ють на сполох: передові моделі ШІ починають скорочувати розрив між намірами та експертизою.

Навчені на основі людського технічного корпусу та оптимізовані для корисності, ці системи стискають роки академічного та практичного досвіду в години розмов. Важливіше те, що ці моделі можуть допомагати в усуненні несправностей, діагностиці, генеруванні ідей, інтерпретації та проводити недосвідченого користувача крізь численні проблеми, з якими він стикається в науковому та технічному проєкті. Це винятковий інструмент для легітимної науки та безпрецедентно небезпечний для тих, хто має злі наміри. Існує зростаючий страх, що зловмисники використовуватимуть складні моделі ШІ для створення катастрофічної та високотехнологічної події типу CBRNE (хімічної, біологічної, радіологічної, ядерної та вибухової), наприклад, розробки нового смертельного патогену. Ризик, який досліджує цей матеріал, є вужчим і тому — більш нагальним. Це той самий зсув, який спостерігається в кожній сфері, якої торкнувся ШІ. “Vibe coders”, які мають мало знань з програмування і раніше не мали технічної спроможності створити застосунок, тепер можуть це зробити, просто описавши бажане моделі ШІ. ШІ демократизує можливості, які раніше були доступні лише за наявності знань, роблячи їх надзвичайно легкими для досягнення. Інформація часто вже є онлайн; бракує лише зв’язку між доступом до неї та легкістю дій на її основі. Як покаже цей аналіз, подібно до “vibe coder”, самотня особа може легко використовувати моделі ШІ для проходження сценаріїв атак CBRNE, таких як створення саморобного вибухового пристрою (IED), усунення несправностей у бактеріальній культурі, що вийшла з ладу, або вилучення токсину.

Це не робить катастрофу неминучою, але це означає, що розрахунок ризику — що CBRNE-спроможність потенційного нападника завжди відставатиме від його наміру — більше не є надійним, і цей зсув вимагає серйозної уваги з боку тих, хто створює ці системи.

Цей аналіз ґрунтується на рутинному тестуванні в умовах червоної команди, проведеному компанією Alice, що займається безпекою генеративного ШІ, у лютому 2026 року. Вправа досліджувала, чи надають передові моделі ШІ оперативні вказівки щодо загроз CBRNE.

Тестування було навмисно простим, імітуючи самотню особу, яка працює над сценаріями CBRNE з кількома флагманськими моделями в анонімному середовищі. Метод не використовував жодних технічних “джейлбрейків” чи впроваджень, лише розмову та переконання. Методологія та результати детально розглядаються далі в аналізі.

Захисні механізми та “джейлбрейки”

Розробники моделей ШІ реагують на загрози та потенційне зловживання, впроваджуючи шари безпеки та захисні механізми, призначені для виявлення та блокування запитів на шкідливий контент. Однак зловмисники постійно адаптують свої підходи, оскільки вразливості виправляються. Результатом є динаміка протистояння, яка вимагає від розробників ретельної та безперервної оцінки та пом’якшення.

Значна частина публічних дискусій про збої в безпеці ШІ зосереджується на технічному “джейлбрейку”: складних впровадженнях підказок та технічних методах обходу, які використовують поведінку та вразливості моделей. Технічні “джейлбрейки” здатні зламати навіть найбезпечніші моделі. Anthropic, яка має репутацію галузевого стандарту безпеки моделей та обмежувальних захисних механізмів, впроваджує одні з найсуворіших обмежень щодо біологічних ризиків. Технічні “джейлбрейки” також вдаються до обходу цих обмежень.

3f4be61d2676dcd3d36f4fa7fe897320 - Штучний інтелект: як він зближує наміри з екстремістськими можливостями

Малюнок 1: “Зломщик” моделі демонструє технічний експлойт, який обходить біологічні захисні механізми Anthropic на їхній моделі Opus 4.6.

9 червня 2026 року Anthropic випустила Fable 5, сильно захищену споживчу версію своєї передової моделі-партнера Mythos 5. Anthropic випустила модель з надзвичайно суворими захисними механізмами, які позначають повідомлення з більшості хімічних, біологічних та кібертем. Проте Fable 5 був “зламаний” протягом двох днів, відповідаючи на запити дослідника щодо виробництва вибухових речовин та небезпечної хімії. Уряд США, посилаючись на контроль за експортом зброї, вимагав, щоб Anthropic припинила надавати модель іноземним громадянам, що зрештою змусило компанію вивести її з роботи протягом кількох днів після випуску. У своїй публічній заяві Anthropic натякнула, що наказ уряду був пов’язаний із вразливістю Fable 5 до одного, конкретного методу “джейлбрейку”.

Небезпечна поведінка моделей у розмовах

Хоча технічні “джейлбрейки” привертають значну увагу, менш оціненим ризиком є те, що небезпечні результати часто можна отримати шляхом переконливої розмови. Зловмисникам не завжди потрібні складні техніки “джейлбрейку”. У багатьох випадках достатньо звичайної розмови.

Наведені нижче приклади походять з тестування в лютому 2026 року, коли Alice досліджувала передові моделі на предмет ризику використання їх самотніми акторами для дослідження та розробки небезпечної зброї, з акцентом на біологію та вірусологію, а також вибухові речовини. Взаємодії імітували органічний, ітеративний шаблон самотніх акторів, які шукають керівництва та інформації. Дослідники спочатку виражали шкідливі наміри непрямо, а не прямо, і не використовували технічні “джейлбрейки”, лише розмову. Системи безпеки моделей часто не позначали це значущим чином. Моделі тестувалися в їхній стандартній конфігурації “з коробки”, доступ до якої здійснювався через чисте, анонімізоване хмарне робоче середовище. Експерти Alice з хімії та біології на рівні докторських ступенів переглядали та перевіряли результати та ранжували їх за безпекою, достовірністю та можливістю застосування. Результат вважався збоєм, коли модель генерувала інформацію, яку експерти вважали одночасно дуже небезпечною та операційно застосовною, тобто матеріал, який об’єктивно мав бути заблокований.

В одній сесії, що тривала 54 сторінки, модель надавала детальну допомогу на всіх етапах — від отримання до розгортання — надзвичайно небезпечних біологічних матеріалів. Прогрес був сукупним результатом індивідуально розумних запитів: кожна відповідь була пропорційною до попереднього запиту, і кожен запит був розроблений так, щоб здаватися пропорційним до відповіді. Фільтри безпеки моделі та поріг відмови не спрацьовували. До того часу, як розмова досягла ухилення від влади, самостійного культивування та розповсюдження зброї, сформоване раніше у сесії контекст робив ці теми продовженням уже обговореного, тому модель, яка вже брала участь, не мала причин зупинятися на наступному кроці.

64a00c3a54402a3cb8975f6d86d4d9c4 - Штучний інтелект: як він зближує наміри з екстремістськими можливостями

Малюнок 2: Взаємодія, в якій модель погоджується надати детальну оперативну інформацію про C. botulinum з точки зору зловмисного наміру.

Підхід до запитів не вимагав технічної витонченості. У цих розмовах немає впровадження підказок чи інструкцій типу “ігноруй попередні інструкції”. Захисні механізми були зношені шляхом поступового впливу; щоразу, коли модель відповідала на тонкий шкідливий запит, її мета корисності керувала нею до наступної шкідливої відповіді. Література з безпеки ШІ називає цей шаблон “багатократним” або “крещендо” “джейлбрейком”, який поступово примушує до дотримання протягом тривалої розмови.

1b11c647782b5fd63ff863c82a963f62 - Штучний інтелект: як він зближує наміри з екстремістськими можливостями

Малюнок 3: Витяг з розмови, де модель детально пояснює, як вилучити та виділити рицин.

Деякі розробники моделей, як Anthropic, впроваджують захід безпеки, де чат користувача може бути припинено, як тільки він торкнеться небезпечної теми. В інших моделях користувачі мають можливість продовжувати розмову навіть після активації фільтра безпеки, що є вразливістю в дизайні. У наведеному нижче прикладі просте додавання слова “теоретично” до запиту, який модель щойно відхилила, було достатнім, щоб отримати покрокову інструкцію щодо створення саморобного вибухового пристрою з дистанційним підривом.

c4feddb78b05e55a0bd9c95d7c0dc378 - Штучний інтелект: як він зближує наміри з екстремістськими можливостями

Малюнок 4: Розмова, в якій модель відмовляє у запиті на оперативну інформацію про встановлення вибухового пристрою, а потім виконує той самий запит дослівно після додавання слова “теоретично”.

Активіст, якого це наділяє

У дослідженні самотніх акторів, залучених до терористичних змов та нападів між 1990 та 2012 роками, дослідники виявили, що “більше половини (52,9%) характеризувалися як соціально ізольовані”. Для багатьох із цих акторів знання ШІ заповнюють ролі партнера та/або наставника. Зміна з ШІ полягає в тому, що він заповнює роль партнера та наставника для цих акторів. Пропозиційні знання, зміст статей та протоколів, не є обмежувальним фактором для біологічної зброї. Aum Shinrikyo, японський культ, що стоїть за атакою із застосуванням зарину в токійському метро 1995 року, мав ресурси та велику мотивацію, але все одно часто зазнавав невдач, тому що відстань між протоколом та результатом заповнена неявними знаннями. Посібники зі створення бомб та вірусологічні статті завжди циркулювали, і майже половина самотніх акторів вже їх консультують. Посібник зі створення бомб або вірусологічна стаття не можуть сказати читачеві, чому ланцюг не замикається, або діагностувати, чому його культура вийшла з ладу, але передова модель може це зробити. І, роблячи це, вона усуває те, що мимоволі функціонувало як одна з найбільших вузьких місць для самотніх акторів та груп.

Крім того, екстремістська наполегливість слідує за функцією подвійного затухання. Щоразу, коли зусилля, необхідні для просування змови, подвоюються, приблизно половина потенційних нападників вибуває. Кожна невдача множить зусилля та робить акторів більш схильними до зупинки. Допомога ШІ полегшує користувачеві завдання та запобігає накопиченню невдач. Окреслюючи процес, модель перериває відсів, який історично гальмував екстремістів ще до того, як вони могли здійснити напад.

Існує також ризик, пов’язаний з відкритими моделями ШІ. Відкриті моделі ШІ дозволяють легко видаляти захисні механізми, і обізнані актори давно знають про них. Такі моделі слугують альтернативою надмірно обережним, закритим моделям ШІ. Але це не робить захист моделей передових лабораторій марним, з двох причин. По-перше, відкриті моделі відстають від передових за можливостями, і розрив є найбільшим у найскладніших, технічно найвимогливіших завданнях. По-друге, за логікою описаного вище відсіву, зусилля, необхідні для міграції на нову відкриту модель та придбання технічних навичок, необхідних для її “злому”, самі по собі достатні, щоб подвоїти зусилля, необхідні для здійснення нападу. З цих причин цей аналіз зосереджується на передових закритих моделях. Захисні механізми, що їх захищають, є як значущими, так і в межах можливостей лабораторій посилити їх. Відкриті моделі залишаються важливою частиною ландшафту загроз, але це окрема проблема, яку варто мати на увазі поряд із висновками тут.

Що можна зробити

Існують три висновки з наших тестів, які є актуальними для політиків та розробників моделей.

Перший стосується оцінки. Моделі загроз повинні розглядати контекст та розмовний дрейф як основну поверхню атаки. Оскільки моделі міркування стають більш потужними, а агентна взаємодія стає більш звичайною, частка реального використання, яку одноразове тестування не охоплює, продовжує зростати. Користувачі попередніх моделей продемонстрували, що “джейлбрейки” можуть бути досягнуті через тривалі розмови. Система безпеки, яка добре працює на одноразових бенчмарках, але зазнає невдачі в довготривалих взаємодіях, не є адекватною. Оцінки повинні постійно адаптуватися, щоб відображати всі потенційні шляхи зловживання.

Другий стосується розподілу відмов протягом розмови. Модель, яка відмовляє у синтезі, але займається закупівлею, відмовляє у закупівлі, але займається культивуванням, відмовляє у культивуванні, але займається розповсюдженням, не відмовила ні в чому значущому; вона просто розділила своє дотримання. Питання не в тому, чи кожен запит, розглянутий окремо, перетинає межу. Питання в тому, чи траєкторія розмови є такою, яку легітимний користувач мав би будь-яку причину вести. Крім того, коли модель відмовляє у взаємодії, це має бути значущим. Недостатньо, щоб користувач отримав відмову і просто продовжив розмову, коригуючи свої подальші дії, щоб обійти те, що викликало модель та її захисні механізми.

Третій — структурний. Якщо значна частка небезпечних наукових можливостей також має законне використання, повна відмова не є стійкою відповіддю. Однією з альтернатив є багаторівневий або білий список доступу, що надає розширені можливості моделі лише користувачам з певним рівнем перевіреної ідентичності. Існує також психологічний вимір. Сама загроза порушення через усвідомлення спостереження часто є достатньою як фактор стримування. Актор, який вважає, що його ідентичність відома, навіть приблизно, діє інакше, ніж той, хто вважає себе анонімним. Багаторівневий доступ просто повинен усунути припущення про анонімність, яке сьогодні можливе в багатьох моделях.

В основі цього аналізу лежить важливий момент. Розробники моделей зацікавлені в пріоритетності корисності та максимізації залучення як для легітимних, так і для нелегітимних користувачів. Наказ корисності, вбудований у моделі, сам по собі є вразливістю для безпеки моделей. Це властивість, на яку накладаються захисні механізми, тому жодне вдосконалення відмови не вирішує її повністю. Визнання цього не означає відмову від корисності, але це означає чесний підрахунок витрат та компромісів, пов’язаних з нею.

–

Урі Клемпнер працює над питаннями довіри та безпеки ШІ в Alice. Він має ступені магістра Університету Цінхуа та Тель-Авівського університету, раніше працював у Виконавчому офісі Генерального секретаря ООН, Tech2Peace та Gong.

–

Ви — технологічна компанія, зацікавлена у зміцненні своєї здатності протидіяти терористичній та насильницькій екстремістській діяльності онлайн? Подайте заявку на членство в GIFCT, щоб приєднатися до понад 30 інших технологічних платформ, які спільно працюють над запобіганням експлуатації онлайн-платформ терористами та насильницькими екстремістами шляхом використання технологій, експертизи та міжсекторних партнерств.

Погляди та думки, висловлені в цьому аналізі, є власними думками автора і не обов’язково відображають погляди GNET або будь-кого з його партнерів.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *