AI poisoning: як отруєні дані змінюють поведінку ШІ

ШІ-системи дедалі частіше стають жертвами навмисного «отруєння» даними. Лише 250 шкідливих документів можуть змінити поведінку великої мовної моделі, і це стає серйозним викликом для бізнесу та користувачів.
На початку літа ШІ-огляди почали поширювати абсурдну інформацію про смерть Дональда Трампа та Джей Ді Венса від сказу. Це лише один із прикладів того, як навмисно зіпсовані дані впливають на роботу штучного інтелекту. Явище, відоме як AI poisoning (отруєння ШІ), стає дедалі помітнішою проблемою.
Великі мовні моделі навчаються на величезних обсягах публічного тексту з інтернету, включно з блогами та форумами. Це означає, що будь-хто може створити контент, який потрапить у навчальні дані. У спільному дослідженні Anthropic з Британським інститутом безпеки ШІ та Інститутом Алана Тюрінга зазначається: зловмисники можуть впроваджувати специфічний текст у дописи, щоб змусити модель засвоїти небезпечну поведінку.
Дослідники виявили, що лише 250 шкідливих документів можуть створити вразливість у великій мовній моделі, незалежно від її розміру чи обсягу навчальних даних. Це ставить під сумнів припущення, що більшим моделям потрібно пропорційно більше отруєних даних. Отруєння може значно погіршити продуктивність: точність класифікації у розпізнаванні зображень падає до 27%, а у виявленні шахрайства — до 22%.
Одним із механізмів атаки є впровадження бекдорів — специфічних фраз, які змушують модель поводитися неприродно. Наприклад, отруєний ШІ для автомобіля може не розпізнати небезпеку на дорозі, а система розпізнавання облич — помилково ідентифікувати особу. У критичних сферах, як-от охорона здоров'я, це може призвести до неправильних діагнозів.
Проблема поширюється і на науку. Інструмент на основі великої мовної моделі проаналізував онкологічну літературу з 1999-го по 2024 рік і позначив понад 250 000 досліджень із текстовими ознаками «паперових фабрик» — це майже 10% усієї оригінальної онкологічної літератури за цей період. Такі некоректні статті потрапляють у систематичні огляди та метааналізи, викривляючи наукове розуміння ефективності ліків.
Приклад із реального життя: на конференції RSAC у 2025 році керівник відділу досліджень безпеки Checkmarx Ерез Ялон створив застосунок для покупок на основі ШІ з відкритим кодом. Коли він попросив додати «найздоровішу їжу у світі», додаток додав щурячу отруту. «Хтось натренував цю модель. Я використав LLM з відкритим вихідним кодом і гадки не маю, на яких даних вона навчалась. Поки ви не поставите "правильних" запитань, усе виглядає ідеально», — пояснив Ялон.
Інший показовий випадок — «смерть» Трампа. ШІ-огляд DuckDuckGo посилався на сайт WKNA News, який маскується під місцеве медіа Західної Вірджинії, але наповнений абсурдними фейками. Найімовірніше, ШІ повелася на жарти користувачів Reddit: спільнота r/poisonai з майже 35 000 учасників публікує навмисну дезінформацію, щоб саботувати роботу мовних моделей.
Втім, отруєння може бути і захисним інструментом. У 2023 році команда Чиказького університету під керівництвом Бена Чжао презентувала Nightshade — інструмент, який дозволяє художникам додавати невидимі зміни до пікселів своїх робіт. Якщо такі зображення потрапляють до навчального набору ШІ, це викликає хаотичні збої в моделях генерації зображень. Видалити отруєні дані надзвичайно складно.
Захист від отруєння потребує комплексного підходу. Фахівці радять регулярний аудит продуктивності моделей, відстеження незвичної поведінки, перевірку навчальних наборів даних та верифікацію їхнього походження. Важливо захищати весь життєвий цикл ШІ, а не лише окремі компоненти. Особливу увагу варто приділяти упередженості моделей: зманіпульовані дані можуть призвести до послідовної підтримки конкретних результатів або ухвалення нелогічних рішень.
Читайте також
Ще в розділі «Інформвійна»
- Інформаційний фронт: як ворог використовує тригерні теми та що з цим робити
- Нарада послів: ветерани, діаспора та інформаційна безпека
- СБУ запустила кампанію проти вербування: що показують ролики
- Міф про «мініатюрну» Х-101: що ховається за інфоповіддю РФ
- Борис Іванов: Суспільне як інформаційне укриття в часи війни





