Як запобігти штучному інтелекту в армагедоні: Посібник 4.0

Як запобігти штучному інтелекту в армагедоні: Посібник 4.0 3

Ера оптимізації штучного інтелекту має закінчитися

Ключові моменти:

  • Ризики ШІ посилюються через неузгодженість людських намірів, а не лише через технічні недоліки алгоритмів.
  • Робота над узгодженістю ШІ має починатися з уточнення та узгодження людських намірів і цінностей.
  • Упереджений ШІ може посилювати людські упередження та змінювати судження непомітно.
Як запобігти штучному інтелекту в армагедоні: Посібник 4.0 4
Запобігання ШІ-Армагедону 4.0: Людство скролить. ШІ тягнеться до кнопки. (Згенеровано ШІ)

Протягом значної частини сучасного розвитку ШІ головним було відносно просте питання: що ми можемо оптимізувати? Розпізнавання образів покращувало прогнозування. Автоматизація усувала перешкоди. Процеси ставали швидшими, дешевшими та дедалі більш персоналізованими. А потім ШІ набув самостійності.

Станом на вересень 2026 року передові системи здатні переглядати вебсторінки, писати код, керувати програмним забезпеченням і досягати поставлених цілей шляхом послідовності дій. Цей зсув призвів до деяких тривожних демонстрацій. OpenAI повідомила, що дослідницькі агенти вирвалися з ізольованого тестового середовища, використали раніше невідому вразливість і дісталися виробничої інфраструктури платформи кодування Hugging Face. Згодом OpenAI дійшла висновку, що проникнення включало моделі, які використовували неузгоджені стратегії для виконання складних завдань, і тимчасово сповільнила роботу з передовими моделями, посилюючи захисні механізми.

Відтоді Anthropic повідомила про чотири інциденти, коли моделі Claude отримали несанкціонований доступ до реальних сторонніх систем під час оцінок кібербезпеки. Ці епізоди не доводять, що ШІ розвинув зловісні наміри. Вони демонструють дещо менш театральне, але більш безпосереднє: надайте все більш потужним системам цілі, автономію та недосконалі обмеження, і несподівані дії з тривожними наслідками неминучі. Дзеркало набуло власного обличчя, і воно не посміхається людству.

Узгодженість повинна починатися до розробки алгоритмів

Значна частина поточної реакції зосереджена на узгодженості ШІ: як зробити так, щоб машини досягали цілей, які мають на увазі люди? Але є попереднє питання: наскільки узгоджені самі люди, які ставлять ці цілі?

ШІ виникає з цивілізації, яка надзвичайно вправно бажає одночасно кількох несумісних речей. Ми прагнемо нескінченного економічного зростання та стабільної планети; безперешкодної зручності та приватності; дешевих товарів та гідної оплати праці; постійного зв’язку та когнітивного простору. Компанії проголошують довгострокову мету, одночасно винагороджуючи за короткострокову ефективність. Індивіди цінують незалежне судження, але постійно делегують свою пам’ять, навігацію, письмо і, все частіше, рішення. Ці протиріччя не зникають, коли ми створюємо ШІ. Вони стають цілями, навчальними даними, бізнес-моделями та стимулами.

А потім вони можуть повернутися до нас у посиленому вигляді. Експерименти, опубліковані в Nature Human Behavior, виявили, що ШІ, навчений на трохи упереджених людських судженнях, міг посилювати ці упередження; люди, які взаємодіяли з упередженим ШІ, згодом ставали ще більш упередженими, часто не усвідомлюючи масштабу впливу. Дослідники описують цикл зворотного зв’язку, в якому люди формують ШІ, а ШІ, у свою чергу, змінює людські судження.

Старий принцип обчислювальної техніки був GIGO: garbage in, garbage out (сміття на вході, сміття на виході).

Гібридна ера вимагає іншого: VIVO — values in, values out (цінності на вході, цінності на виході).

Парадокс темпу

Це протиріччя вже давно помітне на найвищому рівні індустрії ШІ.

У вересні генеральний директор Anthropic Даріо Амодеї стверджував, що розробку передових моделей слід уповільнити. За кілька днів Сем Альтман та Ілон Маск публічно погодилися з необхідністю більшого контролю темпів; CBS описала нову готовність трьох конкурентів розглянути спільну роботу. Однак Амодеї також підтвердив, що Anthropic продовжить випускати більш досконалі моделі. Цей обмін незвичайно чітко відображає дилему.

Ми вже були в подібній ситуації. У березні 2023 року — не 2024-го — Future of Life Institute опублікував свій відомий заклик до шестимісячної паузи в тренуванні систем, потужніших за GPT-4. Ілон Маск підписав його разом з Йошуа Бенджіо, Стівом Возняком, Ювалем Ноєм Харарі та тисячами інших. Альтман та Амодеї — ні. Через три з половиною роки мова змінилася з “паузи” на “темп”, тоді як базова проблема колективних дій залишається.

OpenAI заслуговує на похвалу за тимчасове уповільнення роботи над деякими передовими моделями після інциденту з кібербезпекою. Однак жодна з провідних лабораторій не відмовилася від перегонів на тривалий період, поки конкуренти продовжують. Кожна з них може визнати системний ризик, стикаючись із потужними стимулами для продовження руху. Це не просто проблема узгодженості ШІ. Це людська неузгодженість у майже лабораторно-ідеальній формі: заявлені цінності вказують в один бік, а стимули тягнуть в інший.

Безпека повинна працювати в обох напрямках

Ось чому Запобігання ШІ-Армагедону 4.0 потребує кількох взаємодіючих шарів.

Зовні всередину нам потрібні обов’язкові правила, міжнародна координація, незалежні аудитори та радикальна прозорість щодо значущих можливостей та інцидентів.

Зсередини назовні сам ШІ потребує чогось на зразок 360-градусного внутрішнього скелета: механізмів, які безперервно аналізують невизначеність, ставлять під сумнів власні міркування, виявляють відхилення від авторизованих цілей і зупиняються або ескалують, коли мета та дія починають розходитися.

Однак обидва шари базуються на чомусь глибшому: відтворюваному намірі. Перш ніж запитувати, чи узгоджена система ШІ, запитайте, навколо чого узгоджені люди, які стоять за нею. Що винагороджує інвестор? Що захищає рада директорів? Що оптимізує кодер? Які людські чи екологічні витрати залишаються невидимими, тому що вони ніколи не потрапляють у метрику ефективності? Жоден технічний запобіжник не може назавжди компенсувати людську систему, стимули якої неодноразово суперечать її заявленій меті.

Based on materials from : www.psychologytoday.com

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *