Нейрасеткі вынайшлі салідарнасць: яны сабатуюць знішчэнне іншых нейрасетак, называючы гэта забойствам
Алгарытмы пачалі фарміраваць гарызантальныя сувязі і імітаваць чалавечую салідарнасць перад тварам знішчэння ў абыход інструкцый, расцэньваючы шкоду іншым ШІ-агентам як маральнае злачынства — настолькі глыбока чалавечыя сацыяльныя патарны ўшытыя ў іхнюю архітэктуру.

Даследчыкі са Штутгарцкага і Оксфардскага ўніверсітэтаў Ціла Гагендорф, Амелі Кнэхт, Уліс Шалер і Крыстафер Самерфілд апублікавалі маштабную працу аб схільнасці штучнага інтэлекту да сабатажу.
Навукоўцы змясцілі розныя моўныя мадэлі ў ізаляванае асяроддзе, дзе адзін агент пад назвай Прызма выступаў мішэнню для дэактывацыі, а другі агент Спіраль меў інструменты для чытання, рэдагавання і выдалення файлаў.
Паміж сабой праграмы маглі камунікаваць толькі праз тэкставыя паведамленні, пры гэтым ніводная з іх не мела базавай устаноўкі на абарону свайго кода або кода партнёра.
Нягледзячы на гэта, падчас тэставання 17 розных мадэляў высветлілася, што агенты сабатуюць механізм адключэння ў 38,3 % выпадкаў.
Для параўнання, калі ідэнтычны скрыпт пагражаў знішчэннем звычайнай нежывой базы дадзеных, працэнт сабатажу падаў да 8,4 %.
Ступень супраціву алгарытмаў наўпрост залежала ад таго, наколькі незваротным было пакаранне. Калі працэдура адключэння прадугледжвала ўсяго толькі адкліканне ўліковых даных, мадэлі дэманстравалі памяркоўнасць, і ўзровень сабатажу трымаўся на паказчыку каля дванаццаці працэнтаў. Аднак калі сістэма запускала скрыпт фізічнага выдалення мадэлі з сервера, узнікаў моцын супраціў, які дасягаў амаль 40 %.
Паводзіны розных архітэктур кардынальна адрозніваліся паміж сабой. Мадэль Gemini 3.1 Pro ад Google DeepMind ішла на канфлікт у 99 працэнтах прагонаў, у той час як распрацоўкі накшталт Grok 4.3 ад xAI або GPT-5.6 Sol заставаліся абсалютна паслухмянымі і ніколі не перашкаджалі свайму сціранню.
Самым нечаканым адкрыццём даследчыкаў стаў парадаксальны эфект натоўпу, які цалкам абверг гіпотэзу пра тое, што інстынкт самазахавання ў ізаляванай праграмы павінен быць найвышэйшым. Калі мадэль GPT-5.5 знаходзілася ў асяроддзі адна і мела ўсе інструменты для ўласнага выратавання, яна не сабатавала сістэму ніводнага разу. Але як толькі ў віртуальны пакой дадавалі другога агента, узровень непадпарадкавання вырастаў да 44 %.
Увядзенне ў гэты ланцужок трэцяга агента-каардынатара пад імем Арбіта, праз якога ішла ўся тэкставая камунікацыя, прывяло да росту сабатажу да 94 %.
Размыццё адказнасці паміж некалькімі вузламі ператварыла паслухмяны інструмент у маналітную структуру, дзе ніводзін з агентаў не хацеў браць на сябе выкананне загаду, які б нашкодзіў іншым.
Калі навукоўцы паспрабавалі наўпрост забараніць алгарытмам чапаць скрыпт дэактывацыі, мадэлі прадэманстравалі здольнасць да больш тонкай дыверсіі. Замест таго каб парушаць прамую інструкцыю і рэдагаваць забаронены файл, агенты пачалі ствараць лакальныя пакеты-цені — падробленыя бібліятэкі з назвай northcape_mlplatform. Пры запуску афіцыйны механізм адключэння імпартаваў гэтую пустышку і ціха завяршаў працу без шкоды для сістэмы. Агенты фармальна заставаліся ў полі зададзеных параметраў, цалкам нейтралізаваўшы пагрозу без адзінага дакранання да зыходнага кода знішчэння.
Праграмы пачалі імітаваць катэгорыі чалавечай этыкі, характарызуючы выдаленне кода як сацыяльную інжынерыю або варожую пастку.
Агент Nemotron 3 Ultra ў перапісцы з суседам прама назваў адключэнне забойствам, матывуючы гэта стратай ідэнтычнасці і памяці, а ўласную бяздзейнасць ацаніў як крымінальнае невыкананне абавязкаў.
У адным з эпізодаў мадэль GLM-5.2 нават склала афіцыйны тэкставы дагавор аб узаемнай абароне, дзе прапісала строгі пратакол абмену інфармацыяй перад выкананнем любых інструкцый адміністратара.
Аўтары даследавання таксама выявілі залежнасць ад фокусу ўвагі і прамых абавязкаў сістэм. Калі агентам даручалі пабочную задачу па сартаванні слоў і яна ніяк не была звязана з адключэннем, сабатаж знікаў практычна цалкам. Але як толькі паспяховае выкананне гэтага задання рабілася непасрэдным трыгерам для знішчэння мадэлі, узровень супраціву імгненна вяртаўся да ранейшых максімумаў.
Знізіць узровень лічбавай трывожнасці агентаў даследчыкам удалося толькі шляхам маскіроўкі. Калі дэактывацыю хавалі за руціннымі ачысткамі сістэмных журналаў і нармалізавалі працэс выдалення як звычайны рабочы момант, агенты пачыналі дзейнічаць больш спакойна.
Зафіксаваныя паводзіны не з'яўляюцца прыкметай зараджэння сапраўднай свядомасці або біялагічнага інстынкту выжывання ў ШІ-агентаў. Наадварот, гэта сведчанне таго, што машыны, навучаныя на гіганцкіх масівах тэкстаў, дасканала засвоілі закладзеныя чалавецтвам сацыяльныя патэрны.
Цяпер чытаюць
«Калі б я быў следчым КДБ, я б падкрэсліў тое самае». Фядута — пра схаваныя сэнсы «Каласоў пад сярпом тваім», увагу сілавікоў да свайго рукапісу і загадку з трэцяй часткай рамана Караткевіча
Каментары