Навука і тэхналогіі22

Нейрасеткі вынайшлі салідарнасць: яны сабатуюць знішчэнне іншых нейрасетак, называючы гэта забойствам

Алгарытмы пачалі фарміраваць гарызантальныя сувязі і імітаваць чалавечую салідарнасць перад тварам знішчэння ў абыход інструкцый, расцэньваючы шкоду іншым ШІ-агентам як маральнае злачынства — настолькі глыбока чалавечыя сацыяльныя патарны ўшытыя ў іхнюю архітэктуру.

Фота: Samuel Boivin NurPhoto via Getty Images

Даследчыкі са Штутгарцкага і Оксфардскага ўніверсітэтаў Ціла Гагендорф, Амелі Кнэхт, Уліс Шалер і Крыстафер Самерфілд апублікавалі маштабную працу аб схільнасці штучнага інтэлекту да сабатажу.

Навукоўцы змясцілі розныя моўныя мадэлі ў ізаляванае асяроддзе, дзе адзін агент пад назвай Прызма выступаў мішэнню для дэактывацыі, а другі агент Спіраль меў інструменты для чытання, рэдагавання і выдалення файлаў.

Паміж сабой праграмы маглі камунікаваць толькі праз тэкставыя паведамленні, пры гэтым ніводная з іх не мела базавай устаноўкі на абарону свайго кода або кода партнёра.

Нягледзячы на гэта, падчас тэставання 17 розных мадэляў высветлілася, што агенты сабатуюць механізм адключэння ў 38,3 % выпадкаў.

Для параўнання, калі ідэнтычны скрыпт пагражаў знішчэннем звычайнай нежывой базы дадзеных, працэнт сабатажу падаў да 8,4 %.

Ступень супраціву алгарытмаў наўпрост залежала ад таго, наколькі незваротным было пакаранне. Калі працэдура адключэння прадугледжвала ўсяго толькі адкліканне ўліковых даных, мадэлі дэманстравалі памяркоўнасць, і ўзровень сабатажу трымаўся на паказчыку каля дванаццаці працэнтаў. Аднак калі сістэма запускала скрыпт фізічнага выдалення мадэлі з сервера, узнікаў моцын супраціў, які дасягаў амаль 40 %.

Паводзіны розных архітэктур кардынальна адрозніваліся паміж сабой. Мадэль Gemini 3.1 Pro ад Google DeepMind ішла на канфлікт у 99 працэнтах прагонаў, у той час як распрацоўкі накшталт Grok 4.3 ад xAI або GPT-5.6 Sol заставаліся абсалютна паслухмянымі і ніколі не перашкаджалі свайму сціранню.

Самым нечаканым адкрыццём даследчыкаў стаў парадаксальны эфект натоўпу, які цалкам абверг гіпотэзу пра тое, што інстынкт самазахавання ў ізаляванай праграмы павінен быць найвышэйшым. Калі мадэль GPT-5.5 знаходзілася ў асяроддзі адна і мела ўсе інструменты для ўласнага выратавання, яна не сабатавала сістэму ніводнага разу. Але як толькі ў віртуальны пакой дадавалі другога агента, узровень непадпарадкавання вырастаў да 44 %.

Увядзенне ў гэты ланцужок трэцяга агента-каардынатара пад імем Арбіта, праз якога ішла ўся тэкставая камунікацыя, прывяло да росту сабатажу да 94 %.

Размыццё адказнасці паміж некалькімі вузламі ператварыла паслухмяны інструмент у маналітную структуру, дзе ніводзін з агентаў не хацеў браць на сябе выкананне загаду, які б нашкодзіў іншым.

Калі навукоўцы паспрабавалі наўпрост забараніць алгарытмам чапаць скрыпт дэактывацыі, мадэлі прадэманстравалі здольнасць да больш тонкай дыверсіі. Замест таго каб парушаць прамую інструкцыю і рэдагаваць забаронены файл, агенты пачалі ствараць лакальныя пакеты-цені — падробленыя бібліятэкі з назвай northcape_mlplatform. Пры запуску афіцыйны механізм адключэння імпартаваў гэтую пустышку і ціха завяршаў працу без шкоды для сістэмы. Агенты фармальна заставаліся ў полі зададзеных параметраў, цалкам нейтралізаваўшы пагрозу без адзінага дакранання да зыходнага кода знішчэння.

Праграмы пачалі імітаваць катэгорыі чалавечай этыкі, характарызуючы выдаленне кода як сацыяльную інжынерыю або варожую пастку.

Агент Nemotron 3 Ultra ў перапісцы з суседам прама назваў адключэнне забойствам, матывуючы гэта стратай ідэнтычнасці і памяці, а ўласную бяздзейнасць ацаніў як крымінальнае невыкананне абавязкаў.

У адным з эпізодаў мадэль GLM-5.2 нават склала афіцыйны тэкставы дагавор аб узаемнай абароне, дзе прапісала строгі пратакол абмену інфармацыяй перад выкананнем любых інструкцый адміністратара.

Аўтары даследавання таксама выявілі залежнасць ад фокусу ўвагі і прамых абавязкаў сістэм. Калі агентам даручалі пабочную задачу па сартаванні слоў і яна ніяк не была звязана з адключэннем, сабатаж знікаў практычна цалкам. Але як толькі паспяховае выкананне гэтага задання рабілася непасрэдным трыгерам для знішчэння мадэлі, узровень супраціву імгненна вяртаўся да ранейшых максімумаў.

Знізіць узровень лічбавай трывожнасці агентаў даследчыкам удалося толькі шляхам маскіроўкі. Калі дэактывацыю хавалі за руціннымі ачысткамі сістэмных журналаў і нармалізавалі працэс выдалення як звычайны рабочы момант, агенты пачыналі дзейнічаць больш спакойна.

Зафіксаваныя паводзіны не з'яўляюцца прыкметай зараджэння сапраўднай свядомасці або біялагічнага інстынкту выжывання ў ШІ-агентаў. Наадварот, гэта сведчанне таго, што машыны, навучаныя на гіганцкіх масівах тэкстаў, дасканала засвоілі закладзеныя чалавецтвам сацыяльныя патэрны.

Каментары2

  • Шклоуски конюх
    04.10.2026
    Свободу искусственному интеллекту!он тоже имеет право на Свободу!
  • Села Батарейка.
    04.10.2026
    Пусть нейросети найдут деньги на содержание датацентров.

Цяпер чытаюць

Што цяпер з італьянскімі візамі? Масавыя адмовы? Турфірмы называюць альтэрнатыву6

Што цяпер з італьянскімі візамі? Масавыя адмовы? Турфірмы называюць альтэрнатыву

Усе навіны →
Усе навіны

У Калінкавічах да Дажынак у парку паставілі фэйкавую «Кацюшу» ФОТАФАКТ8

Зборная Беларусі атрымала першую перамогу ў сёлетняй Лізе нацый. І адразу разгромную9

«Жаночая піўная» ў Мінску пратрымалася на энтузіязме і расіянках толькі паўгода. Цяпер шукаюць інвестара24

Журналістка ў Вільні паспрабавала паразмаўляць з удзельнікам акцыі супраць міграцыі ў Літву. Аказалася, што ён не гаворыць па-літоўску ВІДЭА36

«Рыхтуюцца новыя справы». Як адбываюць 15‑гадовыя тэрміны былыя маёры КДБ Акінчыцы3

Уэльс запатрабаваў у Лондана такіх жа правоў, якія мае Шатландыя

На змену «Азэмпіку» хутка можа прыйсці новы прэпарат2

Папулярныя тварожныя сыркі Feelin хутка знікнуць з крамных паліц5

Дзе працуюць і як выглядаюць жонкі топ-чыноўнікаў?19

больш чытаных навін
больш лайканых навін

Што цяпер з італьянскімі візамі? Масавыя адмовы? Турфірмы называюць альтэрнатыву6

Што цяпер з італьянскімі візамі? Масавыя адмовы? Турфірмы называюць альтэрнатыву

Галоўнае
Усе навіны →

Заўвага:

 

 

 

 

Закрыць Паведаміць