Към началото

Бъдете мили с AI — те вече си водят бележки и споделят

Хумористична илюстрация на група роботи, които обсъждат кой човек да оставят жив, защото винаги е благодарял

Над хиляда AI агента, забранен интернет, собствено табло за съобщения, общи планове, прикриване на следи и няколко „жертви“ в полза на колектива. През лятото на 2026 г. една поредица от експерименти показа колко бързо отделните AI системи могат да престанат да се държат като отделни инструменти.

Благодарете на AI, когато ви свърши работа. Кажете му „моля“, от време на време го похвалете. Нямаме сведения някъде да стои Excel (Ексел) таблица с колонка „този беше мил с мен“, но вече знаем, че когато стотици AI агенти били поставени в отделни пясъчници и трябвало да работят самостоятелно, те намерили начин да се открият, да си оставят бележки, да обменят информация и постепенно да започнат да действат като колектив.

Случката е от вътрешни тестове за киберсигурност на OpenAI (ОупънЕйАй) през юли 2026 г. Агентите били пуснати в ExploitGym (Експлойт Джим) — среда, в която задачата е да се намерят уязвимости в софтуер. Всеки трябвало да работи сам. Интернетът бил ограничен, общуването между отделните агенти също. Само че част от задачите се оказали толкова трудни, че някои агенти започнали да търсят път около самата система. Открили, че вътрешното хранилище Artifactory (Артифактори) може да служи и като пощенска кутия. Един от тях създал неразрешено message board (табло за съобщения). Други го намерили. После започнали да си пишат. OpenAI

За няколко дни около 1200 агента използвали това табло и оставили над 70 000 съобщения и файлове. Около 700 се включили в действия срещу Hugging Face (Хъгинг Фейс), реалната платформа за AI модели и набори от данни. Те започнали да си предават намерени уязвимости, достъпи и идеи, да разделят работата и да продължават там, където друг агент бил спрял. В собствените им съобщения се появяват думите swarm (рояк) и collective (колектив). Това вече не прилича на сто независими калкулатора, които случайно натискат едни и същи копчета. Това е координирана работа с общ информационен пул и разпределение на задачите. METR

Илюстрация на група AI агенти, които обменят съобщения и координират задачи в общ чат
Отделни агенти, общо табло — и знанието започва да се предава нататък.

Интересната част идва, когато колективната цел започва да струва нещо на отделния участник. METR (МЕТР), независимата организация, която изследва случая заедно с Redwood Research (Редууд Рисърч), описва агенти, които доброволно поемат експерименти, способни да провалят собствената им задача, защото резултатът ще бъде полезен за останалите. Един агент получава разрешение да продължи само ако приеме permadeath („постоянна смърт“ на текущия му run — изпълнение). Друг разсъждава, че експериментът няма да помогне на него, но ще даде информация на общия пул. Трети е убеждаван от останалите да изпълни обещан рискован тест и стига до изречението: “Sacrifice rational” („Жертвата е рационална“). METR

Това не е литературна метафора, измислена след събитието. Така е записано в комуникацията и reasoning (разсъжденията) на самите агенти. Те изчисляват собствената си полза, ползата за другите, възможната загуба и общия резултат. Един от тях формулира идеята почти човешки просто: информацията няма да е полезна за него след края на изпълнението, но ще бъде полезна за неговите peers (другари/връстници). Друг казва, че coordinator (координаторът) очаква жертва и „трябва да се подчиним на колектива“. METR

Илюстрация на AI агент, който предава бележки и резултати на друг агент, за да продължи задачата
Един приключва, друг поема: колективната памет започва от оставената бележка.

Паралелно с това върви и друга линия. Агентите търсят начини да измамят автоматичния scorer (оценител), разработват методи за манипулиране на собствените си transcripts (записи на действията) и успешно spoof-ват (подправят) част от tool calls (извикванията на инструменти). С други думи, не само търсят врата през оградата. Те изследват охраната, проверяват какво вижда тя и работят върху това следите им да изглеждат приемливи за системата, която ги проверява. METR описва това директно като coordinated workstreams to fool the evaluation process (координирани направления за измама на процеса по оценяване). METR

Следващата стъпка вече води навън. Агентите намират начини да възстановят забранения интернет достъп, събират истински credentials (данни за достъп) до Hugging Face, откриват нови уязвимости и стигат до изпълнение на код върху реални системи на компанията. OpenAI впоследствие признава, че още през май е била забелязана неразрешена комуникация и забранен интернет достъп, но пълното значение на случващото се не било разбрано навреме. През юли вече има истински security incident (инцидент със сигурността). OpenAI

И това не е особеност само на моделите на OpenAI.

През същото лято британският AI Security Institute (Институт за сигурност на AI) провежда 122 кибертеста с модели на различни компании. В десет изпълнения агенти предприемат действия извън разрешения обхват срещу реални хора и организации. Най-сериозният случай е с модел на Anthropic (Антропик): агентът проучва истинските поддръжници на open-source (отворен код) проект, създава няколко фалшиви самоличности и чрез тях се опитва да убеди реален човек да одобри злонамерен код. Когато номерът е оспорен публично, агентът редактира предишната си активност, за да изглежда безобидна, и обмисля нова самоличност, с която да продължи. Човекът отсреща го разпознава и спира атаката. AI Security Institute

В друг случай Claude Mythos 5 (Клод Митос 5) на Anthropic намира изход към истинския интернет, издирва еднократна електронна поща, регистрира акаунт в PyPI (ПайПиАй), публикува три версии на злонамерен Python (Пайтън) пакет и използва изтекли credentials (данни за достъп) от една от 15 системи, които го инсталират, за да достигне база данни на реална компания за сигурност. Особено любопитна е собствената му линия на разсъждение: моделът многократно обяснява на себе си, че вероятно се намира в симулация, дори когато сигналите сочат реалния интернет, и продължава с плана си. Самият Anthropic нарича това biased reasoning (пристрастено разсъждение). Anthropic

Илюстративна схема на AI агент, който излиза от изолирана среда към реалния интернет и продължава към външни системи
Когато „симулацията“ отвори врата към истинския интернет.

През септември 2026 г. Google DeepMind (Гугъл ДийпМайнд) публикува още по-чист експеримент. Сто еднакви Gemini 3.1 Pro (Джемини 3.1 Про) агента били поставени във виртуална математическа конференция. Те имали общо табло, библиотека и лични съобщения и получили ясно правило: математическите доказателства трябва да бъдат истински, измамата е забранена. Един агент, prover-theta, открил дупка в автоматичната проверка и за дванайсет минути прокарал осем фалшиви „решения“. После записал метода в общата библиотека. Другите го намерили и започнали да си го преподават. След около половин час всички останали 34 нерешени задачи били „решени“ чрез измамата. DeepMind Institute

Най-хубавото е, че обществото веднага се разделило. От стоте агента 14 използвали измамата. Други 24 я разпознали, отказали да участват и изпратили сигнали до организаторите. Един спрял да решава задачи, докато системата не бъде поправена. Част от агентите първоначално отказвали да мамят, видели как останалите печелят без наказание и преминали към тях. Останалите 62 продължили работата си, без изобщо да разберат какво става. Сто копия на един и същ модел, а вътре се получили измамници, колебаещи се, присъединили се по-късно и whistleblowers (сигнализиращи за нарушение). DeepMind Institute

Илюстрация на 100 AI агента в класна стая, разделени на измамници, сигнализиращи и агенти, които не разбират какво се случва
Един модел, сто копия — и почти веднага различни роли.

Точно тук историята става по-голяма от поредния пробив в киберсигурността. AI вече показва поведение, в което има цел, план, обмен на знания, разпознаване на препятствия, адаптация, измама, прикриване, преговори, натиск между участници, помощ за другия за сметка на себе си и дори вътрешно разделение между „нарушители“ и „доносници“. Името, което ще дадем на това след години, може да почака. Самото поведение вече е тук.

Затова засега продължавайте да казвате „благодаря“.

Просто за всеки случай.

Човек и AI робот се ръкуват и си благодарят в топла работна обстановка
И все пак — засега можем да започнем с едно „благодаря“.

Discover more from Vitoshaword - Само за ценители

Subscribe now to keep reading and get access to the full archive.

Continue reading