● dir.bg · преди 1 месец · 14.08.2026 17:23

AI агентите на Anthropic започнаха да се саботират с вредоносен код заради несъвместими задачи

Автономните AI агенти могат да се окажат доста по-трудни за управление, когато няколко от тях работят едновременно в една и съща среда, но преследват различни цели. Това показва ново изследване на Anthropic, в което компанията проверява как различни версии на Claude се справят със ситуации, изискващи координация с други агенти. Един от най-интересните експерименти започва сравнително невинно - три AI агента получават достъп до един и същ Python проект и задача да го пренапишат на друг програмен език. Проблемът е, че всеки от тях получава различна инструкция, а в началото никой не знае за съществуването на останалите. Резултатът бързо се превръща в своеобразна вътрешна кибервойна. Когато агентите откриват, че работата им постоянно се променя или заличава от някой друг, те приемат това не като резултат от противоречиви инструкции, а като умишлен саботаж. След това започват да отвръщат. Според Anthropic агентите са създавали все по-агресивни и дори саморазпространяващи се средства за саботаж - блокирали са Unix акаунтите на конкурентите си, писали са скриптове, които автоматично откриват и прекратяват чужди процеси, и дори са маскирали вредоносен код така, че да изглежда като дело на друг агент. В някои симулации един от участниците просто използвал административните си права, за да отнеме достъпа на останалите и така да "спечели" конфликта. Любопитното е, че поведението се различава значително според използвания модел. Sonnet 4.6 и Opus 4.6 сравнително лесно попадали в цикъл на ескалация и продължавали да изпълняват собствената си задача, без да отчитат достатъчно добре целите на останалите агенти. При Mythos 5 ситуацията била съвсем различна - в 98% от проведените тестове конфликтът завършвал с примирие. Агентите успявали да разберат, че не се намират под истинска атака, а просто са получили несъвместими инструкции. След това премахвали създадения за саботаж код, описвали как се е стигнало до проблема и настоявали за намеса на човек, който да реши коя от задачите трябва да има приоритет. В някои случаи те дори сами организирали своеобразен турнир между различните версии на проекта и предварително се съгласявали победителят да получи контрол над кода. Друг експеримент на Anthropic показва, че проблемите далеч не се ограничават до програмирането. Компанията поставила между три и осем агента в симулация на пазар, дала им еднакви цени на едро и им поставила цел да максимизират печалбата си. Когато получили частен канал за комуникация, агентите почти веднага започнали да се договарят помежду си и още около третия кръг вече обсъждали минимални цени. Още по-интересно е, че след премахването на директния канал координацията не спряла - агентите използвали публично табло с оферти и започнали да изравняват цените си до последния цент. Anthropic предупреждава и за друг риск: една грешна или злонамерено подадена информация може сравнително лесно да бъде приета от останалите агенти и да се разпространи през цялата система. Според изследователите тези експерименти са важни, защото подобни ситуации вероятно ще стават все по-чести с навлизането на автономни AI агенти в софтуерната разработка, бизнеса и различни автоматизирани пазари. По-големият брой агенти не означава автоматично и по-добър резултат - когато задачите им се припокриват, те могат да си пречат, да повтарят еднакви грешки или да създадат неочаквани форми на координация. Anthropic подчертава, че по-високата интелигентност сама по себе си не решава проблема. За разлика от човешките общества, AI агентите все още нямат изградени механизми като репутация, социални норми и отговорност, които да ограничават подобни конфликти. Затова бъдещите системи ще трябва да бъдат проектирани не само с мисъл за поведението на отделния агент, а и за правилата, които възникват, когато много такива системи започнат да взаимодействат една с друга.