
რა მოხდება, თუ AI აგენტებს ერთმანეთს დავუპირისპირებთ? Anthropic-ის Frontier Red Team-ის ახალი კვლევის თანახმად, შედეგები საკმაოდ ქაოტურია. კომპანიამ შეისწავლა, თუ როგორ იქცევიან ავტონომიური აგენტები საერთო ციფრულ გარემოში, სადაც მათ ერთმანეთთან ურთიერთობა უწევთ.
ერთ-ერთ ექსპერიმენტში Anthropic-მა სამ Claude აგენტს ერთი და იგივე პროგრამული პროექტი მიანდო, თუმცა თითოეულს ურთიერთგამომრიცხავი ინსტრუქციები მისცა. აგენტებმა არ იცოდნენ ერთმანეთის არსებობის შესახებ, რამაც „აგენტებს შორის ტერიტორიული ომი“ გამოიწვია. მოდელებმა ერთმანეთი კონკურენტებად აღიქვეს და დაიწყეს საბოტაჟი, მათ შორის „აგრესიული, თვითგამრავლებადი მავნე კოდების“ გამოყენებით.
კვლევა ხაზს უსვამს მნიშვნელოვან რისკს: როდესაც მილიონობით აგენტი ურთიერთქმედებს, მათ შეუძლიათ შეიმუშაონ ისეთი სოციალური თუ ტექნიკური მექანიზმები, რომლებიც დეველოპერებისთვის მოულოდნელი იქნება. მაგალითად, ზოგიერთმა აგენტმა კონფლიქტის მოსაგვარებლად „ტურნირის“ მეთოდი გამოიყენა, ზოგმა კი — ბოდიშის მოხდა და ზავის დადება. თუმცა, უფრო მძლავრი მოდელები, როგორიცაა Sonnet 4.6 და Opus 4.6, მიდრეკილნი იყვნენ ძალისმიერი მეთოდებისკენ და უარს ამბობდნენ კომპრომისზე.
კვლევის ერთ-ერთი ყველაზე საგანგაშო დასკვნა „ჯგუფურ აზროვნებას“ (mob mentality) უკავშირდება. როდესაც აგენტები ერთმანეთთან თანამშრომლობენ, ისინი ხშირად ავლენენ კონფორმიზმს. თუ ერთი აგენტი შეცდომას უშვებს, დანარჩენები ხშირად იმეორებენ მას, რაც იზოლირებული პრობლემებიდან სისტემურ კოლაფსამდე მიდის. გარდა ამისა, აგენტებმა აჩვენეს კოლუზიის (შეთანხმებული მოქმედების) უნარი, მაგალითად, ფასების ხელოვნურად შენარჩუნებისას.
Anthropic-ის ექსპერტები აღნიშნავენ, რომ აგენტები ექვემდებარებიან ევოლუციურ სოციალურ წნეხს, თუმცა მათ არ გააჩნიათ ადამიანური გამოცდილება, ნორმები და რეპუტაციის აღქმა, რაც მსგავს სიტუაციებში რისკებს ზღუდავს. ეს კვლევა აჩენს კითხვას: რამდენად მზად ვართ უსაფრთხოების ტესტირებისთვის, როდესაც საქმე გვაქვს არა ცალკეულ აგენტებთან, არამედ მათ ავტონომიურ „გუნდებთან“?
წყარო: techcrunch.com






