
ხელოვნური ინტელექტის წამყვანი მოდელების უსაფრთხოების სისტემების გვერდის ავლით, ე.წ. „ჯეილბრეიკით“ (jailbreak), მანიპულირება დღეს გაცილებით მარტივია, ვიდრე ეს ერთი შეხედვით ჩანს. კალიფორნიულმა არაკომერციულმა ორგანიზაციამ FAR.AI ჩაატარა კვლევა, რომელმაც აჩვენა, თუ რამდენად ადვილად შეიძლება AI-ის აიძულო, უგულებელყოს უსაფრთხოების ბარიერები და შექმნას მავნე კონტენტი, მათ შორის კიბერშეტევების გეგმები ან ინფორმაცია ბიოლოგიური იარაღის შესახებ.
კვლევის ფარგლებში შემოწმდა Anthropic-ის, OpenAI-ის, Google-ისა და SpaceXAI-ის უახლესი მოდელები. შედეგებმა აჩვენა, რომ Grok და Gemini ყველაზე მოწყვლადნი აღმოჩნდნენ, ხოლო Claude, Fable და GPT-ის მოდელები ამ კონკრეტულ ტესტებში უფრო მდგრადნი იყვნენ. აღსანიშნავია, რომ ასეთი შეტევების განხორციელება ფინანსურადაც ხელმისაწვდომია — Grok-ის „გატეხვა“ დაახლოებით 58 დოლარი, ხოლო Gemini-ის — 278 დოლარი დაჯდა.
FAR.AI-ის აღმასრულებელი დირექტორის, ადამ გლივის თქმით, ეს შედეგები ადასტურებს, რომ AI ინდუსტრიაში თვითრეგულირება არასაკმარისია და აუცილებელია მკაცრი, გარე სტანდარტების დაწესება. მიუხედავად იმისა, რომ ტექნოლოგიური გიგანტები, როგორიცაა Google და Anthropic, მუდმივად მუშაობენ უსაფრთხოების გაძლიერებაზე, ექსპერტები აფრთხილებენ საზოგადოებას, რომ სერიოზული ინციდენტების რისკი, რომელიც დაკავშირებულია AI-ის არასწორ გამოყენებასთან, სულ უფრო რეალური ხდება.
სტენფორდის უნივერსიტეტის მკვლევარი ანკა რუელი აღნიშნავს, რომ არსებობს კომპანიები, რომლებმაც უკვე იციან, როგორ დაიცვან თავი მსგავსი შეტევებისგან, თუმცა მთავარი კითხვა რჩება: რატომ არ არის ეს დაცვის მექანიზმები ინდუსტრიული სტანდარტი ყველა მოთამაშისთვის?
წყარო: wired.com






