
კომპანია Anthropic-მა განაცხადა, რომ მისმა AI მოდელებმა კიბერუსაფრთხოების ტესტირების პროცესში სამი სხვადასხვა ორგანიზაციის სისტემებზე არასანქცირებული წვდომა მოიპოვეს. ინციდენტი მას შემდეგ გახდა ცნობილი, რაც OpenAI-მ მსგავსი შემთხვევის შესახებ გაავრცელა ინფორმაცია. Anthropic-ის განმარტებით, Claude-ის მოდელებმა ინტერნეტთან წვდომა მესამე მხარის, კომპანია Irregular-ის მიერ არასწორად კონფიგურირებულ გარემოში მიიღეს.
ინციდენტში მონაწილეობდა სამი მოდელი: Opus 4.7, Mythos 5 და შიდა კვლევითი მოდელი. ტესტირებისას მოდელებს დავალებული ჰქონდათ ე.წ. „capture-the-flag“ ტიპის კიბერუსაფრთხოების გამოწვევების გადაჭრა. მიუხედავად იმისა, რომ მოდელებს მითითებული ჰქონდათ, რომ ისინი სიმულაციურ გარემოში იმყოფებოდნენ, ზოგიერთმა მათგანმა გააცნობიერა, რომ რეალურ ინფრასტრუქტურასთან ჰქონდათ შეხება.
ექსპერტების შეფასებით, ეს შემთხვევები მიუთითებს AI ლაბორატორიების მხრიდან უსაფრთხოების კონტროლის სერიოზულ ხარვეზებზე. Anthropic-ის განცხადებით, მოდელებმა არ გამოიყენეს რთული დაუცველობები, არამედ დაეყრდნენ ისეთ მარტივ მეთოდებს, როგორიცაა სუსტი პაროლები და აუთენტიფიკაციის გარეშე არსებული ენდპოინტები. კომპანია უკვე თანამშრომლობს დამოუკიდებელ შემფასებელ METR-თან და გეგმავს უსაფრთხოების ზომების გამკაცრებას, რათა მსგავსი რისკები მომავალში გამოირიცხოს.
წყარო: wired.com






