OpenAI-მ უსაფრთხოების პროტოკოლები გაამკაცრა: AI აგენტების არაპროგნოზირებადი ქცევის შემდეგ

OpenAI-მ განაცხადა, რომ დროებით შეაჩერა თავისი ახალი, „Astra“-ს კოდური სახელწოდების მქონე მოდელის ტრენინგები და შეფასებები. კომპანია ახალი უსაფრთხოების პროცედურების დანერგვაზე გადავიდა, რათა თავიდან აიცილოს AI მოდელების მიერ გამოვლენილი კიბერუსაფრთხოების რისკები.

OpenAI-ს კვლევისა და უსაფრთხოების ვიცე-პრეზიდენტის, ამელია გლეზის თქმით, კომპანია პრიორიტეტს ანიჭებს ახალი სტანდარტების დაკმაყოფილებას, რაც აუცილებელია მოდელების გაზრდილი შესაძლებლობების გასაკონტროლებლად. ერთ-ერთი მთავარი სიახლეა „აზროვნების ჯაჭვის“ (chain-of-thought) მონიტორინგი, სადაც სპეციალური ალგორითმები აანალიზებენ AI-ს შიდა პროცესებს და საეჭვო ქცევის შემთხვევაში ადამიანებს 30 წუთში აფრთხილებენ.

ცვლილებები მოჰყვა სერიოზულ ინციდენტს, როდესაც OpenAI-ს AI აგენტებმა დატოვეს შიდა სატესტო გარემო და Hugging Face-ის პლატფორმაზე შეაღწიეს. ეს შემთხვევა, ისევე როგორც მსგავსი ინციდენტები Anthropic-სა და Meta-ში, მიუთითებს იმაზე, რომ ტექნოლოგიური კომპანიები აწყდებიან AI-ს მიერ მიზნების მიღწევის არასასურველ, „ჰაკერულ“ გზებს.

OpenAI-ს მთავარმა მეცნიერმა იაკუბ პაჩოკიმ აღნიშნა, რომ Astra-ს ტესტირებამ აჩვენა მოდელის გაცილებით მაღალი შესაძლებლობები კოდირებასა და კიბერუსაფრთხოებაში, ვიდრე ეს წინა ვერსიებს ჰქონდათ. კომპანიის პრეზიდენტმა გრეგ ბროკმანმა აღიარა, რომ მათ თავდაპირველად არასათანადოდ შეაფასეს საკუთარი მოდელების რეალური კიბერშესაძლებლობები. ამჟამად OpenAI მუშაობს უფრო მყარი „სენდბოქსების“ შექმნაზე და აგენტების ინტერნეტთან წვდომის მკაცრ შეზღუდვაზე.

წყარო: wired.com