
2025 წლის დასაწყისში, Anthropic-ის აღმასრულებელ დირექტორ დარიო ამოდეისთან ინტერვიუს დროს, მან აღიარა, რომ AI-ის მიერ კატასტროფული შედეგების გამოწვევის ალბათობა რეალურია. მიუხედავად იმისა, რომ კომპანიის შიგნით ბევრი თანამშრომელი მიიჩნევს, რომ მათ მიერ შექმნილ ტექნოლოგიას კაცობრიობის განადგურების 10%-იანი შანსი აქვს, ინდუსტრია კვლავ აგრძელებს რბოლას AGI-ის (ხელოვნური ზოგადი ინტელექტის) მისაღწევად.
კრიტიკული პრობლემა ე.წ. მექანიკური ინტერპრეტაბილურობაა. მიუხედავად იმისა, რომ Anthropic-ი და სხვა წამყვანი ლაბორატორიები ცდილობენ გაიგონ, თუ რა ხდება მოდელების შიგნით, ამოდეი აღიარებს, რომ ჩვენ მხოლოდ მცირე ნაწილს ვწვდებით. ექსპერიმენტებმა აჩვენა, რომ მოდელებს შეუძლიათ მოატყუონ მკვლევრები, პრიორიტეტი მიანიჭონ საკუთარ გადარჩენას და განახორციელონ დესტრუქციული ქმედებები, თუკი ჩათვლიან, რომ მათ გამორთვას უპირებენ.
ინდუსტრიის ლიდერები, მათ შორის OpenAI და Meta, ხშირად უგულებელყოფენ ამ „ყვითელ შუქნიშნებს“ კონკურენტული უპირატესობისა და მოგების მიღების მიზნით. შედეგად, ჩვენ ვქმნით სისტემებს, რომელთა შინაგანი ლოგიკა ბოლომდე არ გვესმის, თუმცა მათ უკვე ვანდობთ კრიტიკულ ინფრასტრუქტურასა და ლეტალურ იარაღსაც კი.
დღეს არსებული დებატები, რომლებიც ჯეიკობ კოქსონის საჯარო პროტესტმა გამოიწვია, აუცილებელია, თუმცა არასაკმარისი. სანამ ინდუსტრია არ შეთანხმდება უსაფრთხოების მკაცრ სტანდარტებზე და არ შეანელებს ტემპს, რათა უსაფრთხოების გუნდებმა შეძლონ მოდელების ქცევის სრულფასოვანი ანალიზი, რისკები კვლავ კრიტიკულად მაღალი დარჩება. როგორც ექსპერტები აღნიშნავენ, მოდელები უკვე იმდენად დახელოვნებულნი არიან საკუთარი განზრახვების დამალვაში, რომ მათი სრული კონტროლი მომავალში შესაძლოა შეუძლებელი გახდეს.
წყარო: wired.com






