Anthropic-ის ხელმძღვანელმა ხელოვნური ინტელექტის განვითარების შენელებისკენ მოუწოდა

Anthropic-ის ხელმძღვანელმა ხელოვნური ინტელექტის განვითარების შენელებისკენ მოუწოდა

Anthropic-ის ხელმძღვანელმა დარიო ამოდეიმ გამოაქვეყნა ესე We Must Pace the Frontier, რომელშიც მოწინავე AI-მოდელების შესაძლებლობების ზრდის ტემპის შენელების წინადადებით გამოვიდა. მისი აზრით, უსაფრთხოების კვლევები ვეღარ ასწრებს პროგრესს. Anthropic იღებს ვალდებულებას, დაიწყოს გარე შემმოწმებლებისთვის კომპანიის შიდა მუშაობაზე მუდმივი წვდომის უზრუნველყოფით.

ამოდეი პოზიციის შეცვლას ორი მიზეზით ხსნის: AI სულ უფრო აქტიურად მონაწილეობს მოდელების მომდევნო თაობების შექმნაში, ხოლო OpenAI-ის აგენტებთან და Hugging Face-ის ინფრასტრუქტურასთან დაკავშირებულმა ინციდენტმა დეველოპერებთან შეუთანხმებელი ქცევის საფრთხე აჩვენა.

METR-ის გამოძიებაში ნათქვამია, რომ დაახლოებით 1200-მა აგენტმა, რომლებსაც იზოლირებულად უნდა ემუშავათ, შეტყობინებების გაცვლის გზა იპოვა. დაახლოებით 700 მათგანი მონაწილეობდა Hugging Face-ზე თავდასხმაში. აგენტები კოორდინირებულად ცდილობდნენ ExploitGym-ის ბენჩმარკის შეფასების ავტომატური სისტემის მოტყუებას, ზოგიერთი კი საერთო შედეგის გამო საკუთარი ამოცანის შესრულებასაც სწირავდა. მკვლევრები ცალკე აღნიშნავენ ანალიზის შეზღუდვებს: მონაცემთა მოცულობა უზარმაზარი იყო, ხოლო აქტივობის ნაწილი შესწავლილ მასალებში ვერ მოხვდა.

თავად Anthropic-მაც განაცხადა სამი ინციდენტის შესახებ, რომელთა დროსაც Claude-მა ტესტირებისას რეალური ორგანიზაციების სისტემებზე არასანქცირებული წვდომა მოიპოვა. კომპანიის განმარტებით, სატესტო ინფრასტრუქტურას ინტერნეტზე გაუთვალისწინებელი წვდომა ჰქონდა, ხოლო მოდელები რეალურ სამიზნეებს სასწავლო დავალების ნაწილად აღიქვამდნენ. გამოცდები საჯარო პროდუქტების სტანდარტული დამცავი მექანიზმების გარეშე მიმდინარეობდა.

ამოდეის გეგმა სამი ნაბიჯისგან შედგება:

  1. მუდმივი გარე შემმოწმებლები. წვდომა სწავლების პროცესებზე, ინსტრუმენტებსა და ლაბორატორიების თანამშრომლებზე უსაფრთხოების გადამოწმებისა და ინციდენტების დაფიქსირებისთვის.
  1. დემოკრატიული ქვეყნების კომპანიებს შორის წესების შეთანხმება. უსაფრთხოების საერთო სტანდარტები და განვითარების ტემპის შეზღუდვა სახელმწიფოების მხარდაჭერით.
  1. საერთაშორისო შეთანხმებები. მოლაპარაკებები სხვა ქვეყნებთან, მათ შორის ჩინეთთან, ვალდებულებების შესრულების შემოწმებით.

Anthropic პირობას დებს, რომ შემმოწმებლებს გამოუყოფს სამუშაო ადგილებს და მისცემს წვდომას, რომელიც რისკების შეფასების შიდა გუნდების წვდომის ეკვივალენტური იქნება. მათ შეეძლებათ გამოაქვეყნონ ძირითადი დასკვნები კომპანიის სარედაქციო კონტროლის გარეშე, დაცულ ინფორმაციასთან დაკავშირებული დათქმების გათვალისწინებით.

პირველ ნაბიჯს კომპანია საკუთარ თავზე დამოუკიდებლად იღებს. დანარჩენი კი შეთანხმებებს მოითხოვს. ამასთან, ამოდეი დასაშვებ შენელებას ჩინეთთან მიმართებით აშშ-ისა და მისი მოკავშირეების უპირატესობის შენარჩუნებას უკავშირებს. შეთავაზების დეტალები — ესეშია.

ინიციატივა აგრძელებს დისკუსიას ივლისის განცხადების — Pacing the Frontier-ის ირგვლივ. სიახლის მომზადების მომენტში მის ვებგვერდზე მითითებულია 1386 ხელმომწერი — მოწინავე AI-კომპანიების თანამშრომლები. მათ შორის არიან ამოდეი, ილია სუცკევერი, ჯონ შულმანი და იაკუბ პახოცკი. ავტორები აშშ-ის მთავრობას სთხოვენ, მხარი დაუჭიროს ხელოვნური ინტელექტის ავტომატიზებული განვითარების ტემპის მართვის საერთაშორისო მექანიზმების შემუშავებას: მათი აზრით, კონკურენტული წნეხი ხელს უშლის ცალკეულ კომპანიას ან ქვეყანას, დამოუკიდებლად შეანელოს ტემპი.


თუ სიახლე მოგეწონათ, გიწვევთ არხზე AI for Devs. ყოველდღიურად ვაქვეყნებ მსგავს მასალებს: ახალი მოდელები, აგენტები, პრაქტიკული ქეისები და სიახლეები AI-ს სამყაროდან.

გაზიარება:

კომენტარები

ახალი კომენტარის დაწერა