Anthropic-მა თავისი წამყვანი მოდელების განახლება გამოუშვა – Claude Fable 5.1 და Claude Mythos 5.1. „კაპოტის ქვეშ“ ეს ერთი და იგივე მოდელია, რომლებიც უსაფრთხოების შეზღუდვების დონით განსხვავდება: Fable 5.1 ხელმისაწვდომია ყველასთვის საჯარო წვდომით, ხოლო Mythos 5.1 – მხოლოდ შემოწმებული ორგანიზაციებისთვის, სანდო წვდომის პროგრამების მეშვეობით.
რა შეიცვალა ბენჩმარკებში
კომპანია აცხადებს მაჩვენებლების საგრძნობ ზრდაზე Fable 5-თან შედარებით. Terminal-Bench-Science 0.1-ზე, რომელიც აფასებს სამეცნიერო კვლევების სააგენტო შესაძლებლობებს, Fable 5.1 იღებს 52,6%-ს Fable 5-ის 24,7%-ის წინააღმდეგ – ორჯერ მეტი ზრდა. Terminal-Bench 4.0-ზე (სააგენტო პროგრამირება ტერმინალში) შედეგია 55,8% წინამორბედის 42%-თან შედარებით, ხოლო Mythos 5.1 უფრო რბილი კიბერშეზღუდვებით აჩვენებს 60,9%-ს.
ზრდა ფიქსირდება სხვა კატეგორიებშიც: GDPval-AA v2 (ინტელექტუალური სამუშაო) – 1853 ქულა Fable 5-ის 1723-ის წინააღმდეგ; AutomationBench (ბიზნესპროცესები) – 31,4% 17,1%-ის წინააღმდეგ; CursorBench 3.2.0 – 73,4% 70,5%-ის წინააღმდეგ.
დაბალი ან საშუალო ძალისხმევის (effort) დონის დაყენებისას Fable 5.1 აღწევს Fable 5-ის შესადარებელ ან უკეთეს შედეგებს, მაგრამ ნაკლები ღირებულებით. Claude Code-ში ნაგულისხმევად გამოიყენება ძალისხმევის მაღალი დონე, ხოლო Claude Cowork-სა და claude.ai-ზე – საშუალო.
ადრეული ტესტერების გამოხმაურებები
კომპანიებს შორის, რომლებმაც მიიღეს ადრეული წვდომა, არიან: Jane Street Capital, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, Browserbase, Shopify, Datadog, SpaceXAI და სხვები.
კომპანია Millennium-მა განაცხადა, რომ Fable 5.1-მა შიდა სისტემებში იპოვა უკიდურესად იშვიათი შეფერხების მიზეზი (დაახლოებით ერთი შემთხვევა მილიონ გაშვებაზე), რომლის ახსნაც კომპანიის ინჟინრებს ოთხი-ხუთი წლის განმავლობაში არ შეეძლოთ: მოდელმა მოახდინა მესამე მხარის ბიბლიოთეკის დისასემბლირება და შეადარა იგი მეხსიერების დამპს.
Ramp-ში აღწერეს მანქანური სწავლების ამოცანაზე მოდელის უწყვეტი 38-საათიანი მუშაობის პროცესი, რომლის დროსაც მან გადააფასა წინა შედეგი, მოახდინა მონაცემთა მარკირების არტეფაქტის დიაგნოსტირება, გაუშვა ექვსი პარალელური ექსპერიმენტი და წარმოადგინა შედეგები შემდგომი ნაბიჯების შეთავაზებებთან ერთად.
Browserbase-ში განაცხადეს ბრაუზერის აგენტების ყველაზე რთულ ბენჩმარკზე ამოცანების 82%-ით შესრულების შესახებ, Opus 5-ის 74%-ისა და Fable 5-ის 57%-ის წინააღმდეგ.