Anthropic-მა Claude განაახლა – გამოვიდა Fable 5.1 და Mythos 5.1

Anthropic-მა Claude განაახლა – გამოვიდა Fable 5.1 და Mythos 5.1

Anthropic-მა თავისი წამყვანი მოდელების განახლება გამოუშვა – Claude Fable 5.1 და Claude Mythos 5.1. „კაპოტის ქვეშ“ ეს ერთი და იგივე მოდელია, რომლებიც უსაფრთხოების შეზღუდვების დონით განსხვავდება: Fable 5.1 ხელმისაწვდომია ყველასთვის საჯარო წვდომით, ხოლო Mythos 5.1 – მხოლოდ შემოწმებული ორგანიზაციებისთვის, სანდო წვდომის პროგრამების მეშვეობით.

რა შეიცვალა ბენჩმარკებში

კომპანია აცხადებს მაჩვენებლების საგრძნობ ზრდაზე Fable 5-თან შედარებით. Terminal-Bench-Science 0.1-ზე, რომელიც აფასებს სამეცნიერო კვლევების სააგენტო შესაძლებლობებს, Fable 5.1 იღებს 52,6%-ს Fable 5-ის 24,7%-ის წინააღმდეგ – ორჯერ მეტი ზრდა. Terminal-Bench 4.0-ზე (სააგენტო პროგრამირება ტერმინალში) შედეგია 55,8% წინამორბედის 42%-თან შედარებით, ხოლო Mythos 5.1 უფრო რბილი კიბერშეზღუდვებით აჩვენებს 60,9%-ს.

ზრდა ფიქსირდება სხვა კატეგორიებშიც: GDPval-AA v2 (ინტელექტუალური სამუშაო) – 1853 ქულა Fable 5-ის 1723-ის წინააღმდეგ; AutomationBench (ბიზნესპროცესები) – 31,4% 17,1%-ის წინააღმდეგ; CursorBench 3.2.0 – 73,4% 70,5%-ის წინააღმდეგ.

დაბალი ან საშუალო ძალისხმევის (effort) დონის დაყენებისას Fable 5.1 აღწევს Fable 5-ის შესადარებელ ან უკეთეს შედეგებს, მაგრამ ნაკლები ღირებულებით. Claude Code-ში ნაგულისხმევად გამოიყენება ძალისხმევის მაღალი დონე, ხოლო Claude Cowork-სა და claude.ai-ზე – საშუალო.

ადრეული ტესტერების გამოხმაურებები

კომპანიებს შორის, რომლებმაც მიიღეს ადრეული წვდომა, არიან: Jane Street Capital, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, Browserbase, Shopify, Datadog, SpaceXAI და სხვები.

  • კომპანია Millennium-მა განაცხადა, რომ Fable 5.1-მა შიდა სისტემებში იპოვა უკიდურესად იშვიათი შეფერხების მიზეზი (დაახლოებით ერთი შემთხვევა მილიონ გაშვებაზე), რომლის ახსნაც კომპანიის ინჟინრებს ოთხი-ხუთი წლის განმავლობაში არ შეეძლოთ: მოდელმა მოახდინა მესამე მხარის ბიბლიოთეკის დისასემბლირება და შეადარა იგი მეხსიერების დამპს.
  • Ramp-ში აღწერეს მანქანური სწავლების ამოცანაზე მოდელის უწყვეტი 38-საათიანი მუშაობის პროცესი, რომლის დროსაც მან გადააფასა წინა შედეგი, მოახდინა მონაცემთა მარკირების არტეფაქტის დიაგნოსტირება, გაუშვა ექვსი პარალელური ექსპერიმენტი და წარმოადგინა შედეგები შემდგომი ნაბიჯების შეთავაზებებთან ერთად.
  • Browserbase-ში განაცხადეს ბრაუზერის აგენტების ყველაზე რთულ ბენჩმარკზე ამოცანების 82%-ით შესრულების შესახებ, Opus 5-ის 74%-ისა და Fable 5-ის 57%-ის წინააღმდეგ.

გაზიარება:

დაკავშირებული პოსტები

წარმოგიდგენთ Bonsai 27B-ს: პირველი 27B კლასის მოდელი, რომელიც მუშაობს ტელეფონზე
AI

წარმოგიდგენთ Bonsai 27B-ს: პირველი 27B კლასის მოდელი, რომელიც მუშაობს ტელეფონზე

NotebookLM-ს ამიერიდან Gemini Notebook-ი ჰქვია
AI

NotebookLM-ს ამიერიდან Gemini Notebook-ი ჰქვია

ათეისტი ევოლუციონისტი მეცნიერი Anthropic-ის Claude-ს 72 საათის განმავლობაში ესაუბრა და ახლა სჯერა, რომ ის ცნობიერია
AI

ათეისტი ევოლუციონისტი მეცნიერი Anthropic-ის Claude-ს 72 საათის განმავლობაში ესაუბრა და ახლა სჯერა, რომ ის ცნობიერია

სემ ალტმანის პროექტი World ვერიფიკაციის ტექნოლოგიას გაცნობის აპლიკაციებში ნერგავს
AI

სემ ალტმანის პროექტი World ვერიფიკაციის ტექნოლოგიას გაცნობის აპლიკაციებში ნერგავს

Telegram-მა მესამე მხარის კლიენტების მომხმარებლების მონიშვნა დაიწყო. ასევე, მესენჯერმა მიიღო ხელოვნური ინტელექტის რედაქტორი და ბოტების ფაბრიკა
AI

Telegram-მა მესამე მხარის კლიენტების მომხმარებლების მონიშვნა დაიწყო. ასევე, მესენჯერმა მიიღო ხელოვნური ინტელექტის რედაქტორი და ბოტების ფაბრიკა

CERN-ში მონაცემთა მასივების გასაფილტრად ჩიპებში ინტეგრირებულ სპეციალურ AI-მოდელებს იყენებენ
AI

CERN-ში მონაცემთა მასივების გასაფილტრად ჩიპებში ინტეგრირებულ სპეციალურ AI-მოდელებს იყენებენ

კომენტარები

ახალი კომენტარის დაწერა