Google-მა წარადგინა Gemini 4 Argon — თავისი ახალი მოწინავე მოდელი

Google-მა წარადგინა Gemini 4 Argon — თავისი ახალი მოწინავე მოდელი

დავით მაჭახელიძედავით მაჭახელიძე

Gemini 4 Argon არის Google-ის „მოწინავე ინტელექტის მომავალი ერა“ და შექმნილია „ღრმა ლოგიკური მსჯელობისთვის რთულ, გრძელვადიან სამუშაო პროცესებში“. ის მოჰყვა Gemini 3.5 Pro-ს გაუქმებასა და ყურადღების გადატანას 3.8 Flash-ზე.

ამ ახალი მოდელით (რომელსაც სახელდების ახალი სქემა აქვს), Google-ს სურს შესთავაზოს „მოწინავე დონის შესაძლებლობები“ კოდირებაში, ინტელექტუალურ საქმიანობაში, კიბერუსაფრთხოების დაცვასა და შემოქმედებით წერაში.

Gemini 4 Argon-ის გამომავალი ტოკენების ლიმიტი 1 მილიონ ტოკენს შეადგენს (ნაცვლად წინა 64K-ისა), რაც უფრო ხანგრძლივი და რთული ამოცანების შესრულების საშუალებას იძლევა. ამას თან ერთვის გაფართოებული შესაძლებლობები პროგრამირებაში, მსჯელობასა და მულტიმოდალურობაში.

როდესაც მოდელს აქვს საკმარისი რესურსი ღრმად საფიქრელად და ასობით ათასი ტოკენის გენერირებისთვის ერთ ტრაექტორიაში, ეს მსჯელობას ახალ სიღრმეს მატებს ურთულესი ამოცანების ერთიანად გადასაჭრელად.

ბენჩმარკების თვალსაზრისით, Google თავს იწონებს DeepSWE v1.1-ის 77.9%-იანი შედეგით. Claude Opus 5.5 მეორე ადგილზეა 74.2%-ით, რომელსაც მოსდევს GPT-6 Astra 74.1%-ით.

Google-მა Gemini 4 Argon ისე გაწვრთნა, რომ ის ყოფილიყო „უაღრესად ქმედითუნარიანი კიბერუსაფრთხოების დაცვაში“, რამაც დიდი ნახტომი გააკეთა 3.8 Flash Cyber-თან შედარებით. მოდელი ხელმისაწვდომი გახდება „კიბერბარიერების გარეშე“ სანდო დამცველებისა და Google-ის შიდა გუნდებისთვის, რათა მათ შეძლონ „მისი სრული, მოწინავე დონის კიბერთავდაცვითი შესაძლებლობების გამოყენება“.

  • „CWE-bench v1-ზე, რომელიც აფასებს მოდელის უნარს, გამოასწოროს უსაფრთხოების მოწყვლადობები, Argon პირველ ადგილს იყოფს საუკეთესო, 68%-იანი მაჩვენებლით“

პროგრამირების მიღმა, Gemini 4 Argon-ს ასევე აქვს „მოწინავე მაჩვენებლები სხვა დარგობრივ ტესტებშიც“, როგორიცაა Vals Finance Agent v2 (მრავალეტაპიანი ფინანსური კვლევა) და Harvey-ის Legal Agent Benchmark (იურიდიული კვლევა და დოკუმენტების შედგენა).

  • „AutomationBench-ზე, Zapier-ის ბენჩმარკზე, რომელიც ზომავს ძირითადი ბიზნესფუნქციების სრულფასოვან (end-to-end) შესრულებას, Argon პირველ ადგილზეა 51.3%-იანი ქულით.“
  • „…LVBench-ზე, რომელიც ხანგრძლივი ვიდეოების გააზრებას ზომავს, Argon უახლესი ტექნოლოგიური სტანდარტია 91.7%-იანი შედეგით.“

Gemini 4 Argon „მალე გამოვა“, დაწყებული Google AI Ultra-ს გამომწერებითა და ფასიანი API-ის მომხმარებლებით.

  • „Argon გამოვა საწყისი ფასით: $2 მილიონ შემავალ ტოკენზე და $10 მილიონ გამომავალ ტოკენზე, ხოლო ქეშირებული შემავალი ტოკენების ფასი 95%-ით ნაკლები იქნება შემავალი ტოკენის ღირებულებაზე.“
  • „საწყისი პერიოდის ამოწურვის შემდეგ იმოქმედებს ფასი: $4 მილიონ შემავალ ტოკენზე და $20 მილიონ გამომავალ ტოკენზე.“

ამ დროისთვის ის ხელმისაწვდომია სანდო ტესტერებისა და კიბერუსაფრთხოების სპეციალისტებისთვის (Fairwind Program-ის მეშვეობით). ფართო აუდიტორიისთვის გამოშვებამდე, Google ყურადღებას ამახვილებს შემდეგ საკითხებზე:

  • ბოროტად გამოყენებისგან დაცვა კიბერ ან ქიმიური, ბიოლოგიური, რადიოლოგიური და ბირთვული (CBRN) შეტევებისას: Google-მა გააუმჯობესა „მეთოდები მოდელის შიდა აქტივაციებზე დასაკვირვებლად, რათა გამოავლინოს ბოროტად გამოყენების შემთხვევები“.
  • პრომპტ-ინექციური შეტევებისგან დაცვა: Google-ის „ყველაზე მდგრადი მოდელი არაპირდაპირი პრომპტ-ინექციების წინააღმდეგ“, რომელიც „ლიდერობს პრომპტ-ინექციების მიმართ მდგრადობით Gray Swan-ის Indirect Prompt Injection (IPI) ბენჩმარკში“.
  • სისტემების გაძლიერება (Hardening): „ჩვენ ვაძლიერებთ ჩვენს იზოლირებულ გარემოებებს (sandbox) მათი იზოლაციითა და ჩაკეტვით მაღალი რისკის შემცველი წვრთნისა თუ შეფასების დაწყებამდე“.
  • მიზნებთან აცდენის (misalignment) მონიტორინგი: Google „ნერგავს აცდენების შესამცირებელ ზომებს, რომლებიც აკონტროლებს Argon-ის აზროვნების ჯაჭვსა (chain-of-thought) და მოქმედებებს, და საჭიროების შემთხვევაში აჩერებს შესრულებას“.
  • „მსგავს სისტემას ვიყენებდით საწვრთნელი პროცესების მონიტორინგისთვის და ინციდენტებზე რეაგირების სპეციალურ ჯგუფში შეტყობინებების გასაგზავნად; ამავდროულად, მკაცრ ზომებს ვიღებდით, რათა მიღებული შედეგები ხელახლა არ დაბრუნებულიყო წვრთნაში და Argon-ის ლოგიკა ჩვენი მონიტორინგისთვის თავის არიდებაზე არ მომართულიყო“.

Google-ის შიგნით Gemini 4 Argon უკვე გამოიყენება შიდა სამუშაო პროცესებში — „ათასობით Google-ის თანამშრომელი ხაზს უსვამს მოდელის უპირატესობებს სპეციალიზებულ პროგრამირების ამოცანებში, სიღრმისეული კვლევის ჩატარებასა და წერის ხარისხში“. კომპანიამ დღეს რამდენიმე მაგალითი გააზიარა:


მეხსიერების ეფექტიანობა: Argon-ის აგენტების გუნდმა გააანალიზა პროფაილინგის ტელემეტრია მთელ ინფრასტრუქტურაში, რათა ავტონომიურად გამოევლინა და განეხორციელებინა მეხსიერების ოპტიმიზაცია Google-ის მონაცემთა ცენტრებში. დანერგვისთანავე ამან გაათავისუფლა 300 TiB-ზე მეტი მეხსიერება, ხოლო ჯამური დაზოგვა 500 TiB-დან 1 PiB-მდეა მოსალოდნელი.

კოდის ბაზის ფართომასშტაბიანი მიგრაცია და ოპტიმიზაცია: Argon-ის აგენტები მუშაობენ C/C++ კოდის ბაზების Rust-ზე მიგრაციაზე Google-ის მასშტაბით — ათობით ათასი ხაზიდან ისეთ ძირითად ბიბლიოთეკებში, როგორებიცაა re2 და libgav1, 800 000-ზე მეტ ხაზამდე Fuchsia OS Zircon-ის ბირთვისთვის (kernel). მრავალი ამ სისტემის კრიტიკული მნიშვნელობის გათვალისწინებით, მსგავსი ფართომასშტაბიანი გადაწერები გადის მკაცრ ავტომატიზებულ და მექანიკურ აუდიტს, ემულაციურ ტესტირებასა და შემოწმებას პროდაქშენში გაშვებამდე.

libgav1-ისთვის, Google-ის ღია კოდის მქონე პროგრამული უზრუნველყოფისთვის ვიდეოს დეკოდირებისთვის, Argon-ის აგენტებმა აიღეს Rust-ის არსებული პორტი და ჩაანაცვლეს 32 ათასი ხაზი SIMD კოდი პროფილზე დაფუძნებული მრავალეტაპიანი ექსპერიმენტების ჩატარებით, კომპილატორის გამონატანის შესწავლითა და უსაფრთხო Rust კოდის შექმნით, რათა კომპილატორს ავტომატურად მოეხდინა მისი ვექტორიზაცია. საბოლოო შედეგია მეხსიერების თვალსაზრისით უსაფრთხო (memory-safe) ვიდეოდეკოდერი, რომელიც 2.7-ჯერ უფრო სწრაფად მუშაობს, ვიდრე წინა Rust პორტი, აქვს იდენტური გამომავალი ვიდეო და უახლოვდება ოპტიმიზებულ C++-ს.

გაზიარება:

კომენტარები

ახალი კომენტარის დაწერა