Google-მა გამოსახულებების გენერაციისა და რედაქტირების საკუთარი მოდელი განაახლა. Nano Banana 2.1 დაფუძნებულია Gemini 3.6 Flash-ზე და ინარჩუნებს Flash-მიდგომას: სწრაფი ინფერენსი Pro-ხაზთან შედარებით შესამჩნევად დაბალ ფასად. მოდელი უკვე ხელმისაწვდომია Gemini-ში, AI Studio-სა და Gemini API-ში.
მთავარი განახლება რედაქტირებასთან მუშაობაა. ანონსში საუბარია პერსონაჟებისა და ობიექტების თანმიმდევრულობის (კონსისტენტურობის), multi-image editing-ის, ნიღბებისა და ესკიზების გაუმჯობესებაზე, ასევე ინფოგრაფიკის გენერაციაზე. ამ უკანასკნელი ამოცანისთვის მოდელს შეუძლია გამოიყენოს Gemini-ს ცოდნა და ვებძიების მონაცემები, რაც ეხმარება არა მხოლოდ გამოსახულების შექმნაში, არამედ ფაქტობრივ შინაარსთან უფრო ზუსტ მუშაობაშიც.
ჩემი აზრით, ყველაზე სასიამოვნო სიახლე დიდი კონტექსტური ფანჯარაა. მოდელი იღებს ტექსტსა და გამოსახულებებს 1 მლნ-მდე ტოკენის კონტექსტით. გამომავალზე მხარდაჭერილია 4K-მდე ტოკენი გამოსახულებისთვის და 64K-მდე ტექსტისთვის. ამასთანავე, Gemini API-ში გამოქვეყნებულია ცალკე ლიმიტები: 131 072 შემავალი და 32 768 გამომავალი ტოკენი.
Multi-reference სცენარებისთვის შესაძლებელია 14-მდე გამოსახულების გადაცემა. Google აცხადებს ოთხამდე პერსონაჟის თანმიმდევრულობისა და ათამდე ობიექტის სიზუსტის შენარჩუნებას. შესაძლებელია გენერაცია 1K, 2K და 4K რეზოლუციებში, გვერდების ფართო და პანორამული შეფარდების ჩათვლით.
ცალკე დაემატა Thinking-ის მორგებადი სიღრმე: minimal, medium და high, თანაც medium გამოიყენება ნაგულისხმევად.
რა შეიცვალა ციფრებში
Google-ის საკუთარ preference-ტესტებში Nano Banana 2.1-მა Thinking-ით მიიღო 1050 Elo, Nano Banana 2-ის 990-ისა და Nano Banana Pro-ს 935-ის წინააღმდეგ.
რამდენიმე პერსონაჟიან ამოცანებში მოდელმა მიიღო 1106 Elo, Nano Banana 2-ის 978-ისა და Pro-ს 1011-ის წინააღმდეგ. Mask/ink-based editing-ში — 1049 Elo 965-ისა და 927-ის წინააღმდეგ შესაბამისად.
ცალკე Google-მა შეამოწმა ინფოგრაფიკის ფაქტოლოგიური სიზუსტე. აქ Nano Banana 2.1-მა აჩვენა 0,521, Nano Banana 2-ის 0,179-ისა და Nano Banana Pro-ს 0,265-ის წინააღმდეგ.
წყარო: Habr — DashaPasha