ІІ-модель Gemini: що це та як їй користуватися
На початку грудня 2023 року Google представила модель штучного інтелекту Gemini, а в лютому 2024 року оновлену версію — Gemini 1.5. За словами розробників, Gemini краще, ніж найпросунутіша модель ІІ GPT-4
Що таке Gemini
Gemini – це модель штучного інтелекту, розроблена компанією Google DeepMind. Вона доступна у трьох версіях:
- Gemini Nano - На смартфонах Google Pixel 8 Pro;
- Gemini Pro - На її основі тепер працює чат-бот Gemini (раніше відомий як Google Bard). Дозволяє генерувати тексти та зображення, ставити запитання та шукати інформацію. Контекстне вікно складає 32 тис. токенів. Це означає, що користувач може надіслати нейромережі запит обсягом 32 тис. одиниці інформації. Одиницею інформації можуть бути літери, символи, слова, частини слова, речення тощо;
- Gemini Ultra - ІІ-модель, де реалізовано найбільшу кількість функцій, конкурент GPT-4.
Можливості Gemini
Gemini Nano робить короткий зміст записів з диктофона, пропонує варіанти відповідей у листуванні в месенджерах WhatsApp, Line та KakaoTalk та краще захищає персональні дані від витоків.
Демонстраційний ролик смартфона Google Pixel 8 Pro із вбудованою моделлю ІІ Gemini Nano.
Gemini Pro вміє генерувати тексти — від відповіді питання «Як справи?» до комп'ютерного коду різними мовами програмування, розпізнавати, описувати зміст зображень, генерувати картинки, робити короткий переказ тексту.
Модель ІІ Gemini Ultra вміє розпізнавати та аналізувати тексти, зображення, аудіо і навіть відео (цього GPT-4 ще не вміє), а також генерувати текст та зображення. Приклади можливостей Gemini Ultra:
- розпізнає рукописний текст на зображеннях;
- перевіряє наявність помилок у тексті (як у письмовій, так і на зображенні) і пояснює, що потрібно виправити і чому;
- створює окремий інтерфейс для кожного завдання, наприклад покрокову інструкцію з ілюстраціями, як приготувати страву;
- генерує комп'ютерний код, таблиці, різні види текстів та зображень;
- веде з користувачем "усвідомлений" діалог.
Згідно з заявами Google, Gemini Ultra перевершив GPT-4 по 30 із 32 тестів. Gemini краще відповідає питанням, розуміє запити користувачів, пише код на Python, вирішує складні математичні завдання, розшифровує аудіо.
Одна з головних переваг моделі від Google – взаємодія з відео. У демонстраційному ролику було показано, як Gemini розпізнає та озвучує дії, що відбуваються на відео, передбачає, що буде далі, та пропонує варіанти розвитку подій. Також модель запропонувала користувачеві зіграти в гру, порівнювала предмети за різними характеристиками, запропонувала та проілюструвала, що можна зробити з двома клубками пряжі, розпізнала гітару та включила мелодію на гітарі.
Як користуватися Gemini в Росії
Скористатися Gemini Nano можна тільки на смартфонах Pixel 8 Pro.
Gemini Ultra доступна у веб-версії на сайті Gemini Advanced і в однойменних додатках на Android та iOS. Однак його використання платне – $19,99 на місяць. Є безкоштовний двомісячний пробний період. У Росії Gemini Advanced недоступний без VPN.
Gemini Pro можна скористатися безкоштовно у чат-боті Gemini. Для цього потрібно увійти до облікового запису Google. У Росії інструмент недоступний без VPN.
Приклади використання Gemini
У Gemini Advanced на базі Gemini Ultra поки немає можливості взаємодіяти з відео.За словами компанії, Gemini Ultra у Gemini Advanced краще, ніж Gemini Pro у чат-боті Gemini розуміє запити та веде діалог з користувачем. Поступово розробники будуть додавати інші функції, у тому числі роботу з відео.
Користувач може створювати контент у чат-боті Gemini, який вбудований Gemini Pro. Для цього у діалоговому вікні потрібно написати запит. «РБК Тренди» спробували згенерувати вірш, комп'ютерний код та описати зображення.
Як користуватися нейромережею Google Gemini і отримати доступ до неї в Росії
У лютому сервіс Bard від Google перейменували на Gemini. Разом із ребрендингом до нейромережі додали нові функції.
Gemini працює і виглядає як ChatGPT. Тільки безкоштовна версія чат-бота від Google має доступ до інтернету і можливість створювати картинки. Нейросеть може відповідати на запитання, писати код, розпізнавати зображення, допомагати з контентом та багато іншого.
Існують три моделі Gemini, які доступні широкому загалу. Доступ до них та їх можливості дещо відрізняються. Розкажу, як користуватись різними версіями чат-бота з Росії і що вони вміють.
Листи про технології та інтернет
Допоможуть використовувати технології на повну і триматимуть у курсі мемів та трендів. У вашій пошті двічі на місяць. Безкоштовно
Які версії Gemini існують
Усього доступно три версії Gemini: безкоштовні 1.0 Pro та 1.5 Pro, а також 1.0 Ultra за платною підпискою.
😌 Для повсякденних завдань – Gemini 1.0 Pro. На її основі працює чат-бот Gemini, раніше відомий як Bard.Він може написати інструкцію з малювання аквареллю, пояснити суть теорії відносності, згенерувати пост для соцмереж з рецептами шоколадних десертів, дати визначення когнітивній нейронауці, допомогти з кодом, сценарієм для відео або планом для статті.
На початку лютого 2024 року користувачам стала доступна функція створення зображень.
🤑 Платний апгрейд - Gemini 1.0 Ultra. Може те саме, що й Gemini 1.0 Pro, але ще краще — принаймні так говорять у Google. На цій моделі працює платний чат-бот Gemini Advanced. Він повинен краще справлятися зі складними запитами: писати код, розмірковувати, виконувати детальні інструкції і допомагати в креативних завданнях.
🤯 Погляд у майбутнє - Gemini 1.5 Pro. 15 лютого Google анонсував обмежений попередній перегляд цієї моделі через AI Studio. Gemini 1.5 Pro здатна обробляти до мільйона токенів
. Це значно більше, ніж у ChatGPT з контекстним вікном 128 тисяч токенів. Тобто, наприклад, Gemini Pro 1.5 може розпізнати годину відео, 11 годин аудіо, понад 30 тисяч рядків коду та понад 700 тисяч слів.
Якщо завантажити в чат 44-хвилинний німий фільм Бастера Кітона, модель може проаналізувати сюжет та підтримати розмову про дрібні деталі. Наприклад, нейромережа знайшла момент, де у героя з кишені виймають аркуш паперу, і визначила, що на ньому написано: це заставний квиток із сумою та датою.
При цьому Gemini Pro 1.5 не може генерувати картинки та не має доступу до інтернету.
Нейросеть вказала на таймкод із фільму і навела текст із паперу. Джерело: ютуб-канал Google
Як отримати доступ до різних версій Gemini в Росії
Усі моделі Google Gemini можна користуватися з Росії. Розрізняються лише нюанси, пов'язані з доступом.Розповім про них докладніше.
Gemini 1.0 Pro безкоштовна, працює на офіційному сайті Gemini. Для використання чат-бота потрібно увійти в гугл-аккаунт. Російський теж підійде, не потрібно змінювати регіон чи створювати новий профіль.
Нейросітка також доступна у програмі Google для iOS. Щоб перейти до Gemini, на головному екрані натисніть на іконку із синьою зіркою – відкриється чат із ботом. Будьте уважні: окремої програми Gemini на iOS немає. Але в App Store безліч сервісів з такою самою назвою видають себе за нейромережу.
Для «Андроїда» є окремий додаток Gemini. У російському магазині воно недоступне, так що для завантаження доведеться поміняти регіон. Про те, як це зробити, читайте у нашому гайді по смартфонах на Android.
Сервіс офіційно працює у 180 країнах, серед яких немає Росії, тому в обох випадках – через сайт чи додаток – потрібно заходити з іноземною IP-адресою. Інакше з'явиться заглушка з написом «Gemini поки що не підтримується у вашій країні. Ми повідомимо, коли це зміниться».
Gemini 1.0 Ultra доступна платно на офіційному сайті Gemini. Також потрібно вхід через гугл-аккаунт і з іноземної IP-адреси.
Передплата коштує 20 $ ( 1858 ₽) на місяць, але можна скористатися двомісячним безкоштовним тестовим періодом. Для цього потрібно прив'язати банківську картку закордонного банку. Коли тестовий період закінчиться, з вашої карти спишуть вартість передплати за наступний місяць.
Gemini 1.5 Pro доступна безкоштовно, але не на основному сайті Gemini, а в Google AI Studio, де компанія тестує нові продукти нейромережі. На сайт потрібно заходити з іноземною IP-адресою. Для входу знадобиться гугл-аккаунт, можна використовувати російську.Бажано в налаштуваннях профілю змінити мову на англійську, щоб точно все спрацювало.
Як Gemini працює з текстом та пошуком у порівнянні з Bard
У лютому 2024 року Google перейменував чат-бота Bard у Gemini. Ребрендинг пояснили тим, що компанія вибудовує екосистему навколо нейромережі Gemini, і окрема назва для сервісу не потрібна.
Основні функції та інтерфейс чат-бота не змінилися з часів Bard. Нейросеть так само відповідає російською мовою, розпізнає контекст, запам'ятовує деталі розмови, виходить в інтернет. Кількість діалогів та запитів на добу не обмежена.
Чат з помічником та підказки знаходяться праворуч, всі чати з нейромережею зберігаються ліворуч. Інтерфейс перекладено російською мовою за умовчанням, якщо ваш гугл-аккаунт прив'язаний до російського регіону та мови.
При цьому додалися нові можливості. На цих функціях зупинюся докладніше та розповім, що взагалі може Gemini.
Генерувати тексти. Нейросітка відповідає на прості запитання та пояснює складні терміни на рівні безкоштовної версії ChatGPT. Gemini також має доступ до актуальної інформації, тому вона може виходити в інтернет і давати посилання на джерела.
Зберігаються недоліки часів Bard. Нейросеть періодично галюцинує, відмовляється відповідати питання без видимої причини, який завжди дає посилання. Додався ще один: у випадкові моменти Gemini пропонує купити підписку, що дратує.
💻 Google у прес-релізах підкреслює, що Gemini добре допомагає з програмуванням: знає різні мови, вміє шукати баги та пояснювати помилки. Я згенерувала HTML-код простої сторінки.
Нейросітка впоралася і дала пояснення до кожного параметра. Але результат вийшов трохи кривим – текст вийшов за поля.
🎓 У Google також пропонують використовувати нейромережу для самоосвіти. Я попросила пояснити різницю між часом англійською Past Perfect та Past Perfect Continuous. Gemini докладно розповіла правило, навела приклади та навіть намалювала табличку, яку можна скопіювати собі в гугл-документ.
При бажанні в цьому ж чаті попросіть нейромережу згенерувати завдання пройденого матеріалу, щоб краще їх засвоїти.
🍔 Ще я перевірила нейромережу на креативному завданні – попросила згенерувати незвичайні ідеї для кулінарного каналу. Результати важко назвати особливо оригінальними: все запропоноване вже зустрічалося мені у соцмережах.
Але для брейнштормінгу такий перелік непоганий.
Коротко переказувати. Gemini може прочитати текст за посиланням та проаналізувати його. З часів Bard функція почала працювати краще. Нейросеть справді намагається переказати текст, а чи не видає випадкові факти на тему і відмовляється виконувати завдання взагалі, як це було раніше.
Але до ідеалу ще далеко. Зміст статті про сходження на Еверест чат-бот переказав дуже узагальнено. У деяких місцях нейромережа залишила англійські слова, через що текст став нагадувати мем «Дивлячись який fabric».
При цьому Gemini не може переказувати ролики за посиланнями, включаючи відео на «Ютубі», незважаючи на те, що обидва сервіси належать Google. Нейросеть кожен раз генерує галюцинації, взагалі пов'язані зі змістом відео.
Розпізнавати зображення. Gemini може шукати зображення в інтернеті і описувати фотографії, які ви відправляєте в чат. З простими завданнями справляється, а ось більш специфічні, наприклад знайти тигра на картинці з кількома тваринами, йому не під силу.
Ще модель відмовляється працювати із зображеннями людей.Тобто взаємодіяти з фотографіями чи навіть малюнками, де є будь-яка людина — неважливо, відома чи ні — за допомогою нейромережі неможливо.
Як генерувати картинки в Gemini
Одна з головних переваг Gemini – безкоштовний доступ до нейромережевого генератора зображень. На відміну від Midjourney його не потрібно оплачувати, а на відміну від Stable Diffusion — встановлювати на комп'ютер.
Генератор доступний у веб-інтерфейсі чат-бота і розуміє запити природною мовою. Це означає, що не потрібно вчитися писати промпти за складними формулами. Просто просіть намалювати щось так, як попросили б людину.
Як створити першу картинку. На перший погляд, незрозуміло, що Gemini вміє генерувати зображення, тому що на головному екрані немає відповідної підказки. Якщо ввести запит російською, нейромережа відповість, що не може допомогти, тому що поки не вміє створювати зображення. Але це неправда. Вона зрозуміє запит, але лише англійською мовою.
Ви можете сформулювати запит російською, попросити нейромережа його перекласти англійською і потім відправити цей же текст у чат. Якщо Gemini зрозуміла ваш запит, через кілька секунд вона запропонує одне або кілька зображень на вибір. Від чого залежить кількість – невідомо.
Gemini має велике обмеження: вона тимчасово не може створювати зображення людей. Його ввели після того, як користувачі почали генерувати історичних особистостей, наприклад батьків-засновників США, а нейромережа видавала темношкірих людей. Це призвело до звинувачень, що Gemini взагалі неможливо згенерувати білих, навіть коли це обумовлено контекстом.
У Google заявили, що налаштування, що гарантує різноманітність рас, не врахувала випадки, де це недоречно і навіть образливо.Наприкінці лютого компанія вибачилася і оголосила про тимчасове відключення цієї функції. Поки що її так і не повернули.
Як виправити картинку. Якщо результат не сподобався, можна створити нові варіанти за допомогою кнопки Створити ще. Нейросеть видасть ще дві картинки за тим самим запитом. Натискати на кнопку можна необмежену кількість разів – принаймні після десяти перегенерацій до ліміту я не дійшла.
А можна внести редагування у вже згенероване зображення. Наприклад, додати на картинку інопланетян, а потім зробити їх добрішими. Щоб виправити конкретний результат із усіх згенерованих, потрібно вказати, яка картинка за рахунком, та перерахувати свої побажання до неї.
Gemini може створювати зображення у різних стилях, від магічного фентезі до затишних ілюстрацій, як із дитячих казок. Достатньо лише вказати це на початку запиту.
Вибрати можна не лише стилістику, а й настрій, колірну гаму, атмосферу картинки тощо. Якщо губитеся і не знаєте, як описати це у запиті, читайте наш докладний гайд промптингу в нейромережах для генерації картинок.
Як завантажити результат. Щоб завантажити повнорозмірну картинку, натисніть стрілку в її правому верхньому кутку. Зображення розміром 1536 × 1536 пікселів збережеться у форматі JPEG.
Якщо подобаються усі картинки, можна скачати їх разом. Для цього натисніть "Поділитися та експортувати", а потім "Завантажити всі зображення" у спливаючому меню. У такому разі вони зберігатимуться як zip-архів.
Як згенерувати картинку та текст одночасно. Нейросеть мультимодальна - тобто може обробляти текст і зображення в рамках одного запиту. Це означає, що Gemini можна попросити написати історію і згенерувати ілюстрації до неї
Правда, такий запит теж доведеться писати англійською мовою, тому що російською нейромережею відмовляється генерувати картинки.
Що вміє Gemini Advanced і чи варто за неї платити
Gemini Advanced — просунута версія Gemini, доступна за платною підпискою та працююча на основі моделі 1.0 Ultra . .
Я порівняла можливості двох моделей. Ось що вміє платна версія.
Генерувати тексти. У простих запитах якість відповідей Gemini Advanced суттєво не відрізняється від базової версії.
Google обіцяє, що різницю можна помітити при вирішенні більш складних завдань: складанні покрокових інструкцій, навчанні, генерації креативних постів. мінімальні: Advanced просто розповідає трохи докладніше.
Коротко переказувати. Gemini Advanced трохи краще переказав статтю про сходження на Еверест, ніж базова версія. При цьому на початку модель трохи згалюцинувала.
В іншому короткий переказ відповідає тексту і дозволяє скласти враження про зміст.
Розпізнавати зображення. Я попросила показати фото лабрадора, і на відміну від безкоштовної версії Gemini Advanced не тільки знайшов фотографії, але й дав короткий опис породи.
Однак знайти лева на фотографії із 23 тваринами на білому тлі ця версія нейромережі теж не змогла.
Генерувати картинки. Google ніде не заявляє, що при створенні зображень у базовому та просунутому Gemini є різниця. Я також її не знайшла. Зображення генеруються приблизно однакові.
Швидше за все, обидві версії використовують ту саму модель. Тому, якщо Gemini вас цікавить лише як генератор зображень, купувати передплату точно не варто.
Що вміє Gemini 1.5 Pro
Gemini 1.5 Pro доступна безкоштовно на сайті AI Studio. Вона не може генерувати картинки і виходити в інтернет, проте вміє обробляти набагато більший обсяг даних. Модель навчена на даних до початку 2023 року.
Інтерфейс лише англійською мовою, але нейромережа розуміє російську. Промпт можна ввести в поле Type Something, завантажити медіа за допомогою кнопки Image, Video, File або Folder.
Версія поки що тестується, тому має обмеження: історія чатів не зберігається. Щоб розпочати новий діалог, натисніть Create New. Якщо вам потрібні дані з діалогу з нейромережею, збережіть їх вручну.
Ось що може нейромережа Gemini 1.5 Pro.
Генерувати тексти. Я перевірила «складні» запити, на яких тестувала Gemini Advanced: HTML-код, пояснення правил англійської мови та складання контент-плану для кулінарного каналу. З усіма запитами Gemini 1.5 Pro впоралася краще.
Вона відцентрувала логотип в HTML-коді, докладно пояснила різницю між Past Perfect і Past Perfect Continuous і запропонувала трохи більш креативні ідеї для каналу, хоч і все одно трохи банальні.
Обробляти великий обсяг даних. Я завантажила в чат pdf-файл з книгою Гаррі Поттер і філософський камінь і попросила нейромережу коротко переказати її. Модель видала правильну відповідь англійською мовою, я попросила перекласти її російською.Gemini 1.5 Pro також відповіла без помилок на два питання щодо змісту книги.
Ця істотна перевага версії 1.5 Pro відкриває великі можливості, яких немає аналогів, — робота з великими документами. Наприклад, швидко знайти відповідь на запитання у докторській дисертації чи годинниковому подкасті. Так не може навіть платний ChatGPT.
Коротко переказувати. Нейросеть не може переходити за посиланнями, але можна відправляти текстові файли. Я надіслала PDF зі статтею про сходження на Еверест і нарешті отримала найкращий варіант переказу.
Вийшло максимально близько до оригіналу та без явних галюцинацій.
Розпізнавати зображення. На відміну від інших версій, 1.5 Pro обробляє зображення з людьми. Вона визначила, що на фото зображено натовп і додала неочевидну деталь — що воно зроблено на Октоберфесті в Мюнхені. Нейросеть також розпізнала кадр із фільму «Дюна».
Gemini 1.5 Pro краще впоралася з перерахуванням тварин на зображенні, ніж базова версія. Але все одно помилилася на зображенні, де намальовано 23 різних звірів. Нарахувала більше, ніж насправді.
Що в результаті
- Gemini доступний безкоштовно і на прийнятному рівні генерує картинки та текст. На тлі платних чи складних у користуванні конкурентів це хороша і доступна мультимодальна нейромережа. Єдиний очевидний мінус – неможливість створювати картинки з людьми.
- Просунута версія Gemini Advanced працює набагато краще, ніж її безкоштовний варіант. Очевидних причин купувати передплату немає. Але можна взяти тестовий період, якщо дуже хочеться.
- Gemini 1.5 Pro доступна безкоштовно і краще за інші версії працює з текстом, кодом і розпізнаванням зображень. У ній можна обробляти цілі книги або годину відео. Такої можливості немає навіть у платному ChatGPT.Але 1.5 Pro не може генерувати картинки та виходити в інтернет.
Ми розповідаємо різні історії про популярну культуру та тих, хто її створює. Підписуйтесь на наш телеграм: @t_technocult
- snow-white Дякуємо за статтю 0
- pantration Навіщо вони викуповували ГПТ, якщо продовжують своє намагатися робити 0
- user3149686 Ви напевно плутаєте з Microsoft 5
- Денис Штаб Я користувався генеративною моделлю Bard майже з моменту її виходу ще до того, як почав активно користуватися ChatGPT від OpenAI. І це була хороша нейромережа, яка хоч і сильно відставала від того ж ChatGPT, але могла відповісти на базові запити правильно. Однак із виходом Gemini щось пішло не так. Зараз ця нейромережа далека не те, що до досконалості, їй далеко до рівня ChatGPT 3.5. Що дивно, минула модель нейромережі - Bard, мені здалася вдалішою, ніж оновлена Gemini. Проблема Gemini полягає в тому, що вона не може відповідати суцільним текстом, без маркерів і нумерації, вона завжди відповідає вичавку будь-якої текстової інформації у вигляді невеликих абзаців. Припустимо, я задаю базовий промпт «придумай цікаву історію про те, як Лосяш і Копатич зі Смішариків познайомилися». Якщо ChatGPT 3.5 (я мовчу про Copilot від Microsoft з моделлю GPT 4) видасть суцільний текст, який можна скопіювати і вставити куди завгодно, то Gemini обов'язково використовує маркери, де кожен маркер буде невеликим абзацом тексту. Я так і не зміг це виправити, навіть якщо вказати у промпті «текст має бути без маркерів і будь-якої нумерації». Ще Gemini дуже часто пише російсько-англійський текст: ≈80% відповіді російською та решта англійською. У ChatGPT таких проблем мною не було помічено. Зауважу, що я маю на увазі базову версію Gemini 1.0 Pro.Загалом, цієї нейромережі достатньо для повсякденних завдань, але більш складні запити, що трекують коригування його відповіді, Gemini не може обробити і часто видає текст з помилками. Та й загалом, ChatGPT навіть без доступу до Інтернету начебто дає більш правильну інформацію з значно меншою кількістю галюцинацій. Це моя думка. 4
- Гліб Користуюсь версією 1.5 Pro. Загалом виходить досить непогано. Але є одне але. Мільйон токенів це класно, але коли я доходив приблизно до 100к токенів (закидав пдф файли для створення нового контенту, на основі даних) генерація відбувалася дуже повільно. 2
- Як би Gemini 1.5 може переходити за посиланнями і вивчати з них інформацію. Самостійно відправити його шукати інформацію не вийде, але якщо припустимо вийшов новий резил якогось сервісу, можна дати йому посилання на вивчення нової версії. 1
- Олексій Тіманов Денис, ви зараз описали проблеми ChatGPT 4) саме вона видає то англійський то російський текст, при написанні коду робить одну й ту саму помилку. Не враховує раннє сказане, суцільний текст Chat теж далеко не завжди робить навіть якщо його намагатися змусити. Навпаки, у Gemini я такого не спостерігав. Що стосується інформації при спробі написати код на Python GTP написав 10 із 10 кодів з помилкою, Gemini не помилився жодного разу. Втім я використав 1.5 версію Gemini. Але те, що 3.5 краще хоч чогось? Це вже вибачте, він мало того що незграбно може повторювати одне і те ж, так у нього ще й інформація сильно застаріла. 4
- Ольга Просвірякова Хотіла написати, що у вас чудові галактичні пончики вийшли промптом. І інопланетяни теж) Я з-за них і тицьнула на статтю в розсилці.Сама стаття дуже цікава та докладно розписана. Я користуюсь ChatGPT Pro, але тепер цікаво спробувати і Gemini. 0
- Аннет Сухарєва Ольга, дякую! ❤️ картинки і справді вийшли дуже барвисті) 0
- Леонід Білобров Ви точно з Росії? Воно, як і раніше, недоступне. Якщо не видно на скріншоті, але там написано "Gemini поки не підтримується у вашій країні. Ми повідомимо, коли це зміниться." 2
- Леонід Білобров Леонід, Наче стаття від 11.04.24, а відповідь доводиться шукати в іншій про його стару назву Bard взагалі з чужої статті від 04.08.23 з інформацією про яку "Сервіс офіційно працює у 180 країнах, серед яких немає Росії, тому потрібно заходити з іноземною IP-адресою." не було згадано тут. 0