Google представляє штучний інтелект Gemini для роботів
Google DeepMind компанії Alphabet Inc. представила нову модель штучного інтелекту для роботів, яка дозволяє гуманоїдним машинам координувати рухи всього свого тіла, що є черговою спробою розширити технологію Gemini AI, щоб дозволити роботам міркувати, планувати багатоетапні завдання та адаптуватися до людського середовища.
Нова система, Gemini Robotics 2, дозволяє роботам ходити, присідати та маніпулювати об'єктами, одночасно обмірковуючи завдання. На відміну від попередньої моделі, яка в основному керувала верхньою частиною тіла робота, компанія заявила, що Gemini Robotics 2 може керувати цілим гуманоїдом зверху вниз.
«Наша мета — впровадити штучний інтелект у фізичний світ, а потім створити рівень інтелектуального інтелекту, який зможе використовувати кожен робот», — сказала Кароліна Парада, віцепрезидент з робототехніки Google DeepMind , на брифінгу для журналістів.
Водночас Канішка Рао, директор з робототехніки в Google DeepMind, зазначив, що справжня спритність залишається далекою метою; рухи роботів залишаються повільними та обдуманими, оскільки машини повинні зупинятися, щоб обміркувати рішення, які люди приймають інтуїтивно.
Ця анонсована робота ґрунтується на дебюті Google у 2025 році під назвою Gemini Robotics , версії флагманської моделі Gemini AI, яка була здатна перетворювати мову та візуальну інформацію на роботизовані дії.
Цей реліз відродив амбіції компанії в галузі робототехніки, які тривали понад десять років. Після придбання низки стартапів у галузі робототехніки на початку 2010-х років, Alphabet пізніше згорнула значну частину цієї роботи, зокрема закривши свій підрозділ Everyday Robots у 2023 році.
Конкуренти Google, OpenAI та Nvidia , також розробляють моделі штучного інтелекту та програмне забезпечення для роботів. OpenAI також досліджувала універсальні базові моделі роботів, які поєднують зір, мову та дії, тоді як Nvidia надає програмне забезпечення, яке допомагає розробникам навчати роботів на базі штучного інтелекту.
У вівторок, під час попередньо записаної демонстрації для журналістів, нова модель штучного інтелекту від DeepMind керувала гуманоїдним роботом Apollo компанії Apptronik Inc. , який проходив кімнатою, піднімав лійку та ставив її на нижню полицю, одночасно долаючи перешкоди.
У четвер DeepMind також випустила дві інші моделі робототехніки на базі штучного інтелекту, які можуть працювати разом або незалежно. Gemini Robotics 2 перетворює вхідні дані камери та інструкції природною мовою на команди двигуна. Gemini Robotics ER 2, система мислення робота, планує багатоетапні завдання та може координувати роботу кількох роботів, що працюють над досягненням однієї мети.
Незважаючи на це, Рао, директор DeepMind, сказав, що роботи все ще навчаються набагато менш ефективно, ніж люди, які можуть коригувати свою поведінку лише після однієї чи двох помилок.
Google також відзначив покращення в спритності роботів, і його дослідники заявили, що система може успішно відкрутити лампочку у 92% випадків у тестах. Інші складні завдання, включаючи зав'язування сміттєвого пакета та запечатування пакета на блискавці, мали відносно низький рівень успіху.
Компанія також представила нові тести для оцінки того, чи можуть роботи розпізнавати невизначеність та відхиляти небезпечні запити. Google заявила, що Gemini Robotics ER 2 є найбезпечнішою моделлю робототехніки порівняно з попередніми моделями, особливо щодо її здатності виконувати інструкції та орієнтуватися серед людей.
Gemini Robotics ER 2 буде доступний через платформу розробників Google AI Studio, а також у приватній попередній версії на корпоративній платформі штучного інтелекту Google, тоді як більш спеціалізовані моделі Gemini Robotics 2 та On-Device 2 пропонуються партнерам з раннім доступом та понад 100 довіреним тестувальникам, повідомила Google. Компанія додала, що відкриває список очікування на свої моделі для розробників робототехніки та співпрацює з низкою основних партнерів, включаючи Apptronik, Agile Robots SE та Boston Dynamics .