Présentation de Gemini Robotics 2.0
Les robots alimentés par les modèles d'intelligence artificielle (IA) Gemini de Google sont désormais plus capables. Avec l'apparition de Gemini Robotics 2, ces robots physiques peuvent accomplir des tâches plus complexes, analyser en continu des environnements changeants et collaborer avec d'autres robots.
Fonctionnement de Gemini Robotics ER 2
Gemini Robotics ER 2 est un modèle d'intelligence artificielle amélioré qui permet aux robots d'avoir une meilleure dextérité, même pour les machines avec des mains humanoïdes complexes. Ce modèle est intégré à l'API Gemini Live, ce qui donne aux développeurs l'opportunité d'expérimenter cette avancée.
Architecture et limites
Gemini Robotics ER 2 est un modèle de langage et de vision (VLM) conçu pour comprendre les instructions et le monde qui l'entoure. L'amélioration majeure ici est que ER 2 peut traiter des flux vidéo en direct à partir des caméras du robot, permettant au système de suivre les progrès du robot. Google note que Gemini Robotics ER 2 peut classer la complétude des trames vidéo avec une précision d'environ 60 pour cent, ce qui est encore loin de la perfection mais meilleur que la version 1.6 ou que ce que l'on peut obtenir avec la compréhension visuelle des modèles d'IA concurrents.
Implications et perspectives
L'objectif de Gemini Robotics est de créer un robot généraliste, capable de faire tout ce qu'un humain peut faire, parfois appelé « physical AGI » par les scientifiques de Google DeepMind. Avec la version 2.0, Google affirme que son intelligence artificielle robotique peut contrôler un robot humanoïde entier avec une dextérité améliorée, ce qui ouvre de nouvelles possibilités pour les applications futures.
Exemple de code pour utiliser l'API Gemini Live :
// Importer l'API Gemini Live
import gemini_live_api
// Initialiser le robot
robot = gemini_live_api.Robot()
// Définir la tâche pour le robot
task = gemini_live_api.Task('example_task')
// Exécuter la tâche
robot.execute(task)