Nowy model Google DeepMind poprawia zdolności robotów do planowania i percepcji. Współpraca z Boston Dynamics przynosi przełom w odczycie przyrządów.

Źródło zdjęcia: The Decoder
Google DeepMind zaprezentował Gemini Robotics-ER 1.6, ulepszoną wersję modelu przeznaczonego do zaawansowanego rozumowania w robotyce. Nowy model działa jako warstwa wysokopoziomowego myślenia, pomagając robotom lepiej rozumieć otoczenie i planować zadania w sposób autonomiczny.
Model może korzystać z zewnętrznych narzędzi, takich jak Google Search czy modele vision-language-action, gdy potrzebuje dodatkowych informacji lub możliwości działania. Według Google DeepMind, Gemini Robotics-ER 1.6 przewyższa zarówno poprzednią wersję 1.5, jak i Gemini 3.0 Flash w kluczowych zadaniach robotycznych.
Gemini Robotics-ER 1.6 wykazuje znaczące ulepszenia w podstawowych zadaniach percepcyjnych. Model lepiej radzi sobie ze wskazywaniem konkretnych obiektów w przestrzeni, precyzyjnym liczeniem elementów oraz oceną, czy zadanie zostało wykonane pomyślnie. Te zdolności stanowią fundament dla bardziej zaawansowanych operacji robotycznych.
Szczególnie imponujące są możliwości rozpoznawania wzrokowego. Robot może teraz analizować złożone sceny wizualne, identyfikować kluczowe elementy i podejmować decyzje na podstawie tego, co "widzi" w swoim otoczeniu.
Kluczowym osiągnięciem nowej wersji jest zdolność do odczytu instrumentów pomiarowych, opracowana we współpracy z Boston Dynamics. Model łączy kilka zaawansowanych technik: powiększa obraz, aby wychwycić drobne szczegóły na wyświetlaczach, wykorzystuje funkcje wskazywania i kod do obliczania proporcji oraz skalowania odległości, a następnie stosuje wiedzę o świecie do interpretacji odczytów.
Robot Spot firmy Boston Dynamics już wykorzystuje tę funkcjonalność do przeprowadzania inspekcji systemów przemysłowych, co pokazuje praktyczne zastosowanie nowych możliwości w rzeczywistych warunkach pracy.
Google DeepMind udostępnił model deweloperom przez Gemini API i Google AI Studio. Firma przygotowała również przykłady implementacji w Colab, co ma ułatwić programistom eksperymentowanie z nowymi funkcjami i integrację ich z własnymi projektami robotycznymi.
Gemini Robotics-ER 1.6 reprezentuje znaczący krok naprzód w rozwoju inteligentnych robotów, łącząc zaawansowane przetwarzanie wizualne z praktycznymi możliwościami działania w rzeczywistym świecie.

Alibaba wypuściła Qwen 3.8, pierwszy multimodalny model z ponad bilionem parametrów. Otwarte wagi mają zakłócić strategię Moonshot AI przed planowanym IPO.

Google zaprezentował Gemini 3.6 Flash, Flash-Lite 3.5 i Flash Cyber 3.5. Nowe modele są bardziej efektywne kosztowo i zoptymalizowane pod agenty AI.

Sony Music Entertainment złożył pozew przeciwko generatorowi muzyki AI Udio za naruszenie praw autorskich do ponad 30 tys. utworów, w tym hitów Beyoncé i Harry'ego Stylesa.