Pięć pytań, na które przemysł inteligencji cielesnej powinien odpowiedzieć po zakończeniu Światowego Kongresu Robotyki 2026

By: mp.weixin.qq.com|2026/08/21 13:36:00
0
Udostępnij
copy
Oceń nas w GoogleOceń nas w Google

Kto nie przyszedł, powinien zobaczyć, a kto przyszedł, nie oglądając, marnuje wizytę.

Autorzy: Bai Shi, Zhou Yongliang, Geek Park

Redakcja: Zhou Yongliang, Li Yuan

19 sierpnia, w powietrzu w Yizhuang w Pekinie unosiła się dziwna ekscytacja, ponieważ to był dzień otwarcia Światowego Kongresu Robotyki 2026. Ponad 300 firm, ponad 2000 eksponatów, prawie wszystko, co przemysł inteligencji cielesnej mógł zaoferować, zostało przeniesione tutaj: duże modele, podmioty, kluczowe komponenty, dane - wszystko, co potrzebne.

W dniu otwarcia, Yushu Technology zadebiutowało na giełdzie, a jego wartość rynkowa w pewnym momencie przekroczyła 400 miliardów juanów, co może być najbliższym dniem „szaleństwa kapitałowego” w chińskim przemyśle robotycznym w ciągu ostatnich dziesięciu lat. W przeszłości firmy robotyczne częściej istniały w laboratoriach, wiadomościach o finansowaniu i filmach demonstracyjnych; jednak debiut Yushu po raz pierwszy ustalił punkt odniesienia dla kapitału w tym wciąż wczesnym etapie.

Oprócz tego, Yun Shenchu Technology weszło w etap przyjęcia lub przeglądu na giełdzie; Zhi Yuan Robotics potwierdziło rozpoczęcie procesu IPO w Hongkongu w lipcu 2026 roku. Gorączka na rynku pierwotnym zaczyna przenikać na rynek wtórny, a inteligencja cielesna nie jest już tylko technologiczną wizją, ale zaczyna być zobowiązana do odpowiedzi na pytania dotyczące przychodów, dostaw, marży i skalowania.

Po przejściu przez cały teren wystawowy, zgodnie z naszymi wcześniejszymi przewidywaniami, w tym roku nie było momentów, które by wszystkich zaskoczyły; więcej było pokazów demonstracyjnych. Yushu nie zaprezentowało właśnie wydanego robota „Superman”, który skacze na wysokość 2 metrów i biega z prędkością 12,66 metra na sekundę; na stoisku więcej było istniejących produktów odblokowujących nowe ruchy; Zhongqing przeniosło ośmiokątną klatkę do sali konferencyjnej, a Weita Power ożywiło to w stylu postaci z drugiego wymiaru... Atmosfera była rzeczywiście żywa, ale niewiele osób mówiło o „przełomowych innowacjach”.

Zamiast kontynuować pytania „kiedy pojawi się cud”, warto zadać kilka bardziej podstawowych pytań: Czy roboty mogą wyglądać tylko jak ludzie? Na jakim etapie znajduje się „uniwersalność” inteligencji cielesnej? Czy dane przekształcają się z biznesu opartego na algorytmach w biznes sprzętowy? Jak daleko posunęły się kluczowe komponenty ukryte w palcach, stawach i silnikach?

Z tymi pytaniami przeszliśmy przez halę wystawową i rozmawialiśmy z wieloma reprezentatywnymi firmami. Nie wszystkie z nich są najlepsze w tworzeniu hałasu, ale każda z nich reprezentuje kluczowe zmiany, które zachodzą w tej dziedzinie: różnicowanie form podmiotów, konkurencja modeli uniwersalnych, rekonstrukcja zamkniętej pętli danych oraz kluczowe komponenty zbliżające się do „ostatniego centymetra”.

Na stoisku Galaxy Universal, roboty w trzech całkowicie różnych formach: kołowe, ciężkie i dwunożne, działają na tej samej podstawowej dużej modelowej inteligencji cielesnej; Weita Power z kolei, zaczynając od rzeczywistych scenariuszy użycia, opracowało swojego pierwszego humanoidalnego robota Vbot ATOM; Zhi Variable w scenariuszu sortowania logistycznego osiągnęło wydajność 1816 sztuk na godzinę, z dokładnością powyżej 98%; Parsini rozszerzyło rozwiązanie technologiczne dotyczące „dotyku” na sieć percepcyjną obejmującą całe ciało...

Inteligencja cielesna wciąż jest na wczesnym etapie, nawet wcześniej niż wielu się spodziewało. Wchodzi w trudniejszy, ale bardziej wartościowy etap; kto potrafi stworzyć zamkniętą pętlę z modeli, podmiotów, komponentów i zdolności inżynieryjnych, ten może stać się prawdziwie wartościową firmą w następnej fazie.

01. Czy roboty mogą wyglądać tylko jak ludzie?

W ciągu ostatnich dwóch lat narracja dotycząca inteligencji cielesnej była silnie zdominowana przez humanoidalne roboty: tańczące, biegające, walczące, maratońskie, wszystkie wydarzenia, które wyszły poza ramy, prawie zawsze miały ludzką formę.

Jednak po obejrzeniu tegorocznego WRC, zauważysz, że koncepcja humanoidalnych robotów wciąż się rozwija, gigantyczne, biomimetyczne, centaury... „wyglądanie jak człowiek” nie ma już tylko jednej standardowej odpowiedzi. Równocześnie, poza humanoidalnymi formami, coraz więcej firm zaczyna projektować roboty na podstawie rzeczywistych zadań. **(Uwaga: wideo można obejrzeć w oryginalnym linku)*

W tym roku na WRC, Yushu rzeczywiście mocno rywalizowało w kategorii humanoidalnej, wprowadzając nowe ruchy walki. G1 walczy w stylu walki, łącząc ciosy, kopnięcia obrotowe i skoki, polegając na bieżącej koordynacji wszystkich stawów; H2 jest większy, z silniejszymi stawami, a jego ciosy i kopnięcia mają większą moc. Gdy oba roboty są obok siebie, widać wyraźnie różnicę między „zwinnością” a „siłą”.

Interakcja z tenisem stołowym również zasługuje na uwagę; robot musi najpierw „zrozumieć” nadchodzącą piłkę, zanim zdecyduje, jak odpowiedzieć, co wymaga więcej niż tylko rutynowego działania, ale także współpracy percepcyjnej i decyzyjnej. Dodając do tego system zdalnego sterowania do walki, ruchy operatora mogą być precyzyjnie odwzorowywane, co w rzeczywistości jest zamkniętą pętlą danych inteligencji cielesnej, którą Yushu buduje.

Jednak najbardziej rzucającym się w oczy robotem jest GD01, trzymetrowy mech, który może zmieniać kształt i przewozić ludzi. Nie jest humanoidalny ani tradycyjny czteronożny, lecz łączy technologię robota z formą wyposażenia, kierując się bezpośrednio w stronę scenariuszy związanych z kulturą i turystyką oraz specjalnymi operacjami.

Na tegorocznym WRC, Vbot Weita Power oficjalnie zaprezentowało humanoidalny terminal inteligencji cielesnej Vbot ATOM i jednocześnie rozpoczęło przedsprzedaż. Warto zauważyć, że nie zaczyna on od prototypu koncepcyjnego, lecz opiera się na już zweryfikowanej definicji produktu, zdolności do masowej produkcji i operacji użytkowników w czteronożnym robocie „Duża Głowa” Vbot.

W maju tego roku, AI robot „Duża Głowa” osiągnął masową produkcję. Do tej pory, produkt ten stał się liderem sprzedaży inteligencji cielesnej w segmencie konsumenckim, realizując 1,26 miliona interakcji z dużym modelem w rzeczywistym świecie, 23,700 kilometrów użytkowania i 131,500 godzin towarzyszenia, a w ciągu ostatnich trzech miesięcy zrealizowano 4 aktualizacje OTA. Dla branży inteligencji cielesnej, znaczenie tych danych nie leży tylko w sprzedaży, ale w tym, że udowadniają, że Vbot wprowadził roboty do życia prawdziwych użytkowników, tworząc zamkniętą pętlę produktu od dostawy, przez feedback użytkowników, po ciągłą iterację.

Na podstawie praktyki „Dużej Głowy”, Vbot ATOM nie przyjął tradycyjnego podejścia do humanoidalnych robotów przemysłowych, lecz zdefiniował formę produktu w odwrotny sposób, zaczynając od scenariuszy życia, takich jak dom, handel detaliczny, przestrzeń publiczna i usługi biurowe. Wysokość 160 cm, rozpiętość ramion 180 cm, długość nóg 95 cm oraz 31 stopni swobody podmiotu decydują o jego zdolności do świadczenia usług zbliżonej do ludzkiej; pokrycie tkaniną, projektowanie interakcji i ciche podeszwy sprawiają, że w środowisku domowym i publicznym wydaje się bardziej przyjazny i łatwiejszy do zaakceptowania przez ludzi.

Na poziomie technologicznym, Vbot zaprezentował również system modeli inteligencji cielesnej „Vbot Embodied Genome” oraz trzy kluczowe modele, które wspierają zrozumienie interakcji, podejmowanie decyzji w modelach świata, ewolucję między podmiotami oraz rzeczywisty zwrot informacji.

Z tego punktu widzenia, przybycie Vbot ATOM oznacza nie tylko rozszerzenie Vbot z czteronożnych robotów do humanoidalnych, ale także wprowadzenie zweryfikowanej zdolności do komercjalizacji do większej przestrzeni życiowej, co przyspiesza moment komercjalizacji humanoidalnych robotów.

Roboty przyszłości będą całkowicie zaprojektowane z myślą o potrzebach domowych, zdolne do wykonywania podstawowych prac domowych, towarzyszenia dzieciom, opieki nad osobami starszymi, pielęgnacji zwierząt itp. Obecnie weszli do ponad 500 płatnych gospodarstw domowych, świadcząc usługi przez ponad 50,000 godzin.

Roboty przyszłości również zaprezentowały swoją zdolność do szybkiej iteracji w scenariuszach domowych; miesiąc temu na WAIC, skoncentrowali się na podstawowych pracach domowych, takich jak pranie, składanie ubrań i przechowywanie, a na WRC rozszerzyli scenariusz na kuchnię: druga generacja całkowicie samodzielnego robota F2, wyposażona w nową generację samouczącego się modelu WAM, samodzielnie przygotowała makaron.

Pełny proces gotowania wymaga od robota wysokiej współpracy, precyzji i zdolności do podejmowania decyzji: wymaga synchronizacji obu ramion z wysoką precyzją; w przypadku operacji z nieodwracalnymi cieczy, polega na natychmiastowej precyzyjnej ocenie ilości; jednocześnie wymaga elastycznego przełączania, chwytania i wymiany różnych narzędzi kuchennych, a także samodzielnego uczenia się, jak odpowiednio smażyć, co nie ma standardowych odpowiedzi. Roboty przyszłości wykazały niesamowitą stabilność podczas ciągłego gotowania na miejscu.

Roboty przyszłości stwierdziły, że przyjęły całkowicie samodzielny rozwój od podmiotu, mózgu do sprzętu, dlatego iteracja w nowych scenariuszach jest szybsza. Oprócz stopniowego rozszerzania się od lekkich prac domowych do ciężkich, ich zrozumienie potrzeb w scenariuszach domowych obejmuje również podstawowe potrzeby dotyczące dzieci, osób starszych i zwierząt, a na miejscu zaprezentowali różne operacje gier planszowych, otwierania napojów, interaktywnych gier oraz współpracy dwóch robotów. Ich silne scenariusze zastosowań i interaktywność sprawiły, że ich stoisko było zawsze pełne ludzi.

Roboty Zhi Variable obecnie koncentrują się na dwóch scenariuszach: domowym i logistycznym. W scenariuszu logistycznym nie używają pełnowymiarowego humanoidalnego robota ani zręcznych rąk, lecz dwie mechaniczne ramiona w połączeniu z zwykłym chwytakiem, aby obsługiwać rzeczywiste paczki o losowych kształtach, wagach i materiałach.

Ich roboty decydują, jak obsługiwać paczki na podstawie ich fizycznych właściwości: małe przedmioty są chwytane bezpośrednio, ciężkie pudełka można popychać, a w przypadku zabawek bez etykiet, takich jak misie, również oceniają dalsze procesy i samodzielnie je obsługują. W poprzednim publicznym transmisji na żywo, ten system działał przez godzinę, osiągając wydajność sortowania 1816 sztuk na godzinę, z dokładnością powyżej 98%.

Zhi Variable podkreśliło w wywiadzie na miejscu, że ich roboty już weszły do rzeczywistego zastosowania: roboty domowe już masowo obsługują gospodarstwa domowe; sortowanie logistyczne również weszło do czołowych firm.

02. Na jakim etapie jest uniwersalność inteligencji cielesnej?

Uniwersalność inteligencji cielesnej, czyli zdolność do wykonywania złożonych zadań przez roboty inteligencji cielesnej w różnych obiektach, środowiskach i poleceniach, a także zdolność do ponownego planowania w nowych scenariuszach.

Pod względem zdolności, inteligencja cielesna już przekroczyła etap „prezentacji pojedynczego ruchu”; teraz zaawansowane roboty mogą wykonywać sekwencje wielu umiejętności, śledzenie stanu, a nawet mogą ponownie planować po doznaniu zakłóceń.

Pod względem inteligencji, uniwersalność robotów inteligencji cielesnej jest oczywiście związana z modelami, a obecnie technologia modeli wciąż nie jest zbieżna. Główne firmy rozwijają różne podejścia, takie jak model VLA (wzrok - język - ruch) end-to-end, model WAM (model ruchu świata), hierarchiczne systemy operacyjne inteligencji cielesnej oraz podstawowe modele inteligencji cielesnej między podmiotami.

Wśród nich, przedstawicielami modelu end-to-end VLA/WAM są Galaxy Universal, Qianxun Intelligent i Future Not Far. Wspólnym punktem tego podejścia jest maksymalne włączenie wzroku, języka, ruchu i części prognoz stanu do jednego modelu lub reprezentacji.

Na WRC Galaxy Universal zaprezentowało humanoidalnego robota Galbot ET1 „Galaxy·Star Boy”, który wykorzystuje umiejętności interakcji agenta do bezpośredniego obserwowania ruchów ludzi, a następnie naśladowania tańca i dynamicznych ruchów w czasie rzeczywistym. Zintegrował również „LATENT” - wysokodynamikę sieci tenisowej do nauki ruchu, co pozwala na trening tenisowy z prawdziwymi ludźmi.

AstraBrain WBC, model podstawowy małego mózgu w systemie Galaktycznego Mózgu, wspiera ET1 w realistycznym naśladowaniu tańca i gry w tenisa oraz innych ciągłych, ludzkich ruchów.

Mówiąc konkretnie, tancerz podaje nowe ruchy, a ET1 rozpoznaje wizualnie i wyodrębnia rzeczywisty tor ruchu człowieka, a następnie mapuje te ruchy na swoje ciało. To prawdziwe naśladowanie w czasie rzeczywistym, a nie odtwarzanie z wcześniej zaprogramowanej bazy ruchów.

Galaktyczna Uniwersalność obecnie dysponuje humanoidalnym robotem Galbot ET1 oraz różnymi formami robotów, takimi jak Galbot G1, S1 itd. Podkreśla, że "jedno mózgowe połączenie przekracza różne ciała, zadania i scenariusze". Te roboty mają swoje zastosowania w domach, handlu detalicznym i przemyśle, ale dzielą tę samą bazę inteligencji cielesnej. Różne formy robotów mają swoje systemy kontroli ruchu, ale zdolności percepcyjne, rozumienie zadań, modelowanie świata i planowanie działań są wspólne.

Galaktyczna Uniwersalność w wywiadzie wspomniała, że w przeszłości roboty wchodziły w nowy scenariusz, często wymagając ponownego zbierania danych i ponownego szkolenia; teraz ta sama baza modelowa zaczyna być używana w różnych ciałach i zadaniach. Dzięki niewielkiej ilości danych do adaptacji, roboty na kołach mogą być używane, roboty przeładunkowe mogą być używane, a po przełączeniu na humanoidalne, mózg nie musi być ponownie trenowany od podstaw.

W niedalekiej przyszłości, na podstawie AVLA, zbudowany zostanie wizualny, językowy i ruchowy zamknięty krąg, a na tej podstawie wprowadzony zostanie Self-Evolving WAM (samowzmacniający model ruchu świata), który pozwoli robotom nie tylko rozumieć i wykonywać zadania, ale także przewidywać wyniki ruchów i wykorzystywać dane z rzeczywistych domów do ciągłej iteracji modelu.

Przykładowo, w scenariuszu prania, jego model, po przeszkoleniu na podstawie dziesiątek modeli pralek, już potrafi generalizować do setek różnych typów, sposobów otwierania drzwi i typów przycisków. Podobna zdolność generalizacji dotyczy odzieży, zabawek i innych przedmiotów domowych, co pozwala robotom na wykonywanie dynamicznych zadań w różnych środowiskach domowych.

Zmienna podkreśla uniwersalność swojego modelu WALL-B: w dwóch bardzo różnych scenariuszach, usług domowych i sortowania logistycznego, działa ten sam model. WALL-B łączy wizję, język, dotyk, ruch i prognozowanie fizyczne w jednolitą sieć, pozwalając robotom rozumieć prawa fizyki, takie jak grawitacja, inercja i tarcie, oraz przewidywać wyniki ruchów.

Reprezentacyjne badania nad warstwową inteligencją cielesną obejmują dynamikę COSA.

COSA 0.5 dzieli mózg robota na trzy warstwy: System 2 odpowiada za rozumienie scenariuszy, pamięć, wnioskowanie i harmonogram zadań, System 1 wywołuje umiejętności operacyjne, takie jak VLA, a System 0 kontroluje ruch całego ciała z częstotliwością do 1000 Hz.

Jednym z przedstawicieli podstawowego modelu cielesnego, który przekracza różne ciała, jest G0.5. Na miejscu WRC, R1 Lite z G0.5 wykonuje zadania wymagające zrozumienia środowiska, rozkładu zadań, operacji dwiema rękami i odzyskiwania w przypadku nieprawidłowości podczas ruchu. G0.5 poprzez jednolitą kodowanie ruchu pozwala na dostosowanie tego samego modelu do różnych robotów.

Qianxun Intelligent wykorzystuje swojego Moz1 do wyzwań długodystansowych, takich jak "sprzątanie restauracji". Po otrzymaniu polecenia robot musi wykonać szereg działań: obejrzeć otoczenie, wziąć napój, przejść do lodówki, otworzyć drzwi, włożyć napój, zamknąć drzwi, a następnie dostarczyć brudne naczynia do zmywarki; jeśli cel zostanie usunięty, zasłonięty lub jeśli uporządkowane środowisko zostanie ponownie zakłócone, robot ponownie zrozumie i zaplanuje.

W kontekście zastosowań, pozwolenie robotom na wchodzenie do domów i przestrzeni publicznych, aby wykonywały złożone zadania, wciąż jest na stosunkowo niskim poziomie, zwłaszcza w przypadku interakcji z ludźmi, gdzie bezpieczeństwo jest kluczowe. Jednak w fabrykach, magazynach i innych stosunkowo zamkniętych scenariuszach, roboty już potrafią wykonywać stosunkowo złożone długodystansowe zadania.

Na przykład, Star Motion Era's Star Motion M7 w miejscu zdarzenia wykonuje działania takie jak rozpoznawanie losowych paczek, chwytanie, obracanie etykiet i wprowadzanie ich do linii transportowej; ta zdolność została już wdrożona w centrach logistycznych, takich jak China Post, osiągając maksymalnie 1200 sztuk na godzinę.

Uniwersalne zdolności inteligencji cielesnej i zdolności w specyficznych scenariuszach nie wykluczają się nawzajem; roboty w rzeczywistych, specyficznych scenariuszach dostosowują się do różnych niestandardowych operacji i mogą stabilnie działać, co w rzeczywistości może wspierać poprawę uniwersalnych zdolności.

Ponadto, wysiłki różnych firm w zakresie ewolucji modeli postępują od pojedynczych umiejętności w kierunku przekraczania ciał, długodystansowych zadań i generalizacji w dynamicznych środowiskach.

03. Czy inteligencja cielesna staje się biznesem sprzętowym?

Niezależnie od uniwersalnych zdolności inteligencji cielesnej, czy zdolności w specyficznych scenariuszach, modele wymagają dużej ilości wysokiej jakości danych.

Zbieranie danych przez roboty, obecnie dominujące metody to zdalne sterowanie, UMI bez ciała i rękawice danych, zbieranie danych z pierwszej perspektywy i śledzenie ruchu, zbieranie danych z rzeczywistych ciał itp. Prawie każda z tych metod wiąże się ze sprzętem, a niektórzy żartują, że zbieranie danych dla inteligencji cielesnej staje się biznesem sprzętowym.

W rzeczywistości znaczenie danych nie leży w samych danych, ale w modelu, w inteligencji. Tylko gdy dane są wystarczająco liczne, wystarczająco wysokiej jakości, mogą wspierać ewolucję modelu i tworzyć zamknięty krąg danych oraz koło danych w scenariuszu, ich znaczenie naprawdę się ujawnia.

Lightwheel Intelligent jest jedną z wiodących firm w dziedzinie niezależnych danych inteligencji cielesnej, koncentrując się na danych z pierwszej perspektywy, symulacji fizycznej, masowej ocenie i sprzężeniu zwrotnym z rzeczywistych maszyn, budując zamknięty krąg danych Real2Sim2Real.

Na WRC, Lightwheel Intelligent szczególnie zaprezentowało system symulacji SimFoundry i system oceny RoboFinals. SimFoundry zwiększa dokładność symulacji dla elastycznych obiektów, takich jak odzież i kable, poprzez pomiar parametrów rzeczywistych obiektów i własny solver fizyczny; RoboFinals służy do masowego testowania i oceny modeli robotów, pozwalając modelom przejść systemową weryfikację przed wejściem do rzeczywistych scenariuszy.

Zdalne sterowanie, UMI, śledzenie ruchu to metody pozyskiwania wysokiej jakości danych skoncentrowane na człowieku, ale ich koszty są nadal zbyt wysokie, aby spełnić potrzeby modeli dotyczące ilości danych.

Istnieje wiele innych sposobów pozyskiwania danych cielesnych, takich jak dane wideo, dane z gier oraz modele świata, które zyskały popularność w ostatnich 1-2 latach.

Excellent Vision podąża ścieżką modeli świata, traktując modele świata jako "wzmacniacze danych". GigaWorld prognozuje zmiany w środowisku na podstawie ruchów robotów, masowo generując dane interakcji potrzebne do treningu i testów; GigaWorld-1 dodatkowo wprowadza modelowanie ruchu i szacowanie parametrów fizycznych, zwiększając wiarygodność symulacji operacji, takich jak chwytanie i kolizje.

Dlatego dane nie są jedynie biznesem sprzętowym, ale mają wiele typów i form. Co więcej, w porównaniu do samego zbierania danych, dostarczanie danych dla modeli, dla inteligencji cielesnej, może przynieść większe korzyści, tworząc koło danych, co jest trudne do osiągnięcia dla pojedynczych firm skoncentrowanych na zbieraniu danych cielesnych.

Aby stworzyć zamknięty krąg danych i koło danych, konieczne jest wejście w konkretne scenariusze, współpraca z robotami i iteracja oraz optymalizacja modeli na podstawie danych generowanych w rzeczywistości.

Na przykład, Galaktyczna Uniwersalność zbudowała bazę danych "Galaktyczne Dane (AstraData)", która łączy dane z internetu, dane z zachowań ludzkich, dane syntetyczne z symulacji, zdalne sterowanie z rzeczywistych maszyn i dane zwrotne z rzeczywistych scenariuszy do treningu modeli, a także włącza walidację scenariuszy i optymalizację zwrotną w zamknięty krąg. Jej uniwersalny model mózgowy AstraBrain-WBC 0.5 wykorzystuje około 20 000 godzin, 2 miliardy klatek danych ruchów ludzkich do treningu, a po optymalizacji inżynieryjnej opóźnienie wnioskowania wynosi mniej niż 1,5 milisekundy, a całkowite opóźnienie łańcucha śledzenia ruchu wynosi mniej niż 20 milisekund.

Zbieranie danych 2.0 firmy Zhiyuan Robot opiera się na ponad 430 rzeczywistych scenariuszach, budując piramidę danych z rzeczywistych maszyn, bez ciała i danych z wielu źródeł, a także umieszczając ocenę modeli, wdrażanie scenariuszy, testy dostosowawcze w rzeczywistości i dane zwrotne w tym samym systemie.

Co więcej, są zagraniczne startupy, które w środowisku fabrycznym pozwalają pracownikom na bieżąco korygować roboty, a następnie włączać nowe zachowania do procesu i zbierać dane do dalszego szkolenia modeli cielesnych.

Galaktyczna Uniwersalność, Zhiyuan Robot i inne chińskie firmy również postępują w tym kierunku, a przyszłym wspólnym trendem danych cielesnych może być: zbieranie danych przechodzi od "centralnych fabryk zbierania danych" do "robotów wdrożonych w terenie".

04. Jak daleko posunęły się kluczowe komponenty?

Zwinne ręce, percepcja dotykowa, percepcja wizualna, silniki, stawy - postęp kluczowych komponentów często lepiej pokazuje, jak branża naprawdę posunęła się naprzód. W dziedzinie kluczowych komponentów inteligencji cielesnej najważniejsze są precyzyjne operacje i percepcja, a w percepcji najważniejsza jest percepcja dotykowa i wizualna.

Zwinne ręce są kluczowe dla robotów wykonujących precyzyjne operacje. Na przykład, Lingxin Qiaoshou pokazuje przypadek "złożenia zwinnej ręki przez zwinne ręce": robot, wykorzystując rozpoznawanie wizualne, współpracę obu rąk i precyzyjną kontrolę siły, wykonuje chwytanie i montaż komponentów w ciasnej przestrzeni, przesuwając zwinne ręce od chwytania do precyzyjnych operacji przemysłowych.

Jednocześnie Lingxin Qiaoshou nieustannie poprawia zdolności modelu. Informuje nas, że obecnie w stosunkowo jasno określonych scenariuszach, takich jak supermarkety, fabryki i logistyka, można osiągnąć pewien stopień generalizacji dla różnych narzędzi i procesów, ale przejście do całkowicie różnych scenariuszy wciąż wymaga dalszej nauki.

Lingxin Qiaoshou również angażuje się w dane cielesne, system Open TeleDex może jednocześnie zbierać dane wizualne, dotykowe i proprioceptywne do treningu modeli precyzyjnych operacji. Podsumowuje idealne zwinne ręce jako "muszą mieć ludzką rękę i ludzką małą głowę": ostatecznie muszą nie tylko chwytać różne obiekty, ale także rozumieć i używać różnych narzędzi.

Core Competence firmy Paksini to percepcja dotykowa. Wykorzystuje własny chip do percepcji dotykowej 6D, a tym razem Paksini zaprezentowało również wielowymiarowy czujnik dotykowy PX-FOOTRIX oraz czwarte pokolenie produktów dotykowych opartych na chipie GEN4 FUSE, obejmujących chwytaki, elektroniczną skórę całego ciała itp., co dalej rozszerza percepcję na całe ciało.

Za tym wszystkim stoi pełne badania Paksini w zakresie projektowania strukturalnego, systemów sprzętowych i modeli algorytmicznych. Na tej podstawie Paksini zbudowało kompletny łańcuch od zbierania sygnałów percepcji dotykowej do wyjścia siły 3D i 6D, co pozwala robotom uzyskać stabilne, powtarzalne i mierzalne informacje o dotyku siły.

Zastosowanie dotyku wraca do działania, a Pacini na żywo zaprezentował humanoidalnego robota, który samodzielnie montuje małego konika, korzystając z wzroku i dotyku: najpierw rozpoznaje różne kształty części, a następnie ocenia stabilność chwytu i poprawność montażu na podstawie stanu kontaktu, dynamicznie dostosowując siłę.

Pacini rozszerzył również zastosowanie dotyku na zbieranie danych. Rękawica PXCap Pro może jednocześnie zbierać dane wzrokowe, dotykowe i dotyczące postawy dłoni, a ta sama demonstracja ludzka jest mapowana na różne zwinne ręce, co umożliwia "jedno zbieranie, wiele zastosowań".

Pacini włączył również dane dotykowe do bazy danych OmniSharing DB, która zawiera dziesiątki miliardów danych multimodalnych, używanych do treningu modeli ciała, razem z danymi wizualnymi, trajektoriami, postawami, głosem i tekstem. Szczególnie interesujące są dane dotykowe wielowymiarowe, które mogą rejestrować siłę i zmiany stanu podczas kontaktu człowieka z obiektem.

W zakresie percepcji wzrokowej, Obsidian Light zaprezentował serię kamer 3D Gemini 330 z podwójnym obiektywem, wyposażoną w autorską chip MX6800 do głębi; najnowszy produkt wizji robotycznej Physis, zaprojektowany specjalnie dla humanoidalnych robotów i współpracujących ramion robotycznych, które wymagają długotrwałej pracy, oferuje zdolności percepcyjne zbliżone do ludzkich, osiągając doskonałą równowagę między szerokim polem widzenia, wysoką jakością obrazu, rzeczywistym postrzeganiem przestrzeni i wysoką niezawodnością.

Jednocześnie Obsidian Light rozszerzył swoje możliwości wizualne na zbieranie danych ciała, wprowadzając platformę zbierania danych bez ciała, która obejmuje cztery formy: EGO, UMi, Wrsicam i Hub w tym samym systemie: EGO rejestruje perspektywę pierwszej osoby, WristCam zbiera bliskie ujęcia nadgarstka, UMI uzupełnia interakcje rąk z obiektami, tworząc wieloperspektywny łańcuch danych do nauki przez naśladowanie i trening modeli świata.

Zwinne ręce, percepcja wzrokowa i inne zdolności percepcyjne są kluczowe, ponieważ stanowią ostatni centymetr, w którym inteligencja cielesna naprawdę się realizuje. Nawet jeśli model jest bardzo inteligentny, bez dobrych zwinnych rąk robot nie będzie w stanie wykonać precyzyjnych operacji jak człowiek, a bez percepcji robot staje się ślepy, nie wiedząc, co robić.

Obserwujemy również, że firmy zajmujące się zwinnością rąk i percepcją, angażują się w zbieranie danych dotyczących inteligencji cielesnej, co pokazuje, jak bardzo cały sektor inteligencji cielesnej pragnie danych.

05. Na jakim etapie rozwoju znajduje się branża?

Fala zainteresowania inteligencją cielesną przypomina sytuację sprzed dziesięciu lat w dziedzinie wizji komputerowej i autonomicznego prowadzenia pojazdów. Wówczas rynek również wierzył, że technologia szybko się upowszechni w ciągu kilku lat, ale istniała znaczna przepaść między możliwościami laboratoryjnymi a stabilnymi, niskokosztowymi produktami gotowymi do masowej produkcji.

Autonomiczne prowadzenie pojazdów zajęło ponad dziesięć lat, aby rozpocząć działalność komercyjną Robotaxi w kilku miastach i regionach. Choć to nie dowodzi, że inteligencja cielesna powtórzy ten sam proces, wskazuje na pewną regułę:

Fale technologiczne często prowadzą do przeszacowania szybkości wdrażania w krótkim okresie, ale mogą niedoszacować długoterminowego wpływu na przemysł.

Inteligencja cielesna wciąż znajduje się na wczesnym etapie przechodzenia od weryfikacji prototypów do weryfikacji produktów. W nadchodzących latach może najpierw zrealizować się w zorganizowanych scenariuszach, takich jak fabryki, logistyka, inspekcje i usługi komercyjne, a prawdziwe wejście do domów i codziennego życia zajmie więcej czasu. Ponieważ inteligencja cielesna jest połączeniem sprzętu i oprogramowania oraz jest systemowym inżynierią o długim łańcuchu przemysłowym, przełomy w pojedynczych dziedzinach są trudne do szybkiego postępu całej branży.

Z drugiej strony, Chiny mają stosunkowo kompletny łańcuch dostaw robotów, zdolności produkcyjne, inżynieryjnych talentów i wiele rzeczywistych scenariuszy, co może skrócić cykle prób produkcyjnych, obniżenie kosztów, wdrażanie scenariuszy, pozyskiwanie danych i iterację produktów.

Te warunki nie gwarantują, że jakaś firma lub ścieżka odniesie sukces, ale mogą pozwolić Chinom na ciągłe wprowadzanie robotów do rzeczywistych scenariuszy, realizując weryfikację technologiczną, inżynieryjną i komercyjną.

Fala zainteresowania w końcu ustąpi, a inteligencja cielesna wejdzie do życia zwykłych ludzi, co może zająć więcej czasu, niż rynek oczekuje, ale gdy roboty naprawdę zaczną pracować w fabrykach, magazynach i domach, historia inteligencji cielesnej dopiero się zaczyna.

Cena --

--
--
--

Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.

Możesz również polubić

iconiconiconiconiconiconiconicon
Obsługa klienta:@weikecs
Współpraca biznesowa:@weikecs
Quant trading i MM:[email protected]
Program VIP:[email protected]