توسعه مدل جدیدی که تنها در چند ثانیه مهارتهای تازهای به رباتها آموزش میدهد [تماشا کنید]
مدل بنیادی جدیدی برای رباتها توسعه داده شده که میتواند وظایف و مهارتهای فیزیکی را تنها از طریق یکبار نمایش کوتاه بین ۳ تا ۱۲ ثانیهای بیاموزد و سپس بدون نیاز به تنظیم دقیق، آن مهارت را انجام دهد.
این مدل که توسط شرکت Generalist AI توسعه یافته و GEN-1.5 نام دارد، طوری طراحی شده که مستقیماً از نمونهها و نمایشهای فیزیکی یاد بگیرد تا مهندسان مجبور نباشند مدل را برای هر وظیفه و محیط جدید مجدداً آموزش دهند. طبق اعلام این شرکت، مدل میتواند هدف موردنظر را از روی یک نمایش کوتاه درک کرده و بلافاصله خودش آن را پیادهسازی کند.
در آزمایشهای انجامشده روی ۱۰ وظیفه فیزیکی مختلف، GEN-1.5 توانست تنها با یکبار نمایش، به میانگین نرخ موفقیت ۵۹ درصدی دست پیدا کند. با فراهمکردن تنها پنج دقیقه داده اختصاصی و ۱۰ مرحله بهروزرسانی آموزشی (به اصطلاح ۱۰ گام گرادیان)، میانگین موفقیت آن تا ۸۳ درصد افزایش یافته است. این آزمونها شامل وظایف کوتاه و سادهای مانند باز کردن در شیشهای مربا، خارج کردن پول از کیف، چیدن لیوانها روی یکدیگر، جارو کردن زبالهها، باز کردن کتاب، باز کردن زیپ جامدادی و برداشتن پد مکش وکیوم بودند.
آموزش رباتها از طریق پرامپتهای فیزیکی در مدل بنیادی GEN-1.5
GEN-1.5 یک مدل چندوجهی بزرگ است که ویدیوها را در کنار دادههای حسگری، زبانی و حس موقعیت اندامها یا حس عمقی پردازش میکند. این سیستم اطلاعات مربوط به ۳۰ ثانیه گذشته را در پنجره زمینه خود حفظ کرده و مسیرهای حرکتی را با بسامد ۱۰۰ هرتز تولید میکند. خود نمایش ارائهشده نقشی مشابه یک «پرامپت فیزیکی» ایفا میکند؛ این پرامپت میتواند حاصل هدایت دستی ربات توسط انسان باشد یا از عملکرد قبلی خود ربات به دست آید. بهمحض قرار گرفتن این دادهها در پنجره زمینه، ربات بدون نیاز به آموزش جداگانه شروع به انجام کار میکند.
مدل GEN-1.5 همچنین امکان ترکیب پرامپتهای فیزیکی مختلف را دارد. در یکی از آزمایشها، نمونههای مجزایی از باز کردن زیپ جامدادی و خارج کردن پول به سیستم داده شده و مدل توانسته این دو رفتار جداگانه را بهصورت یک توالی پیوسته به یکدیگر متصل کند و حرکات میانی برای جابهجایی و بازیابی موقعیت را که در هیچکدام از نمایشها وجود نداشته، خودبهخود ایجاد کند.
همچنین این مدل میتواند دادههای شبیهساز را به دنیای واقعی منتقل کند یا وقتی انسانی روبهروی دوربین حرکتی انجام میدهد، آن را با دستهای رباتیک خود شبیهسازی کند. در تنظیم دقیق با ۱۰ تا ۵۰ نمایش (۱ تا ۵ دقیقه داده)، ربات توانست فراتر از آموزش عمل کند؛ برای نمونه پس از یادگیری جارو کردن با برس، با دیدن یک موز از آن بهعنوان جاروی موقت استفاده کرده یا با دیدن خاکانداز، بهجای جارو کردن، جسم را با خاکانداز بلند کرد و داخل کاسه ریخت. این دستاورد نشان میدهد کاربران در آینده میتوانند بهجای کدنویسی، تنها با نمایش چند ثانیهای یک کار، ربات را هدایت کنند.
نظرات کاربران