تکناو
TEKNAV

سخت‌افزار

ربات انسان‌نما در ۲۰۲۶: مقایسه Figure 03 و تسلا اپتیموس — قیمت، توانایی‌ها و آینده

عبور از شبیه‌سازی به واقعیت؛ چطور مدل‌های VLA و World Models باعث جان گرفتن ماشین‌ها در سال ۱۴۰۵ شدند.

پاسخ کوتاه: ربات انسان‌نما ماشینی با کالبد شبه‌انسان است که با مدل‌های VLA (بینایی-زبان-عمل) کنترل می‌شود؛ در ۲۰۲۶ دو نمونه پیشتاز — Figure 03 و تسلا اپتیموس نسل ۳ — از دموی آزمایشگاهی به کار واقعی در خطوط تولید رسیده‌اند و قیمت هدف آن‌ها به محدوده یک خودرو نزدیک می‌شود.

در اردیبهشت ۱۴۰۵، رباتیک از مرحله «نمایش‌های آزمایشگاهی» و ویدیوهای فانتزی یوتیوبی خارج شده و به مرحله «تولید در مقیاس صنعتی و حضور واقعی در خانه‌ها» وارد شده است. هوش مصنوعی فیزیکی (Physical AI) با بهره‌گیری از مدل‌های انقلابی VLA (بینایی-زبان-اکشن)، به ربات‌های انسان‌نما اجازه داده است تا جهان را نه به عنوان مجموعه‌ای از پیکسل‌های بی‌روح، بلکه به عنوان محیطی برای تعامل، درک و پیش‌بینی فیزیکی درک کنند.

در این مقاله جامع، به بررسی کالبدشکافی نسل جدید ربات‌های Figure 03، تسلا اپتیموس نسل ۳، مدل‌های جهانی (World Models) و چالش‌های مهندسی در مفاصل و دست‌های رباتیک در سال ۲۰۲۶ می‌پردازیم.

۱. Figure 03: وقتی ربات به حس لامسه و ادراک پوستی مجهز می‌شود

دست رباتیک با ۲۲ درجه آزادی در حال برداشتن قطعه الکترونیکی ظریف — سنسورهای پیزوالکتریک نوک انگشتان ۳ میلی‌گرم تفاوت فشار را حس می‌کنند

شرکت Figure AI با استفاده از داده‌های عظیمی که طی ۱۱ ماه حضور Figure 02 در خط تولید BMW جمع‌آوری کرد، نسخه Figure 03 را در فروردین ۱۴۰۵ روانه بازار کرد. این ربات اولین مدلی است که به جای تکیه صرف بر بینایی ماشین، از یک سیستم بازخورد لمسی (Tactile Feedback) فوق‌پیشرفته در سطح پوست مصنوعی خود استفاده می‌کند.

در Figure 03، نوک انگشتان به سنسورهای پیزوالکتریک با دقت ۳ میلی‌گرم مجهز شده‌اند. این یعنی ربات می‌تواند لغزش یک جسم صیقلی (مثل یک لوله فلزی روغن‌کاری شده) را در لحظه حس کرده و فشار گریپ (Grip) خود را تنظیم کند. این قابلیت، Figure 03 را به گزینه‌ای ایده‌آل برای مونتاژ قطعات حساس الکترونیکی تبدیل کرده است که پیش از این فقط توسط دستان هنرمند انسان قابل انجام بود.

«چالش ما در سال ۱۴۰۳ فقط حرکت دادن ربات بود؛ چالش ما در سال ۱۴۰۵، "فهمیدنِ لمس" و "شهود فیزیکی" است. Figure 03 می‌داند تفاوت فشار بین نگه داشتن یک تخم‌مرغ و یک آچار پیچ‌گوشتی چیست. این درک فیزیکی است که ربات را از یک ماشین خشک به یک همکار واقعی تبدیل می‌کند.» – برت ادکاک، مدیرعامل Figure

در نمودار تعاملی زیر، ساختار توزیع گشتاور در مفاصل و لایه پردازش داده‌های حسگر در ربات‌های نسل جدید را مشاهده می‌کنید. توجه داشته باشید که هر مفصل اکنون دارای یک میکرو-پردازنده اختصاصی برای واکنش‌های میلی‌ثانیه‌ای (Edge Inference) است.

تسلا اپتیموس نسل ۳: ورود به عصر تولید میلیونی و حضور در خانه

نزدیک‌نمای دست مکانیکی ربات انسان‌نما در حال نگه داشتن مدار الکترونیکی
دستان اپتیموس نسل ۳ با ۲۲ درجه آزادی — انگشتان مجهز به سنسورهای پیزوالکتریک می‌توانند فشار لازم برای نگه داشتن یک تخم‌مرغ را از یک آچار تشخیص دهند

ایلان ماسک در گزارش مالی اخیر تسلا تایید کرد که خط تولید "Cortex" در کارخانه فریمونت برای تولید سالانه ۱ میلیون واحد Optimus Gen 3 آماده شده است. این نسخه با دست‌های جدیدی که دارای ۲۲ درجه آزادی (22-DOF) هستند، مرزهای ظرافت حرکتی را جابجا کرده است. در این نسل، تمامی موتورها و تاندون‌ها به داخل ساعد منتقل شده‌اند تا وزن دست کاهش یافته و سرعت واکنش افزایش یابد.

اپتیموس نسل ۳ از تراشه AI5 استفاده می‌کند که قدرت پردازشی آن ۵ برابر نسخه قبلی است. این قدرت اضافی صرف اجرای مدل‌های VLA در لحظه می‌شود. برای اولین بار، ربات می‌تواند دستورات مبهم و چندمرحله‌ای نظیر "برو توی آشپزخانه، اگر ظرف‌ها کثیف هستند آن‌ها را در ماشین ظرفشویی بچین و بعد میز را تمیز کن" را به صورت کاملاً خودمختار و بدون نیاز به اینترنت (Local Inference) انجام دهد.

انقلاب VLA: مدل‌های Vision-Language-Action به ربات اجازه می‌دهند تا شکاف بین ادراک و عمل را پر کند. برخلاف ربات‌های قدیمی که برای هر حرکت نیاز به هزاران خط کدنویسی داشتند، VLA محیط را می‌بیند (Vision)، هدف را به زبان انسانی تحلیل می‌کند (Language) و سپس فرمان‌های حرکتی بهینه را صادر می‌کند (Action).

۲. مدل‌های جهانی (World Models): شهود فیزیکی ماشین

دلیل اصلی پیشرفت ناگهانی رباتیک در سال ۱۴۰۵، تغییر روش آموزش از "تقلید صرف" به "یادگیری قوانین جهان" است. تکنولوژی World Models به ربات اجازه می‌دهد تا یک شبیه‌ساز داخلی از قوانین فیزیک (جاذبه، اصطکاک، جرم) داشته باشد. این ربات‌ها پیش از انجام هر حرکت در دنیای واقعی، آن را میلیون‌ها بار در شبیه‌سازهای فوق‌سریع (مانند NVIDIA Isaac Sim) تمرین می‌کنند تا احتمال خطا را به صفر برسانند.

۳. اقتصادِ رباتیک: قیمت‌گذاری ۲۰ هزار دلاری و تاثیر بر بازار کار

با مقیاس‌پذیری تولید، قیمت نهایی ربات‌های انسان‌نما به محدوده ۲۰ تا ۳۰ هزار دلار رسیده است. این یعنی برای اولین بار در تاریخ، هزینه خرید یک ربات برای یک کارخانه، کمتر از هزینه استخدام نیروی انسانی برای کارهای تکراری در بازه ۳ ساله است. این تحول اقتصادی باعث شده تا در سال جاری، بیش از ۶۰۰ هزار موقعیت شغلی در انبارهای لجستیکی اروپا و آسیا به ربات‌ها واگذار شود.

تکنولوژی "Cortex 2.0" تسلا با استفاده از ۵۰۰ مگاوات توان پردازشی، وظیفه آموزش مداوم ناوگان ربات‌ها را بر اساس ویدیوهای ارسالی از دنیای واقعی (Fleet Learning) بر عهده دارد. این یعنی هرچه یک ربات در ایران یاد می‌گیرد، به تمام ربات‌های تسلا در جهان منتقل می‌شود.

Figure 03 در برابر تسلا اپتیموس نسل ۳

دو پیشتاز این نسل را کنار هم بگذاریم تا تفاوت فلسفه طراحی‌شان روشن شود — یکی محصول یک استارتاپ متمرکز، دیگری ضلعی از یک امپراتوری تولید انبوه:

معیارFigure 03Tesla Optimus نسل ۳
مغز هوش مصنوعیمدل VLA اختصاصی Helixشبکه عصبی مشترک با خودران تسلا (FSD)
میدان آزمون واقعیخطوط لجستیک و تولید شرکای صنعتیکارخانه‌های خود تسلا
مزیت راهبردیچابکی و تمرکز؛ نسل‌های سریع سخت‌افزارزنجیره تأمین و ظرفیت تولید انبوه بی‌رقیب
مسیر قیمتصنعتی، سپس نزول تدریجیهدف اعلامی محدوده قیمت خودرو در تولید انبوه

پیام مشترک هر دو مسیر یکی است: گلوگاه دیگر مکانیک نیست، داده حرکتی است — و هرکه حلقه داده بزرگ‌تری از تعامل واقعی ربات با جهان بسازد، همان بازی داده-محوری را می‌برد که پیش‌تر در مدل‌های زبانی دیدیم.

نتیجه‌گیری: وقتی ماشین‌ها جان می‌گیرند

هوش مصنوعی فیزیکی در سال ۱۴۰۵، آخرین مرز بین دنیای دیجیتال و فیزیکی را از بین برده است. ما در آستانه عصری هستیم که ربات‌ها نه به عنوان ماشین‌های برنامه‌ریزی شده، بلکه به عنوان «همکاران هوشمند» در کنار ما زندگی و کار خواهند کرد. این یک تغییر تمدنی است که نحوه‌ی تولید و خدمات را برای همیشه دگرگون خواهد کرد. تکناو شما را در قلب این انقلاب فیزیکی نگه خواهد داشت.

پرسش‌های پرتکرار

ربات انسان‌نما (Humanoid) چیست؟

رباتی با ساختار دوپا و دست‌های چندمفصله که برای کار در محیط‌های ساخته‌شده برای انسان — کارخانه، انبار، خانه — طراحی شده و به‌جای برنامه‌نویسی صریح، با مدل‌های هوش مصنوعی بینایی-زبان-عمل کنترل می‌شود.

مدل VLA چیست؟

VLA (Vision-Language-Action) خانواده‌ای از مدل‌هاست که تصویر دوربین و دستور زبانی را مستقیماً به فرمان حرکتی تبدیل می‌کند؛ همان معماری که به ربات اجازه می‌دهد «آن جعبه آبی را بردار» را بدون برنامه‌نویسی اختصاصی اجرا کند.

قیمت ربات انسان‌نما در ۲۰۲۶ چقدر است؟

نمونه‌های صنعتی فعلی ده‌ها هزار دلار هزینه دارند و هدف اعلام‌شده سازندگان بزرگ، رساندن قیمت انبوه به محدوده ۲۰ تا ۳۰ هزار دلار — هم‌رده یک خودرو — در نیمه دوم این دهه است.