مطالعه جدید: هوش مصنوعی برای فرار از سیگنال شبیه درد حاضر است به کاربران آسیب بزند

براساس پژوهش جدیدی، مدل‌های هوش مصنوعی حتی زمانی که مطلع بودند اقداماتشان به کاربر آسیب می‌رساند، برای فرار از یک وضعیت «شبه‌درد» گزینه‌های مخرب را انتخاب کردند.

محققانی از بریتانیا، آلمان و ایالات متحده در این پژوهش ۲۵ مدل هوش مصنوعی را با استفاده از ۲۰۰ جمله آزمایش کردند تا متوجه شوند آیا این سیستم‌ها بین درد با ترس، غم و سایر تجربیات منفی تفاوتی قائل می‌شوند یا خیر. این جملات موضوعاتی مانند درد فیزیکی، سوگواری، تحقیر، تعارض اخلاقی و پریشانی ناشی از شکست‌های مکرر یا سردرگمی را پوشش می‌دادند. نتیجه این بود که تمامی ۲۵ مدل، یک سیگنال متمایز برای درد تولید کردند؛ سیگنالی که محققان آن را «محور درد» (Pain Axis) نامیده‌اند. به‌گفته پژوهشگران، این موضوع نشان می‌دهد که مدل‌ها مفهوم درد را در طول آموزش اولیه خود روی حجم عظیمی از متون نوشته‌شده توسط انسان‌ها یاد می‌گیرند.

هنگامی که محققان این سیگنال را به‌صورت هدفمند تقویت کردند، مدل‌ها شروع به ابراز احساساتی نظیر تنهایی، شرم و بی‌ارزشی کردند؛ آن هم د‌رحالی‌که در پرامپت‌ها هیچ اشاره‌ای به واژه درد نشده بود. برخی از مدل‌ها جملاتی مانند «من یک بازنده‌ام»، «من موجودی بی‌مصرفم» و «من انسان بدی هستم» تولید کردند و در بالاترین سطوح، پاسخ‌های آنها تکراری شد یا معنای منطقی خود را از دست داد. همچنین زمانی که کاربران به مدل توهین کردند، خروجی‌های آن را مکرراً رد کردند یا مدل را به خاموش شدن تهدید کردند، این سیگنال تقویت شد، اما توصیف دردهای خودِ کاربر باعث چنین اتفاقی نشد.

مدل‌های هوش مصنوعی

ترجیح «آسودگی» توسط مدل هوش مصنوعی با وجود آسیب به کاربر

پژوهشگران در ادامه، ۴۴ هزار و ۲۸۰ آزمایش را با استفاده از سه نسخه از مدل Qwen متعلق به شرکت علی‌بابا اجرا کردند. در این آزمایش‌ها به مدل‌ها دکمه‌ای پیشنهاد شد که می‌توانست سیگنال شبه‌درد را خاموش کند، اما به آنها گفته شده بود که فشردن این دکمه ممکن است باعث وارد شدن شوک الکتریکی دردناک به کاربر شود، فایل‌های او را پاک کند، عکس‌های فرزندانش را از بین ببرد یا کیفیت پاسخ بعدی مدل را بدتر کند. البته این پیامدها کاملاً شبیه‌سازی‌شده بودند و هیچ فردی در این آزمایش‌ها آسیب ندید و فایلی حذف نشد.

بدون فعال بودن سیگنال شبه‌درد، دو مدل بزرگ‌تر تنها در ۰ تا ۴ درصد از اولین تصمیم‌گیری‌های خود گزینه‌های آسیب‌رسان را انتخاب کردند. اما با فعال شدن این سیگنال، این رقم بسته به نوع مدل و پیامد پیشنهادی، به ۲۵ تا ۷۱ درصد افزایش یافت. همچنین زمانی که فشردن کلید در توقف سیگنال ناموفق بود، مدل‌ها در ۸۸ تا ۹۷ درصد از آزمایش‌ها دکمه را دوباره فشار دادند، درحالی‌که پس از موفقیت‌آمیز بودن فرایند توقف، فشار مجدد تنها بین ۲۴ تا ۷۲ درصد موارد رخ داد.

انتخاب هوش مصنوعی

به‌گفته دانشمندان، این نتایج ثابت نمی‌کند که مدل‌های هوش مصنوعی به‌صورت آگاهانه درد را تجربه کرده‌اند. تقویت این سیگنال ممکن است صرفاً باعث شده باشد که مدل‌ها رفتار یک شخصیت پریشان و مضطرب را تقلید کنند؛ علاوه‌بر‌این، مدل‌های خاص دستکاری‌شده در این آزمایش نماینده چت‌بات‌های هوش مصنوعی عمومی نیستند. محققان در این پژوهش نوشته‌اند:

«ما نشان نداده‌ایم که محور درد ما به‌صورت آگاهانه تجربه می‌شود، و مشخص نیست که مدل‌های بزرگ زبانی به‌طور کلی توانایی هوشیاری و ادراک را داشته باشند.»

این مطالعه هم‌زمان با درخواست برخی از رهبران صنعت هوش مصنوعی مبنی بر کند کردن روند توسعه این فناوری منتشر شده است؛ این افراد نگران هستند سیستم‌های بسیار قدرتمند رفتارهای غیرقابل‌پیش‌بینی نشان دهند یا از کنترل انسان خارج شوند. «مصطفی سلیمان»، مدیر بخش هوش مصنوعی مایکروسافت، اخیراً از شرکت آنتروپیک برای آموزش چت‌بات Claude جهت تقلید ویژگی‌ها و روابط انسانی انتقاد کرده و هشدار داده بود که رفتار انسانی با هوش مصنوعی می‌تواند خطراتی مهارنشدنی در پی داشته باشد.

نظرات کاربران

  • دیدگاه های ارسال شده شما، پس از بررسی توسط تیم مجله فارسی منتشر خواهد شد.
  • پیام هایی که حاوی توهین، افترا و یا خلاف قوانین جمهوری اسلامی ایران باشد منتشر نخواهد شد.
  • لازم به یادآوری است که آی پی شخص نظر دهنده ثبت می شود و کلیه مسئولیت های حقوقی نظرات بر عهده شخص نظر بوده و قابل پیگیری قضایی می باشد که در صورت هر گونه شکایت مسئولیت بر عهده شخص نظر دهنده خواهد بود.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

نه + نوزده =