آیا هوش مصنوعی واقعا استدلال محاسباتی دارد؟

خلاصهٔ داستان (از پادکست «The Joy of Why» منتشرشده در ۲۰ آگوست ۲۰۲۶)

https://castbox.fm/vd/985707408

در پادکست «The Joy of Why» که توسط استیون استروگاتز (Steven Strogatz) و ژانا لون (Janna Levin) با مهمان مهمان اصلی ملانی میچل (Melanie Mitchell، استاد ریاضیات و علوم کامپیوتر در موسسه سانتافه) ضبط شده، موضوع اصلی دقیقاً همون چیزی است که شما پرسیدید:

وقتی یک مدل زبان بزرگ (LLM) به یک سؤال جواب می‌دهد، آیا واقعاً در حال «استدلال» (reasoning) مثل انسان است یا فقط در حال تولید متنی است که شبیه استدلال به نظر می‌رسد؟

ملانی میچل مستقیماً می‌گوید:

«ما روش‌های کافی برای اندازه‌گیری حسیات ماشین نداریم و AI یک نوع «هوش بیگانه» (alien intelligence) است که از مکانیسم‌های شناختی غیرانسانی استفاده می‌کند.»

او به روانشناسان و روانشناسان حیوانی و نوزادان اشاره می‌کند که چطور با روش‌های روانشناختیِ استاندارد (مثل تست‌های generalization، کنترل آزمایش‌های دقیق و بررسی failure types) می‌توانند «هوش» موجودات دیگر را ارزیابی کنند و می‌گوید همین روش‌ها را می‌توان به AI هم اعمال کرد.

در قسمت پایانی پادکست، داستان معروف کلِور هانس (Clever Hans) — اسبِ جادوگرِ اوایل قرن ۲۰ در آلمان — به عنوان یک «تالِ داستان هشدار» آورده می‌شود:

اسبی که می‌توانست جمع و تفریق و عملیات ریاضی را انجام دهد، اما در واقعیت فقط با خواندن میکرو-بیان‌های ناخودآگاه انسان (face cues) حرف می‌زد! وقتی صاحبش سؤال‌های بدون پاسخ را می‌پرسید، اسب اشتباه می‌کرد.

این داستان دقیقاً نشان می‌دهد که چطور می‌توانیم هوش واقعی را با هوش ظاهری اشتباه بگیریم.

شش اصل کلیدی برای ارزیابی بهتر حسیات ماشین (که ملانی در مقالهٔ جداگانهٔ خود در AI Magazine و در پادکست توضیح داده):

1.  آگاه باشید از تعصبات انسان‌محور (anthropomorphic biases): ما ذاتاً چیزهای صحبت‌کننده را انسانی می‌بینیم.

2.  شواهد را محکم بگیرید (skepticism): آزمایش‌های کنترل و رد فرضیات جایگزین طراحی کنید.

3.  تحریک‌های جدید و متغیر بسازید تا ببینید آیا مهارت به معنای واقعی عمومی‌سازی می‌کند یا فقط روی مثال‌های خاص کار می‌کند.

4.  سیستم‌ها را سیاه‌جعبه نپندارید: از تکنیک‌های interpretability برای بررسی داخل مدل استفاده کنید.

5.  عملکرد را از competence جدا کنید: ببینید مدل واقعاً می‌تواند انجام دهد یا فقط ظاهر می‌کند.

6.  نتایج منفی و انواع شکست را تحلیل کنید: شکست‌ها اغلب اطلاعاتی ارزشمندتر از موفقیت‌های ساده دارند.

در ادامهٔ پادکست هم به پیشرفت‌های اخیر ریاضی که با کمک AI انجام شده اشاره می‌شود و بحث می‌شود که این مدل‌ها چطور می‌توانند ایده‌های جدید بسازند، اما همچنان نیاز به نظارت انسانی دارند.

نتیجه‌گیریٔ ملانی در یک جمله:

«اینکه AI جواب درست می‌دهد، لزوماً به معنای اینکه واقعاً «درک» یا «استدلال» کرده مثل انسان است، نیست. ما نیاز داریم روش‌های علمیِ قوی‌تری برای ارزیابی حسیات واقعی بسازیم، نه فقط امتیاز روی بنچمارک‌های استاندارد.»

اگر می‌خواهید پادکست کامل را گوش دهید (حدود ۵۰ دقیقه، کاملاً رایگان):

•  نسخهٔ Apple Podcasts / Spotify: جستجو کنید «Are We Thinking Correctly About AI Intelligence?»

•  یا ویدیو روی یوتیوب Quanta Magazine (با زیرنویس انگلیسی/فارسی موجود نیست، ولی خود پادکست انگلیسی است).

Screenshot

پاسخی بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *