فریب نخورید—مدل‌های زبانی بزرگ استدلال نمی‌کنند

مدل‌های زبانی بزرگ استدلال واقعی انجام نمی‌دهند، بلکه صرفاً با اتکا به شهود آماری دست به پیش‌بینی توکن بعدی می‌زنند. برای حل مسائل حیاتی در علم و پزشکی، هوش مصنوعی باید فراتر از افزایش مقیاس مدل‌ها رفته و همانند معماری آلفاگو به سازوکار جستجو، حالت‌های معرفتی صریح و فرایند تجدیدنظر در باورها مجهز شود.

۷ دقیقه مطالعهنویسندهalireza mohseni(CTO)

ده سال پس از رویارویی آلفاگو با لی سدول، قهرمان بازی گو، هوش مصنوعی امروزی هنوز به سازوکاری که آن پیروزی را رقم زد متوسل نشده است.

نوشته: توره گرِیپِل (Thore Graepel)

۱۰ مهر ۱۴۰۵ — ام‌آی‌تی تکنولوژی ریویو (MIT Technology Review)

یادداشت: این پست توسط ماشین ترجمه شده و بازتاب‌دهنده نظرات شخصی توره گرِیپِل (استاد دانشگاه UCL و عضو سابق تیم آلفاگو) است. نسخه اصلی انگلیسی مقاله را می‌توانید از اینجا مطالعه کنید.

در بعدازظهری از ماه مارس ۲۰۱۶ در سئول، تماشا می‌کردم برنامه‌ای که خودم در ساخت آن مشارکت داشتم، مهره‌ای را در خط پنجم صفحه گو قرار داد؛ حرکتی که در نگاه نخست، شبیه به پیشکشی نسنجیده به رقیب انسانی‌اش به نظر می‌رسید. حرکت شماره ۳۷ در بازی دوم از این نبرد پنج‌گانه چنان بیهوده به چشم می‌آمد که برخی مفسران پنداشتند ناشی از یک خطای نرم‌افزاری است.

اما این‌طور نبود. آلفاگو آن بازی را برد و در نهایت با نتیجه ۴ بر ۱ بر لی سدول—یکی از برجسته‌ترین بازیکنان تاریخ گو—پیروز شد. لی سدول پس از مسابقه گفت: «تصور می‌کردم آلفاگو مبتنی بر محاسبات احتمالاتی است و صرفاً یک ماشین محسوب می‌شود، اما با دیدن این حرکت نظرم عوض شد. آلفاگو بی‌تردید خلاق است.»

هنگامی که دیپ بلو (Deep Blue) در سال ۱۹۹۷ گری کاسپاروف، قهرمان وقت شطرنج جهان را شکست داد، این کار را از طریق بررسی شش تا هشت حرکت جلوتر برای هر بازیکن و ارزیابی ۲۰۰ میلیون موقعیت در ثانیه، بر پایه قواعدی انجام داد که مستقیماً توسط انسان‌ها کدنویسی شده بودند. اما گو بازی به‌مراتب پیچیده‌تری است؛ ارزش یک سنگ‌مهره به چگونگی شکل‌گیری دسته‌ها و قلمروهای دوردست در طول ده‌ها حرکت آینده بستگی دارد. محاسبه حتی کسری از پیامدهای احتمالی در گو، برای یک ابررایانه میلیاردها سال زمان می‌برد. آلفاگو برای پیروزی ناچار بود وضعیت برتری را در یک نگاه درک کند و حتی دست به ابداع حرکاتی بزند که هیچ انسانی تا آن روز به بازی با آن‌ها فکر نکرده بود.

به همین دلیل است که بسیاری از روایت‌های نبرد آلفاگو با لی سدول، حرکت ۳۷ را جرقه‌ای از شهود ناب ماشینی توصیف می‌کنند؛ با این حال، چنین برداشتی خطاست. در حقیقت، این «توان استدلال» آلفاگو بود که به این انتخاب خلاقانه انجامید—توانی که هوش مصنوعی امروزی فاقد آن است. اگر انتظار داریم سیستم‌های هوش مصنوعی آینده دستاوردهایی قابل‌اتکا و بینش‌هایی واقعاً نوین در حوزه‌هایی مانند علم و پزشکی تولید کنند، باید آن‌ها را به قابلیت‌های استدلالی اصیلی از همین جنس مجهز کنیم.

آلفاگو از دو سیستم تشکیل شده است: بخش نخست، شبکه سیاست (Policy Network) آن است که آموزش دیده بود پیش‌بینی کند یک بازیکن ماهر انسانی چه حرکتی انجام می‌دهد. این بخش «شهودی»، حرکت ۳۷ را گزینه‌ای نامحتمل می‌دید؛ حرکتی با احتمال وقوع تقریبی ۱ در ۱۰۰۰۰ توسط یک بازیکن خبره انسان. اما آنچه سبب شد آلفاگو این حرکت را انتخاب کند، سازوکار جستجوی آن بود؛ سامانه‌ای که فراتر از معقولیتِ ظاهری و آنی گام برداشت و پیامدهای بلندمدت گزینه‌ها را سبک‌سنگین کرد. این سیستم به‌طور صریح یک «درخت بازی» با هزاران شاخه تشکیل داد که هر یک نمایانگر آینده‌ای محتمل بودند و در آن به کاوش پرداخت.

نظریه‌ای سرشناس در علوم رفتاری که توسط دانیل کانمن تثبیت شد، میان دو حالت تفکر انسان تفاوت قائل می‌شود: سیستم ۱ سریع، شهودی و کم‌زحمت است؛ و سیستم ۲ کند، گام‌به‌گام و مبتنی بر تأمل. آلفاگو معادلی ماشینی و درخشان از این تفکیک ارائه داد: شبکه‌های عصبی آن نقش حدس‌ها را تأمین می‌کردند—«این حرکت نویدبخش است»، «این وضعیت برد است»—و سیستم جستجوی آن، تأمل را به نمایش می‌گذاشت؛ یعنی آن حدس‌ها را در برابر سلسله حرکات و پاسخ‌های متقابل بعدی می‌آزمود. درست همانند شناخت انسانی، هیچ‌کدام از این دو نیمه به‌تنهایی کارایی ندارند: شهودِ صِرف هرگز حرکت ۳۷ را انتخاب نمی‌کرد، و جستجوی کورکورانه (Brute-force) نیز توان غربال‌گری میان آن حجم عظیم از احتمالات را نداشت.

این رویه، تفاوت بنیادینی با نحوه کار مدل‌های هوش مصنوعی امروزی دارد. یک مدل زبانی بزرگ، صرفاً توکن بعدی را پشت سر هم پیش‌بینی می‌کند. این رفتار مصداق بارزِ «سیستم ۱ در عمل» است: سریع، تداعی‌گرا، و به‌طرز شگفت‌انگیزی ماهر در تکمیل الگو (Pattern Completion) در تقریباً تمام حوزه‌هایی که انسان درباره‌شان نوشته است.

اندکی پس از عرضه ChatGPT، جامعه متخصصان دریافت که تسلط زبانی و شیوایی متن به‌تنهایی با کارآمدی و درک واقعی فاصله دارد. راه‌حل به‌ظاهر منطقی، سوق دادن مدل‌ها به سوی تفکر گام‌به‌گام بود: مدل‌ها اکنون به جای پاسخ‌دهی شتاب‌زده، مراحل میانی تولید می‌کنند که مسئله را تجزیه کرده، نتایج مقطعی را به پیش می‌برد و بر استنتاج‌های بعدی اثر می‌گذارد—فرایندی که تحت عنوان «زنجیره تفکر» (Chain of Thought) شناخته می‌شود.

دستاوردهای این روش ملموس و واقعی بوده‌اند، به‌ویژه در ریاضیات و برنامه‌نویسی. اما بر خلاف الگوریتم جستجوی آلفاگو، زنجیره تفکر مکانیسم استدلالی مستقلی ایجاد نمی‌کند؛ این استدلال‌های میانی همچنان محصول همان فرایند پیش‌بینی توکن بعدی هستند، با این تفاوت که پیش از اعلام خروجی نهایی، تکرار بیشتری صورت می‌گیرد.

سه نقص ساختاری مانع از آن می‌شود که خروجی چت‌بات‌ها مصداق واقعی «استدلال» (آن‌گونه که در جامعه علمی پذیرفته شده است) باشد:

۱. نخست اینکه، این مدل‌ها فاقد یک حالت معرفتیِ (Epistemic State) پایدار، صریح و قابل‌وارسی هستند. هیچ دفتر ثبت بازی وجود ندارد که فرضیاتِ در حال بررسی مدل، میزان اطمینان آن به فرضیات گوناگون، شواهد مورد ارزیابی، و پرسش‌های بلاتکلیف را نگهداری کند؛ مواردی که با ورود داده‌های تازه باید به‌طور نظام‌مند بازنگری شوند.

۲. دوم اینکه، مرزبندی شفافی میان «پایگاه دانش سیستم» و «سازوکار دستکاری و استنتاج روی آن دانش» وجود ندارد. دانش و فرایند استدلال درون وزن‌های شبکه عصبی به‌شکلی غیرقابل‌تفکیک درهم‌تنیده‌اند؛ ازاین‌رو هیچ مجموعه‌ای مستقل و صریح از باورها بازنمایی نمی‌شود.

۳. سوم اینکه، هرچند زنجیره‌های تفکر چت‌بات‌ها ظاهری شبیه به استدلال و تأمل دارند، اما پژوهش‌ها نشان داده است که مدل‌ها اغلب دست به «دلیل‌تراشی پسینی» (Post-hoc concoction) می‌زنند؛ بدین معنا که از یک مسیر به پاسخ رسیده‌اند، اما در گزارش خروجی، مسیر دیگری را بازگو می‌کنند.

این نقص در کاربردهای حیاتی و حساسی چون پزشکی، مهندسی و تحقیقات علمی یک چالش اساسی است؛ در این حوزه‌ها نه‌تنها نتیجه پایانی اهمیت دارد، بلکه مسیر رسیدن به آن نیز تعیین‌کننده است. زمانی که خطایی رخ می‌دهد—برای مثال در تشخیص پزشکی یا تجویز درمان—باید بتوان به‌دقت ردیابی کرد که مشکل از کجا برخاسته است: آیا در مسیر استدلال سیستم خطایی رخ داد؟ آیا به شواهد نامعتبر تکیه کرد؟ یا فرضیات اولیه‌اش اشتباه بود؟

به همین دلیل بود که من به‌تازگی موقعیت شغلی خود را در گوگل دیپ‌مایند ترک کردم. باور دارم که ما نیازمند رویکردی نوین در استدلال ماشینی هستیم؛ رویکردی که از معماری آلفاگو الهام بگیرد. آلفاگو دانش خود از یک موقعیت بازی را در یک ساختار صریح ذخیره و پیگیری می‌کند: همان درخت بازی. این ساختار داده تمامی شاخه‌ها و آینده‌های محتمل بررسی‌شده را در بر دارد و هر حرکت و موقعیت در آن با داوری‌های شبکه‌های عصبی برچسب‌گذاری شده است. با پیشبرد فرایند استدلال، آلفاگو درخت بازی را به‌روزرسانی کرده و در نهایت اطلاعات آن را برای تصمیم‌گیری درباره حرکت بهینه ترکیب می‌کند.

به‌همین ترتیب، در استدلال عمومی نیز سیستم باید یک حالت معرفتی را نگهداری کند؛ چارچوبی که مشخص سازد سیستم چه گزاره‌هایی را اثبات‌شده می‌داند، نسبت به چه اموری تردید دارد، چه مواردی را رد کرده و چه پرسش‌هایی را باز گذاشته است. آن‌گاه می‌توان استدلال را به‌مثابه زنجیره‌ای از حرکات تعریف کرد که برای ارتقای دانش و کاهش عدم قطعیت، حالت معرفتی را دگرگون می‌سازند: استنتاج نتایج، تجزیه مسائل به مؤلفه‌های خردتر و مهم‌تر از همه، تصمیم‌گیری درباره اینکه گام بعدی باید طرح چه سؤالی، انجام چه محاسباتی یا اجرای چه آزمایشی باشد.

البته استدلال در جهانِ باز (Open-World Reasoning) به‌مراتب پیچیده‌تر از بازی روی صفحه تخته‌ای گو یا شطرنج است. در جهان واقعی، وضعیت حاکم همواره با داده‌های ناقص شناخته می‌شود، دامنه کنش‌های ممکن نامحدود و متغیر است و پیامدهای هر عمل نیز سرشتی احتمالاتی (کاتوره‌ای) یا ناشناخته دارند.

با این حال، پیشرفت‌های اخیر مدل‌های زبانی بزرگ این ابزار را در اختیار ما نهاده است که بتوانیم به سراغ چنین استدلال‌های عامی برویم. به‌عنوان نمونه، مدل‌های زبانی می‌توانند بر اساس شواهد موجود و منابع دردسترس، روش‌هایی را برای حل یک مسئله پیشنهاد دهند. آن‌ها می‌توانند از طریق API یا کدنویسی با ابزارهای بیرونی تعامل کنند و میزان انطباق یک ادعا با شواهد موجود را بسنجند.

اما حیاتی‌ترین اصل برای تضمین اصالت سیستم این است که یک بخش مستقل، هر گام را بر مبنای میزان کاهش واقعیِ عدم قطعیت بسنجد و فرایند «تجدیدنظر در باور» (Belief Revision) تنها زمانی رخ دهد که تغییرات توسط شواهد معتبر پشتیبانی شوند. در صورت برقراری چنین قواعدی، مدل می‌تواند دانشی اعتبارسنجی‌شده انباشت کند و شیوه استدلال خود را از طریق درس‌آموزی از تجارب قبلی ارتقا دهد. می‌توان چنین ساختاری را «نسخه ارتقایافته و پرتوانِ روش علمی» تلقی کرد که هدف آن تولید دانشی استوار در برابر دقیق‌ترین نقدها و بازبینی‌هاست.

من بر این باور نیستم که صرفاً با افزایش ابعاد سیستم ۱ (Scale) بتوان به هوش ماشینی قابل‌اتکا دست یافت. مقیاس‌دهی، شهود را تقویت می‌کند، اما آن را به تفکری تحلیلی و تأمل‌ورزانه تبدیل نمی‌سازد. حرکت ۳۷ از آن رو تاریخی شد که یک ماشین موقعیتی را ثبت کرد، آینده‌های محتمل را به سنجش گذاشت، و در نهایت حرکتی را برگزید که غرایز مصنوعی‌اش به‌احتمال بسیار زیاد آن را رد می‌کردند.

جامعه مدرن در حوزه‌هایی مانند کشف دارو، علوم مواد، اقلیم و تشخیص پزشکی به چنین تصمیمات بنیادین و خلاقانه‌ای نیاز دارد؛ عرصه‌هایی که هیچ شباهتی به صفحه مسطح گو ندارند و قوانین بازی نیز پیشاپیش به ما اعطا نشده است. ما چنین بینش‌هایی را تنها از سیستم‌هایی به دست خواهیم آورد که حقیقتاً اهل «استدلال» باشند؛ سیستم‌هایی که نتایج آن‌ها برآمده از توالیِ قابل‌وارسی از شواهد، استنتاج و بازنگری در باورها باشد، نه محصول یک دلیل‌تراشی پسینی و فریبنده که پس از رسیدن به نتیجه سرهم شده است.

توره گرِیپِل (Thore Graepel) استاد کرسی یادگیری ماشین در کالج دانشگاهی لندن (UCL) است. او از اعضای هسته اصلی تیم آلفاگو در دیپ‌مایند بوده و در زمینه همسوسازی هوش مصنوعی با شکوفایی انسانی فعالیت می‌کند.

با اسناد خودتان امتحانش کنید

یک فضای کاری بسازید، یک سند واقعی بارگذاری کنید و سؤالی بپرسید که جوابش را می‌دانید.