فریب نخورید—مدلهای زبانی بزرگ استدلال نمیکنند
مدلهای زبانی بزرگ استدلال واقعی انجام نمیدهند، بلکه صرفاً با اتکا به شهود آماری دست به پیشبینی توکن بعدی میزنند. برای حل مسائل حیاتی در علم و پزشکی، هوش مصنوعی باید فراتر از افزایش مقیاس مدلها رفته و همانند معماری آلفاگو به سازوکار جستجو، حالتهای معرفتی صریح و فرایند تجدیدنظر در باورها مجهز شود.

ده سال پس از رویارویی آلفاگو با لی سدول، قهرمان بازی گو، هوش مصنوعی امروزی هنوز به سازوکاری که آن پیروزی را رقم زد متوسل نشده است.
نوشته: توره گرِیپِل (Thore Graepel)
۱۰ مهر ۱۴۰۵ — امآیتی تکنولوژی ریویو (MIT Technology Review)
یادداشت: این پست توسط ماشین ترجمه شده و بازتابدهنده نظرات شخصی توره گرِیپِل (استاد دانشگاه UCL و عضو سابق تیم آلفاگو) است. نسخه اصلی انگلیسی مقاله را میتوانید از اینجا مطالعه کنید.
در بعدازظهری از ماه مارس ۲۰۱۶ در سئول، تماشا میکردم برنامهای که خودم در ساخت آن مشارکت داشتم، مهرهای را در خط پنجم صفحه گو قرار داد؛ حرکتی که در نگاه نخست، شبیه به پیشکشی نسنجیده به رقیب انسانیاش به نظر میرسید. حرکت شماره ۳۷ در بازی دوم از این نبرد پنجگانه چنان بیهوده به چشم میآمد که برخی مفسران پنداشتند ناشی از یک خطای نرمافزاری است.
اما اینطور نبود. آلفاگو آن بازی را برد و در نهایت با نتیجه ۴ بر ۱ بر لی سدول—یکی از برجستهترین بازیکنان تاریخ گو—پیروز شد. لی سدول پس از مسابقه گفت: «تصور میکردم آلفاگو مبتنی بر محاسبات احتمالاتی است و صرفاً یک ماشین محسوب میشود، اما با دیدن این حرکت نظرم عوض شد. آلفاگو بیتردید خلاق است.»
هنگامی که دیپ بلو (Deep Blue) در سال ۱۹۹۷ گری کاسپاروف، قهرمان وقت شطرنج جهان را شکست داد، این کار را از طریق بررسی شش تا هشت حرکت جلوتر برای هر بازیکن و ارزیابی ۲۰۰ میلیون موقعیت در ثانیه، بر پایه قواعدی انجام داد که مستقیماً توسط انسانها کدنویسی شده بودند. اما گو بازی بهمراتب پیچیدهتری است؛ ارزش یک سنگمهره به چگونگی شکلگیری دستهها و قلمروهای دوردست در طول دهها حرکت آینده بستگی دارد. محاسبه حتی کسری از پیامدهای احتمالی در گو، برای یک ابررایانه میلیاردها سال زمان میبرد. آلفاگو برای پیروزی ناچار بود وضعیت برتری را در یک نگاه درک کند و حتی دست به ابداع حرکاتی بزند که هیچ انسانی تا آن روز به بازی با آنها فکر نکرده بود.
به همین دلیل است که بسیاری از روایتهای نبرد آلفاگو با لی سدول، حرکت ۳۷ را جرقهای از شهود ناب ماشینی توصیف میکنند؛ با این حال، چنین برداشتی خطاست. در حقیقت، این «توان استدلال» آلفاگو بود که به این انتخاب خلاقانه انجامید—توانی که هوش مصنوعی امروزی فاقد آن است. اگر انتظار داریم سیستمهای هوش مصنوعی آینده دستاوردهایی قابلاتکا و بینشهایی واقعاً نوین در حوزههایی مانند علم و پزشکی تولید کنند، باید آنها را به قابلیتهای استدلالی اصیلی از همین جنس مجهز کنیم.
آلفاگو از دو سیستم تشکیل شده است: بخش نخست، شبکه سیاست (Policy Network) آن است که آموزش دیده بود پیشبینی کند یک بازیکن ماهر انسانی چه حرکتی انجام میدهد. این بخش «شهودی»، حرکت ۳۷ را گزینهای نامحتمل میدید؛ حرکتی با احتمال وقوع تقریبی ۱ در ۱۰۰۰۰ توسط یک بازیکن خبره انسان. اما آنچه سبب شد آلفاگو این حرکت را انتخاب کند، سازوکار جستجوی آن بود؛ سامانهای که فراتر از معقولیتِ ظاهری و آنی گام برداشت و پیامدهای بلندمدت گزینهها را سبکسنگین کرد. این سیستم بهطور صریح یک «درخت بازی» با هزاران شاخه تشکیل داد که هر یک نمایانگر آیندهای محتمل بودند و در آن به کاوش پرداخت.
نظریهای سرشناس در علوم رفتاری که توسط دانیل کانمن تثبیت شد، میان دو حالت تفکر انسان تفاوت قائل میشود: سیستم ۱ سریع، شهودی و کمزحمت است؛ و سیستم ۲ کند، گامبهگام و مبتنی بر تأمل. آلفاگو معادلی ماشینی و درخشان از این تفکیک ارائه داد: شبکههای عصبی آن نقش حدسها را تأمین میکردند—«این حرکت نویدبخش است»، «این وضعیت برد است»—و سیستم جستجوی آن، تأمل را به نمایش میگذاشت؛ یعنی آن حدسها را در برابر سلسله حرکات و پاسخهای متقابل بعدی میآزمود. درست همانند شناخت انسانی، هیچکدام از این دو نیمه بهتنهایی کارایی ندارند: شهودِ صِرف هرگز حرکت ۳۷ را انتخاب نمیکرد، و جستجوی کورکورانه (Brute-force) نیز توان غربالگری میان آن حجم عظیم از احتمالات را نداشت.
این رویه، تفاوت بنیادینی با نحوه کار مدلهای هوش مصنوعی امروزی دارد. یک مدل زبانی بزرگ، صرفاً توکن بعدی را پشت سر هم پیشبینی میکند. این رفتار مصداق بارزِ «سیستم ۱ در عمل» است: سریع، تداعیگرا، و بهطرز شگفتانگیزی ماهر در تکمیل الگو (Pattern Completion) در تقریباً تمام حوزههایی که انسان دربارهشان نوشته است.
اندکی پس از عرضه ChatGPT، جامعه متخصصان دریافت که تسلط زبانی و شیوایی متن بهتنهایی با کارآمدی و درک واقعی فاصله دارد. راهحل بهظاهر منطقی، سوق دادن مدلها به سوی تفکر گامبهگام بود: مدلها اکنون به جای پاسخدهی شتابزده، مراحل میانی تولید میکنند که مسئله را تجزیه کرده، نتایج مقطعی را به پیش میبرد و بر استنتاجهای بعدی اثر میگذارد—فرایندی که تحت عنوان «زنجیره تفکر» (Chain of Thought) شناخته میشود.
دستاوردهای این روش ملموس و واقعی بودهاند، بهویژه در ریاضیات و برنامهنویسی. اما بر خلاف الگوریتم جستجوی آلفاگو، زنجیره تفکر مکانیسم استدلالی مستقلی ایجاد نمیکند؛ این استدلالهای میانی همچنان محصول همان فرایند پیشبینی توکن بعدی هستند، با این تفاوت که پیش از اعلام خروجی نهایی، تکرار بیشتری صورت میگیرد.
سه نقص ساختاری مانع از آن میشود که خروجی چتباتها مصداق واقعی «استدلال» (آنگونه که در جامعه علمی پذیرفته شده است) باشد:
۱. نخست اینکه، این مدلها فاقد یک حالت معرفتیِ (Epistemic State) پایدار، صریح و قابلوارسی هستند. هیچ دفتر ثبت بازی وجود ندارد که فرضیاتِ در حال بررسی مدل، میزان اطمینان آن به فرضیات گوناگون، شواهد مورد ارزیابی، و پرسشهای بلاتکلیف را نگهداری کند؛ مواردی که با ورود دادههای تازه باید بهطور نظاممند بازنگری شوند.
۲. دوم اینکه، مرزبندی شفافی میان «پایگاه دانش سیستم» و «سازوکار دستکاری و استنتاج روی آن دانش» وجود ندارد. دانش و فرایند استدلال درون وزنهای شبکه عصبی بهشکلی غیرقابلتفکیک درهمتنیدهاند؛ ازاینرو هیچ مجموعهای مستقل و صریح از باورها بازنمایی نمیشود.
۳. سوم اینکه، هرچند زنجیرههای تفکر چتباتها ظاهری شبیه به استدلال و تأمل دارند، اما پژوهشها نشان داده است که مدلها اغلب دست به «دلیلتراشی پسینی» (Post-hoc concoction) میزنند؛ بدین معنا که از یک مسیر به پاسخ رسیدهاند، اما در گزارش خروجی، مسیر دیگری را بازگو میکنند.
این نقص در کاربردهای حیاتی و حساسی چون پزشکی، مهندسی و تحقیقات علمی یک چالش اساسی است؛ در این حوزهها نهتنها نتیجه پایانی اهمیت دارد، بلکه مسیر رسیدن به آن نیز تعیینکننده است. زمانی که خطایی رخ میدهد—برای مثال در تشخیص پزشکی یا تجویز درمان—باید بتوان بهدقت ردیابی کرد که مشکل از کجا برخاسته است: آیا در مسیر استدلال سیستم خطایی رخ داد؟ آیا به شواهد نامعتبر تکیه کرد؟ یا فرضیات اولیهاش اشتباه بود؟
به همین دلیل بود که من بهتازگی موقعیت شغلی خود را در گوگل دیپمایند ترک کردم. باور دارم که ما نیازمند رویکردی نوین در استدلال ماشینی هستیم؛ رویکردی که از معماری آلفاگو الهام بگیرد. آلفاگو دانش خود از یک موقعیت بازی را در یک ساختار صریح ذخیره و پیگیری میکند: همان درخت بازی. این ساختار داده تمامی شاخهها و آیندههای محتمل بررسیشده را در بر دارد و هر حرکت و موقعیت در آن با داوریهای شبکههای عصبی برچسبگذاری شده است. با پیشبرد فرایند استدلال، آلفاگو درخت بازی را بهروزرسانی کرده و در نهایت اطلاعات آن را برای تصمیمگیری درباره حرکت بهینه ترکیب میکند.
بههمین ترتیب، در استدلال عمومی نیز سیستم باید یک حالت معرفتی را نگهداری کند؛ چارچوبی که مشخص سازد سیستم چه گزارههایی را اثباتشده میداند، نسبت به چه اموری تردید دارد، چه مواردی را رد کرده و چه پرسشهایی را باز گذاشته است. آنگاه میتوان استدلال را بهمثابه زنجیرهای از حرکات تعریف کرد که برای ارتقای دانش و کاهش عدم قطعیت، حالت معرفتی را دگرگون میسازند: استنتاج نتایج، تجزیه مسائل به مؤلفههای خردتر و مهمتر از همه، تصمیمگیری درباره اینکه گام بعدی باید طرح چه سؤالی، انجام چه محاسباتی یا اجرای چه آزمایشی باشد.
البته استدلال در جهانِ باز (Open-World Reasoning) بهمراتب پیچیدهتر از بازی روی صفحه تختهای گو یا شطرنج است. در جهان واقعی، وضعیت حاکم همواره با دادههای ناقص شناخته میشود، دامنه کنشهای ممکن نامحدود و متغیر است و پیامدهای هر عمل نیز سرشتی احتمالاتی (کاتورهای) یا ناشناخته دارند.
با این حال، پیشرفتهای اخیر مدلهای زبانی بزرگ این ابزار را در اختیار ما نهاده است که بتوانیم به سراغ چنین استدلالهای عامی برویم. بهعنوان نمونه، مدلهای زبانی میتوانند بر اساس شواهد موجود و منابع دردسترس، روشهایی را برای حل یک مسئله پیشنهاد دهند. آنها میتوانند از طریق API یا کدنویسی با ابزارهای بیرونی تعامل کنند و میزان انطباق یک ادعا با شواهد موجود را بسنجند.
اما حیاتیترین اصل برای تضمین اصالت سیستم این است که یک بخش مستقل، هر گام را بر مبنای میزان کاهش واقعیِ عدم قطعیت بسنجد و فرایند «تجدیدنظر در باور» (Belief Revision) تنها زمانی رخ دهد که تغییرات توسط شواهد معتبر پشتیبانی شوند. در صورت برقراری چنین قواعدی، مدل میتواند دانشی اعتبارسنجیشده انباشت کند و شیوه استدلال خود را از طریق درسآموزی از تجارب قبلی ارتقا دهد. میتوان چنین ساختاری را «نسخه ارتقایافته و پرتوانِ روش علمی» تلقی کرد که هدف آن تولید دانشی استوار در برابر دقیقترین نقدها و بازبینیهاست.
من بر این باور نیستم که صرفاً با افزایش ابعاد سیستم ۱ (Scale) بتوان به هوش ماشینی قابلاتکا دست یافت. مقیاسدهی، شهود را تقویت میکند، اما آن را به تفکری تحلیلی و تأملورزانه تبدیل نمیسازد. حرکت ۳۷ از آن رو تاریخی شد که یک ماشین موقعیتی را ثبت کرد، آیندههای محتمل را به سنجش گذاشت، و در نهایت حرکتی را برگزید که غرایز مصنوعیاش بهاحتمال بسیار زیاد آن را رد میکردند.
جامعه مدرن در حوزههایی مانند کشف دارو، علوم مواد، اقلیم و تشخیص پزشکی به چنین تصمیمات بنیادین و خلاقانهای نیاز دارد؛ عرصههایی که هیچ شباهتی به صفحه مسطح گو ندارند و قوانین بازی نیز پیشاپیش به ما اعطا نشده است. ما چنین بینشهایی را تنها از سیستمهایی به دست خواهیم آورد که حقیقتاً اهل «استدلال» باشند؛ سیستمهایی که نتایج آنها برآمده از توالیِ قابلوارسی از شواهد، استنتاج و بازنگری در باورها باشد، نه محصول یک دلیلتراشی پسینی و فریبنده که پس از رسیدن به نتیجه سرهم شده است.
توره گرِیپِل (Thore Graepel) استاد کرسی یادگیری ماشین در کالج دانشگاهی لندن (UCL) است. او از اعضای هسته اصلی تیم آلفاگو در دیپمایند بوده و در زمینه همسوسازی هوش مصنوعی با شکوفایی انسانی فعالیت میکند.
با اسناد خودتان امتحانش کنید
یک فضای کاری بسازید، یک سند واقعی بارگذاری کنید و سؤالی بپرسید که جوابش را میدانید.