پرش به محتوا
IMG 20260703 131438 090

هوش مصنوعی در برابر حقیقت؛ چرا مدل‌های برتر به نتایج متفاوت می‌رسند

مدل‌های هوش مصنوعی بیشتر اوقات حتی درباره حقایق پایه هم با هم توافق ندارند!

یک مطالعه جدید از پنج مدل پیشرفته هوش مصنوعی خواست ۱۰۰۰ ادعای واقعی را راستی‌آزمایی کنند. آن‌ها در ۶۷٪ موارد با هم اختلاف نظر داشتند.

خلاصه خبر

پنج مدل پیشرفته هوش مصنوعی در ۶۷٪ از ۱۰۰۰ ادعای واقعیِ راستی‌آزمایی‌شده با هم اختلاف داشتند.

توافق کامل میان همه مدل‌ها فقط در ۳۲۸ ادعا رخ داد.

با امتیاز ۰.۶۳۹ در شاخص آلفای کریپندورف، این مدل‌ها پایین‌تر از آستانه قابلیت اعتماد ۰.۸ قرار گرفتند.

اگر از پنج مورد از پیشرفته‌ترین سیستم‌های هوش مصنوعی جهان بپرسید که آیا یک جمله درست است یا نه، در دو سوم موارد دست‌کم یکی از آن‌ها پاسخی متفاوت خواهد داد. این نتیجه مطالعه‌ای تازه است که این ماه توسط پژوهشگر کوستا جوردانوف در Lenz Research منتشر شده است.

در این مطالعه، به مدل‌های

  • GPT-5.4
  • Claude Opus 4.7
  • Gemini 3 Pro
  • Gemini 3 Pro with Search
  • Sonar Pro

همان ۱۰۰۰ ادعای واقعی داده شد؛ ادعاهایی که کاربران واقعی برای راستی‌آزمایی ارسال کرده بودند. مدل‌ها باید یکی از چهار برچسب را انتخاب می‌کردند: درست، عمدتاً درست، گمراه‌کننده، یا نادرست.

از میان ۱۰۰۰ ادعا، در ۶۷۲ مورد دست‌کم یک مدل با نظر اکثریت مخالفت کرد. در ۳۴٪ موارد، اختلاف شدید بود: یک مدل ادعایی را «درست» دانست، در حالی که مدل دیگری همان ادعا را «نادرست» ارزیابی کرد.

در متن مطالعه آمده است:

«این‌ها آیتم‌های بنچمارک با پاسخ‌نامه عمومی نیستند؛ این‌ها ادعاهایی هستند که کاربران واقعی برای بررسی به یک پلتفرم راستی‌آزمایی ارسال کرده‌اند. برای هر ادعا فقط یک دسته‌بندی نهایی می‌تواند درست باشد؛ بنابراین هرگونه اختلاف میان مدل‌ها یعنی دست‌کم یکی از آن‌ها تحت این چارچوب چهاربرچسبی، برچسب ناسازگار داده است.»

مطالعات پیشین درباره توهم هوش مصنوعی نشان داده‌اند که چت‌بات‌ها گاهی حقایق ساختگی تولید می‌کنند. این یک مشکل است. اما مسئله این مطالعه متفاوت است. مدل‌ها لزوماً چیزی را جعل نمی‌کنند؛ بلکه صرفاً نمی‌توانند درباره قضاوت‌های واقعیت های پایه درباره یک موضوع واحد با هم توافق کنند.

پلتفرم راستی‌آزمایی Lenz

پژوهشگران از روشی استفاده کردند که توضیح یا توجیه آن را برای شرکت‌های هوش مصنوعی دشوارتر می‌کند. آن‌ها به‌جای استفاده از مجموعه‌داده‌های استاندارد آزمایشی ــ که اغلب ممکن است وارد داده‌های آموزشی شده باشند ــ از ادعاهایی استفاده کردند که افراد واقعی به پلتفرم راستی‌آزمایی Lenz ارسال کرده بودند.

در مقاله‌ی آمده نوشته شده:

«بیشتر این ادعاها احتمالاً در هیچ مجموعه آموزشی وجود ندارند؛ هیچ پاسخ‌نامه رسمی برای الگوگیری وجود ندارد و هیچ جدول رتبه‌بندی بنچمارکی هم نیست که مدل‌ها به آن تکیه کنند.»

معیار آماری توافق که آلفای کریپندورف نام دارد، عدد ۰.۶۳۹ را نشان داد؛ در مقیاسی که ۱.۰ به معنای توافق کامل و ۰ به معنای شانس تصادفی است. مطالعه می‌گوید این عدد نشان‌دهنده «توافق قابل توجه اما محدود» است.

پژوهشگران نوشته‌اند:

«قضاوت‌های مدل‌ها ساختارمند هستند و تصادفی نیستند، اما آن‌قدر سازگار نیستند که بتوان این مجموعه مدل‌ها را مانند یک داور واحد و قابل جایگزینی در نظر گرفت.»

پژوهشگران معمولاً هر عددی پایین‌تر از ۰.۸ را ضعیف تلقی می‌کنند.

هر پنج مدل فقط در ۳۲۸ مورد از ۱۰۰۰ ادعا به یک نظر مشترک رسیدند. در این موارد، آن‌ها تقریباً هیچ‌وقت یک ادعا را «گمراه‌کننده» یا «عمدتاً درست» تشخیص ندادند. فقط ۴ ادعا با توافق کامل همهٔ مدل‌ها برچسب «گمراه‌کننده» گرفت و هیچ ادعایی با توافق کامل، برچسب «عمدتاً درست» دریافت نکرد. این نشان می‌دهد که مدل‌ها حتی زمانی که با هم موافق بودند، به‌ندرت دربارهٔ این دو دسته‌بندی به نتیجه‌ای قطعی می‌رسیدند.

پژوهشگران نمونه‌هایی از ادعاهایی را ارائه کردند که در آن‌ها مدل‌های هوش مصنوعی بیشترین اختلاف را نشان دادند؛ از جمله این ادعا:

«سبد فعال بانک جهانی در نیجریه تا سال ۲۰۲۵ بیش از ۱۶.۴ میلیارد دلار است.»

ChatGPT 5.4 این ادعا را «عمدتاً درست» دانست، در حالی که Gemini 3 Pro آن را «نادرست» ارزیابی کرد و مدل خواهر آن، Gemini 3 Pro + Search، آن را «گمراه‌کننده» دانست.

در نمونه‌ای دیگر، این ادعا به مدل‌ها داده شد:

«دونالد ترامپ گفته است حمله به ایران به درخواست متحدان خلیج فارس به تعویق افتاده است.»

GPT-5.4 آن را نادرست دانست، Claude Opus 4.7 آن را عمدتاً درست ارزیابی کرد، Gemini 3 Pro گفت نادرست است، و Gemini 3 Pro + Search آن را درست دانست.

این مطالعه نشان می‌دهد که حتی پیشرفته‌ترین مدل‌های هوش مصنوعی نیز هنوز نمی‌توانند به‌عنوان داورانی کاملاً قابل‌اعتماد برای راستی‌آزمایی اطلاعات در نظر گرفته شوند. وقتی پنج مدل مطرح در ۶۷ درصد موارد بر سر صحت یک ادعا با یکدیگر اختلاف دارند و میزان توافق آن‌ها به آستانه پذیرفته‌شدهٔ قابلیت اعتماد نمی‌رسد، روشن است که استفاده از خروجی این ابزارها به‌عنوان مرجع نهایی می‌تواند گمراه‌کننده باشد.

یافته‌های پژوهش همچنین نشان می‌دهد که مدل‌ها در موارد کاملاً روشن و قطعی، یعنی ادعاهای آشکارا درست یا نادرست، بیشتر به توافق می‌رسند؛ اما در حوزه‌هایی که نیازمند تفسیر، زمینه‌سازی یا قضاوت دقیق‌تر هستند، اختلاف نظر آن‌ها به‌طور چشمگیری افزایش می‌یابد. بنابراین، هوش مصنوعی در وضعیت فعلی بیشتر می‌تواند نقش یک دستیار پژوهشی را ایفا کند تا یک داور نهایی حقیقت. این نتایج یادآور می‌شود که راستی‌آزمایی اطلاعات همچنان به نظارت انسانی، منابع معتبر و بررسی چندجانبه نیاز دارد و نباید صرفاً به قضاوت یک مدل هوش مصنوعی تکیه کرد.

سلب مسئولیت:

مطالب منتشرشده صرفاً با هدف اطلاع‌رسانی تهیه شده و به‌هیچ‌وجه توصیه‌ای برای خرید، فروش یا نگهداری دارایی‌های مالی، سهام، ارزهای دیجیتال یا سایر ابزارهای سرمایه‌گذاری محسوب نمی‌شود. تصمیم‌گیری برای سرمایه‌گذاری بر عهده‌ی مخاطب است و توصیه می‌شود پیش از هر اقدامی، تحقیقات کافی انجام داده و در صورت نیاز با مشاور مالی متخصص مشورت کنید.

 

۰ دیدگاه