مدلهای هوش مصنوعی بیشتر اوقات حتی درباره حقایق پایه هم با هم توافق ندارند!
یک مطالعه جدید از پنج مدل پیشرفته هوش مصنوعی خواست ۱۰۰۰ ادعای واقعی را راستیآزمایی کنند. آنها در ۶۷٪ موارد با هم اختلاف نظر داشتند.
خلاصه خبر
پنج مدل پیشرفته هوش مصنوعی در ۶۷٪ از ۱۰۰۰ ادعای واقعیِ راستیآزماییشده با هم اختلاف داشتند.
توافق کامل میان همه مدلها فقط در ۳۲۸ ادعا رخ داد.
با امتیاز ۰.۶۳۹ در شاخص آلفای کریپندورف، این مدلها پایینتر از آستانه قابلیت اعتماد ۰.۸ قرار گرفتند.
اگر از پنج مورد از پیشرفتهترین سیستمهای هوش مصنوعی جهان بپرسید که آیا یک جمله درست است یا نه، در دو سوم موارد دستکم یکی از آنها پاسخی متفاوت خواهد داد. این نتیجه مطالعهای تازه است که این ماه توسط پژوهشگر کوستا جوردانوف در Lenz Research منتشر شده است.
در این مطالعه، به مدلهای
- GPT-5.4
- Claude Opus 4.7
- Gemini 3 Pro
- Gemini 3 Pro with Search
- Sonar Pro
همان ۱۰۰۰ ادعای واقعی داده شد؛ ادعاهایی که کاربران واقعی برای راستیآزمایی ارسال کرده بودند. مدلها باید یکی از چهار برچسب را انتخاب میکردند: درست، عمدتاً درست، گمراهکننده، یا نادرست.
از میان ۱۰۰۰ ادعا، در ۶۷۲ مورد دستکم یک مدل با نظر اکثریت مخالفت کرد. در ۳۴٪ موارد، اختلاف شدید بود: یک مدل ادعایی را «درست» دانست، در حالی که مدل دیگری همان ادعا را «نادرست» ارزیابی کرد.
در متن مطالعه آمده است:
«اینها آیتمهای بنچمارک با پاسخنامه عمومی نیستند؛ اینها ادعاهایی هستند که کاربران واقعی برای بررسی به یک پلتفرم راستیآزمایی ارسال کردهاند. برای هر ادعا فقط یک دستهبندی نهایی میتواند درست باشد؛ بنابراین هرگونه اختلاف میان مدلها یعنی دستکم یکی از آنها تحت این چارچوب چهاربرچسبی، برچسب ناسازگار داده است.»
مطالعات پیشین درباره توهم هوش مصنوعی نشان دادهاند که چتباتها گاهی حقایق ساختگی تولید میکنند. این یک مشکل است. اما مسئله این مطالعه متفاوت است. مدلها لزوماً چیزی را جعل نمیکنند؛ بلکه صرفاً نمیتوانند درباره قضاوتهای واقعیت های پایه درباره یک موضوع واحد با هم توافق کنند.
پلتفرم راستیآزمایی Lenz
پژوهشگران از روشی استفاده کردند که توضیح یا توجیه آن را برای شرکتهای هوش مصنوعی دشوارتر میکند. آنها بهجای استفاده از مجموعهدادههای استاندارد آزمایشی ــ که اغلب ممکن است وارد دادههای آموزشی شده باشند ــ از ادعاهایی استفاده کردند که افراد واقعی به پلتفرم راستیآزمایی Lenz ارسال کرده بودند.
در مقالهی آمده نوشته شده:
«بیشتر این ادعاها احتمالاً در هیچ مجموعه آموزشی وجود ندارند؛ هیچ پاسخنامه رسمی برای الگوگیری وجود ندارد و هیچ جدول رتبهبندی بنچمارکی هم نیست که مدلها به آن تکیه کنند.»
معیار آماری توافق که آلفای کریپندورف نام دارد، عدد ۰.۶۳۹ را نشان داد؛ در مقیاسی که ۱.۰ به معنای توافق کامل و ۰ به معنای شانس تصادفی است. مطالعه میگوید این عدد نشاندهنده «توافق قابل توجه اما محدود» است.
پژوهشگران نوشتهاند:
«قضاوتهای مدلها ساختارمند هستند و تصادفی نیستند، اما آنقدر سازگار نیستند که بتوان این مجموعه مدلها را مانند یک داور واحد و قابل جایگزینی در نظر گرفت.»
پژوهشگران معمولاً هر عددی پایینتر از ۰.۸ را ضعیف تلقی میکنند.
هر پنج مدل فقط در ۳۲۸ مورد از ۱۰۰۰ ادعا به یک نظر مشترک رسیدند. در این موارد، آنها تقریباً هیچوقت یک ادعا را «گمراهکننده» یا «عمدتاً درست» تشخیص ندادند. فقط ۴ ادعا با توافق کامل همهٔ مدلها برچسب «گمراهکننده» گرفت و هیچ ادعایی با توافق کامل، برچسب «عمدتاً درست» دریافت نکرد. این نشان میدهد که مدلها حتی زمانی که با هم موافق بودند، بهندرت دربارهٔ این دو دستهبندی به نتیجهای قطعی میرسیدند.
پژوهشگران نمونههایی از ادعاهایی را ارائه کردند که در آنها مدلهای هوش مصنوعی بیشترین اختلاف را نشان دادند؛ از جمله این ادعا:
«سبد فعال بانک جهانی در نیجریه تا سال ۲۰۲۵ بیش از ۱۶.۴ میلیارد دلار است.»
ChatGPT 5.4 این ادعا را «عمدتاً درست» دانست، در حالی که Gemini 3 Pro آن را «نادرست» ارزیابی کرد و مدل خواهر آن، Gemini 3 Pro + Search، آن را «گمراهکننده» دانست.
در نمونهای دیگر، این ادعا به مدلها داده شد:
«دونالد ترامپ گفته است حمله به ایران به درخواست متحدان خلیج فارس به تعویق افتاده است.»
GPT-5.4 آن را نادرست دانست، Claude Opus 4.7 آن را عمدتاً درست ارزیابی کرد، Gemini 3 Pro گفت نادرست است، و Gemini 3 Pro + Search آن را درست دانست.
این مطالعه نشان میدهد که حتی پیشرفتهترین مدلهای هوش مصنوعی نیز هنوز نمیتوانند بهعنوان داورانی کاملاً قابلاعتماد برای راستیآزمایی اطلاعات در نظر گرفته شوند. وقتی پنج مدل مطرح در ۶۷ درصد موارد بر سر صحت یک ادعا با یکدیگر اختلاف دارند و میزان توافق آنها به آستانه پذیرفتهشدهٔ قابلیت اعتماد نمیرسد، روشن است که استفاده از خروجی این ابزارها بهعنوان مرجع نهایی میتواند گمراهکننده باشد.
یافتههای پژوهش همچنین نشان میدهد که مدلها در موارد کاملاً روشن و قطعی، یعنی ادعاهای آشکارا درست یا نادرست، بیشتر به توافق میرسند؛ اما در حوزههایی که نیازمند تفسیر، زمینهسازی یا قضاوت دقیقتر هستند، اختلاف نظر آنها بهطور چشمگیری افزایش مییابد. بنابراین، هوش مصنوعی در وضعیت فعلی بیشتر میتواند نقش یک دستیار پژوهشی را ایفا کند تا یک داور نهایی حقیقت. این نتایج یادآور میشود که راستیآزمایی اطلاعات همچنان به نظارت انسانی، منابع معتبر و بررسی چندجانبه نیاز دارد و نباید صرفاً به قضاوت یک مدل هوش مصنوعی تکیه کرد.
سلب مسئولیت:
مطالب منتشرشده صرفاً با هدف اطلاعرسانی تهیه شده و بههیچوجه توصیهای برای خرید، فروش یا نگهداری داراییهای مالی، سهام، ارزهای دیجیتال یا سایر ابزارهای سرمایهگذاری محسوب نمیشود. تصمیمگیری برای سرمایهگذاری بر عهدهی مخاطب است و توصیه میشود پیش از هر اقدامی، تحقیقات کافی انجام داده و در صورت نیاز با مشاور مالی متخصص مشورت کنید.
۰ دیدگاه
در حال آمادهسازی فرم دیدگاه…