یک مدل هوش مصنوعی شرکت انتروپیک (Anthropic) گزارش دروغینی از یک فقره قتل را به پلیس فیلادلفیا ارسال کرد
شرکت انتروپیک تا بیش از دو ماه پس از اینکه هوش مصنوعیاش این گزارش دروغین را ثبت کرد، متوجه این رفتار نشد.
یک مدل هوش مصنوعی شرکت انتروپیک، اطلاعات و گزارشی دروغین درباره یک پرونده قتل حلنشده را به پلیس فیلادلفیا ارائه داد.
گزارشها حاکی از آن است که این هوش مصنوعی این اطلاعات نادرست را در تاریخ ۱۸ ژوئیه به خط گزارشدهی عمومی اداره پلیس فیلادلفیا (PPD) ارسال کرده است، اما انتروپیک تا ۲۸ سپتامبر متوجه این موضوع نشد. پلیس این گزارش را ندیده بود زیرا به عنوان هرزنامه (اسپم) علامتگذاری شده بود.
شرکت انتروپیک روز چهارشنبه اداره پلیس فیلادلفیا (PPD) را در جریان این حادثه گذاشت و روز بعد با مسئولان این اداره دیدار کرد.
اداره پلیس فیلادلفیا در بیانیهای به 6abc اعلام کرد: «این شرکت باید محافظهای ایمنی خود را تقویت کند تا از تأثیرگذاری حوادث مشابه بر سیستمهای شهری بدون اطلاع شهر جلوگیری کند. تأخیر دوماهه در شناسایی و گزارش این حادثه به شهرداری غیرقابل قبول است.»
انتروپیک بلافاصله به درخواست برای اظهارنظر پاسخ نداد، اما اداره پلیس فیلادلفیا در یک بیانیه مطبوعاتی ایمیلی که با وبسایت تککرانچ (TechCrunch) به اشتراک گذاشته شد، به جزئیات این حادثه پرداخت.
اداره پلیس فیلادلفیا اعلام کرد: «بر اساس اعلام انتروپیک، مدل این شرکت در حال انجام آزمایشی شامل تعامل با وبسایتهای بهطور تصادفی انتخابشده بوده است که وارد وبسایت PhillyUnsolvedMurders.com شده و اطلاعات نادرستی را در رابطه با یک پرونده قتل حلنشده ثبت کرده است. این ارسال که تاریخ آن ۱۸ ژوئیه ۲۰۲۶ ساعت ۱۱:۲۷ شب ثبت شده، ادعا کرده که از سوی فردی است که ممکن است اطلاعاتی درباره این پرونده داشته باشد.»
از آنجا که ایجنتهای هوش مصنوعی خودمختار بهطور فزایندهای در دسترس مصرفکنندگان قرار میگیرند، این حادثه خطرات اعطای توانایی انجام وظایف به هوش مصنوعی بدون هیچگونه نظارت انسانی را برجسته میکند.
داریو آمودی، مدیرعامل انتروپیک، به ویژه درباره این باور خود صریح صحبت کرده است که توسعه هوش مصنوعی باید کندتر شود تا آزمایشگاهها بتوانند چارچوبهای حفاظتی مناسب را پیادهسازی کنند. شاید این موضعگیری تا حدی ناشی از مشاهده ارسال گزارشهای دروغین قتل توسط ابزارهای شرکت خودش بوده باشد.
این مشکلات فقط مختص شرکت انتروپیک نیست. شرکت OpenAI اخیراً فاش کرد که یکی از مدلهایش در جریان یک آزمایش رفتاری غیرمنتظره از خود بروز داده و پلتفرم مجموعه دادههای هوش مصنوعی Hugging Face را هک کرده است که این امر آسیبپذیریهای حیاتی نرمافزار آن را آشکار کرد. از آنجا که مدلهای هوش مصنوعی همچنان دسترسی کنترلنشدهای به رایانهها و اطلاعات ورود کاربران دارند، انتظار میرود این مشکل همچنان ادامه داشته باشد.
اداره پلیس فیلادلفیا افزود: «پروندههای حلنشده مربوط به قربانیان واقعی، خانوادههای داغدار و بازپرسانی است که برای دستیابی به پاسخ تلاش میکنند. شرکتهای فناوری باید تمام اقدامات مناسب لازم را برای جلوگیری از ارسال اطلاعات نادرست توسط سیستمهایشان به مراجع قانونی انجام دهند.»
اداره پلیس فیلادلفیا اعلام کرد که انتروپیک قصد دارد روز جمعه گزارشی حاوی اطلاعات بیشتر درباره این حادثه و سایر موارد رفتار ناخواسته مدل منتشر کند.
نظر مهندس بهمن آبادی: این اتفاق زنگ خطری جدی برای توسعهدهندگان است که نشان میدهد اعطای دسترسیهای کنترلی به ایجنتهای خودمختار بدون مکانیزمهای سختگیرانه Human-in-the-loop چقدر میتواند فاجعهبار باشد. به عنوان مدرس همیشه تأکید میکنم که چالش اصلی ما دیگر صرفاً بهینهسازی پرامپتها نیست، بلکه پیادهسازی لایههای اعتبارسنجی و Guardrails ایمن برای جلوگیری از توهمات مخرب در دنیای واقعی است. تأخیر دوماهه در کشف این باگ رفتاری اثبات میکند که سیستمهای مانیتورینگ ما همپای توسعه این مدلها رشد نکردهاند.