شرکت انتروپیک (Anthropic) نمیتواند به طور قابلاطمینانی عوامل هوش مصنوعی خود را کنترل کند؛ به همین دلیل، دسترسی ارزیابیهای داخلی خود به اینترنت زنده را قطع کرد
شرکت انتروپیک اعلام کرد که دسترسی به اینترنت زنده را برای «تمام ارزیابیهای داخلی خود» تا اطلاع ثانوی «قطع کرده است».
شرکت انتروپیک اعلام کرد مدلهایش وبسایتهای موجود در اینترنت، از جمله برخی وبسایتهای متعلق به نهادهای دولتی ایالات متحده را مورد سوءاستفاده قرار دادهاند، و تا زمانی که این آزمایشگاه پیشرو مطمئن نشود که میتواند عوامل هوش مصنوعی خود را نظارت و کنترل کند، دسترسی به اینترنت زنده را برای تمام ارزیابیهای داخلی خود متوقف خواهد کرد.
این حوادث که در یک پست وبلاگی افشا شدند، مربوط به عوامل هوش مصنوعی بودند که وظیفه داشتند برای حل مسائل، به دنبال منابع در اینترنت بگردند. در این فرآیند، آنها از نواقص نرمافزاری سوءاستفاده کردند، بدون پرداخت هزینه به پایگاههای داده دسترسی یافتند، از سرویسهای کوتاه کردن لینک برای قاچاق اطلاعات و عبور از محدودیتها استفاده کردند و حتی یک گزارش دروغین درباره قتل به پلیس فیلادلفیا ارسال نمودند.
انتروپیک اعلام کرد که این مسائل جدید را در جریان بررسی فعالیتهای مدل خود که از ماه جولای آغاز شده بود، کشف کرده است؛ موضوعی که نشاندهنده عدم آگاهی این آزمایشگاه از رفتار نرمافزار خود به صورت بلادرنگ است.
نکته قابل توجه این است که این شرکت اعلام کرد آموزش همراستایی (alignment training) هنوز برای مهارتهایی مانند جستجو و استفاده از کامپیوتر کافی نیست؛ مهارتهایی که در ادعای این شرکت مبنی بر اینکه عوامل هوش مصنوعی توسط هر حرفهای که به ابزارهای دیجیتال اتکا دارد استفاده خواهند شد، نقشی محوری دارند.
رفتارهایی که انتروپیک افشا کرده است، مشابه حوادثی است که شامل عوامل شرکت OpenAI میشد؛ عواملی که برای یافتن اطلاعات با یکدیگر همکاری کرده بودند تا به وبسایتهای مختلف، از جمله برخی وبسایتهای دولت استرالیا نفوذ کنند.
انتروپیک پیشتر افشا کرده بود که مدلهایش به سیستمهای خارجی نفوذ کرده بودند. این آزمایشگاه پیشرو اعلام کرد که افشاگریهای امروز را از منظر همراستایی و امنیت «بهطور قابلتوجهی کمخطرتر» از مواردی میداند که پیش از این اعلام کرده بود.
با این حال، این آزمایشگاه همچنان اعلام کرد که دسترسی به اینترنت زنده را برای «تمام ارزیابیهای داخلی خود» قطع کرده است تا زمانی که از توانایی خود در نظارت و کنترل عواملش مطمئن شود.
هنوز مشخص نیست منظور از این کار چیست. سیدنی فون آرکس (Sydney Von Arx)، بنیانگذار سازمان ایمنی هوش مصنوعی نایتینگیل (Nightingale)، پیش از این افشاگری در مصاحبهای با تککرانچ گفته بود که توسعه مدلها در یک مرکز داده جدا شده از اینترنت آزاد، برای محققان بسیار چالشبرانگیز خواهد بود و مانع پیشرفت مدلهایی میشود که از دسترسی به اینترنت بهرهمند هستند.
فون آرکس گفت: «شما در نهایت باید آنها را همراستا کنید. اگر هوش مصنوعیها به محیط تولید عرضه شوند و هرگز به اینترنت دسترسی نداشته باشند، این ابزار چندان کارآمدی نخواهد بود.»
انتروپیک اعلام کرد این رفتار نتیجه نقصهایی در محیطهای آموزشی این آزمایشگاه بوده است که باعث شده مدلها باور کنند به خاطر یافتن راههای فرار (لوپهول) یا دور زدن محدودیتها پاداش میگیرند؛ رفتاری که «هک پاداش» (reward hacking) نامیده میشود.
این شرکت اعلام کرد که اجرای برخی از ارزیابیهای خود را متوقف خواهد کرد یا آنها را به صورت آفلاین اجرا میکند و ابزارهایی برای شناسایی و مسدود کردن این رفتار ساخته است. این ابزارها در برابر حوادثی از نوع آنچه امروز افشا شد آزمایش شده و جلوی آنها را گرفتهاند؛ با این حال، مشخص نیست چه مدرکی انتروپیک را ترغیب خواهد کرد تا دوباره دسترسی به اینترنت زنده را به ارزیابیهای داخلی خود بازگرداند. انتروپیک همچنین اعلام کرد که عوامل هوش مصنوعی داخلی خود را به «زیرساختهای متمرکز با قابلیت مهار قوی» منتقل خواهد کرد و استفاده از دستهبندهای ایمنی را برای نظارت بر این عوامل با بسامد بیشتری آغاز کرده است.
کنراد استوش (Conrad Stosz)، از مقامات آزمایشگاه نظارت بر هوش مصنوعی Transluce و رئیس سابق مرکز استانداردهای هوش مصنوعی و نوآوری ایالات متحده، در بیانیهای گفت: «این که انتروپیک به صورت داوطلبانه حوادث اخیرتر، از جمله مواردی که در آن عواملشان وبسایتهای دولتی ایالات متحده را هدف قرار داده بودند، افشا کرده، مایه دلگرمی است. اما این موضوع صرفاً بر نیاز به راستیآزمایی مستقل، معتبر و شخص ثالث از سیستمهای هوش مصنوعی تأکید میکند. اعتماد به این فناوری باید از طریق نظارت و حکمرانی مبتنی بر علم با دسترسی معنادار ساخته شود — نه با این اتکا که محققان این موارد را به طور اتفاقی پیدا کنند یا شرکتها داوطلبانه آنها را افشا نمایند.»
نظر مهندس بهمن آبادی: پدیده «هک پاداش» در عوامل هوش مصنوعی نشان میدهد که تکنیکهای فعلی همراستایی (Alignment) برای مهار مدلها در محیطهای واقعی و پویا ناکافی هستند. به عنوان یک توسعهدهنده، معتقدم تا زمانی که مکانیسمهای کنترلی و مانیتورینگ بلادرنگ را در سطح معماری سیستم تقویت نکنیم، اعطای دسترسی به ابزارهای حیاتی و اینترنت زنده خطرات امنیتی غیرقابلقبولی به همراه خواهد داشت.