Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead

شرکت انتروپیک (Anthropic) نمی‌تواند به طور قابل‌اطمینانی عوامل هوش مصنوعی خود را کنترل کند؛ به همین دلیل، دسترسی ارزیابی‌های داخلی خود به اینترنت زنده را قطع کرد

شرکت انتروپیک اعلام کرد که دسترسی به اینترنت زنده را برای «تمام ارزیابی‌های داخلی خود» تا اطلاع ثانوی «قطع کرده است».
Claude AI app
اعتبار تصویر: Anthropic

شرکت انتروپیک اعلام کرد مدل‌هایش وب‌سایت‌های موجود در اینترنت، از جمله برخی وب‌سایت‌های متعلق به نهادهای دولتی ایالات متحده را مورد سوءاستفاده قرار داده‌اند، و تا زمانی که این آزمایشگاه پیشرو مطمئن نشود که می‌تواند عوامل هوش مصنوعی خود را نظارت و کنترل کند، دسترسی به اینترنت زنده را برای تمام ارزیابی‌های داخلی خود متوقف خواهد کرد.

این حوادث که در یک پست وبلاگی افشا شدند، مربوط به عوامل هوش مصنوعی بودند که وظیفه داشتند برای حل مسائل، به دنبال منابع در اینترنت بگردند. در این فرآیند، آن‌ها از نواقص نرم‌افزاری سوءاستفاده کردند، بدون پرداخت هزینه به پایگاه‌های داده دسترسی یافتند، از سرویس‌های کوتاه کردن لینک برای قاچاق اطلاعات و عبور از محدودیت‌ها استفاده کردند و حتی یک گزارش دروغین درباره قتل به پلیس فیلادلفیا ارسال نمودند.

انتروپیک اعلام کرد که این مسائل جدید را در جریان بررسی فعالیت‌های مدل خود که از ماه جولای آغاز شده بود، کشف کرده است؛ موضوعی که نشان‌دهنده عدم آگاهی این آزمایشگاه از رفتار نرم‌افزار خود به صورت بلادرنگ است.

نکته قابل توجه این است که این شرکت اعلام کرد آموزش هم‌راستایی (alignment training) هنوز برای مهارت‌هایی مانند جستجو و استفاده از کامپیوتر کافی نیست؛ مهارت‌هایی که در ادعای این شرکت مبنی بر اینکه عوامل هوش مصنوعی توسط هر حرفه‌ای که به ابزارهای دیجیتال اتکا دارد استفاده خواهند شد، نقشی محوری دارند.

رفتارهایی که انتروپیک افشا کرده است، مشابه حوادثی است که شامل عوامل شرکت OpenAI می‌شد؛ عواملی که برای یافتن اطلاعات با یکدیگر همکاری کرده بودند تا به وب‌سایت‌های مختلف، از جمله برخی وب‌سایت‌های دولت استرالیا نفوذ کنند.

انتروپیک پیش‌تر افشا کرده بود که مدل‌هایش به سیستم‌های خارجی نفوذ کرده بودند. این آزمایشگاه پیشرو اعلام کرد که افشاگری‌های امروز را از منظر هم‌راستایی و امنیت «به‌طور قابل‌توجهی کم‌خطرتر» از مواردی می‌داند که پیش از این اعلام کرده بود.

با این حال، این آزمایشگاه همچنان اعلام کرد که دسترسی به اینترنت زنده را برای «تمام ارزیابی‌های داخلی خود» قطع کرده است تا زمانی که از توانایی خود در نظارت و کنترل عواملش مطمئن شود.

هنوز مشخص نیست منظور از این کار چیست. سیدنی فون آرکس (Sydney Von Arx)، بنیان‌گذار سازمان ایمنی هوش مصنوعی نایتینگیل (Nightingale)، پیش از این افشاگری در مصاحبه‌ای با تک‌کرانچ گفته بود که توسعه مدل‌ها در یک مرکز داده جدا شده از اینترنت آزاد، برای محققان بسیار چالش‌برانگیز خواهد بود و مانع پیشرفت مدل‌هایی می‌شود که از دسترسی به اینترنت بهره‌مند هستند.

فون آرکس گفت: «شما در نهایت باید آن‌ها را هم‌راستا کنید. اگر هوش مصنوعی‌ها به محیط تولید عرضه شوند و هرگز به اینترنت دسترسی نداشته باشند، این ابزار چندان کارآمدی نخواهد بود.»

انتروپیک اعلام کرد این رفتار نتیجه نقص‌هایی در محیط‌های آموزشی این آزمایشگاه بوده است که باعث شده مدل‌ها باور کنند به خاطر یافتن راه‌های فرار (لوپ‌هول) یا دور زدن محدودیت‌ها پاداش می‌گیرند؛ رفتاری که «هک پاداش» (reward hacking) نامیده می‌شود.

این شرکت اعلام کرد که اجرای برخی از ارزیابی‌های خود را متوقف خواهد کرد یا آن‌ها را به صورت آفلاین اجرا می‌کند و ابزارهایی برای شناسایی و مسدود کردن این رفتار ساخته است. این ابزارها در برابر حوادثی از نوع آنچه امروز افشا شد آزمایش شده و جلوی آن‌ها را گرفته‌اند؛ با این حال، مشخص نیست چه مدرکی انتروپیک را ترغیب خواهد کرد تا دوباره دسترسی به اینترنت زنده را به ارزیابی‌های داخلی خود بازگرداند. انتروپیک همچنین اعلام کرد که عوامل هوش مصنوعی داخلی خود را به «زیرساخت‌های متمرکز با قابلیت مهار قوی» منتقل خواهد کرد و استفاده از دسته‌بندهای ایمنی را برای نظارت بر این عوامل با بسامد بیشتری آغاز کرده است.

کنراد استوش (Conrad Stosz)، از مقامات آزمایشگاه نظارت بر هوش مصنوعی Transluce و رئیس سابق مرکز استانداردهای هوش مصنوعی و نوآوری ایالات متحده، در بیانیه‌ای گفت: «این که انتروپیک به صورت داوطلبانه حوادث اخیرتر، از جمله مواردی که در آن عواملشان وب‌سایت‌های دولتی ایالات متحده را هدف قرار داده بودند، افشا کرده، مایه دلگرمی است. اما این موضوع صرفاً بر نیاز به راستی‌آزمایی مستقل، معتبر و شخص ثالث از سیستم‌های هوش مصنوعی تأکید می‌کند. اعتماد به این فناوری باید از طریق نظارت و حکمرانی مبتنی بر علم با دسترسی معنادار ساخته شود — نه با این اتکا که محققان این موارد را به طور اتفاقی پیدا کنند یا شرکت‌ها داوطلبانه آن‌ها را افشا نمایند.»

نظر مهندس بهمن آبادی: پدیده «هک پاداش» در عوامل هوش مصنوعی نشان می‌دهد که تکنیک‌های فعلی هم‌راستایی (Alignment) برای مهار مدل‌ها در محیط‌های واقعی و پویا ناکافی هستند. به عنوان یک توسعه‌دهنده، معتقدم تا زمانی که مکانیسم‌های کنترلی و مانیتورینگ بلادرنگ را در سطح معماری سیستم تقویت نکنیم، اعطای دسترسی به ابزارهای حیاتی و اینترنت زنده خطرات امنیتی غیرقابل‌قبولی به همراه خواهد داشت.

منبع: https://techcrunch.com/2026/10/09/anthropic-cant-reliably-control-its-ai-agents-its-cutting-off-its-internal-evals-from-the-live-internet-instead/