هوش مصنوعی برای محافظت از جوامع شبکههای اجتماعی در برابر هوش مصنوعی کافی نیست
چرا انسانها به تعدیلگر انسانی نیاز دارند.
گاهی اوقات باید با آتش به جنگ آتش رفت. اما وقتی صحبت از محتوای زباله تولید شده توسط هوش مصنوعی و مطالب نفرتپراکنی به میان میآید که امنیت و ارزش پلتفرمهای رسانههای اجتماعی را تهدید میکنند، افزودن آتش بیشتر—در اینجا یعنی هوش مصنوعی بیشتر—میتواند مشکل را بدتر کند.
در بهترین حالت، رسانههای اجتماعی میتوانند پناهگاهی برای افرادی باشند که میخواهند تجربیات و دانش خود را به اشتراک بگذارند. شبکههای اجتماعی زمانی بیشترین نزدیکی را با این آرمان پیدا میکنند که کاربران محتوای معتبر و باارزشی را ارائه دهند؛ چه یک پست وبلاگ بسیار متفکرانه باشد و چه یک ویدیوی مفید درباره نحوه ساخت رایانه. تکیه صرف به ابزارهای هوش مصنوعی برای حفظ این اصالت، از درک آنچه رسانههای اجتماعی را در وهله اول ارزشمند میکند غافل میشود: یعنی انسانهایی که پشت آن قرار دارند.
حذفهای اشتباه
در ماه آوریل، کانال اسلک مختص مدیران انجمن رددیت r/AskHistorians بسیار شلوغ بود. این کانال که بهطور خودکار پیوندهایی به پیامهای بخش مدیریت دریافت میکند، پس از آنکه دهها نظر و پست مربوط به ۱۰ سال گذشته بهطور خودکار از این سابردیت حذف شدند، با سیل هشدارها مواجه شد.
دکتر سارا گیلبرت، یکی از مدیران (مدراتورها)، به من گفت: «و هیچ کاری از دست ما یا کارشناسانی [که محتوای حذفشده را ارسال کرده بودند] برنمیآمد.»
این موضوع به این دلیل صدمه زیادی به سابردیت وارد کرد که کاربران آن، این انجمن را به عنوان آرشیوی از پاسخهای دقیق میبینند که مدتها پس از انتشار محتوا، همچنان به آموزش افراد ادامه میدهند.
مدیران معتقدند که ابزارهای تعدیل هوش مصنوعی اخیراً بازسازیشدهی رددیت ظاهراً مسئول این حذفها بودهاند. پس از بازیابی متن برخی از پستها، یکی از مدیران AskHistorians متوجه شد که تمام محتوای حذفشده به Rare Historical Photos، یک وبسایت اشتراکگذاری تصاویر تاریخی، لینک داده بودند. مدیران فکر میکنند که رددیت ممکن است این وبسایت—و در نتیجه هر پستی که از محتوای آن برای تصاویر توضیحی استفاده کرده است—را به عنوان هرزنامه (اسپم) شناخته باشد.
رددیت به درخواست برای اظهارنظر پاسخ نداده است.
حذف این محتوا اطلاعات باارزشی را از بین برد که جمعآوری آنها زمانبر بود (گیلبرت به من میگوید برخی افراد ساعتها، «گاهی در طول چند روز»، تحقیق میکنند و به سوالات ارسالی به سابردیت پاسخ مینویسند). با این حال، این احتمال وجود دارد که آن حذفهای اشتباه، و موارد مشابه آن، به معیارهایی کمک کرده باشند که قصد دارند نشان دهند تعدیلگری هوش مصنوعی چقدر در رددیت مؤثر است.
رددیت میگوید به لطف هوش مصنوعی، «اقدامات اجرایی علیه محتوای نفرتآمیز و خشن را بیش از ۲۰۰ درصد افزایش داده است» و هوش مصنوعی «اجرای سریعتر و با حجم بیشتری را هدایت میکند». رددیت همین ماه اعلام کرد که هوش مصنوعی «به کاهش مواجهه با محتوای بالقوه مضر بیش از ۴۰ درصد کمک کرده است». این شرکت همچنین اعلام کرد که از مدلهای زبانی بزرگ (LLMs) برای شناسایی «الگوهای بسیار ظریف و هماهنگ رفتار جعلی و هایپ مصنوعی» استفاده میکند.
اما همانطور که ماجرای AskHistorians نشان میدهد، اجرای بیشتر لزوماً به معنای اجرای بهتر نیست.
مشکل مثبت کاذب
رشد هوش مصنوعی مولد موانع جدیدی را برای تعدیل محتوا در شبکههای اجتماعی ایجاد کرده است. برای مثال، گیلبرت خاطرنشان کرد که مدلهای زبانی بزرگ «تشخیص هرزنامه را بسیار سختتر کردهاند»، زیرا آنها تلاش میکنند صدای واقعی انسانها را تقلید کنند. او گفت: «طی دو تا سه ماه گذشته، ما کاملاً با باتهای هرزنامه مجهز به مدلهای زبانی بزرگ سیلزده شدهایم.»
آژانسهای بازاریابی در حال تولید محتوای شبکههای اجتماعی هستند که به گونهای طراحی شدهاند تا برندها توسط چتباتهای هوش مصنوعی نقل شوند. بازاریابان مدتهاست که از پستهای غیرمعتبر در شبکههای اجتماعی برای افزایش دیدهشدن استفاده کردهاند، اما ظهور چتباتها جبهه جدیدی را گشوده است. برای مثال، استارتاپ ReachLLM بهطور خاص روی بازاریابی از طریق چتباتها تمرکز دارد. به عنوان بخشی از این تلاش، نمایندگان شرکت سابردیتهایی را در رددیت ایجاد و مدیریت کردهاند.
این چالشها برخی از شرکتهای شبکههای اجتماعی را بر آن داشته است تا تکنیکهای جدید تعدیل مبتنی بر هوش مصنوعی را بررسی کنند. برای مثال، رددیت میگوید ابزارهای هوش مصنوعی آن «نزدیک به [۲ میلیون] رأی جعلی را روزانه باطل کردهاند» و از مدلهای زبانی بزرگ «برای کشف الگوهای بسیار ظریف و هماهنگ رفتار جعلی و هایپ مصنوعی که سیستمهای قدیمیتر زمانی از دست میدادند» استفاده میکند.
اما بسیاری از پلتفرمهای رسانههای اجتماعی بیش از حد به ابزارهای تعدیلگر هوش مصنوعی وابسته شدهاند که به سرعت کاربران را به خاطر محتوای بیخطر جریمه میکنند.
اخیراً، دیسکورد اعتراف کرد که سیستم تعدیل هوش مصنوعی آن در ماههای مه تا اوایل جولای، حدود ۸,۴۰۰ حساب کاربری را به اشتباه مسدود کرده است. این هوش مصنوعی تصاویری را که حاوی شبکههای مربعی شکل بودند، مانند صفحات شطرنج یا صفحات گسترده (اسپردشیت)، به اشتباه به عنوان محتوای سوءاستفاده جنسی از کودکان (CSAM) برچسبگذاری کرد و متعاقباً کاربران آپلودکننده را برای همیشه بن کرد. (دیسکورد میگوید تمام حسابهای آسیبدیده از آن زمان تاکنون بازگردانده شدهاند.)
این شرکت اعلام کرد که تعدیلگری هوش مصنوعی آن برای استفاده بدون نظارت انسان در نظر گرفته نشده است. این شرکت ادعا کرد که یک کارمند انسانی قرار است محتوای علامتگذاریشده توسط هوش مصنوعی را قبل از اقدام دیسکورد بررسی کند، اما وجود یک باگ باعث شد هوش مصنوعی مرحله انسانی را دور بزند و حسابها را مسدود کند.
این اتفاق ناگوار فرضی برجسته میکند که چرا محافظهای انسانی در تعدیل محتوا همچنان ضروری هستند. بدون نظارت معنادار، یک سیستم تعدیل مبتنی بر هوش مصنوعی میتواند در عرض چند هفته هزاران اشتباه با عواقبی ماندگار مرتکب شود.
از سال ۲۰۲۵، بسیاری از کاربران فیسبوک و اینستاگرام از مسدودسازیهای گستردهای که آن را به تعدیل هوش مصنوعی نسبت میدهند، شکایت کردهاند. عدم نظارت انسانی تنها باعث افزایش ناامیدی کاربرانی شده است که میگویند هیچ قانون را نقض نکردهاند، بهویژه از آنجا که هیچ راهی برای صحبت با یک کارمند متا درباره علت مسدود شدن یا نحوه بازگرداندن حساب وجود نداشته است. متا نگفته است که آیا هوش مصنوعی پشت این مسدودسازیها قرار دارد یا خیر، اما این شرکت در سالهای اخیر به طور فزایندهای به جای انسانها به تعدیل مبتنی بر هوش مصنوعی مولد تکیه کرده است؛ تبدیلی که برخی افراد، از جمله کارمندان متا، میگویند خیلی سریع در حال رخ دادن است.
تامبلر جامعه اجتماعی دیگری است که در آن سیستمهای تعدیل خودکار با شکست مواجه شدهاند. در ماه مارس، چندا نگاک، رئیس بخش ارتباطات در شرکت مادر تامبلر یعنی Automattic، به وبسایت ورج گفت که سیستمهای خودکار تامبلر در یک بعدازظهر «کمتر از ۲۰۰» حساب کاربری تامبلر را به اشتباه مسدود کردند.
و در سال ۲۰۲۵، کاربران تامبلر پس از آن که سیستمهای تعدیل محتوای خودکار این پلتفرم به اشتباه محتوا را به عنوان «بزرگسالان» (mature) علامتگذاری کردند و باعث کاهش دیدهشدن آن شدند، شکایت کردند. در هر دو مورد، کاربران هوش مصنوعی را مقصر دانستهاند. تامبلر هرگز تأیید نکرد که هوش مصنوعی باعث این مشکلات شده است، اما این شرکت گفته است که از «ترکیبی از طبقهبندی یادگیری ماشین و تعدیل انسانی» استفاده میکند.
تعدیل هوش مصنوعی میتواند برای شرکتهای شبکههای اجتماعی صرفهجویی مالی داشته باشد و به حذف سریعتر محتوای مضر کمک کند. اما تا زمانی که این سیستمها بتوانند اشتباهات پایهای را حذف کنند—مانند برچسبگذاری یک تصویر صفحه شطرنج به عنوان CSAM—آنها به نظارت انسانی نیاز دارند.
گیلبرت، مدیر (مدراتور) سابردیت AskHistorians گفت: «در گذشته که شفافیت بیشتری در سیستم وجود داشت، ما به طور معمول محتوای نفرتپراکنی را گزارش میکردیم و پاسخ خودکاری دریافت میکردیم که در واقع قوانین رددیت را نقض نکرده است، و این امر باعث میشد روند تجدیدنظر را آغاز کنیم. بنابراین اعتماد به آمار سخت است زیرا اعتماد به «قضاوت» سیستمهای رددیت دشوار است.»
او گفت که مثبتهای کاذب یک «مشکل بزرگ» در رددیت هستند.
سوگیریهای هوش مصنوعی
سیستمهای معمولی تعدیلکننده مبتنی بر هوش مصنوعی در شبکههای اجتماعی از طبقهبندیکنندههای یادگیری ماشین برای تحلیل پستها و شناسایی و علامتگذاری محتوایی که قوانین پلتفرم را نقض میکند، استفاده میکنند. اما برای یک ماشین دشوار است که ظرافتهای طعنه، هجو و اصطلاحات عامیانه را درک کند.
علاوه بر این، برخی تحقیقات (نمونههایی اینجا، اینجا و اینجا) نشان میدهند که گروههای حاشیهنشین میتوانند به طور نامتناسبی تحت تأثیر تعدیل هوش مصنوعی قرار گیرند. بدون نظارت انسانی، هوش مصنوعی میتواند در نهایت همان جوامعی را جریمه کند که در برابر محتوای نفرتانگیزی که سیستمها برای مبارزه با آن طراحی شدهاند، آسیبپذیرترند.
گیلبرت، که همچنین مدیر پژوهشی آزمایشگاه شهروندان و فناوری کرنل است، میگوید که «جمعیتهای حاشیهنشین و آسیبپذیر جزء کسانی هستند که بالاترین نرخهای تعدیل را تجربه میکنند، و این معمولاً نتیجه «مثبتهای کاذب» است»، که اغلب ناشی از مواردی مانند سخنرانی متقابل، بازپسگیری زبان (language reclamation) و «پاسخ به محتوای نفرتانگیز» است.
او افزود: «مثبتهای کاذب یک مسئله عدالت اجتماعی هستند. آنها به این معنایند که گروههایی که از پیش حاشیهنشین بودهاند، بیش از پیش خاموش و سانسور میشوند.»
مدیران هوش مصنوعی همچنین میتوانند جوامع را در خودمدیریتی کمتر مؤثر سازند. برای مثال، در رددیت، برخی از مدیران سابردیت ترجیح میدهند کاربرانی را که از لحن نفرتانگیز یا خشن استفاده میکنند، مسدود کنند. اما اگر هوش مصنوعی رددیت چنین محتوایی را قبل از اینکه یک مدیر انسانی آن را ببیند حذف کند، آن مدیران توانایی خود را در ارزیابی اینکه آیا مسدودسازی موجه است یا خیر، از دست میدهند.
از نظر دادن کنترل بیشتر به مدیران انسانی، رددیت این هفته از گسترش آزمایش Rules Hub خبر داد؛ مجموعهای از ابزارها که به مدیران انسانی اجازه میدهد «انتخاب کنند کدام قوانین باید به طور خودکار اجرا شوند، تصمیم بگیرند هنگام فعال شدن یک قانون چه اتفاقی بیفتد (ارسال به صف، فیلتر یا حذف)، تجربه را قبل از فعال کردن پیشنمایش کنند و گزارشها و بینشها را بررسی کنند». رددیت انتظار دارد که Rules Hub در نهایت جایگزین ابزار Automod شود که اساساً بر کلیدواژههای دقیق متکی است.
هوش مصنوعی یک ابزار است، نه راهحل
مدیرانی که با آنها صحبت کردهام بارها رشد انفجاری هوش مصنوعی مولد را مقصر افزایش محتوایی دانستهاند که قوانین مختص جامعه یا قوانین گستردهتر پلتفرم را نقض میکند. این یک مشکل جدی برای سایتهای شبکههای اجتماعی است که به مشارکت کاربران متکی هستند.
شرکتها به تلاش برای روشهای جدید جهت تعدیل مطمئنتر و مؤثرتر ادامه خواهند داد، اما کاهش ورودیهای انسانی یک گام به عقب است. محتوای کمتلاش تولید شده توسط هوش مصنوعی در حال تغییر چالشهایی است که تیمهای تعدیل با آن روبهرو هستند، اما این امر رویکردهای قویتری را ضروریتر میکند؛ جایی که تشخیص در مقیاس ماشینی میتواند با قضاوت و تخصص انسانی ترکیب شود.
همانطور که شبکههای اجتماعی بدون انسان هیچ ارزشی ندارند، تعدیل محتوا نیز نمیتواند بدون قرار گرفتن قضاوت انسانی در خط مقدم موفق شود.
انتشارات Advance Publications که مالک شرکت مادر Ars Technica یعنی Condé Nast است، بزرگترین سهامدار رددیت محسوب میشود.
نظر مهندس بهمن آبادی: اعتماد مطلق به هوش مصنوعی در تعدیل محتوا، به دلیل نرخ بالای مثبتهای کاذب و عدم درک ظرافتهای انسانی، نهتنها کیفیت جوامع آنلاین را تخریب میکند، بلکه به سانسور ناعادلانه کاربران میанجامد. در پلتفرمهای مقیاسپذیر، هوش مصنوعی باید صرفاً به عنوان ابزاری کمکی در کنار قضاوت و نظارت مستقیم انسانی عمل کند، نه جایگزین آن.
منبع: https://arstechnica.com/gadgets/2026/08/ai-isnt-enough-to-protect-social-media-communities-from-ai