AI isn’t enough to protect social media communities from AI

هوش مصنوعی برای محافظت از جوامع شبکه‌های اجتماعی در برابر هوش مصنوعی کافی نیست

چرا انسان‌ها به تعدیل‌گر انسانی نیاز دارند.

گاهی اوقات باید با آتش به جنگ آتش رفت. اما وقتی صحبت از محتوای زباله تولید شده توسط هوش مصنوعی و مطالب نفرت‌پراکنی به میان می‌آید که امنیت و ارزش پلتفرم‌های رسانه‌های اجتماعی را تهدید می‌کنند، افزودن آتش بیشتر—در اینجا یعنی هوش مصنوعی بیشتر—می‌تواند مشکل را بدتر کند.

در بهترین حالت، رسانه‌های اجتماعی می‌توانند پناهگاهی برای افرادی باشند که می‌خواهند تجربیات و دانش خود را به اشتراک بگذارند. شبکه‌های اجتماعی زمانی بیشترین نزدیکی را با این آرمان پیدا می‌کنند که کاربران محتوای معتبر و باارزشی را ارائه دهند؛ چه یک پست وبلاگ بسیار متفکرانه باشد و چه یک ویدیوی مفید درباره نحوه ساخت رایانه. تکیه صرف به ابزارهای هوش مصنوعی برای حفظ این اصالت، از درک آنچه رسانه‌های اجتماعی را در وهله اول ارزشمند می‌کند غافل می‌شود: یعنی انسان‌هایی که پشت آن قرار دارند.

حذف‌های اشتباه

در ماه آوریل، کانال اسلک مختص مدیران انجمن رددیت r/AskHistorians بسیار شلوغ بود. این کانال که به‌طور خودکار پیوندهایی به پیام‌های بخش مدیریت دریافت می‌کند، پس از آنکه ده‌ها نظر و پست مربوط به ۱۰ سال گذشته به‌طور خودکار از این ساب‌ردیت حذف شدند، با سیل هشدارها مواجه شد.

دکتر سارا گیلبرت، یکی از مدیران (مدراتورها)، به من گفت: «و هیچ کاری از دست ما یا کارشناسانی [که محتوای حذف‌شده را ارسال کرده بودند] برنمی‌آمد.»

این موضوع به این دلیل صدمه زیادی به ساب‌ردیت وارد کرد که کاربران آن، این انجمن را به عنوان آرشیوی از پاسخ‌های دقیق می‌بینند که مدت‌ها پس از انتشار محتوا، همچنان به آموزش افراد ادامه می‌دهند.

مدیران معتقدند که ابزارهای تعدیل هوش مصنوعی اخیراً بازسازی‌شده‌ی رددیت ظاهراً مسئول این حذف‌ها بوده‌اند. پس از بازیابی متن برخی از پست‌ها، یکی از مدیران AskHistorians متوجه شد که تمام محتوای حذف‌شده به Rare Historical Photos، یک وب‌سایت اشتراک‌گذاری تصاویر تاریخی، لینک داده بودند. مدیران فکر می‌کنند که رددیت ممکن است این وب‌سایت—و در نتیجه هر پستی که از محتوای آن برای تصاویر توضیحی استفاده کرده است—را به عنوان هرزنامه (اسپم) شناخته باشد.

رددیت به درخواست برای اظهارنظر پاسخ نداده است.

حذف این محتوا اطلاعات باارزشی را از بین برد که جمع‌آوری آن‌ها زمان‌بر بود (گیلبرت به من می‌گوید برخی افراد ساعت‌ها، «گاهی در طول چند روز»، تحقیق می‌کنند و به سوالات ارسالی به ساب‌ردیت پاسخ می‌نویسند). با این حال، این احتمال وجود دارد که آن حذف‌های اشتباه، و موارد مشابه آن، به معیارهایی کمک کرده باشند که قصد دارند نشان دهند تعدیل‌گری هوش مصنوعی چقدر در رددیت مؤثر است.

رددیت می‌گوید به لطف هوش مصنوعی، «اقدامات اجرایی علیه محتوای نفرت‌آمیز و خشن را بیش از ۲۰۰ درصد افزایش داده است» و هوش مصنوعی «اجرای سریع‌تر و با حجم بیشتری را هدایت می‌کند». رددیت همین ماه اعلام کرد که هوش مصنوعی «به کاهش مواجهه با محتوای بالقوه مضر بیش از ۴۰ درصد کمک کرده است». این شرکت همچنین اعلام کرد که از مدل‌های زبانی بزرگ (LLMs) برای شناسایی «الگوهای بسیار ظریف و هماهنگ رفتار جعلی و هایپ مصنوعی» استفاده می‌کند.

اما همان‌طور که ماجرای AskHistorians نشان می‌دهد، اجرای بیشتر لزوماً به معنای اجرای بهتر نیست.

مشکل مثبت کاذب

رشد هوش مصنوعی مولد موانع جدیدی را برای تعدیل محتوا در شبکه‌های اجتماعی ایجاد کرده است. برای مثال، گیلبرت خاطرنشان کرد که مدل‌های زبانی بزرگ «تشخیص هرزنامه را بسیار سخت‌تر کرده‌اند»، زیرا آن‌ها تلاش می‌کنند صدای واقعی انسان‌ها را تقلید کنند. او گفت: «طی دو تا سه ماه گذشته، ما کاملاً با بات‌های هرزنامه مجهز به مدل‌های زبانی بزرگ سیل‌زده شده‌ایم.»

آژانس‌های بازاریابی در حال تولید محتوای شبکه‌های اجتماعی هستند که به گونه‌ای طراحی شده‌اند تا برندها توسط چت‌بات‌های هوش مصنوعی نقل شوند. بازاریابان مدت‌هاست که از پست‌های غیرمعتبر در شبکه‌های اجتماعی برای افزایش دیده‌شدن استفاده کرده‌اند، اما ظهور چت‌بات‌ها جبهه جدیدی را گشوده است. برای مثال، استارتاپ ReachLLM به‌طور خاص روی بازاریابی از طریق چت‌بات‌ها تمرکز دارد. به عنوان بخشی از این تلاش، نمایندگان شرکت ساب‌ردیت‌هایی را در رددیت ایجاد و مدیریت کرده‌اند.

این چالش‌ها برخی از شرکت‌های شبکه‌های اجتماعی را بر آن داشته است تا تکنیک‌های جدید تعدیل مبتنی بر هوش مصنوعی را بررسی کنند. برای مثال، رددیت می‌گوید ابزارهای هوش مصنوعی آن «نزدیک به [۲ میلیون] رأی جعلی را روزانه باطل کرده‌اند» و از مدل‌های زبانی بزرگ «برای کشف الگوهای بسیار ظریف و هماهنگ رفتار جعلی و هایپ مصنوعی که سیستم‌های قدیمی‌تر زمانی از دست می‌دادند» استفاده می‌کند.

اما بسیاری از پلتفرم‌های رسانه‌های اجتماعی بیش از حد به ابزارهای تعدیل‌گر هوش مصنوعی وابسته شده‌اند که به سرعت کاربران را به خاطر محتوای بی‌خطر جریمه می‌کنند.

اخیراً، دیسکورد اعتراف کرد که سیستم تعدیل هوش مصنوعی آن در ماه‌های مه تا اوایل جولای، حدود ۸,۴۰۰ حساب کاربری را به اشتباه مسدود کرده است. این هوش مصنوعی تصاویری را که حاوی شبکه‌های مربعی شکل بودند، مانند صفحات شطرنج یا صفحات گسترده (اسپردشیت)، به اشتباه به عنوان محتوای سوءاستفاده جنسی از کودکان (CSAM) برچسب‌گذاری کرد و متعاقباً کاربران آپلودکننده را برای همیشه بن کرد. (دیسکورد می‌گوید تمام حساب‌های آسیب‌دیده از آن زمان تاکنون بازگردانده شده‌اند.)

این شرکت اعلام کرد که تعدیل‌گری هوش مصنوعی آن برای استفاده بدون نظارت انسان در نظر گرفته نشده است. این شرکت ادعا کرد که یک کارمند انسانی قرار است محتوای علامت‌گذاری‌شده توسط هوش مصنوعی را قبل از اقدام دیسکورد بررسی کند، اما وجود یک باگ باعث شد هوش مصنوعی مرحله انسانی را دور بزند و حساب‌ها را مسدود کند.

این اتفاق ناگوار فرضی برجسته می‌کند که چرا محافظ‌های انسانی در تعدیل محتوا همچنان ضروری هستند. بدون نظارت معنادار، یک سیستم تعدیل مبتنی بر هوش مصنوعی می‌تواند در عرض چند هفته هزاران اشتباه با عواقبی ماندگار مرتکب شود.

از سال ۲۰۲۵، بسیاری از کاربران فیس‌بوک و اینستاگرام از مسدودسازی‌های گسترده‌ای که آن را به تعدیل هوش مصنوعی نسبت می‌دهند، شکایت کرده‌اند. عدم نظارت انسانی تنها باعث افزایش ناامیدی کاربرانی شده است که می‌گویند هیچ قانون را نقض نکرده‌اند، به‌ویژه از آنجا که هیچ راهی برای صحبت با یک کارمند متا درباره علت مسدود شدن یا نحوه بازگرداندن حساب وجود نداشته است. متا نگفته است که آیا هوش مصنوعی پشت این مسدودسازی‌ها قرار دارد یا خیر، اما این شرکت در سال‌های اخیر به طور فزاینده‌ای به جای انسان‌ها به تعدیل مبتنی بر هوش مصنوعی مولد تکیه کرده است؛ تبدیلی که برخی افراد، از جمله کارمندان متا، می‌گویند خیلی سریع در حال رخ دادن است.

تامبلر جامعه اجتماعی دیگری است که در آن سیستم‌های تعدیل خودکار با شکست مواجه شده‌اند. در ماه مارس، چندا نگاک، رئیس بخش ارتباطات در شرکت مادر تامبلر یعنی Automattic، به وب‌سایت ورج گفت که سیستم‌های خودکار تامبلر در یک بعدازظهر «کمتر از ۲۰۰» حساب کاربری تامبلر را به اشتباه مسدود کردند.

و در سال ۲۰۲۵، کاربران تامبلر پس از آن که سیستم‌های تعدیل محتوای خودکار این پلتفرم به اشتباه محتوا را به عنوان «بزرگسالان» (mature) علامت‌گذاری کردند و باعث کاهش دیده‌شدن آن شدند، شکایت کردند. در هر دو مورد، کاربران هوش مصنوعی را مقصر دانسته‌اند. تامبلر هرگز تأیید نکرد که هوش مصنوعی باعث این مشکلات شده است، اما این شرکت گفته است که از «ترکیبی از طبقه‌بندی یادگیری ماشین و تعدیل انسانی» استفاده می‌کند.

تعدیل هوش مصنوعی می‌تواند برای شرکت‌های شبکه‌های اجتماعی صرفه‌جویی مالی داشته باشد و به حذف سریع‌تر محتوای مضر کمک کند. اما تا زمانی که این سیستم‌ها بتوانند اشتباهات پایه‌ای را حذف کنند—مانند برچسب‌گذاری یک تصویر صفحه شطرنج به عنوان CSAM—آن‌ها به نظارت انسانی نیاز دارند.

گیلبرت، مدیر (مدراتور) ساب‌ردیت AskHistorians گفت: «در گذشته که شفافیت بیشتری در سیستم وجود داشت، ما به طور معمول محتوای نفرت‌پراکنی را گزارش می‌کردیم و پاسخ خودکاری دریافت می‌کردیم که در واقع قوانین رددیت را نقض نکرده است، و این امر باعث می‌شد روند تجدیدنظر را آغاز کنیم. بنابراین اعتماد به آمار سخت است زیرا اعتماد به «قضاوت» سیستم‌های رددیت دشوار است.»

او گفت که مثبت‌های کاذب یک «مشکل بزرگ» در رددیت هستند.

سوگیری‌های هوش مصنوعی

سیستم‌های معمولی تعدیل‌کننده مبتنی بر هوش مصنوعی در شبکه‌های اجتماعی از طبقه‌بندی‌کننده‌های یادگیری ماشین برای تحلیل پست‌ها و شناسایی و علامت‌گذاری محتوایی که قوانین پلتفرم را نقض می‌کند، استفاده می‌کنند. اما برای یک ماشین دشوار است که ظرافت‌های طعنه، هجو و اصطلاحات عامیانه را درک کند.

علاوه بر این، برخی تحقیقات (نمونه‌هایی اینجا، اینجا و اینجا) نشان می‌دهند که گروه‌های حاشیه‌نشین می‌توانند به طور نامتناسبی تحت تأثیر تعدیل هوش مصنوعی قرار گیرند. بدون نظارت انسانی، هوش مصنوعی می‌تواند در نهایت همان جوامعی را جریمه کند که در برابر محتوای نفرت‌انگیزی که سیستم‌ها برای مبارزه با آن طراحی شده‌اند، آسیب‌پذیرترند.

گیلبرت، که همچنین مدیر پژوهشی آزمایشگاه شهروندان و فناوری کرنل است، می‌گوید که «جمعیت‌های حاشیه‌نشین و آسیب‌پذیر جزء کسانی هستند که بالاترین نرخ‌های تعدیل را تجربه می‌کنند، و این معمولاً نتیجه «مثبت‌های کاذب» است»، که اغلب ناشی از مواردی مانند سخنرانی متقابل، بازپس‌گیری زبان (language reclamation) و «پاسخ به محتوای نفرت‌انگیز» است.

او افزود: «مثبت‌های کاذب یک مسئله عدالت اجتماعی هستند. آن‌ها به این معنایند که گروه‌هایی که از پیش حاشیه‌نشین بوده‌اند، بیش از پیش خاموش و سانسور می‌شوند.»

مدیران هوش مصنوعی همچنین می‌توانند جوامع را در خودمدیریتی کمتر مؤثر سازند. برای مثال، در رددیت، برخی از مدیران ساب‌ردیت ترجیح می‌دهند کاربرانی را که از لحن نفرت‌انگیز یا خشن استفاده می‌کنند، مسدود کنند. اما اگر هوش مصنوعی رددیت چنین محتوایی را قبل از اینکه یک مدیر انسانی آن را ببیند حذف کند، آن مدیران توانایی خود را در ارزیابی اینکه آیا مسدودسازی موجه است یا خیر، از دست می‌دهند.

از نظر دادن کنترل بیشتر به مدیران انسانی، رددیت این هفته از گسترش آزمایش Rules Hub خبر داد؛ مجموعه‌ای از ابزارها که به مدیران انسانی اجازه می‌دهد «انتخاب کنند کدام قوانین باید به طور خودکار اجرا شوند، تصمیم بگیرند هنگام فعال شدن یک قانون چه اتفاقی بیفتد (ارسال به صف، فیلتر یا حذف)، تجربه را قبل از فعال کردن پیش‌نمایش کنند و گزارش‌ها و بینش‌ها را بررسی کنند». رددیت انتظار دارد که Rules Hub در نهایت جایگزین ابزار Automod شود که اساساً بر کلیدواژه‌های دقیق متکی است.

هوش مصنوعی یک ابزار است، نه راه‌حل

مدیرانی که با آن‌ها صحبت کرده‌ام بارها رشد انفجاری هوش مصنوعی مولد را مقصر افزایش محتوایی دانسته‌اند که قوانین مختص جامعه یا قوانین گسترده‌تر پلتفرم را نقض می‌کند. این یک مشکل جدی برای سایت‌های شبکه‌های اجتماعی است که به مشارکت کاربران متکی هستند.

شرکت‌ها به تلاش برای روش‌های جدید جهت تعدیل مطمئن‌تر و مؤثرتر ادامه خواهند داد، اما کاهش ورودی‌های انسانی یک گام به عقب است. محتوای کم‌تلاش تولید شده توسط هوش مصنوعی در حال تغییر چالش‌هایی است که تیم‌های تعدیل با آن روبه‌رو هستند، اما این امر رویکردهای قوی‌تری را ضروری‌تر می‌کند؛ جایی که تشخیص در مقیاس ماشینی می‌تواند با قضاوت و تخصص انسانی ترکیب شود.

همان‌طور که شبکه‌های اجتماعی بدون انسان هیچ ارزشی ندارند، تعدیل محتوا نیز نمی‌تواند بدون قرار گرفتن قضاوت انسانی در خط مقدم موفق شود.

انتشارات Advance Publications که مالک شرکت مادر Ars Technica یعنی Condé Nast است، بزرگ‌ترین سهام‌دار رددیت محسوب می‌شود.

نظر مهندس بهمن آبادی: اعتماد مطلق به هوش مصنوعی در تعدیل محتوا، به دلیل نرخ بالای مثبت‌های کاذب و عدم درک ظرافت‌های انسانی، نه‌تنها کیفیت جوامع آنلاین را تخریب می‌کند، بلکه به سانسور ناعادلانه کاربران می‌анجامد. در پلتفرم‌های مقیاس‌پذیر، هوش مصنوعی باید صرفاً به عنوان ابزاری کمکی در کنار قضاوت و نظارت مستقیم انسانی عمل کند، نه جایگزین آن.

منبع: https://arstechnica.com/gadgets/2026/08/ai-isnt-enough-to-protect-social-media-communities-from-ai