من یک آواتار دیجیتال تعاملی از خودم ساختم — و شما میتوانید با آن صحبت کنید
پس از تهیه یک آواتار تعاملی و آموزش آن برای بحث درباره کلاهبرداری در شرکتهای نوپا (venture fraud)،احساسات متناقضی نسبت به ساخت همزادهای هوش مصنوعی خودمان دارم.
هنگامی که الکساندرو وویتکا، مسئول امور شرکتی در استارتاپ تولید ویدیو Synthesia، تابستان امسال لینکی از جدیدترین عضو تیم روابط عمومیشان برای من فرستاد، تعجب کردم. این لینک مربوط به یک آواتار مجازی تعاملی از او بود که برای پاسخ به سوالات متداول مطبوعاتی درباره Synthesia، مانند اینکه چه کاری انجام میدهد و چگونه کار میکند، آموزش دیده بود. روز قبل از آن، من در پنلی حضور داشتم که افراد روابط عمومی از من میپرسیدند آیا با ارائههایی که از متنهای تولیدشده با هوش مصنوعی استفاده میکنند مشکلی دارم یا خیر. اما آواتار الکساندرو فراتر از این حرفها بود — به نظرم این مرحلهی غولآسا (نهایی) در استفاده از هوش مصنوعی در روابط عمومی بود.
در ماه سپتامبر، شرکت Synthesia مرا به دفتر جدید خود در نیویورک دعوت کرد. Synthesia که اصالتاً در بریتانیا مستقر است، یک استارتاپ داغ در زمینه آواتارهای دیجیتال در کنار شرکتهای دیگری مانند D-ID، HeyGen و Colossyan محسوب میشود. این شرکت اوایل امسال به ارزش ۴ میلیارد دلار رسید و سال گذشته اعلام کرد که از درآمد تکرارپذیر سالانه (ARR) ۱۰۰ میلیون دلاری عبور کرده است.
Synthesia به شرکتها اجازه میدهد با استفاده از آواتارهای هوش مصنوعی، ویدیوهای آموزشی تعاملی بسازند و اخیراً محصولی به نام Roleplay Sessions را راهاندازی کرده که به کارمندان امکان میدهد، بهعنوانمثال، ارائههای فروش را با یک آواتار تعاملی هوش مصنوعی تمرین کنند که به پاسخهای آنها واکنش نشان داده و به آنها نمره میدهد.
وقتی به مراسم افتتاحیه دفتر جدید رفتم و آنها پرسیدند که آیا دوست دارم آواتار هوش مصنوعی خودم را داشته باشم، حتی برای گفتن «بله» درنگ نکردم. البته که دلم میخواست همزاد دیجیتالم را داشته باشم. لباس آن روزم زیبا بود و موهایم در جای خود مرتب قرار داشتند.
Until I met my digital twin, I had been indifferent toward avatars, but I felt they would inevitably become part of everyday online life. I heard of people on Instagram creating them in their likenesses to help them make social content. I find it all to be very interesting, and it’s perhaps why I have no qualms now presenting to you my digital twin. This is the first time Synethsia has made a digital avatar for a journalist (or for anyone, period, outside of Voica). It is trained on my story about why venture-backed startups commit more fraud than non-VC-backed startups and will only answer questions about that story.
در ادامه، برای شروع کافی است روی «شروع در یک پنجره جدید» (start in a new window) کلیک کنید.
شما میتوانید سوالاتی از این دست بپرسید:
- چرا تصمیم گرفتم این مقاله را بنویسم؟
- موضوع این مقاله پژوهشی چیست؟
- پژوهشگران به چه نتایجی دست یافتند؟
برای ساخت این آواتار، وارد یک استودیوی فیلمبرداری کوچک واقع در دفتر Synthesia شدم؛ جایی که آنها عکسهای متعددی از من گرفتند و یک رکورد دو دقیقهای از صدایم ضبط کردند. من باید رضایت میدادم که این آواتارها ساخته شوند و خب، «دام دیجیتال» متولد شد. آنها یک آواتار شخصی برای من ساختند (که هر متنی را که به آن بدهم میخواند) — هم با عینک و هم بدون عینک — و همچنین دو آواتار تعاملی برای من ساختند (که میتوانند به من پاسخ دهند و به حرفهایم گوش دهند)، آنها نیز هم با عینک و هم بدون عینک.
ما مقالهای را برای آموزش آواتار تعاملی انتخاب کردیم و سپس یکی از تیمها آواتار تعاملی مرا ساخت که توسط ترکیبی از مدلهای تبدیل صوت به متن، ویدیو، زبان و تبدیل متن به صوت پشتیبانی میشود. پشته فناوری آواتار من شامل مدلهای ویدیو و صدای اختصاصی خودِ Synthesia است، اگرچه این شرکت به مشتریان اجازه میدهد جایگزینهایی را از آزمایشگاههای دیگر مانند Cartesia، ElevenLabs، Google یا OpenAI نیز انتخاب کنند. شرکتها همچنین میتوانند میزبانی آواتارهای خود را روی هر ابری که میخواهند انجام دهند یا هزینه میزبانی آن را به Synthesia پرداخت کنند.
مدل تبدیل صوت به متن، گفتههای افراد را به متن تبدیل میکند، مدل زبانی عاملیتمحور (agentic) معنای متن را درک میکند و میتواند بر اساس آن اقداماتی انجام دهد، مدل تبدیل متن به صوت، پاسخ را به فایل صوتی تبدیل میکند و در نهایت یک مدل ویدیویی (ساختهشده توسط Synthesia) هنگام صحبت کردن، آواتار را متحرک میسازد.
به طور کلی، شرکت Synthesia سه نوع محصول ارائه میکند — یک پلتفرم ایجاد و توزیع ویدیو با آواتارهای کلاسیک، که در آن شخص یک متن را تایپ میکند و آواتار آن را تکرار میکند؛ یک پلتفرم عاملیتمحور به نام Sessions که در آن افراد میتوانند در نظرسنجیها یا نقشآفرینیها (roleplay) با آواتارها تعامل داشته باشند؛ و یک پلتفرم API که در آن افراد میتوانند مدلهای ویدیو و صوتی Synthesia را با سایر خدمات فناوری ترکیب کنند تا آواتارهای تعاملی یا انواع دیگر محصولات را بسازند.
چند روز طول کشید تا تیم Synthesia آواتارهای مرا بسازد. ابتدا با نسخههای شخصیسازیشده شروع کردم و متن نسبتاً عمومی را تایپ کردم تا ببینم صدای هوش مصنوعی من چطور به نظر میرسد. از آن خواستم درباره اینکه چگونه پاییز به نیویورک رسیده است، یعنی فصل مورد علاقه من، صحبت کند. صدا نسبتاً دقیق بود و خوشحال شدم که هیچکدام از خشخشهای گلوی من را که هنگام ضبط نمونه صدا داشتم، منعکس نکرده بود.
آن را به چند نفر از دوستان غیرفناورم نشان دادم و آنها آن را هم جذاب و هم ترسناک یافتند.
سپس نسخه تعاملی را به آنها نشان دادم که قطعی (deterministic) است؛ یعنی فقط مطالبی را میگوید که برای پاسخگویی به آنها آموزش دیده است. در این مورد، موضوع همان مقاله کلاهبرداری سرمایهگذاری من بود. از آن سوالاتی پرسیدم، مثلاً اینکه قبل از TechCrunch کجا بودم و در کدام منطقه نیویورک زندگی میکنم، اما هر بار مرا به سمت همان مقاله هدایت میکرد.
دوستانم فکر نمیکردند صدا شباهت زیادی به صدای من داشته باشد و به نظرشان شباهت ظاهری آن به اندازه آواتار شخصی نبود، با این حال به اندازه کافی به واقعیت نزدیک بود که تا حدی ترسناک باشد. مادرم آن را «شگفتانگیز» نامید که تعریف بسیار بزرگی از سوی او محسوب میشود. او و پدرم مدام سعی میکردند سوالاتی بپرسند که «فقط خودشان میدانند» — اما مدل پاسخ نداد و هر بار آنها را به مقاله کلاهبرداری سرمایهگذاری ارجاع داد.
او پس از آزمایش مدل به شوخی گفت: «یادم نمیآید دو تا از تو را به دنیا آورده باشم.»
این تجربه باعث شد به این فکر کنم که آینده روزنامهنگاری چگونه میتواند باشد. آیا مردم مشکلی با این ندارند که اخبار را روشن کنند و توسط یک آواتار ارائه شود؟ یک سرمایهگذار بلافاصله به من گفت نه. مطمئناً امروزه واکنشهای منفی زیادی نسبت به محتواهای زباله تولید شده با هوش مصنوعی که شبکههای اجتماعی و سایر پلتفرمهای اشتراکگذاری خبر را تسخیر کردهاند، وجود دارد. اما دیگرانی که از آنها پرسیدم چندان مطمئن نبودند. آیا آواتارها میتوانند جایگزین روزنامهنگاران شوند یا آنها را تقویت کنند؟ آیا مدیران عامل ترجیح میدهند با یک آواتار هوش مصنوعی از یک روزنامهنگار صحبت کنند تا یک انسان واقعی؟
آنچه من در مورد حرفهام دوست دارم، ارتباط با مردم، نوشتن داستانها و تحقیق درباره موضوعات جدید است. اما بزرگترین بخش روزنامهنگاری اعتماد است. به نظر نمیرسد این ویژگی بتواند هرگز به یک هوش مصنوعی برونسپاری شود.
در خارج از دنیای روزنامهنگاری، مطمئنم که ایده همزادسازی خودتان میتواند جذاب باشد. دیگر نیازی به عقبافتادگی در کارها پس از یک تعطیلی یا مسافرت نیست، زیرا نسلی از شما همیشه میتواند حضور داشته باشد و به سوالات پاسخ دهد.
باید ببینیم استفاده از آواتارها در شرکتهای بزرگ آمریکایی چگونه تکامل مییابد. اما حالا که من آواتار خودم را دارم، احساسات متناقضی دارم. پس از اینکه جذابیت اولیه آن فروکش کرد، آواتارم را پس از اینکه صحبتش تمام شد و منتظر ماند، به دقت بررسی کردم — برای چه چیزی، مطمئن نیستم. شاید منتظرم پلک بزند. یا چیز جدیدی بگوید، یا لبخند بزند، یا صرفاً به من بفهماند که میداند.
از آنجا که همزادهای دیجیتال من قطعی (deterministic) هستند، هرگز چنین کاری نخواهند کرد. اما میتوانم درک کنم که افتادن در دام روانپریشی هوش مصنوعی با یک مدل غیرقطعی (nondeterministic) — یعنی مدلی که توسط یک چتبات آزاد برای اظهارنظر هدایت میشود — چقدر میتواند آسان باشد.
به یک سرمایهگذار گفتم که آینده همزادهای دیجیتال هرچه که باشد، پیشبینی میکنم نسل من، یعنی نسل Z، احتمالاً به آنها عادت نخواهد کرد. آنها حس فیلمهای علمی-تخیلی را دارند: هر چیزی که تاکنون در فیلمی دیدهایم، اکنون اینجاست. اما باید بگویم، آواتارهای دیجیتال را کمتر از انساننماها (humanoids) آزاردهنده میدانم. حداقل با یک آواتار، اگر اوضاع عجیب شود، همیشه میتوانم از سیستم خارج شوم.
با این حال، تا آن زمان، این آواتار شخصی من است که مروری بر تمام مطالب برتر وبسایت ما در این هفته را به شما ارائه میدهد!
نظر مهندس بهمن آبادی: گسترش آواتارهای تعاملی مبتنی بر معماریهای Agentic و مدلهای صوت و تصویر، فراتر از یک ابزار سرگرمی، تحولی عمیق در تعاملات دیجیتال و ساختار پشتههای فناوری سازمانی است. با این حال، چالش اصلی در پیادهسازی این همزادها، حفظ مرز میان پاسخهای قطعی (Deterministic) و توهمات هوش مصنوعی است تا اعتماد کاربران خدشهدار نشود. به عنوان توسعهدهنده، باید بپذیریم که هرچند اتوماسیون فرآیندهای ارتباطی با APIهای هوش مصنوعی جذاب است، اما در حوزههایی مانند تولید محتوا، اصالت انسانی و اعتماد عاملانهای که قابل برونسپاری نیست، همچنان خط قرمز سیستم محسوب میشود.