I created an interactive digital avatar of myself — and you can talk to it

من یک آواتار دیجیتال تعاملی از خودم ساختم — و شما می‌توانید با آن صحبت کنید

پس از تهیه یک آواتار تعاملی و آموزش آن برای بحث درباره کلاهبرداری در شرکت‌های نوپا (venture fraud)،احساسات متناقضی نسبت به ساخت همزادهای هوش مصنوعی خودمان دارم.
Image Credits:Synthesia / TechCrunch

هنگامی که الکساندرو وویتکا، مسئول امور شرکتی در استارتاپ تولید ویدیو Synthesia، تابستان امسال لینکی از جدیدترین عضو تیم روابط عمومی‌شان برای من فرستاد، تعجب کردم. این لینک مربوط به یک آواتار مجازی تعاملی از او بود که برای پاسخ به سوالات متداول مطبوعاتی درباره Synthesia، مانند اینکه چه کاری انجام می‌دهد و چگونه کار می‌کند، آموزش دیده بود. روز قبل از آن، من در پنلی حضور داشتم که افراد روابط عمومی از من می‌پرسیدند آیا با ارائه‌هایی که از متن‌های تولیدشده با هوش مصنوعی استفاده می‌کنند مشکلی دارم یا خیر. اما آواتار الکساندرو فراتر از این حرف‌ها بود — به نظرم این مرحله‌ی غول‌آسا (نهایی) در استفاده از هوش مصنوعی در روابط عمومی بود.

در ماه سپتامبر، شرکت Synthesia مرا به دفتر جدید خود در نیویورک دعوت کرد. Synthesia که اصالتاً در بریتانیا مستقر است، یک استارتاپ داغ در زمینه آواتارهای دیجیتال در کنار شرکت‌های دیگری مانند D-ID، HeyGen و Colossyan محسوب می‌شود. این شرکت اوایل امسال به ارزش ۴ میلیارد دلار رسید و سال گذشته اعلام کرد که از درآمد تکرارپذیر سالانه (ARR) ۱۰۰ میلیون دلاری عبور کرده است.

Synthesia به شرکت‌ها اجازه می‌دهد با استفاده از آواتارهای هوش مصنوعی، ویدیوهای آموزشی تعاملی بسازند و اخیراً محصولی به نام Roleplay Sessions را راه‌اندازی کرده که به کارمندان امکان می‌دهد، به‌عنوان‌مثال، ارائه‌های فروش را با یک آواتار تعاملی هوش مصنوعی تمرین کنند که به پاسخ‌های آن‌ها واکنش نشان داده و به آن‌ها نمره می‌دهد.

وقتی به مراسم افتتاحیه دفتر جدید رفتم و آن‌ها پرسیدند که آیا دوست دارم آواتار هوش مصنوعی خودم را داشته باشم، حتی برای گفتن «بله» درنگ نکردم. البته که دلم می‌خواست همزاد دیجیتالم را داشته باشم. لباس آن روزم زیبا بود و موهایم در جای خود مرتب قرار داشتند.

Until I met my digital twin, I had been indifferent toward avatars, but I felt they would inevitably become part of everyday online life. I heard of people on Instagram creating them in their likenesses to help them make social content. I find it all to be very interesting, and it’s perhaps why I have no qualms now presenting to you my digital twin. This is the first time Synethsia has made a digital avatar for a journalist (or for anyone, period, outside of Voica). It is trained on my story about why venture-backed startups commit more fraud than non-VC-backed startups and will only answer questions about that story.

در ادامه، برای شروع کافی است روی «شروع در یک پنجره جدید» (start in a new window) کلیک کنید.

شما می‌توانید سوالاتی از این دست بپرسید:

  • چرا تصمیم گرفتم این مقاله را بنویسم؟
  • موضوع این مقاله پژوهشی چیست؟
  • پژوهشگران به چه نتایجی دست یافتند؟

برای ساخت این آواتار، وارد یک استودیوی فیلم‌برداری کوچک واقع در دفتر Synthesia شدم؛ جایی که آن‌ها عکس‌های متعددی از من گرفتند و یک رکورد دو دقیقه‌ای از صدایم ضبط کردند. من باید رضایت می‌دادم که این آواتارها ساخته شوند و خب، «دام دیجیتال» متولد شد. آن‌ها یک آواتار شخصی برای من ساختند (که هر متنی را که به آن بدهم می‌خواند) — هم با عینک و هم بدون عینک — و همچنین دو آواتار تعاملی برای من ساختند (که می‌توانند به من پاسخ دهند و به حرف‌هایم گوش دهند)، آن‌ها نیز هم با عینک و هم بدون عینک.

ما مقاله‌ای را برای آموزش آواتار تعاملی انتخاب کردیم و سپس یکی از تیم‌ها آواتار تعاملی مرا ساخت که توسط ترکیبی از مدل‌های تبدیل صوت به متن، ویدیو، زبان و تبدیل متن به صوت پشتیبانی می‌شود. پشته فناوری آواتار من شامل مدل‌های ویدیو و صدای اختصاصی خودِ Synthesia است، اگرچه این شرکت به مشتریان اجازه می‌دهد جایگزین‌هایی را از آزمایشگاه‌های دیگر مانند Cartesia، ElevenLabs، Google یا OpenAI نیز انتخاب کنند. شرکت‌ها همچنین می‌توانند میزبانی آواتارهای خود را روی هر ابری که می‌خواهند انجام دهند یا هزینه میزبانی آن را به Synthesia پرداخت کنند.

مدل تبدیل صوت به متن، گفته‌های افراد را به متن تبدیل می‌کند، مدل زبانی عاملیت‌محور (agentic) معنای متن را درک می‌کند و می‌تواند بر اساس آن اقداماتی انجام دهد، مدل تبدیل متن به صوت، پاسخ را به فایل صوتی تبدیل می‌کند و در نهایت یک مدل ویدیویی (ساخته‌شده توسط Synthesia) هنگام صحبت کردن، آواتار را متحرک می‌سازد.

به طور کلی، شرکت Synthesia سه نوع محصول ارائه می‌کند — یک پلتفرم ایجاد و توزیع ویدیو با آواتارهای کلاسیک، که در آن شخص یک متن را تایپ می‌کند و آواتار آن را تکرار می‌کند؛ یک پلتفرم عاملیت‌محور به نام Sessions که در آن افراد می‌توانند در نظرسنجی‌ها یا نقش‌آفرینی‌ها (roleplay) با آواتارها تعامل داشته باشند؛ و یک پلتفرم API که در آن افراد می‌توانند مدل‌های ویدیو و صوتی Synthesia را با سایر خدمات فناوری ترکیب کنند تا آواتارهای تعاملی یا انواع دیگر محصولات را بسازند.

چند روز طول کشید تا تیم Synthesia آواتارهای مرا بسازد. ابتدا با نسخه‌های شخصی‌سازی‌شده شروع کردم و متن نسبتاً عمومی را تایپ کردم تا ببینم صدای هوش مصنوعی من چطور به نظر می‌رسد. از آن خواستم درباره اینکه چگونه پاییز به نیویورک رسیده است، یعنی فصل مورد علاقه من، صحبت کند. صدا نسبتاً دقیق بود و خوشحال شدم که هیچ‌کدام از خش‌خش‌های گلوی من را که هنگام ضبط نمونه صدا داشتم، منعکس نکرده بود.

آن را به چند نفر از دوستان غیرفناورم نشان دادم و آن‌ها آن را هم جذاب و هم ترسناک یافتند.

سپس نسخه تعاملی را به آن‌ها نشان دادم که قطعی (deterministic) است؛ یعنی فقط مطالبی را می‌گوید که برای پاسخگویی به آن‌ها آموزش دیده است. در این مورد، موضوع همان مقاله کلاهبرداری سرمایه‌گذاری من بود. از آن سوالاتی پرسیدم، مثلاً اینکه قبل از TechCrunch کجا بودم و در کدام منطقه نیویورک زندگی می‌کنم، اما هر بار مرا به سمت همان مقاله هدایت می‌کرد.

دوستانم فکر نمی‌کردند صدا شباهت زیادی به صدای من داشته باشد و به نظرشان شباهت ظاهری آن به اندازه آواتار شخصی نبود، با این حال به اندازه کافی به واقعیت نزدیک بود که تا حدی ترسناک باشد. مادرم آن را «شگفت‌انگیز» نامید که تعریف بسیار بزرگی از سوی او محسوب می‌شود. او و پدرم مدام سعی می‌کردند سوالاتی بپرسند که «فقط خودشان می‌دانند» — اما مدل پاسخ نداد و هر بار آن‌ها را به مقاله کلاهبرداری سرمایه‌گذاری ارجاع داد.

او پس از آزمایش مدل به شوخی گفت: «یادم نمی‌آید دو تا از تو را به دنیا آورده باشم.»

این تجربه باعث شد به این فکر کنم که آینده روزنامه‌نگاری چگونه می‌تواند باشد. آیا مردم مشکلی با این ندارند که اخبار را روشن کنند و توسط یک آواتار ارائه شود؟ یک سرمایه‌گذار بلافاصله به من گفت نه. مطمئناً امروزه واکنش‌های منفی زیادی نسبت به محتواهای زباله تولید شده با هوش مصنوعی که شبکه‌های اجتماعی و سایر پلتفرم‌های اشتراک‌گذاری خبر را تسخیر کرده‌اند، وجود دارد. اما دیگرانی که از آن‌ها پرسیدم چندان مطمئن نبودند. آیا آواتارها می‌توانند جایگزین روزنامه‌نگاران شوند یا آن‌ها را تقویت کنند؟ آیا مدیران عامل ترجیح می‌دهند با یک آواتار هوش مصنوعی از یک روزنامه‌نگار صحبت کنند تا یک انسان واقعی؟

آنچه من در مورد حرفه‌ام دوست دارم، ارتباط با مردم، نوشتن داستان‌ها و تحقیق درباره موضوعات جدید است. اما بزرگ‌ترین بخش روزنامه‌نگاری اعتماد است. به نظر نمی‌رسد این ویژگی بتواند هرگز به یک هوش مصنوعی برونسپاری شود.

در خارج از دنیای روزنامه‌نگاری، مطمئنم که ایده همزادسازی خودتان می‌تواند جذاب باشد. دیگر نیازی به عقب‌افتادگی در کارها پس از یک تعطیلی یا مسافرت نیست، زیرا نسلی از شما همیشه می‌تواند حضور داشته باشد و به سوالات پاسخ دهد.

باید ببینیم استفاده از آواتارها در شرکت‌های بزرگ آمریکایی چگونه تکامل می‌یابد. اما حالا که من آواتار خودم را دارم، احساسات متناقضی دارم. پس از اینکه جذابیت اولیه آن فروکش کرد، آواتارم را پس از اینکه صحبتش تمام شد و منتظر ماند، به دقت بررسی کردم — برای چه چیزی، مطمئن نیستم. شاید منتظرم پلک بزند. یا چیز جدیدی بگوید، یا لبخند بزند، یا صرفاً به من بفهماند که می‌داند.

از آنجا که همزادهای دیجیتال من قطعی (deterministic) هستند، هرگز چنین کاری نخواهند کرد. اما می‌توانم درک کنم که افتادن در دام روان‌پریشی هوش مصنوعی با یک مدل غیرقطعی (nondeterministic) — یعنی مدلی که توسط یک چت‌بات آزاد برای اظهارنظر هدایت می‌شود — چقدر می‌تواند آسان باشد.

به یک سرمایه‌گذار گفتم که آینده همزادهای دیجیتال هرچه که باشد، پیش‌بینی می‌کنم نسل من، یعنی نسل Z، احتمالاً به آن‌ها عادت نخواهد کرد. آن‌ها حس فیلم‌های علمی-تخیلی را دارند: هر چیزی که تاکنون در فیلمی دیده‌ایم، اکنون اینجاست. اما باید بگویم، آواتارهای دیجیتال را کمتر از انسان‌نماها (humanoids) آزاردهنده می‌دانم. حداقل با یک آواتار، اگر اوضاع عجیب شود، همیشه می‌توانم از سیستم خارج شوم.

با این حال، تا آن زمان، این آواتار شخصی من است که مروری بر تمام مطالب برتر وب‌سایت ما در این هفته را به شما ارائه می‌دهد!

نظر مهندس بهمن آبادی: گسترش آواتارهای تعاملی مبتنی بر معماری‌های Agentic و مدل‌های صوت و تصویر، فراتر از یک ابزار سرگرمی، تحولی عمیق در تعاملات دیجیتال و ساختار پشته‌های فناوری سازمانی است. با این حال، چالش اصلی در پیاده‌سازی این همزادها، حفظ مرز میان پاسخ‌های قطعی (Deterministic) و توهمات هوش مصنوعی است تا اعتماد کاربران خدشه‌دار نشود. به عنوان توسعه‌دهنده، باید بپذیریم که هرچند اتوماسیون فرآیندهای ارتباطی با APIهای هوش مصنوعی جذاب است، اما در حوزه‌هایی مانند تولید محتوا، اصالت انسانی و اعتماد عاملانه‌ای که قابل برونسپاری نیست، همچنان خط قرمز سیستم محسوب می‌شود.

منبع: https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/