جایگزینی تلفن گویای سنتی با ایجنت صوتی هوش مصنوعی

میلاد اصغری۱۷ شهریور ۱۴۰۵8 دقیقه مطالعه

تبدیل تلفن گویای سنتی به ایجنت صوتی، جایگزینی منوهای عددی و تو در تو با درک مکالمه زنده به زبان فارسی و اتصال بی‌واسطه به پایگاه‌های داده سازمانی است. این مهاجرت فنی از طریق پایپ‌لاینی شامل اتصال ترانک تلفنی، تبدیل گفتار به متن، پردازش معنایی متن توسط مدل زبانی و تولید صدای طبیعی انجام می‌شود؛ سامانه‌ای که بدون معطل کردن مشتری در صف‌های طولانی، مقصود تماس را می‌فهمد، تراکنش مدنظر را ثبت می‌کند و در صورت لزوم تماس را همراه با خلاصه اطلاعات به کارشناس انسانی تحویل می‌دهد.

سیستم‌های تعاملی صوتی قدیمی (IVR) سال‌هاست که کاربران را در دالان‌های خسته‌کننده‌ای مانند «برای بخش پشتیبانی عدد یک و برای امور مالی عدد دو را وارد کنید» گرفتار کرده‌اند. این رویکرد سنتی نه‌تنها بخش زیادی از تماس‌گیرندگان را پیش از اتصال کلافه می‌کند، بلکه حجم قابل‌توجهی از تماس‌های ساده و تکراری را روی دوش کارشناسان مرکز تماس می‌گذارد.

تفاوت تجربه کاربر: مقایسه منوی کلیدی با گفت‌وگوی روان

یک سناریوی مشخص در خدمات پس از فروش یک فروشگاه اینترنتی فرضی را در نظر بگیرید که مشتری قصد دارد زمان تحویل سفارش خود را تغییر دهد.

در ساختار سنتی IVR، مسیر مشتری این‌گونه شکل می‌گیرد: ۱. گوش دادن به پیام خوش‌آمدگویی و شنیدن فهرست گزینه‌های منوی اول. ۲. فشردن کلید مربوط به واحد رهگیری و توزیع مرسولات. ۳. گوش دادن به زیرمنوی دوم و وارد کردن شناسه پیگیری سفارش از طریق صفحه کلید گوشی تلفن (همراه با احتمال بالای اشتباه در تایپ ارقام). ۴. شنیدن گزینه‌های فرعی و در نهایت فشردن کلید «اتصال به اپراتور»، زیرا منوی خودکار گزینه‌ای اختصاصی برای «تغییر زمان تحویل در همان روز» ندارد. ۵. انتظار طولانی در صف موسیقی انتظار تا آزاد شدن نخستین کارشناس پاسخ‌گو.

در مقابل، تعامل از طریق یک ایجنت صوتی هوشمند مسیر متفاوتی را طی می‌کند:

  • مشتری تماس می‌گیرد و بدون معطلی در منو می‌گوید: «سلام، مرسوله من قرار بود امروز بیاد اما من تا عصر خونه نیستم، می‌شه فردا بفرستید؟»
  • سیستم از روی شناسه تماس‌گیرنده (Caller ID)، سوابق خریدار را بازخوانی کرده و آخرین بسته ارسالی را می‌یابد.
  • ایجنت پاسخ می‌دهد: «سلام. سفارش هدفون بی‌سیم شما ثبت شده است. امکان تحویل در نوبت عصر فردا فراهم است. آیا مایلید این زمان را ثبت کنم؟»
  • مشتری تایید می‌کند: «بله، ممنون می‌شم.»
  • ایجنت وضعیت سفارش را در نرم‌افزار انبارداری یا توزیع اصلاح کرده و پیامک تأیید ویرایش زمان تحویل را بی‌درنگ ارسال می‌کند.

تفاوت بنیادین در این است که ایجنت صوتی منتظر فشار دادن کلید نمی‌ماند؛ مقصود کاربر (Intent) را از میان کلام روزمره استخراج کرده و متغیرها (Entities) مانند روز، ساعت یا نام کالا را به مقادیر ساختاریافته تبدیل می‌کند.

معماری پایپ‌لاین صوت در مرکز تماس هوشمند

جایگزینی تلفن گویا نیازمند یکپارچه‌سازی چند زیرسیستم نرم‌افزاری است تا رفت‌وبرگشت صدا به طبیعی‌ترین شکل ممکن شکل بگیرد. این معماری شامل بخش‌های زیر است:

۱. درگاه تلفنی (VoIP/SIP Integration): تماس ورودی از خطوط مخابراتی یا سرورهای تلفنی محلی (مانند استریسک یا فیری‌پی‌بی‌ایکس) از طریق پروتکل SIP دریافت شده و جریان رسانه‌ای صدا (RTP) به سرور ایجنت هدایت می‌شود. ۲. تبدیل گفتار به متن (Speech-to-Text): صوت زنده تماس‌گیرنده دریافت شده و موتور تبدیل صوت با الگوریتم‌های بهینه‌شده برای زبان فارسی محاوره‌ای، واژگان را با وجود افت کیفیت ناشی از فشرده‌سازی شبکه مخابراتی به متن مکتوب تبدیل می‌کند. ۳. هسته تصمیم‌گیری زبانی: متن پیاده‌شده وارد مغز متفکر سیستم می‌شود. بسترهایی مانند اول ایجنت در این بخش وظیفه دارند نیت کاربر را شناسایی، پایگاه دانش را جستجو و در صورت نیاز، توابع سیستمی مرتبط را فرابخوانند. ۴. تبدیل متن به گفتار (Text-to-Speech): خروجی پردازش‌شده توسط موتور تولید صوت به کلام طبیعی و رسا با رعایت لحن فارسی و مکث‌های زبانی تبدیل شده و بلافاصله روی بستر صوتی برای تماس‌گیرنده بازپخش می‌شود.

بخش معماریداده ورودیداده خروجیچالش اصلی در پیاده‌سازی
ارتباط SIPسیگنال شبکه مخابراتیجریان صوتی فشردهنویز خط و افت بسته‌های شبکه
تبدیل صوت به متنجریان صوتی زندهمتن گفتاری فارسیاصطلاحات عامیانه و تداخل لهجه‌ها
هسته تصمیم‌گیریمتن و تاریخچه گفتگودستور عملیاتی یا پاسخفهم متغیرهای ضمنی بدون افت سرعت
تولید گفتار صوتیمتن خروجی ایجنتسیگنال صوتی قابل پخشطبیعی بودن لحن و جلوگیری از حس رباتیک

اجرای عملیات و یکپارچگی با سامانه‌ها (Tool Calling)

یک سیستم صوتی هوش مصنوعی بدون دسترسی به سامانه‌های درون‌سازمانی، کارکردی فراتر از یک متن‌خوان ساده نخواهد داشت. کارایی عملیاتی واقعی زمانی نمایان می‌شود که ایجنت بتواند فرآیندهای واقعی کسب‌وکار را از طریق فراخوانی توابع (Tool Calling) اجرا کند.

فرض کنید در یک کلینیک دندان‌پزشکی فرضی، بیماری تماس گرفته و می‌گوید: «می‌خواهم نوبت معاینه فردایم را لغو کنم.» جریان عملیاتی پشت صحنه به این صورت پیش می‌رود:

  • استعلام وضعیت پرونده: مدل بر پایه شماره تماس، متد جستجوی پرونده بیمار را فراخوانی می‌کند و وجود یک نوبت فعال در تاریخ اعلام‌شده را مورد سنجش قرار می‌دهد.
  • اجرای متد لغو: پس از تأیید مشخصات، ایجنت درخواست لغو را به وب‌سرویس نرم‌افزار نوبت‌دهی ارسال می‌کند.
  • دریافت پاسخ سرور و اطلاع‌رسانی: وب‌سرویس وضعیت را به «لغوشده» تغییر داده و ایجنت جمله‌ای مناسب به زبان طبیعی برای بیمار می‌خواند: «نوبت معاینه شما برای فردا با موفقیت لغو شد. در صورت تمایل به دریافت نوبت جدید در روزهای آینده، می‌توانم زمان‌های آزاد را برایتان بخوانم.»

برای تضمین پایداری چنین فرآیندی، ساختار تبادل داده میان هوش مصنوعی و وب‌سرویس‌ها باید در قالب شیوه‌نامه‌های استاندارد مشخص شود تا خطاها و پاسخ‌ندادن‌های احتمالی سرور مدیریت شده و مانع قطع ناگهانی تماس شود.

مدیریت فنی مکالمه تلفنی: تأخیر و قطع کلام (Barge-in)

مکالمه صوتی تفاوت بنیادینی با گفت‌وگوهای متنی در پیام‌رسان‌ها دارد. اگر در چت متنی چند ثانیه انتظار برای دریافت پیام طبیعی باشد، در مکالمه تلفنی هرگونه سکوت اضافه مکالمه را از ریتم خارج کرده و کاربر را به قطع تماس ترغیب می‌کند.

بهینه‌سازی زنجیره تأخیر (Latency Management)

در یک تماس زنده، زمان لازم برای تبدیل صوت به متن، پردازش در مدل زبانی، واکشی اطلاعات از دیتابیس و تبدیل مجدد متن به صوت باید در کوتاه‌ترین بازه ممکن مدیریت شود. راهکار فنی برای دستیابی به این سرعت، استفاده از معماری جریانی (Streaming) در تمام لایه‌ها است؛ به این معنا که موتور تبدیل متن به صوت منتظر دریافت تمام پاسخ نماند و با دریافت اولین بخش از کلمات، تولید صدا را آغاز کند.

قطع صحبت ایجنت توسط کاربر (Barge-in)

در تلفن‌های گویای قدیمی اگر سیستم در حال خواندن منوی طولانی بود، کاربر راهی جز صبر کردن یا وارد کردن پشت‌سرهم ارقام نداشت. در ایجنت هوشمند، مکانیزم تشخیص فعالیت صوتی (Voice Activity Detection) پیاده‌سازی می‌شود. اگر ایجنت در حال بیان شرایط دریافت خدمات باشد و تماس‌گیرنده بگوید «متوجه شدم، فقط نشانی شعبه رو بگید»، سیستم باید بلادرنگ صدای خروجی خود را قطع کرده و متناسب با قطع کلام مشتری، ادامه دهد.

چه زمانی ایجنت صوتی راهکار مناسبی نیست؟

ایجنت صوتی پاسخی همه‌کاره برای تمام سناریوهای تماس نیست و در موارد زیر استقرار آن توصیه نمی‌شود:

  • تماس‌های نیازمند بررسی اصالت با ریسک‌های قانونی شدید: در امور مربوط به تعهدات حقوقی سنگین یا تراکنش‌های حساس بانکی که نیازمند امضای الکترونیک، احراز هویت چندمرحله‌ای دیداری یا تطبیق امضا هستند، سیستم صوتی به‌تنهایی کفایت نمی‌کند.
  • فوریت‌های امدادی و بحران‌های حاد: در خدمات امداد و نجات پزشکی یا حوادث، درک موقعیت‌های پرالتهاب و واکنش‌های متغیر روانی نیازمند دخالت مستقیم ارزیاب انسانی است و تکیه بر الگوریتم‌های گفتاری ممکن است خسارت‌بار باشد.
  • مجموعه‌های فاقد زیرساخت پایدار داده‌ای: اگر اطلاعات انبار، قیمت‌گذاری یا نوبت‌دهی سازمان روی فایل‌های پراکنده ثبت می‌شود یا وب‌سرویس‌های آن دارای قطعی مکرر هستند، پیاده‌سازی ایجنت هوشمند تنها پاسخ‌های اشتباه را سریع‌تر و رسمی‌تر به گوش مخاطب می‌رساند.

پروتکل تحویل به کارشناس انسانی (Human Fallback)

یک سیستم پاسخ‌گویی هوشمند باید محدودیت‌های خود را بشناسد. انتقال تماس به اپراتور انسانی نقصی در سامانه نیست، بلکه سازوکاری برای جلوگیری از بن‌بست مکالمه است.

در شرایطی که کیفیت خط تماس بسیار نامناسب است، تماس‌گیرنده لحن به شدت ناراضی یا عصبانی دارد، یا پرسش مطروحه خارج از حدود تعریف‌شده برای سیستم است، فرآیند انتقال بدون قطعی (Warm Transfer) اجرا می‌شود. در این حالت، سامانه افزون بر هدایت خط به کارشناس، کارت خلاصه‌ای از مکالمه شامل مشخصات، مقصود کاربر، اطلاعات واکشی‌شده و دلیل ارجاع را روی مانیتور کارشناس بارگذاری می‌کند تا مخاطب مجبور به شرح دوباره مشکل خود از ابتدا نشود.

مراحل گام‌به‌گام مهاجرت از IVR به ایجنت صوتی

پیاده‌سازی موفق این سیستم مستلزم پیشبرد منظم مراحل زیر است:

۱. دسته‌بندی موضوعی تماس‌های گذشته: آرشیو تماس‌های پرتکرار پایش شده و درخواست‌هایی که ساختار مشخص دارند (نظیر استعلام مانده بدهی، ساعات کاری یا وضعیت ارسال کالا) برای فاز نخست انتخاب می‌شوند. ۲. آماده‌سازی وب‌سرویس‌ها: درگاه‌های امن برای استعلام و تغییر رکوردها طراحی و مستندسازی می‌شوند تا ایجنت بتواند دستورات عملیاتی را صادر کند. ۳. طراحی سناریو و خط‌مشی‌های لحن: دستورالعمل‌های مکالمه، نحوه برخورد با ابهام کلامی و شیوه پاسخ‌گویی بر اساس هویت سازمان مشخص می‌گردد. ۴. آزمون در مقیاس محدود: ترافیک تماس‌های خارج از ساعات کاری یا یک خط آزمایشی به ایجنت صوتی متصل می‌شود تا رفتار سامانه در مواجهه با طیف واقعی صداها سنجیده شود. ۵. بهینه‌سازی مداوم: با بررسی متن مکالمات ثبت‌شده، دایره واژگان جدید به سیستم اضافه شده و خطاهای رایج کاربران اصلاح می‌شوند تا در نهایت کل ترافیک ورودی بدون چالش هدایت شود.

هدف اصلی بهره‌گیری از ایجنت‌های صوتی، حذف ارزش کارشناسان نیست؛ بلکه رهاسازی آنان از وظایف فرسایشی و پاسخ به پرسش‌های یکنواخت است تا تخصص انسانی برای پیگیری پرونده‌های حساس و پیچیده متمرکز بماند.

رایگان امتحان کنید

پرسش‌های پرتکرار

پیش‌نیازهای فنی برای اتصال ایجنت صوتی به مرکز تلفن فعلی سازمان چیست؟

مرکز تلفن سازمان باید از پروتکل استاندارد SIP Trunk پشتیبانی کند (مانند سامانه‌های مبتنی بر Asterisk، FreePBX یا تجهیزات سخت‌افزاری سانترال سازگار با IP) و وب‌سرویس‌های داخلی (REST API) پایگاه داده برای خواندن و نوشتن اطلاعات تماس‌گیرندگان مهیا باشند.

چگونه می‌توان میزان تأخیر در پاسخ‌گویی صوتی را به کمترین حد رساند؟

با استقرار سرورهای پردازش گفتار در نزدیک‌ترین مراکز داده نسبت به سرور تلفنی، پیاده‌سازی سازوکار پردازش جریانی (Streaming) برای ارسال صوت پیش از پایان تولید متن و بهره‌گیری از مدل‌های سبک‌تر برای تشخیص نیت و اعتبارسنجی عبارات محاوره‌ای، وقفه صوتی به حداقل کاهش می‌یابد.

آیا ایجنت صوتی توانایی درک اصطلاحات محاوره‌ای یا لهجه‌های گوناگون فارسی را دارد؟

مدل‌های تبدیل گفتار به متن مدرن که روی پیکره‌های وسیع گویش‌های متنوع فارسی آموزش دیده‌اند، واژگان عامیانه و تفاوت‌های تلفظی را تشخیص می‌دهند. افزون بر این، مهندسی پرامپت دقیق در هسته زبانی به سیستم کمک می‌کند معنای کاربردی جملات محاوره‌ای را به متغیرهای سیستمی تبدیل کند.

اگر کاربر در میان مکالمه خواهان صحبت با شخص حقیقی باشد، سیستم چه فرآیندی را طی می‌کند؟

ایجنت صوتی با شناسایی کلماتی نظیر «می‌خواهم با اپراتور صحبت کنم»، فرآیند تحویل تماس را آغاز می‌کند. تماس بدون قطع شدن به صف کارشناسان وصل شده و خلاصه مکالمات همراه با اطلاعات واردشده، روی پنل کاری اپراتور قرار می‌گیرد تا نیاز به تکرار پرسش‌ها نباشد.

میلاد اصغری

میلاد اصغری، بنیانگذار اول ایجنت — پلتفرم فارسی ساخت و اجرای ایجنت هوش مصنوعی برای کسب‌وکارهای ایرانی.

هنوز سؤالی دارید؟

همین حالا از دستیار هوش مصنوعی اول ایجنت بپرسید، یا از راه‌های ارتباطی دیگر با تیم ما در تماس باشید.

تماس با ما
جایگزینی تلفن گویای سنتی با ایجنت صوتی هوش مصنوعی | اول ایجنت