به‌روزرسانی خودکار پایگاه دانش از تیکت‌ها

میلاد اصغری۱۱ شهریور ۱۴۰۵5 دقیقه مطالعه

به‌روزرسانی پایگاه دانش از تیکت‌ها و مکالمات پشتیبانی از طریق یک چرخه منظم شامل فیلتر مکالمات موفق، پاک‌سازی اطلاعات هویتی، کشف شکاف‌های دانشی، تولید پیش‌نویس پرسش‌وپاسخ و بازبینی انسانی انجام می‌شود. این رویکرد به سیستم‌های مبتنی بر بازیابی اطلاعات و ایجنت‌های هوشمند اجازه می‌دهد همگام با تغییرات محصول و ابهامات تازه کاربران رشد کنند، بدون آنکه اطلاعات غلط یا داده‌های حساس وارد حافظه سیستم شوند.

تیم‌های پشتیبانی روزانه صدها پاسخ به مشکلات واقعی کاربران می‌دهند، اما به دلیل حجم بالای کاری، اسناد راهنما و پایگاه دانش سازمانی معمولاً پس از چند ماه قدیمی و بلااستفاده می‌شوند. ساخت یک پایپ‌لاین خودکار برای انتقال تجربه کارشناسان به پایگاه دانش، این شکاف را برطرف می‌کند.

۱. پالایش، فیلتر و ناشناس‌سازی داده‌ها

ورودی خام هرگز نباید مستقیماً وارد پایگاه دانش شود. بخش عمده‌ای از تیکت‌ها شامل تعارفات، پیگیری‌های ناموفق یا مکالمات ناتمام است. برای شروع، فیلترهای زیر را روی دیتابیس تیکتینگ یا تاریخچه چت‌ها اعمال کنید:

  1. فیلتر وضعیت نهایی: فقط تیکت‌هایی را جدا کنید که برچسب «حل‌شده» (Resolved) دارند و کاربر رضایت خود را در نظرسنجی پایانی ثبت کرده است.
  2. جداسازی نویز: پیام‌های با طول کمتر از ده کلمه یا پیام‌های صرفاً تشکرآمیز را از تحلیل خارج کنید.
  3. ناشناس‌سازی اطلاعات هویتی (PII): پیش از ارسال داده به هر مدل زبانی، باید تمام داده‌های حساس شامل شماره کارت، شماره موبایل، آدرس، کد ملی و شناسه‌های اختصاصی کاربر با الگوهای منظم (Regex) یا مدل‌های تشخیص موجودیت نام‌دار (NER) به مقادیر عمومی مانند [PHONE] یا [CARD_NUMBER] تبدیل شوند.

برای مثال، در یک فروشگاه اینترنتی فرضی، اگر کاربری شماره سفارش و تلفن خود را برای پیگیری ارسال مرسوله فرستاده باشد، متن پاک‌سازی‌شده باید فقط مشکل فنی (علت تاخیر ارسال با پست پیشتاز) و پاسخ کارشناس را نگه دارد و اطلاعات شخصی کاربر را به طور کامل حذف کند.

۲. خوشه‌بندی و کشف شکاف دانشی

هدف این مرحله، پیدا کردن سوالاتی است که پایگاه دانش فعلی پاسخ مشخصی برای آن‌ها ندارد اما توسط چندین کاربر تکرار شده‌اند.

در این مرحله، پیام‌های کاربران تبدیل به بردارهای معنایی (Embedding) می‌شوند. سپس فاصله معنایی این پیام‌ها با اسناد موجود در پایگاه داده برداری مقایسه می‌گردد:

  • معیار شباهت کمتر از حد آستانه: اگر شباهت معنایی پیام کاربر با نزدیک‌ترین سند موجود در پایگاه دانش کمتر از مقدار مشخصی (مثلاً ۰.۷۵ در معیار کسینوسی) باشد، این پرسش به عنوان «موضوع فاقد پوشش» ثبت می‌شود.
  • خوشه‌بندی تجمعی: پیام‌های فاقد پوشش با الگوریتم‌های خوشه‌بندی دسته‌بندی می‌شوند. اگر حداقل پنج کاربر در طول یک هفته درباره موضوعی مشابه (مانند خطای درگاه پرداخت جدید) سوال پرسیده باشند، یک خوشه جدید تشکیل می‌شود که نشان‌دهنده یک شکاف دانشی واقعی است.

۳. تولید پیش‌نویس پرسش‌وپاسخ اتمیک

مکالمات محاوره‌ای پشتیبانی برای جست‌وجوی مستقیم مناسب نیستند. یک مدل زبانی باید متن گفتگو را به یک سند مستقل، خلاصه و دقیق تبدیل کند.

ساختار استاندارد برای ذخیره این دانش به صورت «پرسش‌وپاسخ اتمیک» (Atomic FAQ) است. در پرامپت تولید محتوا باید قواعد زیر رعایت شود:

  • استقلال متنی: پاسخ نباید به گذشته گفتگو وابسته باشد و باید بدون نیاز به توضیحات اضافه، مشکل را حل کند.
  • حذف عبارات زمانی نسبی: کلماتی مانند «دیروز»، «از فردا» یا «در آپدیت اخیر» باید به توضیحات فنی دقیق تبدیل شوند.
  • ثبت ابرداده (Metadata): برچسب‌هایی شامل نسخه محصول، دسته‌بندی موضوعی و کلمات کلیدی مترادف در کنار سند ثبت شوند.

به عنوان نمونه، اگر بیست کاربر در مورد خطای اتصال به درگاه بانکی سوال پرسیده‌اند، خروجی این مرحله یک سند دانشی با عنوان «راهنمای رفع خطای کد ۱۰۰ در پرداخت اینترنتی» همراه با مراحل گام‌به‌گام خواهد بود.

با استفاده از زیرساخت اول ایجنت می‌توانید اسناد و داده‌های ساختاریافته کسب‌وکار خود را مدیریت کرده و ایجنت‌های پاسخ‌گو را مستقیماً بر اساس اطلاعات معتبر سازمان آموزش دهید.

۴. نظارت انسانی و اعتبارسنجی (Human-in-the-Loop)

اتوماسیون کامل و بدون نظارت در مدیریت دانش سازمانی ریسک بالایی دارد؛ زیرا ممکن است یک پاسخ موقت کارشناس پشتیبانی به عنوان قانون همیشگی شرکت ثبت شود.

وضعیت سندشرط اعتبارسنجیاقدام مورد نیاز
اطمینان بالاشباهت کامل با رویه‌های استاندارد و تکرار پاسخ یکسان توسط چند کارشناسقرارگیری در صف تایید سریع با یک کلیک مدیر پشتیبانی
مغایرت بالقوهتناقض جزیی با اسناد قدیمی یا تغییر در قوانین مرجوعی کالاارجاع به کارشناس ارشد جهت بازنویسی و اصلاح متنی
رد خودکارحاوی قیمت‌های تخفیفی مقطعی، کدهای تخفیف موقت یا نام افرادحذف از صف و عدم ورود به پایگاه دانش

این مرحله از ورود پاسخ‌های تاریخ‌گذشته، تخفیف‌های منقضی و توهمات مدل زبانی به هسته دانشی کسب‌وکار جلوگیری می‌کند.

۵. ایندکس‌گذاری، نسخه‌بندی و ابطال اسناد قبلی

پس از تایید سند توسط انسان، محتوای جدید باید در سیستم جست‌وجوی معنایی بارگذاری شود. این فرآیند دو بخش فنی مهم دارد:

  1. نسخه‌بندی اسناد (Versioning): اگر سند جدید اصلاحیه یک پاسخ قبلی است، سند قدیمی باید برچسب «منقضی» (Deprecated) بخورد تا در بازیابی معنایی وزن کمتری داشته باشد یا به طور کامل آرشیو شود.
  2. تولید مجدد امبدینگ: متن پردازش‌شده به بردارهای عددی جدید تبدیل و در پایگاه داده ذخیره می‌شود تا ایجنت هوشمند در مکالمات بعدی بدون تاخیر از آن استفاده کند.

چه زمانی این راهکار مناسب نیست؟

این پایپ‌لاین برای تمام مسائل پشتیبانی راهکار مناسبی به شمار نمی‌رود و محدودیت‌های مشخصی دارد:

  • فرآیندهای مالی و حقوقی پیچیده: تیکت‌هایی که نیازمند محاسبات خاص مالی، بررسی قراردادهای اختصاصی یا تصمیم‌گیری موردی هستند، نباید به سند عمومی پایگاه دانش تبدیل شوند.
  • مشکلات ناپایدار و باگ‌های موقت: قطعی سرور یا خطایی که در کمتر از چند ساعت برطرف می‌شود، نباید وارد پایگاه دانش دائم شود؛ زیرا ماندگاری این داده‌ها باعث گمراهی کاربران بعدی خواهد شد.
  • کسب‌وکارهای با حجم تیکت پایین: اگر روزانه کمتر از ده تیکت دریافت می‌کنید، پیاده‌سازی چنین خط لوله‌ای توجیه زمانی ندارد و ویرایش دستی اسناد سریع‌تر و مطمئن‌تر است.

پیاده‌سازی چرخه مداوم یادگیری از مکالمات، نیاز به پاسخ‌دهی دستی به سوالات پرتکرار را به حداقل می‌رساند و اطلاعات ایجنت را همیشه مطابق با نیازهای جاری مشتریان نگه می‌دارد.

برای راه‌اندازی و تست پاسخ‌گویی هوشمند به مشتریان، رایگان امتحان کنید.

پرسش‌های پرتکرار

چقدر طول می‌کشد تا یک پاسخ تاییدشده توسط ایجنت استفاده شود؟

در صورت تایید پیش‌نویس توسط ناظر انسانی، فرآیند امبدینگ و ایندکس‌گذاری در پایگاه داده برداری معمولاً کمتر از چند ثانیه زمان می‌برد و سند بلافاصله در پاسخ‌های بعدی در دسترس خواهد بود.

حداقل تعداد تیکت مورد نیاز برای راه‌اندازی این سیستم چقدر است؟

برای به دست آوردن خوشه‌بندی معنایی معنادار، معمولاً به حداقل چند صد تیکت حل‌شده در ماه نیاز است تا الگوهای پرتکرار شناسایی شوند؛ در حجم‌های پایین‌تر، بازبینی دستی بازدهی بهتری دارد.

چگونه از افشای اطلاعات خصوصی کاربران در پایگاه دانش جلوگیری می‌شود؟

پیش از هرگونه پردازش، پایپ‌لاین‌های ناشناس‌سازی داده‌ها (شامل قواعد رجکس و تشخیص هویت نام‌دار) متغیرهای فردی مانند شماره تماس، کدملی، آدرس و نام افراد را با مقادیر عمومی جایگزین می‌کنند.

آیا می‌توان اسناد متناقض قبلی را به طور خودکار حذف کرد؟

خیر، بهتر است سیستم فقط اسناد قدیمی مشابه را نشانه‌گذاری (Flag) کند و حذف نهایی یا تغییر وضعیت به حالت منقضی‌شده با تصمیم و تایید ناظر انسانی انجام شود.

میلاد اصغری

میلاد اصغری، بنیانگذار اول ایجنت — پلتفرم فارسی ساخت و اجرای ایجنت هوش مصنوعی برای کسب‌وکارهای ایرانی.

هنوز سؤالی دارید؟

همین حالا از دستیار هوش مصنوعی اول ایجنت بپرسید، یا از راه‌های ارتباطی دیگر با تیم ما در تماس باشید.

تماس با ما