رفتن به محتوا
پژوهش

یادگیری ماشین

پرسش‌هایی دربارهٔ ارزیابی، فرض‌ها و محدودیت‌های مدل‌های یادگرفته‌شده.

نگاه کلی

سری‌های زمانی مالی ناایستا، دارای وابستگیِ پیاپی و نسبت سیگنال‌به‌نویز پایین‌اند؛ هر سه ویژگی، فرضِ استقلال و ایستاییِ پشتِ ارزیابیِ استاندارد یادگیری ماشین را نقض می‌کنند.

پرسش‌های محوری

  • تقسیم‌بندیِ آموزش و اعتبارسنجی چگونه باید ساختار زمانی و هم‌پوشانیِ برچسب‌های داده‌های مالی را رعایت کند؟
  • بهبود در عملکردِ اعتبارسنجی چه زمانی بازتابِ یک الگوی واقعی است، نه نشتِ اطلاعات از برچسب‌های هم‌پوشان؟
  • با تغییرِ فرایند زیرینِ تولید داده، عملکرد یک مدل چگونه افت می‌کند؟

صورت‌بندی ریاضی

قید اعتبارسنجی متقاطعِ پاک‌سازی‌شده

اگر برچسبِ زمانِ tᵢ با اطلاعاتِ تا tᵢ + hᵢ (پنجرهٔ برچسب‌گذاریِ آن) تعیین شود، یک تقسیمِ معتبر هر مشاهدهٔ آموزشی را که پنجرهٔ برچسبش با پنجرهٔ برچسبِ یک مشاهدهٔ آزمون هم‌پوشانی دارد، حذف می‌کند؛ آموزش روی پنجرهٔ هم‌پوشان، نتیجهٔ آزمون را به مجموعهٔ آموزش نشت می‌دهد.

روش‌هایی که به کار می‌بریم

  • اعتبارسنجی متقاطعِ پاک‌سازی‌شده و دارای دورهٔ ممنوعیت

    López de Prado, M. (2018). Advances in Financial Machine Learning. Wiley.

  • سنجه‌های عملکردِ تعدیل‌شده در انتخاب مدل

    Bailey, D. H., & López de Prado, M. (2014). The deflated Sharpe ratio. Journal of Portfolio Management, 40(5), 94–107.

مسئله‌های باز

  • وقتی مدتِ پنجره‌های برچسب‌گذاری خود نامعلوم یا متغیر است، طولِ دورهٔ ممنوعیت چقدر باید باشد؟
  • هنگامی که ویژگی‌ها هم‌خطیِ شدید دارند و روابطشان به رژیمِ بازار بستگی دارد، اهمیتِ ویژگی چگونه باید نسبت داده شود؟

این صفحه روش‌های تثبیت‌شدهٔ این حوزه را شرح می‌دهد، نه نتایج، پارامترها یا کاربرد فعلی داراهوش از آن‌ها را.