← العودة إلى قائمة المقالات
July 31, 2026
5 دقائق للقراءة

المعرفي مقابل المعلوم: قياس ما لا يعرفه نموذج العائد

المعرفي مقابل المعلوم: قياس ما لا يعرفه نموذج العائد
#bayesian
#uncertainty
#neural-network
#risk
#position-sizing

كل قاعدة تحجيلة في هذه المدونة تقلل عدم اليقين إلى عدد قياسي واحد. كيلي يقسم على التباين. التنبؤ المطابقي يقسم على عرض الفترة. استهداف التقلب يقسم على توقعات GARCH. كل ثلاثة صحيحة، وكل ثلاثة تتجاهل فرصة تهم التداول: الفرق بين سوق صاخب ونموذج جاهل.

هذان ليسا نفس الخطر. ضجيج السوق مسعّر — هو ما تت compensated للتحمله. جهل النموذج غير مسعّر، غير معوض، وهو بالضبط الحالة التي تكون فيها تقدير حافتك الأقل موثوقية. قاعدة تحجيلة تعاقبهما بالتساوي تترك شيئًا على الطاولة.

هذا المقال يدور حول جعل هذا الانقسام قابلاً للقياس. بشكل ملموس:

σeff2=σalea2+λσepi2,λ>1\sigma^2_{\text{eff}} = \sigma^2_{\text{alea}} + \lambda \cdot \sigma^2_{\text{epi}}, \qquad \lambda > 1

ضع ذلك في مقام كيلي بدلاً من التباين الكلي. بقية المقال تتعلق بكيفية تقدير المكونين (إسقاط مونت كارلو، التشكيلات العميقة)، وكيف يبدو الانقسام فعليًا على البيانات الحقيقية.

الأطروحة: عدما اليقين يتطلبان استجابتين

المعرفي المعلوم
المصدر بيانات/نموذج محدود ضجيج متأصل في البيانات
قابل للتقليل؟ نعم (المزيد من البيانات يساعد) لا
إجراء التداول قلل المركز أو امتنع وسّع التوقفات، قلل الرافعة المالية
الإشارة "لم أرَ هذا النظام" "هذا السوق صاخب حاليًا"

اللا تناظر في صف "إجراء التداول" هو الحجة بأكملها. التباين المعلومي العالي هو "مجهول معروف": يمكنك تحجيمه، تغطيته، وتتوقع الحصول على عائد مخاطرة لتحمله. التباين المعرفي العالي هو "مجهول مجهول": النموذج يستخرج، وتقديره المتوسط μ\mu مشبوه مثل تقديره للتباين، ولا يوجد عائد مرتبط بالخطأ حول معاملاتك الخاصة.

النموذج الذي يخلط بين الاثنين إما يتداول بإفراط في أنظمة غير مألوفة (يتجاهل عدم اليقين المعرفي) أو يتداول بقلة في أنظمة مألوفة ولكن صاخبة (يعاقب التباين المعلومي بشكل مفرط). كيلي القياسي، المطبق على σtotal2\sigma^2_{\text{total}}, يفعل الاثنين اعتمادًا على أي مكون يهيمن.

التحليلة

عدم اليقين المعرفي يأتي من عدم اليقين حول معاملات النموذج θ\theta. بدلاً من θ\theta^* واحد (كما في الاحتمالية القصوى)، نحافظ على توزيع p(θD)p(\theta \mid \mathcal{D}) ونكامل:

p(yx,D)=p(yx,θ)p(θD)dθp(y \mid x, \mathcal{D}) = \int p(y \mid x, \theta)\, p(\theta \mid \mathcal{D})\, d\theta

الانتشار الناتج عن التكامل عبر θ\theta هو معرفي. يتناقص مع نمو D\mathcal{D} لتغطية منطقة الإدخال.

عدم اليقين المعلومي هو الضجيج المشروط لعملية توليد البيانات. في الشبكة العصبية، يتم نمذجته عبر رأس إخراج ثانٍ يبعث تباينًا يعتمد على الإدخال:

p(yx,θ)=N(y;μθ(x),σθ2(x))p(y \mid x, \theta) = \mathcal{N}\bigl(y;\, \mu_\theta(x),\, \sigma^2_\theta(x)\bigr)

هذا الرأس غير المتجانس يقدر نفس الكائن الذي يقدره GARCH بشكل تقليدي — التباين المشروط المعتمد على الحالة الذي يكون مرتفعًا بين عشية وضحاها ومنخفضًا في ساعات الذروة. إذا كنت تريد تجارب هذا الكائن على العملات المشفرة، GARCH(1,1) لتقلب العملات المشفرة يغطيه بشكل صحيح، بما في ذلك لماذا التنبؤ المشروط المباشر (وليس تباين العينة غير المشروط) ينتمي إلى مقام كيلي. رأس NN هو مجرد مقدر مختلف لنفس الكمية، مُلاءم بشكل مشترك مع المتوسط.

ما لا يستطيع GARCH إعطاءك إياه هو المصطلح الآخر. هذا ما بقية هذا المقال من أجله.

موقعه بالنسبة لما تم نشره بالفعل

مقالان سابقان يغطيان أرضًا مجاورة ويستحقان القراءة أولًا، لأن هذا المقال لا يكررهما عمدًا:

المقايضة واضحة. المطابق يمنحك ضمانًا ولكن رقمًا واحدًا — عرض الفترة غير قابل للتحليل، لذلك لا يمكنه إخبارك بالسبب الذي اتسع فيه. الطرق البايesianية تمنحك تحليلاً ولكن بدون ضمان — فترات إسقاط مونت كارلو جيدة بقدر ما يكون اللاحق التقريبي جيدًا. هذا المقال يدور حول شراء التحليل؛ من المحتمل أن تحافظ على المطابق فوقها للتغطية.

الطريقة 1: الاستدلال المتغير (بايز بال_backprop)

لاحق Bayesian كثيف للأوزان يتم ضغطه إلى تقريب متغير قابل للمعالجة قبل إنتاج توزيع عائد تنبؤي

الشبكة العصبية Bayesian تضع أولوية p(θ)p(\theta) على الأوزان وتسعى للحصول على اللاحق p(θD)p(Dθ)p(θ)p(\theta \mid \mathcal{D}) \propto p(\mathcal{D} \mid \theta) p(\theta). يتطلب الموحد التكامل عبر كل تكوين وزن، وهو غير عملي لأي شيء بأكثر من حفنة من المعاملات.

الاستدلال المتغير يستبدل اللاحق غير العملي بعائلة قابلة للمعالجة qϕ(θ)q_\phi(\theta) — عادة Gaussian مُعوّل qϕ(θ)=jN(θj;μj,σj2)q_\phi(\theta) = \prod_j \mathcal{N}(\theta_j; \mu_j, \sigma_j^2) — ويقلل

KL(qϕ(θ)p(θD))\text{KL}\bigl(q_\phi(\theta) \,\|\, p(\theta \mid \mathcal{D})\bigr)

بما أن ذلك يتضمن اللاحق غير المعروف، نحن نزيد بدلاً من ذلك حد الأدنى من الأدلة:

L(ϕ)=Eqϕ(θ)[logp(Dθ)]KL(qϕ(θ)p(θ))\mathcal{L}(\phi) = \mathbb{E}_{q_\phi(\theta)}\bigl[\log p(\mathcal{D} \mid \theta)\bigr] - \text{KL}\bigl(q_\phi(\theta) \,\|\, p(\theta)\bigr)

المصطلح الأول يدفع qϕq_\phi نحو شرح البيانات؛ المصطلح الثاني يبقيه قريبًا من الأولوية. بايز بال_backprop (Blundell et al., 2015) يجعل هذا قابلاً للتفاضل عبر خدعة إعادة المعاملات: عينة ϵN(0,I)\epsilon \sim \mathcal{N}(0, I)، اضبط θ=μ+σϵ\theta = \mu + \sigma \odot \epsilon.

في الممارسة، VI يضاعف عدد المعاملات، يزيد تباين التدرج (كل تمرير أمامي يستخدم أوزانًا مختلفة)، وافتراض المتوسط يتجاهل ارتباطات الوزن، مما يميل إلى التبخير عدم اليقين المعرفي. لمكدس تداول لديك بالفعل نموذج حتمي مدرب، الطريقتان الأرخص أدناه عادةً نقطة دخول أفضل.

الطريقة 2: إسقاط مونت كارلو

تمريرات أمامية متكررة مع dropout متاحة تتنافر إلى تنبؤات مميزة يختلافها يشكل عدم اليقين المعرفي

أظهر Gal و Ghahramani (2016) أن الشبكة المدربة مع dropout والمقيمة مع dropout لا يزال نشطًا وقت الاختبار هي إجراء استدلال متغير تقريبي في عملية Gaussian عميقة. Dropout بالفعل يُحدث توزيعًا عبر الشبكات الفرعية؛ إبقاؤه نشطًا خلال الاستدلال وتشغيل TT تمريرات أمامية يأخذ عينات من هذا اللاحق الضمني.

هذا غير موجود في أي مكان آخر في هذه المدونة. الكود المنشور هنا يستخدم dropout فقط كمُنظم وقت التدريب (نمذجة الانتشار, TFT عند dropout=0.1–0.3). إبقاؤه نشطًا خلال الاستدلال هو تغيير من سطر واحد بمعنى مختلف تمامًا.

الإحصائيات التنبؤية

بما لدينا TT تمريرات أمامية عشوائية تنتج {y^t}t=1T\{\hat{y}_t\}_{t=1}^{T} وتباينات لكل تمرير σ^t2(x)\hat{\sigma}_t^2(x):

المتوسط التنبؤي:

yˉ=1Tt=1Ty^t\bar{y} = \frac{1}{T} \sum_{t=1}^T \hat{y}_t

المعرفي (الاختلاف بين التمريرات):

σepi2=1Tt=1T(y^tyˉ)2\sigma^2_{\text{epi}} = \frac{1}{T} \sum_{t=1}^T (\hat{y}_t - \bar{y})^2

المعلومي (متوسط الضجيج المتوقع):

σalea2=1Tt=1Tσ^t2\sigma^2_{\text{alea}} = \frac{1}{T} \sum_{t=1}^T \hat{\sigma}_t^2

التحليل هو بالضبط قانون التباين الكلي: تباين المتوسط المشروط، بالإضافة إلى متوسط التباين المشروط. التباين التنبؤي الكلي هو مجموعهما.

تنفيذ PyTorch

import torch
import torch.nn as nn
import numpy as np

class MCDropoutNet(nn.Module):
    """
    شبكة تنبؤ العائد مع MC Dropout لتقدير عدم اليقين.
    تخرج كلًا من المتوسط المتوقع ولوغاريتم التباين (المعلومي).
    """
    def __init__(self, input_dim: int, hidden_dim: int = 128, dropout_p: float = 0.1):
        super().__init__()
        self.net = nn.Sequential(
            nn.Linear(input_dim, hidden_dim),
            nn.ReLU(),
            nn.Dropout(p=dropout_p),
            nn.Linear(hidden_dim, hidden_dim),
            nn.ReLU(),
            nn.Dropout(p=dropout_p),
        )
        self.head_mu = nn.Linear(hidden_dim, 1)        # العائد المتوقع
        self.head_logvar = nn.Linear(hidden_dim, 1)    # log(التباين المعلومي)

    def forward(self, x: torch.Tensor):
        h = self.net(x)
        return self.head_mu(h), self.head_logvar(h)


def heteroscedastic_loss(mu, log_var, target):
    """السلب اللوغاريتمي لاحتمالية Gaussian بتباين متعلم يعتمد على الإدخال."""
    precision = torch.exp(-log_var)
    return torch.mean(0.5 * precision * (target - mu) ** 2 + 0.5 * log_var)


@torch.no_grad()
def mc_predict(model: MCDropoutNet, x: torch.Tensor, n_samples: int = 100):
    """
    استدلال MC Dropout: إبقاء dropout نشطًا، جمع T تمرير أمامي,
    حلل التباين التنبؤي إلى أجزاء معرفية ومعلومية.
    """
    model.train()  # ليس eval() — هذا ما يبقي dropout نشطًا
    mus, log_vars = [], []
    for _ in range(n_samples):
        mu, log_var = model(x)
        mus.append(mu)
        log_vars.append(log_var)

    mus = torch.stack(mus)            # (T, batch, 1)
    log_vars = torch.stack(log_vars)  # (T, batch, 1)

    pred_mean = mus.mean(dim=0)
    epistemic_var = mus.var(dim=0)              # Var عبر التمريرات
    aleatoric_var = log_vars.exp().mean(dim=0)  # E عبر التمريرات

    return {
        "mean": pred_mean.squeeze(-1),
        "epistemic_std": epistemic_var.sqrt().squeeze(-1),
        "aleatoric_std": aleatoric_var.sqrt().squeeze(-1),
        "total_std": (epistemic_var + aleatoric_var).sqrt().squeeze(-1),
    }

التدريب يستخدم الخسارة غير المتجانسة، وهو ما يجعل رأس التباين يعني شيئًا. لاحظ البنية المُنظمة ذاتيًا: مصطلح 0.5 * precision * (target - mu)**2 يريد تباينًا صغيرًا، مصطلح 0.5 * log_var يعاقبه، ونقطة التوازن هي مستوى الضجيج المشروط.

model = MCDropoutNet(input_dim=50, hidden_dim=128, dropout_p=0.1)
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=1e-4)

for epoch in range(200):
    model.train()
    for x_batch, y_batch in train_loader:
        mu, log_var = model(x_batch)
        loss = heteroscedastic_loss(mu, log_var, y_batch)
        optimizer.zero_grad()
        loss.backward()
        optimizer.step()

الخطأ الذي يقتل الطريقة بصمت: استدعاء model.eval() داخل mc_predict. يُعطل dropout، كل تمرير يُرجع القيمة المتطابقة، epistemic_var ينهار إلى صفر تمامًا، وقاعدة التحجيل الخاصة بك ترجع بصمت إلى كيلي عادي على التباين المعلومي. تفشل بدون خطأ. تأكد من أن epistemic_var > 0 في مسار الاستدلال الخاص بك.

اختيار عدد التمريرات الأمامية

  • T=30T = 30: حد أدنى معقول لمتوسط مستقر
  • T=100T = 100: افتراضي عملي للمتوسط والتباين
  • T=500+T = 500{+}: عوائد متناقصة ما لم تكن بحاجة إلى كميات الذيل

الطريقة 3: التشكيلات العميقة

خمس شبكات عصبية مدربة بشكل مستقل تجمع تنبؤاتها بينما اختلافها يشكل هالة معرفية

Lakshminarayanan et al. (2017) يُدرّبون MM شبكات مستقلة من تهيئات عشوائية مختلفة ويُجمّعون. على الرغم من عدم كونها Bayesian رسميًا، التشكيلات العميقة تتفوق باستمرار على الطرق الأكثر مبدئية على معايير معايرة عدم اليقين.

p(yx)1Mm=1Mp(yx,θm)p(y \mid x) \approx \frac{1}{M} \sum_{m=1}^M p(y \mid x, \theta_m^*)

الاختلاف بين الأعضاء هو التقدير المعرفي. التشكيلات تظهر في أماكن أخرى في هذه المدونة كأجهزة تجميع — كشف الشذوذ، كشف النظام HMM، حذاء EnbPI المطابقي — ولكن أبدًا كقدر عدم يقين عبر الانتشار بين الأعضاء. هذا هو الاستخدام هنا.

تنفيذ التشكيل

التنوع يأتي من التدريب المستقل، ليس من بناء MM كائنات. تشكيل من أعضاء غير مدربين أو مدربين بشكل متطابق يُرجع إما ضوضاء أو تباين معرفي صفر:

class DeepEnsemble:
    def __init__(self, input_dim: int, n_models: int = 5, hidden_dim: int = 128):
        self.models = []
        for seed in range(n_models):
            torch.manual_seed(seed)          # تهيئة مختلفة لكل عضو
            self.models.append(
                MCDropoutNet(input_dim, hidden_dim, dropout_p=0.0)
            )

    def fit(self, train_loader, epochs: int = 200, lr: float = 1e-3):
        """كل عضو يُدرّب بشكل مستقل. هنا يأتي التنوع
        -- تهيئة مختلفة، ترتيب خلط مختلف. تخطي هذا
        يُنتج epistemic_var == 0 (أعضاء متطابقون) أو ضوضاء نقية (غير مدربين)."""
        for seed, model in enumerate(self.models):
            torch.manual_seed(1000 + seed)   # خلط/dropout مختلف
            opt = torch.optim.AdamW(model.parameters(), lr=lr, weight_decay=1e-4)
            model.train()
            for _ in range(epochs):
                for x_batch, y_batch in train_loader:
                    mu, log_var = model(x_batch)
                    loss = heteroscedastic_loss(mu, log_var, y_batch)
                    opt.zero_grad()
                    loss.backward()
                    opt.step()
        return self

    @torch.no_grad()
    def predict(self, x: torch.Tensor):
        mus, variances = [], []
        for model in self.models:
            model.eval()                     # صحيح هنا: لا عينات dropout
            mu, log_var = model(x)
            mus.append(mu.squeeze(-1))
            variances.append(log_var.exp().squeeze(-1))

        all_mus = torch.stack(mus)
        all_vars = torch.stack(variances)

        epistemic_var = all_mus.var(dim=0)   # انتشار عبر الأعضاء
        aleatoric_var = all_vars.mean(dim=0)

        return {
            "mean": all_mus.mean(dim=0),
            "epistemic_std": epistemic_var.sqrt(),
            "aleatoric_std": aleatoric_var.sqrt(),
            "total_std": (epistemic_var + aleatoric_var).sqrt(),
        }

لاحظ أن model.eval() صحيح في DeepEnsemble.predict وخاطئ في mc_predict. مصدر العشوائية يختلف: التشكيلات تحصل عليه من التدريب المستقل، MC Dropout يحصل عليه من أقنعة dropout المباشرة.

المقايضات: MC Dropout مقابل التشكيلات العميقة

MC Dropout التشكيلات العميقة
تكلفة التدريب 1x (نموذج واحد) MMx (MM نماذج)
تكلفة الاستدلال TT تمريرات أمامية MM تمريرات أمامية
الذاكرة 1x معاملات MMx معاملات
جودة عدم اليقين تميل إلى التبخير المعرفي معايرة أفضل بشكل عام
سهولة التنفيذ بسيط (قلب علامة) بسيط (درّب MM نماذج)
التوازي تمريرات متتالية (نفس النموذج) موززاة محرجة تمامًا

هجين عملي: درّب تشكيلًا صغيرًا (M=35M = 3{-}5) حيث كل عضو يستخدم أيضًا MC Dropout، لالتقاط كلٍ من الاختلاف بين النماذج والعشوائية داخل النموذج.

العائد: التحجيل غير المتماثل

الضجيج المعلومي يوسع مغلف الخطر بينما عدم اليقين المعرفي يضيق فتحة تحجيل المركز ويخلق منطقة امتناع

هنا المساهدة الفعلية. كيلي Gaussian هو f=μ/σ2f^* = \mu / \sigma^2؛ الاشتقاق، قطعة النمو، جدول احتمال الانسحاب، والأربعة أسباب لتشغيل كيلي الكسري بدلاً من الكامل كلها في معيار كيلي للاستراتيجيات، ولا تُكرر هنا. خذ f=μ/σ2f^* = \mu / \sigma^2 عند جزء ربع كيلي كمعطى.

التعديل هو المقام. بدلاً من التباين التنبؤي الكلي:

σeff2=σalea2+λσepi2,λ>1\sigma^2_{\text{eff}} = \sigma^2_{\text{alea}} + \lambda \cdot \sigma^2_{\text{epi}}, \qquad \lambda > 1

الحجة من أجل λ>1\lambda > 1: التباين المعلومي هو ضجيج السوق، هو مسعّر، وتحمله هو كيف تكسب الاستراتيجية. التباين المعرفي هو جهلك — لا يحمل عائدًا، وأسوأ من ذلك، هو مرتبط بكون تقديرك μ\mu خاطئًا. عندما σepi\sigma_{\text{epi}} كبير، بسط كيلي غير موثوق في نفس الوقت الذي يكون فيه المقام كذلك، لذلك يتراكب خطأ التحجيم. معاقبته بشكل فوق خطي بالنسبة لضجيج السوق هو التعبير المباشر عن ذلك.

def uncertainty_adjusted_position_size(
    pred_mean: float,
    epistemic_std: float,
    aleatoric_std: float,
    max_position: float = 1.0,
    lam: float = 2.0,                   # عقاب معرفي؛ انعش على التحقق
    max_epi_ratio: float = 0.5,         # امتنع فوق هذا النسبة معرفي/معلومي
    base_kelly_fraction: float = 0.25,
) -> float:
    """تحجيل كيلي حيث التباين المعرفي يُعاقب بقوة أكبر من المعلومي."""
    effective_var = aleatoric_std ** 2 + lam * epistemic_std ** 2
    if effective_var < 1e-10:
        return 0.0

    position = (pred_mean / effective_var) * base_kelly_fraction

    epi_ratio = epistemic_std / (aleatoric_std + 1e-8)
    if epi_ratio > max_epi_ratio:
        position *= max(0.0, 1.0 - epi_ratio)

    return float(np.clip(position, -max_position, max_position))

البوابة تستحق ملاحظة. تصفير المراكز تحت حد ثقة ليس جديدًا هنا — مقال المطابقة يُحدد ويُرمّم الفلتر العام لعدم التداول كـ et=μ^/wte_t = |\hat{\mu}| / w_t مع حد min_edge، بما في ذلك كيفية اختيار الحد والقراءة الهندسية لفترة تعبر الصفر. انظر التنبؤ المطابقي لتلك الآلات. ما هو جديد هو المقام: التبويت على σepi/σalea\sigma_{\text{epi}} / \sigma_{\text{alea}} يُطلق تحديدًا عندما يكون النموذج أكثر ارتباكًا حول معاملاته الخاصة من السوق الصاخب — حالة لا يستطيع التبويت بعدم اليقين الكلي اكتشافها، لأن نظامًا هادئًا غير مألوف يمكن أن يكون لديه تباين كلي منخفض ونسبة معرفية رهيبة.

المعايرة: سلّم هذا

تقدير عدم اليقين مفيد فقط إذا كان معايرًا: فترة 95% اسمية يجب أن تحتوي على الحقيقة ~95% من الوقت. لا تلف التحقق الخاص بك من موثوقية كم Gaussian — فترة حدودية على بقايا عائد ذيل سمين هي بالضبط وضع الفشل الذي التنبؤ المطابقي موجود لتجنبه، وهو يُشحن evaluate() يعمل يبلغ الهدف مقابل التغطية التجريبية مع ضمان عينة محدودة خلفه. مقال TFT ينقص نفس النقطة لرؤوس الكمية.

إعادة القياس اللاحق (σ~=ασ+β\tilde{\sigma} = \alpha \sigma + \beta مُلاءم على مجموعة تحقق) هو الإصلاح الرخيص، وهو ابن عم أضعف الاستدلال المطابقي التكيفي، الذي يحافظ على مستوى سوء تغطية على الإن αt\alpha_t مع حد تغطية على المدى الطويل بدلاً من إعادة قياس ثابتة. ACI هو الخيار الأقوى؛ السبب الوحيد لتفضيل إعادة القياس الخطية هو أنه يحافظ على نسبة المعرفي/المعلومي، الذي عرض ACI الواحد لا يحتفظ به.

ما يجب قياسه قبل النشر

الطرق أعلاه راسخة. الادعاء أن الانقسام يشتري أي شيء في التداول ليس كذلك، وهذه المدونة لا تنشر قواعد تحجيل على الحجة وحدها. الحاجز:

1. مجموعة البيانات والهدف. سمِّ الأداة، حجم الشريط، نطاق التاريخ الصريح، مجموعة الميزات، والهدف التنبؤي.

2. الانقسام نفسه. أي جزء من التباين التنبؤي الكلي هو معرفي مقابل معلومي، وكيف تتحرك هذه النسبة بين نافذة هادئة مسماة وأخرى متقلبة مسماة. هذا هو المخطوطة المالية ولا يوجد بعد. الفرضية التي تستحق التكذيب: النسبة ترتفع قبل أن يفعل التقلب المدرك، لأن عدم الألفة يسبق الاضطراب.

3. التغطية مقابل المطابقي. التغطية المقاسة خارج العينة لفترات MC Dropout مقابل الاسمية، مقارنة بفترات المطابقة المنقسمة من المقال المنشور على نفس البيانات. المواجهة نفسها هي نتيجة جديدة والجسر الطبيعي بين المقالين.

4. هل يشتري λ\lambda أي شيء؟ امسح عقاب المعرفي على التحقق وأبلغ عن PnL وسحب الأقصى مقابل خط الأساس λ=1\lambda = 1. إذا لم يشترِ أي شيء، قل ذلك — السالب الصادق هو القالب لتلك النتيجة وهو نتيجة قابلة للنشر.

5. تكلفة الاستدلال. مُقاسة، على الأجهزة المستهدفة، عند كل TT.

أي تقييم هنا يعمل تحت انضباط التحسين بالمشي إلى الأمامλ\lambda هو معامل فائق، و λ\lambda مضبوط على العينة الكاملة ليست نتيجة.

نصائح عملية للإنتاج

1. سخّن الأولوية. مع الاستدلال المتغير، تهيئ المتوسط المتغير من شبكة حتمية مُدرّبة مسبقًا وليس عشوائيًا. عادة ما يُنصف وقت التقارب.

2. راقب انهيار التباين. التباينات المتعلمة σj\sigma_j يمكن أن تتباطأ إلى قرب الصفر، تُعيد بصمت BNN إلى شبكة حتمية. راقب متوسط σj\sigma_j أثناء التدريب؛ أضف التقليب KL إذا لزم الأمر.

3. أعد المعايرة على أساس دوار، ليس مجموعة تحقق ثابتة. الأسواق غير ثابتة ومعايرة مُلاءمة مرة تتحلل. أعد التدريب على نافذة دواررة تحت انضباط المشي إلى الأمام، أو دع ACI يمتصstaleness النموذج على الإن — مقال المطابقي يغطي مقايضة تكرار إعادة التدريب مباشرة.

4. تنوع التشكيل يهم. بذور مختلفة، خلط مختلف، اختياريًا معاملات فائقة مختلفة لكل عضو. تنوع التهيئة هو المحرك الأساسي لجودة التشكيل، وهذا هو سبب كون حلقة fit() أعلاه اختيارية.

5. سجّل التحليل، ليس فقط الكلي. خزّن كلا المكونين بجانب النتائج المدركة. بدون هذا لا يمكنك الإجابة على السؤال الوحيد المهم في المراجعة: عندما قلل المُحجّج التعرض، هل كان ذلك لأن السوق صاخب أو لأن النموذج تائه — وهل كان على حق؟

6. عدم اليقين كميزة. الإحصائيات المعرفية الدواررة قد تكون نفسها تنبؤية للانسحابات. معقول، غير مقاس، ويستحق مقالًا منفصلًا.

القيود والتحذيرات الصادقة

  • اللاحقون التقريبيون لا يزالون تقريبيين. MC Dropout و VI يعطي رؤية محدودة للاحق الحقيقي. أفضل من لا شيء، ليس الحقيقة الأرضية، ولا يوجد ضمان تغطية مرتبط بأي منهما.
  • تدهور المعايرة بالضبط عندما تحتاجها. في نظام جديد حقًا قد يكون النموذج لا يزال غير معاير — هو فقط يميل إلى أن يكون أقل سوء معايرة من نموذج حتمي. تقديرات عدم اليقين من إدخال خارج التوزيع هي نفسها مخرجات خارج التوزيع.
  • التباين المعلومي يمكن أن يمتص الإشارة المعرفية. إذا كان الرأس غير المتجانس مرنًا بدرجة كافية، يتعلم شرح عدم اليقين النموذجي بعيدًا كضجيج بيانات، ينهار σepi\sigma_{\text{epi}} نحو الصفر ويهزوم التحليل الكلي بصمت. هذا هو وضع الفشل الأهم في هذا المقال ولا يُعلن عن نفسه. راقب النسبة عبر الأنظمة؛ نسبة لا تتحرك أبدًا هي تحليل مكسور، ليس سوقًا مستقرًا.
  • λ\lambda معلمة حرة. إدخال مضبوط قابل للضبط في قاعدة تحجيل هو كيف يتم بناء قواعد تحجيل مُلاءمة زيادة. يحتاج إلى تبرير بالمشي إلى الأمام أو يجب أن يكون ثابتًا عند 1.

الخاتمة

التنبؤ المطابقي يعطي هذه المدونة بالفعل عرض فترة مع ضمان تغطية، وكيلي يعطيها بالفعل قاعدة تحجيل. ما لا يعطيه أي منهما هو إجابة على السبب اتساع الفترة. تقسيم التباين التنبؤي إلى أجزاء معرفية ومعلومية يجيب على ذلك، والإجابة قابلة للتنفيذ بطريقة الكلي غير هي: ضجيج السوق مخاطر معوضة، جهل النموذج ليس كذلك، ومقام التحجيل يجب أن يقول ذلك.

MC Dropout يجعل الانقسام مجاني تقريبًا — سطر واحد (model.train() عند الاستدلال) يحول أي شبكة dropout إلى Bayesian تقريبي. التشكيلات العميقة تكلف MMx وتُعاير بشكل أفضل. كلاهما يغذي نفس المقام غير المتماثل σalea2+λσepi2\sigma^2_{\text{alea}} + \lambda \sigma^2_{\text{epi}}.

سواء $\lambda > 1` يدفع فعليًا هو سؤال تجريبي هذا المسودة لا يجيب عليه بعد. القياسات المذكورة أعلاه هي ثمن نشره.


المراجع:

  • Blundell, C., Cornebise, J., Kavukcuoglu, K., & Wierstra, D. (2015). Weight Uncertainty in Neural Networks. ICML.
  • Gal, Y. & Ghahramani, Z. (2016). Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning. ICML.
  • Lakshminarayanan, B., Pritzel, A., & Blundell, C. (2017). Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles. NeurIPS.
  • Kendall, A. & Gal, Y. (2017). What Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision? NeurIPS.
  • Gibbs, I. & Candes, E. (2021). Adaptive Conformal Inference Under Distribution Shift. NeurIPS.
  • Kelly, J. L. (1956). A New Interpretation of Information Rate. Bell System Technical Journal.
blog.disclaimer

Authors

Eugen Soloviov
Eugen Soloviov

Trading-systems engineer

Trading-systems engineer building bots since 2017: cross-exchange arbitrage (connected up to 30 venues), cointegration-based pairs arbitrage across spot and futures, scalping, news and sentiment-driven strategies, trend algorithms, and portfolio management and balancing algorithms. Also builds sub-millisecond order execution, big-data warehouses, backtesting engines, AI agents, and trading interfaces (incl. open-source profitmaker.cc). Stack: JS/TS, Python, Rust/Zig/Go, DevOps, backend, frontend, architecture.

Newsletter

ابقَ متقدماً على السوق

اشترك في نشرتنا الإخبارية للحصول على رؤى حصرية حول تداول الذكاء الاصطناعي وتحليلات السوق وتحديثات المنصة.

نحترم خصوصيتك. يمكنك إلغاء الاشتراك في أي وقت.