هدف زندگی فقط به حداقل رساندن یک هدف KL است.
این پست در مورد واگرایی Kullback-Leibler از منظر کل نگر یادگیری تقویت و یادگیری ماشین صحبت خواهد کرد. احتمالاً قبلاً وارد KL Divergences شده اید: به خصوص اگر با مدل های تولیدی عمیق مانند VAES بازی کرده اید. به عبارت ساده ، واگرایی KL بین دو توزیع احتمال اندازه گیری دو توزیع متفاوت است.
تعریف واگرایی KL و تفسیرهای مختلف از واگرایی KL را معرفی می کنم. از همه مهمتر ، من واقعیت زیر را استدلال می کنم:
هر دو مشکل یادگیری تحت نظارت و یادگیری تقویت شده به سادگی هدف واگرایی KL را به حداقل می رسانند
واگرایی KL چیست؟
واگرایی Kullback-Leibler (از این پس به عنوان KL واگرایی نوشته شده است) معیاری است که چگونه یک توزیع احتمال با توزیع احتمال دیگر متفاوت است. از نظر کلاسیک ، در تئوری بیزی ، توزیع واقعی $ p (x) $ وجود دارد. ما می خواهیم با توزیع تقریبی $ q (x) $ تخمین بزنیم. در این زمینه ، واگرایی KL فاصله از توزیع تقریبی $ q $ تا توزیع واقعی $ p $ را اندازه گیری می کند.
از نظر ریاضی ، دو توزیع احتمال $ P ، q $ را در برخی از فضا $ Mathcal $ در نظر بگیرید. واگرایی Kullback-Leibler از $ q $ به $ P $ (نوشته شده به عنوان $ d_ (p | q) $)
خواص kl واگرایی
برخی از یادداشت های فوری وجود دارد که ارزش این تعریف را دارد.
واگرایی KL متقارن نیست: یعنی $ d_ (p | q) neq d_ (q | p) $. در نتیجه ، این نیز یک متریک فاصله نیست.
واگرایی KL می تواند مقادیر [0 ، Infty] $ را بدست آورد. به ویژه ، اگر $ p $ و $ q $ دقیقاً توزیع شوند ($ p stackrel q $) ، سپس $ d_ (p | q) = 0 $ ، و با تقارن $ d_ (q | p) = 0$در حقیقت ، با کمی ریاضی ، می توان بیانیه ای قوی تر را اثبات کرد: اگر $ d_ (p | q) = 0 $ ، سپس $ p stackrel q $.
In order for the KL divergence to be finite, the support of $P$ needs to be contained in the support of $Q$. If a point $x$ exists with $Q(x) = 0$ but $P(x)>0 $ ، سپس $ d_ (p | q) = infty $
بازنویسی هدف
با برخی از جبر ، می توانیم از نظر مقادیر دیگر تعریف واگرایی KL را دستکاری کنیم. مفیدترین چنین دستکاری:
در اینجا ، $ Mathbb _ [- log q (x)] $ آنتروپی متقاطع بین $ p $ و $ q $ (و مشخص شده $ h (p ، q) $) است. اصطلاح دوم $ mathcal (p (x)) = mathbb _ [- log p (x)] $ آنتروپی $ p $ است.
kl¶ رو به جلو و معکوس
بیایید خود را در تنظیمات بهینه سازی قرار دهیم. توزیع واقعی $ p (x) $ وجود دارد که ما می خواهیم با توزیع تقریبی خود $ q_ theta (x) $ تخمین بزنیم. من از $ theta $ به عنوان یک پارامتر در اینجا استفاده می کنم تا صریحاً تأکید کنم که $ q $ توزیع است که ما می توانیم کنترل کنیم.
همانطور که قبلاً نیز اشاره کردیم ، واگرایی KL یک اندازه گیری متقارن نیست (یعنی آن $ d_ (p | q) neq d_ (q | p) $). در نتیجه ، هنگام تلاش برای تقریبی P $ P $ ، ما بین دو هدف بالقوه برای بهینه سازی انتخابی داریم.
- به حداقل رساندن Kl Forward: $ arg min_ d_ (p | q_ theta) $
- به حداقل رساندن KL معکوس: $ arg min_ d_ (q_ theta | p) $
همانطور که معلوم است ، دو هدف مختلف در واقع باعث ایجاد انواع مختلف تقریبی می شوند. ما بخش بعدی را صرف بحث در مورد رفتارهای کیفی هر رویکرد خواهیم کرد. ما در تنظیمات زیر بررسی خواهیم کرد: $ p (x) $ توزیع دوتایی در زیر است. ما سعی خواهیم کرد این کار را با توزیع عادی $ q (x) = mathcal ( mu ، sigma^2) $ تقریب دهیم.

Forward KL: رفتارهای متوسط جستجو
بیایید بهینه سازی هدف KL Forward را با توجه به $ q_ $ در نظر بگیریم
توجه کنید که این با هدف حداکثر احتمال تخمین یکسان است. با ترجمه به کلمات ، هدف فوق از $ p (x) $ نمونه می گیرد و سعی می کند احتمال این نقاط را تحت $ q (x) $ به حداکثر برساند. تقریب خوب در زیر هدف KL رو به جلو
هر جا که $ p ( cdot) $ از احتمال بالایی برخوردار باشد ، $ q ( cdot) $ نیز باید احتمال بالایی داشته باشد.
ما این رفتار متوسط را در نظر می گیریم ، زیرا توزیع تقریبی $ q $ باید تمام حالت ها و مناطق با احتمال زیاد را در $ p $ پوشش دهد. توزیع بهینه "تقریبی" برای مثال ما در زیر نشان داده شده است. توجه کنید که مراکز توزیع تقریبی خود بین دو حالت است ، به طوری که می تواند پوشش بالایی از هر دو داشته باشد. واگرایی KL Forward به دلیل داشتن جرم با احتمال زیاد در جایی که P $ $ نیست ، $ q $ را مجازات نمی کند.

معکوس KL: رفتارهای جستجوی حالت
اکنون بهینه سازی هدف معکوس KL را با توجه به $ q_ $ در نظر بگیرید
بیایید هدف فوق را به کلمات ترجمه کنیم. هدف فوق از $ q (x) $ نمونه ها را نمونه می گیرد و سعی می کند احتمال این نقاط را زیر $ p (x) $ به حداکثر برساند. اصطلاح آنتروپی توزیع تقریبی را تا حد امکان وسیع ترغیب می کند. تقریب خوب تحت هدف KL معکوس بنابراین رضایت می بخشد
هر کجا $ q ( cdot) $ احتمال بالایی دارد ، $ p ( cdot) $ نیز باید از احتمال بالایی برخوردار باشد.
ما این رفتار را در نظر می گیریم ، زیرا هر نمونه از توزیع تقریبی $ q $ باید در حالت p $ $ قرار بگیرد (زیرا لازم است که نمونه های $ q $ احتمال بالایی تحت P $ P $ داشته باشند). توجه کنید که برخلاف هدف KL Forward ، هیچ چیز نیازی به توزیع تقریبی برای تلاش برای پوشاندن همه حالت ها ندارد. اصطلاح آنتروپی مانع از سقوط تقریبی به حالت بسیار باریک می شود. به طور معمول ، رفتار هنگام بهینه سازی این هدف ، یافتن شیوه ای از $ p $ با احتمال زیاد و پشتیبانی گسترده است و دقیقاً آن را تقلید می کند.
توزیع بهینه "تقریبی" برای مثال ما در زیر نشان داده شده است. توجه کنید که توزیع تقریبی اساساً حالت مناسب $ P $ را در بر می گیرد. واگرایی معکوس KL به دلیل عدم قرار دادن توده احتمال در حالت دیگر P $ ، $ q $ را مجازات نمی کند.

از کدام یک باید استفاده کنم؟
در این مثال اسباب بازی ، از آنجا که ما توزیع دقیق P $ $ را می دانستیم ، ما توانستیم رفتار به حداقل رساندن واگرایی KL رو به جلو و معکوس را نشان دهیم. در عمل ، انجام هر دو اغلب امکان پذیر نیست ، و شما فقط به دامنه محدود می شوید.
به جلو KL¶
به یاد بیاورید که هدف ساده برای هدف KL رو به جلو بود
برای اینکه بتوانیم این هدف را ارزیابی کنیم ، به یک مجموعه داده از نمونه های واقعی $ p (x) $ یا مکانیسم نمونه برداری از مدل واقعی نیاز داریم.
معکوس Kl¶
هدف ساده برای هدف KL رو به جلو بود
برای اینکه بتوانیم این هدف را ارزیابی کنیم ، باید بتوانیم احتمالات نقاط داده را تحت مدل واقعی $ P (x) $ ارزیابی کنیم
یادگیری نظارت = kl¶ رو به جلو
به یاد بیاورید در یادگیری تحت نظارت (به حداقل رساندن ریسک تجربی) ، ما یک مجموعه داده از نمونه $ Mathcal = $ از برخی از توزیع داده های حقیقت زمین $ p (x ، y) = p (x) p (y | x) $ داریم.
هدف ما در یادگیری نظارت شده یادگیری یک مدل $ f: mathcal to mathcal $ است که خطر تجربی مدل را به حداقل می رساند ، که با یک عملکرد ضرر $ l (f (x) ، y) $ پارامتر می شود. به طور خاص ، ما در مورد توزیع برخی از مدل های $ f_ theta $ بهینه می کنیم
We'll show that optimizing this objective is equivalent to minimizing the divergence from an approximate distribution $q_ heta(y|x)$ to the true data distribution $p(y|x)$. For reference, the forward KL divergence objective is $$argmin_ mathbb_>[- log q_ theta (y | x)] $ $
- طبقه بندی با ضرر متقابل آنتروپی: در اینجا ، توزیع تقریبی ما $ q_ (y | x) $ توزیع گسسته است که توسط یک بردار احتمال $ p $ که توسط یک شبکه عصبی $ f_ (x) $ تولید می شود ، پارامتری است. با تعریف ، از دست دادن آنتروپی متقاطع دقیقاً همان چیزی است که واگرایی KL به حداقل می رساند.
- رگرسیون با از دست دادن خطای میانگین مربع: در اینجا ، توزیع تقریبی ما $ q_ (y | x) $ به طور معمول $ mathcal (f_ (x) ، i) $ توزیع می شود ، جایی که میانگین توزیع توسط یک شبکه عصبی پارامتر می شود. احتمال ورود منفی توزیع عادی در زیر نوشته شده است. به حداقل رساندن NLL این توزیع عادی به وضوح معادل از بین رفتن خطای مربع مربع است.
این مفهوم در واقع می تواند به بسیاری از ضررهای دیگر گسترش یابد (به عنوان مثال ، خطای مطلق با توزیع لاپلاس مطابقت دارد). به طور خاص ، از دست دادن واگرایی KL به جلو دقیقاً با مشکل برآورد حداکثر احتمال مطابقت دارد که مبنای اصلی بسیاری از مشکلات یادگیری تحت نظارت است.
استراتژی برای تحلیل فاندمنتال...
ما را در سایت استراتژی برای تحلیل فاندمنتال دنبال می کنید
برچسب :
نویسنده : سعید شیخزاده
بازدید : <-PostHit->
تاريخ : دوشنبه
8 خرداد
1402 ساعت: 20:22