مقدمه ای بر مدل خطی تعمیم یافته (GLM)

ساخت وبلاگ

آنچه در آن است و چگونه این مدل نصب شده است و برای پیش بینی قیمت مسکن کاربرد دارد

در مدل خطی کلاسیک معمولاً نیاز به نرمال بودن است. این در شکل 0. 1 نشان داده شده است ، با متغیر تصادفی X ثابت ، توزیع y طبیعی است (توسط هر منحنی زنگ کوچک نشان داده شده است). و منحنی رگرسیون به میانگین هر توزیع عادی می رود.

با این حال ، در مدل خطی تعمیم یافته ، این نیاز دیگر لازم نیست زیرا ما می توانیم با توجه به دانش خود از داده ها ، یک مدل توزیع را برای آن مشاهدات انتخاب کنیم. این توسط عملکرد پیوند تحقق می یابد ، که میانگین آن مشاهدات را به یک شکل خطی تبدیل می کند. علاوه بر این ، همجنسگرایی نیز دیگر لازم نیست. واریانس خطاها در y لازم نیست ثابت باشد. [5]

اجزای مدل خطی تعمیم یافته

سه مؤلفه اصلی GLM وجود دارد ، عملکرد پیوند یکی از آنهاست. آن مؤلفه ها هستند

1. یک مؤلفه تصادفی ، که متغیر پاسخ هر مشاهده است. شایان ذکر است که توزیع مشروط از متغیر پاسخ است ، به این معنی که Yᵢ بر روی Xᵢ مشروط است.

توزیع Yᵢ متعلق به خانواده نمایی است ، به این معنی که Yᵢ دارای فرم است ، تعریف شده به عنوان [2]

تفاوت این است که θᵢ در شکل متعارف دگرگون نمی شود ، که باعث می شود فرم متعارف کار با آن آسانتر شود. همچنین ، توجه داشته باشید که همیشه امکان تبدیل یک خانواده نمایی به فرم متعارف وجود دارد. از طرف دیگر ، ما همچنین می توانیم عملکرد نمایی را به شکل زیر بنویسیم [1]

که در GLM استفاده می شود. در EQ 1. 2 ، θᵢ و ϕᵢ مکان (مربوط به میانگین) و پارامترهای مقیاس (مربوط به) هستند. علاوه بر این ، ما از μᵢ برای نشان دادن میانگین Yᵢ استفاده می کنیم. یادداشت به نماد: در معادله 1. 2 ، Yᵢ می تواند به سادگی به صورت Y نوشته شود ، دقیقاً مانند معادله 1. 1. ما فقط باید در نظر داشته باشیم که یک yᵢ یا y نتیجه یک مشاهدات واحد است.

2. یک پیش بینی کننده خطی ، که شکل آشنای یک مدل خطی معمولی دارد

ما از این برای پیش بینی میانگین Yᵢ استفاده خواهیم کرد. توجه داشته باشید که در EQ 1. 1 ، ηᵢ یک پیش بینی کننده خطی نیست ، بلکه یک تابع تبدیل θᵢ است. در این مقاله فقط از فرم ارائه شده در EQ 1. 2 استفاده خواهیم کرد.

3. یک تابع پیوند g (∙) ، میانگین yᵢ ، e (yᵢ) را به یک شکل خطی مانند در eq [خطی] تبدیل می کند ، که به معنای آن است.

عملکرد مرتبط لازم است صاف و غیرقابل برگشت باشد (غیرقابل برگشت نشان می دهد که این عملکرد یکنواخت است).

چرا خانواده نمایی خوب است؟

خانواده نمایی دارای چند خاصیت خوب هستند.

1. در چندین منبع (چرا خانواده های نمایی بسیار جذاب هستند؟ مزایای خانواده نمایی ، ویکی: خانواده نمایی) ، ذکر شده است که خانواده نمایی در آمار بیزی بسیار امکان پذیر است زیرا این توزیع ها همیشه قبل از آن ترکیب شده اند.

2. یکی دیگر از ویژگی های بسیار مهم این است که در معادله 1. 1 ، Tᵢ (x) یک آمار کافی است. به زبان ساده ، یک آمار کافی تابعی است که شامل تمام اطلاعات متغیر X با توجه به پارامتر ناشناخته است ، در این حالت θ."کافی" در اینجا همان معنای "کافی" را در "شرایط کافی" در منطق دارد.

به طور رسمی تر ، گفته می شود که یک آمار t (x₁ ، ... ، xₙ) برای θ کافی است ، اگر توزیع مشروط x₁ ،… ، xₙ ، با توجه به t = t ، به θ برای هر مقدار t بستگی ندارد.

3. جدا از دو خاصیت فوق الذکر ، خانواده نمایی نیز چندین توزیع مختلف را در کنار هم قرار می دهند. این به ما امکان می دهد چندین توزیع مختلف را در یک الگوی قرار دهیم. در اینجا ما نشان خواهیم داد که می توان با استفاده از A ، B و φ ، یک عبارت کلی را برای میانگین و واریانس توزیع خانواده نمایی بدست آورد.

ما برای دستیابی به این هدف از حداکثر احتمال استفاده خواهیم کرد: وقتی عملکرد احتمال بهینه می شود ، می خواهیم e [y]. در مرحله اول ، ما احتمال ورود به سیستم عمومی توزیع خانواده نمایی (معادله 1. 2) را محاسبه می کنیم (البته اگر احتمال ورود به سیستم بهینه شود ، احتمال بهینه سازی نیز بهینه می شود).

سپس مشتق جزئی از آن را با توجه به θ می گیریم. توجه داشته باشید که قسمت C (y ، ϕ) حاوی θ نیست ، بنابراین از بین می رود. و ما می گیریم

ترفند این است که ما می توانیم با جایگزینی y با مقدار مورد انتظار آن e [y] ، L را به عنوان یک متغیر تصادفی درمان کنیم و اجازه دهیم مقدار مورد انتظار ∂ L/ ∂ θ 0 باشد

که فرمول بسیار ساده ای از E (y) به ما می دهد

یک واقعیت بسیار مهم وجود دارد که قابل ذکر است. این ترفند (تعیین اولین مشتق برای 0 برای به دست آوردن حداکثر) به دلیل خاصیت عملکرد ورود به سیستم از خانواده نمایی است-با توجه به θ مقعر است. [3] در غیر این صورت ، این روش به سادگی می شکند.(این یک چیز خوب دیگر در مورد خانواده نمایی است)

اکنون سعی می کنیم واریانس y ، var (y) را محاسبه کنیم. با استفاده از مشتق معادله 2. 3 ، دوم مشتق عملکرد ورود به سیستم را دریافت می کنیم

ما می توانیم از نتیجه کلی استفاده کنیم

که ویژگی عملکرد ورود به سیستم را نشان می دهد. اثبات فنی است ، نه دشوار و نه جالب. بنابراین ، در این مقاله ، ما قصد داریم این موضوع را حذف کنیم. وصل کردن معادله 2. 6 به معادله 2. 7 که می گیریم

با استفاده از میانگین Y ، که ما قبلاً (معادله 2. 5) داریم ، به همراه برخی از عملکرد جبری در معادله 2. 8 ، بلافاصله واریانس Y را دریافت می کنیم

a (ϕ) می تواند هر عملکردی از ϕ باشد ، اما برای آسان تر کردن کار با GLM ، ما معمولاً اجازه می دهیم

جایی که W یک ثابت شناخته شده است. سپس می توانیم معادله 2. 9 را به عنوان بنویسیم

نمونه ای از توزیع های متعلق به خانواده نمایی

ساده ترین نمونه GLM GLM با عملکرد پیوند هویت است. این GLM را به یک مدل خطی معمولی کاهش می دهد. اگرچه این ساده است ، این مورد ایده ای راجع به آنچه GLM انجام می دهد به ما می دهد.

ما می دانیم که یک مدل خطی معمولی فرض می کند که هر مشاهده توزیع عادی دارد. از آنجا که این یک مورد خاص از GLM است ، البته توزیع عادی متعلق به خانواده نمایی است. در اینجا ما نشان می دهیم که چگونه توزیع عادی را به شکل EQ 1. 1 تبدیل کنیم:

ما می توانیم ببینیم که این بسیار آسان است - همه چیز در مورد انتقال ثابت به قسمت نمایی و گسترش میدان است. معادله 3. 1 به ما می گوید

با استفاده از نتیجه ای که در بخش قبلی به دست آورده ایم (معادله 2. 5 و معادله 2. 10) ، اکنون می توانیم میانگین و واریانس توزیع عادی را بررسی کنیم

متناسب با مدل

برای متناسب با مدل ، ما از برآورد احتمال استفاده می کنیم. همانطور که قبلاً ذکر شد ، عملکرد ورود به سیستم از یک عملکرد نمایی مقعر است ، بنابراین می توانیم با جستجوی نقطه ، جایی که اولین مشتق صفر است ، حداکثر آن را پیدا کنیم. اکنون چه چیزی را حل می کنیم؟یک بردار سریع از مشکل: ما یک بردار N بعدی از متغیرهای پاسخ مستقل Yᵢ ، که در آن μ = e [yᵢ] و آن را به یک پیش بینی کننده خطی از طریق مرتبط می کنیم.

و θᵢ یک پارامتر متعارف است. و ما می خواهیم β را پیدا کنیم ، که عملکرد ورود به سیستم را به حداکثر می رساند. یک بار دیگر ، Yᵢ مستقل هستند ، که باعث می شود MLE β امکان پذیر باشد. مشابه EQ 2. 1 ، احتمال ورود به سیستم β است

θᵢ و β به روش زیر مرتبط هستند: θᵢ به میانگین Yᵢ مربوط می شود (این بستگی به عملکرد توزیع بتن دارد ، در مثال بخش قبلی ، θᵢ = μᵢ) ، β به میانگین Yᵢ نیز مربوط می شود، از طریق عملکرد پیوند. بنابراین θᵢ و β از طریق μᵢ متصل می شوند ، که بعداً در تمایز جزئی خواهیم دید.

اکنون ما می خواهیم Eq را متفاوت کنیم. 4. 3 با توجه به هر عنصر موجود در β (آنها توسط فهرست J به اشتراک می گذارند). این می دهد

به دلیل قاعده زنجیره ای ، ما داریم

پس از تمایز EQ 2. 5 ، ما داریم

ما این کار را برای بدست آوردن ∂ θᵢ/ ∂ μ ᵢ انجام می دهیم زیرا e [yᵢ] = μᵢ. مرحله بعدی در واقع آسان است ، ما EQ 4. 7 را در EQ 4. 5 جایگزین می کنیم

جایی که قسمت قرمز از EQ 4. 7 است. و EQ 4. 8 می تواند بیشتر ساده شود. همانطور که در مورد آن صحبت کردیم ، در GLM ، var [yᵢ] ثابت نیست. بنابراین ، ما می توانیم var [yᵢ] را به عنوان تابعی از e [yᵢ] در نظر بگیریم ، بنابراین می توانیم تعریف کنیم

به گونه ای که (به EQ 2. 10 مراجعه کنید)

قرار دادن EQ 4. 10 در EQ 4. 8 و تنظیم آن روی صفر (ما علاقه مند به نقطه ای هستیم که اولین مشتق از عملکرد ورود به سیستم صفر باشد) ، ما می گیریم

EQ 4. 11 سیستم معادلات غیر خطی β را به ما می دهد-اگر J از 1 به متر برود ، چنین معادلات وجود دارد. چگونه می توان سیستم معادلات غیر خطی مانند این را حل کرد ، هنگامی که تعداد ناشناخته ها لزوماً با تعداد معادلات برابر نیست و معادلات می توانند بسیار پیچیده باشند؟در این مورد روشهای عددی بازی می شود. در اینجا ما حداقل مربع های با وزن دوباره تکرار شده (IRL) را اعمال خواهیم کرد. در این مقاله ، ما به جزئیات نمی پردازیم. به طور کلی ، این روش به طور تکراری محلول را تقریب می دهد. و وقتی می دانیم که V (μᵢ) مستقل از β است ، حداقل هدف مربع است

در یک کلمه دیگر ، مشکل از این پس یافتن β است که EQ 4. 12 را به حداقل می رساند. به این ترتیب ما یک راه حل بهینه شده برای EQ 4. 11 را ارائه می دهیم.

از GLM در پیش بینی قیمت مسکن استفاده کنید

مجموعه داده ها ، قیمت مسکن ، از یکی از مسابقات پیش بینی شده در مورد Kaggle است. کد برای کل تجزیه و تحلیل در دسترس است

قیمت خانه/glm. ipynb در Main · Zhangxichu/قیمت خانه

قیمت خانه را با استفاده از مدل GLM پیش بینی کنید. با ایجاد یک حساب کاربری در GitHub ، در توسعه قیمت Zhangxichu/House Compled کمک کنید.

نتایج با استفاده از انحراف میانگین مربع (RMSD) ارزیابی می شود. روش GLM موقعیت 33 ٪ برتر را به دست آورد. البته ، این بهینه ترین روش برای استفاده نیست - نتایج با 0 خطا در تابلوی رهبری وجود دارد. اما به خوبی نشان می دهد که GLM در عمل.

من می گویم که در مورد اجرای آن خیلی صحبت نمی شود ، زیرا چرا هر مرحله انجام می شود ، در نوت بوک توضیح داده شده است. و بیشتر کد اکتشاف داده ها ، پیش پردازش ، مقایسه مدل و تشخیص مدل بود. قسمت مدل سازی به یک خط واحد می رسد (البته ، واردات statsmodels. api را به عنوان SM فراموش نکنید):

که متناسب با داده ها به توزیع گاما تعمیم یافته با عملکرد لینک ورود است.

خلاصه

این مقاله عمدتاً مربوط به تعریف مدل خطی تعمیم یافته (GLM) است ، چه زمانی از آن استفاده می شود ، و نحوه نصب مدل. بسیاری از متون مربوط به خانواده نمایی است زیرا این پایه و اساس GLM است و دانستن خواص خانواده نمایی به ما کمک می کند تا درک کنیم که چرا اتصالات مدل به حداقل می رسد EQ 4. 12.(جزئیات راه حل این مشکل حذف شده است زیرا ارزش یک مقاله تصمیم گیری کامل را دارد.)

در حقیقت ، هیچ یک از اینها برای اجرای برنامه لازم نیست ، همانطور که در بخش آخر ذکر می کنیم ، مدل سازی فقط یک خط کد است. و به سختی اتفاق می افتد ، که ما باید GLM را از ابتدا پیاده سازی کنیم. با این حال ، دانستن این تئوری همیشه برای تصمیم گیری در مورد کدام مدل برای انتخاب و تشخیص و تفسیر مدل مفید است.

منابع :

[1] Germán Rodríguez. نظریه مدل خطی تعمیم یافته. دسترسی به 17 فوریه 2022.

[2] استفان بیتس ، اندی تسائو. خانواده های نمایی. دسترسی به 18 فوریه 2022. < Pan> این مقاله عمدتاً مربوط به تعریف مدل خطی تعمیم یافته (GLM) است ، چه زمانی از آن استفاده می شود ، و نحوه نصب مدل. بسیاری از متون مربوط به خانواده نمایی است زیرا این پایه و اساس GLM است و دانستن خواص خانواده نمایی به ما کمک می کند تا درک کنیم که چرا اتصالات مدل به حداقل می رسد EQ 4. 12.(جزئیات راه حل این مشکل حذف شده است زیرا ارزش یک مقاله تصمیم گیری کامل را دارد.)

استراتژی‌های اسکالپ...
ما را در سایت استراتژی‌های اسکالپ دنبال می کنید

برچسب : نویسنده : ناصر تقوایی بازدید : <-PostHit-> تاريخ : جمعه 6 مرداد 1402 ساعت: 21:06