7 منطق تخمین حداقل مربعات معمولی

ساخت وبلاگ

در این فصل بحث در مورد رگرسیون حداقل مربعات معمولی (OLS) آغاز می شود. OLS "اسب بخار" علوم اجتماعی تجربی است و ابزاری مهم در آزمایش فرضیه و ساخت تئوری است. این فصل با نشان دادن چگونگی استفاده از رگرسیون OLS برای برآورد روابط بین و در بین متغیرها ، به بحث در فصل 6 می پردازد.

7. 1 مدل های نظری

مدل ها ، همانطور که قبلاً مورد بحث قرار گرفت ، یک مؤلفه اساسی در ساخت تئوری است. آنها مفاهیم نظری را ساده می کنند ، یک روش دقیق برای ارزیابی روابط بین متغیرها ارائه می دهند و به عنوان وسیله ای برای آزمایش فرضیه خدمت می کنند. همانطور که در فصل 1 مورد بحث قرار گرفت ، یکی از ویژگی های اصلی یک مدل نظری پیش فرض علیت است و علیت مبتنی بر سه عامل است: ترتیب زمان (مشاهده یا نظری) ، همبستگی و عدم تحریم. از این سه فرض ، متغیر همبستگی موردی است که با استفاده از OLS مورد تجزیه و تحلیل قرار می گیرد. ادعای اغلب مکرر ، "همبستگی علیت" نیست. علیت توسط تئوری هدایت می شود ، اما همبستگی بخش مهمی از آزمایش فرضیه تجربی است.

هنگام توصیف روابط ، تفاوت بین مواردی که قطعی در مقابل تصادفی هستند ، مهم است. روابط قطعی کاملاً "مشخص" است به گونه ای که با دانستن مقادیر متغیر مستقل ، می توانید مقدار متغیر وابسته را کاملاً توضیح دهید (یا پیش بینی کنید). فیلسوفان قدیمی (مانند کانت) تصور می کردند که جهان مانند یک ساعت عظیم و پیچیده است که پس از آنکه همه اطلاعاتی را در مورد شرایط شروع داشته باشید ، پیش بینی کاملی از آینده را امکان پذیر می کند. در پیش بینی "خطایی" وجود ندارد. از طرف دیگر ، روابط تصادفی شامل یک مؤلفه تصادفی غیرقابل برگشت است ، به گونه ای که متغیرهای مستقل فقط یک پیش بینی جزئی از متغیر وابسته را مجاز می دانند. اما این مؤلفه تصادفی (یا تصادفی) تغییر در متغیر وابسته دارای توزیع احتمال است که می تواند از نظر آماری تجزیه و تحلیل شود.

7. 1. 1 مدل خطی قطعی

مدل خطی قطعی به عنوان پایه ای برای ارزیابی مدلهای نظری عمل می کند. بیان شده است:

[ شروع y_ = alpha + beta x_ tag end ]

یک مدل قطعی سیستماتیک است و هیچ خطایی ندارد ، بنابراین (y ) کاملاً توسط (x ) پیش بینی می شود. این در شکل 7. 1 نشان داده شده است. ( alpha ) و ( beta ) پارامترهای مدل هستند و اصطلاحات ثابت هستند. ( beta ) شیب یا تغییر در (y ) بر تغییر در (x ) است. ( alpha ) رهگیری است ، یا مقدار (y ) وقتی (x ) صفر است.

Deterministic Model

شکل 7. 1: مدل قطعی

با توجه به اینکه در علوم اجتماعی به ندرت با مدلهای قطعی کار می کنیم ، تقریباً همه مدل ها حاوی یک مؤلفه تصادفی یا تصادفی هستند.

7. 1. 2 مدل خطی تصادفی

مدل تصادفی یا آماری خطی حاوی یک مؤلفه سیستماتیک ، (y = alpha+ beta ) و یک مؤلفه تصادفی به نام اصطلاح خطا است. اصطلاح خطا تفاوت بین مقدار مورد انتظار (y_i ) و مقدار مشاهده شده (y_i ) است. (y_i- mu ). این مدل به صورت زیر بیان شده است:

[ شروع y_ = alpha + beta x_ + epsilon_i tag end ]

جایی که ( epsilon_i ) اصطلاح خطا است. در مدل قطعی ، هر مقدار (y ) در امتداد خط رگرسیون قرار می گیرد ، اما در یک مدل تصادفی مقدار مورد انتظار (y ) توسط مقادیر (x ) شرط می شود. این در شکل 7. 2 نشان داده شده است.

Stochastic Linear Model

شکل 7. 2: مدل خطی تصادفی

شکل 7. 2 توزیع جمعیت مشروط (y ) را برای چندین مقدار (x ، p (y | x) ) نشان می دهد. وسیله مشروط (y ) داده شده (x ) مشخص شده است ( mu ).

[ شروع mu_ Equiv e (y_) equiv e (y | x _) = alpha+ beta x_ tag end ]

که در آن - ( alpha = e (y) equiv mu ) وقتی (x = 0 ) - هر 1 واحد در (x ) افزایش می یابد (e (y) ) توسط ( beta)

با این حال ، در تغییر مدل خطی تصادفی در (y ) توسط بیش از (x ) ایجاد می شود ، همچنین با اصطلاح خطا ( epsilon ) ایجاد می شود. اصطلاح خطا به صورت زیر بیان می شود:

ما چندین فرض مهم در مورد اصطلاح خطا که در بخش بعدی مورد بحث قرار می گیرد ، ایجاد می کنیم.

7. 1. 3 فرضیات درباره اصطلاح خطا

سه فرض اصلی در مورد اصطلاح خطا وجود دارد. الف) خطاها دارای توزیع یکسان هستند ، ب) خطاها مستقل هستند و ج) خطاها به طور معمول توزیع می شوند. 14

فرضیات خطا

خطاها توزیع یکسان دارند

خطاها مستقل از (x ) و سایر ( epsilon_ ) هستند

(e ( epsilon_) Equiv e ( epsilon | x_) = 0 )

(e ( epsilon_) neq e ( epsilon _) ) برای (i neq j )

خطاها به طور معمول توزیع می شوند

با هم جمع شده این فرض بدان معنی است که اصطلاح خطا دارای توزیع طبیعی ، مستقل و یکسان است (I. I. D. عادی). با این حال ، ما نمی دانیم که در هر صورت خاص ، این فرضیات برآورده شده است یا خیر. بنابراین ما باید یک مدل خطی را تخمین بزنیم.

7. 2 تخمین مدل های خطی

با مدل های تصادفی نمی دانیم فرضیات خطا برآورده شده است ، و همچنین مقادیر ( alpha ) و ( beta ) را نمی دانیم. بنابراین ما باید آنها را تخمین بزنیم ، همانطور که توسط یک کلاه مشخص شده است (به عنوان مثال ، ( hat ) تخمین برای ( alpha ) است). مدل تصادفی همانطور که در معادله (7. 4) نشان داده شده است:

جایی که ( epsilon_i ) اصطلاح باقیمانده یا اصطلاح خطای تخمین زده شده است. از آنجا که هیچ خطی نمی تواند کاملاً از تمام نقاط داده عبور کند ، ما یک باقیمانده ، ( epsilon ) را به معادله رگرسیون معرفی می کنیم. توجه داشته باشید که مقدار پیش بینی شده (y ) مشخص شده است ( hat ) ( (y ) -hat).

[ شروع y_ & = hat+ hatx _+ epsilon_ \ & = hat+ epsilon_ \ epsilon_ & = y_i- hat\ & = y_i- hat- hatx_i پایان ]

7. 2. 1 باقیمانده

باقیمانده خطاهای پیش بینی اندازه گیری میزان مشاهده (y_ ) از پیش بینی شده ( کلاه است)این در شکل 7. 3 نشان داده شده است.

Residuals: Statistical Forensics

شکل 7. 3: باقیمانده: پزشکی قانونی آماری

اصطلاح باقیمانده شامل تجمع (جمع) خطاها است که می تواند ناشی از مشکلات اندازه گیری ، مشکلات مدل سازی و تصادفی غیرقابل برگشت باشد. در حالت ایده آل ، اصطلاح باقیمانده شامل بسیاری از تأثیرات کوچک و مستقل است که منجر به کیفیت تصادفی کلی توزیع خطاها می شود. هنگامی که این توزیع تصادفی نیست - یعنی وقتی توزیع خطا از کیفیت سیستماتیک برخوردار است - تخمین های ( hat ) و ( hat ) ممکن است مغرضانه باشد. بنابراین ، هنگامی که مدل های خود را ارزیابی می کنیم ، روی شکل توزیع خطاهای خود تمرکز خواهیم کرد.

  • عملیاتی های ناقص
  • برنامه اندازه گیری ناقص
  • خطای مدل سازی/مشخصات نادرست
  • توضیح مدل گمشده
  • فرضیات نادرست در مورد انجمن ها
  • فرضیات نادرست در مورد توزیع
  • تنوع غیرقابل پیش بینی در متغیر وابسته

هدف از تجزیه و تحلیل رگرسیون به حداقل رساندن خطای مرتبط با برآورد مدل است. همانطور که اشاره شد ، اصطلاح باقیمانده خطای تخمین زده شده یا کلی "خانم" است (به عنوان مثال ، (y _- hat)). به طور خاص هدف به حداقل رساندن مجموع خطاهای مربع ، ( sum epsilon^) است. بنابراین ، ما باید مقادیر ( hat ) و ( hat ) را پیدا کنیم که ( sum epsilon^) را به حداقل برساند.

توجه داشته باشید که برای یک مجموعه ثابت از داده ها<(hat) , (hat)>، هر انتخاب ممکن از مقادیر برای ( hat ) و ( hat ) با یک جمع باقیمانده خاص مربع ها ، ( sum epsilon^) مطابقت دارد. این را می توان با فرم عملکردی زیر بیان کرد:

به حداقل رساندن این عملکرد نیاز به مشخص کردن برآوردگرها برای ( hat ) و ( hat ) دارد به گونه ای که (s ( hat ، hat) = sum epsilon^) در پایین ترین مقدار ممکن قرار دارد. یافتن این مقدار حداقل نیاز به استفاده از حساب دارد که در فصل بعد مورد بحث قرار خواهد گرفت. قبل از آن نمونه ای سریع از رگرسیون ساده را طی می کنیم.

7. 3 نمونه ای از رگرسیون ساده

مثال زیر از یک معیار ایدئولوژی سیاسی مردم برای پیش بینی درک آنها از خطرات ناشی از تغییرات جهانی آب و هوا استفاده می کند. رگرسیون OLS با استفاده از عملکرد LM در r انجام می شود. برای این مثال ، ما دوباره از مجموعه داده های کلاس استفاده می کنیم.

بازده در R اطلاعات زیادی در مورد رابطه بین اقدامات ایدئولوژی و خطرات درک شده از تغییرات آب و هوا ارائه می دهد. این نمای کلی از توزیع باقیمانده ها را ارائه می دهد. ضرایب تخمین زده شده برای ( hat ) و ( hat ) ؛نتایج آزمون فرضیه ؛و اقدامات کلی مدل `` fit " - همه آنها در فصول بعدی به تفصیل بحث خواهیم کرد. در حال حاضر ، توجه داشته باشید که تخمین زده شده (b ) برای ایدئولوژی منفی است ، که نشان می دهد با افزایش ارزش ایدئولوژی - درداده های ما این به معنای محافظه کارتر اس ت-خطر درک شده از تغییرات آب و هوا کاهش می یابد. به طور خاص ، برای هر واحد افزایش در مقیاس ایدئولوژی ، خطر تغییر آب و هوا درک شده توس ط-1. 0463463 کاهش می یابد.

ما همچنین می توانیم توزیع باقیمانده ها را با استفاده از هیستوگرام و منحنی چگالی بررسی کنیم. این در شکل 7. 4 و شکل 7. 5 نشان داده شده است. توجه داشته باشید که ما در فصل های آینده در مورد تشخیص های باقیمانده به تفصیل بحث خواهیم کرد.

Residuals of Simple Regression: Histogram

شکل 7. 4: باقیمانده رگرسیون ساده: هیستوگرام

Residuals of Simple Regression: Density

شکل 7. 5: باقیمانده رگرسیون ساده: تراکم

برای اهداف این فصل ، مطمئن باشید که می توانید مدل اصلی رگرسیون OLS دو متغیره را در r اجرا کنید. اگر می توانید - تبریک می گویم! اگر اینطور نیست ، دوباره امتحان کنید. و دوباره. و دوباره…

در واقع ، ما فقط فرض می کنیم که وسایل خطاهای ناشی از نمونه های مکرر مشاهدات به طور معمول توزیع می شود - اما ما بعداً با آن چروک سر و کار خواهیم داشت.

استراتژی‌های اسکالپ...
ما را در سایت استراتژی‌های اسکالپ دنبال می کنید

برچسب : نویسنده : ناصر تقوایی بازدید : <-PostHit-> تاريخ : پنجشنبه 8 تير 1402 ساعت: 21:23