الگوی گسترش با دو خط افزایش

ساخت وبلاگ

در بسیاری از مطالعات ، ما بیش از یک متغیر را برای هر فرد اندازه گیری می کنیم. به عنوان مثال ، ما بارش و رشد گیاه را اندازه گیری می کنیم ، یا تعداد جوانهای دارای زیستگاه لانه سازی ، یا فرسایش خاک و حجم آب. ما جفت داده ها را جمع آوری می کنیم و به جای بررسی هر متغیر به طور جداگانه (داده های یک متغیره) ، می خواهیم راه هایی برای توصیف داده های دو متغیره پیدا کنیم ، که در آن دو متغیر در هر موضوع در نمونه ما اندازه گیری می شوند. با توجه به چنین داده هایی ، ما با تعیین اینکه آیا بین این دو متغیر رابطه وجود دارد ، شروع می کنیم. به عنوان مقادیر تغییر متغیر ، آیا تغییرات مربوط به متغیر دیگر را می بینیم؟

ما می توانیم رابطه بین این دو متغیر را به صورت گرافیکی و عددی توصیف کنیم. ما با در نظر گرفتن مفهوم همبستگی شروع می کنیم.

همبستگی به عنوان ارتباط آماری بین دو متغیر تعریف شده است.

همبستگی بین دو متغیر وجود دارد که یکی از آنها به نوعی با دیگری مرتبط باشد. پراکندگی بهترین مکان برای شروع است. یک پراکندگی (یا نمودار پراکندگی) نمودار داده های نمونه زوج (x ، y) با محور x افقی و یک محور y عمودی است. هر جفت فردی (x ، y) به عنوان یک نقطه واحد ترسیم می شود.

11280.png

شکل 1. پراکندگی از قفسه سینه در مقابل طول.

در این مثال ، ما در مقابل طول خرس (x) ، سینه سینه خرس (y) را ترسیم می کنیم. هنگام بررسی یک پراکندگی ، باید الگوی کلی نقاط ترسیم شده را مطالعه کنیم. در این مثال ، ما می بینیم که با افزایش مقدار طول ، مقدار آن افزایش می یابد. ما می توانیم یک شیب به سمت بالا و یک الگوی مستقیم در نقاط داده ترسیم شده را مشاهده کنیم.

یک پراکندگی می تواند چندین نوع مختلف از روابط بین دو متغیر را شناسایی کند.

  • هنگامی که امتیاز در یک پراکندگی هیچ الگویی نشان نمی دهد ، یک رابطه هیچ ارتباطی ندارد.
  • یک رابطه غیر خطی است که نقاط موجود در یک پراکندگی از یک الگوی پیروی می کنند اما یک خط مستقیم نیست.
  • یک رابطه خطی است که نقاط موجود در یک پراکندگی از یک الگوی خط تا حدودی مستقیم پیروی می کنند. این رابطه ای است که ما بررسی خواهیم کرد.

روابط خطی می تواند مثبت یا منفی باشد. روابط مثبت دارای نکاتی است که به سمت راست حرکت می کند. با افزایش مقادیر X ، مقادیر Y افزایش می یابد. با کاهش مقادیر x ، مقادیر Y کاهش می یابد. به عنوان مثال ، هنگام مطالعه گیاهان ، ارتفاع به طور معمول با افزایش قطر افزایش می یابد.

11268.png

شکل 2. پراکندگی ارتفاع در مقابل قطر.

روابط منفی دارای نکاتی است که به سمت راست رو به پایین است. با افزایش مقادیر X ، مقادیر Y کاهش می یابد. با کاهش مقادیر X ، مقادیر Y افزایش می یابد. به عنوان مثال ، با افزایش سرعت باد ، دمای خنک کننده باد کاهش می یابد.

11256.png

شکل 3. پراکندگی دما در مقابل سرعت باد.

روابط غیرخطی الگوی ظاهری دارد ، فقط خطی نیست. به عنوان مثال ، با افزایش سن ، قد تا یک نقطه افزایش می یابد و بعد از رسیدن به حداکثر ارتفاع ، سطح آن خاموش می شود.

11245.png

شکل 4. پراکندگی ارتفاع در مقابل سن.

هنگامی که دو متغیر رابطه ای ندارند ، هیچ رابطه مستقیم یا رابطه غیر خطی وجود ندارد. وقتی یک متغیر تغییر می کند ، بر متغیر دیگر تأثیر نمی گذارد.

11236.png

شکل 5. پراکندگی رشد در مقابل منطقه.

ضریب همبستگی خطی

از آنجا که امتحانات بصری تا حد زیادی ذهنی است ، ما برای تعریف همبستگی بین دو متغیر به یک اندازه گیری دقیق تر و عینی تر نیاز داریم. برای تعیین کمیت قدرت و جهت رابطه بین دو متغیر ، از ضریب همبستگی خطی استفاده می کنیم:

11226.png

در جایی که X̄ و S X میانگین نمونه و انحراف استاندارد نمونه از X هستند ، و ȳ و S y میانگین و انحراف استاندارد Y هستند. اندازه نمونه n است.

محاسبه متناوب از ضریب همبستگی:

11679.png

11691.png

جایی که

11702.png

11709.png

ضریب همبستگی خطی همچنین به عنوان ضریب همبستگی لحظه محصول پیرسون به افتخار کارل پیرسون ، که در ابتدا آن را توسعه داده است ، گفته می شود. این آماری به صورت عددی توصیف می کند که رابطه مستقیم یا خطی بین دو متغیر و جهت ، مثبت یا منفی چقدر قوی است.

خواص "R":

  • همیشه بی ن-1 و 1 است.
  • این یک اندازه گیری واحد است ، بنابراین "R" همان مقدار خواهد بود که آیا شما دو متغیر را در پوند و اینچ یا در گرم و سانتیمتر اندازه گیری کرده اید.
  • مقادیر مثبت "R" با روابط مثبت همراه است.
  • مقادیر منفی "R" با روابط منفی همراه است.

نمونه هایی از همبستگی مثبت

11215.png

شکل 6. نمونه هایی از همبستگی مثبت.

نمونه هایی از همبستگی منفی

11205.png

شکل 7. نمونه هایی از همبستگی منفی.

همبستگی علیت نیست. فقط به این دلیل که دو متغیر در ارتباط هستند به این معنی نیست که یک متغیر باعث تغییر متغیر دیگر می شود.

این دو پراکندگی بعدی را بررسی کنید. هر دو این مجموعه داده ها دارای R = 0. 01 هستند ، اما بسیار متفاوت هستند. طرح 1 رابطه خطی کمی بین متغیرهای X و Y نشان می دهد. طرح 2 رابطه غیرخطی قوی را نشان می دهد. ضریب همبستگی خطی پیرسون فقط قدرت و جهت یک رابطه خطی را اندازه گیری می کند. نادیده گرفتن ScatterPlot می تواند هنگام توصیف رابطه بین دو متغیر منجر به یک اشتباه جدی شود.

11196.png

شکل 8. مقایسه نقشه های پراکندگی.

وقتی رابطه بین دو متغیر را بررسی می کنید ، همیشه با یک پراکندگی شروع کنید. این نمودار به شما امکان می دهد تا به دنبال الگوهای (خطی و غیر خطی) باشید. مرحله بعدی توصیف کمی قدرت و جهت رابطه خطی با استفاده از "R" است. هنگامی که متوجه شدید که یک رابطه خطی وجود دارد ، می توانید مرحله بعدی در ساخت مدل را بردارید.

رگرسیون خطی ساده

هنگامی که ما دو متغیر را که همبستگی دارند شناسایی کردیم ، می خواهیم این رابطه را الگوبرداری کنیم. ما می خواهیم از یک متغیر به عنوان یک متغیر پیش بینی کننده یا توضیحی استفاده کنیم تا متغیر دیگر ، پاسخ یا متغیر وابسته را توضیح دهیم. برای انجام این کار ، ما نیاز به یک رابطه خوب بین دو متغیر خود داریم. سپس می توان از این مدل برای پیش بینی تغییرات در متغیر پاسخ ما استفاده کرد. یک رابطه قوی بین متغیر پیش بینی کننده و متغیر پاسخ منجر به یک مدل خوب می شود.

11187.png

شکل 9. پراکندگی با مدل رگرسیون.

یک مدل رگرسیون خطی ساده یک معادله ریاضی است که به ما امکان می دهد پاسخی را برای یک مقدار پیش بینی کننده معین پیش بینی کنیم.

مدل ما به شکل ŷ = b 0 + b 1 x در جایی که b 0 در رهگیری Y است ، B 1 شیب است ، x متغیر پیش بینی کننده است ، و ŷ تخمین از میانگین مقدار متغیر پاسخ برای هرمقدار متغیر پیش بینی کننده.

y-Intercept مقدار پیش بینی شده برای پاسخ (y) است که x = 0. شیب تغییر در y را برای هر واحد تغییر در x توصیف می کند. بیایید به این مثال نگاه کنیم تا تفسیر شیب و رهگیری را روشن کنیم.

مثال 1

یک هیدرولوژیک مدلی را برای پیش بینی جریان حجم برای یک جریان در یک گذرگاه پل با متغیر پیش بینی کننده بارندگی روزانه در اینچ ایجاد می کند.

ŷ = 1. 6 + 29 x. رهگیری Y 1. 6 را می توان از این طریق تفسیر کرد: در یک روز بدون بارندگی ، 1. 6 گالن وجود خواهد داشت. آب/دقیقهجریان در جریان در آن گذرگاه پل. شیب به ما می گوید که اگر آن روز یک اینچ باران می بارد ، جریان در جریان با 29 گال اضافی افزایش می یابد./مین. اگر آن روز 2 اینچ باران بارید ، جریان با 58 گال اضافی افزایش می یابد./مین.

مثال 2

اگر آن روز 0. 45 اینچ باران بارید ، جریان متوسط جریان چیست؟

ŷ = 1. 6 + 29 x = 1. 6 + 29 (0. 45) = 14. 65 gal./min.

خط رگرسیون کمترین مربع (معادلات میانبر)

معادله توسط ŷ = b 0 + b 1 x داده شده است

13279.png

شیب کجاست و b 0 = ŷ-b 1 x̄ رهگیری y از خط رگرسیون است.

یک معادله محاسباتی جایگزین برای شیب:

13297.png

این مدل ساده خط بهترین مناسب برای داده های نمونه ما است. خط رگرسیون از هر نقطه ای عبور نمی کند. در عوض ، تفاوت بین تمام نقاط داده و مدل مستقیم را متعادل می کند. تفاوت بین مقدار داده مشاهده شده و مقدار پیش بینی شده (مقدار در خط مستقیم) خطا یا باقیمانده است. معیار برای تعیین خطی که به بهترین وجه ارتباط بین دو متغیر را توصیف می کند ، بر اساس باقیمانده ها است.

باقیمانده = مشاهده شده - پیش بینی شده

به عنوان مثال ، اگر می خواستید با توجه به وزن آن ، توری سینه خرس سیاه را پیش بینی کنید ، می توانید از مدل زیر استفاده کنید.

وزن قفسه سینه = 13. 2 +0. 43 وزن

پیش بینی قفسه سینه خرس که 120 پوند وزن داشت 64. 8 اینچ است.

GIRTH قفسه سینه = 13. 2 + 0. 43 (120) = 64. 8 اینچ.

اما یک دهانه سینه خرس اندازه گیری شده (مقدار مشاهده شده) برای خرس که وزن آن 120 پوند وزن داشت ، در واقع 62. 1 اینچ بود.

باقیمانده 62. 1-64. 8 = -2. 7 در.

باقیمانده منفی نشان می دهد که این مدل بیش از حد پیش بینی می کند. باقیمانده مثبت نشان می دهد که این مدل پیش بینی نشده است. در این مثال ، این مدل بیش از حد قفسه سینه خرس را پیش بینی می کند که در واقع 120 پوند وزن داشت.

Image37921.PNG

شکل 10. پراکندگی با مدل رگرسیون که یک مقدار باقیمانده را نشان می دهد.

این خطای تصادفی (باقیمانده) تمام عوامل غیرقابل پیش بینی و ناشناخته را که در مدل گنجانده نشده است ، در نظر می گیرد. یک خط رگرسیون حداقل مربعات معمولی ، مجموع خطاهای مربع بین مقادیر مشاهده شده و پیش بینی شده را به حداقل می رساند تا بهترین خط مناسب ایجاد شود. تفاوت بین مقادیر مشاهده شده و پیش بینی شده برای مقابله با تفاوت های مثبت و منفی مربع است.

ضریب تعیین

پس از اینکه خط رگرسیون خود را منطبق کردیم (b 0 و b 1 را محاسبه کنید)، معمولاً مایلیم بدانیم که مدل چقدر با داده های ما مطابقت دارد. برای تعیین این موضوع، باید به ایده تحلیل واریانس فکر کنیم. در ANOVA، ما تغییرات را با استفاده از مجموع مربع ها تقسیم بندی کردیم تا بتوانیم یک اثر درمانی را در مقابل تغییرات تصادفی که در داده های ما رخ می دهد شناسایی کنیم. این ایده برای رگرسیون یکسان است. ما می خواهیم تنوع کل را به دو بخش تقسیم کنیم: تغییر ناشی از رگرسیون و تغییر به دلیل خطای تصادفی. و ما دوباره می خواهیم مجموع مربع ها را محاسبه کنیم تا به ما در انجام این کار کمک کند.

فرض کنید تغییرپذیری کل در اندازه گیری های نمونه در مورد میانگین نمونه با نشان داده می شود که مجموع مربع های تنوع کل در مورد میانگین (SST) نامیده می شود. اختلاف مجذور بین مقدار پیش بینی شده و میانگین نمونه با نشان داده می شود که مجموع مربع های ناشی از رگرسیون (SSR) نامیده می شود. SSR نشان دهنده تنوع توضیح داده شده توسط خط رگرسیون است. در نهایت، متغیری که با خط رگرسیون قابل توضیح نیست، مجموع مربعات ناشی از خطا (SSE) نامیده می شود و با نشان داده می شود. SSE در واقع همان باقیمانده مربع است.

11902.png

11906.png

=

11912.png

+

11168.png

شکل 11. تصویری از رابطه بین میانگین y و مقدار پیش بینی شده و مشاهده شده یک y خاص.

مجموع مربع ها و مجموع میانگین مربعات (درست مانند ANOVA) معمولاً در جدول تحلیل واریانس رگرسیون ارائه می شود. نسبت مجموع میانگین مربعات برای رگرسیون (MSR) و مجموع میانگین مربعات برای خطا (MSE) یک آماره آزمون F را تشکیل می دهد که برای آزمایش مدل رگرسیون استفاده می شود.

رابطه بین این مجموع مربع به صورت تعریف شده است

کل تنوع = تغییرات توضیح داده شده + تغییرات غیر قابل توضیح

هر چه تغییرات توضیح داده شده بزرگتر باشد، مدل در پیش بینی بهتر است. هر چه تغییرات غیرقابل توضیح بزرگتر باشد، مدل در پیش بینی بدتر است. یک اندازه گیری کمی از توان توضیحی یک مدل R2، ضریب تعیین است:

11934.png

ضریب تعیین درصد تغییرات متغیر پاسخ (y) را که توسط مدل توضیح داده شده است را اندازه گیری می کند.

  • مقادیر از 0 تا 1 متغیر است.
  • R 2 نزدیک به صفر مدلی با قدرت توضیح بسیار کم را نشان می دهد.
  • R 2 نزدیک به یک مدل با قدرت توضیح بیشتر را نشان می دهد.

ضریب تعیین و ضریب همبستگی خطی از نظر ریاضی با هم مرتبط هستند.

با این حال ، آنها دو معنی بسیار متفاوت دارند: R اندازه گیری قدرت و جهت یک رابطه خطی بین دو متغیر است. R 2 درصد تغییر در "Y" را که توسط مدل توضیح داده شده است ، توصیف می کند.

توطئه های احتمال باقیمانده و طبیعی

حتی اگر شما با استفاده از یک پراکندگی ، ضریب همبستگی و R 2 را تعیین کرده اید ، که x در پیش بینی ارزش y مفید است ، نتایج تجزیه و تحلیل رگرسیون فقط زمانی معتبر است که داده ها فرضیات رگرسیون لازم را برآورده می کنند.

13333.png

 

  1. متغیر پاسخ (y) یک متغیر تصادفی است در حالی که متغیر پیش بینی کننده (x) غیر تصادفی یا ثابت و بدون خطا اندازه گیری می شود.
  2. رابطه Y و X باید خطی باشد ، که توسط مدل ارائه شده است.
  3. خطای اصطلاح تصادفی مقادیر ε مستقل است ، میانگین 0 و یک واریانس مشترک σ 2 ، مستقل از x ، و به طور معمول توزیع می شوند.

 

ما می توانیم از توطئه های باقیمانده برای بررسی واریانس ثابت و همچنین اطمینان حاصل کنیم که مدل خطی در واقع کافی است. یک طرح باقیمانده یک پراکندگی از باقیمانده (= مشاهده شده - مقادیر پیش بینی شده) در مقابل مقدار پیش بینی شده یا نصب شده (همانطور که در طرح باقیمانده استفاده می شود) است. محور افقی مرکز در صفر تنظیم شده است. یکی از ویژگی های باقیمانده این است که آنها به صفر می رسند و میانگین صفر دارند. یک طرح باقیمانده باید از هر الگوی عاری باشد و باقیمانده ها باید به عنوان یک پراکندگی تصادفی از نقاط در حدود صفر ظاهر شوند.

یک طرح باقیمانده و بدون ظاهر از هر الگوی نشان می دهد که فرضیات مدل برای این داده ها راضی هستند.

11155.png

شکل 12. یک طرح باقیمانده.

یک طرح باقیمانده که دارای "شکل فن" است ، نشان دهنده واریانس ناهمگن (واریانس غیر ثابت) است. با افزایش یا کاهش واریانس خطا ، باقیمانده ها تمایل به فن یا فن دارند.

11142.png

شکل 13. یک طرح باقیمانده که نشان دهنده واریانس غیر ثابت است.

یک طرح باقیمانده که تمایل به "تعقیب" دارد ، نشان می دهد که یک مدل خطی ممکن است مناسب نباشد. ممکن است این مدل به شرایط مرتبه بالاتر X نیاز داشته باشد ، یا ممکن است یک مدل غیر خطی برای توصیف بهتر رابطه بین Y و X مورد نیاز باشد. تحول در X یا Y نیز ممکن است در نظر گرفته شود.

11131.png

شکل 14. یک طرح باقیمانده که نشانگر نیاز به یک مدل مرتبه بالاتر است.

یک طرح احتمال عادی به ما امکان می دهد بررسی کنیم که خطاها به طور عادی توزیع می شوند. این باقیمانده ها را در برابر مقدار مورد انتظار باقیمانده قرار می دهد که گویی از توزیع عادی ناشی شده است. به یاد بیاورید که هنگامی که باقیمانده ها به طور معمول توزیع می شوند ، آنها از یک الگوی مستقیم پیروی می کنند و به سمت بالا شیب می گیرند.

این طرح غیرمعمول نیست و هیچ گونه غیر طبیعی با باقیمانده ها را نشان نمی دهد.

11121.png

شکل 15. یک طرح احتمال طبیعی.

این طرح بعدی به وضوح توزیع غیر عادی باقیمانده ها را نشان می دهد.

11111.png

شکل 16. یک طرح احتمال طبیعی ، که توزیع غیر عادی را نشان می دهد.

جدی ترین تخلفات عادی بودن معمولاً در دم توزیع ظاهر می شود زیرا این جایی است که توزیع عادی بیشتر با انواع دیگر توزیع ها با میانگین و گسترش مشابه متفاوت است. انحنای در هر دو یا هر دو انتهای یک طرح احتمال طبیعی نشانگر عدم طبیعی بودن است.

مدل جمعیت

مدل رگرسیون ما بر اساس نمونه ای از مشاهدات دو متغیره N که از جمعیت بیشتری از اندازه گیری ها تهیه شده است ، ساخته شده است.

11952.png

ما از میانگین و انحراف استاندارد داده های نمونه خود برای محاسبه شیب (B 1) و y-intrece (B 0) به منظور ایجاد یک خط رگرسیون معمولی حداقل مربعات استفاده می کنیم. اما ما می خواهیم رابطه Y و X را در جمعیت توصیف کنیم ، نه فقط در داده های نمونه ما. ما می خواهیم یک مدل جمعیتی بسازیم. اکنون ما به خط حداقل مربعات محاسبه شده از یک نمونه به عنوان برآورد خط رگرسیون واقعی برای جمعیت فکر خواهیم کرد.

11964.png

مدل جمعیت ، که در آن μ y میانگین پاسخ جمعیت است ، β 0 با رهگیری Y است و β 1 شیب مدل جمعیت است.

در جمعیت ما ، می تواند پاسخ های مختلفی برای مقدار x وجود داشته باشد. در رگرسیون خطی ساده ، مدل فرض می کند که برای هر مقدار x مقادیر مشاهده شده متغیر پاسخ y به طور معمول با میانگین توزیع می شود که به x بستگی دارد. ما از μ y برای نشان دادن این وسایل استفاده می کنیم. ما همچنین فرض می کنیم که این بدان معناست که همه در هنگام ترسیم در برابر X (یک خط از وسایل) روی یک خط مستقیم قرار دارند.

11100.png

شکل 17. مدل آماری برای رگرسیون خطی. میانگین پاسخ یک تابع مستقیم از متغیر پیش بینی کننده است.

داده های نمونه سپس متناسب با مدل آماری:

داده ها = تناسب + باقیمانده

11974.png

جایی که خطاها (ε i) مستقل هستند و به طور معمول N (0 ، σ) توزیع می شوند. رگرسیون خطی همچنین واریانس برابر Y را فرض می کند (σ برای همه مقادیر x یکسان است). ما از ε (یونانی اپسیلون) برای ایستادن قسمت باقیمانده مدل آماری استفاده می کنیم. پاسخ y مجموع میانگین و انحراف شانس آن از میانگین است. انحرافات ε نشان دهنده "نویز" در داده ها است. به عبارت دیگر ، نویز تغییر در Y به دلیل سایر دلایل است که مانع از شکل گیری یک خط کاملاً مستقیم می شود.

داده های نمونه مورد استفاده برای رگرسیون مقادیر مشاهده شده Y و X است. پاسخ y به یک x معین یک متغیر تصادفی است و مدل رگرسیون میانگین و انحراف استاندارد این متغیر تصادفی Y را توصیف می کند. رهگیری β 0 ، شیب β 1 و انحراف استاندارد σ از y پارامترهای ناشناخته مدل رگرسیون است و باید از داده های نمونه تخمین زده شود.

ŷ یک تخمین بی طرفانه برای میانگین پاسخ μ Y B 0 یک تخمین بی طرفانه برای رهگیری β 0 B 1 یک تخمین بی طرفانه برای شیب β 1 است

تخمین پارامتری

هنگامی که ما تخمین های β 0 و β 1 (از داده های نمونه B 0 و B 1) داشته باشیم ، رابطه خطی تخمین μ Y را برای تمام مقادیر x در جمعیت ما تعیین می کند ، نه فقط برای مقادیر مشاهده شده x. اکنون می خواهیم از خط کمترین مربع به عنوان پایه ای برای استنباط در مورد جمعیتی که نمونه ما از آن ترسیم شده است استفاده کنیم.

فرضیات مدل به ما می گویند که B 0 و B 1 به طور معمول با میانگین β 0 و β 1 با انحراف استاندارد توزیع می شوند که می توانند از داده ها تخمین زده شوند. روشهای استنباط در مورد خط رگرسیون جمعیت مشابه مواردی است که در فصل قبل برای وسایل شرح داده شده است. مثل همیشه ، بررسی داده های مربوط به خارج از کشور و مشاهدات تأثیرگذار مهم است.

برای انجام این کار ، باید خطای استاندارد رگرسیون را تخمین بزنیم. این انحراف استاندارد از خطاهای مدل است. این تنوع Y را در مورد خط رگرسیون جمعیت اندازه گیری می کند. ما از باقیمانده ها برای محاسبه این مقدار استفاده خواهیم کرد. به یاد داشته باشید ، مقدار پیش بینی شده Y (P̂) برای یک X خاص ، نقطه ای از خط رگرسیون است. این تخمین بی طرفانه از میانگین پاسخ (μ Y) برای آن x است. باقیمانده:

باقیمانده = مشاهده شده - پیش بینی شده

12066.png

e i = y i - ŷ =

باقیمانده E I با انحراف مدل ε i که σ e i = 0 با میانگین 0. خطای استاندارد رگرسیون S یک تخمین بی طرفانه از σ است.

12076.png

12100.png

مقدار S تخمین خطای استاندارد رگرسیون (σ) است و S 2 اغلب به عنوان میانگین خطای مربع (MSE) خوانده می شود. مقدار کمی از S نشان می دهد که مقادیر مشاهده شده y نزدیک به خط رگرسیون واقعی است و خط باید تخمین ها و پیش بینی های دقیق را ارائه دهد.

فواصل اطمینان و تست های اهمیت برای پارامترهای مدل

در فصل قبل ، ما فواصل اطمینان را ساختیم و آزمایشات معنی داری را برای پارامتر جمعیت μ (میانگین جمعیت) انجام دادیم. ما به آمار نمونه مانند میانگین و انحراف استاندارد برای برآورد نقطه ، حاشیه خطاها و آمار آزمون اعتماد داشتیم. استنتاج برای پارامترهای جمعیت β 0 (شیب) و β 1 (y- رهگیری) بسیار مشابه است.

استنتاج شیب و رهگیری بر اساس توزیع عادی با استفاده از برآوردهای B 0 و B 1 است. انحراف استاندارد این تخمین ها چند برابر σ ، خطای استاندارد رگرسیون جمعیت است. به یاد داشته باشید ، ما σ را با S (تغییرپذیری داده ها در مورد خط رگرسیون) تخمین می زنیم. از آنجا که ما از S استفاده می کنیم ، ما به توزیع T دانشجویی با (N-2) درجه آزادی متکی هستیم.

12112.png

خطای استاندارد برای برآورد β 0

12122.png

خطای استاندارد برای برآورد β 1

ما می توانیم فواصل اطمینان را برای شیب رگرسیون بسازیم و به همان روشی که هنگام تخمین جمعیت انجام دادیم ، رهگیری کنیم.

فاصله اطمینان برای β 0: B 0 ± T α /2 SE B0

فاصله اطمینان برای β 1: B 1 ± T α /2 SE B1

جایی که SE B0 و SE B1 به ترتیب خطاهای استاندارد برای رهگیری Y و شیب هستند.

ما همچنین می توانیم فرضیه H 0 را آزمایش کنیم: β 1 = 0. وقتی β 1 = 0 را در مدل جایگزین می کنیم ، X- ترم از بین می رود و ما با μ y = β 0 باقی می مانند. این به ما می گوید که میانگین y با x متفاوت نیست. به عبارت دیگر ، هیچ رابطه مستقیمی بین x و y وجود ندارد و رگرسیون y بر روی x برای پیش بینی y هیچ ارزشی ندارد.

آزمون فرضیه برای β 1

آمار آزمون t = b 1 / se b1 است

ما همچنین می توانیم از F-Statistic (MSR/MSE) در جدول ANOVA رگرسیون استفاده کنیم*

*به یاد بیاورید که t 2 = f

بنابراین بیایید همه اینها را در یک مثال جمع کنیم.

مثال 3

شاخص یکپارچگی بیوتیک (IBI) اندازه گیری کیفیت آب در جریان است. به عنوان مدیر منابع طبیعی در این منطقه ، شما باید تغییرات در کیفیت آب را رصد ، ردیابی و پیش بینی کنید. شما می خواهید یک مدل رگرسیون خطی ساده ایجاد کنید که به شما امکان می دهد تغییرات IBI را در منطقه جنگلی پیش بینی کنید. در جدول زیر داده های نمونه از یک منطقه جنگلی ساحلی را منتقل می کند و داده های مربوط به IBI و منطقه جنگلی را در کیلومتر مربع ارائه می دهد. بگذارید منطقه جنگل متغیر پیش بینی کننده (X) باشد و IBI متغیر پاسخ (Y) باشد.

11090.png

جدول 1. داده های مشاهده شده از یکپارچگی بیوتیک و منطقه جنگل.

ما با یک آمار توصیفی محاسباتی و پراکندگی IBI در برابر منطقه جنگل شروع می کنیم.

x̄ = 47. 42 ؛S x 27. 37 ؛ȳ = 58. 80 ؛S y = 21. 38 ؛r = 0. 735

11080.png

شکل 18. پراکندگی IBI در مقابل منطقه جنگل.

به نظر می رسد رابطه خطی مثبت بین دو متغیر وجود دارد. ضریب همبستگی خطی R = 0. 735 است. این نشانگر یک رابطه قوی ، مثبت و خطی است. به عبارت دیگر ، منطقه جنگلی پیش بینی کننده خوبی از IBI است. اکنون بیایید یک مدل رگرسیون خطی ساده با استفاده از منطقه جنگل برای پیش بینی IBI (پاسخ) ایجاد کنیم.

ابتدا با استفاده از معادلات میانبر ، B 0 و B 1 را محاسبه خواهیم کرد.

= = 0. 574

= 31. 581

12216.png

معادله رگرسیون است.

اکنون بیایید از Minitab برای محاسبه مدل رگرسیون استفاده کنیم. خروجی در زیر ظاهر می شود.

تجزیه و تحلیل رگرسیون: IBI در مقابل منطقه جنگل

معادله رگرسیون IBI = 31. 6 + 0. 574 منطقه جنگل است

4. 177

0. 07648

S = 14. 6505

r-sq = 54. 0 ٪

تحلیل واریانس

215

تخمین های β 0 و β 1 به ترتیب 31. 6 و 0. 574 است. ما می توانیم با تعبیر Y به معنای این بدانیم که وقتی منطقه جنگلی صفر وجود داشته باشد ، IBI با 31. 6 برابر خواهد شد. برای هر کیلومتر مربع اضافی منطقه جنگلی اضافه شده ، IBI با 0. 574 واحد افزایش می یابد.

ضریب تعیین ، R 2 ، 54. 0 ٪ است. این بدان معنی است که 54 ٪ از تغییرات در IBI توسط این مدل توضیح داده شده است. تقریباً 46 ٪ از تغییرات در IBI به دلیل سایر عوامل یا تغییر تصادفی است. ما دوست داریم R 2 تا حد امکان (حداکثر مقدار 100 ٪) باشد.

توطئه های احتمال باقیمانده و طبیعی هیچ مشکلی را نشان نمی دهد.

11070.png

شکل 19. یک طرح احتمال باقیمانده و طبیعی.

12275.png

برآورد σ ، خطای استاندارد رگرسیون ، S = 14. 6505 است. این یک اندازه گیری از تغییر مقادیر مشاهده شده در مورد خط رگرسیون جمعیت است. ما دوست داریم این مقدار تا حد ممکن کوچک باشد. MSE برابر با 215 است. به یاد داشته باشید ، = s. خطاهای استاندارد برای ضرایب برای y-intruce و 0. 07648 برای شیب 4. 177 است.

ما می دانیم که مقادیر b 0 = 31. 6 و b 1 = 0. 574 برآورد نمونه از پارامترهای جمعیتی واقعی اما ناشناخته β 0 و β 1 است. ما می توانیم 95 ٪ فاصله اطمینان را برای برآورد بهتر این پارامترها بسازیم. مقدار بحرانی (T α /2) از توزیع T دانشجویی با (N-2) درجه آزادی ناشی می شود. اندازه نمونه ما 50 است بنابراین ما 48 درجه آزادی خواهیم داشت. نزدیکترین مقدار جدول 2. 009 است.

فاصله اطمینان 95 ٪ برای β 0 و β 1

B 0 ± T α /2 SE B0 = 31. 6 ± 2. 009 (4. 177) = (23. 21 ، 39. 99)

B 1 ± T α /2 SE B1 = 2. 009 ± 0. 574 (0. 07648) = (0. 4204 ، 0. 7277)

مرحله بعدی آزمایش این است که شیب با استفاده از سطح 5 ٪ از اهمیت با صفر تفاوت معنی داری دارد.

T = B 1 / SE B1 = 0. 574 / 0. 07648 = 7. 50523

ما 48 درجه آزادی داریم و نزدیکترین ارزش بحرانی از توزیع T دانشجویی 2. 009 است. آمار آزمون از مقدار بحرانی بیشتر است ، بنابراین ما فرضیه تهی را رد خواهیم کرد. شیب تفاوت قابل توجهی با صفر دارد. ما از نظر آماری رابطه معنی داری بین منطقه جنگلی و IBI پیدا کرده ایم.

خروجی MINITAB همچنین آمار آزمون و مقدار P را برای این آزمایش گزارش می دهد.

معادله رگرسیون IBI = 31. 6 + 0. 574 منطقه جنگل است

7. 50

0. 000

تحلیل واریانس

56. 32

0. 000

آمار آزمون T 7. 50 با مقدار p مرتبط با 0. 000 است. مقدار p کمتر از سطح اهمیت (5 ٪) است بنابراین ما فرضیه تهی را رد خواهیم کرد. شیب تفاوت قابل توجهی با صفر دارد. همین نتیجه را می توان از آمار آزمون F 56. 32 (7. 505 2 = 56. 32) یافت. مقدار p همان نتیجه گیری (0. 000) است.

فاصله اطمینان برای μ y

اکنون که ما یک مدل رگرسیون ایجاد کرده ایم که بر اساس رابطه معنی داری بین متغیر پیش بینی کننده و متغیر پاسخ ساخته شده است ، ما آماده استفاده از مدل هستیم

  • تخمین میانگین مقدار y برای مقدار معین x
  • پیش بینی یک مقدار خاص از y برای مقدار معین x

بیایید گزینه اول را بررسی کنیم. داده های نمونه از جفت N که از یک جمعیت گرفته شده است برای محاسبه ضرایب رگرسیون B 0 و B 1 برای مدل ما استفاده شد و میانگین مقدار Y را برای یک مقدار خاص x از طریق مدل جمعیت ما به ما می دهد

بشربرای هر مقدار خاص x ، یک y (μ ch) متوسط وجود دارد که در معادله خط مستقیم (یک خط از میانگین) قرار می گیرد. به یاد داشته باشید که می توان مقادیر مشاهده شده متفاوتی از Y را برای یک X خاص وجود داشت ، و فرض بر این است که این مقادیر دارای توزیع عادی با میانگین برابر و واریانس σ 2 هستند. از آنجا که مقادیر محاسبه شده B 0 و B 1 از نمونه به نمونه متفاوت است ، هر نمونه جدید ممکن است معادله رگرسیون کمی متفاوت تولید کند. از هر مدل جدید می توان برای تخمین مقدار y برای مقدار x استفاده کرد. برآوردگر ما از جمعیت واقعی تا چه اندازه برای این ارزش x خواهد بود؟این مانند همیشه به تغییرپذیری در برآوردگر ما بستگی دارد که با خطای استاندارد اندازه گیری می شود.

می توان نشان داد که مقدار تخمین زده شده از y هنگامی که x = x 0 (مقداری مشخص شده x) ، یک برآوردگر بی طرفانه از میانگین جمعیت است ، و این که P̂ به طور معمول با یک خطای استاندارد توزیع می شود

12371.png

ما می توانیم یک فاصله اطمینان را برای برآورد بهتر این پارامتر (μ در Y) به دنبال همان روشی که قبلاً در این فصل نشان داده شده بود ، بسازیم.

12387.png

جایی که مقدار بحرانی t α /2 از جدول T دانشجویی با درجه (N-2) از آزادی ناشی می شود.

نرم افزار آماری مانند Minitab فواصل اطمینان را برای شما محاسبه می کند. با استفاده از داده های مثال قبلی ، ما از Minitab برای محاسبه فاصله اطمینان 95 ٪ برای میانگین پاسخ برای یک منطقه جنگلی متوسط 32 کیلومتر استفاده خواهیم کرد.

استراتژی‌های اسکالپ...
ما را در سایت استراتژی‌های اسکالپ دنبال می کنید

برچسب : نویسنده : ناصر تقوایی بازدید : <-PostHit-> تاريخ : جمعه 5 خرداد 1402 ساعت: 16:02