تجزیه و تحلیل داده های پیشرفته

ساخت وبلاگ

مدل سازی پیش بینی شامل کار کردن چگونه یک مجموعه از متغیرها متغیر دیگری را پیش بینی می کند. دو "طعم" از این نوع تجزیه و تحلیل وجود دارد که معمول هستند: تجزیه و تحلیل درایور و هدف قرار دادن.

تجزیه و تحلیل راننده

تجزیه و تحلیل درایور به دنبال این است که نقش نسبی را که محرک های مختلف اولویت در یک بازار بازی می کنند ، بر عهده بگیرد. به عنوان مثال ، اگر یک سؤال وجود داشته باشد که رضایت کلی را اندازه گیری کند و سؤال دیگری که رضایت از مناطق مختلف یک شرکت را اندازه گیری می کند (به عنوان مثال ، خدمات مشتری ، قیمت ، کیفیت) ، سپس می توان از تجزیه و تحلیل درایور برای تعیین کمیت تأثیر نسبی هر یک از این موارد استفاده کرد. مناطق کلی در مورد ترجیح کلی. تجزیه و تحلیل راننده معمولاً با استفاده از رگرسیون انجام می شود. مدل سازی انتخاب نوعی تجزیه و تحلیل درایور است.

پسرفت

رگرسیون ابزاری آماری برای کمیت یک مدل است. خروجی کلیدی رگرسیون یک فرمول است ، مانند:

فروش $ = 121 $ + 4. 1 × $ هزینه تبلیغات تلویزیون + 3. 2 × $ هزینه تبلیغات آنلاین

با چنین فرمول ممکن است:

  • پیش بینی کنیدبه عنوان مثال ، با استفاده از فرمول فوق ، بنگاهی که 1،000،000 دلار در تبلیغات تلویزیونی خرج می کند و هیچ چیز در هزینه های تبلیغاتی پیش بینی می شود فروش 121 + 4. 1 × 1،000،000 دلار = 4،100،121 دلار پیش بینی شود.
  • نتیجه گیری در مورد اثربخشی نسبی. به عنوان مثال ، معادله فوق نشان می دهد که تبلیغات تلویزیونی از تبلیغات آنلاین مؤثرتر است.

بیشتر مدل های رگرسیون با داشتن یک متغیر وابسته و یک یا چند متغیر مستقل مشخص می شوند.

در مثال بالا متغیر وابسته فروش است. متغیرهای وابسته مشترک در برنامه های تجزیه و تحلیل پیمایشی شامل موارد زیر است:

  • رضایت کلی از یک محصول یا یک سرویس.
  • احتمال توصیه یک محصول یا خدمات.
  • نمره تبلیغ کننده خالص.
  • احتمال استفاده مجدد از یک محصول یا خدمات.
  • کیفیت محصول.
  • فرکانس خرید یا استفاده از یک محصول یا خدمات.

متغیرهای مستقل به طور معمول لیستی از متغیرهایی خواهند بود که اعتقاد بر این است که مقدار متغیر وابسته را تعیین می کنند. در مثال بالا ، متغیرهای مستقل هستندهزینه تبلیغات تلویزیونی $هزینه تبلیغات آنلاین $بشردر بیشتر کاربردهای رگرسیون به تجزیه و تحلیل نظرسنجی ، متغیرهای مستقل یا:

  • متغیرهای جمعیتی. به عنوان مثال ، در صورت تمایل به شناسایی مشتریان با ارزش بالا ، متغیر وابسته ممکن است مبلغی از هزینه هزینه شود و متغیرهای مستقل جمعیتی باشند.
  • اندازه گیری عملکرد در مناطق مختلف. به عنوان مثال ، اگر متغیر وابسته رضایت از یک شرکت هواپیمایی را اندازه گیری کند ، متغیرهای مستقل می توانند چیزهایی مانند رضایت از غذا ، رضایت از خدمه کابین ، رضایت از سرگرمی در پرواز و غیره باشند. چنین مدل رگرسیون به عنوان تجزیه و تحلیل درایور شناخته می شود.
  • اندازه گیری تلاش در مناطق مختلف. به عنوان مثال ، هزینه های مربوط به انواع مختلف تبلیغات ، مانند مثال فوق.

هدف گذاری

هدف قرار دادن ، که به دنبال شناسایی ویژگی های متمایز گروهی از افراد مورد علاقه خاص است (به عنوان مثال ، اگر می خواهید مشخصات جمعیتی سنگین ترین کاربران یک سرویس را درک کنید). ده ها تکنیک در استفاده گسترده برای هدف قرار دادن وجود دارد. با این حال ، بسیاری از این تکنیک ها بسیار پیچیده و نادرست تفسیر هستند. تنها یکی از این ابزارهایی که به راحتی توسط افراد غیر آمیز قابل استفاده است ، درختان پیش بینی کننده است.

درختان پیش بینی کننده

یک درخت پیش بینی کننده تحلیلی است که به نظر می رسد مانند یک درخت وارونه است. اگرچه به نظر می رسد کاملاً پیچیده است که این "درخت" فقط یک نمایش گرافیکی از یک جدول است. اصطلاح درخت پیش بینی یک اصطلاح استاندارد نیست. همان ایده اصلی دارای نام تجاری مختلفی از جمله: RPART (R) ، درخت و پاسخ دهنده (SPSS) و Chaid (نوآوری های آماری) ، سبد ، درختان رگرسیون ، درختان طبقه بندی و درختان تصمیم گیری است.

مثال

درخت زیر تعداد پیام کوتاه افراد در مطالعه مثال موبایل را پیش بینی می کند. جعبه بالای درخت داده ها را برای کل نمونه (یعنی 100 ٪) نشان می دهد. این به طور متوسط 11. 0 پیامک متنی برای هر شخص نشان می دهد و هیستوگرام (نمودار ستون) نشان می دهد که رایج ترین پاسخ در حدود 0 است. از این درخت می توانیم ببینیم که اولین متغیر پیش بینی کننده استوضعیت زناشویی: افرادی که هستندتنهابه طور متوسط 20. 7 پیام کوتاه ارسال کرد ، در مقایسه با 4. 0 در بین افراد غیر تک.

به عنوانتنهاطبقه بندی بیشتر تقسیم نمی شود ، این به ما می گوید که هنگامی که می دانیم کسی مجرد است ، می توانیم بدون هیچ گونه اطلاعات بیشتر پیش بینی کنیم ، جایی که پیش بینی این است که یک شخص مجرد 20. 7 پیام کوتاه را انجام می دهد. از هیستوگرام می بینیم که هنوز تنوع قابل توجهی در بین این افراد مجرد وجود دارد.

اکنون به افرادی که مجرد نیستند نگاه می کنم (یعنی ،متاهل/de facto + جدا شده/طلاق + بیوه) ، این گروه بر اساس سن تقسیم می شود و می بینیم که افرادی هستندمتاهل/de facto + جدا شده/طلاق + بیوهو در سن 45 سال سن متوسط تعداد پیامک در هر ماه 9. 3 دارند ، در مقایسه با 2. 2 در میان کسانی که در سن 45 سال یا بیشتر هستند و هستندمتاهل/de facto + جدا شده/طلاق + بیوه.

با نگاهی بیشتر در پایین درخت می توانیم ببینیم که این گروه جوانتر با این که آیا آنها فرزند دارند ، سن دوباره و شغل دارند ، بیشتر تقسیم می شود.

Tree1.png

مشاهده درخت به عنوان یک میز

درخت فوق نیز می تواند به عنوان یک جدول (مسلماً زشت) بیان شود:

نقاط قوت و ضعف درختان پیش بینی

قدرت اصلی درختان پیش بینی سهولت استفاده است. مشروط بر اینکه کمی از عواملی استفاده کنید و وقت خود را برای یادگیری نحوه استفاده از نرم افزاری که استفاده می کنید ، انجام دهید ، سخت است که به خصوص در یک درخت اشتباه کنید. درختان پیش بینی نزدیکترین چیزی است که به یک تکنیک تجزیه و تحلیل پیشرفته ضد احمق وجود دارد. در مقابل ، رگرسیون ، که می تواند برای مشکلات مشابه استفاده شود ، اغلب توسط محققان بسیار باتجربه به طور نادرست استفاده می شود.

محدودیت های اصلی درختان پیش بینی این است که:

  • آنها در بهترین حالت خود با اندازه نمونه بسیار بزرگ هستند. درختان پیش بینی کننده با کمتر از چند صد مشاهده اغلب مفید نیستند. این امر به این دلیل است که هر بار که درخت اندازه نمونه را تقسیم می کند نیز تقسیم می شود ، بنابراین با اندازه نمونه های کوچک درختان فقط یک یا دو متغیر دارند.
  • از درختان پیش بینی نمی توان برای نتیجه گیری در مورد اینکه کدام متغیرها قوی هستند و پیش بینی کننده های ضعیف هستند ، استفاده شود. به عنوان مثال ، نگاه کردن بهتنهاتعبیر طبیعی ، اما نادرست ، این است که سن بی ربط است زیرا برای تقسیم بیشتر این گروه استفاده نمی شود. با این حال ، چنین تفسیری صحیح نیست زیرا نادیده می گیرد که مجرد بودن با جوان بودن در ارتباط است. برای قدردانی از این ، ما می توانیم وضعیت تأهل را محروم کنیم و دوباره درخت را رشد دهیم. درخت اصلاح شده در زیر نشان داده شده است. توجه داشته باشید که اکنون سن نشان داده شده است که اولین پیش بینی کننده تعداد پیامک در هفته است و به نظر می رسد در دقت پیش بینی کننده آن به وضعیت زناشویی نزدیک است ، با پیش بینی های مختلف از 2. 8 تا 22. 3 ، در مقایسه با 4. 0 تا 20. 7 برای زناشوییوضعیت[یادداشت 1]

TreesRevised.png

نرم افزار

بیشتر تکنیک های آماری پیشرفته از نظر منطقی استاندارد هستند و برنامه های مختلف اساساً همان خروجی ها را ارائه می دهند. این مورد در مورد درختان پیش بینی نیست. بیشتر شرکت های نرم افزاری درختان خود را به روش های مختلف ایجاد می کنند و تمایز بین درختان ایجاد شده توسط برنامه های مختلف می تواند بزرگ باشد.

تمام برنامه های پیش بینی کننده درختی متداول از لحاظ فنی به عنوان الگوریتم های تفرقه آمیز بازگشتی توصیف می شوند ، که یک روش جالب برای گفتن آنها است:

  1. متغیری را پیدا کنید که به بهترین وجه پیش بینی می شود.
  2. نمونه را به گروههایی تقسیم کنید که از نظر این متغیر نسبتاً مشابه هستند (به عنوان مثال ، در درخت در بالای این صفحه ، گروه ها بر اساس وضعیت تأهل تعریف شدند).
  3. برای هر یک از گروه های جدید ، مراحل 1 و 2 را تکرار کنید ، به طور مداوم هر گروه را تقسیم کنید و تقسیم بیشتر تا زمانی که تقسیم بیشتر عملی نباشد..

تفاوت های کلیدی بین بیت های مختلف نرم افزار عبارتند از:

  • آنچه آنها می توانند پیش بینی کنند. بیشتر برنامه ها فقط یک متغیر عددی یا عددی واحد را پیش بینی می کنند. استثناء اصلی این Q ، Q است که می تواند همزمان چندین نوع داده عددی ، طبقه بندی و سایر انواع داده های عجیب و غریب را پیش بینی کند (به عنوان مثال ، داده های مدل سازی انتخاب).
  • هر بار که یک شکاف انجام می دهند ، چند گروه تشکیل می دهند. در مثالهای بالا ، برنامه (در این مورد Q) ، سعی می کند تعداد گروه ها را در هر سطح از درخت به طور به صورت بهینه انجام دهد. یک رویکرد مشابه توسط درخت SPSS ، پاسخ دهنده ، Chaid و DisplayR استفاده می شود. رویکرد جایگزین این است که همیشه به دو گروه تقسیم شود. این روش در سبد خرید استفاده می شود.
  • از چه قوانینی برای تعیین زمان متوقف کردن گروه های تقسیم بیشتر در درخت استفاده می کنند. هر یک از برنامه ها روش های مختلفی برای انجام این کار دارند ، از جمله:
    • نیاز به این که تقسیمات اضافی باعث بهبود دقت پیش بینی درخت شود (برنامه های مختلف از این طریق به روش های مختلف اجرا می شوند ؛ Chaid از تست های اهمیت استفاده می کند ، DisplayR و Q از معیارهای اطلاعات استفاده می کنند و سبد خرید معمولاً از اعتبار متقابل استفاده می کند).
    • مشخص کردن حداقل اندازه نمونه که پس از آن یک گروه نمی تواند بیشتر تقسیم شود.
    • مشخص کردن حداکثر تعداد سطح درخت.

    یادداشت

    1. پرش به سمت بالا - در واقع ، ممکن است به نظر برسد که سن پیش بینی کننده بهتری است ، زیرا دامنه بیشتری دارد. با این حال ، در این حالت شغل ترجیح داده می شود زیرا تعداد کمی از دسته ها با دقت پیش بینی کاملاً مشابهی دارد. این نمونه ای از اصل پارسیمونی در هنگام ایجاد یک مدل در نظر گرفته شده است.

    تقسیم بندی

    تقسیم بندی شامل یافتن گروه هایی از افراد است که در یک نظرسنجی پاسخ های مشابهی داده اند با این هدف که می توان استراتژی های مشابهی را برای هر یک از بخش های افراد مشابه توسعه داد. به عنوان مثال ، اگر مطالعه ای انجام شده است و به دنبال نوع فعالیت های اوقات فراغت است که افراد انجام می دهند ، تقسیم بندی گروه هایی از افرادی را که انواع مشابهی از فعالیت های اوقات فراغت را انجام می دهند ، شناسایی می کند. سه روش اصلی وجود دارد که افراد بخش هستند: داوری ، تجزیه و تحلیل خوشه ای و تجزیه و تحلیل کلاس نهفته.

    داوری

    هنگامی که از قضاوت برای ایجاد بخش استفاده می شود ، معمولاً شامل انتخاب یک متغیر واحد یا ترکیبی از تعداد کمی از متغیرها است که به بسیاری از متغیرهای اصلی در این بررسی مربوط می شود. به عنوان مثال ، اگر متقاطع فاش می کرد که سن با بسیاری از سؤالات دیگر در نظرسنجی ارتباط دارد تا اینکه ممکن است با استفاده از سن تقسیم شود.

    آنالیز خوشه ای

    رویکرد سنتی برای انجام تقسیم بندی استفاده از تجزیه و تحلیل خوشه ای است. تجزیه و تحلیل خوشه ای فرض می کند که:

    • هیچ داده ای از دست رفته وجود ندارد (به عنوان مثال ، هر یک از پاسخ دهندگان داده هایی را در مورد تمام متغیرها ارائه داده اند.
    • همه متغیرها عددی هستند.
    • تمام متغیر دارای یک محدوده یکسان هستند (به عنوان مثال ، بالاترین و کمترین مقادیر).

    غالباً این مورد است که یک یا چند مورد از این فرضیات برآورده نمی شود. تکنیک های مختلفی وجود دارد که می تواند برای تلاش و غلبه بر این فرضیات استفاده شود.

    اصول اولیه

    تجزیه و تحلیل خوشه گروه هایی از پاسخ دهندگان مشابه را پیدا می کند ، جایی که اگر تفاوت های نسبتاً کمی بین رتبه بندی متوسط آنها وجود داشته باشد ، پاسخ دهندگان مشابه هستند. به عنوان نمونه ، به طرح زیر نگاه کنید. این یک پراکندگی است که داده ها را برای 18 پاسخ دهنده در دو متغیر عددی نشان می دهد. امیدوارم ببینید که نقاط در دو گروه قرار می گیرند. اگر از تجزیه و تحلیل خوشه ای برای تجزیه و تحلیل این داده ها استفاده کرده اید ، مشروط بر اینکه کار اشتباهی انجام نداده باشید ، همان دو گروه را نیز می بینید که می توانید ببینید. این گروه ها سپس خوشه نامیده می شوند.

    ClusterStep1.png

    به طور معمول ما بیش از دو متغیر داریم و این باعث می شود تجسم داده ها و تعیین خوشه ها برای ما دشوار شود. در چنین شرایطی است که ما باید از تجزیه و تحلیل خوشه ای استفاده کنیم. داده های زیر را در نظر بگیرید ، که پاسخ 20 پاسخ دهنده به 7 متغیر را نشان می دهد (این از SPSS است). آیا می توانید الگویی را ببینید؟اگر سخت کار کنید شاید بتوانید یکی را پیدا کنید. با این حال ، این 20 پاسخ دهنده از یک نمونه از 498 پاسخ دهنده هستند و تعداد کمی از افراد می توانند یک جدول را بخوانند که تمام داده های خود را نشان می دهد و هر خوشه ای را شناسایی می کند ، به همین دلیل از تجزیه و تحلیل خوشه ای (یا بهتر ، تجزیه و تحلیل کلاس نهفته) برای یافتن خوشه ها استفاده می شود. در داده هاSurveyAnalysis. org بحث مفصلی در مورد نحوه عملکرد تجزیه و تحلیل خوشه دارد.

    ObservationsCluster.PNG

    مثال

    این مثال داده هایی را که در انتهای بخش قبلی پیش نمایش داده شده است ، تجزیه و تحلیل می کند. در صورت تمایل به تکرار مثال می توانید پرونده و پرسشنامه SPSS را بارگیری کنید. این داده ها شامل هفت متغیر است که نگرش به تلفن های همراه را اندازه گیری می کند ، جایی که از پاسخ دهندگان خواسته شد تا با بیانیه های زیر میزان توافق/اختلاف نظر خود را ارائه دهند:

    • فناوری جذاب است
    • من اغلب از اندازه صورتحسابها تعجب می کنم
    • تعیین بهترین معامله دشوار است
    • من زمان زیادی را برای خرید بهترین معامله صرف کردم
    • من از نزدیک زمانی را که در تلفن می گذرانم نظارت می کنم
    • هزینه در تصمیم گیری در مورد اس ام اس یا تلفن عاملی است
    • من سعی می کنم تماس ها را کوتاه و به یک نکته حفظ کنم

    مقیاس مورد استفاده:

    کاملاً موافقم که کمی مخالف نیست و کمی مخالفم نمی دانم نمی دانم

    در نتیجه ، قبل از تجزیه و تحلیل داده ها ، داده های مورد نیاز برای تهیه از دو طریق:

    1. افرادی که گفتندنمی دانمکدهای مقدار از دست رفته در متغیرهای مربوطه اختصاص داده شدند.
    2. داده ها به گونه ای منتشر شد که یک مقدار از1اختصاص داده شدبه شدت مخالف, 2بهکمی مخالفو به همین ترتیب تا 5. توجه داشته باشید که این مقادیر دقیق دلخواه هستند زیرا هیچ دلیل خوبی وجود ندارد که چرا باید این دسته از مقادیر 1 تا 5 با فضای 1 بین هر نقطه مقیاس اختصاص یابد. در حالی که خودسرانه است ، با این وجود این یک روش استاندارد است.

    روال تجزیه و تحلیل خوشه ای دو مرحله ای SPSS ، که بهترین تکنیک های تجزیه و تحلیل خوشه ای است که در SPSS موجود است ، [توجه 1] پنج راه حل خوشه زیر را توصیه می کند.

    ردیف بالای جدول اندازه خوشه ها را نشان می دهد. می توانیم ببینیم که تقریباً 25 ٪ از نمونه در خوشه اول ، 22 ٪ در دوم و غیره است.

    متغیرها سپس در زیر هر خوشه به ترتیب اهمیت آنها در تعیین عضویت در خوشه ذکر شده اند. با نگاهی به خوشه 1 می بینیم که متغیر نشان داده شده در بالا استتعیین بهترین معامله دشوار استبشراز آنجا که مقدار متوسط آن 1. 92 است و به عنوان 2 نشان می دهدکمی مخالفما می توانیم نتیجه بگیریم که افراد در خوشه 1 شناسایی بهترین معامله را نسبتاً آسان می دانند. با نگاهی به جای دیگر جدول ، می بینیم که همه خوشه های دیگر پیدا کردن بهترین معامله را سخت می دانند (یعنی ، زیرا میانگین آنها بسیار بالاتر از 1. 92 است). به همین ترتیب ، اگر به خوشه 2 نگاه کنیم ، می بینیم که مهمترین تعیین کننده عضویت در این خوشه سطح توافق با بیانیه بوداز نزدیک از طریق تلفن نظارت می کند.

    TwoStepCluster.PNG

    در یک مطالعه در دنیای واقعی ، روند اساسی از این نقطه به:

    • خلاصه ای از جنبه های منحصر به فرد هر یک از خوشه ها را ایجاد کنید.
    • Crosstabs از خوشه ها را در مقابل سایر جداول جالب اجرا کنید تا ببینید آیا روابط جالب دیگری وجود دارد یا خیر.
    • راه حل های جایگزین تجزیه و تحلیل خوشه ای را بررسی کنید. به طور کلی کشف راه حل هایی با خوشه های کمتری نسبت به مواردی که به طور خودکار پیشنهاد می شوند ، مفید است. در این حالت ، یک راه حل پنج خوشه به طور خودکار شناسایی شد ، بنابراین توصیه می شود راه حل ها را با چهار ، سه و دو خوشه بررسی کنید.(توجه داشته باشید که هیچ روش واقعاً علمی برای تعیین تعداد خوشه ها وجود ندارد و اینکه تمام روشهای خودکار برای انتخاب تعداد خوشه ها واقعاً شناسایی حداکثر تعداد معقول است.)
    • برای هر یک از خوشه ها نامهای تحریک آمیز (به عنوان مثال ، "گویندگان بزرگ") بیایید.

    تجزیه و تحلیل کلاس نهان

    تجزیه و تحلیل کلاس نهان در اصل نسخه بهبود یافته تجزیه و تحلیل خوشه ای است. از آن برای همان نوع چیزهایی که تجزیه و تحلیل خوشه ای است استفاده می شود. در تجزیه و تحلیل نظرسنجی ، این عمدتاً شامل یافتن بخش ها است. تجزیه و تحلیل کلاس نهان در تجزیه و تحلیل خوشه ای به دو روش مهم بهبود می یابد:

    • این قادر است انواع مختلفی از داده ها را کنترل کند (به عنوان مثال ، رتبه بندی ، رتبه بندی ، مدل سازی انتخاب).
    • به طور خودکار مقادیر گمشده را مورد بررسی قرار می دهد.

    مثال

    خروجی زیر توسط Q ایجاد شده است (و تقریباً با آن که توسط DisplayR ایجاد شده است). هفت متغیر از مطالعه موبایل در تجزیه و تحلیل استفاده شده است: شش متغیرهای عددی اندازه گیری نگرش (به تجزیه و تحلیل خوشه ای برای بحث در مورد این داده ها مراجعه کنید) ، و هفتم یک متغیر طبقه بندی شده است که میانگین صورتحساب ماهانه را اندازه گیری می کند. Q به طور خودکار دو بخش را شناسایی کرده است. بخش اول شامل 60 ٪ از بازار است و آنها افرادی هستند که صورتحساب متوسط نسبتاً کمتری دارند که نگرش ها نشان می دهد که آنها نسبتاً هزینه متمرکز هستند. بخش دوم عمدتاً شامل افرادی با هزینه های ماهانه بالاتری است که کمتر نگران قیمت هستند اما احتمالاً از اندازه صورتحساب آنها شگفت زده می شوند.

    LatentClass.PNG

    انتخاب تعداد بخش ها

    هنگام انتخاب تعداد بخش ها ، باید معامله ای انجام شود. هرچه بخش های بیشتری داشته باشد ، میزان تجزیه و تحلیل تا چه اندازه تنوع مشاهده شده در داده ها را نشان می دهد. این نشان می دهد که داشتن تعداد زیادی از بخش ها مطلوب است. با این حال ، هرچه بخش های بیشتری وجود داشته باشد ، خطر این که تنوع مورد نظر تنوع بی معنی باشد ، بیشتر می شود. خطر این است که بخش ها به جای تنوع واقعی در جهان ، منعکس کننده خواص داده های خاص مورد استفاده در تجزیه و تحلیل هستند. این نشان می دهد که بخش های کمتری از آن ترجیح داده می شود.

    اکتشافی های مختلفی ایجاد شده است که تلاش برای یافتن نقطه شیرین در این تجارت است. بیشترین استفاده از معیار اطلاعات بیزی (BIC) است که برای هر تعداد ممکن از بخش ها مقداری را محاسبه می کند و توصیه می کند که بهترین تقسیم بندی با کمترین BIC باشد. باید در نظر داشته باشید که اکتشافی مانند این فقط قوانین شست است و مناسب نیست که فرض کنیم تعداد بخش های مشخص شده توسط BIC از هر نظر بهینه است. در حالی که در صورت انتخاب تعداد بیشتری از بخش ها از آنچه توسط BIC پیشنهاد شده است ، باید احتیاط شود ، اغلب دلیل خوبی برای انتخاب تعداد کمتری از بخش ها وجود دارد ، زیرا این امر اغلب از نظر اجرای تقسیم بندی عملی تر است.

    نقشه برداری ادراکی

    نقشه های ادراکی نمودارهایی هستند که روابط بین دسته های مختلف را در یک نظرسنجی نشان می دهد. به عنوان مثال ، نقشه زیر نشان می دهد که چگونه مارک های مختلف کولا درک می شوند. بیشتر نقشه های ادراکی مورد استفاده در تجزیه و تحلیل پیمایشی با استفاده از تجزیه و تحلیل مکاتبات ایجاد می شوند. مثال زیر در DisplayR ایجاد شده است.

    شناسایی متغیرهای همبسته

    بعضی اوقات درک این مسئله که چگونه بین تعداد زیادی از متغیرها ارتباط وجود دارد ، مفید است. به عنوان مثال ، این می تواند برای:

    • درک کنید که نگرش و/یا رفتارها چگونه به هم پیوسته اند.
    • در صورت نیاز به ساده کردن آن ، سؤالات اضافی را در یک پرسشنامه شناسایی کنید.
    • مفاهیم اضافی را به شکل یک آزمون مفهومی شناسایی کنید.
    • خلاصه کردن داده ها.
    • داده ها را قبل از استفاده از سایر تکنیک های چند متغیره (به عنوان مثال ، تجزیه و تحلیل خوشه ای و رگرسیون) تبدیل کنید.

    شناسایی متغیرهای همبسته به طور کلی با استفاده از تجزیه و تحلیل مؤلفه های اصلی انجام می شود ، اما بیشتر اوقات وقتی محققان تجزیه و تحلیل مؤلفه های اصلی را انجام می دهند ، آنها را به عنوان تجزیه و تحلیل عاملی (که از نظر فنی یک تکنیک متفاوت است ، از آن استفاده می کنند ، اما تفاوت ها بی اهمیت است).

    تجزیه و تحلیل مؤلفه های اصلی متغیرهایی را که با یکدیگر ارتباط دارند ، مشخص می کند.

    تجزیه و تحلیل مؤلفه های اصلی

    تجزیه و تحلیل مؤلفه های اصلی متغیرهایی را که با یکدیگر ارتباط دارند ، مشخص می کند.

    مثال

    این مثال هفت متغیر را اندازه گیری میزان توافق با گفته های زیر تجزیه و تحلیل می کند:

    • فناوری جذاب است
    • من اغلب از اندازه صورتحسابها تعجب می کنم
    • تعیین بهترین معامله دشوار است
    • من زمان زیادی را برای خرید بهترین معامله صرف کردم
    • من از نزدیک زمانی را که در تلفن می گذرانم نظارت می کنم
    • هزینه در تصمیم گیری در مورد اس ام اس یا تلفن عاملی است
    • من سعی می کنم تماس ها را کوتاه و تا حدی نگه دارم

    خروجی کلیدی تجزیه و تحلیل مؤلفه های اصلی ماتریس مؤلفه چرخشی مانند نمونه ای که در زیر نشان داده شده است (محاسبه شده با استفاده از SPSS) است. هفت متغیر مورد تجزیه و تحلیل را می توان به سه متغیر کاهش داد. هفت متغیر اصلی در ردیف ها نشان داده شده و سه متغیر جدید توسط ستون ها نشان داده شده و به عنوان مؤلفه ها گفته می شود. اعداد موجود در جدول همبستگی دارند اما هنگام انجام تجزیه و تحلیل مؤلفه های اصلی ، معمولاً به آنها بارهای گفته می شود.

    RotatedComponentMatrix.PNG

    این خروجی به شرح زیر است:

    • مؤلفه اول بسیار با همبستگی استاز نزدیک از طریق تلفن نظارت می کندو به طور منطقی با همبستگی باتماس ها کوتاه و تا حدودی نگه داشته می شوندوتهزینه در هنگام تصمیم گیری در مورد پیامک یا تلفن عاملی استبشربنابراین ، به نظر می رسد که این مؤلفه اول مربوط به منعکس کننده ابعاد حساسیت هزینه است (یعنی نشان می دهد که یک تمایز اساسی بین مردم این است که چقدر نگران قیمت هستند).
    • بعد دوم تفسیر کمی دشوارتر است. بارهای نسبتاً بالایی برای شیفتگی با فناوری وجود دارد و از اندازه بیل شگفت زده می شود. اینکه چرا این دو متغیر با همبستگی همبستگی دارند ، توضیح آن دشوار است و شاید بیشتر از یک بینش عمیق از یک بینش عمیق باشد (نه اینکه این دو متغیر هر دو با مؤلفه دوم در ارتباط هستند ، این بدان معنی است که آنها نیز با یکدیگر ارتباط دارند).
    • مؤلفه سوم اساساً فقط منعکس کننده توافق با این ایده است که تعیین بهترین معامله دشوار است.
    • متغیروقت زیادی را صرف خرید یا بهترین معامله کردبا هیچ یک از مؤلفه ها ارتباط زیادی ندارد و بنابراین تا حد زیادی نادیده گرفته می شود.

    نتیجه گیری واقعی از این تحلیل این است که تجزیه و تحلیل مؤلفه های اصلی نتوانسته است چیزهای جالب را شناسایی کند. شاید با بررسی مؤلفه های بیشتر (به عنوان مثال ، چهار یا پنج) یک راه حل جالب تر پیدا شود ، اما بعید است که این امر آنقدر مفید باشد که مثلاً یک راه حل پنج مؤلفه به جای هفت متغیر اصلی در این امر زیاد نباشدروش ساده سازی داده ها.

    نرم افزار

    تقریباً تمام برنامه های تجزیه و تحلیل مؤلفه های اصلی در تجزیه و تحلیل پیمایشی از چرخش واریماکس استفاده می کنند.

    1. در برگه متغیرها و سوالات ، تمام متغیرهایی را که می خواهید از آنها استفاده کنید ، کلیک راست کرده و SET SELUCT را انتخاب کرده و نوع سؤال شماره را مشخص کنید-Multi.
    2. On the Tables’ tab select Create> Traditional Multivariate Analysis>تجزیه و تحلیل مؤلفه های اصلی ، سوال را انتخاب کرده و OK را فشار دهید.
    1. Analyze> Dimension Reduction>عامل .
    2. متغیرهایی را که می خواهید تجزیه و تحلیل کنید انتخاب کنید.
    3. Rotations> Varimax> Continue>خوب .

    RotatedComponentMatrix.PNG

    • معرفی
    • طرح پژوهش
    • تحقیق کیفی
    • جمع آوری داده ها
    • پرسشنامه های اساسی
    • پرسشنامه ها: نگرش ، اعتقاد ، شخصیت و قیمت گذاری
    • پرسشنامه ها: توسعه محصول جدید
    • تهیه داده ها
    • تجزیه و تحلیل داده های اساسی
    • تجزیه و تحلیل داده های پیشرفته
    • گزارش نویسی
    • آموزش Q
استراتژی برای تحلیل فاندمنتال...
ما را در سایت استراتژی برای تحلیل فاندمنتال دنبال می کنید

برچسب : نویسنده : سعید شیخ‌زاده بازدید : <-PostHit-> تاريخ : شنبه 7 مرداد 1402 ساعت: 16:03