Pivot (ترکیب)

ساخت وبلاگ

اپراتور محوری یک جدول محوری ایجاد می کند و با سازماندهی مجدد آن در گروه ها و محاسبه مبالغ ، میانگین ها یا سایر آمار برای هر گروه ، داده ها را در یک جدول بزرگتر خلاصه می کند.

شرح

رایج ترین نمونه جدول محوری گزارش خلاصه فروش است. تصور کنید که کالاها را در فروشگاه های متعدد می فروشید و می خواهید کل فروش در هر فروشگاه را در هر ماه از سال بدانید. شما یک جدول داده دارید که تمام معاملات موجود در همه فروشگاه ها را نشان می دهد. برای هر معامله ، یک ردیف در جدول شما فروشگاه و تاریخ خرید را با ستون های جداگانه برای ماه و روز به علاوه هزینه معامله لیست می کند. جدول Pivot یک جدول جدید است که از جدول اصلی شما به روش زیر ایجاد شده است:

  • یک ردیف منحصر به فرد برای هر فروشگاه ایجاد کنید.
  • برای هر ماه از سال یک ستون منحصر به فرد ایجاد کنید.
  • با افزودن هزینه معامله ، هر معامله را به ردیف و ستون مناسب اختصاص دهید.

اگرچه در این حالت سلولهای جدول محوری مبلغی را نشان می دهند (کل فروش آن دسته) ، می توانید انواع دیگری از آمار را ایجاد کنید. یک شمارش به شما می گوید که در هر ماه چه تعداد معاملات در هر فروشگاه رخ داده است. به طور متوسط هزینه متوسط معامله را به شما می گوید. برای لیست کامل آمار ، ویژگی های تجمیع پارامتر را مشاهده کنید.

به طور معمول ، یک جدول محوری توسط سه ویژگی از نمونه اصلی شما تعریف می شود:

  • گروه بر اساس ویژگی ها - معمولاً مقادیر طبقه بندی (اسمی) ، ردیف ها را تعریف می کنند
  • ویژگی گروه بندی ستون - معمولاً مقادیر طبقه بندی (اسمی) ، ستون ها را تعریف می کنند
  • ویژگی های تجمیع - معمولاً مقادیر عددی ، خلاصه یا به طور متوسط می شوند

با این حال ، بسته به انتخاب شما ، تعداد واقعی ویژگی ها ممکن است بیش از سه یا کمتر باشد. به عنوان مثال می توانید بیش از یک ویژگی را در مجموعه ویژگی های جمع آوری انتخاب کنید.

توجه کنید که در مثال اصلی ما ، گروه توسط ویژگی ها (فروشگاه) و ویژگی گروه بندی ستون (ماه) دارای مقادیر طبقه بندی شده ای هستند ، در حالی که ویژگی های تجمیع (هزینه) دارای مقادیر عددی هستند. اگر صفتی که برای ویژگی های جمع آوری انتخاب کرده اید دارای مقادیر طبقه بندی شده است ، دامنه آمار محدودتر است - به عنوان مثال ، تعداد هنوز در دسترس است ، اما متوسط نیست.

اگر صفتی که شما برای گروه با ویژگی ها انتخاب کرده اید یا ویژگی گروه بندی ستون دارای مقادیر عددی است ، ممکن است با قرار دادن مقادیر عددی در سطل ها ، ابتدا آنها را به مقادیر طبقه بندی تبدیل کنید.

تفکیک

تجمیع

درست مانند اپراتور Pivot ، اپراتور کل دارای گروه پارامترها با ویژگی ها و ویژگی های جمع آوری است ، اما از ویژگی گروه بندی ستون پشتیبانی نمی کند. شما می توانید از اپراتور محوری به عنوان تعمیم اپراتور کل ، با مفهوم پیشرفته تری از گروه ها فکر کنید.

در حال پیش رفتن

اپراتور Transpose ردیف ها و ستون های یک نمونه را مانند انتقال یک ماتریس مبادله می کند.

ورودی

این درگاه ورودی انتظار نمونه ای را دارد.

خروجی

این درگاه خروجی جدول محوری را ارائه می دهد.

نمونه هایی که به عنوان ورودی داده شده است بدون تغییر از طریق آن منتقل می شود.

این پورت مدل پیش پردازش را ارائه می دهد. این می تواند توسط اپراتور Apply Model برای انجام محوری مشخص شده در نمونه های دیگر استفاده شود. نتیجه مدل Apply سپس دقیقاً همان ویژگی هایی را دارد که در درگاه خروجی محوری قرار دارد. به عنوان مثال اگر از اپراتور Pivot در طول آموزش استفاده شود و همان تحول را باید روی داده های آزمون یا واقعی استفاده کرد ، مفید است. مدل پیش پردازش همچنین می تواند با سایر مدل های پیش پردازش و مدل های پیش بینی توسط اپراتور مدل های گروهی گروه بندی شود.

مولفه های

  • group_by_attributes

این پارامتر ردیف های موجود در جدول محوری را مشخص می کند. روی "انتخاب ویژگی ها" کلیک کنید و یک یا چند ویژگی را انتخاب کنید. اگر یک ویژگی واحد را انتخاب کنید ، ردیف ها با مقادیر منحصر به فرد آن ویژگی مطابقت دارند. اگر دو یا چند ویژگی را انتخاب کنید ، ردیف ها با ترکیب های منحصر به فرد از مقادیر ویژگی مطابقت دارند. تمام نقاط داده با همان مقادیر ویژگی ها در یک ردیف قرار دارند.

این پارامتر ستون های موجود در جدول محوری را مشخص می کند. یک ویژگی را از کشویی انتخاب کنید. ستون ها با مقادیر منحصر به فرد این ویژگی مطابقت دارند. تمام نقاط داده با همان مقدار ویژگی در همان ستون تعلق دارند.

در هر سلول از جدول محوری ، تعریف شده توسط یک ردیف و یک ستون ، یک یا چند آمار با استفاده از توابع تجمع محاسبه می شود. روی "ویرایش لیست" کلیک کنید و یک ویژگی و یک عملکرد را از کشویی انتخاب کنید. لیست کامل توابع تجمیع در زیر آورده شده است.

  • میانگین
  • هماهنگی
  • شمردن
  • تعداد (کسری)
  • شمارش (از جمله Missings)
  • شمارش (درصد)
  • اولین
  • کمترین
  • محصول ورود به سیستم
  • بیشترین
  • میانه
  • کمترین
  • حالت
  • تولید - محصول
  • انحراف معیار
  • جمع
  • جمع (کسری)
  • واریانس

در صورت بررسی ، این پارامتر به شما امکان می دهد یک تابع تجمع پیش فرض را برای ویژگی های باقیمانده تعریف کنید - تمام مواردی که توسط سه پارامتر اول استفاده نمی شوند. هر ویژگی باقیمانده که نوع داده آنها با عملکرد تجمع پیش فرض سازگار نیست ، نادیده گرفته می شود. به عنوان مثال ، توجه کنید که میانگین برای ویژگی های طبقه بندی (اسمی) در دسترس نیست.

این پارامتر فقط زمانی در دسترس است که تجمع پیش فرض استفاده از پارامتر روی True تنظیم شده است. این عملکرد پیش فرض تجمیع را برای ویژگی های باقیمانده مشخص می کند - تمام مواردی که توسط سه پارامتر اول استفاده نمی شوند. ویژگی های مورد نظر باید با عملکرد پیش فرض تجمع سازگار باشد. به عنوان مثال ، اگر یک مثال دارای دو ویژگی اسمی باشد و بقیه آنها عددی باشند ، می توانید همه آنها را با استفاده از دو ویژگی اسمی در ویژگی های جمع آوری ، با شمارش به عنوان عملکرد تجمع ، جمع کنید ، سپس انتخاب را به عنوان عملکرد پیش فرض انتخاب کنید.، برای مراقبت از بقیه.

فرآیندهای آموزش

بقا در تایتانیک بر اساس کلاس و جنس

این فرایند آموزش داده های تایتانیک را بازیابی می کند و از اپراتور Pivot برای نمایش احتمال بقا برای گروههای طبقه بندی شده با توجه به "کلاس مسافر" و "جنس" استفاده می کند. از آنجا که "زنده مانده" یک متغیر طبقه بندی شده است ("بله"/"نه") ، ما ابتدا آن را از طریق اپراتور عددی به یک مقدار عددی تبدیل می کنیم. این اپراتور "زنده مانده" را به دو ویژگی عددی جدید تبدیل می کند: "زنده مانده = نه" و "زنده مانده = بله" ، با 0 و 1 به عنوان مقادیر.

برای پارامترهای اپراتور Pivot ، ما انتخاب می کنیم: گروه بر اساس ویژگی ها - "کلاس مسافر" (3 مقدار) ویژگی گروه بندی ستون - "جنس" (2 مقدار) ویژگی های تجمع - "زنده مانده = بله" ، با میانگین عملکرد تجمع.

این روند شامل یک نقطه شکست است ، بنابراین شما باید دو بار دکمه "Run" را فشار دهید:

1) برای دیدن نمونه ها با ویژگی های جدید ، روی "Run" کلیک کنید.

2) برای دیدن احتمال بقا در هر یک از شش دسته ، دوباره روی "Run" کلیک کنید.

اندازه خانواده در تایتانیک

این فرایند آموزش داده های تایتانیک را بازیابی می کند و از اپراتور محوری برای نمایش اندازه خانواده گروههای طبقه بندی شده با "جنس" ، "کلاس مسافر" و ارزش "زنده مانده" استفاده می کند. این جدول محوری از بیش از سه ویژگی استفاده می کند.

"اندازه خانواده" ویژگی مجموعه داده های تایتانیک نیست ، اما می توانید با اضافه کردن دو ویژگی که از قبل وجود دارد ، این ویژگی را با کمک اپراتور ویژگی های تولید ایجاد کنید: [اندازه خانواده] = [هیچ یک از والدین یا فرزندان در هیئت مدیره] + [هیچ خواهر و برادر یا همسر در هیئت مدیره] + 1

برای پارامترهای اپراتور Pivot ، ما انتخاب می کنیم: گروه بر اساس ویژگی ها - "جنس" و "کلاس مسافر" (2 x 3 = 6 مقادیر) ویژگی گروه بندی ستون - "زنده مانده" (2 مقدار) ویژگی های جمع آوری - "اندازه خانواده" ، "اندازه خانواده" ،با میانگین به عنوان عملکرد جمع."اندازه خانواده" ، با شمارش به عنوان عملکرد جمع.

این روند شامل یک نقطه شکست است ، بنابراین شما باید دو بار دکمه "Run" را فشار دهید:

1) برای دیدن نمونه ها با ویژگی جدید "اندازه خانواده" کلیک کنید.

2) برای دیدن جدول Pivot ، "Run" را کلیک کنید ، جایی که دو ستون عددی اول اندازه خانواده را برای گروه هایی از افرادی که زنده مانده یا زنده مانده اند نشان می دهد ، در حالی که دو ستون آخر تعداد افراد (تعداد) را در هر گروه نشان می دهد.

تعداد زنان در کلاس اول و دوم که زنده مانده اند معنی دار نیست (به مقادیر شمارش مراجعه کنید) ، اما بررسی ردیف برای زنان طبقه سوم ، می بینیم که متوسط اندازه خانواده برای زنانی که زنده مانده اند به طور قابل توجهی بزرگتر از آن استبرای زنانی که زنده مانده اند (3 در مقابل 2).

دوره ی فارکس...
ما را در سایت دوره ی فارکس دنبال می کنید

برچسب : نویسنده : پرویز حبّی بازدید : <-PostHit-> تاريخ : شنبه 3 تير 1402 ساعت: 11:37