اجازه دادن به داده ها برای خودش صحبت می کند

ساخت وبلاگ

یا: ابرداده تجسم چیست و چرا ما به آن احتیاج داریم؟

همه می دانند که تجسم یک نمایش بصری از داده ها است. خوب ، این نظریه حداقل است.

در عمل ، روند ایجاد تجسم کمی متفاوت است. بیایید بگوییم که شما یک روزنامه نگار در یک اتاق خبر هستید ، و شما در حال نوشتن یک داستان هستید. ویراستار به شما گفت که شما باید برخی از داده ها را به مقاله خود اضافه کنید تا به نظر حرفه ای تر باشد - اما همه می دانند که شما نمی توانید فقط تمام شماره ها را درون متن خود پرتاب کنید ، زیرا خوانندگان را از بین می برد. آنچه شما نیاز دارید یک تجسم زیبا و آسان و رنگارنگ است.

اما چگونه به آنجا می رسید؟

بیشتر افرادی که در حال ایجاد تجسم هستند ، در تلاشند تا یک نکته را بیان کنند - یا از یک ادعای خاص حمایت کنند. با این حال ، داده های خود داستانی را نمی گویند. و برای اینکه داده ها صحبت کنید ، اغلب نیاز به انتخاب داده هایی که می خواهید نشان دهید.

  • ممکن است یک محدوده زمانی خاص را انتخاب کنید که در آن پدیده ای که توصیف می کنید قابل توجه است
  • ممکن است تصمیم بگیرید که به جای تمام نقاط داده ، نمونه ای از داده ها را نشان دهید
  • شما می توانید شاخص های خاصی را انتخاب کنید که بیشتر ادعای شما را پشتیبانی می کند
  • اگر داده های اصلی بیش از حد دقیق باشند ، ممکن است نیاز به انجام برخی از پردازش ها بر روی داده ها داشته باشید - به عنوان مثال ، برخی از نقاط داده مشابه را به طور متوسط انجام دهید.

به عنوان گذشته-هیچ چیز غیر اخلاقی در مورد این روند وجود ندارد. این یک مورد ساده برای ویرایش است - انتخاب آنچه به خوانندگان می گوید و چه چیزی را از بین می برد. این مسئله فقط در صورتی ایجاد می شود که شما عمداً تصمیم بگیرید که داده های متناقض با ادعای خود را با تنها هدف گمراه کردن خوانندگان خود کنار بگذارید.

اکنون که داده های خود را مرتب کرده اید ، باید در مورد نحوه تجسم داده ها فکر کنید. انواع مختلفی از تجسم وجود دارد که هر یک داستان کمی متفاوت را بیان می کنند. نمودار پای از بسیاری جهات متفاوت از یک نمودار خط است ، و همه تجسم به ادعاهای شما به همان روش خدمت نمی کند.

این معمولاً زمان آن است که طراح گرافیک قابل اعتماد شما به آن بپیوندد. آنها با تجسم مسخره شما برگه اکسل شما را می گیرند و آن را به یک نمودار بصری جذاب تبدیل می کنند. خروجی نهایی نمودار مشخص شده ، حاشیه نویسی ، با زمینه مربوطه-همه بسته بندی شده در یک تصویر با وضوح بالا ، آماده چاپ ، پخش یا تعبیه شده در یک وب سایت است.

بنابراین خروجی بصری خیره کننده است. با این حال ، در این فرآیند ما داده های اصلی و تغییراتی را که برای ایجاد تجسم انجام شده است ، از دست داده ایم.

و این یک مشکل است.

به چه چیزی نیاز داریم؟

من پیشنهاد می کنم که ما باید یک روش استاندارد برای اتصال به یک تصویر تجسم داشته باشیم:

  • داده های اصلی (یا از کجا آمده است)
  • مراحل پردازش
  • داده های حاصل
  • نکات تجسم
  • حاشیه نویسی ، زمینه و غیره

سپس ما برای استفاده از این اطلاعات و ارائه تجسم از ابتدا-در کنار تصویر از پیش ارائه شده که ناشر تهیه کرده است ، باید نرم افزار تخصصی (یعنی یک مرورگر وب) بسازیم.

بعد به شما می گویم که چرا این ارزش زحمت را دارد. پس از آن - چگونه می توان آن را انجام داد.

پس چرا همه دردسرها؟

جلوگیری از تعصب و حفظ اعتبار

همه ما می دانیم که تجسم یک هدف آسان برای دستکاری و فریب است - با انتخاب دقیق دامنه های زمان و خواص نمودار شما می توانید نمودار خود را مهندسی کنید تا تصور متضاد از آنچه ممکن است یک بازرسی بی طرفانه از داده ها ارائه دهد ، ارائه دهد.

با این حال ، حتی صادق ترین گزارشگر می تواند در این تله های اطلاعاتی قرار بگیرد-یا به دلیل تعصبات داخلی خود و یا با اشتباه ساده.

یک روش خوب برای حفظ اعتبار در چنین مواردی ارائه داده های خام در طول تجسم است. با این حال ، "داده های خام" معمولاً به معنای دو چیز در اینجا است - هم داده های اصلی و هم مورد پردازش. بدون سابق ، خواننده هیچ راهی برای اعتبارسنجی منبع داده یا پردازش مورد نیاز آن ندارد. بدون دومی ، ما خواننده را با وظیفه تمیز کردن ، پردازش و استخراج دقیقاً همان مجموعه داده هایی که در تجسم استفاده شده است ، رها می کنیم.

راه حل در اینجا تهیه هر دو - و همچنین توضیح کامل روند و روش مورد استفاده در دریافت داده های خام به داده های نهایی که در تجسم استفاده می شود.

دسترسی

تجسم گرافیکی از داده ها برای بیشتر ما بسیار خوب کار می کند - اما نه همه.

اگر نتوانند به درستی آن را ببینند ، خوانندگان با اختلال بینایی درک سختی را در درک تجسم خواهند دید. برخی از شیوه های خوب برای دور زدن این مشکل وجود دارد - به عنوان مثال ، طراحان آگاه تر می دانند که طرح های رنگی را انتخاب کنند که با جمعیت نسبتاً زیاد و دارای انواع نابینایی رنگ دوستانه تر باشد. بدیهی است ، کار مشابهی در مورد انواع از دست دادن بینایی غیرممکن است.

با داشتن داده های منبع برای هر تجسم وصل شده به آن ، می توانیم موتورهای مختلف رندر را به ارائه داده های مشابه اجازه دهیم. در بعضی موارد ممکن است امکان انتخاب یک طرح رنگی متفاوت را فراهم کند. در برخی دیگر ، داده ها می توانند به روشی کاملاً متفاوت ارائه شوند (به عنوان مثال. چند پروژه که داده ها را با Sounding Sonification نشان می دهند).

اما می توانیم ببینیم که داده ها به خودی خود کافی نیستند - ما همچنین به اطلاعاتی در مورد معنای داده ها نیاز داریم. در بسیاری از موارد، دانستن معنای هر ستون و بهترین راه برای ارائه اطلاعات آن بدون نوعی دستورالعمل غیرممکن است.

چنین دستورالعمل هایی ممکن است شامل نوع داده ها (عددی/متن)، واحدها (کیلوگرم/دلار آمریکا) یا محور ترجیحی (زمانی/لگاریتمی) و غیره باشد.

اکتشاف

اجازه دادن به خوانندگان برای کشف داده ها فراتر از محدودیت های خود تصویرسازی بسیار مهم است.

نه تنها به کاربر این امکان را می دهد که داده های مشابهی را در دیدگاه های مختلف ببیند (مثلاً گروه بندی بر اساس بعد / متغیر دیگری) یا با استفاده از تجسم های متفاوت، بلکه به خواننده اجازه می دهد تا بخش متفاوتی از مجموعه داده های اصلی را انتخاب کند تا خود را با ادعای شما متقاعد کند. یا ثابت کنید که اشتباه است.

برای من منطقی است که با گذشت زمان، خوانندگان کمتر و کمتر متداول می شوند که ادعایی را بدون هیچ بررسی دقیقی بپذیرند. ارائه توانایی بازرسی داده های خام به طور مستقل و رسیدن به نتیجه یکسان، تنها قدرت تحقیق خوب را تقویت می کند (و در نهایت به مبارزه با ارائه گمراه کننده داده ها کمک می کند).

منشأ

همانطور که دیدیم، دانستن منبع دقیق منبع دریافت داده ها در ایجاد اعتبار و همچنین امکان بازتولید همان تجزیه و تحلیل داده ها بسیار مهم است. معمولاً پیوند به یک پورتال داده یا وب سایتی که داده ها را در اختیار دارد کافی است.

اما اگر منبع داده مدام در حال تغییر باشد چه؟اگر شخصی تصمیم به حذف وب سایت (به دلیل سوء نیت یا بی کفایتی - یا ترکیبی از هر دو) بگیرد، چه؟و بدتر از همه اینها - اگر ناشر داده ها تصمیم به جعل عطف به ماسبق در داده های منتشر شده داشته باشد، چه؟

اینها سناریوهای غیرقابل تصوری نیستند و برای دور زدن آنها باید نوعی مدرک برای صحت داده ها ارائه کنیم. یکی از راه های انجام این کار، امضای دیجیتالی داده ها در زمان جمع آوری است - توسط یک شخص ثالث قابل اعتماد. به همان روشی که امروزه وب سایت ها هویت خود را با استفاده از یک گواهی، که به صورت دیجیتالی توسط «مرجع صدور گواهینامه» امضا شده است، اثبات می کنند، داده ها ممکن است با گواهی مشابه امضا شوند - که ثابت می کند دقیقاً همان داده ها در همان تاریخ وجود داشته اند.

چگونه می توانید آن را انجام داد؟

بیایید سعی کنیم آنچه را که برای انجام این کار به آن نیاز داریم فهرست کنیم - معلوم شد که بیشتر آن از قبل وجود دارد و به سادگی باید در یک مشخصات چتر واحد جمع شود.

داده های قابل حمل

  • کارهای بسیار خوبی در FrictionlessData. io در مورد مفهوم "بسته های داده" انجام شده است - ارائه مشخصات داده های بسته بندی در قالب ، مستندات و طرحواره قابل حمل.
  • ما می توانیم برای امضای دیجیتالی داده ها از چارچوب خوزه در حال ظهور (امضای و رمزگذاری شی JavaScript) استفاده کنیم. این چارچوب برای وب ساخته شده است و در بیش از یک RFCS شرح داده شده است.

چه داده هایی باید نشان داده شود؟

چگونه می توانیم مشخص کنیم کدام ستون یا محدوده ارزش برای نشان دادن - یا کدام فیلترها اعمال می شود؟چارچوب Vega حاوی برخی از دستور زبان ها برای انجام این کار دقیقاً (و خیلی بیشتر) است. مثلا:

چگونه باید ارائه شود؟

هنگام توصیف پارامترهای ارائه ، ما به انتخاب نوع نمودار (نوار یا پای؟) ، انواع محور (تاریخ یا لگاریتمی؟) ، عناوین نمودار ، افسانه و حاشیه نویسی اشاره می کنیم.

نوعی از Vega فوق الذکر اجازه می دهد تا نمودارها را به زبان سطح بالا تعریف کنند:

کار کردن با وب

برای اینکه کاری در وب کار کند ، ابتدا به یک استاندارد توافق شده نیاز داریم که مجریان مختلف را راهنمایی کند و سازگاری بین پیاده سازی های مختلف را تضمین می کند.

But we don’t need to reinvent the wheel — we already have an HTML tag for showing plain images: .

HTML5 برچسب را معرفی کرد و باعث می شود چندین منبع جایگزین برای یک تصویر واحد:

برچسب در مثال بالا سعی خواهد کرد تصویر را به تصویر vis. svg نشان دهد ، و در صورت عدم موفقیت (به دلیل ناسازگاری دستگاه یا خطای دیگر) ، به Vis.png باز می گردد.

به همین ترتیب ممکن است ما یک برنامه افزودنی این برچسب را تصور کنیم:

که در آن مرورگر ابتدا تصویر را نشان می دهد ، اما یک رابط کاربری برای مشاهده داده ها از طریق تجسم تعاملی شرح داده شده در پرونده توضیحات Vega-Lite ارائه می دهد. مرورگرهای مختلف ممکن است موتورهای مختلف ارائه دهنده ای را برای چنین تجسم فراهم کنند - از پشتیبانی از کمک های برای افراد با اختلال بینایی همه از طریق یک موتور قدرتمند اکتشاف داده.

داده ها کجاست؟

در مثال بالا ، داده ها در داخل مشخصات تجسم تعبیه شده اند. با این حال ، یک راه حل ظریف تر در ذهن من این است که هر دو نگرانی را از هم جدا کنیم.

HTML5 دارای برچسب است که به شما امکان می دهد داده ها را به یک عنصر وصل کنید:

بیایید سعی کنیم نمونه تجسم فوق را دوباره با عنصر داده مجدداً تصور کنیم.

در اینجا تجسم در واقع در یک عنصر محدود به داده است ، بنابراین از لحاظ تئوریکی نیازی به ارائه داده ها به عنوان بخشی از مشخصات تجسم نیست.

ما حتی می توانیم یک قدم جلوتر برویم - هیچ دلیلی وجود ندارد که ناشر داده ها چند نمونه از داده ها را ارائه ندهد:

و حتی ممکن است یک تجسم بدون تصویر همراه ارائه دهیم ، زیرا داده ها می توانند به روش های دیگری نیز ارائه شوند:

یا حتی مانند این - به عنوان روشی شسته و رفته برای حمایت از ادعای در یک مقاله کلاسیک ، متنی ، با داده های منبع و تجسم:

خلاصه

ما عادت کرده ایم که بتوانیم ادعاهای مطرح شده در اینترنت را با پیگیری پیوند به یک منبع قابل احترام تأیید کنیم. همانطور که گفته می شود: "پیوند یا اتفاق نیفتاد!"اما زمان در حال تغییر است و حتی منابع قابل احترام آن چیزی نیستند که قبلاً بودند.

استراتژی برای تحلیل فاندمنتال...
ما را در سایت استراتژی برای تحلیل فاندمنتال دنبال می کنید

برچسب : نویسنده : سعید شیخ‌زاده بازدید : <-PostHit-> تاريخ : دوشنبه 8 خرداد 1402 ساعت: 19:01