
۴۴٬۰۰۰تومان
نوع فایل دانلود: EPUB
پس از خرید، یک فایل EPUB دریافت میکنید.
این فایل با Calibre، Apple Books و سایر کتابخوانهای دیجیتال مناسب است.
به عنوان یک متخصص آینده علم داده، درک میکنید که چرا سازمانها برای تصمیمگیریهای مهم به دادهها اتکا میکنند؛ چه شرکتی باشد که وبسایت طراحی میکند، چه شهری که تصمیم میگیرد چگونه خدماتش را بهبود بخشد، و چه دانشمندانی که راه توقف شیوع یک بیماری را کشف میکنند. شما هم مهارتهای لازم را میخواهید تا از دل یک کوه دادهی بههمریخته، بینشهای کاربردی بیرون بکشید. ما به این فرآیند چرخه حیات علم داده میگوییم: فرآیند جمعآوری، پاکسازی، تحلیل و نتیجهگیری از دادهها. کتاب «آموزش علم داده» اولین کتابی است که مهارتهای پایهای در برنامهنویسی و آمار را پوشش میدهد که کل این چرخه را در بر میگیرد. این کتاب برای کسانی نوشته شده است که میخواهند دانشمند داده شوند یا در حال حاضر با دانشمندان داده کار میکنند، و همچنین تحلیلگرانی که میخواهند مرز میان «فنی و غیرفنی» را پشت سر بگذارند. اگر دانش پایهای از برنامهنویسی پایتون داشته باشید، یاد میگیرید که چگونه با استفاده از ابزارهای استاندارد صنعت مانند پانداس با دادهها کار کنید. این کتاب اصول و مهارتهای اساسی مورد نیاز دانشمندان داده را پوشش میدهد تا به تصمیمگیریهای مهم در زمینههای مختلف کمک کنند. با برخورداری از مهارتهای فنی و درک مفهومی، میتوانیم روی مسائل دادهمحور کار کنیم؛ مثلاً بررسی کنیم که آیا یک واکسن کارساز است یا خیر، اخبار جعلی را بهطور خودکار فیلتر کنیم، حسگرهای کیفیت هوا را کالیبره کنیم، و به تحلیلگران در زمینه تغییرات سیاستی مشاوره دهیم. برای کمک به شما در درک تصویر بزرگتر، مباحث را پیرامون چرخهای سازماندهی کردهایم که آن را چرخه حیات علم داده مینامیم. در این فصل، این چرخه را معرفی میکنیم. برخلاف سایر کتابهای علم داده که معمولاً روی یک بخش از چرخه تمرکز میکنند یا فقط به مباحث محاسباتی یا آماری میپردازند، ما کل چرخه را از ابتدا تا انتها پوشش میدهیم و جنبههای آماری و محاسباتی را در کنار هم در نظر میگیریم. دانشمندان داده با دادههای ذخیرهشده در جدولها کار میکنند. فصل سوم، دیتافریمها را معرفی میکند که یکی از رایجترین راهها برای نمایش جدولهای داده هستند. همچنین کتابخانه پانداس را که پکیج استاندارد پایتون برای کار با دیتافریمهاست، معرفی خواهیم کرد. انواع داده در مفهوم برنامهنویسی به این اشاره دارد که کامپیوتر چگونه دادهها را بهطور داخلی ذخیره میکند. برای مثال، ستون اندازه دارای نوع دادهی رشتهای در پایتون است. اما از دیدگاه آماری، ستون اندازه، دادههای ردهای مرتبشده (دادههای ترتیبی) را ذخیره میکند. در فصل بعد بیشتر درباره این تفاوت خاص صحبت میکنیم. در این فصل، به شما نشان میدهیم که چگونه با استفاده از پانداس، عملیات رایج روی دیتافریمها را انجام دهید. دانشمندان داده هنگام کار با دیتافریمها در پایتون از کتابخانه پانداس استفاده میکنند. ابتدا اشیاء اصلی ارائهشده توسط پانداس یعنی کلاسهای دیتافریم و سری را توضیح میدهیم. سپس به شما نشان میدهیم که چگونه از پانداس برای انجام کارهای رایج دستکاری دادهها، مانند برش، فیلتر کردن، مرتبسازی، گروهبندی و پیوند دادن استفاده کنید. اصلاح یک پرسش مورد علاقه به پرسشی که بتوان آن را با دادهها بررسی کرد. پیگیری جمعآوری دادهها که ممکن است شامل پردازش متن، وب اسکرپینگ و غیره باشد. استخراج بینشهای ارزشمند درباره دادهها از طریق پاکسازی، اکتشاف و مصورسازی دادهها. یادگیری نحوه استفاده از مدلسازی برای توصیف دادهها. تعمیم یافتهها فراتر از دادههای موجود.
As an aspiring data scientist, you appreciate why organizations rely on data for important decisions--whether it's for companies designing websites, cities deciding how to improve services, or scientists discovering how to stop the spread of disease. And you want the skills required to distill a messy pile of data into actionable insights. We call this the Data Science lifecycle: the process of collecting, wrangling, analyzing, and drawing conclusions from data.Learning Data Science is the first book to cover foundational skills in both programming and statistics that encompass this entire lifecycle. It's aimed at those who wish to become data scientists or who already work with data scientists, and at data analysts who wish to cross the "technical/nontechnical" divide. If you have a basic knowledge of Python programming, you'll learn how to work with data using industry-standard tools like Pandas.This book covers fundamental principles and skills that data scientists need to help make all sorts of important decisions. With both technical skills and conceptual understanding we can work on data-centric problems to, say, assess whether a vaccine works, filter out fake news automatically, calibrate air quality sensors, and advise analysts on policy changes. To help you keep track of the bigger picture, we’ve organized topics around a workflow that we call the data science lifecycle. In this chapter, we introduce this lifecycle. Unlike other data science books that tend to focus on one part of the lifecycle or address only computational or statistical topics, we cover the entire cycle from start to finish and consider both statistical and computational aspects together.Data scientists work with data stored in tables. The Chapter 3 introduces dataframes, one of the most widely used ways to represent data tables. We’ll also introduce Pandas, the standard Python package for working with dataframes. Data types in a programming sense refers to how a computer stores data internally. For instance, the size column has a string data type in Python. But from a statistical point of view, the size column stores ordered categorical data (ordinal data). We talk more about this specific distinction in the next chapter. In this chapter, we’ll show you how to do common dataframe operations using pandas. Data scientists use the Pandas library when working with dataframes in Python. First, we’ll explain the main objects that pandas provides: the DataFrame and Series classes. Then, we’ll show you how to use pandas to perform common data manipulation tasks, like slicing, filtering, sorting, grouping, and joining.Refine a question of interest to one that can be studied with dataPursue data collection that may involve text processing, web scraping, etc.Glean valuable insights about data through data cleaning, exploration, and visualizationLearn how to use modeling to describe the dataGeneralize findings beyond the data