
۴۴٬۰۰۰تومان
نوع فایل دانلود: EPUB
پس از خرید، یک فایل EPUB دریافت میکنید.
این فایل با Calibre، Apple Books و سایر کتابخوانهای دیجیتال مناسب است.
سیستمهای امروزی شامل CPU و GPUهای چندکاره هستند که ظرفیت بالایی برای رایانش موازی دارند. اما بسیاری از ابزارهای علمیِ پایتون طوری طراحی نشدهاند که بتوانند از این توانِ موازیسازی بهخوبی استفاده کنند. در این منبع کوتاه اما دقیق، دانشمندان داده و برنامهنویسان پایتون یاد میگیرند کتابخانه متنباز Dask برای رایانش موازی چگونه با ارائه APIهای ساده، موازیسازی کتابخانههای PyData مثل NumPy، Pandas و Scikit-learn را آسان میکند.
ما این کتاب را برای دانشمندان داده و مهندسان داده نوشتهایم که با پایتون و pandas آشنا هستند و میخواهند با مسئلههایی در مقیاس بزرگتر از آنچه ابزارهای فعلیشان اجازه میدهد، کنار بیایند. کاربران فعلی PySpark ممکن است بخشی از مطالب را با دانستههای خود همپوشان ببینند، اما امیدواریم همچنان برایشان مفید باشد؛ نه فقط بهخاطر اینکه از ماشین مجازی جاوا (JVM) دور شوند.
هولدن کارائو و میکا کیمینز به شما نشان میدهند چطور محاسبات Dask را در سیستمهای محلی به کار ببرید و بعد آن را برای کارهای سنگینتر تا سطح ابر گسترش دهید. این کتاب عملی توضیح میدهد چرا Dask در میان متخصصان صنعت و دانشگاه محبوب است و توسط سازمانهایی از جمله Walmart، Capital One، Harvard Medical School و NASA استفاده میشود.
این کتاب بیشتر روی علم داده و کارهای مرتبط تمرکز دارد؛ چون به نظر ما، Dask در همین حوزه بیشترین توان را دارد. اگر مسئلهای عمومیتر دارید که به نظر نمیرسد Dask انتخاب مناسبی برای آن باشد، (باز هم با کمی سوگیری) توصیه میکنیم کتاب Scaling Python with Ray (O’Reilly) را هم بررسی کنید؛ چون تمرکز کمتری روی علم داده دارد.
Dask یک چارچوب برای رایانش موازی با پایتون است که از استفاده از چند هسته روی یک ماشین شروع میشود و تا مراکز داده با هزاران ماشین گسترش پیدا میکند. هم APIهای سطح پایینِ کارمحور دارد و هم APIهای سطح بالاتر که بیشتر روی داده تمرکز میکنند. APIهای سطح پایین، موتورِ اصلی قدرتدادن به یکپارچگی Dask با طیف گستردهای از کتابخانههای پایتون هستند. وجود APIهای عمومی باعث شده یک اکوسیستم از ابزارها پیرامون Dask برای کاربردهای مختلف شکل بگیرد.
پروژه Blaze که با حمایت DARPA و بهصورت متنباز آغاز شد، توسط Continuum Analytics که اکنون Anaconda Inc نام دارد شروع شد و در ادامه به Dask تکامل پیدا کرد. Continuum در توسعه بسیاری از کتابخانههای ضروری و حتی کنفرانسهای حوزه تحلیل دادههای پایتون نقش داشته است. Dask همچنان یک پروژه متنباز است و بخش زیادی از توسعه آن اکنون توسط Coiled پشتیبانی میشود.
Dask در میان اکوسیستم رایانش توزیعشده یکتا است، چون کتابخانههای محبوب علم داده، رایانش موازی و رایانش علمی را با هم یکپارچه میکند. یکپارچهسازی Dask از کتابخانههای مختلف باعث میشود توسعهدهندگان بتوانند بخش زیادی از دانش و تجربه فعلی خود را در مقیاس بزرگتر دوباره به کار بگیرند. همچنین معمولاً میتوانند بخشهایی از کد خود را با کمترین تغییر، بارها استفاده کنند.
Dask مقیاسدهی به تحلیلها، یادگیری ماشین (ML) و دیگر کدی را که با پایتون نوشته شده ساده میکند و به شما امکان میدهد با دادهها و مسئلههای بزرگتر و پیچیدهتر کار کنید. Dask تلاش میکند شکافی را پر کند که در آن ابزارهای موجودتان، مثل DataFrameهای pandas یا پایپلاینهای یادگیری ماشین scikit-learn، کمکم آنقدر کند میشوند (یا اصلاً به نتیجه نمیرسند).
در این کتاب یاد خواهید گرفت:
Dask چیست، کجا میتوانید از آن استفاده کنید، و با ابزارهای دیگر چه تفاوتی دارد
چطور از Dask برای پردازش موازیِ دادههای دستهای (batch) استفاده کنید
مفاهیم کلیدی سیستمهای توزیعشده برای کار با Dask
روشهای استفاده از Dask با APIهای سطح بالاتر و ابزارهای سازنده
چطور با کتابخانههای یکپارچهشدهای مثل scikit-learn، pandas و PyTorch کار کنید
چطور از Dask با GPUها استفاده کنید
Modern systems contain multi-core CPUs and GPUs that have the potential for parallel computing. But many scientific Python tools were not designed to leverage this parallelism. With this short but thorough resource, data scientists and Python programmers will learn how the Dask open source library for parallel computing provides APIs that make it easy to parallelize PyData libraries including NumPy, Pandas, and Scikit-learn.We wrote this book for data scientists and data engineers familiar with Python and pandas who are looking to handle larger-scale problems than their current tooling allows. Current PySpark users will find that some of this material overlaps with their existing knowledge of PySpark, but we hope they still find it helpful, and not just for getting away from the Java Virtual Machine (JVM).Authors Holden Karau and Mika Kimmins show you how to use Dask computations in local systems and then scale to the cloud for heavier workloads. This practical book explains why Dask is popular among industry experts and academics and is used by organizations that include Walmart, Capital One, Harvard Medical School, and NASA.This book is primarily focused on data science and related tasks because, in our opinion, that is where Dask excels the most. If you have a more general problem that Dask does not seem to be quite the right fit for, we would (with a bit of bias again) encourage you to check out Scaling Python with Ray (O’Reilly), which has less of a Data Science focus.Dask is a framework for parallelized computing with Python that scales from multiple cores on one machine to data centers with thousands of machines. It has both low-level task APIs and higher-level data-focused APIs. The low-level task APIs power Dask’s integration with a wide variety of Python libraries. Having public APIs has allowed an ecosystem of tools to grow around Dask for various use cases. Continuum Analytics, now known as Anaconda Inc, started the open source, DARPA-funded Blaze project, which has evolved into Dask. Continuum has participated in developing many essential libraries and even conferences in the Python data analytics space. Dask remains an open source project, with much of its development now being supported by Coiled. Dask is unique in the distributed computing ecosystem, because it integrates popular data science, parallel, and scientific computing libraries. Dask’s integration of different libraries allows developers to reuse much of their existing knowledge at scale. They can also frequently reuse some of their code with minimal changes.Dask simplifies scaling analytics, ML, and other code written in Python, allowing you to handle larger and more complex data and problems. Dask aims to fill the space where your existing tools, like pandas DataFrames, or your scikit-learn machine learning pipelines start to become too slow (or do not succeed).With this book, you'll learn:What Dask is, where you can use it, and how it compares with other toolsHow to use Dask for batch data parallel processingKey distributed system concepts for working with DaskMethods for using Dask with higher-level APIs and building blocksHow to work with integrated libraries such as scikit-learn, pandas, and PyTorchHow to use Dask with GPUs