
۴۴٬۰۰۰تومان
نوع فایل دانلود: EPUB
پس از خرید، یک فایل EPUB دریافت میکنید.
این فایل با Calibre، Apple Books و سایر کتابخوانهای دیجیتال مناسب است.
جلد -- حق نشر -- تقدیر و تشکر -- دربارهٔ نویسندگان -- دربارهٔ بازبینان -- www.PacktPub.com -- فهرست مطالب -- پیشگفتار -- فصل ۱: نخستین گامها بهسوی مقیاسپذیری -- توضیح دقیق مقیاسپذیری -- نمونههایی در مقیاس بزرگ -- آشنایی با پایتون -- افزایش مقیاس با پایتون -- گسترش مقیاس با پایتون -- پایتون برای یادگیری ماشین در مقیاس بزرگ -- انتخاب بین پایتون ۲ و پایتون ۳ -- نصب پایتون -- نصب گامبهگام -- نصب بستهها -- بهروزرسانی بستهها -- توزیعهای علمی -- آشنایی با Jupyter/IPython -- بستههای پایتون -- NumPy -- SciPy -- Pandas -- Scikit-learn -- بستهٔ matplotlib -- Gensim -- H2O -- XGBoost -- Theano -- TensorFlow -- کتابخانهٔ sknn -- Theanets -- Keras -- بستههای مفید دیگر برای نصب روی سیستم -- خلاصه -- فصل ۲: یادگیری مقیاسپذیر در Scikit-learn -- یادگیری خارج از حافظهٔ اصلی -- نمونهبرداری جزئی بهعنوان گزینهای عملی -- بهینهسازی یک نمونه در هر بار -- ساخت یک سامانهٔ یادگیری خارج از حافظهٔ اصلی -- دریافت جریانی داده از منابع -- مجموعهدادههایی برای امتحان واقعی خودتان -- نخستین مثال - دریافت جریانی مجموعهٔ دادهٔ اشتراک دوچرخه -- استفاده از ابزارهای ورودی/خروجی pandas -- کار با پایگاههای داده -- توجه به ترتیب نمونهها -- یادگیری تصادفی -- نزول گرادیان دستهای -- نزول گرادیان تصادفی -- پیادهسازی SGD در Scikit-learn -- تعریف پارامترهای یادگیری SGD -- مدیریت ویژگیها با جریانهای داده -- توصیف هدف -- ترفند هشینگ -- تبدیلهای پایهٔ دیگر -- آزمون و اعتبارسنجی در جریان داده -- امتحان SGD در عمل -- خلاصه -- فصل ۳: پیادهسازیهای سریع SVM -- مجموعهدادههایی برای آزمایش خودتان -- مجموعهٔ دادهٔ اشتراک دوچرخه -- مجموعهٔ دادهٔ covertype -- ماشینهای بردار پشتیبان -- زیان لولا و گونههای آن -- درک پیادهسازی SVM در Scikit-learn -- دنبال کردن SVMهای غیرخطی با نمونهبرداری جزئی دستیابی به SVM در مقیاس بزرگ با SGD -- انتخاب ویژگی با منظمسازی -- افزودن غیرخطی بودن به SGD -- امتحان نگاشتهای صریح با ابعاد بالا -- تنظیم ابرپارامترها -- گزینههای دیگر برای یادگیری سریع SVM -- غیرخطی و سریعتر با Vowpal Wabbit -- نصب VW -- درک قالب دادهٔ VW -- یکپارچهسازی با پایتون -- چند مثال با استفاده از کاهشها برای SVM و شبکههای عصبی -- اشتراک دوچرخهٔ سریعتر -- مجموعهٔ دادهٔ covertype پردازششده با VW -- خلاصه -- فصل ۴: شبکههای عصبی و یادگیری عمیق -- معماری شبکهٔ عصبی -- شبکههای عصبی چه و چگونه یاد میگیرند -- انتخاب معماری مناسب -- لایهٔ ورودی -- لایهٔ پنهان -- لایهٔ خروجی -- شبکههای عصبی در عمل -- موازیسازی برای sknn -- شبکههای عصبی و منظمسازی -- شبکههای عصبی و بهینهسازی ابرپارامتر -- شبکههای عصبی و مرزهای تصمیم -- یادگیری عمیق در مقیاس بزرگ با H2O -- یادگیری عمیق مقیاسبزرگ با H2O -- جستجوی شبکهای روی H2O -- یادگیری عمیق و پیشآموزش بدون نظارت -- یادگیری عمیق با theanets -- خودرمزگذارها و یادگیری بدون نظارت -- خودرمزگذارها -- خلاصه -- فصل ۵: یادگیری عمیق با TensorFlow -- نصب TensorFlow -- عملیاتهای TensorFlow -- محاسبات GPU -- رگرسیون خطی با SGD -- یک شبکهٔ عصبی از صفر در TensorFlow -- یادگیری ماشین روی TensorFlow با SkFlow -- یادگیری عمیق با فایلهای بزرگ - یادگیری افزایشی -- نصب Keras و TensorFlow -- شبکههای عصبی کانولوشنی در TensorFlow از طریق Keras -- لایهٔ کانولوشن -- لایهٔ ادغام -- لایهٔ تماممتصل -- CNNها با رویکرد افزایشی -- محاسبات GPU -- خلاصه -- فصل ۶: درختهای طبقهبندی و رگرسیون در مقیاس بزرگ -- تجمیع بوتاسترپ -- جنگل تصادفی و جنگل بسیار تصادفی -- بهینهسازی سریع پارامتر با جستجوی تصادفی -- درختهای بسیار تصادفی و مجموعهدادههای بزرگ CART و تقویت -- ماشینهای تقویت گرادیان -- max_depth -- learning_rate -- Subsample -- GBM سریعتر با warm_start -- آموزش و ذخیرهٔ مدلهای GBM -- XGBoost -- رگرسیون با XGBoost -- XGBoost و اهمیت متغیر -- دریافت جریانی مجموعهدادههای بزرگ با XGBoost -- ماندگاری مدل XGBoost -- CART خارج از حافظهٔ اصلی با H2O -- جنگل تصادفی و جستجوی شبکهای روی H2O -- تقویت گرادیان تصادفی و جستجوی شبکهای روی H2O -- خلاصه -- فصل ۷: یادگیری بدون نظارت در مقیاس بزرگ -- روشهای بدون نظارت -- تجزیهٔ ویژگی - PCA -- PCA تصادفی -- PCA افزایشی -- PCA تنک -- PCA با H2O -- خوشهبندی - K-means -- روشهای مقداردهی اولیه -- فرضهای K-means -- انتخاب بهترین K -- مقیاسپذیری K-means - مینیبچ -- K-means با H2O -- LDA -- مقیاسپذیری LDA - حافظه، CPUها و ماشینها -- خلاصه -- فصل ۸: محیطهای توزیعشده - Hadoop و Spark -- از یک ماشین مستقل تا مجموعهای از گرهها -- چرا به یک چارچوب توزیعشده نیاز داریم؟ -- راهاندازی ماشین مجازی -- VirtualBox -- Vagrant -- استفاده از ماشین مجازی -- اکوسیستم Hadoop -- معماری -- HDFS -- MapReduce -- YARN -- Spark -- pySpark -- خلاصه -- فصل ۹: یادگیری ماشین عملی با Spark -- راهاندازی ماشین مجازی برای این فصل -- بهاشتراکگذاری متغیرها میان گرههای خوشه -- متغیرهای فقطخواندنی Broadcast -- متغیرهای فقطنوشتنی Accumulator -- Broadcast و Accumulator با هم - یک مثال -- پیشپردازش داده در Spark -- فایلهای JSON و DataFrameهای Spark -- برخورد با دادههای گمشده -- گروهبندی و ساخت جدولها در حافظه -- نوشتن DataFrame یا RDD پیشپردازششده روی دیسک -- کار با DataFrameهای Spark -- یادگیری ماشین با Spark -- Spark روی مجموعهٔ دادهٔ KDD99 -- خواندن مجموعهٔ داده -- مهندسی ویژگی -- آموزش یک یادگیرنده -- ارزیابی عملکرد یک یادگیرنده -- قدرت خط لولهٔ ML -- تنظیم دستی -- اعتبارسنجی متقابل -- پاکسازی نهایی -- خلاصه پیوست: آشنایی با GPUها و Theano -- محاسبات GPU -- Theano - محاسبات موازی روی GPU -- نصب Theano -- نمایه ادامه مطلب...چکیده: جلد -- حق نشر -- تقدیر و تشکر -- دربارهٔ نویسندگان -- دربارهٔ بازبینان -- www.PacktPub.com -- فهرست مطالب -- پیشگفتار -- فصل ۱: نخستین گامها بهسوی مقیاسپذیری -- توضیح دقیق مقیاسپذیری -- نمونههایی در مقیاس بزرگ -- آشنایی با پایتون -- افزایش مقیاس با پایتون -- گسترش مقیاس با پایتون -- پایتون برای یادگیری ماشین در مقیاس بزرگ -- انتخاب بین پایتون ۲ و پایتون ۳ -- نصب پایتون -- نصب گامبهگام -- نصب بستهها -- بهروزرسانی بستهها -- توزیعهای علمی -- آشنایی با Jupyter/IPython -- بستههای پایتون -- NumPy -- SciPy -- Pandas -- Scikit-learn -- بستهٔ matplotlib -- Gensim -- H2O -- XGBoost -- Theano -- TensorFlow -- کتابخانهٔ sknn -- Theanets -- Keras -- بستههای مفید دیگر برای نصب روی سیستم -- خلاصه -- فصل ۲: یادگیری مقیاسپذیر در Scikit-learn -- یادگیری خارج از حافظهٔ اصلی -- نمونهبرداری جزئی بهعنوان گزینهای عملی -- بهینهسازی یک نمونه در هر بار -- ساخت یک سامانهٔ یادگیری خارج از حافظهٔ اصلی -- دریافت جریانی داده از منابع -- مجموعهدادههایی برای امتحان واقعی خودتان -- نخستین مثال - دریافت جریانی مجموعهٔ دادهٔ اشتراک دوچرخه -- استفاده از ابزارهای ورودی/خروجی pandas -- کار با پایگاههای داده -- توجه به ترتیب نمونهها -- یادگیری تصادفی -- نزول گرادیان دستهای -- نزول گرادیان تصادفی -- پیادهسازی SGD در Scikit-learn -- تعریف پارامترهای یادگیری SGD -- مدیریت ویژگیها با جریانهای داده -- توصیف هدف -- ترفند هشینگ -- تبدیلهای پایهٔ دیگر -- آزمون و اعتبارسنجی در جریان داده -- امتحان SGD در عمل -- خلاصه -- فصل ۳: پیادهسازیهای سریع SVM -- مجموعهدادههایی برای آزمایش خودتان -- مجموعهٔ دادهٔ اشتراک دوچرخه -- مجموعهٔ دادهٔ covertype -- ماشینهای بردار پشتیبان -- زیان لولا و گونههای آن -- درک پیادهسازی SVM در Scikit-learn -- دنبال کردن SVMهای غیرخطی با نمونهبرداری جزئی دستیابی به SVM در مقیاس بزرگ با SGD -- انتخاب ویژگی با منظمسازی -- افزودن غیرخطی بودن به SGD -- امتحان نگاشتهای صریح با ابعاد بالا -- تنظیم ابرپارامترها -- گزینههای دیگر برای یادگیری سریع SVM -- غیرخطی و سریعتر با Vowpal Wabbit -- نصب VW -- درک قالب دادهٔ VW -- یکپارچهسازی با پایتون -- چند مثال با استفاده از کاهشها برای SVM و شبکههای عصبی -- اشتراک دوچرخهٔ سریعتر -- مجموعهٔ دادهٔ covertype پردازششده با VW -- خلاصه -- فصل ۴: شبکههای عصبی و یادگیری عمیق -- معماری شبکهٔ عصبی -- شبکههای عصبی چه و چگونه یاد میگیرند -- انتخاب معماری مناسب -- لایهٔ ورودی -- لایهٔ پنهان -- لایهٔ خروجی -- شبکههای عصبی در عمل -- موازیسازی برای sknn -- شبکههای عصبی و منظمسازی -- شبکههای عصبی و بهینهسازی ابرپارامتر -- شبکههای عصبی و مرزهای تصمیم -- یادگیری عمیق در مقیاس بزرگ با H2O -- یادگیری عمیق مقیاسبزرگ با H2O -- جستجوی شبکهای روی H2O -- یادگیری عمیق و پیشآموزش بدون نظارت -- یادگیری عمیق با theanets -- خودرمزگذارها و یادگیری بدون نظارت -- خودرمزگذارها -- خلاصه -- فصل ۵: یادگیری عمیق با TensorFlow -- نصب TensorFlow -- عملیاتهای TensorFlow -- محاسبات GPU -- رگرسیون خطی با SGD -- یک شبکهٔ عصبی از صفر در TensorFlow -- یادگیری ماشین روی TensorFlow با SkFlow -- یادگیری عمیق با فایلهای بزرگ - یادگیری افزایشی -- نصب Keras و TensorFlow -- شبکههای عصبی کانولوشنی در TensorFlow از طریق Keras -- لایهٔ کانولوشن -- لایهٔ ادغام -- لایهٔ تماممتصل -- CNNها با رویکرد افزایشی -- محاسبات GPU -- خلاصه -- فصل ۶: درختهای طبقهبندی و رگرسیون در مقیاس بزرگ -- تجمیع بوتاسترپ -- جنگل تصادفی و جنگل بسیار تصادفی -- بهینهسازی سریع پارامتر با جستجوی تصادفی -- درختهای بسیار تصادفی و مجموعهدادههای بزرگ CART و تقویت -- ماشینهای تقویت گرادیان -- max_depth -- learning_rate -- Subsample -- GBM سریعتر با warm_start -- آموزش و ذخیرهٔ مدلهای GBM -- XGBoost -- رگرسیون با XGBoost -- XGBoost و اهمیت متغیر -- دریافت جریانی مجموعهدادههای بزرگ با XGBoost -- ماندگاری مدل XGBoost -- CART خارج از حافظهٔ اصلی با H2O -- جنگل تصادفی و جستجوی شبکهای روی H2O -- تقویت گرادیان تصادفی و جستجوی شبکهای روی H2O -- خلاصه -- فصل ۷: یادگیری بدون نظارت در مقیاس بزرگ -- روشهای بدون نظارت -- تجزیهٔ ویژگی - PCA -- PCA تصادفی -- PCA افزایشی -- PCA تنک -- PCA با H2O -- خوشهبندی - K-means -- روشهای مقداردهی اولیه -- فرضهای K-means -- انتخاب بهترین K -- مقیاسپذیری K-means - مینیبچ -- K-means با H2O -- LDA -- مقیاسپذیری LDA - حافظه، CPUها و ماشینها -- خلاصه -- فصل ۸: محیطهای توزیعشده - Hadoop و Spark -- از یک ماشین مستقل تا مجموعهای از گرهها -- چرا به یک چارچوب توزیعشده نیاز داریم؟ -- راهاندازی ماشین مجازی -- VirtualBox -- Vagrant -- استفاده از ماشین مجازی -- اکوسیستم Hadoop -- معماری -- HDFS -- MapReduce -- YARN -- Spark -- pySpark -- خلاصه -- فصل ۹: یادگیری ماشین عملی با Spark -- راهاندازی ماشین مجازی برای این فصل -- بهاشتراکگذاری متغیرها میان گرههای خوشه -- متغیرهای فقطخواندنی Broadcast -- متغیرهای فقطنوشتنی Accumulator -- Broadcast و Accumulator با هم - یک مثال -- پیشپردازش داده در Spark -- فایلهای JSON و DataFrameهای Spark -- برخورد با دادههای گمشده -- گروهبندی و ساخت جدولها در حافظه -- نوشتن DataFrame یا RDD پیشپردازششده روی دیسک -- کار با DataFrameهای Spark -- یادگیری ماشین با Spark -- Spark روی مجموعهٔ دادهٔ KDD99 -- خواندن مجموعهٔ داده -- مهندسی ویژگی -- آموزش یک یادگیرنده -- ارزیابی عملکرد یک یادگیرنده -- قدرت خط لولهٔ ML -- تنظیم دستی -- اعتبارسنجی متقابل -- پاکسازی نهایی -- خلاصه پیوست: آشنایی با GPUها و Theano -- محاسبات GPU -- Theano - محاسبات موازی روی GPU -- نصب Theano -- نمایه
Cover -- Copyright -- Credits -- About the Authors -- About the Reviewers -- www.PacktPub.com -- Table of Contents -- Preface -- Chapter 1: First Steps to Scalability -- Explaining scalability in detail -- Making large scale examples -- Introducing Python -- Scale up with Python -- Scale out with Python -- Python for large scale machine learning -- Choosing between Python 2 and Python 3 -- Installing Python -- Step-by-step installation -- The installation of packages -- Package upgrades -- Scientific distributions -- Introducing Jupyter/IPython -- Python packages -- NumPy -- SciPy -- Pandas -- Scikit-learn -- The matplotlib package -- Gensim -- H2O -- XGBoost -- Theano -- TensorFlow -- The sknn library -- Theanets -- Keras -- Other useful packages to install on your system -- Summary -- Chapter 2: Scalable Learning in Scikit-learn -- Out-of-core learning -- Subsampling as a viable option -- Optimizing one instance at a time -- Building an out-of-core learning system -- Streaming data from sources -- Datasets to try the real thing yourself -- The first example - streaming the bike-sharing dataset -- Using pandas I/O tools -- Working with databases -- Paying attention to the ordering of instances -- Stochastic learning -- Batch gradient descent -- Stochastic gradient descent -- The Scikit-learn SGD implementation -- Defining SGD learning parameters -- Feature management with data streams -- Describing the target -- The hashing trick -- Other basic transformations -- Testing and validation in a stream -- Trying SGD in action -- Summary -- Chapter 3: Fast SVM Implementations -- Datasets to experiment with on your own -- The bike-sharing dataset -- The covertype dataset -- Support Vector Machines -- Hinge loss and its variants -- Understanding the Scikit-learn SVM implementation -- Pursuing nonlinear SVMs by subsampling Achieving SVM at scale with SGD -- Feature selection by regularization -- Including non-linearity in SGD -- Trying explicit high-dimensional mappings -- Hyperparameter tuning -- Other alternatives for SVM fast learning -- Nonlinear and faster with Vowpal Wabbit -- Installing VW -- Understanding the VW data format -- Python integration -- A few examples using reductions for SVM and neural nets -- Faster bike-sharing -- The covertype dataset crunched by VW -- Summary -- Chapter 4: Neural Networks and Deep Learning -- The neural network architecture -- What and how neural networks learn -- Choosing the right architecture -- The input layer -- The hidden layer -- The output layer -- Neural networks in action -- Parallelization for sknn -- Neural networks and regularization -- Neural networks and hyperparameter optimization -- Neural networks and decision boundaries -- Deep learning at scale with H2O -- Large scale deep learning with H2O -- Gridsearch on H2O -- Deep learning and unsupervised pretraining -- Deep learning with theanets -- Autoencoders and unsupervised learning -- Autoencoders -- Summary -- Chapter 5: Deep Learning with TensorFlow -- TensorFlow installation -- TensorFlow operations -- GPU computing -- Linear regression with SGD -- A neural network from scratch in TensorFlow -- Machine learning on TensorFlow with SkFlow -- Deep learning with large files - incremental learning -- Keras and TensorFlow installation -- Convolutional Neural Networks in TensorFlow through Keras -- The convolution layer -- The pooling layer -- The fully connected layer -- CNN's with an incremental approach -- GPU Computing -- Summary -- Chapter 6: Classification and Regression Trees at Scale -- Bootstrap aggregation -- Random forest and extremely randomized forest -- Fast parameter optimization with randomized search -- Extremely randomized trees and large datasets CART and boosting -- Gradient Boosting Machines -- max_depth -- learning_rate -- Subsample -- Faster GBM with warm_start -- Training and storing GBM models -- XGBoost -- XGBoost regression -- XGBoost and variable importance -- XGBoost streaming large datasets -- XGBoost model persistence -- Out-of-core CART with H2O -- Random forest and gridsearch on H2O -- Stochastic gradient boosting and gridsearch on H2O -- Summary -- Chapter 7: Unsupervised Learning at Scale -- Unsupervised methods -- Feature decomposition - PCA -- Randomized PCA -- Incremental PCA -- Sparse PCA -- PCA with H2O -- Clustering - K-means -- Initialization methods -- K-means assumptions -- Selection of the best K -- Scaling K-means - mini-batch -- K-means with H2O -- LDA -- Scaling LDA - memory, CPUs, and machines -- Summary -- Chapter 8: Distributed Environments - Hadoop and Spark -- From a standalone machine to a bunch of nodes -- Why do we need a distributed framework? -- Setting up the VM -- VirtualBox -- Vagrant -- Using the VM -- The Hadoop ecosystem -- Architecture -- HDFS -- MapReduce -- YARN -- Spark -- pySpark -- Summary -- Chapter 9: Practical Machine Learning with Spark -- Setting up the VM for this chapter -- Sharing variables across cluster nodes -- Broadcast read-only variables -- Accumulators write-only variables -- Broadcast and accumulators together - an example -- Data preprocessing in Spark -- JSON files and Spark DataFrames -- Dealing with missing data -- Grouping and creating tables in-memory -- Writing the preprocessed DataFrame or RDD to disk -- Working with Spark DataFrames -- Machine learning with Spark -- Spark on the KDD99 dataset -- Reading the dataset -- Feature engineering -- Training a learner -- Evaluating a learner's performance -- The power of the ML pipeline -- Manual tuning -- Cross-validation -- Final cleanup -- Summary Appendix: Introduction to GPUs and Theano -- GPU computing -- Theano - parallel computing on the GPU -- Installing Theano -- Index Read more...Abstract: Cover -- Copyright -- Credits -- About the Authors -- About the Reviewers -- www.PacktPub.com -- Table of Contents -- Preface -- Chapter 1: First Steps to Scalability -- Explaining scalability in detail -- Making large scale examples -- Introducing Python -- Scale up with Python -- Scale out with Python -- Python for large scale machine learning -- Choosing between Python 2 and Python 3 -- Installing Python -- Step-by-step installation -- The installation of packages -- Package upgrades -- Scientific distributions -- Introducing Jupyter/IPython -- Python packages -- NumPy -- SciPy -- Pandas -- Scikit-learn -- The matplotlib package -- Gensim -- H2O -- XGBoost -- Theano -- TensorFlow -- The sknn library -- Theanets -- Keras -- Other useful packages to install on your system -- Summary -- Chapter 2: Scalable Learning in Scikit-learn -- Out-of-core learning -- Subsampling as a viable option -- Optimizing one instance at a time -- Building an out-of-core learning system -- Streaming data from sources -- Datasets to try the real thing yourself -- The first example - streaming the bike-sharing dataset -- Using pandas I/O tools -- Working with databases -- Paying attention to the ordering of instances -- Stochastic learning -- Batch gradient descent -- Stochastic gradient descent -- The Scikit-learn SGD implementation -- Defining SGD learning parameters -- Feature management with data streams -- Describing the target -- The hashing trick -- Other basic transformations -- Testing and validation in a stream -- Trying SGD in action -- Summary -- Chapter 3: Fast SVM Implementations -- Datasets to experiment with on your own -- The bike-sharing dataset -- The covertype dataset -- Support Vector Machines -- Hinge loss and its variants -- Understanding the Scikit-learn SVM implementation -- Pursuing nonlinear SVMs by subsampling Achieving SVM at scale with SGD -- Feature selection by regularization -- Including non-linearity in SGD -- Trying explicit high-dimensional mappings -- Hyperparameter tuning -- Other alternatives for SVM fast learning -- Nonlinear and faster with Vowpal Wabbit -- Installing VW -- Understanding the VW data format -- Python integration -- A few examples using reductions for SVM and neural nets -- Faster bike-sharing -- The covertype dataset crunched by VW -- Summary -- Chapter 4: Neural Networks and Deep Learning -- The neural network architecture -- What and how neural networks learn -- Choosing the right architecture -- The input layer -- The hidden layer -- The output layer -- Neural networks in action -- Parallelization for sknn -- Neural networks and regularization -- Neural networks and hyperparameter optimization -- Neural networks and decision boundaries -- Deep learning at scale with H2O -- Large scale deep learning with H2O -- Gridsearch on H2O -- Deep learning and unsupervised pretraining -- Deep learning with theanets -- Autoencoders and unsupervised learning -- Autoencoders -- Summary -- Chapter 5: Deep Learning with TensorFlow -- TensorFlow installation -- TensorFlow operations -- GPU computing -- Linear regression with SGD -- A neural network from scratch in TensorFlow -- Machine learning on TensorFlow with SkFlow -- Deep learning with large files - incremental learning -- Keras and TensorFlow installation -- Convolutional Neural Networks in TensorFlow through Keras -- The convolution layer -- The pooling layer -- The fully connected layer -- CNN's with an incremental approach -- GPU Computing -- Summary -- Chapter 6: Classification and Regression Trees at Scale -- Bootstrap aggregation -- Random forest and extremely randomized forest -- Fast parameter optimization with randomized search -- Extremely randomized trees and large datasets CART and boosting -- Gradient Boosting Machines -- max_depth -- learning_rate -- Subsample -- Faster GBM with warm_start -- Training and storing GBM models -- XGBoost -- XGBoost regression -- XGBoost and variable importance -- XGBoost streaming large datasets -- XGBoost model persistence -- Out-of-core CART with H2O -- Random forest and gridsearch on H2O -- Stochastic gradient boosting and gridsearch on H2O -- Summary -- Chapter 7: Unsupervised Learning at Scale -- Unsupervised methods -- Feature decomposition - PCA -- Randomized PCA -- Incremental PCA -- Sparse PCA -- PCA with H2O -- Clustering - K-means -- Initialization methods -- K-means assumptions -- Selection of the best K -- Scaling K-means - mini-batch -- K-means with H2O -- LDA -- Scaling LDA - memory, CPUs, and machines -- Summary -- Chapter 8: Distributed Environments - Hadoop and Spark -- From a standalone machine to a bunch of nodes -- Why do we need a distributed framework? -- Setting up the VM -- VirtualBox -- Vagrant -- Using the VM -- The Hadoop ecosystem -- Architecture -- HDFS -- MapReduce -- YARN -- Spark -- pySpark -- Summary -- Chapter 9: Practical Machine Learning with Spark -- Setting up the VM for this chapter -- Sharing variables across cluster nodes -- Broadcast read-only variables -- Accumulators write-only variables -- Broadcast and accumulators together - an example -- Data preprocessing in Spark -- JSON files and Spark DataFrames -- Dealing with missing data -- Grouping and creating tables in-memory -- Writing the preprocessed DataFrame or RDD to disk -- Working with Spark DataFrames -- Machine learning with Spark -- Spark on the KDD99 dataset -- Reading the dataset -- Feature engineering -- Training a learner -- Evaluating a learner's performance -- The power of the ML pipeline -- Manual tuning -- Cross-validation -- Final cleanup -- Summary Appendix: Introduction to GPUs and Theano -- GPU computing -- Theano - parallel computing on the GPU -- Installing Theano -- Index