ISBN 9784254122817

Pythonによる実務で役立つデータサイエンス練習問題200+ (1) : アナリティクスの基礎・可視化と実践的テクニック

Pythonによる実務で役立つデータサイエンス練習問題200+ (1) : アナリティクスの基礎・可視化と実践的テクニック
著者
久保 幹雄
出版社
朝倉書店
刊行
2023-05

概要

Jupyter上の練習問題でデータサイエンス実務スキルを体得する

想定読者

Pythonの基礎文法を習得済みで、NumPy・Pandas・可視化ライブラリを実務レベルまで引き上げたいデータ分析担当者・研究者

こんな人には向いていない

  • Pythonをまだ書いたことがない初学者(本書はPython入門を前提とし、文法説明は最小限)
  • 理論的な統計学・機械学習の数理的裏付けを求める読者(本書は演習中心で数式展開は少ない)
  • 第2巻・第3巻のSciPy・PyMC・scikit-learnを先に学びたい読者(第1巻はその前段となる基礎スタック)

読了後にできるようになること

  • NumPyによる配列演算とブロードキャストを使いこなし、数値計算を効率化できる
  • Pandasのデータ整形・集計・結合操作を実務規模のデータに適用できる
  • matplotlib・plotly・Plotly Expressで目的に応じた静的・対話型グラフを作り分けられる
  • dataclasses・pydantic・defaultdict・mapなどのPython中級テクニックをデータ処理パイプラインに組み込める
  • statsmodelsを用いた回帰・統計検定を実務データに対して適用できる
  • StreamlitとOpenPyXLを使いデータ可視化結果をアプリ・Excelへ出力できる

本書のキー概念(章解説)

  • 第 1 章 ビッグデータとアナリティクス — データサイエンスの業務文脈と本書全体の位置付けを整理する導入章
  • 第 2 章 数値計算パッケージ NumPy — 配列演算・ブロードキャストを演習形式で習得する。後続章の基盤となる
  • 第 3 章 データ解析パッケージ Pandas — 実務頻度が最も高い章。DataFrameの整形・集計・結合を問題形式で体得できる
  • 第 4 章 matplotlibを用いた可視化入門 — 静的グラフの基礎。5章・6章の対話型可視化への橋渡し
  • 第 5 章 対話型可視化パッケージ plotly — インタラクティブなグラフ生成を習得。レポート・ダッシュボード用途で直結
  • 第 6 章 データを可視化するための方法(Plotly Express) — plotlyの高水準APIで記述量を減らしながら可視化の質を維持する方法論
  • 第 7 章 Python言語先進的プログラミング — dataclasses・pydantic・defaultdict・mapなど中級テクニック集。コードの保守性を高める実践的な章
  • 第 8 章 statsmodelsを用いた統計分析 — 回帰・検定を実データで演習。第2巻のPyMCへ進む前の統計的思考の地ならし

ハイライト

  • 実際に課題解決で使えるPythonプログラミングをJupyter上で練習問題をときながら身に着ける。NumPy/Pandas/matplotlib/plotly/Plotly Express/simpy/様々な技巧(dataclasses,pydantic,defaultdict,map,JSON,Requests,OpenPyXL,Streamlit)/statsmodels(本書がカバーするスタック全体を過不足なく示している記述。実務で頻出するツールチェーンの広さが確認できる)

編集メモ

Qiita での本ISBN直接言及: 0件 / booklogへの登録数25件 / 外部ランキングシグナルなし。公開後日が浅く(2023年5月)外部シグナルの蓄積途上。朝倉書店の専門書として東京大学・山梨大学の図書館に採録済みで学術的認知はあるが、現時点の定量シグナルでは supplementary が適正

読む前に押さえておきたいこと

  • Pythonの基本文法(変数・リスト・辞書・関数定義・内包表記)の実装経験
  • JupyterNotebookまたはJupyterLabの基本操作(セル実行・カーネル管理)
  • 基本的な統計概念(平均・分散・相関係数)の理解。statsmodels章では仮説検定の概念が前提となる

学習のコツ

  • 第3章(Pandas)は章のボリュームと実務密着度が最も高い。他章より時間を多く確保し、手元のデータに置き換えて演習すると定着が速い
  • 第7章(先進的プログラミング)は通読ではなく辞書として活用する方法が有効。他章で詰まった構文が出てきたときに参照する読み方が合っている
  • 本書はJupyterNotebook前提の設計。手元環境をJupyterLabまたはVSCode+Jupyter拡張で整えてから読み始めると演習の試行錯誤がスムーズ
  • 第2巻(SciPy・PyMC・NetworkX・最適化)へ進む前に、第8章のstatsmodelsを一通り解いておくと統計的な感覚が定着しやすい
出版社による内容紹介

実際に課題解決で使えるPythonプログラミングをJupyter上で練習問題をときながら身に着ける.[内容]NumPy/Pandas/matplotlib/plotly/Plotly Express/simpy/様々な技巧(simpy,dataclasses,pydantic,defaultdict,map,JSON,Requests,OpenPyXL,Streamlit)/statsmodels 【全巻構成】 第1巻 1. ビックデータとアナリティクス 2. 数値計算パッケージ NumPy 3. データ解析パッケージ Pandas 4. matplotlibを用いた可視化入門 5. 対話型可視化パッケージ plotly 6. データを可視化するための方法( plotly express ) 7. Python言語先進的プログラミング 8. statsmodelsを用いた統計分析 第2巻 9. 科学技術計算パッケージ SciPy 10. PyMCによるベイズ推論とProphetによる時系列データの予測 11. グラフ・ネットワークパッケージNetworkX 12. PuLPとGurobi/Pythonによる最適化問題のモデリング 13. 制約最適化システムSCOP 14. スケジューリング最適化システムOptSeq 第3巻 15. scikit-learnを用いた機械学習 16. fastaiによる深層学習 17. PyCaretを用いた自動機械学習

この本がどの学習段階で役立つかは、 関連する ロードマップ から確認できます。

質問に答えるだけで、
あなたに合う専門書が見つかる

IT・デザイン・士業・医療・経理・教育・研究 ほか、あらゆる分野の専門書と 「読む順序」(学習ロードマップ)を収録。何を選べばいいか分からなくても、 いくつかの質問に答えるだけでたどり着けます。