ISBN 9784814400195
Pythonによるデータ分析入門 第3版 : pandas、NumPy、Jupyterを使ったデータ処理
- 出版社
- オライリー・ジャパン
- 刊行
- 2023-08
概要
『Python によるデータ分析入門 第 3 版 — pandas、NumPy、Jupyter を使ったデータ処理』(原題『Python for Data Analysis』第 3 版、Wes McKinney 著、2023 年 8 月邦訳、オライリー・ジャパン)は、pandas の 開発者本人 による pandas 公式バイブル。pandas 2.0 + Python 3.10 に対応した最新版で、初版・第 2 版の累計 4 万部超のベストセラー。データ分析を行うなら「必ず棚に置く 1 冊」として圧倒的支持を得ている。
想定読者
- Python は使えるが pandas を体系で押さえたいデータアナリスト・サイエンティスト
- 業務で pandas を使うが「自己流」で詰まることがあるエンジニア
- pandas 2.0 の新機能(Arrow バックエンド・Copy-on-Write 等)を把握したい中級者
- 大学・大学院でデータ分析を学ぶ学生(英語原書を読まずに済ませたい場合)
こんな人には向いていない
- Python の言語入門段階の読者(本書は基本文法を前提とする)
- 機械学習(scikit-learn / PyTorch)が中心の読者(本書はデータ前処理特化)
- データ可視化(matplotlib / seaborn)を中心に学びたい読者(本書は触れる程度)
読了後にできるようになること
- pandas の Series / DataFrame を仕様レベルで使いこなせる — Indexing / Selection の細部
- GroupBy / pivot / merge の典型パターンを使い分けられる — データ整形の基本所作
- 時系列データの扱い方が分かる — resample / shift / 移動平均
- 大規模データの効率的な扱いが見える — chunking / Arrow バックエンド
本書のキー概念
- 第 1 章 Python 環境の構築 — IPython / Jupyter
- 第 2 章 Python の基本データ構造 — list / dict / set / 文字列処理
- 第 3 章 NumPy — 多次元配列 / ブロードキャスト
- 第 4 章 pandas 基礎 — Series / DataFrame / Index
- 第 5 章 データのロード・保存 — CSV / Excel / JSON / SQL / Parquet
- 第 6 章 データクリーニング — 欠損値 / 重複 / 文字列処理
- 第 7 章 データの整形 — GroupBy / pivot / merge / concat
- 第 8 章 時系列データ — DatetimeIndex / resample / 移動統計
- 第 9 章 可視化(matplotlib / seaborn) — pandas との統合
- 第 10 章 データ分析の応用例 — 売上 / 経済 / Web ログ
なぜ「pandas の決定版」と呼ばれるのか
著者の Wes McKinney は pandas そのものを作った張本人。仕様の意図・歴史的経緯まで本書から読み取れるため、他のどんな入門書よりも信頼性が高い。第 3 版で pandas 2.0(Arrow バックエンド・Copy-on-Write) に対応し、向こう 2-3 年は pandas のリファレンスとして現役。「データ分析を始めるなら 1 冊目に McKinney 本」というのが業界の通説。
関連書籍
- 『Python データサイエンスハンドブック 第 2 版』(Jake VanderPlas) — Python データ分析の併読書
- 『R によるやさしい統計学』 — R 派の入門書、本書と相補
- 『scikit-learn、Keras、TensorFlow による実践機械学習 第 3 版』 — 機械学習への展開
関連 Topic
- /topics/python — Python
- /topics/numpy — NumPy
- /topics/jupyter — Jupyter
- /topics/data-science — データサイエンス
出版社による内容紹介
pandas2.0に対応したPythonを使ったデータ分析の必読書に待望の改訂版! 本書はPythonの代表的なデータ分析ツール、pandasの開発者Wes McKinneyによる書籍で、データ分析を行うための基本を網羅しています。第1版、第2版の売上冊数は累計で4万部を超えるベストセラーで、データ分析を行うなら読むべき一冊として、必ず名前が挙がるバイブル的な書籍で、多くの読者に信頼され、支持されています。 Python 3.10、pandas 2.0対応
この本がどの学習段階で役立つかは、 関連する ロードマップ から確認できます。