ISBN 9784274224126

Pythonによるデータマイニングと機械学習

Pythonによるデータマイニングと機械学習
著者
藤野 巌
出版社
オーム社
刊行
2019-08

概要

Python で主要なデータマイニング・機械学習手法を一通り実装する

想定読者

Pythonの基礎は理解しているが機械学習の実装経験がなく、回帰・クラスタリング・分類・テキストマイニングを手を動かしながら習得したい入門者

こんな人には向いていない

  • すでに scikit-learn を使って実務プロジェクトを経験している人には手法の網羅性より実装の深さを求めるため物足りない
  • 数理統計や最適化の理論を体系的に学びたい人には数式の説明量が少ない
  • 深層学習(ニューラルネット・CNN 等)を主目的とする読者には対象手法に含まれないため別書が必要

読了後にできるようになること

  • NumPy / SciPy / scikit-learn / pandas / matplotlib を組み合わせたデータ分析環境を自力で構築できる
  • 回帰分析、階層型・非階層型クラスタリング、ナイーブベイズ分類、SVM の実装原理と使い分けを説明できる
  • 時系列数値データの予測モデルを構築し、日経平均株価予測の実践例を再現できる
  • 形態素解析を使ったテキストマイニングと Wikipedia 記事類似度分析を実装できる
  • 画像データの特徴量抽出・類似度分類・クラスタリングをPythonで実装できる
  • サンプルコードを改変しながらデータマイニングの各手法を実プロジェクトへ応用する足場を得られる

本書のキー概念(章解説)

  • 第 1 章 データマイニングと機械学習 — 本書全体の手法マップを概観できる導入章
  • 第 2 章 Pythonクイックスタート(基礎編)
  • 第 3 章 Pythonクイックスタート(応用編) — NumPy / pandas / matplotlib の実践的な使い方を固める
  • 第 4 章 回帰分析
  • 第 5 章 階層型クラスタリング
  • 第 6 章 非階層型クラスタリング
  • 第 7 章 ナイーブベイズによる分類
  • 第 8 章 サポートベクターマシンによる分類
  • 第 9 章 時系列数値データの予測 — 実践編の入口。数値予測の典型的なパイプラインを構築する
  • 第 10 章 日経平均株価の予測 — 9章の発展。実データを用いた金融時系列予測の応用例
  • 第 11 章 テキストデータのマイニング
  • 第 12 章 Wikipedia記事の類似度分析
  • 第 13 章 画像データの処理技術
  • 第 14 章 画像の類似度分類とクラスタリング — テキスト・画像の両ドメインをカバーし、実践編の締め括りとなる章

ハイライト

  • 本書は、本当にPythonによってデータマイニングと機械学習を行いたい人のための入門書です。初学者がわかりやすいよう、途中でつまづいてしまうことがないよう、一部省略なしで、初歩からていねいに解説してあります。(著者の編集方針が最も端的に表れている記述。省略なしの丁寧な解説という本書の特徴を示す)

編集メモ

Qiita 言及記事 0 件 / 累計 likes 0。楽天ランキング情報なし。外部シグナルが確認できないため supplementary と判定。出版社サイトから確認できる範囲で、回帰・クラスタリング・分類・テキスト・画像を一冊でカバーする手法横断型の入門書という位置付け

読む前に押さえておきたいこと

  • Pythonの基本文法(変数・制御構造・関数・クラス)の読み書きができる
  • 高校数学レベルの線形代数(行列・ベクトル)と統計(平均・分散・確率)の概念を理解している
  • コマンドラインでの Python 実行環境(pip / venv または conda)を自力で構築できる

学習のコツ

  • 1〜3章のPythonクイックスタートは、NumPy / pandas / matplotlib を既に使える人であれば斜め読みで十分。4章の回帰分析から本題に入れる
  • 9〜10章(時系列・株価予測)は実データを使う分、前章の理論を確認しながら読むと吸収が早い。先に4章の回帰分析を手元で動かしてから進むと良い
  • 著者の GitHub (https://github.com/iwaofujino) にサンプルコードが公開されているため、本を読む前にコードを clone してから各章を読む方法も有効
  • テキストマイニング(11〜12章)は日本語形態素解析ライブラリの環境構築が必要なため、事前に MeCab または janome のセットアップを済ませておくとスムーズ
出版社による内容紹介

本当にPythonによってデータマイニングと機械学習を行いたい人のための入門書 本書は、本当にPythonによってデータマイニングと機械学習を行いたい人のための入門書です。 初学者がわかりやすいよう、途中でつまづいてしまうことがないよう、一部省略なしで、初歩からていねいに解説してあります。 本書を読み切れば、誰でもPythonにデータマイニングと機械学習の主な手法が実装できます。

この本がどの学習段階で役立つかは、 関連する ロードマップ から確認できます。

質問に答えるだけで、
あなたに合う専門書が見つかる

IT・デザイン・士業・医療・経理・教育・研究 ほか、あらゆる分野の専門書と 「読む順序」(学習ロードマップ)を収録。何を選べばいいか分からなくても、 いくつかの質問に答えるだけでたどり着けます。