ISBN 9784814400409
機械学習システムデザイン : 実運用レベルのアプリケーションを実現する継続的反復プロセス
- 出版社
- オライリー・ジャパン
- 刊行
- 2023-09
概要
機械学習システムを本番運用レベルで継続的に設計・改善する
想定読者
モデル開発の経験はあるが、本番環境への安定デプロイ・運用継続・ビジネス要件への適応に課題を感じているMLエンジニアおよびデータサイエンティスト
こんな人には向いていない
- 機械学習の数学的基礎・アルゴリズム理論をこれから学ぶ段階の人には、システム設計の前提となるモデル構築経験が不足しており内容の吸収が難しい
- 個別モデルの精度改善を主目的とするリサーチャーには、インフラ・パイプライン・運用監視寄りの比重が想定する関心と一致しないことが多い
- 大規模MLプラットフォーム(Vertex AI Pipelines / Kubeflow 等)の設計・運用経験をすでに持つ上級MLOpsエンジニアには、既知のトレードオフ整理として参照用にとどまる可能性がある
この本で身につくこと
- 訓練データの収集・前処理・ラベリング戦略を品質とコストのバランスを考慮しながら設計できる
- 特徴エンジニアリングとフィーチャーストアの役割を理解し、学習フェーズと推論フェーズ間のデータ一貫性を担保する設計ができる
- モデルの再訓練頻度・カナリアデプロイ・シャドウデプロイ等のデプロイ戦略を業務要件から選択・判断できる
- 本番環境での概念ドリフト・データドリフトを検出・対処するためのモニタリング設計ができる
- 信頼性・拡張性・保守性を考慮したエンドツーエンドのMLパイプライン構造を設計し、各決定をビジネス目標と結びつけて説明できる
ハイライト(外部からの言及)
訓練データの処理方法、特徴の使い方、モデルを再訓練する頻度、監視すべき項目……このような設計上の決定がシステム全体の目的達成にどのように寄与するのかを、実際のケーススタディを通じて理解します。 — 出典
本書の核心である「設計判断の連鎖がシステム全体の成否を決める」という視点が最も端的に示されている箇所
機械学習プロジェクトを成功に導く上で必要な信頼性、拡張性、保守性、およびビジネス要件の変化への適応性を備えた機械学習システムを設計する包括的なアプローチを本書で学ぶことができます。 — 出典
本書がカバーする設計品質の4軸を明示しており、読者が期待値と到達点を30秒で把握できる
章立て
第1章 機械学習システムの概要
本書の問題設定。研究の ML と本番の ML の違いを整理する起点
第2章 機械学習システム設計の概要
本書全体の地図。後続章の役割が一覧できる
第3章 データエンジニアリングの基礎知識
後続のパイプライン設計・フィーチャーストア・ドリフト監視を理解する土台となる概念を整理。データ基盤の経験が浅い読者は丁寧に読むことで第7章以降の設計議論が追いやすくなる
第4章 訓練データ
ラベリング・サンプリング戦略。実務でモデル品質を左右する領域
第5章 特徴エンジニアリング
本書中盤の中核章。特徴量設計の体系
第6章 モデル開発とオフライン評価
実験管理・ベースライン設計・オフライン評価指標の選定を扱う。ここで設定した評価指標が第8章のデータドリフト監視設計と直結するため、後続章との連続性を意識しながら読むと全体設計の一貫性が把握しやすい
第7章 モデルのデプロイと予測サービス
オンライン推論アーキテクチャの設計判断軸
第8章 データ分布のシフトと監視
本番でモデルが劣化する原因と検知方法。MLOps の核心
第9章 実現場での継続学習とテスト
Online Learning / Shadow Deployment / A/B テスト
第10章 MLOpsにおけるインフラとツール
MLflow / Kubeflow / Feature Store の選定軸
第11章 機械学習の人的側面
ML プロジェクトのチーム構成。本書独自の視点
関連記事 / 参考情報
- 初心者データサイエンティストに向けて独断と偏見だけで選んだ読んでおいてもらいたい情報まとめ — データサイエンス入門者向けの書籍・情報リソース厳選まとめ。本書はMLシステムの実務設計を学ぶ一冊として収録
学習のヒント
- 各章で提示される設計上の選択肢(例: オンライン学習 vs バッチ学習、push vs pull 型フィーチャーストア)は、自分が担当する実際のシステムに当てはめながら読むと判断軸が定着しやすい
- データ収集・特徴エンジニアリングの章は、モデル精度改善に行き詰まったタイミングで読むとボトルネックの所在が上流にあると気づけることが多い
- モニタリング・ドリフト検出の章は本番MLを持っていない読者でも「稼働後に何が壊れるか」の予習として通読する価値がある。設計前に読むことで、後から入れにくいオブザーバビリティ要件を初期設計に含めやすくなる
前提知識
- scikit-learn / TensorFlow / PyTorch いずれかでモデルを学習・評価した実務または学習経験
- コンテナ・オブジェクトストレージ・REST API デプロイなど基本的なクラウドインフラの操作経験
- DataFrame または SQL によるデータ前処理の実務経験
次に読む本
機械学習デザインパターン
本書がMLシステム設計の考え方と判断軸を体系化するのに対し、機械学習デザインパターンは同問題を再利用可能なパターン群として整理する。設計の抽象論から実装レベルのパターン適用に移行する段階で補完的に読むと、設計判断の言語化と知識の再利用性が高まる
データ指向アプリケーションデザイン
本書がMLパイプラインの設計方針を前提とするのに対し、データ指向アプリケーションデザインはその土台となるストリーム処理・レプリケーション・一貫性モデルを原理から体系化する。フィーチャーストアやパイプライン設計をより深く理解したい場合、本書の後に読むと根拠の明確さが増す
Kubeflow for Machine Learning
本書で学んだMLパイプラインの概念をKubeflow/Vertex AI Pipelines上で実装する際の実践ガイドとして機能し、設計から実装への橋渡しになる
出版社による内容紹介
機械学習システム設計(デザイン)を業務での実践的な観点で解説! ビジネスとしての機械学習システムの設計や運用についての解説書。本書では、機械学習の最前線で活躍する著者の豊富な経験と知識に基づき、エンド・ツー・エンドの機械学習システムを設計・構築するための基本原則を明らかにします。訓練データの処理方法、特徴の使い方、モデルを再訓練する頻度、監視すべき項目……このような設計上の決定がシステム全体の目的達成にどのように寄与するのかを、実際のケーススタディを通じて理解します。機械学習プロジェクトを成功に導く上で必要な信頼性、拡張性、保守性、およびビジネス要件の変化への適応性を備えた機械学習システムを設計する包括的なアプローチを本書で学ぶことができます。
この本がどの学習段階で役立つかは、 関連する ロードマップ から確認できます。