概要
機械学習の資格では、Databricks の機能だけでなく、モデル開発の基本的な考え方も問われます。
特に、評価を正しく行うこと(リーケージを防ぎ、目的に合った指標を選ぶこと)は、実務でも試験でも大切な点です。
押さえるべきポイント
一、データリーケージを防ぐ
前処理(スケーリングなど)は学習データだけで fit し、評価データには transform だけを適用します。分割する前に全データで fit すると、評価データの情報が学習側に漏れて、評価が実際より良く見えてしまいます。
二、過学習を見分ける
学習データでの性能が非常に高く、検証データでの性能が大きく下がるのは、過学習のサインです。正則化、モデルの単純化、データの追加などで対処します。
三、目的に合った評価指標を選ぶ
クラスが大きく偏ったデータでは、正解率だけでは少数のクラスを検出できているか分かりません。適合率・再現率・F1 などを併用します。
四、特徴量の作り方と、時系列での注意点
カテゴリの変数は、ワンホットエンコーディングなどで数値にします。時系列の特徴量を結合するときは、ポイントインタイム結合で、予測する時点より未来の値が混ざらないようにします。
五、AutoML で出発点を作る
Databricks AutoML は、試行ごとのソースコードをノートブックとして生成します。最も良い試行のコードを出発点にして、手作業で改良していけます。
重要な用語
| 用語 | 意味 |
|---|---|
| データリーケージ | 本来使えないはずの情報(評価データや未来の値)が、学習に混ざってしまうこと。 |
| 過学習 | 学習データに合わせすぎて、未知のデータでの性能が落ちること。 |
| 適合率・再現率 | 陽性と予測したものの正しさ(適合率)と、実際の陽性をどれだけ拾えたか(再現率)。 |
| ワンホットエンコーディング | カテゴリの値ごとに 0/1 の列を作って、数値にする方法。 |
| ポイントインタイム結合 | 各行のタイムスタンプ時点で有効だった特徴量の値だけを結合する方法。 |
おすすめの教材
いずれも公式の情報です。内容は更新されることがあるため、最新の版を確認してください。
問題で確かめる
- Machine Learning Associate 問題集分野:モデリングと評価、特徴量エンジニアリング(7問)この分野を解く