AI と ML の基礎 #1

Q1未挑戦の問題問題を見る

ML ワークフローを自動化する SageMaker Pipelines

正解の『SageMaker Pipelines』を押さえます。
・データ準備・学習・評価・デプロイなどのステップを、自動化された再現可能なワークフローとして定義・実行する。
・手順を毎回同じように回せるため MLOps の中核になる。
Feature Store(特徴量保存)・Data Wrangler(前処理)・JumpStart(モデルハブ)はいずれもワークフロー全体を自動化するパイプラインではなく、個々のステップやリソースに関わる機能です。

Q2未挑戦の問題問題を見る

分類・回帰・クラスタリング・次元削減の違い

代表的な 4 つの機械学習タスクの違いを押さえます。
分類: ラベル付きデータで学習し、入力をカテゴリ(離散ラベル)に割り当てる教師あり学習(例: 病変あり/なし、犬/猫)。
回帰: 同じ教師あり学習だが、売上や気温などの連続する数値を予測する。
クラスタリング: ラベルを使わず、似たデータを集団に分ける教師なし学習(例: 顧客のセグメント分け)。
次元削減: ラベルを使わず、特徴量を圧縮して扱いやすくする教師なし学習(可視化・前処理に使う)。
出力が カテゴリ → 分類数値 → 回帰、ラベルなしの 集団分け → クラスタリング圧縮 → 次元削減 で見分けます。

Q3未挑戦の問題問題を見る

過学習が進む前に学習を打ち切る早期終了

正解の『早期終了(アーリーストッピング)』を押さえます。
・検証データの精度が悪化に転じた時点で学習を打ち切る。
・過剰適合が進む前に止めることでオーバーフィッティングを抑える。
『データを減らす』『学習を長く続ける』はいずれも過学習を悪化させ、『レイテンシを下げる』は過学習の抑制とは無関係です。

Q4未挑戦の問題問題を見る

学習データに適合しすぎるオーバーフィッティング

正解の『オーバーフィッティング(過学習)』を押さえます。
・学習データに過剰に適合し、ノイズや細部まで覚え込んでしまう状態。
・学習データでは高精度でも、未知データでは精度が下がり汎化できない。
アンダーフィッティングは学習データでも精度が低い別の状態で、正則化(抑制手法)・ハイパーパラメータ(設定値)はそもそも『状態』の名前ではありません。

Q5未挑戦の問題問題を見る

データ収集から運用までの機械学習ライフサイクル

機械学習ライフサイクルのフェーズと、各フェーズで行う作業を押さえます。
データ収集: 学習に使うデータを集める。
データ準備: クレンジング(欠損値補完・外れ値処理・形式統一)と特徴量エンジニアリング(有効な入力変数を作る)でデータを整える。
モデル学習: アルゴリズムでモデルを訓練し、ハイパーパラメータを調整する。
評価: 精度などの指標でモデルの性能を確認する。
デプロイ: モデルを本番環境に展開する。
モニタリング(運用): 本番でのモデルの挙動・精度を監視し、推論結果を API で提供する。
本問の『データクレンジング・特徴量エンジニアリング』はデータ準備フェーズ。本番モニタリング・推論 API 提供はデプロイ後の運用フェーズ、ハイパーパラメータ調整はモデル学習フェーズの作業です。