AWS Certified Machine Learning Engineer – Associate (MLA-C02) 備考指南

AWS 機器學習工程師認證 MLA-C02(Beta 期間代碼為 ME1-C02)全面替代舊版 MLA-C01。新版考試從過往「傳統特徵工程與單機訓練」為主的架構,正式演進為「傳統 MLOps + 生成式 AI 與大型語言模型維運(LLMOps)」的混合型考綱。

本指南彙整了 MLA-C02 的考試規格變動、四大領域權重核心考點、實戰實驗清單與避坑心法。

一、 考試規格與關鍵變遷速查

項目舊制 MLA-C01(英文版已除役)新制 MLA-C02
題目數量65 題85 題(65 題計分 + 20 題不計分)
考試時長130 分鐘170 分鐘(增加 40 分鐘)
及格標準720 / 1000 分720 / 1000 分
考試形式Pearson VUE 實體考場或 OnVUE 線上遠距監考Pearson VUE 實體考場或 OnVUE 線上遠距監考
主要技術棧新增傳統 ML 演算法、SageMaker 訓練與端點Amazon Bedrock、OpenSearch Serverless 向量引擎、RAG 管線、Bedrock Guardrails、LLM 評估指標

二、 四大核心領域拆解與高頻考點

  ┌────────────────────────────────────────────────────────────────────────┐
  │                    MLA-C02 四大核心領域架構與權重配比                  │
  └────────────────────────────────────────────────────────────────────────┘
    │ Domain 1 (28%): Data Preparation for ML and AI (資料準備與向量化)
    │ Domain 2 (24%): ML Model and Foundation Model (FM) Development (模型與基礎模型開發)
    │ Domain 3 (24%): Deployment and Orchestration of ML and AI Workflows (部署與編排)
    │ Domain 4 (24%): Operating, Monitoring, and Securing ML and AI Solutions (維運與安全)

Domain 1: Data Preparation for ML and AI (28%)

  • 文字與多模態分塊(Chunking Strategies):
    • Fixed-size chunking:需理解 Token 大小與重疊比例(Overlap %)對語意完整性的影響。
    • Hierarchical chunking(層級分塊):用小區塊(Child)做向量精準檢索,傳回大區塊(Parent)作為 Prompt 上下文。
    • Semantic chunking(語意分塊):基於語意自然斷句切分。
  • 向量資料庫選型與整合:
    • Amazon OpenSearch Serverless (AOSS):專用 Vector Search Collection 的網路策略(Network Policy)、加密(KMS)與資料存取策略(Data Access Policy)。
    • Amazon Aurora PostgreSQL 搭配 pgvector:適用於既有關係型資料庫系統的向量混合查詢。
  • 傳統資料清洗工具:
    • AWS Glue DataBrew、SageMaker Data Wrangler 處理缺失值(Imputation)、異常值偵測與類別編碼(One-Hot vs. Ordinal)。

Domain 2: ML Model and Foundation Model (FM) Development (24%)

  • 基礎模型選型與調用:
    • 掌握 Amazon Titan、Anthropic Claude、Meta Llama 3 等模型的優勢場景與 Context Window 限制。
    • 掌握 Prompt Engineering(Zero-shot, Few-shot, Chain-of-Thought)與 模型微調(PEFT / LoRA) 的決策邊界(成本、資料量與延遲權衡)。
  • 模型評估矩陣(新增重點):
    • 傳統 ML:Confusion Matrix、Precision、Recall、F1-Score、AUC-ROC、RMSE。
    • LLM 評估:ROUGE(摘要評估)、BLEU(翻譯評估)、BERTScore(語意相似度)、Perplexity(困惑度),以及結合 Amazon A2I 的人工審查(Human-in-the-loop)。

Domain 3: Deployment and Orchestration of ML and AI Workflows (24%)

  • SageMaker 推論端點選型:
    • Real-time Inference:低延遲、持續流量、支援自動擴展與多模型端點(MME)。
    • Serverless Inference:間歇性或難以預測的流量、冷啟動容忍、成本最低。
    • Asynchronous Inference:Payload 較大(最高 1 GB)、處理時間長(最多 1 小時)、支援排隊(S3 傳輸)與縮容至零。
    • Batch Transform:離線大量資料批次推論。
  • RAG 與 Agent 自動化管線:
    • Bedrock Knowledge Bases 增量同步:S3 文件更新後,必須透過 EventBridge 觸發 Lambda 調用 StartIngestionJob API 才能更新向量庫。
    • Bedrock Agents:透過 OpenAPI Schema 定義 Action Group,並綁定 AWS Lambda 執行後端業務邏輯。

Domain 4: Operating, Monitoring, and Securing ML and AI Solutions (24%)

  • Amazon Bedrock Guardrails(必考大熱門):
    • Sensitive Information Filters:PII 處置模式中,Mask(替換為標籤,模型仍可理解語境)與 Block(直接攔截)的適用場景。
    • Contextual Grounding Checks:
      • Grounding Score:模型回答是否有知識庫事實依據(防止模型腦補/幻覺)。
      • Relevance Score:模型回答是否符合使用者的提問意圖。
  • 模型漂移監控:
    • SageMaker Model Monitor:Data Quality Drift、Model Quality Drift、Bias Drift 與 Feature Attribution Drift。
  • 網路邊界與私有化:
    • 透過 AWS PrivateLink(VPC Endpoints)安全存取 Bedrock 與 SageMaker 端點,停用公網存取。

三、 必做動手實驗清單(Hands-on Lab Checklist)

純背題庫極易在長題幹情境題中失分,建議在 AWS 控制台親自完成以下三組實驗:

  1. 端到端 RAG 知識庫搭建:
    • 建立一個 OpenSearch Serverless 的 Vector Collection。
    • 配置 Data Access Policy,將 Bedrock 專屬 IAM Role 加入授權。
    • 在 S3 上傳幾份 PDF 文件,於 Bedrock 建立 Knowledge Base,設定 Fixed Chunking 並完成一次 Sync。
    • 在控制台測試檢索問答(RetrieveAndGenerate)。
  2. Bedrock Guardrails 攔截測試:
    • 建立一組 Guardrail,配置 PII 去識別化(Masking SSN/Email)與自訂 Denied Topics。
    • 設定 Contextual Grounding 門檻為 0.8,在測試視窗輸入誘導性問題,觀察攔截與過濾效果。
  3. SageMaker Pipeline 與非同步端點:
    • 透過 Python SDK 體驗建立一個包含 Preprocessing、Training 與 RegisterModel 的三階段 Pipeline。
    • 觀察 Asynchronous Inference 端點在無請求時自動縮容至 0 節點的配置機制。

四、 考試常見題型避坑指南

  1. 「S3 文件更新了,為什麼 RAG 回答還是舊的?」
    • ❌ 錯誤選項:等待 15 分鐘讓 S3 自動同步。
    • ✅ 正確選項:透過調用 bedrock-agent:StartIngestionJob 發起 Knowledge Base 同步作業。
  2. 「如何防止內部員工在提問時將客戶身分證號碼送入模型,同時讓模型順利處理客服信件?」
    • ❌ 錯誤選項:在 Guardrail 中將 SSN 設為 Block(這會直接中斷服務)。
    • ✅ 正確選項:在 Guardrail 的 Sensitive Information Filters 中將 SSN 處理動作設為 Mask。
  3. 「推論請求量極低,偶爾有突發流量,且能容忍幾秒的冷啟動延遲,如何達到最高成本效益?」
    • ❌ 錯誤選項:配置單台 ml.t3.medium 的 Real-time Endpoint。
    • ✅ 正確選項:選用 SageMaker Serverless Inference。
  4. 「評估摘要任務(Text Summarization)的生成品質,應優先採用哪項自動化指標?」
    • ❌ 錯誤選項:BLEU(偏重機器翻譯精確匹配)或 RMSE(回歸問題)。
    • ✅ 正確選項:ROUGE(尤其是 ROUGE-1 / ROUGE-L)。

五、 衝刺學習資源推薦

  • 官方文件:
  • 備考建議進度:
    • 第 1 週:傳統 ML 基礎複習(特徵工程、常用演算法、SageMaker 四大推論端點)。
    • 第 2 週:GenAI / LLMOps 專項攻克(Bedrock、RAG、OpenSearch Serverless、Guardrails、評估指標)。
    • 第 3 週:安全與維運合規(IAM Policy、KMS、VPC Endpoints、Model Monitor)。
    • 第 4 週:模擬題衝刺(注重分析 85 題長題幹的時間分配,平均每題控制在 1.8 分鐘以內)。

评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注