10問中 0問が回答されています
質問:
You have already completed the テスト before. Hence you can not start it again.
問題を読み込んでいます…
無料レッスン・テストを受講するにはフリーコース(無料)に登録してください。
まず、次の操作を完了する必要があります:
正解数 0/問題数10
回答にかかった時間:
終了時間となりました
回答お疲れ様でした。
Earned Point(s): 0 of 0, (0)
0 Essay(s) Pending (Possible Point(s): 0)
【MLA-2001】ある企業の ML エンジニアは、オンプレミスから移行した Amazon FSx for NetApp ONTAP 上に数 TB の画像データを保持しています。この画像データを教師データとして、Amazon SageMaker のトレーニングジョブでモデルを構築する予定です。ファイルシステムと SageMaker のトレーニングインスタンスは同一の VPC 内に配置されています。データを別のストレージに複製せずにトレーニングを開始する必要があります。この要件を満たす方法を選択してください。
SageMaker の FileSystemInput がネイティブに受け付けるファイルシステムの種類は何と何でしょうか。その一覧に FSx for NetApp ONTAP が含まれているかを確認してみましょう。含まれない場合、同一 VPC にあるという前提を活かして、ONTAP が提供するプロトコルで直接読み込む方法が残らないか考えてみてください。また「別のストレージに複製せずに」という制約に注目してください。
【MLA-2002】ある製造業の企業の ML エンジニアは、画像分類モデルのトレーニングデータをオンプレミスのサーバーと AWS の Amazon EC2 インスタンスの両方から共有ストレージとして読み書きする必要があります。オンプレミスとの接続には AWS Direct Connect を使用しています。このストレージは NFSv4 プロトコルに対応し、複数のクライアントからの同時アクセス時にファイルロックが機能する必要があります。これらの要件を満たすソリューションを選択してください。
まず要件を分解してみましょう。求められているのは「NFSv4 プロトコル」「複数クライアントからの同時アクセス」「ファイルロック」の 3 点です。オブジェクトストレージやブロックストレージは、そもそもファイル共有プロトコルを話すのでしょうか。また SMB 対応のサービスは NFSv4 の要件を満たせるでしょうか。Direct Connect が用意されている点も、どのサービスならオンプレミスから直接マウントできるかを考えるヒントになります。
【MLA-2003】ある企業の ML エンジニアは、オンプレミスの NetApp ONTAP ストレージに蓄積された画像とメタデータを AWS 上のトレーニング環境に供給する必要があります。既存の ONTAP からスナップショットベースの増分レプリケーションを継続し、Linux トレーニングインスタンスからは NFS、Windows のアノテーションツールからは SMB で同一データに同時アクセスします。運用オーバーヘッドを最小限に抑えて、これらの要件を満たす方法を選択してください。
要件は三つあります。既存 ONTAP のスナップショットベース増分レプリケーションの継続、NFS と SMB による同一データへの同時アクセス、そして運用オーバーヘッドの最小化です。各選択肢のストレージが「どのプロトコルをネイティブに提供するか」をまず確認してみましょう。また、DataSync による差分転送とスナップショットベースのレプリケーションは同じ仕組みでしょうか。ONTAP 独自の複製機能をそのまま使えるサービスがあるかに注目してください。
【MLA-2004】ある企業の ML エンジニアは、工場の設備から送られるセンサーデータを Amazon Data Firehose で受け取り、Amazon S3 に配信しています。S3 に到着したデータは異常検知モデルの推論入力として即座に読み込まれます。現在は配信ストリームのバッファ間隔が 300 秒、バッファサイズが 5 MB に設定されており、データ発生から S3 への到着までに数分の遅延が生じています。ML エンジニアは、S3 への到着遅延を 1 秒未満に短縮しながら、取り込みスループットを維持する必要があります。この要件を満たす方法を選択してください。
Amazon Data Firehose の遅延は、何によって決まっているでしょうか。バッファサイズとバッファ間隔のうち、どちらかの条件が先に満たされた時点で配信される仕組みを思い出してください。1 秒未満という要件に対し、間隔を「下げる」のではなく「ゼロにする」設定が用意されていないか確認してみましょう。また、レイテンシーを詰めると 1 回あたりのレコード数が減りますが、送信側でどう補えるかにも注目してください。
【MLA-2005】ある企業の ML エンジニアは、工場の設備から送られてくるセンサーデータをリアルタイムに監視する仕組みを構築しています。データは毎秒数千件のレコードとして送信され、Amazon Kinesis Data Streams に取り込まれています。エンジニアは、この連続的な数値ストリームから異常値を検出し、検出結果を Amazon S3 に保存する必要があります。推論エンドポイントの管理やモデルの再学習作業は避けたいと考えています。これらの要件を満たす最も運用効率の高い方法を選択してください。
毎秒数千件の数値ストリームに対して、推論エンドポイントを立てずに異常検知を行う手段はないでしょうか。ストリーム処理エンジンの中に、異常スコア算出用の関数が組み込みで用意されていないか考えてみましょう。また「リアルタイムに監視」という要件に対して、数分間隔のバッチ処理が許容されるかにも注目してください。運用効率とは、管理すべきコンポーネントがいくつ減るかという観点でもあります。
【MLA-2006】あるオンラインゲーム企業の ML エンジニアは、プレイヤー行動の異常検知モデル向けにデータパイプラインを構築しています。数千台のゲームサーバーから毎分数 GB のイベントが連続的に発生します。ML エンジニアはこのイベントを取り込み、リアルタイムに集計と型変換を実施したうえで、推論時に低レイテンシーで参照できるキーバリューストアに書き込む必要があります。これらの要件を満たす構成を選択してください。
毎分数 GB のイベントに対して「リアルタイムに集計する」には、複数レコードをまたいで状態を保持するウィンドウ処理が必要です。レコード単位の変換やバッチ単位の関数実行で、時間窓の集計は表現できるでしょうか。
また推論時の参照先として求められているのは「キーバリューストア」です。分析用データウェアハウスやオブジェクトストレージが、その要件に合致するか確認してみましょう。
【MLA-2007】ある小売企業の ML エンジニアは、Web サイトのクリックイベントをリアルタイムに取り込むパイプラインを構築しています。イベントは毎秒数千件発生し、複数のコンシューマーアプリケーションが同じイベントを個別に読み取ります。取り込んだイベントは変換して Amazon S3 に蓄積し、データサイエンティストが標準 SQL でアドホックに集計できる必要があります。ストリーミング基盤の管理作業は最小限にとどめたいと考えています。これらの要件を満たすソリューションを選択してください。
要件のうち「複数のコンシューマーアプリケーションが同じイベントを個別に読み取る」という条件に注目してください。メッセージを読み取ると消える仕組みや、単一の配信先へ流し込むだけの仕組みでは、この要件を満たせるでしょうか。
一方で「管理作業は最小限」という条件もあります。ファンアウト読み取りが可能なサービスの中で、クラスター運用が不要なものはどれか、2つの条件を掛け合わせて考えてみましょう。
【MLA-2008】ある企業の ML エンジニアは、複数のアプリケーションから Amazon Kinesis Data Streams に送信されるクリックストリームイベントを取り込んでいます。イベントは JSON 形式で、後続の特徴量エンジニアリングのために Apache Parquet 形式に変換して Amazon S3 に保存する必要があります。データストリームの規模は時間帯によって大きく変動します。運用上のオーバーヘッドを最小限に抑えて、これらの要件を満たす方法を選択してください。
JSON から Parquet への列指向フォーマット変換は、コードを書かなければ実現できない処理でしょうか。マネージドな配信サービスに組み込み機能として用意されていないか確認してみましょう。
また「時間帯によって大きく変動する」という条件に対し、各選択肢が並列度や DPU、同時実行数といったパラメータの調整を必要としていないかに注目してください。設定だけで完結する選択肢はどれでしょうか。
【MLA-2009】ある企業の ML エンジニアは、Amazon S3 に保存された数億行のイベントログを対象に、Amazon SageMaker Canvas でノーコードの分類モデルを構築する予定です。ログはネストされた属性を多く含み、モデル構築では全カラムのうち一部のカラムのみを使用します。現在ログは gzip 圧縮されたテキスト形式で日次出力されています。データセットのインポートとモデル構築にかかる処理時間を最小限に抑える方法を選択してください。
数億行のうち「一部のカラムのみ」を使うという条件に注目してください。行単位で全項目が並ぶ形式と、カラム単位でまとめて格納される形式では、必要な列だけを読み出す際の I/O 量がどう変わるでしょうか。
また gzip 圧縮されたテキストファイルは分割して並列に読めるのか、ネストされた属性をそのまま表現できるのかも考えてみましょう。処理時間を左右するのは事後の除外設定か、それ以前のデータ形式かという視点が鍵になります。
【MLA-2010】ある小売企業のデータサイエンティストは、店舗の売上ログを CSV 形式で Amazon S3 に日次で蓄積しています。データサイエンティストは、モデルの特徴量候補を検討するため、蓄積済みの CSV を対象に集計や絞り込みの SQL クエリをアドホックに実行したいと考えています。クエリの実行頻度は不定期で、データを別のストアへコピーすることは避けたいと考えています。これらの要件を運用上のオーバーヘッドを最小限に抑えて満たすソリューションを選択してください。
要件には「データを別のストアへコピーすることは避けたい」という条件が明記されています。各選択肢がこの条件を満たすかどうかを最初に確認してみましょう。
また「実行頻度は不定期」という点にも注目してください。常時稼働するクラスターやインスタンスを抱える構成と、クエリを実行したときだけ課金される構成では、運用上のオーバーヘッドとコストがどう変わるでしょうか。
⚠️ こちらは教材の操作/UIなど全般に対するリクエストフォームではございません。
個別の問題についての改善リクエストです。
教材全般についての改善リクエストはお問い合わせフォームよりご連絡ください。
CloudTech(クラウドテック)は多くのユーザーの皆様から改善リクエストをご協力いただき運営できております。
あなたの視点での気づきは他の学習者の迷いを解決する手助けとなります。
運営側でもチェックをしておりますが限界があるため、誠に恐縮ではございますが細かい点でもご遠慮なくご指摘をお願いいたします。
※ 匿名での報告となり、内容は一般公開されません。
※ 技術的なご質問への回答を行うフォームではございませんのでご注意ください。
