Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) - Databricks-Certified-Data-Engineer-Professional日本語 模擬練習

以下の各構成は、各クラスターに合計 400 GB の RAM、合計 160 個のコアがあり、VM ごとに 1 つの Executor のみがあるという点では同一です。
完了を保証する必要のある非常に長時間実行されるジョブがある場合、1 つ以上の VM 障害を考慮して、どのクラスター構成でジョブの完了を保証できますか。

正解: B
ストレージとコンピューティングのコストを削減するために、データ エンジニアリング チームには、ビジネス インテリジェンス ダッシュボード、顧客向けアプリケーション、本番環境の機械学習モデル、アドホック分析クエリによって活用される一連の集計テーブルをキュレートする任務が与えられています。
データエンジニアリングチームは、顧客向けアプリケーションからの新たな要件を認識しました。これは、彼らが完全に管理する唯一のダウンストリームワークロードです。その結果、組織全体の多数のチームが使用する集計テーブルで、いくつかのフィールドの名前を変更する必要があり、さらにフィールドも追加する必要があります。
管理する必要があるテーブルの数を増やすことなく、組織内の他のチームへの影響を最小限に抑えながら状況に対処できるソリューションはどれですか?

正解: A
解説: (PassTest メンバーにのみ表示されます)
データエンジニアはDelta LaleテーブルにLiquid Clusteringを実装しており、それがデータ管理操作にどのような影響を与えるかを理解する必要があります。テーブルは新しいデータで頻繁に更新されます。
このテーブルは外部テーブルであり、Unity Catalog では管理されていません。Delta Lake の Liquid Clustering は、最初のテーブル作成後に挿入された新しいデータをどのように処理しますか?

正解: C
解説: (PassTest メンバーにのみ表示されます)
データ エンジニアリング チームは次のコードを管理しています。

このコードが論理的に正しい結果を生成し、ソース テーブル内のデータが重複排除され検証されていると仮定すると、このコードを実行すると何が起こるかを説明するステートメントはどれですか。

正解: B
解説: (PassTest メンバーにのみ表示されます)
チームのジュニア データ エンジニアが次のコード ブロックを実装しました。

new_eventsビューには、events Deltaテーブルと同じスキーマを持つレコードのバッチが含まれています。event_idフィールドは、このテーブルの一意のキーとして機能します。
このクエリを実行すると、既存のレコードと同じ event_id を持つ新しいレコードはどうなるでしょうか?

正解: E
解説: (PassTest メンバーにのみ表示されます)
Predictive Optimization は、Unity Catalog Managed テーブルに対してデフォルトで有効になっている自動化された Databricks サービスです。Delta テーブルを継続的に最適化することで、最適なパフォーマンスとコストを確保し、維持管理を支援します。Predictive Optimization は、Delta テーブルを維持するためにどの 2 つの操作を実行しますか?(2 つ選択してください。)

正解: B,C
解説: (PassTest メンバーにのみ表示されます)
データ エンジニアは、既存の本番環境の Databricks ジョブをアセット バンドル管理下に置き、次のことを確認したいと考えています。
- ジョブの現在の設定はYAMLとしてキャプチャされ、
参照されるファイルはバンドル プロジェクトに含まれます。
- バンドルのYAMLの今後の変更により、既存のジョブが更新されます。
配置(新しいジョブを作成しない)
データ エンジニアは、アセット バンドル管理下で本番ジョブを正常に移行するにはどうすればよいですか?

正解: A
解説: (PassTest メンバーにのみ表示されます)
データ エンジニアは、きめ細かな権限を持つジョブをデプロイするために Databricks アセット バンドルを構成しています。
要件は次のとおりです。
- データ エンジニア グループにジョブへの CAN_MANAGE アクセスを許可します。
- 監査人グループがジョブを表示できるが、変更/実行できないことを確認します。
- 他のユーザー/グループに意図しない権限を付与しないようにしてください。
データ エンジニアは、要件を満たしながらジョブをどのように展開する必要がありますか?

正解: A
解説: (PassTest メンバーにのみ表示されます)
データエンジニアは、ワークスペース内の既存のパイプライン設定をキャプチャし、それを使用してJSONファイルを作成し、バージョン管理して新しいパイプラインを作成する必要があります。データエンジニアは、Databricks CLIで構成されたWebターミナルにどのコマンドを入力すればよいでしょうか?

正解: D
解説: (PassTest メンバーにのみ表示されます)
データエンジニアリングチームには、3つのデータソースからのデータ取り込みジョブに時間のかかる作業があります。各ノートブックで新しいデータを読み込むのに約1時間かかります。ある日、ノートブックの更新によって新しい必須構成パラメータが導入されたため、ジョブが失敗しました。チームは迅速に問題を解決し、失敗したソースから最新のデータを読み込む必要があります。チームはどのような対応を取るべきでしょうか?

正解: A
解説: (PassTest メンバーにのみ表示されます)
データエンジニアは、display(df.collect()) から結果を出力する前に、多数の変換を含むインタラクティブノートブックで作業しています。ノートブックには、ワイド変換とクロス結合が含まれています。
データ エンジニアが次のエラーを受け取りました: 「Spark ドライバーが予期せず停止したため、再起動しています。ノートブックは自動的に再接続されます。」データ エンジニアはどのようなアクションを実行する必要がありますか?

正解: C
解説: (PassTest メンバーにのみ表示されます)
データ エンジニアリング チームは、Databricks Lakehouse Monitoring を使用して、Delta テーブル内の重要な列の percent_null メトリックを追跡します。
プロファイル メトリック テーブル (prod_catalog.prod_schema.customer_data_profile_metrics) には、1 時間ごとの percent_null 値が格納されます。
チームの目標:
percent_nullの1日平均が5%を超えるとアラートを発動します。
3日連続。
問題が継続している間は通知がスパムにならないようにします。

正解: A
解説: (PassTest メンバーにのみ表示されます)
データ取り込みタスクでは、1TBのJSONデータセットを、ターゲット部分ファイルサイズ512MBでParquetに書き出す必要があります。Delta LakeではなくParquetを使用しているため、自動最適化や自動圧縮などの組み込みファイルサイズ調整機能は使用できません。
データをシャッフルせずに最高のパフォーマンスを実現する戦略はどれですか?

正解: B
解説: (PassTest メンバーにのみ表示されます)
セキュリティチームは、顧客の個人情報(PII)データを含む顧客テーブルのデータ保護を強化したいと考えています。現地のポリシーに準拠するため、営業チームのメンバーは自分の地域の顧客のみを閲覧できるようにし、管理者以外のユーザーのメールアドレスはマスクする必要があります。Unity Catalogの行フィルターと列マスクを使用する場合、どのような実装方法を採用すべきでしょうか?

正解: B
解説: (PassTest メンバーにのみ表示されます)