
2026年最新ののGoogle Professional-Data-Engineer日本語問題集PDFProfessional-Data-Engineer日本語最速合格したいならここ
Professional-Data-Engineer日本語練習試験問題集で99%合格率Google試験合格させます
質問 # 138
ニューラルネットワークモデルのトレーニングには数日かかります。トレーニング速度を上げたい。あなたは何ができますか?
- A. テストデータセットをサブサンプリングします。
- B. トレーニングデータセットをサブサンプリングします。
- C. ニューラルネットワークのレイヤー数を増やします。
- D. モデルへの入力フィーチャの数を増やします。
正解:C
解説:
Reference: https://towardsdatascience.com/how-to-increase-the-accuracy-of-a-neural-network-9f5d1c6f407d
質問 # 139
デフォルトでは、Dataflowが無制限のデータセットに適用するウィンドウ動作は次のうちどれですか?
- A. 単一のグローバルウィンドウ
- B. 1分ごとのウィンドウ
- C. 100MBのデータごとのWindows
- D. 10分ごとのウィンドウ
正解:A
解説:
Dataflow's default windowing behavior is to assign all elements of a PCollection to a single, global window, even for unbounded PCollections
質問 # 140
MJTelcoケーススタディ
会社概要
MJTelcoは、世界中の急速に成長し、サービスの行き届いていない市場でネットワークを構築することを計画している新興企業です。
同社は革新的な光通信ハードウェアの特許を取得しています。これらの特許に基づいて、安価なハードウェアで多くの信頼性の高い高速バックボーンリンクを作成できます。
会社背景
経験豊富な通信幹部によって設立されたMJTelcoは、宇宙での通信の課題を克服するために元々開発されたテクノロジーを使用しています。運用の基本として、リアルタイム分析を推進し、機械学習を組み込んでトポロジを継続的に最適化する分散データインフラストラクチャを作成する必要があります。彼らのハードウェアは安価であるため、ネットワークを過剰に展開して、動的な地域政治が場所の可用性とコストに与える影響を考慮できるようにすることを計画しています。
彼らの管理および運用チームは世界中に配置されており、データコンシューマー間で多対多の関係を構築し、システムで提供しています。慎重に検討した結果、彼らはパブリッククラウドが彼らのニーズをサポートするのに最適な環境であると判断しました。
ソリューションコンセプト
MJTelcoは、ラボで成功した概念実証(PoC)プロジェクトを実行しています。彼らには2つの主要なニーズがあります:
* PoCをスケーリングおよび強化して、50,000を超えるインストールに増加したときに生成される大幅に多くのデータフローをサポートします。
*機械学習サイクルを改善して、トポロジ定義の制御に使用する動的モデルを検証および改善します。
MJTelcoは、開発/テスト、ステージング、本番の3つの個別の動作環境も使用して、実験の実行、新機能の展開、本番の顧客へのサービス提供のニーズに対応します。
ビジネス要件
*最小限のコストで本番環境をスケールアップし、予測不可能な分散型通信ユーザーコミュニティで必要なときに必要な場所でリソースをインスタンス化します。
*独自のデータのセキュリティを確保して、最先端の機械学習と分析を保護します。
*分散した研究者からの分析のためのデータへの信頼できるタイムリーなアクセスを提供します
*顧客に影響を与えることなく、機械学習モデルの迅速な反復をサポートする分離された環境を維持します。
技術要件
テレメトリデータの安全で効率的な転送と保存を保証します
インスタンスを迅速にスケーリングして、それぞれ複数のフローを持つ10,000〜100,000のデータプロバイダーをサポートします。
約1億レコード/日を保存する最大2年間のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします。テレメトリフローと本番学習サイクルの両方でのデータパイプラインの問題の認識に焦点を当てた監視インフラストラクチャの迅速な反復をサポートします。
CEOの声明
私たちのビジネスモデルは、特許、分析、動的な機械学習に依存しています。当社の安価なハードウェアは信頼性が高くなるように構成されているため、コスト面で有利です。信頼性と容量のコミットメントを満たすには、大規模な分散データパイプラインを迅速に安定させる必要があります。
CTOステートメント
当社のパブリッククラウドサービスは、宣伝どおりに動作する必要があります。データを拡張して安全に保つリソースが必要です。
また、データサイエンティストがモデルを注意深く研究し、迅速に適応できる環境も必要です。
データの処理は自動化に依存しているため、反復しながら機能する開発環境とテスト環境も必要です。
CFOステートメント
プロジェクトが大きすぎて、データと分析に必要なハードウェアとソフトウェアを維持できません。また、運用チームにこれほど多くのデータフィードを監視する余裕がないため、自動化とインフラストラクチャに依存します。 Google Cloudの機械学習により、定量的研究者は、データパイプラインの問題ではなく、価値の高い問題に取り組むことができます。
これで、MJTelcoのGoogle Cloud Dataflowパイプラインは、50,000のインストールからデータの受信を開始する準備が整いました。
CloudDataflowが必要に応じて計算能力をスケールアップできるようにする必要があります。どのCloudDataflowパイプライン構成設定を更新する必要がありますか?
- A. 労働者の数
- B. ゾーン
- C. 労働者の最大数
- D. ワーカーあたりのディスクサイズ
正解:B
質問 # 141
次のジョブタイプのどれがCloudDataprocでサポートされていますか(3つの回答を選択してください)?
- A. ハイブ
- B. YARN
- C. スパーク
- D. 豚
正解:A、C、D
解説:
Explanation
Cloud Dataproc provides out-of-the box and end-to-end support for many of the most popular job types, including Spark, Spark SQL, PySpark, MapReduce, Hive, and Pig jobs.
Reference: https://cloud.google.com/dataproc/docs/resources/faq#what_type_of_jobs_can_i_run
質問 # 142
あなたの会社は最近急速に成長し、以前よりも大幅に高い割合でデータを取り込むようになりました。 ApacheHadoopで毎日のバッチMapReduce分析ジョブを管理します。ただし、最近のデータの増加は、バッチジョブが遅れていることを意味しています。開発チームがコストを増やすことなく分析の応答性を高める方法を推奨するように求められました。あなたは彼らに何を勧めるべきですか?
- A. Hadoopクラスターのサイズを増やします。
- B. ApacheSparkでジョブを書き直します。
- C. Hadoopクラスターのサイズを小さくしますが、Hiveでジョブを書き直します。
- D. Pigでジョブを書き直します。
正解:D
質問 # 143
Google アナリティクスから BigQuery に毎日何テラバイトもの顧客行動データがストリーミングされており、顧客の好みなどの情報は Cloud SQL for MySQL データベースでホストされています。CRM データベースは Cloud SQL for PostgreSQL インスタンスでホストされています。マーケティング チームは、2 つのデータベースからの顧客情報と顧客行動データを使用して、年間アクティブ顧客向けのマーケティング キャンペーンを作成したいと考えています。マーケティング チームが通常の日には 1 日 100 回以上、セール期間中は最大 300 回キャンペーンを実行できるようにする必要があります。同時に、Cloud SQL データベースの負荷を最小限に抑える必要があります。どうすればよいでしょうか。
- A. 両方の Cloud SQL データベースへの BigQuery 接続を作成します。2 つのデータベースに対する BigQuery 連携クエリと BigQuery 上の Google アナリティクス データを使用して、これらのクエリを実行します。
- B. これらのクエリに必要なテーブルを両方の Cloud SQL データベースから BigQuery に複製するために、Datastream にストリームを作成します。
- C. Trino を使用して Dataproc クラスタを作成し、Cloud SQL データベースと BigQuery の両方への接続を確立してクエリを実行します。
- D. Dataproc Serverless を使用して Apache Spark にジョブを作成し、これらのクエリに対して Cloud SQL データベースと BigQuery 上の Google アナリティクス データの両方をクエリします。
正解:B
解説:
Datastream は、Oracle および MySQL データベースから BigQuery、Cloud Storage、Cloud SQL、Pub/Sub などの Google Cloud サービスにデータ変更をストリーミングできるサーバーレスの変更データ キャプチャ(CDC)およびレプリケーション サービスです。Datastream は、ソース データベースのパフォーマンスへの影響を最小限に抑えながら、データベースの変更をリアルタイムでキャプチャして配信します。また、Datastream はソース データベースのスキーマとデータ型を保持し、BigQuery 内の対応するテーブルを自動的に作成して更新します。
Datastream を使用すると、両方の Cloud SQL データベースから必要なテーブルを BigQuery に複製し、ソース データベースとの同期を維持できます。こうすることで、マーケティング チームが Cloud SQL テーブルではなく BigQuery テーブルでクエリを実行できるため、Cloud SQL データベースの負荷を軽減できます。また、BigQuery のスケーラビリティとパフォーマンスを活用して、Google アナリティクスの顧客行動データと複製されたテーブルからの顧客情報をクエリすることもできます。Cloud SQL データベースへの影響を気にすることなく、必要な頻度でクエリを実行できます。
オプション A は適切なソリューションではありません。BigQuery フェデレーション クエリを使用すると、Cloud SQL データベースなどの外部データ ソースをクエリできますが、ソース データベースの負荷は軽減されません。実際、フェデレーション クエリでは、外部データ ソースに対してクエリ ステートメントを実行し、その結果を BigQuery に返す必要があるため、ソース データベースの負荷が増加する可能性があります。フェデレーション クエリには、データ型のマッピング、割り当て、パフォーマンスの問題など、いくつかの制限もあります。
オプション C は適切なソリューションではありません。Trino を使用して Dataproc クラスタを作成すると、Datastream を使用する場合よりも多くのリソースと管理オーバーヘッドが必要になるためです。Trino は、Cloud SQL や BigQuery などの複数のデータソースに接続し、それらに対してクエリを実行できる分散 SQL クエリ エンジンです。ただし、Trino を実行するには Dataproc クラスタが必要なため、クラスタ ノードをプロビジョニング、構成、監視する必要があります。また、Cloud SQL および BigQuery 用の Trino コネクタをインストールして構成し、クエリを Trino SQL 方言で記述する必要もあります。さらに、Trino は Cloud SQL から BigQuery にデータを複製または同期しないため、Cloud SQL データベースの負荷は依然として高くなります。
オプション D は適切なソリューションではありません。Dataproc Serverless を使用して Apache Spark でジョブを作成するには、Datastream を使用する場合よりも多くのコーディングと処理能力が必要になるためです。Apache Spark は、Cloud SQL や BigQuery などのさまざまなソースからデータを読み書きし、それらに対して複雑な変換と分析を実行できる分散データ処理フレームワークです。Dataproc Serverless は、クラスタを管理せずに Spark ジョブを実行できるサーバーレス Spark サービスです。ただし、Spark では、Python、Scala、Java、または R でコードを記述し、Cloud SQL および BigQuery 用の Spark コネクタを使用してデータソースにアクセスする必要があります。また、Spark は Cloud SQL から BigQuery にデータを複製または同期しないため、Cloud SQL データベースの負荷は依然として高くなります。参照: Datastream の概要 | Datastream | Google Cloud、Datastream のコンセプト | Datastream | Google Cloud、Datastream のクイックスタート | Datastream | Google Cloud、連携クエリの概要 | BigQuery | Google Cloud、Trino の概要 | Dataproc のドキュメント | Google Cloud、Dataproc Serverless の概要 | Dataproc のドキュメント | Google クラウド。
質問 # 144
Cloud Machine Learning Engineを使用して自分のコンピューターでTensorFlowトレーニングジョブを実行するには、コマンドは何から始まりますか?
- A. gcloudml-engineジョブがローカルでトレーニングを送信
- B. Cloud MLEngineを使用して自分のコンピューターでTensorFlowプログラムを実行することはできません。
- C. gcloudml-engineローカルトレイン
- D. gcloudml-engineジョブがトレーニングを送信
正解:C
解説:
gcloud ml-engine local train - run a Cloud ML Engine training job locally This command runs the specified module in an environment similar to that of a live Cloud ML Engine Training Job.
This is especially useful in the case of testing distributed models, as it allows you to validate that you are properly interacting with the Cloud ML Engine cluster configuration.
Reference: https://cloud.google.com/sdk/gcloud/reference/ml-engine/local/train
質問 # 145
Cloud Bigtableは、非常に大量のデータを保存するための推奨オプションです。
____________________________?
- A. レイテンシが非常に短いマルチキーデータ
- B. レイテンシが非常に高いマルチキーデータ
- C. レイテンシが非常に高いシングルキーデータ
- D. レイテンシが非常に低いシングルキーデータ
正解:D
解説:
Cloud Bigtable is a sparsely populated table that can scale to billions of rows and thousands of columns, allowing you to store terabytes or even petabytes of data. A single value in each row is indexed; this value is known as the row key. Cloud Bigtable is ideal for storing very large amounts of single-keyed data with very low latency. It supports high read and write throughput at low latency, and it is an ideal data source for MapReduce operations.
質問 # 146
自然言語処理ドメインで回帰問題に取り組んでおり、データセットに1億個のラベル付きの例があります。データをランダムにシャッフルし、データセットをトレーニングサンプルとテストサンプルに分割しました(90/10の比率)。ニューラルネットワークをトレーニングし、テストセットでモデルを評価した後、モデルの二乗平均平方根誤差(RMSE)が、テストセットの2倍のトレインセットで高いことがわかります。モデルのパフォーマンスをどのように改善する必要がありますか?
- A. トレインテスト分割でのテストサンプルのシェアを増やします。
- B. 過剰適合を回避するために、正則化手法(バッチ正規化のドロップアウトなど)を試してください。
- C. より多くのデータを収集し、データセットのサイズを増やしてみてください。
- D. たとえば、追加のレイヤーを導入したり、使用する語彙やn-gramのサイズを大きくしたりして、モデルの複雑さを増します。
正解:D
質問 # 147
BigQueryデータウェアハウスのメインインベントリテーブルを読み取るほぼリアルタイムのインベントリダッシュボードを作成する必要があります。過去の在庫データは、アイテムおよび場所ごとの在庫残高として保存されます。 1時間ごとに数千の在庫更新があります。ダッシュボードのパフォーマンスを最大化し、データが正確であることを確認する必要があります。あなたは何をするべきか?
- A. BigQueryバルクローダーを使用して、在庫の変更を毎日の在庫移動テーブルにバッチロードします。
履歴在庫残高テーブルに結合するビューで残高を計算します。在庫バランステーブルを毎晩更新します。 - B. BigQuery UPDATEステートメントを活用して、変化する在庫残高を更新します。
- C. ストリームの変更を毎日の在庫移動テーブルにストリーミングするBigQueryを使用します。履歴在庫残高テーブルに結合するビューで残高を計算します。在庫バランステーブルを毎晩更新します。
- D. 在庫バランステーブルをアイテムごとに分割して、在庫の更新ごとにスキャンされるデータの量を減らします。
正解:B
質問 # 148
運用環境に Standard Tier Memorystore for Redis インスタンスをデプロイしています。最も正確な災害復旧状況で Redis インスタンスのフェイルオーバーをシミュレートし、フェイルオーバーが運用データに影響を与えないことを確認する必要があります。どうすればよいでしょうか。
- A. 実稼働環境の Memorystore for Redis インスタンスに対して、データ損失が制限されたデータ保護モードを使用して手動のテーラーオーバーを開始します。
- B. 実稼働環境の Redis インスタンスにレプリカを 1 つ増やします。force-data-loss データ保護モードを使用して手動フェイルオーバーを開始します。
- C. 開発環境で Standard Tier Memorystore for Redis インスタンスを作成します。force-data-loss データ保護モードを使用して手動フェイルオーバーを開始します。
- D. 開発環境で Standard Tier Memorystore for Redis インスタンスを作成します。データ損失が制限されたデータ保護モードを使用して手動フェイルオーバーを開始します。
正解:D
解説:
To simulate a Redis instance failover in a production-like environment without impacting production data, the best approach is to use a development environment. Here's why option D is the best choice:
Standard Tier Memorystore for Redis:
The Standard Tier provides high availability and automatic failover capabilities. It's suitable for testing failover scenarios in a controlled environment.
Development Environment:
Using a development environment ensures that any potential data loss or impact from the failover simulation does not affect production data, maintaining the integrity and availability of the production system.
Limited-Data-Loss Mode:
The limited-data-loss mode for manual failover ensures that data loss is minimized during the failover process, making it a realistic simulation of a production failover scenario.
Steps to Implement:
Create a Development Environment:
Set up a development environment with a Standard Tier Memorystore for Redis instance that mirrors the configuration of your production instance.
Initiate Manual Failover:
Initiate a manual failover using the limited-data-loss data protection mode to simulate a failover scenario:
gcloud redis instances failover INSTANCE_ID --data-protection-mode=limited-data-loss Verify Failover:
Monitor and verify the failover process to ensure it behaves as expected, simulating the disaster recovery scenario accurately.
Reference:
Memorystore for Redis Documentation
Manual Failover in Memorystore
質問 # 149
ソーシャルメディアの投稿をGoogleBigQueryに保存し、ほぼリアルタイムで1分あたり10,000メッセージの割合で分析する必要があります。最初に、個々の投稿にストリーミング挿入を使用するようにアプリケーションを設計します。アプリケーションは、ストリーミング挿入の直後にデータ集約も実行します。ストリーミング挿入後のクエリは強い一貫性を示さず、クエリからのレポートは処理中のデータを見逃す可能性があることがわかりました。アプリケーションの設計をどのように調整できますか?
- A. 元のメッセージをGoogle Cloud SQLに読み込み、ストリーミング挿入を介して1時間ごとにテーブルをBigQueryにエクスポートします。
- B. 蓄積されたデータを2分ごとにロードするようにアプリケーションを書き直します。
- C. ストリーミング挿入コードを個々のメッセージのバッチロードに変換します。
- D. ストリーミング挿入後のデータ可用性の平均レイテンシを見積もり、2倍の時間待機した後に常にクエリを実行します。
正解:D
解説:
The data is first comes to buffer and then written to Storage. If we are running queries in buffer we will face above mentioned issues. If we wait for the bigquery to write the data to storage then we won't face the issue.
So We need to wait till it's written tio storage
質問 # 150
これらの主要なツールが使用されており、データ形式はOptimized Row Columnar(ORC)です。すべてのORCファイルがCloudStorageバケットに正常にコピーされました。パフォーマンスを最大化するには、一部のデータをクラスターのローカルHadoop分散ファイルシステム(HDFS)に複製する必要があります。Cloud DataprocでHiveの使用を開始する2つの方法は何ですか?(2つ選択してください。)
- A. gsutilユーティリティを実行して、すべてのORCファイルをCloudStorageバケットからDataprocクラスターのマスターノードに転送します。次に、Hadoopユーティリティを実行して、HDFSを実行してそれらをコピーします。HDFSからHiveテーブルをマウントします。
- B. gsutilユーティリティを実行して、すべてのORCファイルをCloudStorageバケットからHDFSに転送します。Hiveテーブルをローカルにマウントします。
- C. ORCファイルをBigQueryに読み込みます。Hadoop用のBigQueryコネクタを利用して、BigQueryテーブルを外部Hiveテーブルとしてマウントします。外部Hiveテーブルをネイティブテーブルに複製します。
- D. gsutilユーティリティを実行して、すべてのORCファイルをCloudStorageバケットからDataprocクラスターの任意のノードに転送します。Hiveテーブルをローカルにマウントします。
- E. Hadoop用のCloud Storageコネクターを利用して、ORCファイルを外部Hiveテーブルとしてマウントします。外部Hiveテーブルをネイティブテーブルに複製します。
正解:A、D
質問 # 151
Cloud Storage から BigQuery に CSV ファイルをロードしています。ファイルには、同じ列に STRINGS と INT64 などのデータ型の不一致や、電話番号や住所などの値のフォーマットの一貫性の欠如など、既知のデータ品質の問題があります。データ品質を維持し、必要なクレンジングと変換を実行するには、データ パイプラインを作成する必要があります。どうすればよいですか。
- A. データを BigQuery にロードする前に、Data Fusion を使用して CSV ファイルを AVRO などの自己記述型データ形式に変換します。
- B. 必要なスキーマを持つテーブルを作成し、CSV ファイルをテーブルに追加し、SQL を使用してその場で変換を実行します。
- C. CSV ファイルを目的のスキーマを持つステージング テーブルにロードし、SQL を使用して変換を実行します。その後、結果を最終的な宛先テーブルに書き込みます。
- D. BigQuery に読み込む前に、Data Fusion を使用してデータを変換します。
正解:D
解説:
Data Fusion の利点:
ビジュアル インターフェイス: 大規模なコーディングなしでデータ パイプラインを設計するためのユーザー フレンドリなインターフェイスを提供し、より幅広いユーザーがアクセスできるようにします。
組み込み変換: 次のような一般的なデータ品質の問題を処理するための、事前に構築されたさまざまな変換が含まれています。
データ型変換
データ クレンジング (無効な文字の削除、書式の修正など)、データ検証 (欠損値のチェック、制約の適用など)、データ強化 (派生フィールドの追加、他のデータセットとの結合など)、カスタム変換: より複雑なクリーニング タスクに対して、SQL または Java コードを使用したカスタム変換を可能にします。
スケーラビリティ: 大規模なデータセットを効率的に処理できるため、データ品質の問題がある可能性のある CSV ファイルの処理に適しています。
BigQuery との統合: BigQuery とシームレスに統合し、変換されたデータを直接読み込むことができます。
質問 # 152
数百万のモノのインターネット (IoT) デバイスから送信されるテレメトリ データを処理するために、NoSQL データベースを選択しています。データ量は年間 100 TB 増加しており、各データ エントリには約 100 個の属性があります。データ処理パイプラインには、原子性、一貫性、独立性、耐久性 (ACID) は必要ありません。ただし、高可用性と低レイテンシが必要です。
個々のフィールドに対してクエリを実行してデータを分析する必要があります。要件を満たすデータベースはどれですか? (3 つ選択してください。)
- A. カサンドラ
- B. MySQL
- C. Hive を使用した HDFS
- D. レディス
- E. HBase
- F. モンゴDB
正解:C、E、F
解説:
Explanation:
質問 # 153
日付ごとにパーティション化された数百万行の販売データを含むテーブルがあるとします。さまざまなアプリケーションやユーザーがこのデータを 1 分間に何度もクエリします。クエリでは、avg を使用して値を集計する必要があります。最大。と合計を計算し、他のテーブルに結合する必要はありません。必要な集計は過去 1 年間のデータに対してのみ計算されますが、ベース テーブルに完全な履歴データを保持する必要があります。計算コストやメンテナンスのオーバーヘッドを削減しながら、クエリ結果には常にテーブルの最新データが含まれるようにしたいと考えています。 、および期間。あなたは何をするべきか?
- A. パーティションの最後の年を指定するフィルター句を含む、ベース テーブル データを集計する新しいテーブルを作成します。スケジュールされたクエリを設定して、1 時間ごとに新しいテーブルを再作成します。
- B. ベース テーブル データを集計するためのビューを作成します。パーティションの最後の年を指定するフィルター句を含めます。
- C. 過去 1 年間のパーティションを指定するフィルター句を含む実体化ビュー (実体化ビュー) を作成してベース テーブル データを集計します。
- D. マテリアライズド ビューを作成してベース テーブル データを集約します。ベース テーブルにパーティションの有効期限を構成して、過去 1 年間のパーティションのみを保持します。
正解:A
解説:
A materialized view is a database object that contains the results of a query, which can be updated periodically. It can improve the performance and efficiency of queries that involve aggregations, joins, or filters. By creating a materialized view to aggregate the base table data and include a filter clause to specify the last one year of partitions, you can ensure that the query results always include the latest data from the tables, while also reducing computation cost, maintenance overhead, and duration. The materialized view will automatically refresh when the base table data changes, and will only use the partitions that match the filter clause. Option A is incorrect because it will delete the historical data from the base table, which is not desired. Option C is incorrect because it will create a redundant table that needs to be updated manually by a scheduled query, which is more complex and costly than using a materialized view. Option D is incorrect because a view does not store any data, but only references the base table data, which means it will not reduce the computation cost or duration of the query. Reference:
Materialized views, ML models in data warehouse - Google Cloud
Data Engineering with Google Cloud Platform - Packt Subscription
質問 # 154
あなたは大規模な e コマース企業で働いています。顧客の注文データを Bigtable に保存しています。ガベージ コレクション ポリシーは 30 日後にデータを削除するように設定されており、バージョン数は 1 に設定されています。データ アナリストが顧客の合計支出を報告するクエリを実行すると、アナリストは 30 日以上前の顧客データを見ることがあります。コストとオーバーヘッドを最小限に抑えながら、アナリストが 30 日以上前の顧客データを見ないようにする必要があります。どうすればよいでしょうか。
- A. テーブル内のデータをスキャンし、30 日以上経過したデータを削除するジョブを毎日スケジュールします。
- B. クエリでタイムスタンプ範囲フィルターを使用して、特定の範囲の顧客データを取得します。
- C. 列ファミリーの有効期限を 30 日に設定し、バージョン数を 2 に設定します。
- D. 列ファミリーの有効期限を 29 日に設定し、バージョン数を 1 のままにします。
正解:B
解説:
By using a timestamp range filter in the query, you can ensure that the analysts only see the customer data that is withinthe desired time range, regardless of the garbage collection policy1. This option is the most cost- effective and simple way to avoid fetching data that is marked for deletion by garbage collection, as it does not require changing the existing policy or creating additional jobs. You can use the Bigtable client libraries or the cbt CLI to apply atimestamp range filter to your read requests2.
Option A is not effective, as it increases the number of versions to 2, which may cause more data to be retained and increase the storage costs. Option C is not reliable, as it reduces the expiring values to 29 days, which may not match the actual data arrival and usage patterns. Option D is not efficient, as it requires scheduling a job daily to scan and delete the data, which may incur additional overhead and complexity. Moreover, none of these options guarantee that the data older than 30 days will be immediately deleted, as garbage collection isan asynchronous process that can take up to a week to remove the data3. References:
* 1: Filters | Cloud Bigtable Documentation | Google Cloud
* 2: Read data | Cloud Bigtable Documentation | Google Cloud
* 3: Garbage collection overview | Cloud Bigtable Documentation | Google Cloud
質問 # 155
「customers」という名前の BigQuery データセットがあります。すべてのテーブルは、「gdpr」という名前のデータ カタログ タグ テンプレートを使用してタグ付けされます。テンプレートには、ブール値を持つ「機密データあり」という必須フィールドが 1 つ含まれています。すべての従業員は、データセット内で「機密データあり」フィールドが true または false であるテーブルを簡単な検索で見つけられる必要があります。ただし、「機密データあり」フィールドが true であるテーブル内のデータは、人事 (HR) グループのみが表示できるようにする必要があります。すべての従業員グループに、データセットの bigquery.metadataViewer ロールと bigquery.connectionUser ロールを付与します。構成のオーバーヘッドを最小限に抑える必要があります。次に何をすべきでしょうか。
- A. プライベート可視性を持つ「gdpr」タグ テンプレートを作成します。機密データを含むテーブルの HR グループに bigquery -dataViewer ロールを割り当てます。
- B. 公開可能な「gdpr」タグ テンプレートを作成します。機密データを含むテーブルの HR グループに bigquery.dataViewer ロールを割り当てます。
- C. 公開可能な「gdpr」タグ テンプレートを作成します。このタグの datacatalog. tagTemplateViewer ロールを全従業員グループに割り当て、機密データを含むテーブルの HR グループに bijquery.dataViewer ロールを割り当てます。
- D. プライベート可視性を持つ「~gdpr」タグ テンプレートを作成します。このタグの datacatalog.tagTemplateViewer ロールをすべての従業員グループに割り当て、機密データを含むテーブルの HR グループに bigquery.dataViewer ロールを割り当てます。
正解:C
解説:
To ensure that all employees can search and find tables with GDPR tags while restricting data access to sensitive tables only to the HR group, follow these steps:
* Data Catalog Tag Template:
* Use Data Catalog to create a tag template named "gdpr" with a boolean field "has sensitive data".
Set the visibility to public so all employees can see the tags.
* Roles and Permissions:
* Assign the datacatalog.tagTemplateViewer role to the all employees group. This role allows users to view the tags and search for tables based on the "has sensitive data" field.
* Assign the bigquery.dataViewer role to the HR group specifically on tables that contain sensitive data. This ensures only HR can access the actual data in these tables.
Steps to Implement:
* Create the GDPR Tag Template:
* Define the tag template in Data Catalog with the necessary fields and set visibility to public.
* Assign Roles:
* Grant the datacatalog.tagTemplateViewer role to the all employees group for visibility into the tags.
* Grant the bigquery.dataViewer role to the HR group on tables marked as having sensitive data.
Reference Links:
* Data Catalog Documentation
* Managing Access Control in BigQuery
* IAM Roles in Data Catalog
質問 # 156
あなたは、ハンドヘルド スキャナーを使用して配送ラベルを読み取る配送会社で働いています。会社には厳格なデータ プライバシー標準があり、スキャナーは受信者の個人情報 (PII) のみを分析システムに送信することを求めていますが、これはユーザーのプライバシー ルールに違反しています。クラウド ネイティブのマネージド サービスを使用してスケーラブルなソリューションを迅速に構築し、PII が分析システムに公開されるのを防ぎたいと考えています。どうすればよいですか?
- A. トピックを読み取り、Cloud Data Loss Prevention API を呼び出す Cloud Functions を構築します。タグ付けと信頼レベルを使用して、バケット内のデータをレビュー用に渡すか、隔離します。
- B. Stackdriver ロギングを使用して、パイプライン全体を通過したデータを分析し、機密情報が含まれている可能性のあるトランザクションを識別します。
- C. Compute Engine 仮想マシンにサードパーティのデータ検証ツールをインストールして、受信データに機密情報が含まれているかどうかを確認します。
- D. BigQuery で承認済みビューを作成し、機密データを含むテーブルへのアクセスを制限します。
正解:A
質問 # 157
あるオンライン証券会社では、大量の取引を処理するアーキテクチャが必要です。ジョブをトリガーする安全なキューイング システムを作成する必要があります。ジョブは Google Cloud で実行され、会社の Python API を使用して取引を実行します。ソリューションを効率的に実装する必要があります。何をすべきでしょうか?
- A. Pub/Sub プッシュ サブスクリプションを使用して Cloud Functions をトリガーし、データを Python API に渡します。
- B. Compute Engine インスタンスでホストされ、Pub/Sub トピックへのプッシュ サブスクリプションを行うアプリケーションを作成します。
- C. Cloud Composer を使用して Pub/Sub トピックをサブスクライブし、Python API を使用できます。
- D. NoSQLデータベースにキューを作成するアプリケーションを作成する
正解:D
質問 # 158
レガシー SQL と標準 SQL に関する次の記述のうち、正しくないものはどれですか。
- A. 2 つのクエリ言語の違いの 1 つは、完全修飾テーブル名 (つまり、関連付けられたプロジェクト名を含むテーブル名) を指定する方法です。
- B. レガシー SQL でクエリを記述した場合、標準 SQL で実行しようとするとエラーが発生する可能性があります。
- C. BigQuery では標準 SQL が推奨されるクエリ言語です。
- D. 各データセットのクエリ言語を設定する必要があります。デフォルトは標準 SQL です。
正解:D
解説:
データセットごとにクエリ言語を設定する必要はありません。クエリを実行するたびに設定され、デフォルトのクエリ言語はレガシー SQL です。
BigQuery 2.0 がリリースされて以来、標準 SQL が推奨されるクエリ言語となっています。
従来の SQL では、プロジェクト修飾名を持つテーブルをクエリするには、区切り文字としてコロン (:) を使用します。標準 SQL では、代わりにピリオド (.) を使用します。
2 つのクエリ言語間の構文の違い (プロジェクト修飾テーブル名など) により、レガシー SQL でクエリを記述した場合、標準 SQL で実行しようとするとエラーが発生する可能性があります。
参照:
https://cloud.google.com/bigquery/docs/reference/standard-sql/migrated-from-legacy-sql
質問 # 159
機械学習データセットをトレーニングデータとテストデータに分割する必要があるのはなぜですか?
- A. コードで単体テストを作成できるようにするため
- B. 2つの異なる機能セットを試すことができます
- C. つまり、ワイドモデルに1つのデータセットを使用し、ディープモデルに1つのデータセットを使用できます。
- D. モデルがトレーニングデータだけでなく一般化されていることを確認する
正解:D
解説:
Explanation
The flaw with evaluating a predictive model on training data is that it does not inform you on how well the model has generalized to new unseen data. A model that is selected for its accuracy on the training dataset rather than its accuracy on an unseen test dataset is very likely to have lower accuracy on an unseen test dataset. The reason is that the model is not as generalized. It has specialized to the structure in the training dataset. This is called overfitting.
Reference: https://machinelearningmastery.com/a-simple-intuition-for-overfitting/
質問 # 160
......
最新の検証済みProfessional-Data-Engineer日本語問題と解答で合格保証:https://www.passtest.jp/Google/Professional-Data-Engineer-JPN-shiken.html