Databricks Certified Data Engineer Associate 教科書
模擬試験 セット3(45問・90分・合格目安70%)
本試験と同じ45問・90分・4択形式です。ページを開いた時点からタイマーが動いています。すべて解答したら最下部の「採点する」を押してください(時間切れで自動採点されます)。
このセットは、2026年5月改訂の試験ガイドで新設・強化された領域(Lakeflow Connect、Lakeflow Jobs の新トリガーと制御フロー、CI/CD、Liquid Clustering、Predictive Optimization、ABAC)と新旧名称の対応を多めに含む、やや難しめの構成です。似た機能を混同させる選択肢に注意して解いてください。
問1. 2026年5月改訂の試験では製品の新名称が使われるが、社内の既存教材や過去のドキュメントには旧名称が残っている。旧名称と新名称の対応として正しいものはどれか。
問2. メダリオンアーキテクチャにおけるシルバー層の役割の説明として最も適切なものはどれか。
問3. Databricksのサーバーレスコンピュートに関する説明として最も適切なものはどれか。
問4. あるチームが、社外のSaaS型CRMアプリケーションのデータを毎日Delta表へ取り込みたい。APIのポーリング、認証管理、増分取得の管理といったコードを自前で書かずに済ませたい。最も適切な機能はどれか。
問5. Lakeflow Connectにおける「標準コネクタ」と「マネージドコネクタ」の違いの説明として最も適切なものはどれか。
問6. クラウドストレージのディレクトリに継続的に到着する大量のJSONファイルを、到着した分だけ増分でDelta表に取り込みたい。どのファイルを処理済みかの管理も自動化したい。最も適切な方法はどれか。
問7. COPY INTOとAuto Loaderの使い分けに関する説明として最も適切なものはどれか。
問8. 外部ベンダーから一度だけ受領したCSVファイル群がUnity CatalogのVolumeに置かれている。スキーマ推論込みで、これらから新しいDelta表を最短の手順で作りたい。最も適切な方法はどれか。
問9. 業務システムのリレーショナルデータベースのテーブルを、挿入・更新・削除の変更分を継続的にDelta表へ反映する形で取り込みたい。Lakeflow Connectのマネージドコネクタに関する説明として最も適切なものはどれか。
問10. Auto LoaderでJSONファイルを取り込んでいるが、ソース側の仕様変更で想定外の新フィールドや型が一致しない値が混ざる可能性がある。データを失わずに取り込みを継続する仕組みとして最も適切なものはどれか。
問11. 毎日受領する顧客マスタの差分ファイルをDelta表に反映したい。既存の顧客IDの行は最新情報で更新し、新規の顧客IDの行は挿入したい。最も適切なSQLはどれか。
問12. SQLだけを使って、クラウドストレージに継続的に到着するファイルを増分で取り込むテーブルをDatabricks SQL上に定義したい。最も適切な構文はどれか。
問13. Lakeflow Spark Declarative Pipelines(旧称 Delta Live Tables)における、ストリーミングテーブルとマテリアライズドビューの使い分けとして最も適切なものはどれか。
問14. パイプラインで、主キー列がNULLの行は品質基準違反としてターゲットに入れず、違反件数はメトリクスとして記録したい。期待(expectation)の指定として最も適切なものはどれか。
問15. CDCフィードを入力として、顧客住所の変更履歴をすべて保持する形(各行に有効期間を持つ履歴表)でターゲット表を維持したい。Lakeflow Spark Declarative Pipelinesでの実現方法として最も適切なものはどれか。
問16. イベント表に、同一イベントIDの行が複数回の取り込みにより重複して存在する。各イベントIDについてタイムスタンプが最新の1行だけを残した結果を得るSQLとして最も適切なものはどれか。
問17. 文字列型の列payloadにJSON文書が格納されており、その中の配列フィールドitemsの各要素を1行ずつに展開して分析したい。最も適切な処理の組み合わせはどれか。
問18. 上流ソースに新しい列が追加された。既存のDelta表への日次書き込みを、既存データを壊さずに新列も取り込みながら継続したい。最も適切な対応はどれか。
問19. 誤ったUPDATE文を本番のDelta表に実行してしまい、多数の行が不正な値になった。実行前の状態に戻す方法として最も適切なものはどれか。
問20. 複雑なJOINと絞り込みのロジックを複数の利用者・複数のセッションから再利用したい。データの実体は持たせず、参照のたびに元表の最新データを反映させたい。最も適切なオブジェクトはどれか。
問21. 「税抜価格と税率から税込価格を計算する」ロジックを、SQLの複数のクエリから同じ名前で呼び出せる形で共有したい。ガバナンス(権限管理)の対象にもしたい。最も適切な方法はどれか。
問22. Lakeflow Spark Declarative Pipelinesの実行モードに関する説明として最も適切なものはどれか。
問23. 取引先からのデータファイルが不定期にUnity CatalogのVolumeへ置かれる。ファイルが到着したときだけ処理ジョブを実行し、cronスケジュールによる空振り実行と検知遅延を避けたい。最も適切なものはどれか。
問24. 上流チームが管理するUnity Catalog上のDelta表が更新されたら、それを入力とする自チームの集計ジョブを自動実行したい。上流チームのジョブ定義には変更を加えられない。最も適切なものはどれか。
問25. 日次ジョブで、前段タスクが算出した「当日データ件数」が閾値を超えた場合のみ本処理タスクを実行し、超えない場合は担当者への通知タスクへ分岐させたい。Lakeflow Jobsでの実現方法として最も適切なものはどれか。
問26. 同一のノートブック処理を、10か国分の国コードをそれぞれパラメータとして与えて繰り返し実行したい。同時に実行する数(並列度)も制御したい。Lakeflow Jobsでの実現方法として最も適切なものはどれか。
問27. 20個のタスクを持つジョブが、途中の1タスクの失敗により停止した。成功済みタスクを再実行することなく、失敗した箇所から効率よく復旧する方法として最も適切なものはどれか。
問28. 本番の定期バッチジョブ(旧称 Workflows、現 Lakeflow Jobs)の実行に使うコンピュートに関する説明として最も適切なものはどれか。
問29. 深夜に実行されるバッチジョブについて、失敗に翌朝まで気づかない事態を防ぎ、かつネットワークの瞬断のような一時的なエラーでは人手をかけずに自動復旧させたい。設定の組み合わせとして最も適切なものはどれか。
問30. 複数人のチームでノートブック開発のバージョン管理を行いたい。Databricksワークスペース内でリモートGitリポジトリをクローンし、ブランチの切替・コミット・プッシュなどのGit操作を行える機能はどれか。
問31. Declarative Automation Bundles(旧称 Databricks Asset Bundles、DABs)の説明として最も適切なものはどれか。
問32. 同じバンドルをdevとprodに配備する際、ターゲットごとに使用するカタログ名やコンピュートの設定を切り替えたい。最も適切な方法はどれか。
問33. Lakeflow JobsとパイプラインのCI/CDフローの設計として最も適切なものはどれか。
問34. 高カーディナリティの列(顧客IDなど)での絞り込みが多い大規模Delta表のデータレイアウトを最適化したい。将来、クエリパターンが変わる可能性もある。最も適切なものはどれか。
問35. 数百のUnity CatalogマネージドテーブルへのOPTIMIZEやVACUUMの実行スケジュールを個別に管理する負担が大きい。運用負荷を最小化する方法として最も適切なものはどれか。
問36. Lakeflow Jobsの本番ジョブが今朝の実行で失敗した。原因調査の最初の一歩として最も適切なものはどれか。
問37. ストリーミングで細かい追記が続くDelta表(外部テーブルのためPredictive Optimizationの対象外)の読み取りが徐々に遅くなった。調査の結果、原因は大量の小さなデータファイルだと分かった。最も適切な対処はどれか。
問38. 複数のワークスペースにまたがるジョブの実行履歴の傾向(失敗率、実行時間)と、コンピュートの利用量・コストをSQLで横断的に分析したい。最も適切なデータソースはどれか。
問39. 数百のテーブルに散在する個人情報列へのマスキングを、テーブルごとの個別設定ではなく、全社共通のポリシーとして一元的に適用したい。最も適切なUnity Catalogの機能はどれか。
問40. 地域列の値に基づく行レベルのアクセス制御を、カタログ内の対象テーブル群に適用したい。今後新しく作成されるテーブルにも、個別の設定作業なしで同じ制御が効くようにしたい。最も適切なものはどれか。
問41. アナリストのグループに catalog1.schema1.table1 への読み取りだけを許可したい。Unity Catalogで必要となる最小権限の組み合わせとして最も適切なものはどれか。
問42. 本番のLakeflow Jobsが特定の社員の個人ユーザーとして実行されており、その社員の異動・退職でジョブが失敗するリスクが指摘された。最も適切な対策はどれか。
問43. ゴールド層のある表の値に異常が見つかった。この表が上流のどの表からどう作られたかを遡って特定し、逆にこの表を参照している下流への影響範囲も調べたい。最も適切な方法はどれか。
問44. 顧客テーブル(Unity Catalog管理)の電話番号列を、個人情報管理グループ pii_admins のメンバーにはそのまま、それ以外の利用者には伏字で表示したい。このテーブルは多数のダッシュボードやノートブックから直接参照されている。最も適切な方法はどれか。
SET MASK でテーブル本体の列に適用します。テーブルを直接参照するすべての経路で一貫して効くため、参照元の変更が不要です。Aはコピーの拡散と鮮度・同期の問題を生みます。Bは全参照元の書き換えが必要で、切り替え漏れがそのまま漏えいリスクになります。Cは誤りで、Unity Catalog の GRANT はテーブル単位であり列単位の SELECT 制御はできません(列単位の制御にはカラムマスクや列を絞ったビューを使います)。参照:7-3節問45. 外部テーブルとして運用してきたDelta表を、Predictive Optimizationなどマネージドテーブル向けの機能を活用するためにマネージドテーブルへ移行したい。テーブル名・付与済みの権限・テーブル履歴を維持したまま移行する方法として最も適切なものはどれか。