最新的Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional Korean Version) - Databricks-Certified-Data-Engineer-Professional Korean免費考試真題
問題1
데이터 과학 팀은 MLflow를 사용하여 프로덕션 모델을 생성하고 로그에 기록했습니다. 다음 코드는 프로덕션 모델을 올바르게 가져와 적용하여 "customer_id LONG, predictions DOUBLE, date DATE" 스키마를 가진 preds라는 새 DataFrame으로 예측 결과를 출력합니다.

데이터 과학 팀은 예측 결과를 Delta Lake 테이블에 저장하고, 시간 경과에 따른 모든 예측 결과를 비교할 수 있기를 원합니다. 고객 이탈 예측은 하루에 최대 한 번만 수행됩니다.
어떤 코드 블록이 잠재적인 컴퓨팅 비용을 최소화하면서 이 작업을 수행합니까?
데이터 과학 팀은 MLflow를 사용하여 프로덕션 모델을 생성하고 로그에 기록했습니다. 다음 코드는 프로덕션 모델을 올바르게 가져와 적용하여 "customer_id LONG, predictions DOUBLE, date DATE" 스키마를 가진 preds라는 새 DataFrame으로 예측 결과를 출력합니다.

데이터 과학 팀은 예측 결과를 Delta Lake 테이블에 저장하고, 시간 경과에 따른 모든 예측 결과를 비교할 수 있기를 원합니다. 고객 이탈 예측은 하루에 최대 한 번만 수행됩니다.
어떤 코드 블록이 잠재적인 컴퓨팅 비용을 최소화하면서 이 작업을 수행합니까?
正確答案: E
問題2
스트림 정적 조인과 정적 델타 테이블에 관한 다음 설명 중 올바른 것은 무엇입니까?
스트림 정적 조인과 정적 델타 테이블에 관한 다음 설명 중 올바른 것은 무엇입니까?
正確答案: A
說明:(僅 PDFExamDumps 成員可見)
問題3
데이터 엔지니어가 Databricks에 있는 대규모 분할 소매 데이터 세트를 분석하고 있습니다. 각 행은 영업 사원이 수행한 판매를 나타냅니다. 이 데이터 세트는 다음과 같은 스키마를 가진 수백만 개의 레코드로 구성되어 있습니다.
sales_df: [salesperson_id: string, region: string, sale_amount: double, sale_date: date] 데이터 엔지니어는 각 지역 내 영업 사원들의 누적 총 판매액을 기준으로 순위를 매기는 데이터프레임을 생성해야 합니다. 가장 높은 판매액을 기록한 영업 사원을 1위로 지정합니다. 여러 영업 사원의 누적 판매액이 같을 경우, 동일한 순위를 부여해야 합니다.
데이터 엔지니어는 PySpark의 윈도우 함수와 dense_rank() 함수를 사용하여 이 로직을 구현하려고 합니다.
어떤 코드 조각이 이러한 순위 매기기를 수행할까요?
데이터 엔지니어가 Databricks에 있는 대규모 분할 소매 데이터 세트를 분석하고 있습니다. 각 행은 영업 사원이 수행한 판매를 나타냅니다. 이 데이터 세트는 다음과 같은 스키마를 가진 수백만 개의 레코드로 구성되어 있습니다.
sales_df: [salesperson_id: string, region: string, sale_amount: double, sale_date: date] 데이터 엔지니어는 각 지역 내 영업 사원들의 누적 총 판매액을 기준으로 순위를 매기는 데이터프레임을 생성해야 합니다. 가장 높은 판매액을 기록한 영업 사원을 1위로 지정합니다. 여러 영업 사원의 누적 판매액이 같을 경우, 동일한 순위를 부여해야 합니다.
데이터 엔지니어는 PySpark의 윈도우 함수와 dense_rank() 함수를 사용하여 이 로직을 구현하려고 합니다.
어떤 코드 조각이 이러한 순위 매기기를 수행할까요?
正確答案: A
說明:(僅 PDFExamDumps 成員可見)
問題4
데이터 엔지니어가 소스에서 가져온 CDC(변경 데이터 캡처) 데이터를 처리하기 위해 Lakeflow 선언적 파이프라인을 구성하고 있습니다. 소스 이벤트는 때때로 순서대로 도착하지 않으며, 동일한 update_timestamp를 갖지만 update_sequence_id가 다른 여러 업데이트가 발생할 수 있습니다.
데이터 엔지니어는 이벤트 순서가 올바르게 유지되도록 하기 위해 무엇을 해야 할까요?
데이터 엔지니어가 소스에서 가져온 CDC(변경 데이터 캡처) 데이터를 처리하기 위해 Lakeflow 선언적 파이프라인을 구성하고 있습니다. 소스 이벤트는 때때로 순서대로 도착하지 않으며, 동일한 update_timestamp를 갖지만 update_sequence_id가 다른 여러 업데이트가 발생할 수 있습니다.
데이터 엔지니어는 이벤트 순서가 올바르게 유지되도록 하기 위해 무엇을 해야 할까요?
正確答案: D
說明:(僅 PDFExamDumps 成員可見)
問題5
데이터 엔지니어가 기본 설정을 사용하여 공유 액세스 모드로 새 클러스터를 생성했습니다.
데이터 엔지니어는 필요한 경우 개발팀이 드라이버 로그를 볼 수 있도록 접근 권한을 부여해야 합니다.
개발팀이 이를 수행하는 데 필요한 최소 클러스터 권한은 무엇입니까?
데이터 엔지니어가 기본 설정을 사용하여 공유 액세스 모드로 새 클러스터를 생성했습니다.
데이터 엔지니어는 필요한 경우 개발팀이 드라이버 로그를 볼 수 있도록 접근 권한을 부여해야 합니다.
개발팀이 이를 수행하는 데 필요한 최소 클러스터 권한은 무엇입니까?
正確答案: D
說明:(僅 PDFExamDumps 成員可見)
問題6
다음 오류 추적 정보를 검토하십시오.

발생한 오류를 설명하는 문장은 무엇입니까?
다음 오류 추적 정보를 검토하십시오.

발생한 오류를 설명하는 문장은 무엇입니까?
正確答案: B
說明:(僅 PDFExamDumps 成員可見)
問題7
Databricks를 처음 사용하는 사용자가 작업 중인 파이프라인 로직의 실행 시간이 너무 오래 걸리는 문제를 해결하려고 합니다. 현재 사용자는 display() 호출을 사용하여 코드를 셀 단위로 실행하면서 새로운 변환이 작업에 추가될 때 코드가 논리적으로 올바른 결과를 생성하는지 확인하고 있습니다. 평균 실행 시간을 측정하기 위해 각 셀을 대화형으로 여러 번 실행하고 있습니다.
다음 중 어떤 조정을 하면 실제 운영 환경에서 코드 성능을 더 정확하게 측정할 수 있을까요?
Databricks를 처음 사용하는 사용자가 작업 중인 파이프라인 로직의 실행 시간이 너무 오래 걸리는 문제를 해결하려고 합니다. 현재 사용자는 display() 호출을 사용하여 코드를 셀 단위로 실행하면서 새로운 변환이 작업에 추가될 때 코드가 논리적으로 올바른 결과를 생성하는지 확인하고 있습니다. 평균 실행 시간을 측정하기 위해 각 셀을 대화형으로 여러 번 실행하고 있습니다.
다음 중 어떤 조정을 하면 실제 운영 환경에서 코드 성능을 더 정확하게 측정할 수 있을까요?
正確答案: D
問題8
데이터 엔지니어가 Lakeflow Declarative Pipeline 기술을 활용하여 Auto Loader를 통해 S3의 JSON 파일에서 수집된 실시간 트럭 원격 측정 데이터를 처리하는 시스템을 설계하고 있습니다. 데이터에는 트럭 ID, 타임스탬프, 위치, 속도 및 연료량이 포함됩니다. 이 시스템은 두 가지 사용 사례를 지원해야 합니다.
- 최신 위치, 속도 등을 거의 실시간으로 모니터링
운영팀을 위한 트럭 ID별 연료량 정보입니다.
- 일일 총 주행 거리 및 평균 연료 소비량 집계 보고서
경영진을 위한 트럭 ID별 효율성.
데이터 엔지니어는 Lakeflow 선언적 파이프라인에서 스트리밍 테이블과 구체화된 뷰를 구현할 때 이러한 요구 사항을 충족하기 위해 어떤 접근 방식을 사용해야 할까요?
데이터 엔지니어가 Lakeflow Declarative Pipeline 기술을 활용하여 Auto Loader를 통해 S3의 JSON 파일에서 수집된 실시간 트럭 원격 측정 데이터를 처리하는 시스템을 설계하고 있습니다. 데이터에는 트럭 ID, 타임스탬프, 위치, 속도 및 연료량이 포함됩니다. 이 시스템은 두 가지 사용 사례를 지원해야 합니다.
- 최신 위치, 속도 등을 거의 실시간으로 모니터링
운영팀을 위한 트럭 ID별 연료량 정보입니다.
- 일일 총 주행 거리 및 평균 연료 소비량 집계 보고서
경영진을 위한 트럭 ID별 효율성.
데이터 엔지니어는 Lakeflow 선언적 파이프라인에서 스트리밍 테이블과 구체화된 뷰를 구현할 때 이러한 요구 사항을 충족하기 위해 어떤 접근 방식을 사용해야 할까요?
正確答案: D
說明:(僅 PDFExamDumps 成員可見)
問題9
데이터 엔지니어는 코드가 매우 유사한 여러 테이블 정의를 포함하는 다음 DLT 코드를 리팩토링하려고 합니다.

데이터 엔지니어는 매개변수화된 테이블 정의를 사용하여 이러한 테이블을 프로그래밍 방식으로 생성하기 위해 다음과 같은 코드를 작성했습니다.

파이프라인은 리팩토링된 코드를 사용하여 업데이트를 실행하지만, 이러한 테이블에 대해 잘못된 구성 값을 보여주는 다른 DAG를 생성합니다.
데이터 엔지니어는 이 문제를 어떻게 해결할 수 있을까요?
데이터 엔지니어는 코드가 매우 유사한 여러 테이블 정의를 포함하는 다음 DLT 코드를 리팩토링하려고 합니다.

데이터 엔지니어는 매개변수화된 테이블 정의를 사용하여 이러한 테이블을 프로그래밍 방식으로 생성하기 위해 다음과 같은 코드를 작성했습니다.

파이프라인은 리팩토링된 코드를 사용하여 업데이트를 실행하지만, 이러한 테이블에 대해 잘못된 구성 값을 보여주는 다른 DAG를 생성합니다.
데이터 엔지니어는 이 문제를 어떻게 해결할 수 있을까요?
正確答案: D
說明:(僅 PDFExamDumps 成員可見)
問題10
PySpark 애플리케이션에 단위 테스트를 통합하려면 작업 설계에 대한 사전 고려가 필요하거나 기존 코드에 상당한 리팩토링이 필요할 수 있습니다.
다음 중 이러한 추가적인 노력을 상쇄하는 주요 이점을 설명하는 문장은 무엇입니까?
PySpark 애플리케이션에 단위 테스트를 통합하려면 작업 설계에 대한 사전 고려가 필요하거나 기존 코드에 상당한 리팩토링이 필요할 수 있습니다.
다음 중 이러한 추가적인 노력을 상쇄하는 주요 이점을 설명하는 문장은 무엇입니까?
正確答案: E
說明:(僅 PDFExamDumps 成員可見)
問題11
Spark Structured Streaming에서 사용하는 일반적인 프로그래밍 모델의 특징을 설명하는 문장은 무엇입니까?
Spark Structured Streaming에서 사용하는 일반적인 프로그래밍 모델의 특징을 설명하는 문장은 무엇입니까?
正確答案: B
說明:(僅 PDFExamDumps 成員可見)
問題12
Databricks 쿼리 프로파일러에서 쿼리 실행을 검토하던 데이터 엔지니어는 '상위 연산자' 패널에서 정렬 연산자의 소요 시간 및 메모리 사용량이 높게 나타나는 것을 확인했습니다. 또한 Spark UI에서도 데이터 스필링이 빈번하게 발생한다는 보고가 있습니다. 데이터 엔지니어는 이 문제를 어떻게 해결해야 할까요?
Databricks 쿼리 프로파일러에서 쿼리 실행을 검토하던 데이터 엔지니어는 '상위 연산자' 패널에서 정렬 연산자의 소요 시간 및 메모리 사용량이 높게 나타나는 것을 확인했습니다. 또한 Spark UI에서도 데이터 스필링이 빈번하게 발생한다는 보고가 있습니다. 데이터 엔지니어는 이 문제를 어떻게 해결해야 할까요?
正確答案: B
說明:(僅 PDFExamDumps 成員可見)
問題13
데이터 엔지니어가 의료비 청구 데이터를 처리하기 위해 Lakeflow Declarative Pipelines 파이프라인을 구축하고 있습니다. 메타데이터 JSON 파일에는 다음을 포함한 여러 테이블에 대한 데이터 품질 규칙이 정의되어 있습니다.
{
"주장": [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "음수가 아닌 금액", "constraint": "청구 금액 >= 0"}
]
}
파이프라인은 규칙을 하드코딩하지 않고 이러한 규칙을 클레임 테이블에 동적으로 적용해야 합니다.
데이터 엔지니어는 어떻게 이를 달성해야 할까요?
데이터 엔지니어가 의료비 청구 데이터를 처리하기 위해 Lakeflow Declarative Pipelines 파이프라인을 구축하고 있습니다. 메타데이터 JSON 파일에는 다음을 포함한 여러 테이블에 대한 데이터 품질 규칙이 정의되어 있습니다.
{
"주장": [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "음수가 아닌 금액", "constraint": "청구 금액 >= 0"}
]
}
파이프라인은 규칙을 하드코딩하지 않고 이러한 규칙을 클레임 테이블에 동적으로 적용해야 합니다.
데이터 엔지니어는 어떻게 이를 달성해야 할까요?
正確答案: A
說明:(僅 PDFExamDumps 成員可見)
問題14
데이터 거버넌스 팀은 개인 식별 정보(PH)가 포함된 모든 테이블에 명확한 주석을 추가해야 한다는 요구 사항을 도입했습니다. 여기에는 열 주석, 테이블 주석 추가 및 사용자 지정 테이블 속성 "contains_pii" = true 설정이 포함됩니다.
다음 SQL DDL 문이 실행되어 새 테이블이 생성됩니다.

이 세 가지 요구 사항이 충족되었는지 수동으로 확인할 수 있는 명령은 무엇입니까?
데이터 거버넌스 팀은 개인 식별 정보(PH)가 포함된 모든 테이블에 명확한 주석을 추가해야 한다는 요구 사항을 도입했습니다. 여기에는 열 주석, 테이블 주석 추가 및 사용자 지정 테이블 속성 "contains_pii" = true 설정이 포함됩니다.
다음 SQL DDL 문이 실행되어 새 테이블이 생성됩니다.

이 세 가지 요구 사항이 충족되었는지 수동으로 확인할 수 있는 명령은 무엇입니까?
正確答案: B
說明:(僅 PDFExamDumps 成員可見)