사이트 소개

데이터 준비 › 절차

결함 수정 (2단계)

유형 · 절차읽는 시간 · 약 4분데이터 제공 담당자

목차목차
  1. 점수가 낮은 지표의 수정
  2. 고칠 수 없는 한계 기록
  3. 원본 · 정제본 · 결과서의 관리
  4. 빈번한 오류

2단계에서 점수가 낮은 지표를 고치고, 고칠 수 없는 한계를 기록하는 방법입니다. 고친 파일(정제본)은 원본과 구분해 보관합니다.

목표점수가 낮은 지표의 값을 고치고, 고칠 수 없는 한계는 기록합니다. 원본 파일 · 정제본 · 결과서를 구분해 보관합니다.

점수가 낮은 지표의 수정 권고

담당자의 정제 작업은 세 범주로 나뉩니다.

범주 작업 내용 개선되는 차원
컬럼명 정리 서로 다른 컬럼 이름 · 표기를 하나로 통일 일관성(D2) · 기계 판독성(D7)
값 정리 식별자 · 분류체계 · 표준 코드에 맞춘 값 정리 완전성(D1) · 일관성(D2) · 유효성(D5) · 유일성(D6)
설명 보강 측정 결과와 한계를 마니페스트에 기재 기계 판독성(D7)

차원별 우선 조치

차원별 우선 조치 — 표 7행 펼치기
점수가 낮은 차원 우선 조치
완전성(D1) 핵심 컬럼의 빈 값 확인. 채울 수 없으면 빈 값 표기를 통일하고 그 사실을 기재
일관성(D2) 같은 개념에 다른 이름을 쓰는지 확인. 날짜 · 코드 표기 통일
정확성(D3) 원천 자료와 대조. 기준 자료가 없으면 「정확성 미측정」으로 두고 이유를 기재
적시성(D4) 기재한 갱신 주기를 실제 갱신 이력과 맞춤. 지킬 수 있는 주기만 기재
유효성(D5) 자료형 · 허용값 · 필수값 규칙을 정의하고 규칙에 어긋나는 행을 찾음
유일성(D6) 같은 행으로 볼 기준(레코드 키)을 정의. 키가 없으면 레코드 단위 중복 판정이 불확실
기계 판독성(D7) 개방 형식으로 변환. 셀 병합 · 소계 행 · 여러 줄 머리글 제거

고칠 수 없는 한계 기록 필수

담당자는 고칠 수 없는 한계도 기록합니다. 이용자는 기록된 한계를 보고 데이터의 사용 여부와 사용 범위를 판단합니다. 기록하지 않은 제약은 이용자가 확인할 수 없습니다.

기재 대상 예
알려진 치우침 전국 대상이나 수도권 데이터가 90% 이상
부적합한 용도 주민등록 기준 통계로 실제 상주 인구 분석에는 부적합
빠진 값의 원인 센서 점검(2.1%) · 통신 오류(1.1%)로 결측 발생
측정하지 못한 이유 대조할 원천 자료가 없어 정확성 미측정

한계 기록은 결함 판정이 아닙니다. 한계 기록은 이용자가 활용 범위를 판단하는 정보입니다.

원본 · 정제본 · 결과서의 관리 필수

정제본에도 데이터셋의 고유 식별자를 그대로 씁니다. 정제본은 다른 데이터셋이 아닙니다. 담당자는 원본 파일 · 정제본 · 배포 버전 · 데이터 설명서(마니페스트) · 결과서(표준 용어: 진단 리포트) · 목적별 운용 파일을 각각 구분합니다.

원본 · 정제본 · 버전의 구분
구분 대상 구분 방법
원본 파일과 정제본 배포 자원과 SHA-256 체크섬으로 구분
배포 버전 버전 번호로 구분
마니페스트 버전마다 새로 발행 · 이전 버전 참조 [제3부 5.1]
결과서 측정할 때마다 새로 생성
목적별 운용 파일 활용 목적 유형마다 별도 파일로 생성

원본 파일은 보존합니다. 정제본으로 원본 파일을 덮어쓰지 않습니다.

기존 결과서를 그대로 쓰는 조건

다음 네 가지가 모두 같을 때만 기존 결과서를 그대로 씁니다. 하나라도 달라지면 새 결과서를 만듭니다.

  • 측정 대상 버전
  • 측정 규칙
  • 적용한 운영 지침
  • 측정 시점의 유효성

데이터를 정제했거나 다시 측정했으면 새 결과서를 만듭니다. 마니페스트는 새 결과서를 주소와 체크섬으로 가리킵니다.

처리 이력 기록 항목 [제4부 12]후속 부

기록 항목 예
작업 내용 결측 보정 · 코드값 정규화 · 중복 제거
작업 일자 2026-08-14
버전 변경 원본 v1.0.0 → 정제본 v1.1.0
변경 사유 구 단위 누락값 보정 · 연령 구간을 5세 단위로 세분화

처리 이력이 없으면 이용자는 정제 결과를 검증할 수 없습니다.

빈번한 오류

2단계에서 자주 나오는 오류는 다음 세 가지입니다.

  • 평균 점수로 등급 판단(등급 판정은 최소 차원 점수에서 출발)
  • 운영 지침이 아닌 값(예: 예시 임계 프로파일)으로 계산한 등급의 공개
  • 정제 후 결과서 미갱신
잘못된 예바로잡은 예문제 원인
차원 점수 D1 0.92 · D2 0.88 · D3 0.93 · D4 0.86 · D5 0.89 · D6 1.00 · D7 0.97을 가중 평균 0.925로 요약해 등급 판단최소 차원 점수 D4 0.86에서 후보 등급 산정 시작평균은 한 차원의 결정적 결손을 희석합니다. 가중 평균 0.925는 예시 임계 프로파일(제2부 부록 Ⅰ, 상태 EXAMPLE)의 차원 가중치로 계산한 값입니다. 예시 임계 프로파일은 등급 판정에 쓰지 않습니다
J-GR-001 사례의 차원 점수에 운영 지침 없이 등급 부여점수와 측정 완성도만 기록. 품질 등급은 「판정하지 않음: 운영 지침 미적용」같은 점수도 적용한 운영 지침에 따라 다른 등급이 됩니다. 예시 임계 프로파일로 계산한 값은 등급이 아닙니다
데이터를 정제한 뒤 이전 결과서를 그대로 둠새 결과서 생성. 마니페스트가 새 결과서를 주소와 체크섬으로 가리킴기존 결과서는 측정 대상 버전 · 측정 규칙 · 운영 지침 · 측정 시점이 모두 같을 때만 씁니다

필요성

2단계의 작업은 이용자가 데이터의 재사용 가능성을 판단하는 근거를 만듭니다. 담당자는 품질 점수와 함께 한계와 처리 이력을 남깁니다. 값의 상태와 변경 사유가 없으면 이용자는 데이터의 제약을 판단할 수 없습니다.

품질 점수와 등급은 AI 활용을 위해 표준이 추가한 요건입니다. 국제 FAIR 원칙은 품질 점수와 등급을 요구하지 않습니다.

완료 조건

  • 정제본 · 처리 이력 · 한계 기록 작성
  • 원본 파일 보존(정제본과 다른 파일 · 다른 체크섬)

필요한 것 정제본을 진단 도구로 다시 측정해 새 결과서를 만듭니다. 이 작업에는 진단 도구가 있어야 합니다. 진단 도구의 배포 버전은 개발 중입니다(개발 현황과 향후 공개).

결과서 읽기 (2단계)

최종 수정 · 2026-10-07오류 신고