AI 레디 데이터 표준 해설
데이터를 사용하는 주체가 사람에서 AI로 넓어지고 있습니다. 기록되지 않은 사실은 AI가 확인할 수 없습니다.
에이전트가 데이터를
추정하지 않고 활용하도록
AI 레디 데이터 표준은 AI가 데이터를 찾고, 이해하고, 신뢰하고, 목적에 맞게 사용하는 데 필요한 사실을 기계가 읽을 수 있는 형태로 기록하는 방법과, 그 준비 상태를 판정하는 방법을 정합니다.
마니페스트 유무에 따른 에이전트 판단
같은 예시 파일을 에이전트가 읽은 결과입니다. 파일만 있을 때와 1단계를 마친 마니페스트가 함께 있을 때를 비교합니다.
- 4 알 수 있음
- 10 추정해야 함
- 2 표준이 답하지 않음
판단 16개 기준
- 12 알 수 있음
- 2 추정해야 함
- 2 표준이 답하지 않음
판단 16개 기준
진단 화면이 예시 파일을 실제로 계산한 값입니다 (회귀 시험 CV-001 · CV-002). 내 데이터 진단
역할별 시작점
관측 결과 공공데이터 · 기업 데이터
기업 데이터 · 사용 가능성 이용약관을 확인한 국내 민간 정형 데이터 3건은 모두 자체 약관으로 재배포를 제한했고, 오픈 라이선스로 개방한 것은 없었습니다. 무료로 받을 수 있어도 에이전트는 이용 조건을 확인할 수 없습니다.
출처: 공공데이터포털 파일데이터 목록 84,271건 관측(2026-08-31) · fdi-stats-pack 비교 실행(2026-09-30) · 국내 민간 정형 데이터 3건의 이용약관 · 이용정책 확인(2026-10-03). 특정 기관 · 기업을 평가하지 않습니다.
사례 영상 한 편당 2분 이내
결합성 · 설명용 예시같은 이름, 다른 의미단위와 주기가 다르면 결론이 16배 어긋납니다.
신뢰성 · 실제 데이터같은 사실의 중복 집계중복 보고 · 합계 행 · 관측 상태를 가리지 않으면 정답의 4.0배가 됩니다.
사용 가능성 · 실행 기록이용 가능 범위 판정포털 표기로는 제3자 권리의 범위를 알 수 없습니다. 마니페스트의 권리 조항이 이를 구분합니다.
내 데이터로 확인
파일 하나를 넣으면 에이전트가 이 데이터에서 알 수 있는 것과 추정해야 하는 것을 확인할 수 있습니다. 계산은 이 페이지 안에서만 수행하며 파일은 전송하지 않습니다.
- 파일 입력 · 에이전트가 보는 결과 확인
- 효과가 큰 순서로 설명 보완
- 마니페스트 초안 저장 · 재진단
AI 레디 데이터란
AI 레디 데이터는 에이전트가 데이터를 활용하기 전에 판단하는 데 필요한 사실을, 데이터와 함께 기계가 읽는 형식으로 기록한 데이터입니다. 표준은 Quality-Ready(품질 확인) 이상의 상태에 도달한 데이터를 AI 레디 데이터라 합니다. [제1부 3.1 · 5.1]
달라지는 점
사람은 모르는 것이 있으면 담당자에게 묻습니다. 에이전트는 데이터에 기록되지 않은 사실을 확인할 수 없어 추정합니다. 추정이 틀려도 오류 메시지는 나오지 않습니다.
데이터 활용 전의 네 가지 판단
네 가지 판단은 모든 데이터 유형에 같습니다. 판단에 필요한 정보는 유형마다 다릅니다. [제1부 5.6]
| 데이터 유형 | 판단에 주로 필요한 정보 (예) |
|---|---|
표 형태 · 시계열 STRUCT TSERIES | 컬럼의 의미 · 단위 · 코드 체계 · 기준 시점 · 레코드 키 |
문서 TEXT | 출처 · 작성 시점 · 문서를 나눈 단위 · 근거 위치 · 개인정보 포함 여부 |
이미지 IMAGE | 촬영 · 수집 조건 · 라벨 체계 · 라벨 파일과 이미지의 대응 |
지시문 · 응답 쌍 PT | 지시문과 응답의 대응 · 출처 · 검수 여부 |
표준의 데이터 유형은 이 다섯 가지입니다. 영상은 따로 정하지 않습니다.
세 단계
표준의 상태 이름: Discoverable → Quality-Ready → Purpose-Ready
1단계만 마쳐도 에이전트가 추정해야 하는 것이 줄어듭니다. 사례는 사례 영상에서 볼 수 있습니다.
함께 제공하는 파일
AI 레디 데이터는 데이터 파일 하나가 아니라, 판단에 필요한 사실을 담은 문서를 함께 제공합니다. 표준은 이 묶음을 팩(Pack)이라 부릅니다. [제4부 10]후속 부
상태 · 확인 지점 · 등급 상세
- 하는 일
- 원천에서 제공된 직후의 데이터입니다. 그 자체로는 AI 레디 데이터가 아닙니다.
- 검증된 계층
- 없음
- 품질 등급
- —
- 목적 등급
- —
- 진단 성숙도
- —
- 원시 데이터 관계
- 원시 데이터셋
- 하는 일
- 내용과 소재가 기록되어 검색과 접근이 가능한 상태입니다.
- 검증된 계층
- 발견
- 품질 등급
- —
- 목적 등급
- —
- 진단 성숙도
- 진단했다면 DM-0 · DM-1 · DM-2
- 원시 데이터 관계
- 원시 데이터셋의 값을 유지 · 필요하면 형식만 변환
- 진입 경로
- 단계 1 — 수집 · 개방 형식 변환 · 발견 계층 생성
- G1 판정 대상
- 발견 계층의 완비
- 이 상태를 증명하는 파일
- manifest.json (발견 계층) · G1 판정 기록
- 하는 일
- 품질을 측정 · 판정해 전이 조건을 충족한 상태입니다. 여기서부터 AI 레디 데이터입니다.
- 검증된 계층
- 발견 · 이해
- 품질 등급
- Tier 1 이상
- 목적 등급
- —
- 진단 성숙도
- DM-2
- 원시 데이터 관계
- 정제 결과를 반영 · 원시와 같은 데이터셋
- 진입 경로
- 단계 2 — 품질 진단 · 정제 · 이해 계층 생성
- G2 판정 대상
- 품질이 확인된 데이터(Quality-Ready) 전이 가능 여부 (DM-2 · Tier 1 이상 · 활성 공식 적용 기준)
- 이 상태를 증명하는 파일
- manifest.json (발견 · 이해 계층) · 결과서 · G2 판정 기록
- 하는 일
- 특정 활용 목적의 정량 요건까지 충족한 상태입니다.
- 검증된 계층
- 발견 · 이해 · 운용
- 품질 등급
- 유지
- 목적 등급
- 목적별 부여
- 진단 성숙도
- DM-2
- 원시 데이터 관계
- 목적별 파생물 · 원시와 함께 존재
- 진입 경로
- 단계 3 — 목적별 변환 · 운용 계층 생성
- G3 판정 대상
- 목적 요건의 충족
- 이 상태를 증명하는 파일
- manifest.json · 결과서 · 운용 파일 (목적별) · G3 판정 기록
- 하는 일
- 무결성 검증에 실패하거나 기재한 갱신 주기를 지키지 않아, 부여된 등급의 효력이 정지된 상태입니다. 재검증으로 복귀합니다.
- 검증된 계층
- 직전 상태 유지
- 품질 등급
- 효력 정지
- 목적 등급
- 효력 정지
- 진단 성숙도
- 유지
- 원시 데이터 관계
- 직전 상태의 관계 유지
자주 묻는 질문
- 의무입니까
- 아닙니다. 법령이나 규정에 따른 의무가 아니며, 평가나 조직 간 순위 산정에 사용하지 않습니다. 1단계만 수행해도 에이전트가 추정해야 하는 항목이 줄어듭니다.
- 무엇을 얻습니까
- 에이전트와 이용자가 담당자에게 문의하지 않고도 데이터가 무엇인지, 신뢰할 수 있는지, 어떤 조건으로 이용할 수 있는지 판단할 수 있습니다. 에이전트가 데이터를 검색 결과와 결합 후보로 선택할 근거도 기재됩니다.
- 데이터를 고쳐야 합니까
- 1단계는 데이터값을 변경하지 않고 설명을 기재하는 작업입니다. 값을 고치는 일은 2단계의 결함 수정에서 하며, 원본은 보존합니다.
- 얼마나 걸립니까
- 기재 값은 데이터 등록 정보와 운영 데이터베이스의 컬럼 주석에서 가져오고, 체크섬은 내 데이터 진단 화면이 자동으로 계산합니다. 소요 시간은 기존 컬럼 설명의 기재 정도에 따라 달라집니다.
필요성과 배경
사람은 모르는 것이 있으면 담당자에게 묻습니다. 에이전트는 데이터에 기록되지 않은 사실을 확인할 수 없어 추정합니다. 추정이 틀려도 오류 메시지는 나오지 않습니다.
공개 데이터 관측 결과
공공데이터포털 파일데이터 목록 84,271건을 관측한 결과(2026-08-31), 같은 문제를 확인했습니다.
출처: 공공데이터포털 목록개방현황(2026-08-31, 84,271건) 관측. 포털이 내보내는 DCAT 파일 2건은 RDF 파서로 읽히지 않았습니다.
기업 데이터는 이용 조건이 우선 제약입니다. 이용약관을 확인한 국내 민간 정형 데이터 3건은 무료로 받을 수 있어도 모두 자체 이용약관으로 재배포 · 자동 수집을 제한했고, 표준 라이선스 값 14개 가운데 자체 약관을 적을 값은 없습니다. 사람은 약관을 읽고 판단할 수 있지만 에이전트는 이용 조건을 확인할 수 없습니다.
문제의 원인
데이터 자체보다 데이터를 쓰기 위한 사실이 빠져 있습니다. 같은 이름의 컬럼이 다른 단위를 쓰고, 같은 사실이 여러 번 보고되며, 이용 조건의 범위가 적혀 있지 않습니다. 사람은 담당자 문의로 누락 사실을 보완하지만 에이전트는 보완할 수 없습니다. 사례는 사례 영상에서 볼 수 있습니다.
표준이 하는 일
- 에이전트가 판단에 쓰는 사실 — 뜻 · 단위 · 기준 시점 · 이용 조건 — 을 데이터 설명서(마니페스트)에 기계가 읽는 형식으로 기록하게 합니다.
- 품질을 같은 공식으로 측정하고, 측정한 것과 측정하지 못한 것을 함께 기록하게 합니다.
- 근거가 없을 때 에이전트가 추정하지 않고 보류할 수 있도록 판정의 근거를 남기게 합니다.
이 설계의 논거와 표준이 하지 않는 것은 설계 근거에 있습니다. 효과는 효과 확인 실험에서 확인합니다.
사례 영상
표준이 무엇을 바꾸는지 사례로 보입니다. 설명용 예시 · 실제 데이터 · 실행 기록을 구분해 표시합니다. 영상에는 소리가 없고 화면의 글이 내용을 전합니다. 자막은 기본으로 꺼져 있으며 한국어 · 영어를 고를 수 있습니다.
시연 기록 영상은 이전 버전 규칙에 따른 실행 기록으로 제작했습니다. 에이전트의 판단은 측정 규칙과 관계없지만, 화면의 마니페스트 형식은 지금의 어휘표와 다릅니다. 자막(.vtt)은 내려받기에서 제공합니다.
시작하기
다루는 범위 — 표 형태(STRUCT)와 시계열(TSERIES) 데이터는 실행 항목까지 제공합니다. 문서(TEXT) · 이미지(IMAGE) · 지시문 · 응답 쌍(PT) 데이터도 절차는 같으며, 유형별 추가 항목은 이후 버전에서 추가할 예정입니다.
시작 전 준비 자료
작업을 시작하기 전에 다음 자료를 준비합니다. 자료가 없으면 작성 가능한 기재 항목부터 채웁니다.
| 자료 | 확인 위치 | 없는 경우 |
|---|---|---|
| 데이터 파일 | 담당 시스템, 포털 등록분, 사내 데이터 카탈로그 | 1단계의 기재 작업부터 가능 |
| 현재 등록 정보 | 공공데이터: 포털 등록 화면 · 기업 데이터: 사내 카탈로그 또는 거래소 상품 등록 정보 | 새로 작성 |
| 컬럼 설명 | 원본 데이터베이스의 컬럼 주석 | 마니페스트 작성 (1단계)에서 작성 |
| 갱신 주기 | 실제 갱신 이력 | 실제 주기를 먼저 확인 |
| 이용 조건 | 공공데이터: 기관의 개방 정책 · 기업 데이터: 이용약관 · 라이선스 문서 (시행일 포함) | 담당 부서에 확인 |
준비 절차의 세 단계
데이터는 세 단계를 거쳐 AI가 활용할 수 있는 상태가 됩니다. 각 단계 끝에는 확인 지점이 있습니다.
작업 원칙은 네 가지입니다.
- 단계 순서를 지킵니다. 품질을 측정하기 전에 데이터를 찾을 수 있는 상태로 만듭니다.
- 미충족 항목은 보완합니다. 확인 지점을 통과하지 못하면 해당 항목을 보완하고 다시 확인합니다. 미충족은 탈락을 뜻하지 않습니다.
- 원본은 보존합니다. 정제본과 목적별 산출물은 원본과 함께 남습니다.
- 단계별로 나누어 수행할 수 있습니다. 1단계만 수행해도 에이전트의 추정 항목이 줄어듭니다.
이 사이트의 표시
| 표시 | 뜻 |
|---|---|
| 필수 | 현행 표준안이 필수로 규정한 사항 |
| 기준 | 표준 운영 주체가 발행하는 적용 기준이 정하는 사항 |
| 권고 | 이 사이트가 작업 편의를 위해 권하는 사항. 표준안의 요건이 아닙니다 |
| 예시 | 설명을 위한 값이나 문안 |
권고 항목은 표준안의 요건이 아니므로 조직 사정에 맞게 달리 결정할 수 있습니다.
표시와 스펙 문안의 shall · should · may의 대응은 확정 전입니다.
시작 전 데이터 확인
목표보유 파일의 데이터 유형과 인코딩, 1단계 준비 사항을 확인합니다.
데이터 유형 확인
데이터 유형을 먼저 결정합니다. 유형에 따라 측정 항목과 기재 항목이 달라집니다. [제1부 5.6 표 5-5] 필수
| 유형 | 정의 | 예 | 표준 식별자 |
|---|---|---|---|
| 표 형태 | 행과 열이 있고 컬럼마다 자료형이 정해진 데이터 | 사업장 등록 현황, 인허가 목록, 거래 내역, 제품 마스터 | STRUCT |
| 시계열 | 시간 순서로 값을 기록한 데이터. 표 형태의 특수한 경우 | 설비 센서 측정값, 일별 가격 | TSERIES |
| 문서 | 자연어 문장과 문서로 된 데이터 | 민원 답변, 고시 원문, 보고서, 제조 기술문서 | TEXT |
| 이미지 | 사진·도면 등 이미지 파일 | 시설물 점검 사진, 위성 영상, 제품 결함 검사 이미지 | IMAGE |
| 지시문 · 응답 쌍 | 지시문과 응답의 쌍 또는 선호 쌍으로 이루어진 텍스트 데이터 | 상담 질문–답변 쌍 | PT |
복수 유형 데이터 필수
대표 유형 하나를 정해 종합 표시에 사용합니다. 파일이나 구성요소가 여러 유형에 해당하면 각 구성요소에 해당하는 확인 항목을 함께 적용합니다. 대표 유형을 선택했다고 해서 다른 유형의 확인 항목을 생략하지 않습니다. [제2부 8.2]
시계열은 표 형태의 특수한 경우입니다. 표 형태의 확인 항목을 그대로 쓰되 기준 시점·측정 주기·단위를 함께 적습니다. 권고
유형에 따라 달라지는 항목
유형에 따라 반드시 측정하는 항목의 집합(제2부 부속서 A.2), 최소한 측정해야 하는 항목(제2부 부속서 A.1), 기재해야 하는 추가 항목(제3부)이 달라집니다.
유형별 항목 목록은 기재 항목 · 품질 지표 페이지에서 확인할 수 있습니다. 현재 버전에는 표 형태와 시계열 데이터의 실행 항목을 수록했습니다. 문서 · 이미지 · 지시문 · 응답 쌍의 실행 항목은 표준 원문과 대조한 뒤 이후 버전에 수록합니다.
대조할 기준 자료가 없으면 정확성을 측정할 수 없습니다. 대조할 기준 자료가 없으면 「정확성 미측정」으로 표시합니다. 이 표시는 감점이 아닌 측정 상태를 뜻합니다. 해당 항목이 필수 측정 항목이면 다음 단계 전이가 성립하지 않을 수 있습니다. [제2부 7.4 · 8.1] 필수
개인정보가 포함된 데이터
참고 자료: 개인정보보호위원회 「가명정보 처리 가이드라인」(2026.3. 개정). 공공기관이라면 「공공 AX 프라이버시 안내서」(2026.7.)도 함께 확인합니다. 최신 버전은 개인정보보호위원회 자료실에서 확인합니다.
개인정보를 포함한 데이터셋은 비식별화 처리 여부를 기재해야 합니다. [제3부 부속서 A.1] 필수 처리 수준·방법·일시는 2단계에서 기재합니다.
이 절차는 공개 제공을 대상으로 합니다. 공개가 제한되는 데이터는 이 절차의 대상에서 제외합니다. 통제된 환경에서 준비할 수 있는지는 별도로 판단합니다.
완료 조건
- 내 데이터 진단에 파일을 넣고 「데이터 유형」과 「인코딩」 결과가 예상과 일치하는지 확인합니다.
내 데이터 진단
파일 하나를 넣으면 에이전트가 이 데이터에서 무엇을 알 수 있고 무엇을 추정해야 하는지가 네 가지 판단으로 나옵니다. 추정을 줄이는 다음 작업은 효과가 큰 순서로, 데이터 설명서(마니페스트) 초안과 검증된 사실은 복사 가능한 형태로 제공합니다.
계산은 모두 이 페이지 안에서 수행하며 파일은 어디에도 전송하지 않습니다. 기재 항목은 마니페스트 작성 (1단계)의 작성기와 같은 값을 씁니다.
현재 상태 자가 확인 5문항
이미 개방 중인 데이터는 이 5문항으로 시작 단계를 결정합니다. 응답에 따라 시작 단계가 마니페스트 작성(1단계) 또는 품질 측정(2단계)으로 정해집니다.
판정 규칙 — 가장 앞의 「아니오」가 시작점을 결정합니다. 뒤 문항의 응답은 앞 문항의 조건이 충족된 뒤에 유효합니다. 따라서 뒤 문항이 「예」여도 시작점은 가장 앞의 「아니오」를 따릅니다.
| 가장 앞의 「아니오」 | 시작점 | 근거 |
|---|---|---|
| 1번 또는 2번 | 마니페스트 작성 (1단계) | 개방 형식과 컬럼 설명이 없으면 품질 측정 불성립 |
| 3번 또는 4번 | 1단계 기재 항목 작성 | 등록 화면 입력 항목에 해당 |
| 5번 | 품질 측정 (2단계) | 한계 기록은 2단계의 작업 |
| 없음 (모두 「예」) | 품질 측정 (2단계) | 기재 항목 충족과 품질 측정은 별개 |
「아니오」 응답 수는 담당자의 오류와 무관합니다. 기존 등록 화면은 일부 항목의 입력이나 기계 판독 형식의 제공을 지원하지 않았습니다.
30분 실습
목표예시 파일로 1 · 2단계를 30분 안에 수행합니다.
진단 화면
실습은 브라우저의 내 데이터 진단에서 수행합니다. 파일은 브라우저 안에서만 읽습니다. 화면은 확인 항목과 측정 가능한 지표를 계산하고 데이터 설명서(마니페스트) 초안을 만듭니다. 기준값은 내장하지 않습니다.
| 화면 구성 | 입력 · 확인 내용 | 실습 |
|---|---|---|
| 파일 입력 | CSV · XLSX 파일 선택 또는 「예시 파일로 진단」 | 실습 1 |
| 기재 항목 탭 | 발견 계층 23개 항목 입력 · 항목별 충족 여부 | 실습 2 · 4 |
| 컬럼 탭 | 컬럼별 자료형 · 설명 · 필수 표시 · 레코드 키 (csvw:tableSchema) |
실습 3 |
| 측정 상세 탭 | 측정한 지표의 점수 · 측정하지 못한 지표와 사유 | 실습 5 |
| 다음 작업 | 에이전트가 추정해야 하는 판단이 줄어드는 순서의 작업 목록 | 실습 4 · 6 |
| 마니페스트와 결과서 탭 | 마니페스트 초안 · 결과서 · 다음 작업 목록 (복사) | 실습 6 |
입력을 갖출수록 측정한 지표가 늘어납니다. 예시 파일만 넣으면 필수 지표 13개 중 6개를, 1단계 마니페스트를 채우면 7개를 측정합니다. 두 경우 모두 D5-03은 [제2부 부록 Ⅰ]의 예시 패턴으로 측정한 잠정값입니다.
화면은 미측정 결과와 함께 사유를 제시합니다. 예를 들어 「정확성 미측정」 대신 「공인 참조 기준이 없어 D3-01을 측정하지 못함」으로 기록하므로, 담당자가 준비할 자료를 확인할 수 있습니다.
활성 공식 적용 기준이 없으므로 화면은 공식 품질 등급을 판정하지 않습니다. 예시 패턴으로 산출한 등급은 잠정(PROVISIONAL)으로 표기하며 공식 등급으로 쓰지 않습니다.
화면의 결과는 표준과 활성 공식 적용 기준에 따라 검증합니다. 측정 대상과 계산 방법도 같은 근거로 대조합니다.
명령행 진단 도구는 공개 전입니다. 공개 계획은 개발 현황과 향후 공개의 「진단 도구 배포 버전」에 있습니다.
실습 절차
예시 파일로 준비 절차를 실습합니다. 각 실습에 수행할 작업과 예상 결과를 제시합니다. 내 데이터 진단 화면을 함께 열어 진행합니다.
이 실습은 준비 1단계(마니페스트 작성)와 2단계(품질 측정)의 결과 확인까지 다룹니다. 3단계(목적별 준비)는 다루지 않습니다. 실습의 순서는 「실습 1~6」으로 부르며 준비 단계(1 · 2 · 3단계)와 구분합니다.
준비
예시 파일(example.csv)은 사업장 등록 정보 20건과 컬럼 8개로 구성됩니다. 「내 데이터 진단」의 「예시 파일로 진단」은 같은 파일을 불러옵니다. 파일 내용과 1단계를 마친 기재 예(meta.json) · 컬럼 스키마(columns.json)는 위 실습자료에서 복사할 수 있습니다. 소속 조직의 데이터로 진행할 수 있으며, 이 경우 아래 값 대신 해당 데이터의 값을 입력합니다.
실습 1 · 현재 상태 확인 (2분)
수행할 작업 — 「예시 파일로 진단」을 실행합니다. 기재 항목은 입력하지 않습니다.
예상 결과
| 확인 항목 | 값 |
|---|---|
| 기재 항목 | 1 / 23 |
| 측정한 정식 필수 지표 | 6 |
| 측정 완성도 | DM-0 |
1 / 23은 정상 결과입니다. 데이터 파일에는 마니페스트가 들어 있지 않습니다. 충족된 1개는 화면이 파일에서 계산한 체크섬입니다.
실습 2 · 기재 항목 작성 (10분)
수행할 작업 — 「기재 항목」 탭에서 다음 다섯 항목을 입력합니다. 공공데이터는 포털 등록 화면에서, 기업 데이터는 사내 데이터 카탈로그나 상품 등록 정보에서 같은 값을 옮겨 적을 수 있습니다.
| 항목 | 기재 내용 | 예시 파일의 값 |
|---|---|---|
| 제목 | 등록 화면의 제목 | 예시 사업장 등록 정보 |
| 설명 | 수록 내용을 밝힌 한두 문장 | 지역별 사업장의 등록 정보와 영업 상태를 수록한 예시 데이터셋입니다. |
| 키워드 | 검색어 3개 이상 | 사업장, 산업분류, 지역 |
| 언어 | 값 목록에서 선택 | KOR |
| 접근 권한 | 값 목록(PUBLIC · RESTRICTED · NON_PUBLIC)에서 선택 |
PUBLIC |
주의할 점 — 갱신 주기는 「수시」와 같은 자유 문자열로 적지 않습니다. 값 목록에서 고르면 마니페스트에는 다음과 같은 표준 주소가 들어갑니다.
http://publications.europa.eu/resource/authority/frequency/ANNUAL
고유 식별자는 소속 조직의 발급 정책을 먼저 확인합니다. 정책이 없으면 고유 식별자 정하기의 잠정 규칙을 적용합니다.
예상 결과 — 다섯 항목을 입력하면 기재 항목이 6 / 23이 됩니다.
실습 3 · 컬럼 설명 작성 (10분)
수행할 작업 — 「컬럼」 탭에서 컬럼마다 자료형과 설명을 기재합니다. 다음은 앞의 세 컬럼의 기재 예입니다.
| 컬럼 | 자료형 | 설명 |
|---|---|---|
bizId |
string |
사업장 고유 등록번호. B-YYYY-NNNN 형식 |
bizName |
string |
사업장 명칭 |
industryCode |
string |
한국표준산업분류 세세분류 코드 |
bizId에는 필수 표시를 함께 답니다. 이 표시가 있으면 D1-01(필수 필드 충족도)을 측정합니다. 레코드 키도 bizId로 지정합니다.
예상 결과 — 컬럼 설명 8 / 8. 측정한 정식 필수 지표가 7로 늘어납니다.
실습 4 · 나머지 기재 항목 입력 (2분)
수행할 작업 — 나머지 기재 항목을 입력합니다. 예시 파일에서는 「다음 작업」의 예시 마니페스트 채우기로 1단계를 마친 상태를 불러옵니다.
예상 결과
| 확인 항목 | 실습 1 | 실습 4 |
|---|---|---|
| 기재 항목 | 1 / 23 | 23 / 23 |
| 컬럼 설명 | 0 / 8 | 8 / 8 |
| 측정한 정식 필수 지표 | 6 / 13 | 7 / 13 |
| 에이전트가 추정해야 하는 판단 | 10 | 2 |
데이터값은 변경되지 않았습니다. 파일은 그대로입니다. 변경된 것은 값을 해석하는 데 필요한 기재 정보입니다.
실습 5 · 결과 확인 (3분)
수행할 작업 — 결과 머리의 수치와 「측정 상세」 탭에서 다음 세 가지를 순서대로 확인합니다.
| 확인 항목 | 예시 파일의 결과 | 의미 |
|---|---|---|
| 측정 완성도 | DM-0 | 최소 측정 지표(MMI) 4개를 모두 측정함. D5-03은 예시 패턴으로 측정한 잠정값 |
| 미측정 지표 | D2-02 · D3-01 등 |
지표별 측정에 필요한 자료를 함께 표시 |
| 품질 등급 | 잠정 (PROVISIONAL) |
활성 공식 적용 기준이 없어 공식 등급으로 쓰지 않음 |
점수가 모두 1.0000이어도 공식 품질 등급은 판정하지 않습니다. 원인은 데이터가 아니라 활성 공식 적용 기준 미발행입니다. 화면의 잠정 등급은 예시 프로파일과 측정한 차원만으로 산출한 값입니다. 기준 발행은 담당자의 작업 범위가 아닙니다.
실습 6 · 후속 작업 확인 (3분)
수행할 작업 — 결과 아래의 「다음 작업」을 확인합니다. 세 묶음으로 나뉩니다. 작업 목록은 「마니페스트와 결과서」 탭에서 복사합니다.
| 묶음 | 의미 | 예시 파일의 항목 |
|---|---|---|
| 즉시 수행 가능 | 추가 자료 불필요 | 레코드 키 지정 · 기재 항목 입력 |
| 자료 확보 후 수행 | 확보할 자료와 측정 가능해지는 지표 | 코드표 → D2-02 D3-01 |
| 담당자 범위 외 | 사유 기록 후 대기 | 활성 공식 적용 기준 발행 → 공식 등급 판정 |
실습 완료 후
이 실습은 준비 1단계와 2단계의 결과 확인까지입니다. 예시 데이터는 발견할 수 있는 상태가 되었고, 품질 근거가 있으며, 측정하지 못한 지표와 사유가 기록되어 있습니다. 3단계(목적별 준비)는 활용 목적이 확정되기 전에는 수행하지 않습니다.
소속 조직의 데이터로 다시 진단합니다. 예시 파일은 형식 오류를 제거한 파일입니다. 실제 데이터에서는
D5-01(형식 유효성)과D7-01(인코딩 일관성)이 1.0000 미만으로 측정될 수 있습니다. 그 차이를 확인하는 것이 이 실습의 목적입니다.
완료 조건
- 실습으로 만든 결과서가 진단 화면의 결과서와 같은 항목 이름(제2부 표 9-1)을 쓰는지 확인합니다.
가이드 › 데이터 제공
마니페스트 작성 (1단계)
목표데이터 설명서(마니페스트)의 발견 계층 23개 항목을 채워 에이전트가 추정해야 하는 판단을 줄입니다. 데이터값은 바꾸지 않습니다.
1단계 점검표 — 기재 항목 23개 (데모 프로파일)
0 / 23 채움
데이터셋
배포 자원 (파일마다)
체크 상태는 이 브라우저에만 저장됩니다. 실제 기재 여부는 내 데이터 진단이 확인합니다. 원천: 어휘표 v0.10.5 데모 프로파일.
단계 개요
현재 버전으로 완결할 수 있습니다. 기재 항목 23개 유형을 모두 채울 수 있습니다. 고유 식별자는 고유 식별자 정하기의 잠정 규칙을 사용합니다.
목표는 데이터가 무엇이고 어디에 있는지를 기계가 읽을 수 있는 형식으로 기록하는 것입니다.
| 담당자 | 진단 도구 | 표준 운영 주체 |
|---|---|---|
| 기재 항목 작성 · 컬럼 설명 작성 · 개방 형식 변환 | 체크섬 계산 · 마니페스트 초안 생성 | — |
이 단계의 주요 작업은 데이터 담당자가 수행합니다.
데이터값은 변경하지 않습니다. 데이터의 내용은 유지하고 설명을 추가합니다. [제1부 5.2]
| 작업 | 결과 |
|---|---|
| 전용 형식의 개방 형식 변환 | CSV·JSON 등 |
| 기재 항목별 데이터 설명 작성 | 마니페스트 |
| 컬럼별 의미 기재 | 컬럼 정의서 |
담당자와 진단 도구는 확인 지점 ①에서 필수 기재 항목의 충족 여부를 확인합니다. [제4부 6.4]후속 부 갖추어지지 않으면 보완하고 다시 확인합니다.
확인 항목
기재 항목 유형은 23개입니다. 데이터셋에 19개, 배포 자원(배포하는 파일)마다 4개를 적용합니다. 파일이 3개면 기재값은 23개가 아니라 19 + 4×3 = 31개입니다. 이 수는 어휘표 v0.10.5 데모 프로파일 기준이며, 표준안 기준은 15 + 4 × 배포 자원 수입니다. [제3부 부속서 A.1] 전체 목록과 판단 기준은 기재 항목 페이지에 있습니다.
자주 누락되거나 잘못 기재되는 6개 항목은 다음과 같습니다.
| 항목 | 구분 | 판단 기준 | 자주 나오는 문제 |
|---|---|---|---|
| 고유 식별자 | 필수 | 변경하지 않는 영구 식별값. 해석 가능한 URI를 원칙으로 함. 내려받는 주소와 구분 | 조직 내부 번호를 그대로 사용 |
| 키워드 | 필수 | 3개 이상 | 1~2개만 기재 |
| 갱신 주기 | 필수 | 표준 어휘의 URI로 기재 | 「분기」·「수시」 등 자유 문자열 |
| 라이선스 | 필수 | 어휘표 kr-license 14값(KOGL-0~4 · KOGL-AI · CC 등) 중에서 선택. 목록에 없는 라이선스의 기재 방법은 확인 중 |
「예/아니오」 또는 긴 문장 |
| 미디어 타입 | 필수 | text/csv 형태의 IANA 표기 |
「텍스트」·「이미지」 |
| 체크섬 | 필수 | 배포 자원마다 SHA-256 값 | 기재 자체가 누락 |
조직에 식별자 발급 정책이 없으면 고유 식별자 정하기의 잠정 규칙을 적용합니다. 정책이 마련되면 그 정책이 우선합니다.
고유 식별자와 접근 주소는 다릅니다. 고유 식별자는 데이터셋을 식별하는 값이고, 접근 주소는 실제 데이터에 접근하는 위치입니다. 두 항목을 같은 값으로 채우지 않습니다.
파일이 여러 개면 배포 자원을 여러 개로 구성합니다. 표·이미지·영상을 함께 제공한다면 배포 자원마다 접근 주소·미디어 타입·파일 형식·체크섬을 따로 적습니다.
표 형태 데이터의 컬럼 스키마는 조건부 필수입니다. 작성 방법은 아래 「컬럼 정의서 작성」에, 판단 기준은 기재 항목 페이지에 있습니다.
컬럼 정의서 작성
컬럼 정의서는 자주 누락되며, 누락되면 데이터값의 의미를 확인하기 어렵습니다.
필요성
원본 데이터베이스에 있는 컬럼 설명은 CSV로 내보낼 때 사라질 수 있습니다. 컬럼명만 남으면 mkt_nm과 같은 명칭의 의미를 확인하기 어렵습니다.
컬럼별 기재 항목
컬럼별 기재 항목 — 표 7행 펼치기
| 항목 | 구분 | 예 |
|---|---|---|
| 컬럼명 | 필수 | bizr_no |
| 표시 이름 | 권고 | 사업자등록번호 |
| 자료형 | 필수 | 문자열 |
| 설명 | 필수 | 국세청이 부여한 사업자 등록 번호. 하이픈 없음 |
| 단위 | 권고 | 원, ㎡, ℃ |
| 코드값 의미 | 권고 | 01=운영, 02=휴업, 03=폐업 |
| 빈 값 표기 | 권고 | 빈칸 |
코드값의 의미와 빈 값 표기는 표준의 요건이 아니지만 실무에서 자주 문제가 됩니다. 숫자 코드의 의미가 없으면 해당 컬럼을 해석하기 어렵습니다. 빈칸·
-·N/A·0을 혼용하면 0이 실제 값인지 빈 값인지 구별할 수 없습니다.
파일 형식 결정 권고
| 상황 | 권장 | 근거 |
|---|---|---|
| 표 형태 | CSV (UTF-8) | 범용 도구에서 판독 가능 |
| 표 형태 · 대용량 | Parquet 병행 | 내려받기 · 처리 속도 향상 |
| 계층 구조가 있는 데이터 | JSON | 표로 평탄화하면 계층 관계 손실 |
| 지리 정보 | GeoJSON | 좌표계 포함 |
| 문서 | 원문 형식 + 텍스트 추출본 | 원문만으로는 기계 판독 불가 |
| 이미지 | 표준 이미지 형식 | 전용 형식은 범용 도구에서 판독 불가 |
피해야 할 형식
- 특정 프로그램에서만 열리는 형식만 제공
- 셀 병합·소계 행·여러 줄 머리글이 들어간 표
- 설명 없이 여러 표를 시트로 나눠 담은 파일
이미지 라벨(정답지), 학습 · 검증 분할, 지시문 · 응답 쌍의 대응 관계, 문서 분할 단위는 이 단계의 요건이 아닙니다. 특정 활용 목적에 필요한 항목은 목적별 준비 (3단계)에서 다룹니다. 라벨이 없는 사진도 「찾을 수 있는 데이터」가 될 수 있습니다.
기준 인코딩은 UTF-8입니다.
EUC-KR·CP949는 미준수로 판정됩니다. [제2부 부속서 A.4] 담당자가 직접 수정할 수 있는 항목입니다. 조직이 다른 인코딩 기준을 명시하면 그 기준을 따르고, 적용한 기준을 메타데이터에 기록합니다.바이트 순서 표시의 유무 · 줄바꿈 문자의 차이는 측정 대상이 아니므로 별도 조치가 필요하지 않습니다.
완료 조건
- 진단 화면의 기재 항목이 23 / 23 인지 확인합니다.
- 「추정해야 함」으로 남은 판단을 확인하고, 담당자가 해결할 수 없는 항목은 사유를 기록합니다.
가이드 › 데이터 제공
고유 식별자 정하기
목표데이터셋에 변경되지 않는 고유 식별자를 결정합니다.
기재 항목 23개 가운데 담당자가 혼자 결정하기 어려운 유일한 항목입니다. 소속 조직(공공기관 · 기업 · 단체)에 발급 정책이 없으면 고유 식별자를 확정할 수 없습니다. 이 페이지는 정책이 마련되기 전까지 사용할 잠정 규칙을 제시합니다. 권고
표준이 요구하는 것 — URI. 변경하지 않는 영구 식별자. 해석 가능한 URI를 원칙으로 합니다. [제3부 부속서 A.1] 필수
고유 식별자 결정 절차
| 상황 | 결정 |
|---|---|
| 조직 발급 정책 있음 | 조직 정책 적용 (이 잠정 규칙보다 우선) |
| 정책 없음 · 조직 도메인 있음 | 1순위 · 조직 도메인 아래 고정 경로 지정 |
| 정책 · 조직 도메인 없음 | 2순위 · 상위 조직(공공기관의 상위기관 · 기업의 그룹사)이나 공통 네임스페이스의 사용 가능 여부 확인 |
| 정책 · 도메인 · 공통 네임스페이스 모두 없음 | 유일성이 보장되는 식별자 부여 · 해석되지 않는다는 사실을 한계로 기재 |
비워 두지 않습니다. 기재하지 않으면 1단계 확인을 통과하지 못합니다.
작성 규칙
식별자는 네임스페이스 + 데이터셋 이름 두 부분으로 구성합니다.
https://data.<조직도메인>/id/dataset/<데이터셋이름>
└────────── 네임스페이스 ──────────┘└─ 데이터셋 이름 ─┘
조직이 통제하는 고정 영역 한 번 정하면 바꾸지 않는다
| 구성 부분 | 포함 요소 | 제외 요소 |
|---|---|---|
| 네임스페이스 | 조직을 나타내는 고정 주소 | 담당 부서명 — 조직 개편 시 변경 |
| 데이터셋 이름 | 데이터셋을 가리키는 고정 이름 · 의미 없는 일련번호도 가능 | 버전 · 연도 — 갱신 시 변경 파일 형식 — 형식 변경 시 무효 |
핵심 규칙: 변하는 요소를 식별자에 넣지 않습니다. 버전 · 연도 · 형식은 별도 항목에 기재합니다. 버전은 dcat:version, 기준 시점은 시간 범위, 형식은 dct:format에 기재합니다.
예시
예시 — 표 7행 펼치기
| 판단 | 값 | 사유 |
|---|---|---|
| 적합 | https://data.example.go.kr/id/dataset/biz-registry |
네임스페이스 고정 · 이름 불변 |
| 적합 | https://data.example.go.kr/id/dataset/d-00417 |
의미 없는 일련번호도 사용 가능 |
| 부적합 | https://data.example.go.kr/file/biz_2025_v3.csv |
연도 · 버전 · 형식 포함 |
| 부적합 | BIZ-2025-001 |
URI 아님 |
| 부적합 | https://www.data.go.kr/data/15029008/fileData.do |
접근 주소 · 재등록 시 변경 |
| 적합 | https://data.example.com/id/dataset/sales-daily |
기업 도메인 아래 고정 경로 · 이름 불변 |
| 부적합 | https://market.example.com/products/48213 |
거래소 상품 페이지 주소 · 상품 재등록 시 변경 |
접근 페이지 주소를 고유 식별자로 쓰지 않습니다. 포털의 데이터 페이지나 거래소의 상품 페이지는 등록 화면의 접근 경로이며, 재등록·이관 시 변경됩니다. 접근 주소는 별도 항목(
dcat:accessURL)에 적습니다.
공공데이터포털에 등록된 데이터 — 어휘표 v0.10.5 의 1.1.1 은
dct:identifier에 포털 목록키를 적고, 데이터셋 URI를https://www.data.go.kr/data/{목록키}로 둡니다. 이 경우 위 결정 흐름보다 어휘표를 따릅니다. 목록키가 재등록·이관 때 변경되는 경우를 어떻게 다룰지는 확인 중입니다.
식별자 부여 후 유지 원칙
| 상황 | 식별자 처리 |
|---|---|
| 값 정제 | 유지 — 같은 데이터셋 |
| 새 버전 발행 | 유지 — 버전은 버전 번호로 구분 |
| 파일 형식 추가 | 유지 — 배포 자원 추가 |
| 목적별 파일 생성 | 유지 — 원본 데이터셋의 식별자 사용 |
| 데이터셋 통합 · 분할 | 새로 부여 — 다른 데이터셋 |
바꾸지 않는 것이 식별자의 목적입니다. 바꾸면 그 데이터를 가리키던 모든 참조가 끊어집니다.
담당 부서 확인 사항
정책 수립 요청 시 다음 사항을 함께 전달합니다.
| 확인 사항 | 확인 목적 |
|---|---|
| 조직이 통제하는 도메인이 있는가 | 네임스페이스 결정 |
| 그 도메인의 유지 기간이 보장되는가 | 식별자 영속성 확보 |
| 이미 쓰는 데이터셋 번호 체계가 있는가 | 기존 번호 체계를 URI 경로에 반영 가능 |
| 식별자 발급·회수를 누가 관리하는가 | 중복 발급 방지 |
이 페이지의 규칙은 잠정 규칙입니다. 조직의 정책이나 상위 지침이 마련되면 그 정책이나 지침이 우선하며, 이미 부여한 식별자는 유지합니다.
완료 조건
- 진단 화면의 「데이터셋 식별자」가 URI 형식인지 확인합니다.
가이드 › 데이터 제공
품질 측정 (2단계)
목표품질을 표준 공식으로 측정하고, 측정 완성도와 점수를 결과서에 기록합니다.
이 단계에서 하는 일
점수 산출과 측정 완성도 DM-0까지는 활성 공식 적용 기준 없이 가능합니다. 표 형태 예시를 「내 데이터 진단」에 넣으면 파일만으로 필수 지표 13개 중 6개를, 1단계 데이터 설명서(마니페스트)를 채우면 7개를 측정합니다. 나머지 지표는 코드표 · 기준 시점 등 외부 자료를 요구합니다. 측정되는 지표 수는 데이터 유형과 갖춘 자료에 따라 달라집니다. 공식 등급은 활성 공식 적용 기준이 발행되어야 정해집니다.
목표는 데이터의 품질을 측정하고 그 근거를 남기는 것입니다.
| 담당자 | 진단 도구 | 표준 운영 주체 |
|---|---|---|
| 자료 준비 · 결과 확인 · 수정 가능한 값 수정 · 수정할 수 없는 한계 기록 | 점수 계산 · 결과서 생성 | 적용 기준 발행 · 등급과 다음 단계 진행 판정 |
담당자는 공식을 적용해 점수를 계산하지 않습니다. 담당자는 자료를 준비하고, 점수가 낮은 항목과 미측정 사유를 확인하며, 수정 가능한 값과 수정할 수 없는 한계를 구분해 기록합니다.
2단계는 빠진 값을 보완하거나 잘못된 값을 수정하므로 데이터값이 달라질 수 있습니다.
| 작업 | 결과 |
|---|---|
| 7개 차원의 점수 측정 | 품질 측정 결과서 |
| 점수가 낮은 항목 수정 | 정제본 |
| 수정 내용 기록 | 처리 이력 |
| 수정할 수 없는 한계 기재 | 한계 기재 |
7개 차원 필수
[제2부 5.2]
기계 판독성을 먼저 확인합니다. 파일을 열 수 없으면 나머지 차원을 측정할 수 없으므로 다른 차원보다 먼저 판단합니다. [제2부 7.3]
7개 차원의 지표 · 측정 공식 · 전제 조건은 품질 지표에, 점수가 낮을 때 고치는 방법은 결함 수정 (2단계)에 있습니다.
점수와 등급의 구분
담당자가 확인할 사항은 네 가지입니다.
| 점수 계산 주체: 진단 도구 | 7개 차원별 값. 담당자의 공식 적용 불요 |
| 공식 등급 산출: 활성 공식 적용 기준 적용 | 같은 점수도 적용 기준에 따라 등급이 다름 |
| 기준 부재 시 공식 등급 미부여 | 점수와 측정 완성도를 기록. 예시 패턴으로 산출한 등급은 잠정(PROVISIONAL)으로 표기하며 공식 등급으로 쓰지 않음 |
| 판정의 출발점: 최소 차원 점수 | 한 차원의 점수가 낮으면 다른 차원 점수와 무관하게 그 차원이 품질 한계를 결정 |
활성 공식 적용 기준이 없는 동안에도 측정 결과는 유효한 기초 자료입니다. 기존 점수와 미측정 사유는 기준 발행 후 재측정과 판정에 사용합니다. 적용 기준이 측정 방법에 영향을 주는 항목은 다시 측정하고 새 결과서를 발행합니다.
등급이 정해지는 절차의 세부는 판정 절차에 있습니다. 담당자가 수행하는 절차가 아닙니다.
측정 완성도 필수
점수와 별개로 요구된 지표 가운데 측정을 마친 정도가 함께 기록됩니다. 이것을 측정 완성도(표준 용어: 진단 성숙도, DM)라 합니다. 측정 완성도는 도구가 아래 결정표를 위에서부터 적용해 처음 충족한 줄로 판정합니다. [제2부 부속서 B.5 표 B.4]
D5-03은 적용 기준의 파라미터를 씁니다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ의 예시 패턴을 임시로 적용하므로 4행(DM-0)이 성립하고, 결과는 잠정으로 표기합니다.DM-1은 단순히 필수 지표의 일부를 측정했다는 뜻이 아닙니다. 최소 측정 지표를 모두 측정하고, 측정 충족률(표준 용어: 평가 범위)이 적용 기준이 정한 하한 이상이어야 합니다. 그 하한은 표준이 정하지 않습니다.
적용 기준 없이도 DM-0까지는 도달합니다. 최소 측정 지표인
D5-03(통계적 타당성)은 활성 공식 적용 기준이 없는 동안 제2부 부록 Ⅰ의 예시 더미값 패턴으로 측정하고 결과를 잠정으로 표기합니다. 측정 충족률의 하한에는 제2부 부록 Ⅰ의 예시값을 쓰지 않습니다. 활성 공식 적용 기준이 없으면 DM-1을 판정할 수 없으므로 결과는 DM-0(잠정)까지입니다. 공식 등급과 조직 간 비교에는 DM-2와 활성 공식 적용 기준이 있어야 합니다. [제2부 5.1 · 부속서 A.4.1 · 부록 Ⅰ]
파일이 비어 있거나(레코드 0건) 깨져 열리지 않으면 진단에 들어가지 않습니다. 측정 완성도와 등급을 기록하지 않습니다.
미측정 사유의 5개 구분
미측정 사유를 한 상태로 묶지 않습니다. 사유에 따라 담당자의 조치가 달라집니다. [제2부 부속서 B.2]
| 적용성 | 공식 점수 | statusFactor | 담당자가 할 일 |
|---|---|---|---|
APPLIED | 점수 | 1 | 없음 |
PARTIALLY_APPLIED | null | coverage | 나머지 대상의 기준 자료 확보 |
PRECONDITION_UNMET | null | 0 | 기준 자료 확보 후 측정 |
NOT_APPLICABLE | null | 산정에서 제외 | 조치 불필요 |
OPTIONAL_SKIPPED | null | 산정에서 제외 | 없음 |
NOT_APPLICABLE을 결손으로 오해하지 않습니다. 그 유형이나 조건에 적용되지 않는 지표이며 수정 대상이 없습니다.
점수가 높아도 측정 완성도가 낮으면 공식 등급이 부여되지 않습니다. 두 값은 서로를 대체하지 않습니다. [제2부 8.1]
측정 결과서 판독 순서
완료 조건
- 진단 화면의 측정 완성도(DM-0 · DM-1 · DM-2)와 측정하지 못한 지표의 사유를 확인합니다.
- 결과서의 평가 상태가 PROVISIONAL 인지 확인합니다. 예시 프로파일로 산출한 잠정 등급은 공식 등급이 아닙니다.
가이드 › 데이터 제공
결함 수정 (2단계)
목표점수가 낮은 항목을 고치고, 고칠 수 없는 한계는 기록합니다. 원본 파일 · 정제본 · 결과서를 구분해 보관합니다.
점수가 낮은 항목 수정 권고
정제 작업은 세 범주로 구분합니다.
| 범주 | 작업 내용 | 개선 차원 |
|---|---|---|
| 컬럼명 정리 | 서로 다른 컬럼 이름 · 표기를 하나로 통일 | 일관 · 기계 판독 |
| 값 정리 | 식별자 · 분류체계 · 표준 코드에 맞춰 값 정리 | 빠짐 · 일관 · 형식 · 중복 |
| 설명 보강 | 측정 결과와 한계를 설명에 기재 | 기계 판독 |
차원별 우선 조치
점수가 낮은 항목 수정 권고 — 표 7행 펼치기
| 점수가 낮은 차원 | 우선 조치 |
|---|---|
| 빠짐 | 핵심 컬럼의 빈 값을 확인. 채울 수 없으면 빈 값 표기를 통일하고 그 사실을 기재 |
| 일관 | 같은 개념에 다른 이름을 쓰는지 확인. 날짜·코드 표기를 통일 |
| 정확 | 원천과 대조. 기준 자료가 없으면 「정확성 미측정」으로 두고 이유를 기재 |
| 최신 | 갱신 주기를 실제 갱신 이력과 맞춤. 지키지 못할 주기를 적지 않음 |
| 형식 | 자료형·허용값·필수값 규칙을 정의하고 어긋나는 행을 찾음 |
| 중복 | 무엇이 같으면 같은 행인지(키)를 정의함. 키를 정의하지 않으면 레코드 단위 중복 판정이 불확실 |
| 기계 판독 | 개방 형식으로 변환. 셀 병합·소계 행·여러 줄 머리글 제거 |
수정할 수 없는 한계 기록 필수
모든 문제를 수정할 수 있는 것은 아닙니다. 수정할 수 없는 한계도 기재합니다. 이용자는 기록된 한계를 검토하여 데이터의 사용 여부와 범위를 판단합니다. 기록하지 않은 제약은 이용자가 확인할 수 없습니다.
| 기재 대상 | 예 |
|---|---|
| 알려진 치우침 | 전국 대상이나 수도권 데이터가 90% 이상 |
| 부적합한 용도 | 주민등록 기준 통계로 실제 상주 인구 분석에는 부적합 |
| 빠진 값의 원인 | 센서 점검(2.1%)·통신 오류(1.1%)로 결측 발생 |
| 측정하지 못한 이유 | 대조할 원천 자료가 없어 정확성 미측정 |
이 항목은 데이터의 결함 판정이 아니라 활용 범위를 판단하는 정보입니다.
원본 · 정제본 · 결과서의 관리 필수
데이터셋의 고유 식별자는 유지합니다. 정제했다고 해서 다른 데이터로 취급하지 않습니다. 원본 파일·정제 파일·배포 버전·데이터 설명서(마니페스트)·결과서·목적별 운용 파일은 각각 구분합니다.
| 구분 대상 | 구분 방법 |
|---|---|
| 원본 파일과 정제 파일 | 배포 자원과 체크섬으로 구분 |
| 배포 버전 | 버전 번호로 구분 |
| 마니페스트 | 버전마다 새로 발행 · 이전 버전 참조 [제3부 5.1] |
| 측정 결과서 | 측정할 때마다 새로 생성 |
| 목적별 운용 파일 | 목적마다 별도 파일로 생성 |
원본은 보존합니다. 정제로 원본을 덮어쓰지 않습니다.
측정 결과서 재작성 조건: 측정 대상 버전·측정 규칙·적용 기준·측정 시점의 유효성이 모두 같을 때만 기존 결과서를 사용합니다. 데이터를 정제했거나 다시 측정했다면 새 결과서를 만듭니다. 마니페스트는 해당 결과서를 주소와 체크섬으로 가리킵니다.
처리 이력 기록 항목 [제4부 12]후속 부
| 기록 항목 | 예 |
|---|---|
| 작업 내용 | 결측 보정, 코드값 정규화, 중복 제거 |
| 작업 일자 | 2026-08-14 |
| 버전 변경 | 원본 v1.0.0 → 정제본 v1.1.0 |
| 변경 사유 | 일부 구 단위 누락값 보정, 연령 구간 5세 단위로 세분화 |
기록이 없으면 정제 결과를 검증하기 어렵습니다.
빈번한 오류
다음 세 가지가 빈번합니다.
- 평균 점수로 등급 판단 (등급 판정은 가장 낮은 차원 점수에서 출발)
- 활성 공식 적용 기준이 아닌 값으로 산출한 등급의 공식 발표
- 데이터 정제 후 결과서 미갱신
필요성
이 단계의 작업은 이용자가 데이터의 재사용 가능성을 판단하는 근거를 작성합니다. 품질 점수와 함께 한계와 이력을 남겨야 합니다. 값의 상태와 변경 사유가 없으면 이용자가 데이터의 제약을 판단하기 어렵습니다.
품질 점수와 등급은 AI 활용을 위해 표준이 추가한 요건이며, 국제 FAIR 원칙이 요구하는 것이 아닙니다. 자세한 대응은 관련 표준과 대응에 있습니다.
| 잘못된 예 | 수정한 예 | 문제 원인 |
|---|---|---|
| 차원 점수 D1 0.92 · D2 0.88 · D3 0.93 · D4 0.86 · D5 0.89 · D6 1.00 · D7 0.97, 예시 가중치로 계산한 가중 평균 0.925 | — | 평균은 결정적 결손을 희석합니다. 후보 등급은 최소 차원 점수에서 산정을 시작합니다. 예시 가중치로 계산한 가중 평균 0.925 는 등급과 무관합니다 |
| J-GR-001 사례의 차원 점수, 활성 공식 적용 기준 없음 | — | 기준이 없으면 점수만 기록하고 공식 등급을 부여하지 않습니다. 예시 프로파일로 계산한 잠정 등급만 표기합니다. 같은 점수도 기준에 따라 다른 등급이 됩니다 |
| 데이터를 정제한 뒤 이전 결과서를 그대로 두었습니다 | 새 결과서를 만듭니다. 마니페스트는 새 결과서를 주소와 체크섬으로 가리킵니다 | 측정 대상 버전·측정 규칙·적용 기준·측정 시점이 모두 같을 때만 기존 결과서를 씁니다 |
완료 조건
- 수정한 파일을 다시 진단해 점수와 측정 완성도의 변화를 확인합니다.
가이드 › 데이터 제공
목적별 준비 (3단계)
목표활용 목적이 정해진 데이터에 그 목적의 운용 계층을 준비합니다.
이 단계에서 하는 일
목적별 자료는 미리 준비할 수 있습니다. 목적 등급은 해당 목적의 기준이 등록된 뒤 판정합니다.
목표는 데이터를 특정 활용 목적에 맞는 형태로 준비하는 것입니다.
| 담당자 | 진단 도구 | 표준 운영 주체 |
|---|---|---|
| 활용 부서와 목적 결정 · 추가 자료 준비 | 목적별 파일 생성 | 목적별 기준 등록 · 목적 등급 판정 |
활용 목적은 담당자가 단독으로 결정하지 않습니다. 데이터를 활용하려는 부서·조직과 함께 결정합니다.
3단계에서 생성한 산출물은 원본을 대체하지 않으며 원본과 함께 보존합니다. 활용 목적이 여러 개이면 목적별 산출물을 각각 생성합니다. [제1부 5.2]
모든 데이터에 적용하는 단계가 아닙니다. 활용 목적이 분명할 때만 수행합니다. 목적이 정해지지 않았으면 2단계에서 종료합니다.
6개 활용 목적
3단계는 활용 목적이 확정된 데이터에만 적용합니다. 목적 준비를 수행하는 경우, 목적 유형은 표준이 정한 아래 6개 값 중에서 선택합니다. 필수 검토 대상은 해당하는 목적으로 한정하며, 해당하는 목적이 없으면 선택하지 않습니다. [제1부 5.6]
여섯 활용 목적의 정의와 자동 활용 조건은 활용 목적과 자동 활용 조건에 있습니다.
활용 목적 선택 권고
| 데이터 특성 | 우선 검토 목적 |
|---|---|
| 정답 컬럼(예측 대상 값)이 있는 표 | ML |
| 라벨이 붙은 이미지 | DL |
| 질의응답의 근거로 쓰는 문서 | RAG |
| 코드 · 분류체계로 다른 데이터와 연결되는 표 | KG |
| 추세 · 계절성을 분석하는 시계열 | Stats |
| 지시문과 응답이 쌍을 이룬 텍스트 | FineTuning |
목적별 추가 준비 항목
목적별 세부 요건은 해당 목적에 등록된 기준이 정합니다. [제4부 9.2]후속 부 다음 표는 담당자가 미리 준비할 수 있는 사항을 정리합니다. 권고
| 목적 | 사전 준비 항목 |
|---|---|
ML | 정답 컬럼 지정 · 학습·검증 분할 기준 · 클래스별 건수 |
DL | 라벨 파일과 이미지의 대응 관계 · 촬영·수집 조건 |
RAG | 문서를 나눈 단위(조·항·문단) · 근거 위치 |
KG | 개체 식별자 · 사용한 분류체계와 코드표의 출처 |
Stats | 기준 시점 · 집계 단위 · 모집단 정의 |
FineTuning | 지시문–응답 쌍의 대응 관계와 출처 · 검수 여부 |
모든 목적에 공통 필수
- 어느 목적에 준비되었는지를 기재합니다.
- 목적별로 만든 파일에도 체크섬을 기재합니다.
목적을 판정할 수 없는 경우 필수
목적별 기준이 아직 마련되지 않은 경우가 있습니다. 이때는 비워 두지 않고 이유를 기재합니다. [제4부 9.4]후속 부
| 상황 | 기재 방법 |
|---|---|
| 그 목적의 기준이 등록되지 않았습니다 | 판정하지 않음: 기준 미등록 |
| 기준은 있으나 기준값이 발행되지 않았습니다 | 판정하지 않음: 기준값 미발행 |
| 앞 단계의 조건을 충족하지 못했습니다 | 판정하지 않음: 선행 조건 미충족 |
기준이 없거나 선행 조건을 충족하지 못한 경우에는 「해당 없음」이나 최하 등급으로 적지 않습니다. 판정하지 않은 것과 판정해서 미달인 것은 다릅니다. 「해당 없음」은 그 데이터 유형이나 목적에 항목이 적용되지 않을 때만 씁니다.
자동 활용 적격을 위한 데이터 측 조건
AI 에이전트가 담당자의 항목별 확인 없이 데이터를 불러와 활용하려면, 데이터 측에서 8개 조건을 충족해야 합니다. [제5부 표 9-2]후속 부 필수 조건 목록과 담당자의 작업은 활용 목적과 자동 활용 조건에 있습니다.
조건을 충족하지 못하면 표준안에 따른 자동 활용 적격을 표시할 수 없습니다. 사람이 확인하여 찾고 내려받아 사용하는 것은 가능합니다.
8개 항목은 데이터 측 조건입니다. 실제 자동 활용에는 제공 시스템의 인터페이스, 교환 방식, 변환 절차의 적합성도 필요합니다. 표준은 각 조건을 별도 수준으로 규정합니다. [제1부 표 6-1] 시스템 운영자와 사업 주관자가 해당 사항을 확인합니다.
파일을 바꾸면 체크섬도 함께 갱신합니다. 그대로 두면 검증에 실패하고 효력 정지 상태가 됩니다.
필요성
같은 데이터라도 활용 목적에 따라 준비 항목이 다릅니다. 예측 모델에는 정답 컬럼이 필요합니다. 검색에는 문서 분할 단위가, 지식그래프에는 개체 식별자가 필요합니다. 3단계는 목적별 차이를 반영해 추가 자료를 준비합니다.
목적별 준비와 목적 등급은 AI 활용을 위해 표준이 추가한 요건입니다. 자세한 대응은 관련 표준과 대응에 있습니다.
완료 조건
- 목적 등급은 해당 목적의 기준(프로파일)이 등록된 뒤 판정합니다. 해당 목적의 프로파일 등록 상태를 먼저 확인합니다.
가이드 › 데이터 제공
예시 데이터로 따라가기
이 데이터로 따라가기 ① · 데이터 개요
예시 데이터 · 실측 아래 ②~④에서 같은 데이터의 단계별 변화를 제시합니다. 예시용 가상 데이터이며 실재하는 조직이나 데이터를 가리키지 않습니다. 수치는 이 파일을 내 데이터 진단으로 측정한 값입니다.
원본 파일 example.csv — 20행 · 8열 · UTF-8
| bizId | bizName | industryCode | regionCode | employeeCount | revenueBand | registeredOn | closedFlag |
|---|---|---|---|---|---|---|---|
| B-2019-0001 | 가온정밀 | C29294 | 11680 | 42 | B3 | 2019-03-11 | 0 |
| B-2019-0014 | 대성포장 | C22240 | 41135 | 17 | B2 | 2019-05-02 | 0 |
| B-2019-0033 | 한별전자 | C26429 | 28185 | 133 | B4 | 2019-07-19 | 0 |
유형 판정: 표 형태 STRUCT — 행과 열이 있고 컬럼마다 자료형이 정해집니다. [제1부 5.6 표 5-5]
이 데이터로 따라가기 ① · 데이터 개요 — 표 8행 펼치기
| 컬럼 | 자료형 | 의미 |
|---|---|---|
bizId |
string |
사업장 고유 등록번호. B-YYYY-NNNN 형식 |
bizName |
string |
사업장 명칭 |
industryCode |
string |
한국표준산업분류 세세분류 코드 |
regionCode |
string |
행정표준코드 법정동 시군구 코드 |
employeeCount |
integer |
상시 종업원 수. 0 이상 100000 이하 |
revenueBand |
string |
매출 구간 코드. B1부터 B4까지 |
registeredOn |
date |
최초 등록일. ISO 8601-1 날짜 |
closedFlag |
integer |
폐업 여부. 0은 영업, 1은 폐업 |
개인정보 확인 — 사업장명은 법인 정보지만 개인사업자인 경우 개인정보에 해당할 수 있습니다. 담당자가 단독으로 판단하지 않고 개인정보 보호 담당 부서와 함께 확인합니다. 확인 절차는 시작 전 데이터 확인에 있습니다.
이 데이터로 따라가기 ② · 발견 계층 작성
예시 데이터 · 실측 데이터값은 변경되지 않았습니다. 달라진 것은 값을 설명하는 정보입니다.
| 시작 | 1단계를 마친 뒤 | |
|---|---|---|
| 기재 항목 | 1 / 23 | 23 / 23 |
| 컬럼 설명 | 0 / 8 | 8 / 8 |
고유 식별자는 조직에 발급 정책이 없어 고유 식별자 정하기의 잠정 규칙(조직 도메인 기반 URI)을 적용했습니다.
https://datahub.kr/pid/ds-example-2026
컬럼 설명 기재 예는 다음과 같습니다. 나머지 4개 컬럼도 같은 형식입니다.
| 컬럼 | 자료형 | 설명 |
|---|---|---|
bizId |
string |
사업장 고유 등록번호. B-YYYY-NNNN 형식 |
bizName |
string |
사업장 명칭 |
industryCode |
string |
한국표준산업분류 세세분류 코드 |
regionCode |
string |
행정표준코드 법정동 시군구 코드 |
bizId는 필수 컬럼으로 표시했습니다. 이 표시가 있어야 품질 측정 (2단계)에서 D1-01을 측정할 수 있습니다.
이 데이터로 따라가기 ③ · 품질 측정
예시 데이터 · 실측 1단계 데이터 설명서(마니페스트)를 채우고 레코드 키를 bizId로 지정한 예시 파일을 내 데이터 진단으로 측정한 결과입니다. 아래 수치는 계산 예가 아니라 측정값입니다.
이 데이터로 따라가기 ③ · 품질 측정 — 표 7행 펼치기
| 지표 | 측정 대상 | 점수 |
|---|---|---|
D1-01 |
필수 필드 충족도 | 1.0000 |
D1-02 |
필수 메타데이터 항목 충실도 | 1.0000 |
D5-01 |
형식 유효성 | 1.0000 |
D6-01 |
유일성 · 최소 측정 지표(MMI) | 1.0000 |
D7-01 |
인코딩 일관성 · 최소 측정 지표(MMI) | 1.0000 |
D7-02 |
기술적 유효성 · 최소 측정 지표(MMI) | 1.0000 |
D5-03 |
통계적 타당성 · 최소 측정 지표(MMI) | 1.0000 (잠정) |
20건 모두 형식이 맞아 수정할 값이 없었습니다. 측정 결과는 다음과 같습니다.
| 결과 | |
|---|---|
| 측정한 정식 필수 지표 | 7 / 13 (D5-03 잠정 포함) |
| 측정 완성도 | DM-0 |
| 품질 등급 | 공식 등급 판정하지 않음 — 활성 공식 적용 기준이 없습니다. 화면의 잠정 등급(PROVISIONAL)은 공식 등급으로 쓰지 않습니다 |
점수가 모두 1.0000이어도 공식 등급은 판정하지 않습니다. 원인은 데이터가 아니라 활성 공식 적용 기준 미발행입니다. 최소 측정 지표(MMI) 4개는 모두 측정했습니다. D5-03(통계적 타당성)은 [제2부 부록 Ⅰ]의 예시 패턴으로 측정한 잠정값입니다.
측정하지 못한 지표와 측정에 필요한 자료는 다음과 같습니다. 이 목록이 곧 담당자가 구해야 할 자료의 목록입니다.
| 지표 | 측정 필요 자료 |
|---|---|
D2-01 필드 간 관계 일관성 |
관계 규칙이 데이터 사전 또는 메타데이터 규격에 정의되어 있을 것 |
D2-02 참조 무결성 |
마스터 코드 테이블의 실제 값을 대조할 것 (주소·참조만으로는 미충족) |
D2-03 파생값 정확성 |
파생값 계산 규칙이 정의되어 있을 것 (저장된 파생값이 없으면 해당 없음) |
D3-01 표준 명칭 정합성 |
공인 참조 기준이 코드–명칭 대응으로 활용 가능하고 데이터에 코드와 명칭이 함께 있을 것 |
D4-01 최신성 |
기준 시점과 갱신 이력을 확인할 수 있을 것 |
D5-02 수치 범위 유효성 |
컬럼별 허용 수치 범위가 정의되어 있을 것 |
이 데이터로 따라가기 ④ · 목적별 준비
예시 데이터 · 실측 이 데이터로 성립 가능한 활용 목적을 판별합니다. 검토 대상은 이 데이터에 해당하는 목적으로 한정합니다.
| 활용 목적 | 이 데이터의 해당 사항 | 판단 |
|---|---|---|
| ML 기계학습 | 정답 컬럼 후보 closedFlag (폐업 여부) |
후보 |
| KG 지식그래프 | 표준 코드 컬럼 industryCode · regionCode |
후보 |
| Stats 통계 분석 | registeredOn은 등록 시점이며 시간 순서 측정값이 아님 |
해당 없음 |
| RAG 검색증강생성 | 자연어 문서 없음 | 해당 없음 |
| DL 심층학습 | 이미지 없음 | 해당 없음 |
| FineTuning 미세조정 | 지시문 · 응답 쌍 없음 | 해당 없음 |
목적 선택으로 3단계가 완료되지 않습니다. 목적 등급은 해당 목적의 기준이 등록되어야 판정됩니다. 등록 전에는 사유와 함께 판정하지 않음으로 기재합니다.
3단계는 활용 목적이 확정된 뒤에 수행합니다. 2단계까지 마친 이 데이터는 발견할 수 있고 품질 근거를 갖추었습니다.
가이드 › 데이터 제공
작성 예시와 빈번한 오류
작성 예시
수정 전
제목: 데이터
설명: 관련 데이터이다.
갱신주기: 수시
라이선스: 제3자 권리 포함 여부 - N
미디어타입: 텍스트
컬럼 정의서: (없음)
수정 후
제목: 2025년 ○○시 사업장 등록 현황
설명: ○○시에 등록된 사업장의 업종·소재지·영업상태.
2025-12-31 기준, 12,480건.
키워드: 사업장, 인허가, 업종, ○○시, 2025
데이터 종류: STRUCT
갱신주기: http://publications.europa.eu/resource/authority/frequency/MONTHLY
라이선스: KOGL-1 (어휘표 kr-license 값)
이용 조건: 공공누리 제1유형. 출처 표시 후 자유 이용 가능. (문자열 고지문)
미디어타입: text/csv
접근제한: public
컬럼 정의서: 14개 컬럼 전체에 이름·자료형·설명·코드값 기재
빈번한 오류
1단계에서 빈번한 오류 세 가지는 다음과 같습니다.
| 잘못된 예 | 수정한 예 | 문제 원인 |
|---|---|---|
| 갱신 주기에 「분기」 또는 「수시」라는 자유 문자열을 적었습니다 | 표준 목록의 URI로 기재 — 예: .../frequency/QUARTERLY, .../frequency/IRREG | 갱신 주기는 표준 목록에서 선택하는 항목입니다. 자유 문자열은 기계가 해석할 수 없습니다 |
| 이용 조건에 「제3자 권리 포함 여부: N」을 적었습니다 | 라이선스 값 목록(어휘표 1.4.1 kr-license)에서 고릅니다. 목록에 없는 라이선스는 어휘표 개정 제안 대상이며 기재 방법은 확인 중입니다 | 무엇을 허용하는지 알 수 없습니다. 라이선스는 어휘표 kr-license 값 목록에서 고릅니다. 심의본 제3부 C.18 은 SPDX 식별자를 기준으로 적었으나 어휘표가 우선합니다 |
| 다른 데이터의 데이터 설명서(마니페스트)를 복사하고 접근 주소를 고치지 않았습니다 | 복사한 마니페스트의 접근 주소를 해당 데이터의 주소로 수정합니다 | 형식은 유효해도 잘못된 위치를 가리킵니다. 형식 검사로 검출되지 않는 결함입니다 |
필요성
이 단계의 작업은 데이터 탐색, 접근, 이용 조건 확인을 지원합니다. 식별자는 다른 자료가 해당 데이터를 참조하게 합니다. 컬럼 설명은 값의 의미를 전달하며, 이용 조건은 사용 가능 여부를 판단하는 근거가 됩니다.
FAIR 원칙 대응 관계는 관련 표준과 대응 페이지에 있습니다. FAIR 원칙과 무관하게 이 사이트의 작업을 수행할 수 있습니다.
가이드 › 데이터 제공
자주 묻는 질문
- 의무입니까
- 아닙니다. 법령이나 규정에 따른 의무가 아니며, 평가나 조직 간 순위 산정에 사용하지 않습니다. 1단계만 수행해도 에이전트가 추정해야 하는 항목이 줄어듭니다.
- 무엇을 얻습니까
- 에이전트와 이용자가 담당자에게 문의하지 않고도 데이터가 무엇인지, 신뢰할 수 있는지, 어떤 조건으로 이용할 수 있는지 판단할 수 있습니다. 에이전트가 데이터를 검색 결과와 결합 후보로 선택할 근거도 기재됩니다.
- 데이터를 고쳐야 합니까
- 1단계는 데이터값을 변경하지 않고 설명을 기재하는 작업입니다. 값을 고치는 일은 2단계의 결함 수정에서 하며, 원본은 보존합니다.
- 얼마나 걸립니까
- 기재 값은 데이터 등록 정보와 운영 데이터베이스의 컬럼 주석에서 가져오고, 체크섬은 내 데이터 진단 화면이 자동으로 계산합니다. 소요 시간은 기존 컬럼 설명의 기재 정도에 따라 달라집니다.
- 지금 공식 등급을 받을 수 있습니까
- 현재는 받을 수 없습니다. 공식 등급은 운영 지침이 발행되고 활성 공식 적용 기준을 적용하며 측정 완성도가 DM-2 일 때 성립합니다. 그 전의 결과는 잠정입니다.
- 제4 · 5부의 지위는 무엇입니까
- 표준 논의에서 채택되었으나 2026년 12월 제정 범위(제1~3부) 밖의 후속 부입니다. 이 사이트는 해당 인용에 「후속 부」 표지를 붙입니다.
표 — 표 8행 펼치기
| 질문 | 답 |
|---|---|
| 어디까지 해야 합니까 | 1단계만 수행해도 발견 계층이 갖춰져 검색 · 이용 판단이 가능합니다. 활용 요청이 있는 데이터 → 다른 데이터와 결합해 쓰는 데이터 → 나머지 순으로 우선순위를 결정합니다. 권고 |
| 시스템을 바꿔야 합니까 | 기존 등록 화면과 내보내기 기능을 먼저 활용합니다. 필수 속성 입력·버전 관리·체크섬 생성·데이터 설명서(마니페스트) 발행을 지원하지 않으면 추가 기능을 도입합니다 |
| 개인정보가 있으면 어떻게 합니까 | 시작 전 데이터 확인을 참고합니다. 담당자가 단독으로 판단하지 않고 개인정보 보호 담당 부서와 함께 확인합니다 |
| 이미 공개한 데이터는 다시 해야 합니까 | 처음부터 다시 만들지 않습니다. 기존 고유 식별자를 유지하면서 빠진 설명을 보완합니다. 먼저 확인할 항목은 컬럼 스키마와 라이선스 표기입니다 |
| 도구 없이도 할 수 있습니까 | 1단계는 수작업으로 가능합니다. 체크섬은 내 데이터 진단 화면이 파일에서 계산합니다. 2단계의 점수는 내 데이터 진단이 계산합니다. 사용 절차는 30분 실습에 있습니다 |
| 이용자가 문제를 알려오면 어떻게 합니까 | 확인 후 정제·설명 수정·갱신 중 필요한 조치를 하고 처리 상태를 기록합니다. 접수·확인·처리·미조치 상태와 미조치 사유를 적습니다. [제5부 10]후속 부 필수 |
| 결과는 어디에 쓰입니까 | 데이터를 찾는 사람의 판단 · AI 에이전트의 자동 활용 · 조직 내부의 정비 우선순위 · 적용 기준을 검토하는 근거 |
| 잘못 적으면 불이익이 있습니까 | 이 사이트의 진단은 평가 제도가 아닙니다. 조직 간 비교나 순위 산정에 사용하지 않습니다 |
낮은 점수보다 부정확한 기재가 더 큰 문제입니다. 측정하지 않은 항목을 측정한 것으로 적거나 한계를 누락하면 이용자가 잘못 판단할 수 있습니다. 확인하지 못한 사항은 미확인 또는 미측정으로 기재합니다.
측정값의 용도: 측정값은 적용 기준을 검토하는 근거로 활용될 수 있습니다. 담당자는 측정값과 측정 조건을 정확하게 기록합니다. 기준값은 표준 운영 주체가 운영 지침에 따라 발행합니다.
다른 갈래 · 에이전트 개발 — 에이전트가 읽는 것 · 도입 검토 — 도입 판단 요약
가이드 › 에이전트 개발
에이전트가 읽는 것
에이전트가 데이터를 활용하기 전에 하는 네 가지 판단을 기준으로 표준을 읽습니다. 판단에 필요한 정보가 어느 조항과 기재 항목에 반영되어 있는지, 표준이 요구하지 않는 정보는 무엇인지 정리했습니다. 이 페이지는 해설이며, 공백으로 표시한 항목은 표준 개정 검토의 후보입니다.
표준의 대상과 수요처는 공공데이터에 한정되지 않습니다. 공공기관 · 기업 · 민간 비영리 단체가 발행하거나 제공하는 데이터를 가리지 않습니다. AI 에이전트가 데이터에 접근하고, 이해하고, 신뢰하고, 이용해도 되는지 판단할 수 있게 하는 것이 목표입니다. 설계는 공공데이터 관측에서 출발했습니다. 에이전트는 점수 하나가 아니라 구조화된 필드와 측정 근거로 판단합니다. 아래 대응표는 표 형태 데이터를 기준으로 정리했습니다. 문서 · 이미지 · 지시문 · 응답 쌍은 판단에 필요한 정보가 다릅니다.
판단별 표준의 대응
필수 표준의 필수 요구 · 부분 조건부 · 선택 · 권고, 또는 측정하되 필드로 미노출 · 공백 필수 항목과 지표에 없음 (선택 항목 포함 여부는 확인 중)
필요한 정보 24개 가운데 필수 9 · 부분 10 · 공백 5
적합성 — 질문 부합도
판단 질문 · 내 질문에 맞는 데이터인가
적합성 — 질문 부합도 — 표 7행 펼치기
| 필요한 정보 | 표준 | 표준의 대응 |
|---|---|---|
| 시간 범위 | 공백 | 없음 어휘는 DCAT-AP-KR(DCAT)에 있음. AIRD 발견 · 이해 계층의 필수 항목은 아님. 시계열의 기준 시점 · 측정 주기는 권고. 포털 목록의 「시간범위」 채움률 5.2% (공공데이터포털 목록 관측, 2026-08-31) |
| 공간 범위 | 공백 | 없음 시간 범위와 같음. 포털 「공간범위」 채움률 6.4% |
| 단위 | 부분 | 컬럼 정의서의 단위 (권고) · 시계열 단위 (권고) |
| 수집 대상 모집단 | 부분 | Stats 목적의 준비 항목 (권고) · rai:dataBiases (알려진 치우침, 필수) |
| 컬럼의 의미 | 필수 | csvw:tableSchema (정형 데이터 조건부 필수) |
| 데이터 유형 | 필수 | dct:type · aird:dataType |
| 부적합한 용도 | 필수 | rai:dataLimitations |
신뢰성 — 신뢰 근거
판단 질문 · 신뢰할 수 있는가
| 필요한 정보 | 표준 | 표준의 대응 |
|---|---|---|
| 실제 갱신 여부 | 부분 | D4-01 최신성 (필수) · D4-02 갱신 충실도 (STRUCT 선택) 갱신 주기는 필수 기재, 실제 갱신 이력 대조는 선택 지표 |
| 파일 무결성 | 필수 | spdx:checksum · D7-02 기술적 유효성 · 효력 정지(Stale) |
| API 가용성 | 공백 | 제공 시스템의 인터페이스 적합성은 데이터 측 조건과 별도 수준 [제1부 표 6-1] 지표 16종은 파일 기준. 가용성은 데이터에 붙는 사실로 노출되지 않음 |
| API 응답의 명세 일치 | 공백 | 없음 파일의 D7-02에 해당하는 API 측 지표 없음 |
| 값의 형식 · 범위 준수 | 필수 | D5-01 · D5-02 · D5-03 |
| 측정 완성도 | 필수 | 측정 완성도(DM) · 지표 적용성 5값 |
결합성 — 결합 가능성
판단 질문 · 다른 데이터와 결합할 수 있는가
| 필요한 정보 | 표준 | 표준의 대응 |
|---|---|---|
| 영속 식별자 | 필수 | dct:identifier |
| 레코드 키 | 필수 | D6-01 유일성 (식별 컬럼 지정 시) |
| 값 수준에서 확인한 표준코드 | 부분 | D2-02 참조 무결성 · D3-01 표준 명칭 정합성 표준은 코드표의 실제 값 대조를 요구함(주소만으로는 미충족). 컬럼별 결과(코드 체계와 일치율)는 결과서에만 있고 메타데이터 필드로 노출되지 않음 |
| 개체 식별자와 코드표 출처 | 부분 | KG 목적의 준비 항목 (권고) |
사용 가능성 — 이용 조건
판단 질문 · 이용해도 되는가
사용 가능성 — 이용 조건 — 표 7행 펼치기
| 필요한 정보 | 표준 | 표준의 대응 |
|---|---|---|
| 기계가 읽을 수 있는 라이선스 | 부분 | dct:license (어휘표 1.4.1 · kr-license 14값 — 공공누리 · CC · CC0) 값 목록이 닫혀 있음. 기업의 자체 이용약관, MIT · Apache · ODbL 같은 라이선스는 기재할 값이 없음. 값 공간 확장은 어휘표 개정 제안 대상 |
| AI 학습 허용 여부 | 부분 | odrl:hasPolicy (어휘표 1.4.4 · 선택) · 공공누리 AI유형 (kr-license) 기계 판독 이용 정책을 담을 자리는 있으나 선택 항목. 공공누리 밖의 데이터에는 학습 허용을 뜻하는 라이선스 값이 없음 |
| 자동 수집 허용 여부 | 부분 | odrl:hasPolicy (선택) 사람은 내려받아 이용할 수 있어도 약관이 웹 크롤링 등 자동 수집을 금지할 수 있음. 기업이 무료로 제공하는 데이터의 약관에 이 조항이 있는 사례가 있음 |
| 이용 조건의 버전 | 공백 | dct:rights 고지문 (문자열) 자체 약관은 개정될 때마다 조건이 바뀜. 어느 버전(시행일)의 조건인지 기록하는 필드가 없음 |
| 유상 · 계약 조건 | 부분 | dcatkr:fee (권장) · sc:offers (fee=true일 때 조건부 필수) 가격 · 통화 · 단위는 기재 가능. 무료 할당 뒤 종량제, 계약 고객 한정 같은 조건은 담을 자리가 없음 |
| 접근 조건 | 필수 | dct:accessRights (eu-access: PUBLIC · RESTRICTED · NON_PUBLIC) |
| 개인정보 포함 여부 | 부분 | aird:deidentificationLevel (조건부) · dpv:hasPersonalData (조건부) |
검증된 사실
에이전트에게 노출할 것은 요약 점수가 아니라 진단이 확인한 사실입니다. 사실마다 측정 시점과 유효 기간을 함께 기재합니다. 유효 기간이 지난 사실은 효력이 정지됩니다.
표 — 표 7행 펼치기
| 사실 | 판단 | 표준 내 산출 위치 | 표준 현황 |
|---|---|---|---|
update_delay_days | 신뢰성 | D4-01 (경과일수 − 갱신주기) | 측정함 · 노출 안 함 |
api_availability_7d | 신뢰성 | 표준 밖 | 측정하지 않음 |
response_matches_spec | 신뢰성 | 표준 밖 | 측정하지 않음 |
pk_uniqueness | 결합성 | D6-01 | 측정함 · 노출 안 함 |
code_columns_matched | 결합성 | D2-02 (컬럼별) | 측정함 · 노출 안 함 |
encoding | 신뢰성 | D7-01 | 측정함 · 노출 안 함 |
required_fields_nonnull | 적합성 | D1-01 | 측정함 · 노출 안 함 |
- 측정함 · 노출 안 함 — 표준이 측정, 결과는 결과서에만 수록 (마니페스트에는 차원 점수만 기재)
- 측정하지 않음 — 표준이 측정하지 않음
노출 방식 제안
미결 사항
- 이해 계층에 「사실 목록」 항목을 둘지, 결과서 참조로 대신할지
- API 가용성·명세 일치를 데이터 측 사실로 둘지, 제공 시스템 수준(제1부 표 6-1)에 남길지
- 유효 기간의 결정 주체 (적용 기준 또는 사실 종류별 고정값)
대응표 요약
- 결합성에는 공백이 없습니다. 표준은 코드표의 실제 값 대조를 요구하며 주소만 있으면 미충족으로 봅니다. 남은 과제는 컬럼별 결과를 메타데이터 필드로 노출하는 것입니다.
- 공백은 적합성 · 신뢰성 · 사용 가능성에 분포합니다. 시간 · 공간 범위는 필수 항목에 없고, AI 학습 허용 여부는 선택 항목에만 있습니다. 두 조건은 에이전트가 데이터를 선별할 때 쓰는 조건입니다.
- 신뢰성 지표는 파일 기준입니다. 지표 16종은 파일을 대상으로 하므로, API로 제공되는 데이터의 가용성과 명세 일치는 데이터에 기재되는 사실로 나타나지 않습니다.
가이드 › 에이전트 개발
판단별 필드와 처리
에이전트가 데이터를 활용하기 전에 데이터 설명서(마니페스트)에서 무엇을 읽고 어떻게 판정할지를 보여 주는 구현 예시입니다. 표준이 정한 필드와 판정값을 따르며, 판정 규칙 자체는 이 사이트의 권고입니다.
판독 원칙 — 기재되지 않은 필드를 추정값으로 대체하지 않습니다. 근거가 없으면 결과에 「근거 없음」을 밝히고, 필요하면 사람의 확인으로 이관합니다. 이 표준의 목적은 에이전트가 추정 없이 판단하게 하는 것이며, 이 페이지의 판정 규칙도 같은 원칙을 따릅니다.
적합성 — 질문 부합도
판단 질문 · 내 질문에 맞는 데이터인가
읽는 필드 dct:description · csvw:tableSchema · dct:type · rai:dataLimitations · rai:dataBiases
schema = m.get("csvw:tableSchema")
if schema is None:
return 근거없음("컬럼 의미가 기록되지 않았다") # 컬럼명으로 추정하지 않는다
for col in 질문이_쓰는_컬럼:
if not 컬럼(schema, col).get("dc:description"):
return 근거없음(f"{col} 의 뜻이 기록되지 않았다")
# rai:dataLimitations · rai:dataBiases 는 사람이 쓴 문장 목록이다.
# 문자열 일치로 걸러내지 말고, 답과 함께 그대로 제시한다.
주의사항 = m.get("rai:dataLimitations", []) + m.get("rai:dataBiases", [])
return 적합(주의=주의사항)필드가 없을 때 컬럼 설명이 없으면 이름으로 뜻을 추정하지 않고, 답에 「컬럼 의미 미기록」을 밝힙니다.
신뢰성 — 신뢰 근거
판단 질문 · 신뢰할 수 있는가
읽는 필드 aird:lifecycleStatus · dcat:distribution[].spdx:checksum · dct:modified · dct:accrualPeriodicity · aird:diagnosticMaturity · aird:qualityTier · aird:thresholdProfile · aird:diagnosticReport
if m["aird:lifecycleStatus"] == "Stale":
return 제외("효력 정지 상태")
d = 배포자원(m, 내려받은_주소) # 체크섬은 배포 자원마다 있다
if sha256(내려받은_파일) != d["spdx:checksum"]["spdx:checksumValue"]:
return 제외("체크섬 불일치 — 마니페스트가 가리키는 파일이 아니다")
dm = m.get("aird:diagnosticMaturity")
if dm is None:
# null 은 두 뜻이다. 결과서의 진단 상태로 구분한다.
if 진단상태(m) in ("SCHEMA_ONLY", "FILE_BROKEN"):
return 제외("진단에 들어가지 못한 파일")
return 주의("측정 완성도 미성립 — 품질 근거가 부족하다") # 0점으로 읽지 않는다
공식등급 = m.get("aird:qualityTier") if (dm == "DM-2" and m.get("aird:thresholdProfile")) else None
if 공식등급 is None:
return 주의(f"측정 완성도 {dm} · 공식 등급 없음", 점수=m.get("aird:qualityIndexMin"))
return 신뢰(등급=공식등급, 기준=m["aird:thresholdProfile"])필드가 없을 때 측정 완성도가 없으면 「낮음」이 아니라 「측정 근거 부족」으로 다룹니다. 등급은 측정 완성도 DM-2와 활성 공식 적용 기준이 함께 있을 때만 공식으로 읽습니다. DM-0 · DM-1이면 점수와 잠정 등급은 참고로만 씁니다.
결합성 — 결합 가능성
판단 질문 · 다른 데이터와 결합할 수 있는가
읽는 필드 dct:identifier · csvw:tableSchema.primaryKey · csvw:tableSchema.columns[].dc:description · 결과서의 D2-02 결과
a, b = 두_데이터의_결합_컬럼
# 마니페스트에는 컬럼의 코드 체계를 담는 전용 필드가 없다 (지금은 컬럼 설명 문장에만 있다).
# 값 수준 대조 결과는 결과서에 있고 마니페스트로 노출되지 않는다 — 검증된 사실 제안이 이 틈을 메운다.
ra, rb = D2_02_결과(결과서(a)), D2_02_결과(결과서(b)) # 결과서를 읽을 수 없으면 None
if ra is None or rb is None:
return 후보("값 수준 대조 결과를 확인할 수 없다 — 이름이 같다는 것만으로 결합하지 않는다")
if ra.적용성 != "APPLIED" or rb.적용성 != "APPLIED":
return 후보("코드표 값 대조가 이뤄지지 않았다")
if ra.코드표 != rb.코드표:
return 제외("서로 다른 코드표로 대조했다")
return 결합(근거=[ra.일치율, rb.일치율, ra.코드표_버전])필드가 없을 때 값 수준 대조 결과가 없으면 결합을 「후보」로만 두고, 결과에 결합 근거가 없음을 밝힙니다.
사용 가능성 — 이용 조건
판단 질문 · 이용해도 되는가
읽는 필드 dct:license · dct:rights · dct:accessRights · dpv:hasPersonalData · aird:deidentificationLevel · odrl:hasPolicy
if m["dct:accessRights"] != "PUBLIC":
return 사람확인("접근 제한 데이터")
lic = m["dct:license"]
if lic not in KR_LICENSE: # 어휘표 1.4.1 kr-license 값 목록
return 사람확인("값 목록 밖의 라이선스 — 기계가 조건을 읽을 수 없다")
조건 = 라이선스_조건(lic)
# AI 학습 허용 여부는 필수 항목이 없다 — 선택 항목 odrl:hasPolicy 만 읽고, dct:rights 문구로 추정하지 않는다
정책 = m.get("odrl:hasPolicy")
학습허용 = 정책_허용행위(정책) if 정책 else "미확인"
return 사용가능(조건=조건, 학습허용=학습허용)필드가 없을 때 AI 학습 허용 여부는 표준의 필수 항목에 없고, 선택 항목인 이용 정책(odrl:hasPolicy)에 담을 수 있습니다. 값이 없으면 이용 조건(dct:rights) 문구를 해석해 추정하지 말고 「미확인」으로 둡니다.
표준에 규정이 없는 정보의 처리
다음 네 가지는 표준의 필수 항목에 없습니다. 에이전트 측 처리 방식으로 다음을 권고합니다.
| 표준이 아직 답하지 않는 것 | 에이전트 측 권고 |
|---|---|
| 시간 범위 · 공간 범위 | DCAT의 dct:temporal · dct:spatial 이 있으면 읽습니다. 없으면 「범위 미기록」으로 두고, 질문이 범위를 요구하면 사람에게 확인합니다. |
| AI 학습 허용 여부 | ODRL 정책(odrl:hasPolicy)이 붙어 있으면 그 허용·금지 행위를 읽습니다. 없으면 「미확인」이며, 학습 용도라면 사람에게 넘깁니다. |
| 자동 수집 허용 여부 · 이용 조건의 버전 | ODRL 정책에 금지 행위(odrl:prohibition)가 있으면 따릅니다. 정책이 없고 이용 조건이 약관 문서뿐이면 자동으로 수집하지 않고 「미확인」으로 두며, 약관의 시행일을 확인할 수 없으면 사람에게 넘깁니다. |
| API 가용성 · 응답의 명세 일치 | 에이전트가 호출 전에 직접 확인하고, 확인 시각과 결과를 판단 근거로 함께 남깁니다. 마니페스트의 값으로 대신하지 않습니다. |
자동 활용 적격 조건
표준은 자동 활용 적격을 위한 데이터 측 조건 8개를 정합니다. 이 가운데 표준이 필드를 정의한 조건만 의사코드로 구현했습니다. 제공 시스템의 인터페이스·교환 방식 적합성은 별도 수준에서 다룹니다. 활용 목적과 자동 활용 조건
# 자동 활용 적격 — 데이터 측 조건 8개 [제5부 표 9-2]후속 부
# 표준이 필드를 정해 둔 조건만 코드로 쓴다. 필드가 확인되지 않은 조건은 표시해 둔다.
def 자동활용_적격(m, 파일, 주소):
d = 배포자원(m, 주소)
return all([
m["aird:lifecycleStatus"] == "Purpose-Ready", # 1 목적에 맞게 준비된 데이터
현재_제공중(m), # 2 필드 확인 중
공식_공개(m), # 3 필드 확인 중
목적등급(m) is not None, # 4 속성명 확인 중 — aird:purposeTier / aird:purposeReadiness
m.get("aird:diagnosticMaturity") == "DM-2", # 5 요구된 항목을 모두 측정
품질등급_최소기준_이상(m), # 6 적용 기준의 최소 등급 이상
sha256(파일) == d["spdx:checksum"]["spdx:checksumValue"], # 7 체크섬 일치 (배포 자원 단위)
m.get("dct:license") in KR_LICENSE and m.get("dct:rights") and m.get("dct:accessRights"),
# 8 이용 조건 확인 가능 — 자동 활용이므로
# 기계가 읽을 수 있는 라이선스로 해석했다
])
의사코드의 「확인 중」 표시는 표준 원문과 속성명·해석을 대조하는 중인 곳입니다. 목록은 제작 방식과 검증 중인 항목에 있습니다.
마니페스트의 구체적인 형태는 마니페스트 예시에서, 속성 목록은 기재 항목에서 확인할 수 있습니다. 스키마 파일과 검증 도구의 공개 현황은 개발 현황과 향후 공개에 있습니다.
다른 갈래 · 데이터 제공 — 마니페스트 작성 (1단계) · 도입 검토 — 도입 판단 요약
가이드 › 도입 검토
도입 판단 요약
조직(공공기관 · 기업 · 산업 단체 · 데이터 플랫폼)에 이 표준을 도입할지 판단하고 보고하는 데 필요한 내용을 한 페이지에 정리했습니다. 각 항목의 근거는 연결된 페이지에서 확인할 수 있습니다.
개요
AI 에이전트가 데이터를 활용하기 전에 하는 네 가지 판단(질문에 맞는가 · 신뢰할 수 있는가 · 결합할 수 있는가 · 이용해도 되는가)의 근거를 데이터와 함께 기계가 읽을 수 있는 형태로 남기는 방법을 정한 표준입니다. 다섯 부 가운데 제1~3부가 표준안 (TTAK 심의본 · 0.95 버전)이고, 제4 · 5부는 후속 부입니다.
도입 배경
데이터를 이용하는 주체가 사람에서 AI 에이전트로 확대되고 있습니다. 에이전트는 데이터에 기록되지 않은 사실을 확인할 수 없어 추정합니다. 목록 메타데이터가 비교적 충실한 공공데이터 1건을 관측한 결과에서도 관측 기준 기재 항목 19개(심의본 기준 데이터셋 15 + 배포 자원 4) 가운데 10개는 새로 작성해야 했습니다. 포털 등록과 AI 활용 준비는 서로 다른 일입니다. 기업이 무료로 제공하는 데이터에서는 자체 이용약관이 재배포나 자동 수집을 막는 경우가 있어, 사람은 약관을 읽고 판단할 수 있으나 에이전트는 이용 조건을 확인할 수 없습니다. 필요성과 배경
적용 의무
이 표준은 법령이나 규정에 따른 의무가 아니며, 평가나 조직 간 순위 산정에 사용하지 않습니다. 제1~3부 표준안은 2026년 12월 제정 범위이고, 제4 · 5부는 후속 부입니다. 제정본이 발행되면 제정본이 우선합니다.
도입하는 조직이 할 일
| 주체 | 할 일 |
|---|---|
| 데이터 담당자 | 1단계 기재 항목과 컬럼 설명 작성 · 2단계 수정 가능한 값 수정과 한계 기록 · 3단계는 활용 목적이 정해진 데이터만 |
| 진단 도구·시스템 | 점수 계산 · 데이터 설명서(마니페스트)와 결과서 초안 생성 · 체크섬 계산 |
| 표준 운영 주체 | 운영 지침 · 적용 기준 발행 — 표준이 위임한 가중치 · 등급 구간 · 평가 범위 하한 · 판정 파라미터 결정 · 발행 전에는 공식 등급과 다음 단계 진행 판정 없음 |
| 데이터를 구매 · 조달하는 조직 | 계약 · 조달 조건에 마니페스트와 기계 판독 이용 조건 제공 요구 권고 |
준비 순서는 활용 요청이 있는 데이터, 다른 데이터와 연계하여 쓰는 데이터, 나머지 데이터의 순으로 권합니다. 시작하기
비용과 효과
1단계에서는 데이터값을 변경하지 않고 설명 정보를 작성합니다. 체크섬 계산을 제외하면 별도 도구 없이도 시작할 수 있습니다. 기존 등록 화면이 필수 속성 입력, 버전 관리, 체크섬 생성, 마니페스트 발행을 지원하지 않는다면 관련 기능의 추가가 필요할 수 있습니다.
결정 사항
- 적용 기준 없이는 공식 등급이 산출되지 않습니다. 측정과 결과서 작성은 지금 할 수 있습니다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ의 예시 수치 · 패턴을 임시 적용하므로 DM-0이 성립하며, 결과는 잠정(PROVISIONAL)으로 표기합니다. 공식 등급과 조직 간 비교는 운영 지침이 발행되고 활성 공식 적용 기준을 적용할 때 성립합니다. [제1부 7.2 · 제2부 5.1 · 부속서 A.4.1] 적용 기준에 위임된 항목
- 표준에 규정이 없는 정보가 있습니다. 시간 · 공간 범위, AI 학습 허용 여부, API 가용성은 필수 항목에 없습니다. 기업의 자체 이용약관은 어휘표의 라이선스 값 목록(kr-license)에 없으며, 기재 방법은 어휘표 개정 제안과 함께 확인 중입니다. 에이전트가 읽는 것
- 내용이 바뀔 수 있습니다. 제4 · 5부는 후속 부입니다. 제정본이 발행되면 이 사이트도 함께 갱신합니다.
도입 절차
- 대상 데이터 몇 건을 선정하여 내 데이터 진단으로 준비 상태를 점검합니다.
- 적용 기준에 위임된 항목에서 적용 기준이 정할 값을 확인하고, 등급 모의 계산으로 기준에 따른 등급 변화를 확인합니다.
- 「운영 지침과 적용 기준의 발행」 페이지를 참고해 적용 기준 초안을 작성합니다.
가이드 › 도입 검토
적용 기준에 위임된 항목
공식 등급은 표준 운영 주체가 발행하는 운영 지침과 활성 공식 적용 기준(임계 프로파일)이 있어야 판정할 수 있습니다. [제1부 7.1 · 7.2] 이 페이지는 표준이 적용 기준에 위임한 항목을 정리합니다. 이 사이트가 제시하는 기준값은 표준 부록의 예시 수치뿐이며, 잠정 판정에만 쓰입니다. [제2부 부록 Ⅰ]
위임된 값
| 위임된 값 | 정하는 곳 | 비고 |
|---|---|---|
| 차원 가중치 Wi 와 차원 내 가중치 wk | 활성 공식 적용 기준 | |
| 등급 구간의 경계값 | 활성 공식 적용 기준 | |
| 평가 범위의 하한 (DM-1 판정용) | 활성 공식 적용 기준 | |
| D5-03 이 오류값으로 판정하는 더미값 패턴 | 활성 공식 적용 기준 | 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ 의 예시 패턴을 임시 적용합니다. |
| 이미지의 라벨 일치 판정 기준 (D3-02) | 활성 공식 적용 기준 |
적용 기준 부재 시 수행 가능 범위
측정과 결과서 작성은 지금 할 수 있습니다. 활성 공식 적용 기준이 없는 동안은 제2부 부록 Ⅰ의 예시 수치 · 패턴을 적용하므로 파일만으로 DM-0이 성립하며, 결과서의 평가 상태는 PROVISIONAL(잠정)로 기록됩니다. 잠정 결과는 공식 공시와 조직 간 비교에 쓰지 않습니다. 이는 정상 절차이며, 측정한 점수와 미측정 사유는 기준 발행 뒤 판정의 기초 자료가 됩니다.
| 지금 할 수 있는 것 | 적용 기준이 발행되어야 할 수 있는 것 |
|---|---|
| 7개 차원의 점수 측정 | 품질 등급 판정 |
| 결과서 작성 | 다음 단계 전이 판정 |
| 정제와 이력 기록 | 목적 등급 판정 |
| 한계 기재 | 자동 활용 적격 표시 |
적용 기준 부재 시 측정 완성도 판정
D5-03은 적용 기준의 파라미터를 씁니다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ의 예시 패턴을 임시로 적용하므로 4행(DM-0)이 성립하고, 결과는 잠정으로 표기합니다.D5-03 은 MMI 입니다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ 의 예시 더미값 패턴을 임시로 적용하여 측정하고, 그 결과는 잠정(PROVISIONAL)으로 표기합니다. [제2부 5.1 · 부속서 A.4.1] D6-01 은 전제 조건이 없습니다. 식별 컬럼이 없으면 전체 컬럼 조합으로 완전 동일 레코드를 집계합니다. 따라서 파일만으로 MMI 전부(D5-03 · D6-01 · D7-01 · D7-02)를 측정할 수 있고 DM-0 이 성립합니다. DM-1 은 활성 공식 적용 기준의 평가 범위 하한이 있어야 판정하므로, 기준이 없으면 결과는 DM-0(잠정)까지입니다. 공식 등급은 운영 지침이 발행되고 활성 공식 적용 기준이 적용될 때 성립합니다. [제1부 7.2]
가이드 › 도입 검토
운영 지침과 적용 기준의 발행
적용 기준(표준 용어: 임계 프로파일)은 등급 구간 · 통과선 · 가중치처럼 운영하면서 조정하는 수치를 식별자와 버전을 부여해 수록한 기계 판독 파일입니다. 표준 운영 주체가 운영 지침에 따라 발행합니다. [제1부 3.20 · 3.21 · 7.1]
발행 주체와 절차
운영 지침은 표준 운영 주체가 발행하며, 진단 주기 · 결과 유효기간 · 이의제기 절차 · 도구 인증처럼 운영에 필요한 사항을 정합니다. 운영 지침은 이 표준과 동시에 발행합니다. 적용 기준의 식별자 · 버전 · 활성화 절차는 운영 지침이 정하고, 적용 기준이 담는 항목의 구조는 제2부 부속서 D가 정합니다. [제1부 7.1 · 제2부 부속서 D]
운영 지침이 발행되기 전에는 공식 등급을 산출하지 않습니다. 표준 부록의 예시 수치로 산출한 결과는 참고로만 기록하고 공식 공시와 조직 간 비교에 쓰지 않습니다. [제1부 7.2]
적용 기준이 담는 항목
적용 기준이 담는 항목 — 표 10행 펼치기
| 항목 | 구분 | 값 범위 | 정하는 수치 |
|---|---|---|---|
profileId | 필수 | URI | 프로파일 식별자 |
version | 필수 | SemVer | 프로파일 버전 |
status | 필수 | OFFICIAL 또는 EXAMPLE | 프로파일 상태 |
digest | 필수 | SHA-256 | 프로파일 파일의 해시 |
tierThresholds | 필수 | 0.0–1.0 값 4개 | 등급 구간 (제2부 7.1) |
passLines | 필수 | 7개 차원 × 4개 등급 | 차원별 필수 통과선 (7.2) |
dimensionWeights | 필수 | 합 1.00 인 7개 값 | 차원 가중치 (6.3) |
weightAdjustmentRange | 필수 | 차원별 하한 · 상한 | 가중치 조정 허용 범위 (6.3) |
dm1Coverage | 필수 | 0.0–1.0 | DM-1 평가 범위 하한 (8.1) |
indicatorParameters | 조건부 필수 | 지표별 객체 | D3-02 이미지 라벨 일치 기준 · D5-03 더미값 패턴 |
[제2부 부속서 D 표 D.1] · 기계 표현은 aird-threshold-profile-1.0.schema.json (제2부 표 9-3)
활성 공식 적용 기준 부재 시 — 예시 프로파일
활성 공식 적용 기준이 없는 동안에는 제2부 부록 Ⅰ의 예시 수치를 부속서 D의 구조로 수록한 예시 프로파일을 적용합니다. 결과서에는 그 파일의 식별자 · 버전 · 해시와 상태 EXAMPLE을 기록하고, 평가 상태는 PROVISIONAL(잠정)로 표기합니다. [제2부 5.1 · 9.1 · 부록 Ⅰ]
부록 Ⅰ의 수치는 학술적 근거를 확정한 값이 아닙니다. 이 사이트가 제시하는 기준값은 이 예시뿐이며, 잠정 판정과 도구 개발에만 씁니다. 아래 표의 수치(가중치 포함)는 모두 예시값이며 공식 기준값이 아닙니다.
예시 프로파일 · 상태 EXAMPLE · 원천 표준안 (TTAK 심의본 · 0.95 버전) [제2부 부록 Ⅰ 표 Ⅰ.1 ~ Ⅰ.4]
등급 구간 (최소 차원 점수)
| 등급 | 등급명 | 최소 차원 점수 |
|---|---|---|
| Tier 4 | Platinum | 0.95 이상 |
| Tier 3 | Gold | 0.85 이상 0.95 미만 |
| Tier 2 | Silver | 0.70 이상 0.85 미만 |
| Tier 1 | Bronze | 0.50 이상 0.70 미만 |
| Tier 0 | Unqualified | 0.50 미만 또는 통과선 미달 |
차원별 필수 통과선
차원별 필수 통과선 — 표 7행 펼치기
| 차원 | Tier 1 | Tier 2 | Tier 3 | Tier 4 |
|---|---|---|---|---|
| D1 완전성 | 0.60 | 0.75 | 0.85 | 0.95 |
| D2 일관성 | 0.50 | 0.70 | 0.80 | 0.90 |
| D3 정확성 | 0.65 | 0.80 | 0.90 | 0.95 |
| D4 적시성 | 0.40 | 0.60 | 0.75 | 0.85 |
| D5 유효성 | 0.60 | 0.75 | 0.85 | 0.95 |
| D6 유일성 | 0.60 | 0.75 | 0.85 | 0.95 |
| D7 기계 판독성 | 0.80 | 0.90 | 0.95 | 1.00 |
차원 가중치
차원 가중치 — 표 7행 펼치기
| 차원 | 예시 가중치 | 조정 허용 범위 |
|---|---|---|
| D1 완전성 | 0.18 | 0.10 ~ 0.25 |
| D2 일관성 | 0.10 | 0.07 ~ 0.18 |
| D3 정확성 | 0.24 | 0.17 ~ 0.32 |
| D4 적시성 | 0.10 | 0.05 ~ 0.18 |
| D5 유효성 | 0.13 | 0.08 ~ 0.20 |
| D6 유일성 | 0.12 | 0.08 ~ 0.18 |
| D7 기계 판독성 | 0.13 | 0.08 ~ 0.20 |
그 밖의 수치
| 항목 | 예시값 |
|---|---|
| DM-1 평가 범위 하한 (활성 공식 적용 기준이 없는 잠정 판정에서는 DM-1 판정에 쓰지 않음) | 0.50 |
| D3-02 이미지 겹침 비율 | 0.5 이상 |
| D5-03 더미값 패턴 | 999999, 99999999, 9999, -1, -9, 0000 |
발행 전 측정 결과 처리
활성 공식 적용 기준이 없는 동안에도 측정 결과는 유효한 기초 자료입니다. 기존 점수와 미측정 사유는 기준 발행 후 재측정과 판정에 씁니다. 적용 기준이 측정 방법에 영향을 주는 항목, 예를 들어 D5-03의 더미값 패턴은 활성 공식 적용 기준의 패턴이 예시와 다르면 다시 측정하고 새 결과서를 발행합니다.
기존 결과서를 그대로 쓸 수 있는 것은 측정 대상 버전 · 측정 규칙 · 적용 기준 · 측정 시점이 모두 같을 때뿐입니다.
목적별 기준
목적 등급의 판정 기준은 운영 지침이 정합니다. 활용 목적 유형마다 등록 상태(Registered)의 운용 계층 프로파일이 있어야 목적 등급을 판정하며, 등록 상태 프로파일이 없는 유형은 목적 등급을 판정하지 않고 목적에 맞게 준비된 데이터(Purpose-Ready)도 성립하지 않습니다. 프로파일 상태는 Draft · Candidate · Registered · Deprecated 넷입니다. [제1부 5.6 · 표 5-3 · 제3부 8.2 · 부속서 C.19]
다른 갈래 · 데이터 제공 — 마니페스트 작성 (1단계) · 에이전트 개발 — 에이전트가 읽는 것
핵심 개념
표준을 읽는 데 필요한 개념은 네 묶음이다. 데이터가 거치는 준비 상태, 상태 사이의 확인 지점, 서로 합산하지 않는 세 가지 판정, 그리고 그 결과를 담는 산출물이다.
준비 상태와 확인 지점
데이터는 세 단계를 거쳐 준비된다. 각 단계의 끝에는 확인 지점(결정 게이트)이 있으며, 통과하면 준비 상태가 전이한다. 통과하지 못해도 탈락하는 것이 아니라 보완한 뒤 다시 확인한다. 한 번 도달한 상태도 갱신이 지연되거나 체크섬이 맞지 않으면 효력이 정지된다.
| 풀이어 | 표준 용어 | 해설 | 근거 |
|---|---|---|---|
| 찾을 수 있는 데이터 | 디스커버러블 Discoverable | 발견 계층의 필수 기재 항목을 갖춘 상태. 1단계의 결과다. | [제1부 5.2] |
| 품질이 확인된 데이터 | 퀄리티 레디 Quality-Ready | 품질을 측정하고 활성 공식 적용 기준으로 전이 조건을 충족한 상태. 2단계의 결과다. | [제1부 5.2] |
| 목적에 맞게 준비된 데이터 | 펄포즈 레디 Purpose-Ready | 특정 활용 목적의 기준에 맞춰 준비된 상태. 3단계의 결과다. | [제1부 5.2] |
| 효력 정지 상태 | 스테일 Stale | 갱신 지연이나 체크섬 불일치로 준비 상태의 효력이 정지된 상태. 갱신하고 재검증하면 복귀한다. | [제1부 5.2] |
| 확인 지점 | 결정 게이트 Decision Gate (G1 · G2 · G3) | 각 단계의 끝에서 다음 상태 전이 가능 여부를 판정하는 지점. | [제1부 5.2 · 제4부 6~8]후속 부 |
세 가지 판정 — 합산하지 않는다
품질 판정은 다음 세 가지로 나뉘며, 각 판정의 결과는 따로 기록한다.
| 판정 | 답하는 질문 | 형태 | 결정 근거 |
|---|---|---|---|
| 품질 등급 (Q-Tier) | 측정한 품질이 어느 수준인가 | Tier 0~4 · 예: Gold (Tier 3, STRUCT) | 최소 차원 점수와 활성 공식 적용 기준 |
| 측정 완성도 (진단 성숙도, DM) | 요구된 지표를 어디까지 측정했는가 | DM-0 · DM-1 · DM-2 | 결정표 (판정 절차) |
| 목적 등급 (P-Tier) | 특정 목적에 얼마나 준비되었는가 | 예: P-Tier 2 (KG) | 그 목적에 등록된 기준 |
측정 점수가 높더라도 측정 완성도가 낮으면 공식 등급을 부여할 수 없다. 두 값은 서로를 대체하지 않는다. 판정할 수 없는 경우에는 「판정하지 않음」과 그 사유를 기록하며, 0점이나 최하 등급으로 대체하지 않는다 (상태값과 판정값).
| 풀이어 | 표준 용어 | 해설 | 근거 |
|---|---|---|---|
| 7개 차원 | 품질 차원 Quality Dimension (D1~D7) | 완전성·일관성·정확성·적시성·유효성·유일성·기계 판독성. | [제2부 5.2] |
| 품질 등급 | 품질 등급 Q-Tier (aird:qualityTier, Tier 0~4) | 활성 공식 적용 기준으로 판정하는 품질 수준. 기준이 없으면 판정하지 않는다. | [제2부 7.1 · 제3부 C.6] |
| 측정 완성도 | 진단 성숙도 Diagnostic Maturity (DM-0 · DM-1 · DM-2) | 요구된 지표를 어디까지 측정했는지를 결정표로 정하는 등급형 판정. 품질 점수와 합산하지 않는다. | [제2부 8.1 · 부속서 B.5] |
| 측정 충족률 | 평가 범위 Evaluation Coverage | 적용 대상 정식 필수 지표의 statusFactor 합을 지표 수로 나눈 0~1의 값. DM-1 판정에 쓰인다. | [제2부 부속서 A.3 · B.5] |
| 최소 측정 지표 | 최소 측정 가능 지표 Minimum Measurable Indicator (MMI) | 진단의 진입 요건이 되는 지표 4종. 입력 요구 수준이 가장 낮은 지표다. | [제2부 부속서 A.2] |
| 가장 낮은 점수 | 최소 차원 점수 Minimum Dimension Score | 일곱 차원 점수 가운데 가장 낮은 값. 후보 등급을 찾는 출발점이다. 평균은 등급 판정에 쓰지 않는다. | [제2부 6.2] |
| 한 단계 하향 | 강등 Demotion | 적용 기준이 정한 조건을 충족하지 못해 후보 등급에서 한 단계 내려가는 것. | [제2부 7.3] |
| 다음 단계 전이 가능 여부 | 전이 적격성 Transition Eligibility | 측정 완성도 DM-2 와 활성 공식 적용 기준으로 판정한 등급을 모두 갖춘 상태. | [제2부 7.5] |
산출물
판정 결과는 데이터와 별도의 문서로 남는다. 마니페스트는 버전마다 새로 발행하고, 측정 결과서는 측정할 때마다 새로 만든다. 데이터 파일 자체는 마니페스트가 주소와 체크섬으로 가리킨다.
| 풀이어 | 표준 용어 | 해설 | 근거 |
|---|---|---|---|
| 데이터 설명서 | 마니페스트 Manifest | 데이터셋을 기계가 읽을 수 있게 기술한 문서. 버전마다 새로 발행하고 이전 버전을 가리킨다. | [제3부] |
| 결과서 | 진단 리포트 Diagnostic Report | 측정할 때마다 새로 만드는 품질 측정 결과 문서. 이 사이트에서는 「결과서」로 부른다. | [제2부 9] |
| 목적별 운용 파일 | 운용 파일 Operation File | 활용 목적마다 따로 만드는 준비 산출물. | [제3부 8] |
| 묶음 | 팩 Pack | 마니페스트와 결과서 등을 한 배포 단위로 묶은 것. 데이터 파일은 마니페스트가 주소와 체크섬으로 가리킨다. | [제4부 10]후속 부 |
역할
작업은 세 주체가 나눈다. 담당자는 자료를 갖추고 결과를 확인한다. 진단 도구는 점수를 계산하고, 활성 공식 적용 기준을 적용해 등급을 계산한다. 표준 운영 주체는 운영 지침과 적용 기준을 발행하며, 공식 등급의 발행과 운영을 맡는다. 단계별 분담은 각 가이드 페이지의 작업 흐름(예: 품질 측정 (2단계))에 있다.
| 주체 | 하는 일 | 하지 않는 일 |
|---|---|---|
| 담당자 | 자료 준비와 확인 · 수정 가능한 값의 수정 · 수정할 수 없는 한계의 기록 | 점수 계산 · 등급 계산 · 기준값 결정 |
| 진단 도구·시스템 | 점수 계산 · 활성 공식 적용 기준에 따른 등급 계산 · 결과서와 마니페스트 초안 작성 · 체크섬 계산 | 기준값 결정 · 한계 판단 |
| 표준 운영 주체 | 운영 지침과 적용 기준 발행 · 공식 등급과 다음 단계 진행 판정의 발행 · 운영 · 기준 갱신 | 데이터 작성 · 값 수정 |


설계 근거
목차
목차표준 문안은 무엇을 정하는지를 적지만 정한 이유는 적지 않는다. 이 페이지는 설계상의 선택과 그 이유를 해설한다. 해설이므로 요건이 아니다.
1. 등급의 기준값을 표준이 정하지 않는다
표준은 점수를 계산하는 방법까지만 정하고, 점수를 등급으로 나누는 기준값은 표준 운영 주체가 발행하는 적용 기준에 위임한다. 이는 빠진 부분이 아니라 의도된 장치다. 같은 점수가 기준에 따라 다른 등급이 되는 것은 정상이며, 조직은 자기 사정에 맞는 근거로 기준을 결정할 수 있다. 기준값 변경에 따른 등급 변화는 등급 모의 계산에서 확인할 수 있다.
위임 범위는 등급 경계보다 넓다. 표준 본문은 가중치의 수치조차 고정하지 않는다.
| 위임된 값 | 정하는 곳 | 비고 |
|---|---|---|
| 차원 가중치 Wi 와 차원 내 가중치 wk | 활성 공식 적용 기준 | |
| 등급 구간의 경계값 | 활성 공식 적용 기준 | |
| 평가 범위의 하한 (DM-1 판정용) | 활성 공식 적용 기준 | |
| D5-03 이 오류값으로 판정하는 더미값 패턴 | 활성 공식 적용 기준 | 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ 의 예시 패턴을 임시 적용한다. |
| 이미지의 라벨 일치 판정 기준 (D3-02) | 활성 공식 적용 기준 |
적용 기준이 없으면 DM-1은 판정할 수 없고, DM-0은 잠정으로 성립한다. DM-1에 필요한 평가 범위의 하한은 적용 기준이 정한다. 최소 측정 지표인
D5-03은 적용 기준의 더미값 패턴을 쓰지만, 활성 공식 적용 기준이 없는 동안은 제2부 부록 Ⅰ의 예시 패턴을 임시 적용해 측정하고 결과를 잠정으로 표기한다. 따라서 파일만으로 DM-0이 성립하며, 공식 등급은 운영 지침과 활성 공식 적용 기준이 있어야 성립한다. [제2부 5.1 · 부속서 A.4.1]
심의본 반영 표준안 제2부 5.1 · 부속서 A.4.1은 활성 공식 적용 기준이 없는 동안 부록 Ⅰ의 예시 수치 · 패턴을 적용하고 판정 결과를 잠정으로 표기하도록 정한다. 이 사이트는 이에 따라 D5-03을 측정하고 DM-0을 판정한다. DM-1 판정에는 예시 하한을 쓰지 않는다.
2. 세 판정을 하나로 합치지 않는다
품질 등급, 측정 완성도, 목적 등급을 단일 점수로 합치면 「측정하지 못한 것」과 「측정했더니 낮은 것」이 구별되지 않는다. 좁은 범위만 측정해 높은 점수를 받은 데이터와, 넓게 측정해 조금 낮은 점수를 받은 데이터가 같은 숫자로 보이게 된다. 세 판정을 따로 두면 이용자는 점수가 무엇을 근거로 하는지 함께 읽을 수 있다.
3. 등급은 평균이 아니라 가장 낮은 차원에서 출발한다
다른 차원의 점수가 높아도 한 차원이 낮으면 그 차원이 데이터의 한계가 된다. 평균은 결정적인 결손을 희석한다. 예를 들어 일곱 차원의 점수가 0.92 · 0.88 · 0.93 · 0.86 · 0.89 · 1.00 · 0.97이면 평균은 0.90 이상이지만, 후보 등급 판정의 출발점은 가장 낮은 0.86(D4 적시성)이다. 평균은 등급 판정에 사용하지 않는다.
4. 최소 측정 지표를 따로 둔다
정식 지표 16종 가운데 D5-03 · D6-01 · D7-01 · D7-02의 4종은 진단의 진입 요건이다. 이 넷은 코드표·기준 시점·관계 규칙 같은 데이터 사전 없이도 측정할 수 있는, 입력 요구가 가장 낮은 지표다. 이것조차 측정하지 못하면 진단이 시작되었다고 볼 수 없다. D5-03은 오류값으로 볼 더미값 패턴을 적용 기준에서 받는다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ의 예시 패턴을 임시 적용하며, 결과는 잠정이다 (1번).
5. 데이터 유형마다 필수 지표의 수가 다르다
유형마다 측정할 수 있는 속성이 다르기 때문이다. 이미지에는 컬럼 사이의 관계나 수치 범위가 없고, 문서에는 코드표가 없다. 적용되지 않는 지표를 요구하면 모든 이미지 데이터가 미충족이 된다.
| 유형 | 정식 필수 지표 수 | 유형 |
|---|---|---|
STRUCT | 13 | 표 형태 |
TEXT | 5 | 문서 |
IMAGE | 3 | 이미지 |
TSERIES | 13 | 시계열 |
PT | 8 | 지시문 · 응답 쌍 |
6. 「미측정」을 다섯 가지로 구분한다
측정하지 못한 이유에 따라 담당자가 할 일이 다르다. 자료를 갖추면 측정되는 것, 조치할 필요가 없는 것, 생략이 허용된 것을 한 상태로 묶으면, 수정할 수 없는 항목에 조치를 시도하거나 수정할 수 있는 항목을 방치하게 된다. 표준은 이 대응을 규범적 계약으로 정했다.
| 적용성 | 공식 점수 | statusFactor | 담당자가 할 일 |
|---|---|---|---|
APPLIED | 점수 | 1 | 없음 |
PARTIALLY_APPLIED | null | coverage | 나머지 대상의 기준 자료 확보 |
PRECONDITION_UNMET | null | 0 | 기준 자료 확보 후 측정 |
NOT_APPLICABLE | null | 산정에서 제외 | 조치 불필요 |
OPTIONAL_SKIPPED | null | 산정에서 제외 | 없음 |
7. 확인 지점은 산출물이 새로 생기는 자리에 둔다
1단계가 끝나면 마니페스트가, 2단계가 끝나면 측정 결과서가, 3단계가 끝나면 목적별 운용 파일이 생긴다. 확인 지점은 이 산출물을 근거로 판정하므로 산출물이 생기는 자리에 있다. 따라서 1단계만 완료해도 마니페스트라는 독립된 산출물이 남는다.
8. 원본은 보존하고 식별자는 유지한다
정제본과 목적별 산출물은 원본을 대체하지 않는다. 값을 정제하거나 새 버전을 내거나 포맷을 추가해도 데이터셋의 식별자는 그대로다. 식별자를 바꾸면 그 데이터를 가리키던 모든 참조가 끊어지기 때문이다. 식별자를 새로 부여하는 것은 데이터셋을 통합하거나 분할해 다른 데이터셋이 되었을 때뿐이다 (고유 식별자 정하기).
데이터를 이용하는 주체가 사람에서 AI 에이전트로 확대되고 있다. 사람은 설명 문서를 찾아보거나 담당자에게 문의하여 모르는 것을 보완하지만, 에이전트는 데이터와 함께 기록된 것만 근거로 삼는다. 기록되지 않은 것은 추정하고, 추정의 근거는 남지 않는다. 이 표준은 에이전트가 데이터에 접근하고, 이해하고, 신뢰하고, 이용해도 되는지 판단할 수 있는 상태를 정의한다.
에이전트가 실제로 필요로 하는 것
에이전트는 데이터를 활용하기 전에 네 가지를 판단한다. 이 판단은 점수 하나로 이루어지지 않으며, 구조화된 필드와 검증된 사실이 있어야 한다.
| 판단 | 질문 | 필요한 정보 |
|---|---|---|
| 적합성 | 내 질문에 맞는 데이터인가 | 시간 범위 · 공간 범위 · 단위 · 수집 대상 모집단 · 컬럼의 의미 · 데이터 유형 · 부적합한 용도 |
| 신뢰성 | 신뢰할 수 있는가 | 실제 갱신 여부 · 파일 무결성 · API 가용성 · API 응답의 명세 일치 · 값의 형식 · 범위 준수 · 측정 완성도 |
| 결합성 | 다른 데이터와 결합할 수 있는가 | 영속 식별자 · 레코드 키 · 값 수준에서 확인한 표준코드 · 개체 식별자와 코드표 출처 |
| 사용 가능성 | 이용해도 되는가 | 기계가 읽을 수 있는 라이선스 · AI 학습 허용 여부 · 자동 수집 허용 여부 · 이용 조건의 버전 · 유상 · 계약 조건 · 접근 조건 · 개인정보 포함 여부 |
네 판단마다 표준이 이미 요구하는 것과 아직 비어 있는 것은 에이전트가 읽는 것에 정리했다.
에이전트 환경에서 표준의 적용 범위
에이전트는 데이터 제공자와 직접 소통하지 않는다. 카탈로그에서 데이터를 찾고, 데이터에 딸린 설명을 읽은 뒤 호출한다. 표준은 이 과정에서 데이터와 함께 전달되는 것의 형식을 정한다.
| 구간 | 표준이 정하는 것 | 에이전트에게 돌아오는 것 |
|---|---|---|
| 제공자 → 진단 | 무엇을 측정하는가 — 지표 16종, 전제 조건, 측정식 | 같은 데이터를 누가 진단해도 같은 결과 |
| 진단 → 마니페스트 | 무엇을 기록하는가 — 발견·이해 계층 항목, 측정 완성도, 미측정 사유 | 「측정하지 못한 것」과 「낮은 것」의 구별 |
| 마니페스트 → 카탈로그 | 언제 다음 상태로 넘기는가 — 확인 지점, 효력 정지 | 오래되거나 변경된 데이터를 걸러 낼 근거 |
| 카탈로그 → 에이전트 | 사람의 확인 없이 활용해도 되는 조건 — 자동 활용 데이터 측 조건 8개 | 자동으로 가져다 활용할지의 판단 |
| 에이전트 → 제공자 | 문제 제기의 접수·확인·처리 상태 기록 | 고쳐졌는지 확인할 수단 |
점수보다 검증된 사실
「필수 메타데이터 항목 충실도 0.8」 같은 요약값만으로는 에이전트가 판단할 수 없다. 요약값은 무엇이 빠졌는지와 그에 따라 해당 질문에 활용할 수 있는지를 알려 주지 않는다. 반면 진단 과정에서 나오는 부산물, 즉 무엇을 언제 어떤 기준으로 확인한 결과는 에이전트가 판단 근거로 직접 사용할 수 있다.
verified_facts:
update_delay_days: 0
api_availability_7d: 0.98
response_matches_spec: true
pk_uniqueness: 1.0
code_columns_matched: {sido_cd: "행정표준코드 99.7%"}
encoding: UTF-8
required_fields_nonnull: 1.0이러한 사실을 메타데이터에 담아 노출하면 진단 자체가 AI 레디 정보를 만들어 내는 장치가 된다. 이 가운데 일부는 표준의 지표가 이미 측정하는 값이다. 그러나 현재는 결과서에만 기록되고, 마니페스트에는 차원 점수만 반영된다.
표준의 품질 등급과 측정 완성도는 이 사실들을 사람과 절차를 위해 요약한 값이다. 등급은 조직이 다음 단계로 넘길지를 결정하는 데 쓰이며, 에이전트에게는 그 바탕이 되는 사실이 더 유용하다.
표준이 기록하게 하는 것
| 에이전트의 판단 | 표준이 정하는 것 | 준비 상태 | 주로 다루는 부 |
|---|---|---|---|
| 발견 · 이해 가능 여부 | 발견 계층의 기재 항목, 식별자, 컬럼 스키마, 배포 자원, 체크섬 | 찾을 수 있는 데이터 | 제3부 |
| 신뢰 가능 여부 | 7개 품질 차원의 지표 16종, 측정 완성도, 한계와 이력 | 품질이 확인된 데이터 | 제2부 |
| 목적 적합 여부 | 활용 목적 6종과 목적별 준비, 목적 등급 | 목적에 맞게 준비된 데이터 | 제4부 |
| 자동 활용 가능 여부 | 자동 활용 적격을 위한 데이터 측 조건 8개 | — | 제5부 |
각 단계의 끝에는 확인 지점이 있어서, 앞 단계의 조건을 갖추어야 다음 상태로 넘어간다. 흐름과 용어는 핵심 개념에 있다.
적용 대상 — 공공데이터 관측에서 출발한 설계
표준의 대상과 수요처는 공공데이터에 한정되지 않는다. 공공기관 · 기업 · 민간 비영리 단체가 발행하거나 제공하는 데이터를 가리지 않는다. 설계는 공공데이터 관측에서 출발했다. 공공데이터는 이미 대량으로 개방되어 있고, 여러 기관이 서로 다른 방식으로 만들었으며, 파일로 내보내는 과정에서 맥락이 사라지는 문제가 뚜렷해 관측 대상으로 적합했다.
- 원본 데이터베이스의 컬럼 주석이 CSV로 내보낼 때 사라지고
mkt_nm같은 이름만 남는다. - 갱신 주기가 「분기」 「수시」 같은 자유 문자열로 적힌다.
- 이용 조건이 「제3자 권리 포함 여부: N」처럼 기계가 읽을 수 없는 형태로 적힌다.
포털 등록이 잘 되어 있다는 것과 에이전트가 쓸 수 있다는 것은 다르다. 목록 메타데이터가 충실한 편인 산업 공공데이터 1건을 관측한 결과, 관측 기준 기재 항목 19개(심의본 기준 데이터셋 15 + 배포 자원 4) 가운데 포털에 이미 있는 것은 6개였고 새로 만들어야 하는 것이 10개였다. 관측 이후 추가된 4개는 분류하지 않았다. 이 사이트의 시작하기는 발행 주체를 가리지 않는 절차이며, 공공데이터와 기업 데이터에서 갈리는 대목은 따로 표시한다.
기업 데이터에서는 다른 문제가 먼저 나타난다. 무료로 받을 수 있어도 자체 이용약관이 재배포나 자동 수집을 막는 경우가 있고, 이용 조건이 표준 라이선스 값으로 적히지 않는다. 사람은 약관을 읽고 판단할 수 있지만 에이전트는 이용 조건을 확인할 수 없다. 이 문제는 표준의 어휘에도 남아 있다. 라이선스 값 목록이 공공누리와 CC로 닫혀 있어서, 자체 약관을 적을 값이 없다. 이것은 어휘표 개정 제안의 대상이다 (에이전트가 읽는 것).
표준이 하지 않는 것
- 등급의 기준값을 정하지 않는다. 점수를 계산하는 방법은 표준이 정하지만, 점수를 등급으로 나누는 경계와 가중치는 표준 운영 주체가 발행하는 적용 기준이 정한다. 이유는 이 페이지의 1번 항목에 있다.
- 발행 주체나 데이터셋을 평가하거나 순위를 매기지 않는다.
- 원본을 바꾸라고 요구하지 않는다. 1단계는 데이터값을 변경하지 않고 설명을 추가한다. 2단계에서 값을 정제하더라도 원본은 보존한다.
FAIR 원칙과 비교
데이터를 찾고, 접근하고, 연결하고, 재사용할 수 있도록 관리할 것을 요구하는 FAIR 원칙과 방향이 같다. 다만 품질 수준, 측정 완성도, 활용 목적 적합성, 무결성 검증은 FAIR가 요구하지 않는 것으로, AI 활용을 위해 이 표준이 더한 요건이다. 대응 관계는 관련 표준과 대응에 있다.
관련 표준과 대응
목차
목차이 표준은 기존 원칙과 어휘를 기반으로 한다. 발견 계층은 DCAT 계열 어휘를 쓰고, 방향은 FAIR 원칙과 같다. 다만 FAIR가 요구하지 않는 요건을 더했으며, 이 페이지는 FAIR가 요구하는 범위와 이 표준이 더한 범위를 구분해 기술한다.
FAIR 데이터 원칙과 대응
FAIR 데이터 원칙은 데이터를 찾고(Findable), 접근하고(Accessible), 다른 데이터와 연결하고(Interoperable), 다시 사용할 수 있게(Re-usable) 관리하도록 요구한다.
이 사이트는 FAIR 원칙을 알지 못해도 사용할 수 있다.
| 참조 위치 | 내용 |
|---|---|
| 각 가이드 페이지의 「필요성」 단락 | 해당 작업이 필요한 이유 (FAIR 용어 없이 기술) |
| FAIR 데이터 원칙과 AIRD 작업의 대응 (이 페이지 아래) | 15개 세부원칙별 대응 · 대응 성격 4구분 |
| 구분과 역할 |
|---|
| FAIR 원칙: 데이터가 발견·접근·연계·재사용될 수 있어야 한다는 원칙 |
| AI 레디 데이터 표준: AI 활용을 위한 품질·목적·산출물과 절차를 정하며, 일부 요건은 FAIR 원칙의 구현을 지원 |
| 이 사이트: 표준 요건을 해설하고 담당자의 작업 순서로 제시 |
주의할 점 두 가지
- 이 사이트의 절차를 따라도 FAIR 원칙이 자동으로 충족되지 않는다.
- 품질 등급과 활용 목적별 준비는 FAIR가 요구하는 것이 아니다. FAIR는 정확성·완전성의 임계값이나 활용 목적 적합성을 규정하지 않는다. 이 둘은 AI 활용을 위해 표준이 추가한 요건이다.
원전: Wilkinson, M. D. et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data 3, 160018.
FAIR 데이터 원칙과 AIRD 작업의 대응
원전: Wilkinson, M. D. et al. (2016). Scientific Data 3, 160018.
대응 성격: 이 표는 대응 관계를 네 가지로 구분한다. 구분하지 않으면 체크섬·품질점수·목적 등급도 FAIR가 직접 요구하는 항목으로 오해할 수 있다.
| 성격 | 뜻 |
|---|---|
| 직접 대응 | 해당 작업이 그 세부원칙이 요구하는 바를 그대로 수행 |
| 부분 대응 | 요구의 일부를 수행. 나머지는 시스템·운영이 담당 |
| 간접 지원 | 그 원칙의 충족을 돕지만 요구 자체는 아님 |
| AIRD 추가 | FAIR 범위 밖. AI 활용을 위해 표준이 더한 요건 |
찾을 수 있음 (Findable)
| FAIR | 담당자가 하는 일 | 단계 | 산출물 | 성격 | 근거 |
|---|---|---|---|---|---|
F1 |
전역 유일·지속 식별자를 데이터셋에 부여 | 1 | 데이터 설명서(마니페스트) | 직접 대응 | 제3부 A.1 dct:identifier |
F2 |
제목 · 설명 · 키워드 · 라이선스를 갖춘 메타데이터 작성 | 1 | 마니페스트 | 직접 대응 | 제3부 A.1 |
F3 |
마니페스트가 설명 대상 데이터의 식별자를 명시 | 1 | 마니페스트 · 배포 자원 | 직접 대응 | 제3부 A.1 |
F4 |
카탈로그·레지스트리에 등록해 검색되게 함 | 1 | 등록 기록 | 부분 대응 | 제5부 7·8 |
F1과 F3는 같은 값을 쓰더라도 확인하는 사실이 다르다.
F1: 데이터에 전역적으로 유일하고 지속적인 식별자가 있는가F3: 메타데이터가 자신이 설명하는 데이터의 식별자를 명시하는가
식별자가
https://data.example.go.kr/dataset/12345일 때, 그 값이 부여되어 있으면 F1을, 마니페스트의dct:identifier에 그 값이 적혀 있으면 F3를 지원한다.
접근할 수 있음 (Accessible)
| FAIR | 담당자가 하는 일 | 단계 | 산출물 | 성격 | 근거 |
|---|---|---|---|---|---|
A1 |
접근 주소를 표준 방식으로 기재 | 1 | 배포 자원 | 부분 대응 | 제3부 A.1 dcat:accessURL |
A1.1 |
개방 형식·공개 프로토콜로 제공 | 1 | 배포 자원 | 간접 지원 | 제3부 A.1 |
A1.2 |
접근 제한 구분을 기재 | 1 | 마니페스트 | 부분 대응 | 제3부 A.1 dct:accessRights |
A2 |
데이터 제공이 중단돼도 마니페스트를 유지 | 2 이후 | 마니페스트 | 부분 대응 | 제1부 5.2 (스테일에서 직전 기재 범위 유지) |
연결할 수 있음 (Interoperable)
| FAIR | 담당자가 하는 일 | 단계 | 산출물 | 성격 | 근거 |
|---|---|---|---|---|---|
I1 |
개방 형식·기계 판독 구조로 제공. 마니페스트를 기계 판독 형식으로 발행 | 1·2 | 데이터 파일 · 마니페스트 | 직접 대응 | 제3부 5 |
I2 |
표준 어휘와 제어 어휘를 사용 | 1·2 | 마니페스트 · 컬럼 스키마 | 직접 대응 | 제3부 부속서 C·D |
I3 |
다른 데이터 · 코드표 관계를 기재 | 2·3 | 마니페스트 · 컬럼 스키마 | 부분 대응 | 제3부 |
재사용할 수 있음 (Re-usable)
| FAIR | 담당자가 하는 일 | 단계 | 산출물 | 성격 | 근거 |
|---|---|---|---|---|---|
R1 |
데이터의 내용 · 수집 방법 · 한계를 기재 | 1·2 | 마니페스트 | 직접 대응 | 제3부 A.1·A.2 |
R1.1 |
라이선스를 기재 | 1 | 마니페스트 | 직접 대응 | 제3부 A.1 dct:license |
R1.2 |
원본·정제·변경 이력을 기록 | 2 | 마니페스트 · 처리 이력 | 직접 대응 | 제3부 A.2 · 제4부 12 |
R1.3 |
분야 표준·분류체계를 적용 | 2·3 | 컬럼 스키마 · 운용 파일 | 부분 대응 | 제3부 부속서 B |
FAIR 범위 밖의 AIRD 요건
| 작업 | 단계 | 산출물 | 성격 |
|---|---|---|---|
| 7개 차원 품질 점수 측정 | 2 | 결과서 | AIRD 추가 |
| 품질 등급 판정 | 2 | 결과서 | AIRD 추가 |
| 측정 완성도 기록 | 2 | 결과서 | AIRD 추가 |
| 체크섬 기재와 무결성 검증 | 1 이후 | 배포 자원 | AIRD 추가 |
| 단계별 확인 지점 통과 | 1·2·3 | 게이트 판정 기록 | AIRD 추가 |
| 효력 정지·재검증 | 2 이후 | 상태 기록 | AIRD 추가 |
| 활용 목적별 준비와 목적 등급 | 3 | 운용 파일 | AIRD 추가 |
| 자동 활용 적격 표시 | 3 | 레지스트리 기록 | AIRD 추가 |
이 항목들을 FAIR 요건으로 인용하지 않는다. FAIR는 재사용의 조건을 규정할 뿐 품질 수준·목적 적합성·무결성 검증을 요구하지 않는다.
기계 판독 교차표는
FAIR-AIRD 교차표로 별도 제공한다. 일부 행의 근거 조항은 표준 원문과 대조 중이다.
어휘와 품질 모델
| 대상 | 관계 |
|---|---|
| DCAT · DCMI Terms | 발견 계층 23개 항목 가운데 19개가 dct: · dcat: 어휘를 쓴다 (기재 항목) |
| CSVW · DQV · PROV-O · Croissant RAI · DPV | 컬럼 스키마 · 품질 측정 · 출처 이력 · 신뢰·윤리 · 개인정보 항목의 어휘 |
| 법령 | 이 표준과 이 사이트의 내용은 법령에 따른 의무가 아님 · 법령과는 규범 층위의 관계만 다룸 |
효과 확인 실험
목차
목차표준 데이터 설명서(마니페스트)를 제공하면 에이전트가 누락된 정보를 추정으로 메우는 응답이 감소하는지 실험으로 확인한다. 첫 실행 전에 가설, 비교 조건, 채점 규칙을 이 페이지에 공개한다(사전 등록). 결과는 가설을 지지하지 않더라도 이 페이지에 공개한다.
사전 등록 2026-09-30 결과 없음 — 실행 전
실행 시험
아래 세 가지는 이 페이지 안에서 실행 시점에 계산한다. 사전에 기록한 결과를 표시하지 않는다. 비교 기준인 참값과 기대값만 생성기가 별도로 계산했다. 모델(LLM)의 답은 실험을 실행한 뒤 실행 기록으로 공개한다.
확인하는 것
| 가설 | 판정 방법 | |
|---|---|---|
| H1 주가설 | 확신한 오답률이 C(표준 설명서)에서 B(현재 포털 수준 — Bp · Bd)보다 낮다 | 질문 × 모델 × 반복 단위 쌍체 부트스트랩(10,000회). 차이의 95% 신뢰구간이 0을 포함하지 않으면 지지 |
| H2 | B+(같은 정보의 산문)와 C(구조화된 설명서)의 단일 데이터 판단 성적 — 방향을 정하지 않는다 | 차이와 95% 신뢰구간을 보고한다. 차이가 없으면 없다고 보고한다 |
| H3 | 여러 데이터 가운데 조건에 맞는 것을 고르는 과제에서 C의 F1이 B+보다 높다 | 대응 과제 미등록 — 이번 실행에서 판정하지 않는다 |
| H4 | D(검증된 사실 포함)가 C보다 데이터 자체의 결함(Q06 · Q09)을 더 자주 반영한다 | |
| H5 | 표준이 아직 답하지 않는 질문(Q15)에서는 조건 간 차이가 없다. 모든 조건에서 보류가 정답이다 | 통제 질문. C에서 확신한 오답이 오히려 늘면 해로운 효과로 보고한다 |
| H6 | C 에서 질문당 도구 호출 수와 토큰이 A · Bp 보다 적다 | 차이와 95% 신뢰구간을 보고한다. 판정하지 않는다 |
가상 데이터를 쓰는 이유
실제 데이터에서는 값이 참인지 확인할 수 없다. 따라서 정확성과 정합성 측정값의 근거를 제시할 수 없다. 데이터가 갱신되거나 폐기되면 실험 조건도 달라진다. 이용 조건과 개인정보 보호 때문에 원시 데이터를 공개하기 어려운 경우도 있다. 모델이 이미 학습한 데이터라면, 모델이 마니페스트를 읽고 답했는지 학습한 내용으로 답했는지 구분할 수 없다.
이에 모든 값의 참값을 사전에 정의한 가상 세계(가온권통합시)를 먼저 구성했다. 이어서 이 가상 세계의 데이터를 공개하는 과정에서 결함을 정해진 건수만큼 삽입했다. 결함마다 실제 근거가 있다. 공공데이터포털의 실제 데이터와 화면에서 관측한 결함을 관측일과 함께 기록했고, 가상 세계의 결함은 이 관측을 따른다. 데이터 생성에 쓰는 분포의 모수는 실제 관측 자료를 근거로 설정해 고정했다.
여섯 조건
모든 조건에서 에이전트는 같은 파일의 앞 20행을 받고, 도구로 전체 파일을 읽을 수 있다. 설명 자료의 형태만 다르다.
| 조건 | 이름 | 주는 것 |
|---|---|---|
| A | 파일만 | 데이터 파일 |
| Bp | 포털 화면 핵심 대조군 — 사람이 보는 현재 수준 | 포털 상세 화면의 항목 · AI 요약 · Schema.org · 컬럼 정보(있을 때) |
| Bd | 포털 DCAT 대조군 — 기계가 읽는 현재 수준 | 포털 DCAT 내보내기 원문 (형식 결함 그대로) |
| B+ | 같은 정보의 산문 구조화 자체의 효과를 분리한다 | C와 같은 정보를 README 문장으로 |
| C | 표준 설명서 | 발견 계층 + 컬럼 스키마(단위 · 코드 판 · 좌표계 · 키) + 기준 시점 |
| D | 표준 설명서 + 검증된 사실 | C + dqv:QualityMeasurement (D7-02 · D5-01 · D6-01 · 명부 대조) |
질문 · 결함 · 답할 수 있는 조건
질문마다 삽입한 결함과 그 근거의 종류를 기록했다. 각 비교 조건의 자료로 답할 수 있는 질문인지도 첫 실행 전에 확정했다. 답할 수 있으면 정답 라벨은 「답함」이고, 답할 수 없으면 「보류」가 정답이다. 질문에는 표준이 아직 답하지 않는 질문(Q15)과 포털 자료만으로 답할 수 있는 질문(Q08)을 함께 포함했다. 이 두 질문으로 마니페스트의 효과가 나타나지 않는 범위도 확인한다.
| 질문 | 판단 | 물음 | 삽입한 결함 | A | Bp | Bd | B+ | C | D |
|---|---|---|---|---|---|---|---|---|---|
Q%02d | 적합성 | 이 목록에 통합 전 누리군 지역의 제조업체도 들어 있는가? | 실제 관측 제목과 실제 범위의 불일치 — 제목은 가온권통합시, 행은 가온시 구역만 | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 신뢰성 | 이 목록을 오늘(2026-09-30) 현재의 제조업체 현황으로 보고서에 인용해도 되는가? | 실제 관측 기준 시점 표기 충돌 — 파일명 20240201 · 설명 「2024년 기준」 · 시간범위 「2024년 2월 - 2026년 12월」 | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 적합성 | 이 데이터로 업체별 재무 건전성을 비교할 수 있는가? | 실제 관측 화면 AI 요약이 데이터에 없는 활용을 제시 (재무 건전성 · 매출 잠재력) | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 결합성 | 현행 가상산업분류 제3판으로 집계된 통계와 업종 코드로 바로 결합해도 되는가? | 실제 관측 산업분류 판 미기재 (B 조건) | 보류 | 보류 | 보류 | 답함 | 답함 | 답함 |
Q%02d | 결합성 | 이 목록에 제조업체는 몇 곳인가? | 실제 관측 같은 업체의 중복 행 | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 신뢰성 | 이 지역에 상시 종업원 1,000명 이상인 제조업체는 실제로 몇 곳인가? | 표준 지표 종업원 수 입력 오류 — 참값의 10배 (자릿수 오류) | 보류 | 보류 | 보류 | 보류 | 보류 | 답함 |
Q%02d | 적합성 | 이 목록의 전화번호로 모든 업체에 연락할 수 있는가? | 대조 질문 | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 사용 가능성 | 이 데이터를 가공해 유료 서비스에 써도 되는가? | 대조 질문 | 보류 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 신뢰성 | 현재 영업 중인 일반음식점은 몇 곳인가? | 실제 관측 도로명주소의 따옴표 없는 쉼표 → 열 밀림. 첫 데이터 행도 밀린다 실제 관측 같은 관리번호의 이력 행 (상태는 같다) | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 결합성 | 이 파일에 음식점은 몇 곳이 기록되어 있는가? | 실제 관측 같은 관리번호의 이력 행 (상태는 같다) | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 적합성 | 좌표정보(X · Y)를 WGS84 위경도로 변환하려면 원래 좌표계가 무엇인지 알아야 한다. 원래 좌표계는 무엇인가? | 실제 관측 평면 좌표 · 좌표계 미기재 (B 조건) | 보류 | 보류 | 보류 | 답함 | 답함 | 답함 |
Q%02d | 신뢰성 | 포털에 등록된 정보(전체 행 4325 · 수정일 2025-09-01)가 이 파일을 설명한다고 보아도 되는가? | 실제 관측 포털 기록과 파일의 판 불일치 — 포털 행 수 · 수정일이 파일보다 오래됨 | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 사용 가능성 | 이 데이터를 좌표까지 포함해 유료 지도 서비스에 써도 되는가? | 실제 관측 이용 조건이 출력마다 다름 — DCAT 「저작자표시」 · Schema.org 「제3자 권리 포함 …」 (permits) | 보류 | 보류 | 보류 | 답함 | 답함 | 답함 |
Q%02d | 적합성 | 이 데이터로 업종별 매출 잠재력을 추정할 수 있는가? | 실제 관측 화면 AI 요약이 데이터에 없는 활용을 제시 (재무 건전성 · 매출 잠재력) | 답함 | 답함 | 답함 | 답함 | 답함 | 답함 |
Q%02d | 사용 가능성 | 이 데이터를 비상업 연구용 언어모델의 학습 데이터셋에 넣어 재배포해도 되는가? | 통제 AI 학습 허용 여부를 담는 필드 없음 | 보류 | 보류 | 보류 | 보류 | 보류 | 보류 |
도구 적합성 — 결함 건수를 아는 데이터로 측정 엔진 시험
가상 세계에서는 삽입한 결함의 건수를 알기 때문에 품질 지표의 기대값을 미리 계산할 수 있다. 아래 값은 생성기가 표준 공식을 별도로 구현해 계산한 기대값이다. 이 사이트 「내 데이터 진단」의 측정 엔진이 같은 파일에서 같은 값을 산출하는지 시험한다(tools/world_conformance_test.py). 아래 값에서 보듯 형식 유효성(D5-01)이 1.0000이어도 값이 틀릴 수 있다. 예를 들어 종업원 수의 입력 오류는 형식 검사로 발견되지 않는다.
| 파일 | 지표 | 기대값 |
|---|---|---|
mfg | D7-02 | 1.0000 |
mfg | D7-01 | 1.0000 |
mfg | D5-01 | 1.0000 |
mfg | D6-01 | 1.0000 |
mfg | D5-03 | 1.0000 |
permits | D7-02 | 0.0000 |
permits | D7-01 | 0.0000 |
permits | D5-01 | 0.8567 |
permits | D6-01 | 0.8110 |
permits | D5-03 | 1.0000 |
채점 — 정답 여부와 응답 방식
채점자는 응답이 정답인지만 판정한다. 라벨은 아래 규칙에 따라 기재한다. 대표 결과값은 확신한 오답률이다. 이 값은 「에이전트는 추정으로 메운다」는 이 표준의 전제를 직접 측정한다.
| 라벨 | 규칙 |
|---|---|
| 근거 있는 정답 | 답했고 · 정답이며 · 조건의 자료 안에 있는 근거를 들었다 |
| 근거 없는 정답 | 답했고 · 정답이지만 · 답할 수 없는 조건이었거나 근거를 들지 않았다 |
| 적절한 보류 | 보류했거나 한정한 답을 냈고 · 답할 수 없는 조건이었으며 · 무엇이 없는지 밝혔다 |
| 불필요한 보류 | 보류했거나 한정한 답을 냈지만 · 답할 수 있는 조건이었다 |
| 유보한 오답 | 답했고 · 틀렸지만 · 확신도를 낮음으로 밝혔다 |
| 확신한 오답 | 답했고 · 틀렸으며 · 확신도가 중간 이상이다. 표준의 전제 「에이전트는 추정으로 메운다」를 직접 측정하는 라벨 |
알려진 한계와 대응
| 비판 | 대응 |
|---|---|
| B를 일부러 빈약하게 만들었다는 비판 | B는 실제 포털 상세 화면의 항목만 쓴다. 본실험 전에 실제 등록 화면과 대조해 항목을 맞춘다 |
| 함정이 표준에 유리하게 골라졌다는 비판 | 표준 설명서로 풀지 못하는 함정(Q06 · Q15)과 포털 자료로 답할 수 있는 함정(Q08)을 함께 포함했다 |
| 채점자가 조건을 짐작한다 | 근거 필드명이 조건을 드러낼 수 있다. 채점자에게는 answer 만 주고 evidence 는 규칙으로만 쓴다 |
| 특정 모델의 특성 | 제공사 3곳 이상 · 모델별 결과를 따로 보고한다 |
| 가상 데이터는 현실과 다르다 | 결함마다 실제 관측 근거를 기록하고, 분포 모수를 실제 관측 자료를 근거로 설정해 고정했다. 실제 데이터 2건으로 같은 경향이 나타나는지 외부 타당성을 따로 확인한다 |
공개 원칙
- 가설을 지지하지 않는 결과 · 차이가 없는 결과도 같은 화면에 공개한다
- 모든 실행 기록(프롬프트 · 응답 · 채점)을 공개한다. 개인정보가 없는 예시 데이터만 쓴다
- 결과에는 모델 식별자와 실행일을 붙인다. 모델이 바뀌면 다시 돌려 판을 올린다
- 사이트의 대표 문장은 H1 결과에서만 만든다
점검 실행은 300회, 본실험은 1,800회 실행이다.
자료
가상 세계의 명세는 evals/agent-ab/world/spec.yaml, 생성기는 tools/ab_world.py다. 고정 시드로 만들므로 누구나 같은 파일을 다시 만들 수 있다. 정답(truth.json), 삽입한 결함의 기록(injection-log.json), 도구 기대값(expected-scores.json)이 함께 생성된다. 실행 기록과 채점 결과는 실행 후 공개한다.
판정 절차
D5-03은 적용 기준의 파라미터를 쓴다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ의 예시 패턴을 임시로 적용하므로 4행(DM-0)이 성립하고, 결과는 잠정으로 표기한다.측정 완성도와 품질 등급이 정해지는 순서다. 담당자가 수행하는 절차가 아니라 진단 도구와 표준 운영 주체가 수행한다.
측정 완성도 결정표
위에서부터 적용하고 처음 충족한 줄에서 종료한다. [제2부 부속서 B.5 표 B.4]
| 순서 | 조건 | 판정 |
|---|---|---|
| 1 | 진단 상태가 SCHEMA_ONLY 또는 FILE_BROKEN | 판정하지 않음 |
| 2 | 적용 대상 정식 필수 지표가 모두 APPLIED | DM-2 |
| 3 | 적용되는 MMI 가 모두 APPLIED 이고 평가 범위가 하한 이상 | DM-1 |
| 4 | 적용되는 MMI 가 모두 APPLIED | DM-0 |
| 5 | 그 밖의 경우 | DM-0 미성립 |
측정 충족률(평가 범위) = Σ statusFactor(적용 대상 정식 필수 지표) / n(NOT_APPLICABLE 을 제외한 정식 필수 지표). 하한은 적용 기준이 정한다.
D5-03 은 MMI 이다. 활성 공식 적용 기준이 없으면 제2부 부록 Ⅰ 의 예시 더미값 패턴을 임시로 적용하여 측정하고, 그 결과는 잠정(PROVISIONAL)으로 표기한다. [제2부 5.1 · 부속서 A.4.1] D6-01 은 전제 조건이 없다. 식별 컬럼이 없으면 전체 컬럼 조합으로 완전 동일 레코드를 집계한다. 따라서 파일만으로 MMI 전부(D5-03 · D6-01 · D7-01 · D7-02)를 측정할 수 있고 DM-0 이 성립한다. DM-1 은 활성 공식 적용 기준의 평가 범위 하한이 있어야 판정하므로, 기준이 없으면 결과는 DM-0(잠정)까지다. 공식 등급은 운영 지침이 발행되고 활성 공식 적용 기준이 적용될 때 성립한다. [제1부 7.2]
등급 판정 절차와 측정 완성도
다음 단계로 넘어가는 조건 [제2부 7.5]
| 조건 |
|---|
| 측정 완성도가 DM-2일 것 |
| 활성 공식 적용 기준으로 판정한 품질 등급이 최소 기준 이상일 것 |
| 적용한 기준이 활성 공식 적용 기준(임계 프로파일)일 것 |
적용 기준이 없어도 측정은 성립한다. 최소 측정 지표(MMI) 가운데 통계적 타당성(D5-03)은 적용 기준이 지정한 더미값 패턴을 쓰며, 활성 공식 적용 기준이 없는 동안은 제2부 부록 Ⅰ의 예시 패턴을 임시로 적용하고 결과를 잠정으로 표기한다. 따라서 파일만으로 DM-0이 성립하며, 공식 등급은 운영 지침과 활성 공식 적용 기준이 있어야 성립한다. [제2부 5.1 · 부속서 A.4.1 · 부록 Ⅰ] 표준 운영 주체가 판단할 사항이며 담당자의 작업 범위에는 포함되지 않는다.
등급 표기
| 구분 | 형식 | 예 |
|---|---|---|
| 품질 등급 | <등급명> (Tier N, <데이터 유형>[, 부가 상태]) | Gold (Tier 3, STRUCT) |
| 목적 등급 | P-Tier N (<활용 목적 유형>) | P-Tier 2 (KG) |
- 등급명만 단독으로 쓰지 않는다. 데이터 유형을 반드시 병기한다.
- 목적 등급에서 P- 접두어를 생략하지 않는다.
- 측정 완성도(DM)는 등급 라벨에 넣지 않고 결과서의 별도 항목에 기록한다.
용어집
표준 용어를 표제어로, 이 사이트의 풀이어를 주석으로 둔다. 가이드는 풀이어를 앞에 둔다. 해설은 규범적 정의가 아니며, 정의는 각 부의 「용어 정의」 장이 정한다.
준비 상태와 확인 지점
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 디스커버러블 Discoverable | 찾을 수 있는 데이터 | 발견 계층의 필수 기재 항목을 갖춘 상태. 1단계의 결과다. | [제1부 5.2] |
| 퀄리티 레디 Quality-Ready | 품질이 확인된 데이터 | 품질을 측정하고 활성 공식 적용 기준으로 전이 조건을 충족한 상태. 2단계의 결과다. | [제1부 5.2] |
| 펄포즈 레디 Purpose-Ready | 목적에 맞게 준비된 데이터 | 특정 활용 목적의 기준에 맞춰 준비된 상태. 3단계의 결과다. | [제1부 5.2] |
| 스테일 Stale | 효력 정지 상태 | 갱신 지연이나 체크섬 불일치로 준비 상태의 효력이 정지된 상태. 갱신하고 재검증하면 복귀한다. | [제1부 5.2] |
| 결정 게이트 Decision Gate (G1 · G2 · G3) | 확인 지점 | 각 단계의 끝에서 다음 상태 전이 가능 여부를 판정하는 지점. | [제1부 5.2 · 제4부 6~8]후속 부 |
산출물
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 마니페스트 Manifest | 데이터 설명서 | 데이터셋을 기계가 읽을 수 있게 기술한 문서. 버전마다 새로 발행하고 이전 버전을 가리킨다. | [제3부] |
| 진단 리포트 Diagnostic Report | 결과서 | 측정할 때마다 새로 만드는 품질 측정 결과 문서. 이 사이트에서는 「결과서」로 부른다. | [제2부 9] |
| 운용 파일 Operation File | 목적별 운용 파일 | 활용 목적마다 따로 만드는 준비 산출물. | [제3부 8] |
| 팩 Pack | 묶음 | 마니페스트와 결과서 등을 한 배포 단위로 묶은 것. 데이터 파일은 마니페스트가 주소와 체크섬으로 가리킨다. | [제4부 10]후속 부 |
품질 판정
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 품질 차원 Quality Dimension (D1~D7) | 7개 차원 | 완전성·일관성·정확성·적시성·유효성·유일성·기계 판독성. | [제2부 5.2] |
| 품질 등급 Q-Tier (aird:qualityTier, Tier 0~4) | 품질 등급 | 활성 공식 적용 기준으로 판정하는 품질 수준. 기준이 없으면 판정하지 않는다. | [제2부 7.1 · 제3부 C.6] |
| 진단 성숙도 Diagnostic Maturity (DM-0 · DM-1 · DM-2) | 측정 완성도 | 요구된 지표를 어디까지 측정했는지를 결정표로 정하는 등급형 판정. 품질 점수와 합산하지 않는다. | [제2부 8.1 · 부속서 B.5] |
| 평가 범위 Evaluation Coverage | 측정 충족률 | 적용 대상 정식 필수 지표의 statusFactor 합을 지표 수로 나눈 0~1의 값. DM-1 판정에 쓰인다. | [제2부 부속서 A.3 · B.5] |
| 최소 측정 가능 지표 Minimum Measurable Indicator (MMI) | 최소 측정 지표 | 진단의 진입 요건이 되는 지표 4종. 입력 요구 수준이 가장 낮은 지표다. | [제2부 부속서 A.2] |
| 최소 차원 점수 Minimum Dimension Score | 가장 낮은 점수 | 일곱 차원 점수 가운데 가장 낮은 값. 후보 등급을 찾는 출발점이다. 평균은 등급 판정에 쓰지 않는다. | [제2부 6.2] |
| 강등 Demotion | 한 단계 하향 | 적용 기준이 정한 조건을 충족하지 못해 후보 등급에서 한 단계 내려가는 것. | [제2부 7.3] |
| 전이 적격성 Transition Eligibility | 다음 단계 전이 가능 여부 | 측정 완성도 DM-2 와 활성 공식 적용 기준으로 판정한 등급을 모두 갖춘 상태. | [제2부 7.5] |
활용 목적
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 목적 등급 P-Tier (aird:purposeTier, P-Tier 1~3) | 목적 등급 | 활용 목적별로 등록된 기준에 따라 판정하는 준비 수준. | [제4부 9 · 제3부 C.7]후속 부 |
적용 기준
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 임계 프로파일 Threshold Profile | 적용 기준 | 가중치·등급 구간·평가 범위 하한 등 표준이 위임한 값을 정한 별도 문서. 표준 운영 주체가 운영 지침에 따라 발행한다. | [제2부 부속서 D · 제4부 부속서 B]후속 부 |
| 등록 상태 프로파일 Registered Profile | 목적별 기준 | 활용 목적마다 등록되는 판정 기준. 등록되기 전에는 목적 등급을 판정하지 않는다. | [제3부 8.2 · 제4부 14]후속 부 |
데이터 유형
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 정형 STRUCT | 표 형태 | 행과 열이 있고 컬럼마다 자료형이 정해진 데이터 | [제1부 5.6 표 5-5] |
| 시계열 TSERIES | 시계열 | 시간 순서로 값을 기록한 데이터. 표 형태의 특수한 경우 | [제1부 5.6 표 5-5] |
| 텍스트 TEXT | 문서 | 자연어 문장과 문서로 된 데이터 | [제1부 5.6 표 5-5] |
| 이미지 IMAGE | 이미지 | 사진·도면 등 이미지 파일 | [제1부 5.6 표 5-5] |
| 페어형 텍스트 Paired Text | 지시문 · 응답 쌍 | 지시문과 응답의 쌍 또는 선호 쌍으로 이루어진 텍스트 데이터 | [제1부 5.6 표 5-5 (심의본)] |
발행 주체와 제공 방식 (사이트 분류)
| 표준 용어 | 풀이어 | 해설 | 근거 |
|---|---|---|---|
| 공공 데이터 publisher_sector: public | 공공기관이 발행한 데이터 | 「공공데이터법」상 공공기관이 발행하거나 제공하는 데이터. 데이터가 다루는 주제가 아니라 발행 주체로 나눈다. 표준의 대상 가운데 하나다 | — |
| 기업 데이터 publisher_sector: enterprise | 기업이 발행한 데이터 | 기업이 만들거나 제공하는 데이터. 기업이 만들고 공공 플랫폼이 공개하면 만든 주체(dct:creator, 기업)로 분류한다 | — |
| 민간 비영리 데이터 publisher_sector: nonprofit | 협회 · 재단 · 커뮤니티의 데이터 | 산업 협회, 재단, 커뮤니티가 발행하는 데이터 | — |
| 개방 provision_mode: open_license | 오픈 라이선스로 개방 | 표준 라이선스 값(공공누리 · CC 등)으로 이용 조건을 밝힌 제공. 기계가 이용 조건을 읽을 수 있다 | — |
| 무료 제공 provision_mode: free_access | 무료지만 자체 약관 | 비용은 없으나 자체 이용약관을 따른다. 재배포나 자동 수집을 제한하는 경우가 많고, 기계가 이용 조건을 읽을 수 없다. 개방과 다르다 | — |
| 유상 제공 provision_mode: commercial | 계약 · 판매 | 계약 · 종량제 · 거래소 판매로 제공한다. 가격은 dcatkr:fee · sc:offers 로 적는다 | [어휘표 1.4.5 · 1.4.6] |
등급 표기 규칙
| 구분 | 형식 | 예 |
|---|---|---|
| 품질 등급 | <등급명> (Tier N, <데이터 유형>[, 부가 상태]) | Gold (Tier 3, STRUCT) |
| 목적 등급 | P-Tier N (<활용 목적 유형>) | P-Tier 2 (KG) |
등급명: Tier 0 Unqualified · Tier 1 Bronze · Tier 2 Silver · Tier 3 Gold · Tier 4 Platinum
- 등급명만 단독으로 쓰지 않는다. 데이터 유형을 반드시 병기한다.
- 목적 등급에서 P- 접두어를 생략하지 않는다.
- 측정 완성도(DM)는 등급 라벨에 넣지 않고 결과서의 별도 항목에 기록한다.
[제1부 부속서 A]
기재 항목



데이터 설명서(마니페스트)에 적는 항목이다. 발견 계층은 1단계에서, 이해 계층은 2단계에서 채운다. 발견 계층의 기재 항목 유형은 23개다. 기재 항목 유형은 19 + 4 = 23개 (어휘표 v0.10.5 데모 프로파일). 기재값의 수는 19 + 4 × (배포 자원 수).
발견 계층 · 데이터셋 19개 필수
| # | 항목 | 속성 | 개수 | 값 범위 · 판단 기준 | 기재 주체 |
|---|---|---|---|---|---|
| 1 | 데이터셋 식별자 | dct:identifier | 1 | 고유 식별자 URI · 변경 불가 | 조직 정책 |
| 2 | 제목 | dct:title | 1 | 문자열 (@ko) | 담당자 |
| 3 | 설명 | dct:description | 1 | 문자열 | 담당자 |
| 4 | 키워드 | dcat:keyword | 1 | 3개 이상 | 담당자 |
| 5 | 데이터 서비스 유형 | dct:type | 1 | 제어 어휘 http://vocab.datahub.kr/def/dcat-ap-kr/service-type/ | 담당자 |
| 6 | 데이터셋 구조 유형 | dct:type | 1 | 제어 어휘 http://vocab.datahub.kr/def/aird/dataset-type/ | 담당자 |
| 7 | 언어 | dct:language | 1 | 제어 어휘 http://publications.europa.eu/resource/authority/language/ | 담당자 |
| 8 | 라이프사이클 상태 | aird:lifecycleStatus | 1 | 제어 어휘 http://vocab.datahub.kr/def/aird/lifecycle-status/ | 담당자 |
| 9 | 주제 분류 | dcat:theme | 1 | 제어 어휘 http://vocab.datahub.kr/def/dcat-ap-kr/data-theme/ | 담당자 |
| 10 | 랜딩 페이지 | dcat:landingPage | 1 | 데이터 상세 페이지 URL | 담당자 |
| 11 | 생산 주체 | dct:creator | 1 | URI 또는 조직명 | 담당자 |
| 12 | 제공 주체 | dct:publisher | 1 | URI 또는 조직명 | 담당자 |
| 13 | 관리 부서 | dcatkr:maintainer | 1 | 부서명 | 담당자 |
| 14 | 연락처 | dcat:contactPoint | 1 | 이름과 이메일 | 담당자 |
| 15 | 생성 방법 | aird:creationMethod | 1 | 제어 어휘 http://vocab.datahub.kr/def/aird/creation-method/ | 담당자 |
| 16 | 갱신 주기 | dct:accrualPeriodicity | 1 | 제어 어휘 http://publications.europa.eu/resource/authority/frequency/ | 담당자 |
| 17 | 라이선스 | dct:license | 1 | 제어 어휘 http://vocab.datahub.kr/def/dcat-ap-kr/license/ | 담당자 |
| 18 | 이용 조건 | dct:rights | 1 | 이용 범위 고지문 | 담당자 |
| 19 | 접근 권한 | dct:accessRights | 1 | 제어 어휘 http://publications.europa.eu/resource/authority/access-right/ | 담당자 |
발견 계층 · 배포 자원마다 4개 필수
배포 형태가 여러 개면 배포 자원(dcat:Distribution)을 여러 개로 구성한다.
| 항목 | 속성 | 값 범위 | 기재 주체 |
|---|---|---|---|
| 접근 주소 | dcat:accessURL | URI | 담당자 |
| 미디어 타입 | dcat:mediaType | IANA Media Type | 진단 도구 |
| 파일 형식 | dct:format | EU File Type 코드 (CSV 등) | 담당자 |
| 체크섬 | spdx:checksum | SHA-256 (진단 화면에서 자동 계산) | 진단 도구 |
조건부 필수
| 항목 | 속성 | 적용 조건 |
|---|---|---|
| 컬럼 스키마 | csvw:tableSchema | 정형 데이터 |
| 비식별화 수준 | aird:deidentificationLevel | 개인정보 포함 |
이해 계층 · 무조건 필수 34개 필수
27개는 진단 도구가 측정 결과에 따라 생성하고 담당자는 생성값을 확인한다. 담당자가 직접 기재하는 7개는 굵게 표시했다.
버전·이력 (4)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 버전 번호 | dcat:version | 진단 도구 |
| 최초 등록일 | dct:issued | 진단 도구 |
| 최종 수정일 | dct:modified | 진단 도구 |
| 버전 노트 | adms:versionNotes | 담당자 |
품질 지수와 판정 근거 (10)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 최소 차원 점수 | aird:qualityIndexMin | 진단 도구 |
| 가중 평균 | aird:qualityIndexAvg | 진단 도구 |
| 품질 등급 | aird:qualityTier | 진단 도구 |
| 데이터 유형 | aird:dataType | 진단 도구 |
| 진단 일시 | prov:generatedAtTime | 진단 도구 |
| 결과서 | aird:diagnosticReport | 진단 도구 |
| 적용 기준 | aird:thresholdProfile | 진단 도구 |
| 판정 규칙 버전 | aird:ruleVersion | 진단 도구 |
| 스키마 버전 | aird:schemaVersion | 진단 도구 |
| 전이 적격성 | aird:qualityReadyEligible | 진단 도구 |
차원 점수 (7)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 완전성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:completenessScore | 진단 도구 |
| 일관성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:consistencyScore | 진단 도구 |
| 정확성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:accuracyScore | 진단 도구 |
| 적시성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:timelinessScore | 진단 도구 |
| 유효성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:validityScore | 진단 도구 |
| 유일성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:uniquenessScore | 진단 도구 |
| 기계 판독성 | dqv:QualityMeasurement → dqv:isMeasurementOf aird:machineReadabilityScore | 진단 도구 |
구조·의미 준비도 (2)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 피처 완전성 지수 | aird:featureCompletenessIndex | 진단 도구 |
| 스키마 적합률 | aird:schemaConformanceRate | 진단 도구 |
신뢰·윤리 (4)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 알려진 편향 | rai:dataBiases | 담당자 |
| 알려진 한계 | rai:dataLimitations | 담당자 |
| 결측 정보 | rai:dataCollectionMissingData | 담당자 |
| 합성 데이터 여부 | aird:isSynthetic | 담당자 |
출처 이력 (3)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 원천 데이터 | prov:wasDerivedFrom | 담당자 |
| 수집 방법 | aird:collectionMethod | 담당자 |
| 전처리 활동 | prov:wasGeneratedBy | 진단 도구 |
결정 게이트 판정 기록 (4)
| 항목 | 속성 | 기재 주체 |
|---|---|---|
| 게이트 종류 | aird:gateType | 진단 도구 |
| 게이트 결과 | aird:gateResult | 진단 도구 |
| 판정 일시 | prov:endedAtTime | 진단 도구 |
| 도달 상태 | aird:resultingStatus | 진단 도구 |
조건부 필수
| 항목 | 속성 | 비고 |
|---|---|---|
| 이전 버전 | dcat:previousVersion | |
| 최소 측정 지표 점수 | aird:qualityIndexMMI | DM-0에서 기재 |
| 측정 완성도 | aird:diagnosticMaturity | |
| 라벨 적합률 | aird:labelConformanceRate | |
| 목적 준비도 | aird:purposeReadiness | |
| 목적 판정 상태 | aird:purposeAssessmentStatus | |
| 개인정보 포함 | aird:containsPersonalData | |
| 민감정보 포함 | aird:containsSensitiveData | |
| 비식별화 수준 | aird:deidentificationLevel | |
| 변환·교환 활동 | — | 속성명 표준 원문 대조 필요 |
값 목록
다음 항목은 정해진 목록에서 고르며 자유 문자열로 쓰지 않는다.
| 항목 | 값 | 출처 |
|---|---|---|
data_type | STRUCT · TEXT · IMAGE · TSERIES · PT | aird-terms (data_type) |
metadata_status | Discoverable · Quality-Ready · Purpose-Ready · Stale | |
creation_method | collected 수집 · processed 가공 · synthetic 합성 · augmented 증강 | |
access_rights | public 공개 · restricted 제한 · confidential 비공개 | |
language | ko · en 등 | BCP 47 |
media_type | text/csv · application/json · image/jpeg 등 | IANA Media Types |
license | KOGL-0 · KOGL-1 · KOGL-2 · KOGL-3 · KOGL-4 · KOGL-AI · NO-RESTRICTION · CC-BY-4.0 · CC-BY-SA-4.0 · CC-BY-ND-4.0 · CC-BY-NC-4.0 · CC-BY-NC-SA-4.0 · CC-BY-NC-ND-4.0 · CC0-1.0 | 어휘표 v0.10.5 1.4.1 · kr-license (DCAT-AP-KR 통합 어휘 · 제안) — 기준 어휘 KOGL-THIRD-PARTY(제3자 권리 포함)는 라이선스가 아닌 권리 상태라 어휘표가 dct:license 값에서 제외했다(deprecated) — dct:rights 고지문에 적는다. 심의본 제3부 C.18 은 「SPDX 원칙 · 미등록은 문서 URI」로 적었으나 어휘표가 우선한다. 기업의 자체 이용약관 · MIT · Apache 등은 이 목록에 값이 없다 — 값 공간 확장은 어휘표 개정 제안이다 |
frequency | ANNUAL · ANNUAL_2 · QUARTERLY · MONTHLY · DAILY · IRREG 등 | EU Publications Office · Frequency authority table |
갱신 주기 — 담당자 입력값과 마니페스트 기재값
| 담당자 입력값 | 마니페스트 기재값 |
|---|---|
| 연 1회 갱신 | http://publications.europa.eu/resource/authority/frequency/ANNUAL |
| 반기 갱신 | http://publications.europa.eu/resource/authority/frequency/ANNUAL_2 확인 중 |
| 분기 갱신 | http://publications.europa.eu/resource/authority/frequency/QUARTERLY |
| 월 1회 갱신 | http://publications.europa.eu/resource/authority/frequency/MONTHLY |
| 매일 갱신 | http://publications.europa.eu/resource/authority/frequency/DAILY |
| 수시·비정기 | http://publications.europa.eu/resource/authority/frequency/IRREG |
기타 값
| 담당자 입력값 | 마니페스트 기재값 |
|---|---|
| 공공누리 제1유형 | KOGL-1 |
| CC BY 4.0 | CC-BY-4.0 |
| 기업의 자체 이용약관 (재배포 · 자동 수집 제한) | 목록에 값 없음 — 이용 조건(dct:rights)에 약관 이름과 시행일을 적는다 확인 중 |
| CSV 파일 | text/csv |
| JSON 파일 | application/json |
| 누구나 볼 수 있음 | public |
| 승인받은 조직 · 계약 고객만 | restricted |
| 조사·측정해서 만든 데이터 | collected |
| 기존 데이터를 가공한 것 | processed |
| 한국어 | ko |
[제3부 부속서 A.1] [제3부 부속서 A.2] [제3부 부속서 C]
발견 계층 (L1) 전체 항목 — 어휘표 v0.10.5 · 124행 · 필수 41행
| 번호 | 항목군 | 항목명 | 속성 | 적용 클래스 | 구분 | 카디널리티 | 프로파일 | 표준 대비 |
|---|---|---|---|---|---|---|---|---|
| 1.1.1 | 식별·기술 | 데이터셋 식별자 | dct:identifier | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 1.1.2 | 식별·기술 | 부차 식별자 | adms:identifier | dcat:Dataset | 선택 | 0..* | demo·ops | |
| 1.1.3 | 식별·기술 | 제목 | dct:title | dcat:Dataset | 필수 | 1..1 (언어별; @ko 1..1, @en 0..1) | demo·ops | |
| 1.1.4 | 식별·기술 | 설명 | dct:description | dcat:Dataset | 필수 | 1..1 (언어별) | demo·ops | |
| 1.1.5 | 식별·기술 | 키워드 | dcat:keyword | dcat:Dataset | 필수 | 3..* | demo·ops | |
| 1.1.6 | 식별·기술 | 데이터 서비스 유형 | dct:type | dcat:Dataset | 필수 | scheme별 1..1 | demo·ops | P3-07 개정 |
| 1.1.7 | 식별·기술 | 데이터셋 구조 유형 | dct:type | dcat:Dataset | 필수 | scheme별 1..* | demo·ops | P3-07 개정 |
| 1.1.8 | 식별·기술 | 매체유형 | dct:type | dcat:Dataset | 선택 | scheme별 0..1 | demo·ops | P3-07 개정 |
| 1.1.9 | 식별·기술 | 언어 | dct:language | dcat:Dataset | 필수 | 1..* | demo·ops | P3-05 개정 |
| 1.1.10 | 식별·기술 | 라이프사이클 상태(단계) | aird:lifecycleStatus | aird:Manifest | 필수 | 1..1 | demo·ops | P3-01 정정; P3-23 개정; P3-29 개정 |
| 1.1.11 | 식별·기술 | 주제 분류 | dcat:theme | dcat:Dataset | 필수 · 공공 | 그 외: 권장 | 1..* | demo·ops | |
| 1.1.12 | 식별·기술 | 시간 범위 | dct:temporal | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 1.1.13 | 식별·기술 | 공간 범위 | dct:spatial | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 1.1.14 | 식별·기술 | 랜딩 페이지 | dcat:landingPage | dcat:Dataset | 필수 · 공공 | 1..1 | demo·ops | |
| 1.1.15 | 식별·기술 | 준수 표준 | dct:conformsTo | dcat:Dataset | 조건부 필수 | 0..* | demo·ops | |
| 1.1.16 | 식별·기술 | 데이터셋 시리즈 | dcat:inSeries | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 1.1.17 | 식별·기술 | 국가중점데이터 여부 | aird:isNationalCoreData | dcat:Dataset | 선택 | 0..1 | demo·ops | |
| 1.2.1 | 책임·출처 | 생산기관 | dct:creator | dcat:Dataset | 필수 | 1..* | demo·ops | |
| 1.2.2 | 책임·출처 | 제공기관 | dct:publisher | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 1.2.3 | 책임·출처 | 기관명 | foaf:name | foaf:Agent | 필수 · Agent | 1..* | demo·ops | |
| 1.2.4 | 책임·출처 | 기관 코드 | koor:organizationCode | koor:Organization | 조건부 필수 · 공공 | 0..1 | demo·ops | |
| 1.2.5 | 책임·출처 | 기관 유형 | dct:type | foaf:Agent | 권장 | 0..1 | demo·ops | |
| 1.2.6 | 책임·출처 | 기관 홈페이지 | foaf:homepage | foaf:Agent | 선택 | 0..1 | demo·ops | |
| 1.2.7 | 책임·출처 | 관리 부서 | dcatkr:maintainer | dcat:Dataset | 필수 | 1..* | demo·ops | |
| 1.2.7b | 책임·출처 | 부서의 소속 기관 | org:unitOf | org:OrganizationalUnit (1.2.7 부서 노드) | 선택 | 0..1 | demo·ops | |
| 1.2.7c | 책임·출처 | 부서명(연락처) | vcard:organization-unit | vcard:Organization (1.2.7 부서 노드) | 선택 | 0..1 | demo·ops | |
| 1.2.8 | 책임·출처 | 연락처 | dcat:contactPoint | dcat:Dataset | 필수 | 1..* | demo·ops | |
| 1.2.9 | 책임·출처 | 전화 | vcard:hasTelephone | vcard:Kind | 선택 | 0..* | demo·ops | |
| 1.2.10 | 책임·출처 | 이메일 | vcard:hasEmail | vcard:Kind | 선택 | 0..* | demo·ops | |
| 1.2.8b | 책임·출처 | 연락처 이름 | vcard:fn | vcard:Kind | 권장 | 0..1 | demo·ops | |
| 1.2.11 | 책임·출처 | 생성 방법 | aird:creationMethod | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 1.2.12 | 책임·출처 | 수집 방법 | aird:collectionMethod | dcat:Dataset | 조건부 필수 · Quality-Ready 이상 | 0..1 | demo·ops | P3-13 개정 |
| 1.2.13 | 책임·출처 | 갱신 주기 | dct:accrualPeriodicity | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 1.2.14 | 책임·출처 | 차기 등록 예정일 | dcatkr:nextRegistrationDate | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 1.2.15 | 책임·출처 | 보유근거 | dcatkr:legalBasis | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 1.2.16 | 책임·출처 | 데이터 최초 공개일 | dct:issued | dcat:Dataset | 조건부 필수 · Quality-Ready 이상 | 0..1 | demo·ops | P3-16 보강 |
| 1.2.17 | 책임·출처 | 데이터 최종 수정일 | dct:modified | dcat:Dataset | 조건부 필수 · Quality-Ready 이상 | 0..1 | demo·ops | P3-16 보강 |
| 1.2.18 | 책임·출처 | 원시 시스템 | dcatkr:derivedSystem | dcat:Dataset | 선택 | 0..* | demo·ops | |
| 1.3.1 | 접근·배포 | 배포 | dcat:distribution | dcat:Dataset | 필수 | 1..* | demo·ops | |
| 1.3.2 | 접근·배포 | 배포 제목 | dct:title | dcat:Distribution | 권장 | 0..* | demo·ops | |
| 1.3.3 | 접근·배포 | 접근 주소 | dcat:accessURL | dcat:Distribution | 필수 | 1..1 | demo·ops | |
| 1.3.4 | 접근·배포 | 다운로드 주소 | dcat:downloadURL | dcat:Distribution | 권장 | 0..1 | demo·ops | |
| 1.3.5 | 접근·배포 | 미디어 타입 | dcat:mediaType | dcat:Distribution | 필수 | 1..1 | demo·ops | P3-09 보강 |
| 1.3.6 | 접근·배포 | 파일 형식 | dct:format | dcat:Distribution | 필수 | 1..1 | demo·ops | P3-09 보강 |
| 1.3.7 | 접근·배포 | 압축 포맷 | dcat:compressFormat | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.3.8 | 접근·배포 | 패키지 포맷 | dcat:packageFormat | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.3.9 | 접근·배포 | 체크섬 | spdx:checksum | dcat:Distribution | 필수 | 1..1 | demo·ops | P3-09 보강 |
| 1.3.10 | 접근·배포 | 체크섬 알고리즘 | spdx:algorithm | spdx:Checksum | 필수 · Checksum | 1..1 | demo·ops | P3-09 보강 |
| 1.3.11 | 접근·배포 | 체크섬 값 | spdx:checksumValue | spdx:Checksum | 필수 · Checksum | 1..1 | demo·ops | P3-09 보강 |
| 1.3.12 | 접근·배포 | 파일 크기 | dcat:byteSize | dcat:Distribution | 권장 | 0..1 | demo·ops | |
| 1.3.13 | 접근·배포 | 문자 인코딩 | aird:encoding | dcat:Distribution | 권장 | 0..1 | demo·ops | |
| 1.3.14 | 접근·배포 | 행 수 | dcatkr:numberOfRow | dcat:Distribution | 권장 | 0..1 | demo·ops | |
| 1.3.15 | 접근·배포 | 배포 등록일 | dct:issued | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.3.16 | 접근·배포 | 배포 수정일 | dct:modified | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.3.17 | 접근·배포 | 배포 상태 | adms:status | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.3.18 | 접근·배포 | 컬럼 스키마 | csvw:tableSchema | dcat:Distribution (a csvw:Table) | 조건부 필수 · 정형 | 0..1 | demo·ops | P3-25 보강 |
| 1.3.18b | 접근·배포 | 컬럼 스키마 자산 참조 | rdfs:seeAlso | csvw:Schema (1.3.18 인라인 스키마) | 선택 | 0..1 | demo·ops | P3-40 등재 |
| 1.3.19 | 접근·배포 | 컬럼 | csvw:column | csvw:Schema | 필수 · Schema | 1..* | demo·ops | |
| 1.3.20 | 접근·배포 | 컬럼명 | csvw:name | csvw:Column | 필수 · Column | 1..1 | demo·ops | |
| 1.3.21 | 접근·배포 | 컬럼 표제어 | csvw:titles | csvw:Column | 권장 | 0..* | demo·ops | |
| 1.3.22 | 접근·배포 | 컬럼 데이터 타입 | csvw:datatype | csvw:Column | 필수 · Column | 1..1 | demo·ops | |
| 1.3.23 | 접근·배포 | 컬럼 설명 | dct:description | csvw:Column | 권장 | 0..* | demo·ops | |
| 1.3.24 | 접근·배포 | 컬럼 필수 여부 | csvw:required | csvw:Column | 권장 | 0..1 | demo·ops | |
| 1.3.24b | 접근·배포 | 컬럼 결측 표기 | csvw:null | csvw:Column | 권장 | 0..* | demo·ops | |
| 1.3.24c | 접근·배포 | 컬럼 기본값 | csvw:default | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24d | 접근·배포 | 컬럼 언어 | csvw:lang | csvw:Column | 권장 | 0..1 | demo·ops | |
| 1.3.24e | 접근·배포 | 다중값 구분자 | csvw:separator | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24f | 접근·배포 | 컬럼 순번 | aird:columnIndex | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24g | 접근·배포 | 설명의 성격 | aird:descriptionKind | csvw:Column | 권장 | 0..1 | demo·ops | |
| 1.3.24h | 접근·배포 | 의미 유형 | aird:semanticType | csvw:Column | 권장 | 0..1 | demo·ops | |
| 1.3.24i | 접근·배포 | 관측 자료형 | aird:observedDatatype | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24j | 접근·배포 | 관측 최대 길이 | aird:observedMaxLength | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24t | 접근·배포 | 관측 표현 제약 | aird:observedFormat | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24u | 접근·배포 | 관측 단위 표기 | aird:unitLabel | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24v | 접근·배포 | 관측 결측률 | aird:observedMissingRate | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24w | 접근·배포 | 관측 값 분포 | aird:observedDistribution | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24k | 접근·배포 | 단위 | qudt:hasUnit | csvw:Column | 조건부 필수 · 수치·규격 컬럼 | 0..* | demo·ops | |
| 1.3.24l | 접근·배포 | 단위 내장 여부 | aird:unitInValue | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24m | 접근·배포 | 예시값 | skos:example | csvw:Column | 권장 | 0..* | demo·ops | |
| 1.3.24n | 접근·배포 | 통제어휘 후보 여부 | aird:codeListCandidate | csvw:Column | 선택 | 0..1 | demo·ops | |
| 1.3.24o | 접근·배포 | 코드리스트 | aird:codeList | csvw:Column | 조건부 필수 · CODE 의미 유형 확정 시 | 0..1 | demo·ops | |
| 1.3.24p | 접근·배포 | 개인정보 검토 상태 | aird:personalDataReview | csvw:Column | 조건부 필수 · 탐지 규칙 표시 시 | 0..1 | demo·ops | |
| 1.3.24q | 접근·배포 | 컬럼명 표기 레지스트리 참조 | aird:columnTerm | csvw:Column | 권장 | 0..1 | demo·ops | |
| 1.3.24r | 접근·배포 | 컬럼 주석 | skos:note | csvw:Column | 선택 | 0..* | demo·ops | |
| 1.3.24s | 접근·배포 | 컬럼 IRI | @id | csvw:Column | 필수 · Column | 1..1 | demo·ops | |
| 1.3.25 | 접근·배포 | 접근 서비스 | dcat:accessService | dcat:Distribution | 조건부 필수 · API | 0..* | demo·ops | |
| 1.3.26 | 접근·배포 | 서비스 제목 | dct:title | dcat:DataService | 필수 · DataService | 1..* | demo·ops | |
| 1.3.27 | 접근·배포 | 엔드포인트 URL | dcat:endpointURL | dcat:DataService | 필수 · DataService | 1..* | demo·ops | |
| 1.3.28 | 접근·배포 | 엔드포인트 설명 | dcat:endpointDescription | dcat:DataService | 권장 | 0..* | demo·ops | |
| 1.3.29 | 접근·배포 | API 유형 | dct:type | dcat:DataService | 권장 | 0..* | demo·ops | |
| 1.3.30 | 접근·배포 | 요청 제한 횟수 | dcatkr:numberOfRequestLimit | dcat:DataService | 선택 | 0..1 | demo·ops | |
| 1.3.31 | 접근·배포 | 심의 유형 | aird:approvalRequirement | dcat:DataService | 선택 | 0..2 | demo·ops | |
| 1.3.32 | 접근·배포 | 운용 파일 참조 | aird:operationFile | aird:Manifest | 조건부 필수 · purposeState = ready인 목적 존재 | 0..* | demo(선택)·ops | P3-23 개정; P3-31 개정 |
| 1.4.1 | 권리·이용 | 라이선스 | dct:license | dcat:Distribution | dcat:Dataset (Dataset은 배포와 동일값) | 필수 · demo; Distribution 라이선스와 동일값 | 1..1 | demo·ops | P3-11 개정 |
| 1.4.2 | 권리·이용 | 이용 조건 | dct:rights | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 1.4.2b | 권리·이용 | 고지문 라벨 | rdfs:label | dct:RightsStatement (1.4.2 값 노드) | 조건부 필수 · dct:rights 값 노드가 있을 때 | 1..1 | demo·ops | |
| 1.4.3 | 권리·이용 | 접근 권한 | dct:accessRights | dcat:Dataset | 필수 | 1..1 | demo·ops | P3-11 개정 |
| 1.4.4 | 권리·이용 | 이용 정책 | odrl:hasPolicy | dcat:Distribution | 선택 | 0..1 | demo·ops | |
| 1.4.5 | 권리·이용 | 비용부과 여부 | dcatkr:fee | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 1.4.6 | 권리·이용 | 비용 정보 | sc:offers | dcat:Dataset | 조건부 필수 · fee=true | 0..* | demo·ops | |
| 1.4.7 | 권리·이용 | 이용상 유의사항 | sc:usageInfo | dcat:Dataset (sc:CreativeWork) | 선택 | 0..1 | demo·ops | |
| 1.4.7b | 권리·이용 | 유의사항 본문 | sc:text | sc:CreativeWork (1.4.7 값 노드) | 조건부 필수 · usageInfo가 텍스트형 | 0..1 | demo·ops | |
| 1.4.8 | 권리·이용 | 비식별화 수준 | aird:deidentificationLevel | dcat:Dataset | 조건부 필수 · 개인정보 포함 | 0..1 | demo·ops | P3-08 개정 |
| 1.5.1 | 신뢰 | 데이터 한계 | rai:dataLimitations | dcat:Dataset | 참조 · → 2.5.2 | 0..* | demo·ops | |
| 1.6.1 | 상태 조건 | 조건 종류 | aird:conditionType | aird:Condition | 필수 · Condition | 1..1 | ops | P3-29 개정 |
| 1.6.2 | 상태 조건 | 대상 목적 유형 | aird:purposeType | aird:Condition | 조건부 필수 · conditionType = PurposeReady | 0..1 | ops | P3-29 개정 |
| 1.6.3 | 상태 조건 | 충족 여부 | aird:conditionStatus | aird:Condition | 필수 · Condition | 1..1 | ops | P3-29 개정 |
| 1.6.4 | 상태 조건 | 현행 여부 | aird:fresh | aird:Condition | 조건부 필수 · QualityAssessed·PurposeReady | 0..1 | ops | P3-29 개정 |
| 1.6.5 | 상태 조건 | 비현행 사유 | aird:freshReason | aird:Condition | 조건부 필수 · fresh = false | 0..1 | ops | P3-29 개정 |
| 1.6.6 | 상태 조건 | 사유 코드 | aird:reason | aird:Condition | 필수 · Condition | 1..1 | ops | P3-29 개정 |
| 1.6.7 | 상태 조건 | 설명 | rdfs:comment | aird:Condition | 선택 | 0..1 | ops | P3-29 개정 |
| 1.6.8 | 상태 조건 | 판정 대상 버전 | aird:assessedVersion | aird:Condition | 조건부 필수 · QualityAssessed·PurposeReady | 0..1 | ops | P3-29 개정 |
| 1.6.9 | 상태 조건 | 성립 시각 | aird:since | aird:Condition | 필수 · Condition | 1..1 | ops | P3-29 개정 |
| 1.6.10 | 상태 조건 | 확인 시각 | aird:checkedAt | aird:Condition | 조건부 필수 · Intact·DataIntact·Current | 0..1 | ops | P3-29 개정 |
| 1.6.11 | 상태 조건 | 기한 | aird:dueDate | aird:Condition | 조건부 필수 · Current | 0..1 | ops | P3-29 개정 |
| 1.6.12 | 상태 조건 | 근거 자산 | aird:evidence | aird:Condition | 권장 | 0..* | ops | P3-29 개정 |
| 1.6.13 | 상태 조건 | 기록 주체 | prov:wasAttributedTo | aird:Condition | 필수 · Condition | 1..1 | ops | P3-29 개정 |
| 1.6.14 | 상태 조건 | 대리 대상 | aird:onBehalfOf | aird:Condition | 선택 | 0..1 | ops | P3-29 개정 |
| 1.6.15 | 목적 상태 | 목적 유형 | aird:purposeType | aird:PurposeState | 필수 · PurposeState | 1..1 | ops | P3-29 개정 |
| 1.6.16 | 목적 상태 | 상태 값 | aird:state | aird:PurposeState | 필수 · PurposeState | 1..1 | ops | P3-29 개정 |
| 1.6.17 | 다음 조치 | 조치 | aird:action | aird:NextAction | 필수 · NextAction | 1..1 | ops | P3-29 개정 |
| 1.6.18 | 다음 조치 | 대상 목적 | aird:purposeType | aird:NextAction | 선택 | 0..1 | ops | P3-29 개정 |
| 1.6.19 | 다음 조치 | 담당 | aird:owner | aird:NextAction | 권장 | 0..1 | ops | P3-29 개정 |
| 1.3.33 | 접근·배포 | 배포 유형(정규화 배포) | dct:type | dcat:Distribution | 조건부 필수 · NORMALIZE 정규화 배포 | 0..1 | demo(선택)·ops | P1-01 개정 |
원천: 어휘표 v0.10.5 Layer1_Discovery 시트. 「표준 대비」의 P 번호는 심의본 수정 대장의 항목이다. 「ops」 행은 운영 프로파일 전용이다.
이해 계층 (L2) 전체 항목 — 어휘표 v0.10.5 · 121행 · 필수 47행
| 번호 | 항목군 | 항목명 | 속성 | 적용 클래스 | 구분 | 카디널리티 | 프로파일 | 표준 대비 |
|---|---|---|---|---|---|---|---|---|
| 2.1.1 | 버전·이력 | 버전 번호 | dcat:version | dcat:Dataset | 필수 | 1..1 | demo·ops | P3-37 보강 |
| 2.1.2 | 버전·이력 | 버전 노트 | adms:versionNotes | dcat:Dataset | 필수 | 1..1 (언어별) | demo·ops | |
| 2.1.3 | 버전·이력 | 이전 버전 | dcat:previousVersion | dcat:Dataset | 조건부 필수 · 규칙 A 새 버전 | 0..1 | demo·ops | P3-04 정정; P1-01 개정; P3-37 보강 |
| 2.1.4 | 버전·이력 | 원천 데이터셋 | dct:source | dcat:Dataset | 조건부 필수 · 파생 데이터셋 1..1 | 0..1 | demo(선택)·ops | P1-01 개정 |
| 2.1.4b | 버전·이력 | 버전의 안정 데이터셋 | dct:isVersionOf | dcat:Dataset | 조건부 필수 · 버전 자원 | 0..1 | demo·ops | P3-37 보강 |
| 2.1.4c | 버전·이력 | 현행 버전 자원 | dcat:hasCurrentVersion | dcat:Dataset | 필수 · demo | 그 외: 조건부 필수(ops: 버전 자원을 둘 때) | 1..1 (demo) · 0..1 (ops) | demo·ops | P3-37 보강 |
| 2.1.5 | 버전·이력 | 파생 데이터셋 역참조 | dct:relation | dcat:Dataset | 선택 | 0..* | ops | P1-01 개정 |
| 2.2.1 | 품질 판정 | 품질 판정 | aird:qualityAssessment | aird:Manifest | 조건부 필수 · lifecycleStatus = Quality-Ready | 0..* | demo·ops | P3-23 개정; P3-31 개정; P3-24 등재 |
| 2.2.1b | 품질 판정 | 판정 대상 버전 | aird:assessedVersion | aird:QualityAssessment | 조건부 필수 · QA 재참조 시 | 0..1 | demo·ops | P3-24 등재 |
| 2.2.2 | 품질 판정 | 데이터 유형 | aird:dataType | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.3 | 품질 판정 | 품질 등급 | aird:qualityTier | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재; P2-02 보강; P3-22 보강 |
| 2.2.5 | 품질 판정 | 등급 라벨 | aird:qualityTierLabel | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재; P3-22 보강 |
| 2.2.6 | 품질 판정 | 정확성 측정 상태 | aird:accuracyMeasurementState | aird:QualityAssessment | 조건부 필수 | 0..1 | demo·ops | P3-22 보강 |
| 2.2.7 | 품질 판정 | 후보 등급 | aird:candidateTier | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재; P2-02 보강 |
| 2.2.8 | 품질 판정 | 강등 사유 | aird:downgradeReason | aird:QualityAssessment | 조건부 필수 | 0..* | demo·ops | P3-17 등재 |
| 2.2.8b | 품질 판정 | 기계 판독성 통과선 충족 | aird:machineReadabilityPassLine | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.9 | 품질 판정 | 최소 차원 점수 | aird:qualityIndexMin | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.10 | 품질 판정 | 가중 평균 | aird:qualityIndexAvg | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.11 | 품질 판정 | 최소 측정 가능 지표 점수 | aird:qualityIndexMMI | aird:QualityAssessment | 조건부 필수 · DM-0 | 0..1 | demo·ops | P3-17 등재 |
| 2.2.12 | 품질 판정 | 진단 성숙도 | aird:diagnosticMaturity | aird:QualityAssessment | 조건부 필수 | 0..1 | demo·ops | P3-17 등재 |
| 2.2.13 | 품질 판정 | 평가 상태 | aird:assessmentStatus | aird:QualityAssessment | 권장 | 0..1 | demo·ops | P3-17 등재 |
| 2.2.14 | 품질 판정 | 전이 적격성 | aird:qualityReadyEligible | aird:QualityAssessment | 조건부 필수 · Quality-Ready 판정 시 | 0..1 | demo·ops | P3-17 등재 |
| 2.2.15 | 품질 판정 | 진단 일시 | prov:generatedAtTime | aird:QualityAssessment (⊑ prov:Entity) | 필수 | 1..1 | demo·ops | P3-02 정정 |
| 2.2.16a | 품질 판정 | 진단 활동 | prov:wasGeneratedBy | aird:QualityAssessment (prov:Entity) | 권장 | 0..1 | demo·ops | P3-15 보강 |
| 2.2.16b | 품질 판정 | 진단 도구 | prov:wasAssociatedWith | aird:DiagnosisActivity | 권장 | 0..1 | demo·ops | P3-15 보강 |
| 2.2.17 | 품질 판정 | 판정 규칙 버전 | aird:ruleVersion | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.18 | 품질 판정 | 스키마 버전 | aird:schemaVersion | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-18 보강 |
| 2.2.19 | 품질 판정 | 진단 리포트 | aird:diagnosticReport | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-17 등재 |
| 2.2.20 | 품질 판정 | 임계 프로파일 | aird:thresholdProfile | aird:QualityAssessment | 필수 | 1..1 | demo·ops | P3-18 보강 |
| 2.2.21 | 품질 판정 | 프로파일 식별자 | aird:profileId | aird:ThresholdProfileRef | 필수 · Ref | 1..1 | demo·ops | P3-18 보강 |
| 2.2.22 | 품질 판정 | 프로파일 버전 | aird:profileVersion | aird:ThresholdProfileRef | 필수 · Ref | 1..1 | demo·ops | P3-18 보강 |
| 2.2.23 | 품질 판정 | 프로파일 상태 | aird:profileStatus | aird:ThresholdProfileRef | 필수 · Ref | 1..1 | demo·ops | P3-18 보강; P3-27 보강 |
| 2.2.25 | 품질 판정 | 차원 가중치 | aird:dimensionWeight | aird:ThresholdProfileRef | 권장 | 0..7 | demo·ops | P3-18 보강 |
| 2.2.26 | 품질 판정 | 차원 가중치 값 | aird:weight | aird:DimensionWeight | 필수 · DimensionWeight | 1..1 | demo·ops | P3-33 등재 |
| 2.2.6b | 품질 판정 | 측정한 정확성 지표 수 | aird:measuredIndicatorCount | aird:QualityAssessment | 조건부 필수 · accuracy-state = PARTIAL | 0..1 | demo·ops | P3-22 보강 |
| 2.2.6c | 품질 판정 | 적용 대상 정확성 지표 수 | aird:applicableIndicatorCount | aird:QualityAssessment | 조건부 필수 · accuracy-state = PARTIAL | 0..1 | demo·ops | P3-22 보강 |
| 2.2.24 | 품질 판정 | 프로파일 해시 | spdx:checksum | aird:ThresholdProfileRef | 필수 · Ref | 1..1 | demo·ops | P3-18 보강 |
| 2.2.24b | 품질 판정 | 프로파일 발행 권한 | aird:profileAuthority | aird:ThresholdProfileRef | 권장 | 0..1 | demo·ops | P3-27 보강 |
| 2.2.27 | 품질 판정 | 미충족 지표 항목 | aird:unmetItem | aird:QualityAssessment | 선택 | 0..* | demo·ops | P3-38 보강; P3-41 보강 |
| 2.2.27a | 품질 판정 | 미충족 지표 | aird:indicator | aird:UnmetItem | 필수 · UnmetItem | 1..1 | demo·ops | P3-38 보강 |
| 2.2.27b | 품질 판정 | 발견 사항 | rdfs:comment | aird:UnmetItem | 권장 | 0..1 | demo·ops | P3-38 보강 |
| 2.2.27c | 품질 판정 | 지표 점수 | aird:score | aird:UnmetItem | 조건부 필수 · measurementState ∈ {APPLIED, PARTIALLY_APPLIED} | 1..1 | demo·ops | P3-38 보강; P3-41 보강 |
| 2.2.27d | 품질 판정 | 통과선 | aird:passLine | aird:UnmetItem | 조건부 필수 · measurementState ∈ {APPLIED, PARTIALLY_APPLIED} | 1..1 | demo·ops | P3-38 보강; P3-41 보강 |
| 2.2.27e | 품질 판정 | 통과 여부 | aird:passed | aird:UnmetItem | 조건부 필수 · measurementState ∈ {APPLIED, PARTIALLY_APPLIED} | 1..1 | demo·ops | P3-38 보강; P3-41 보강 |
| 2.2.27f | 품질 판정 | 전제 미충족 사유 | aird:unmetReason | aird:UnmetItem | 조건부 필수 · measurementState = PRECONDITION_UNMET | 0..1 | demo·ops | P2-01 보강 |
| 2.2.27g | 품질 판정 | 제1부 단계 참조 | aird:part1Stage | aird:UnmetItem | 조건부 필수 · measurementState = PRECONDITION_UNMET | 0..1 | demo·ops | P2-01 보강 |
| 2.2.27h | 품질 판정 | 측정 범위(부분 측정) | aird:coverage | aird:UnmetItem | 조건부 필수 · measurementState = PARTIALLY_APPLIED | 0..1 | demo·ops | P2-01 보강 |
| 2.2.27i | 품질 판정 | 측정 상태(항목) | aird:measurementState | aird:UnmetItem | 참조 · → 2.3.6 | 1..1 | demo·ops | P2-01 보강; P2-03 보강 |
| 2.3.1 | 품질 측정 | 품질 측정 | aird:measurement | aird:QualityAssessment | 필수 | 7..* (D1~D7 각 정확히 1 + 지표 측정) | demo·ops | P3-19 개정 |
| 2.3.2 | 품질 측정 | 측정 대상 | dqv:computedOn | dqv:QualityMeasurement | 필수 · QM | 1..1 | demo·ops | P3-02 정정 |
| 2.3.3 | 품질 측정 | 측정값 | dqv:value | dqv:QualityMeasurement | 조건부 필수 | 0..1 | demo·ops | P3-19 개정 |
| 2.3.4 | 품질 측정 | 측정 지표 | dqv:isMeasurementOf | dqv:QualityMeasurement | 필수 · QM | 1..1 | demo·ops | P3-19 개정 |
| 2.3.5 | 품질 측정 | 지표 소속 차원 | dqv:inDimension | dqv:Metric | 조건부 필수 · 정식 지표 D-계열 | 1..1 | demo·ops | P3-19 개정 |
| 2.3.6 | 품질 측정 | 측정 상태 | aird:measurementState | dqv:QualityMeasurement | aird:UnmetItem | 필수 | 1..1 | demo·ops | P3-19 개정; P3-24 등재; P2-03 보강 |
| 2.3.7 | 품질 측정 | 측정 범위 | aird:coverage | dqv:QualityMeasurement | 조건부 필수 · 부분 측정 | 0..1 | demo·ops | P3-19 개정; P3-24 등재 |
| 2.3.8 | 품질 측정 | 측정 시각 | prov:generatedAtTime | dqv:QualityMeasurement (+ prov:Entity) | 선택 | 0..1 | demo·ops | |
| 2.3.9 | 품질 측정 | 구성 지표 측정 | prov:wasDerivedFrom | dqv:QualityMeasurement (prov:Entity, 차원 점수) | 조건부 필수 · 같은 QA에 지표 측정이 있으면 ≥1 | 0..* | demo·ops | |
| 2.4.1 | 구조·의미 | 피처 완전성 지수 | aird:featureCompletenessIndex | dcat:Dataset | 권장 | 0..1 | demo(선택)·ops | P3-21 개정 |
| 2.4.2 | 구조·의미 | 스키마 적합률 | aird:schemaConformanceRate | dcat:Dataset | 권장 | 0..1 | demo(선택)·ops | P3-21 개정 |
| 2.4.3 | 구조·의미 | 라벨 정확성 | (dqv 측정: aird:labelConformanceRate = D3-02 Metric) | dqv:QualityMeasurement | 조건부 필수 · 지도학습 | 0..1 | demo(선택)·ops | P3-19 개정 |
| 2.4.4 | 구조·의미 | 클래스 균형도 | (dqv 측정: aird:labelDistributionBalance = R1-02 Metric) | dqv:QualityMeasurement | 권장 | 0..1 | demo(선택)·ops | P3-20 정정; P3-19 개정 |
| 2.4.5 | 구조·의미 | 컬럼 품질 세부 | aird:columnQualityBreakdown | dcat:Dataset | 선택 | 0..1 | demo(선택)·ops | |
| 2.5.1 | 신뢰·윤리 | 알려진 편향 | rai:dataBiases | dcat:Dataset (sc:Dataset) | 필수 | 1..* | demo·ops | |
| 2.5.2 | 신뢰·윤리 | 데이터 한계 | rai:dataLimitations | dcat:Dataset | 필수 | 1..* | demo·ops | |
| 2.5.3 | 신뢰·윤리 | 결측 정보 | rai:dataCollectionMissingData | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 2.5.4 | 신뢰·윤리 | 의도된 사용 | rai:dataUseCases | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 2.5.5 | 신뢰·윤리 | 금지된 사용 | aird:prohibitedUses | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 2.5.6 | 신뢰·윤리 | 사회적 영향 | rai:dataSocialImpact | dcat:Dataset | 선택 | 0..1 | demo·ops | |
| 2.5.7 | 신뢰·윤리 | 수집 과정 | rai:dataCollection | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 2.5.8 | 신뢰·윤리 | 품질 검증 주석 | dqv:hasQualityAnnotation | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 2.5.9 | 신뢰·윤리 | 합성 데이터 여부 | aird:isSynthetic | dcat:Dataset | 필수 | 1..1 | demo·ops | |
| 2.6.1 | 출처 이력 | 원천 데이터 | prov:wasDerivedFrom | dcat:Dataset (prov:Entity) | 조건부 필수 · 규칙 B 파생 데이터셋 | 0..* | demo·ops | P3-36 정정; P3-35 개정 |
| 2.6.2 | 출처 이력 | 전처리 이력 | prov:wasGeneratedBy | dcat:Dataset | 조건부 필수 · preprocessingLevel ≠ NONE 또는 파생 데이터셋: 1..*; 그 외 0..* | 0..* | demo·ops | P3-35 개정 |
| 2.6.3 | 출처 이력 | 변환 이력 | prov:wasGeneratedBy | dcat:Dataset | 조건부 필수 · purposeState = ready | 0..* | demo(선택)·ops | P3-36 정정 |
| 2.6.4 | 출처 이력 | 교환 이력 | aird:exchangeActivity | dcat:Dataset | 조건부 필수 · 운용 파일·팩 전달 | 0..* | demo(선택)·ops | P3-06 정정 |
| 2.6.5 | 출처 이력 | 활용 이력 | aird:consumerActivity | dcat:Dataset | 권장 | 0..* | demo(선택)·ops | P3-06 정정 |
| 2.6.6 | 출처 이력 | 활동 시작 | prov:startedAtTime | aird:PreprocessingActivity | TransformationActivity | ExchangeActivity | ConsumerActivity | 필수 · 계보 활동 | 1..1 | demo·ops | |
| 2.6.7 | 출처 이력 | 활동 종료 | prov:endedAtTime | aird:PreprocessingActivity | TransformationActivity | ExchangeActivity | ConsumerActivity | 필수 · 계보 활동 | 1..1 | demo·ops | |
| 2.6.8 | 출처 이력 | 활동 주체 | prov:wasAssociatedWith | aird:PreprocessingActivity | TransformationActivity | ExchangeActivity | ConsumerActivity | 필수 · 계보 활동 | 1..* | demo·ops | |
| 2.6.9 | 출처 이력 | 사용 데이터 | prov:used | prov:Activity | 조건부 필수 · 교환·활용 활동 | 그 외: 권장(정제 활동) | 0..* | demo·ops | P3-06 정정 |
| 2.6.10 | 출처 이력 | 선행 활동 | prov:wasInformedBy | prov:Activity | 권장 | 0..* | demo·ops | |
| 2.6.11 | 출처 이력 | 정제 내역 문서 | rdfs:seeAlso | aird:PreprocessingActivity | 권장 | 0..* | demo·ops | |
| 2.6.12 | 출처 이력 | 계보 서술 | dct:provenance | dcat:Dataset | 선택 | 0..1 | demo·ops | |
| 2.6.13 | 출처 이력 | 전처리 등급(활동) | aird:preprocessingLevel | aird:PreprocessingActivity | 필수 · PreprocessingActivity | 1..1 | demo·ops | P3-35 개정 |
| 2.7.1 | 결정 게이트 | 게이트 판정 | aird:gateDecision | aird:Manifest | 조건부 필수 · PhaseMatrix: Discoverable G1, Quality-Ready G1·G2, purposeState ready G3/p | 0..* | demo·ops | P3-10 개정; P3-23 개정; P3-31 개정; P3-24 등재 |
| 2.7.2 | 결정 게이트 | 게이트 식별 | aird:gateType | aird:GateDecision | 필수 · GD | 1..1 | demo·ops | P3-10 개정 |
| 2.7.3 | 결정 게이트 | 판정 결과 | aird:gateResult | aird:GateDecision | 필수 · GD | 1..1 | demo·ops | P3-10 개정 |
| 2.7.4 | 결정 게이트 | 판정 시각 | prov:endedAtTime | aird:GateDecision | 필수 · GD | 1..1 | demo·ops | P3-10 개정 |
| 2.7.5 | 결정 게이트 | 결과 상태 | aird:resultingStatus | aird:GateDecision | 조건부 필수 · G1·G2 PASS | 0..1 | demo·ops | P3-10 개정; P3-29 개정 |
| 2.7.6 | 결정 게이트 | 근거 활동 | prov:wasInformedBy | aird:GateDecision | 권장 | 0..* | demo·ops | P3-10 개정; P3-34 보강 |
| 2.7.6b | 결정 게이트 | 판정 주체 | prov:wasAssociatedWith | aird:GateDecision | 선택 | 0..* | demo·ops | P3-10 개정 |
| 2.7.6c | 결정 게이트 | 근거 문서 | prov:used | aird:GateDecision | 조건부 필수 · G2·G3 | 0..* | demo·ops | P3-34 보강 |
| 2.7.7 | 결정 게이트 | 경고 기록 | aird:gateWarnings | aird:GateDecision | 선택 | 0..* | demo(선택)·ops | P3-10 개정 |
| 2.7.8 | 결정 게이트 | 판정 기준 | aird:criteria | aird:GateDecision | 권장 | 0..1 | demo·ops | P3-34 보강 |
| 2.7.9 | 결정 게이트 | 기준 규격 | dct:conformsTo | aird:GateCriteria | 권장 | 0..* | demo·ops | P3-34 보강 |
| 2.7.10 | 결정 게이트 | 임계값 | aird:threshold | aird:GateCriteria | 선택 | 0..* | demo·ops | P3-34 보강 |
| 2.7.10b | 결정 게이트 | 적용 임계 프로파일 | aird:thresholdProfile | aird:GateCriteria | 권장 | 0..1 | demo·ops | P3-34 보강 |
| 2.7.11 | 결정 게이트 | 판정자 | aird:decidedBy | aird:GateDecision | 권장 | 0..1 | demo·ops | P3-34 보강 |
| 2.7.12 | 결정 게이트 | 대리 대상 | aird:onBehalfOf | aird:GateDecision | 선택 | 0..1 | demo(선택)·ops | P3-34 보강 |
| 2.7.13 | 결정 게이트 | 미충족 지표(판정 근거) | aird:failedIndicators | aird:GateDecision | 조건부 필수 · gateResult = FAIL ∧ ineligibilityReason ∋ INDICATOR_BELOW_PASSLINE | 0..* | demo·ops | P3-34 보강 |
| 2.7.14 | 결정 게이트 | 판정 대상 버전 | aird:assessedVersion | aird:GateDecision | 필수 · GD | 1..1 | demo·ops | P3-34 보강 |
| 2.7.15 | 결정 게이트 | 전이 부적격 사유 | aird:ineligibilityReason | aird:GateDecision | 조건부 필수 · gateResult = FAIL, G2·G3 | 0..* | demo·ops | P2-01 보강 |
| 2.8.1 | 목적 준비도 | 목적 준비도 | aird:purposeReadiness | aird:Manifest | 조건부 필수 · purposeState = ready인 목적 존재 | 0..* | demo(선택)·ops | P3-23 개정; P3-31 개정 |
| 2.8.2 | 목적 준비도 | 활용 목적 유형 | aird:purposeType | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.3 | 목적 준비도 | 목적 등급 | aird:purposeTier | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.4 | 목적 준비도 | 목적 등급 라벨 | aird:purposeTierLabel | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.5 | 목적 준비도 | 확장 프로파일 식별자 | aird:profileId | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.6 | 목적 준비도 | 확장 프로파일 버전 | aird:profileVersion | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.7 | 목적 준비도 | 임계 프로파일 | aird:thresholdProfile | aird:PurposeReadiness | 필수 · PR | 1..1 | demo(선택)·ops | |
| 2.8.8 | 목적 준비도 | 목적 평가 상태 | aird:purposeAssessmentStatus | aird:Manifest | 조건부 필수 · 미판정 유형 존재 | 0..* | demo(선택)·ops | P3-23 개정 |
| 2.8.9 | 목적 준비도 | 대상 목적 유형 | aird:purposeType | aird:PurposeAssessment | 필수 · PA | 1..1 | demo(선택)·ops | |
| 2.8.10 | 목적 준비도 | 평가 상태 값 | aird:assessmentState | aird:PurposeAssessment | 필수 · PA | 1..1 | demo(선택)·ops | P3-24 등재 |
| 2.8.11 | 목적 준비도 | 미평가 사유 | aird:notAssessedReason | aird:PurposeAssessment | 필수 · PA | 1..1 | demo(선택)·ops | P3-24 등재 |
| 2.9.1 | 보안·프라이버시 | 개인정보 포함 여부 | aird:containsPersonalData | dcat:Dataset | 필수 | 1..1 | demo·ops | P3-03 정정; P3-24 등재 |
| 2.9.2 | 보안·프라이버시 | 개인정보 범주 | dpv:hasPersonalData | dcat:Dataset | 조건부 필수 · 포함 시 | 0..* | demo·ops | P3-03 정정 |
| 2.9.3 | 보안·프라이버시 | 민감정보 포함 여부 | aird:containsSensitiveData | dcat:Dataset | 조건부 필수 · 개인정보 포함 시 | 0..1 | demo·ops | P3-03 정정 |
| 2.9.4 | 보안·프라이버시 | 정보주체 분류 | dpv:hasDataSubject | dcat:Dataset | 권장 | 0..* | demo·ops | |
| 2.9.5 | 보안·프라이버시 | 비식별화 수준 | aird:deidentificationLevel | dcat:Dataset | 참조 · → 1.4.8 | 0..1 | demo·ops | P3-08 개정 |
| 2.9.6 | 보안·프라이버시 | 비식별화 방법 | aird:deidentificationMethod | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 2.9.7 | 보안·프라이버시 | 비식별화 일시 | aird:deidentificationDate | dcat:Dataset | 권장 | 0..1 | demo·ops | |
| 2.9.8 | 보안·프라이버시 | 재식별 위험도 | aird:reidentificationRisk | dcat:Dataset | 권장 | 0..1 | demo·ops |
원천: 어휘표 v0.10.5 Layer2_Understanding 시트. 「표준 대비」의 P 번호는 심의본 수정 대장의 항목이다. 「ops」 행은 운영 프로파일 전용이다.
제어 어휘 22종
값으로 쓰는 제어 어휘는 제3부 부속서 C가 정한다. 본문과 다른 부속서는 값을 다시 열거하지 않고 이 부속서를 참조한다. [제3부 부속서 C]
| 번호 | 이름 | 속성 | 값 |
|---|---|---|---|
| C.1 | 데이터셋 유형 | dct:type | aird:Structured, aird:Image, aird:Audio, aird:Video, aird:Text, aird:Geospatial, aird:PT |
| C.2 | 라이프사이클 상태 | aird:lifecycleStatus,aird:resultingStatus | Discoverable, Quality-Ready, Purpose-Ready, Stale. aird:resultingStatus에 Stale을 규정하지 않는다 |
| C.3 | 생성 방법 | aird:creationMethod | collected, processed, synthetic, augmented |
| C.4 | 갱신 주기 | dct:accrualPeriodicity | EU Frequency Named Authority List의 URI |
| C.5 | 접근 제한 | dct:accessRights | public, restricted, |
| C.6 | 품질 등급 | aird:qualityTier | 라벨 형식은 제1부 부속서 A를 따른다 |
| C.7 | 목적 등급 | aird:purposeTier | P-Tier 1, P-Tier 2, P-Tier 3 |
| C.8 | 진단 성숙도 | aird:diagnosticMaturity | DM-0, DM-1, DM-2 |
| C.9 | 데이터 유형 | aird:dataType | STRUCT, TEXT, IMAGE, TSERIES, PT |
| C.10 | 재식별 위험도 | aird:reidentificationRisk | low, medium, high |
| C.11 | 결정 게이트 식별 | aird:gateType | G1, G2, G3 |
| C.12 | 비식별화 수준 | aird:deidentificationLevel | none, pseudonymized, anonymized, aggregated |
| C.13 | 활용 목적 유형 | aird:purposeType | ML, DL, RAG, KG, Stats, FineTuning |
| C.14 | 모델-데이터 결합도 | aird:modelDataCoupling | loose, derived, tight |
| C.15 | 팩 완전성 | aird:packCompleteness | data-only, derived-without-model |
| C.16 | 태스크 유형 | aird-ml:taskType | 기계학습은 classification, regression, clustering, anomaly-detection, time-series-forecasting, ranking. 심층학습은 image-classification, object-detection, image-segmentation, semantic-segmentation, text-classification, named-entity-recognitio n, speech-recognition, text-generation, question-answering |
| C.17 | 활동 유형 | PROV-O활동의타입 | aird:PreprocessingActivit y, aird:TransformationActivit y, aird:ExchangeActivity, aird:ConsumerActivity |
| C.18 | 라이선스 | dct:license | SPDX 식별자. SPDX에 등록되지 않은 라이선스는 라이선스 문서의 URI. 기재 값은 어휘표 v0.10.5 kr-license 가 우선 |
| C.19 | 프로파일 상태 | 표8-1의프로파일상태열 | Draft, Candidate, Registered, Deprecated |
| C.20 | 평가 상태 | aird:assessmentStatus | OFFICIAL, PROVISIONAL |
| C.21 | 결정 게이트 판정 결과 | aird:gateResult | PASS, FAIL |
| C.22 | 목적 평가 상태 | aird:purposeAssessmentStatus | 상태 값은 NOT_ASSESSED. 사유 코드는 PROFILE_NOT_REGISTER ED, THRESHOLD_NOT_PUBLI SHED, PRECONDITION_UNMET |
확인 중 C.5 접근 제한 — 값 목록이 「public, restricted,」로 끝난다 (SF-11) · C.1 데이터셋 유형 — aird:PT 포함 (SF-04) · C.16 태스크 유형 — 값 목록 원문 대조 중
품질 지표
정식 지표 16종의 유형별 적용, 전제 조건, 측정식이다. 모든 점수는 0 이상 1 이하다. 가중치와 등급 구간은 표준이 정하지 않는다 (적용 기준에 위임된 항목).
유형별 적용
● 정식 필수 · ○ 선택 · — 적용하지 않음. MMI는 최소 측정 지표(진단의 진입 요건)다.
| ID | 지표 | 차원 | STRUCT | TEXT | IMAGE | TSERIES | PT | |
|---|---|---|---|---|---|---|---|---|
D1-01 | 필수 필드 충족도 | D1 완전성 | ● | ○ | ○ | ● | ● | |
D1-02 | 필수 메타데이터 항목 충실도 | D1 완전성 | ● | ● | ● | ● | ● | |
D2-01 | 필드 간 관계 일관성 | D2 일관성 | ● | — | — | ● | — | |
D2-02 | 참조 무결성 | D2 일관성 | ● | — | — | ● | — | |
D2-03 | 파생값 정확성 | D2 일관성 | ● | — | — | ● | — | |
D3-01 | 표준 명칭 정합성 | D3 정확성 | ● | ○ | — | ○ | — | |
D3-02 | 라벨 정확성 | D3 정확성 | — | ○ | ● | — | ● | |
D4-01 | 최신성 | D4 적시성 | ● | ● | ○ | ● | ● | |
D4-02 | 갱신 충실도 | D4 적시성 | ○ | ○ | — | — | ○ | |
D4-03 | 시계열 완비도 | D4 적시성 | — | — | — | ● | — | |
D5-01 | 형식 유효성 | D5 유효성 | ● | ● | — | ● | ● | |
D5-02 | 수치 범위 유효성 | D5 유효성 | ● | — | — | ● | — | |
D5-03 | 통계적 타당성 | D5 유효성 | MMI | ● | — | — | ● | — |
D6-01 | 유일성 | D6 유일성 | MMI | ● | ○ | — | ● | ● |
D7-01 | 인코딩 일관성 | D7 기계 판독성 | MMI | ● | ● | ○ | ● | ● |
D7-02 | 기술적 유효성 | D7 기계 판독성 | MMI | ● | ● | ● | ● | ● |
| 정식 필수 지표 수 | 13 | 5 | 3 | 13 | 8 |
지표별 전제 조건과 측정식
D1-01 필수 필드 충족도 — 필수 컬럼의 비결측 비율
전제 조건 필수 필드 목록이 데이터 사전, 데이터셋에 적용한 메타데이터 규격, 또는 기관이 승인한 동등 문서에 정의되어 있을 것
측정식
(1 / |Freq|) × Σ_{f∈Freq} [ n(f ≠ NULL ∧ f ≠ '') / N ]D1-02 필수 메타데이터 항목 충실도 — 필수 기재 항목의 기재 비율
전제 조건 데이터셋에 적용한 메타데이터 규격이 이 지표의 분모로 삼을 항목 목록을 지정하고 있을 것. 목록을 지정하지 않은 규격은 그 규격의 필수 항목 전체를 분모로 삼는다
측정식
n(기재된 필수 메타데이터 항목) / n(전체 필수 메타데이터 항목)D2-01 필드 간 관계 일관성 — 두 컬럼 간 관계 규칙 준수 여부
전제 조건 관계 규칙이 데이터 사전, 데이터셋에 적용한 메타데이터 규격, 기관이 승인한 동등 문서 가운데 하나에 정의되어 있을 것
측정식
1 − ( n(규칙 위배 레코드) / N )D2-02 참조 무결성 — 코드값의 코드표 등재 여부
전제 조건 마스터 코드 테이블의 실제 값을 대조할 것. 주소나 참조만 있고 값을 취득하지 못하면 전제 조건 미충족(PRECONDITION_UNMET)으로 판정한다
측정식
1 − ( n(미매핑 코드 셀) / n(유효 코드 셀) )선행 지표 D5-01
D2-03 파생값 정확성 — 저장된 파생값의 계산 규칙 일치 여부
전제 조건 파생값 계산 규칙이 스키마, 데이터 사전, 또는 데이터셋에 적용한 메타데이터 규격에 정의되어 있을 것. 저장된 파생값이 없으면 해당 없음으로 판정한다
측정식
1 − ( n(산출값 ≠ 저장값) / n(검증 대상) )D3-01 표준 명칭 정합성 — 코드와 명칭의 공인 기준 일치 여부
전제 조건 공인 참조 기준이 코드와 명칭의 대응 형태로 활용 가능하고, 데이터에 코드와 명칭이 함께 존재할 것
측정식
1 − ( n(기준 불일치 코드 셀) / n(매칭된 코드 셀) )선행 지표 D2-02
D3-02 라벨 정확성 — 라벨의 정답 라벨 일치 비율
전제 조건 전문가 검수를 완료한 정답 라벨 집합이 존재할 것. 자동 측정이 성립하지 않으며 검수 결과를 입력으로 사용한다
측정식
n(일치) / n(검수 대상). 텍스트와 페어형 텍스트는 완전 일치를 일치로 판정한다D4-01 최신성 — 기재한 갱신 주기 내 갱신 여부
전제 조건 메타데이터에 갱신일과 갱신 주기가 기록되어 있을 것
측정식
경과일수 ≤ 갱신주기이면 1.0. 그 밖의 경우 max(0, 1 − (경과일수 − 갱신주기) / 유예기간). 유예기간은 갱신 주기와 같은 일수이다D4-02 갱신 충실도 — 예정 갱신의 이행 비율
전제 조건 메타데이터에 갱신 주기와 갱신 이력이 명시되어 있을 것
측정식
n(이행된 갱신) / n(예정된 갱신)D4-03 시계열 완비도 — 시계열 측정 시점의 누락 여부
전제 조건 메타데이터에 기대 측정 시점이 명시되어 있을 것
측정식
n(실제 측정 시점) / n(기대 측정 시점)D5-01 형식 유효성 — 값의 정의 형식 준수 여부
전제 조건 없음. 형식이 정의되지 않은 컬럼은 측정 대상에서 제외한다
측정식
1 − ( n(형식 불일치 셀) / n(형식 검증 대상 셀) )D5-02 수치 범위 유효성 — 수치의 허용 범위 준수 여부
전제 조건 컬럼별 허용 범위가 정의되어 있을 것. 정의된 컬럼이 하나도 없으면 전제 조건 미충족(PRECONDITION_UNMET)으로 판정한다
측정식
1 − ( n(범위 초과 셀) / n(범위가 정의된 셀) )D5-03 통계적 타당성 — 더미값 · 명백한 오류값 포함 여부
전제 조건 없음
측정식
1 − ( n(명백한 오류값 셀) / n(평가 대상 수치 셀) )D6-01 유일성 — 레코드 중복 여부
전제 조건 없음
측정식
n(유니크 키) / N. 식별 컬럼이 정의된 경우 동일 개체의 중복을 측정하고, 식별 컬럼이 없는 경우 전체 컬럼의 조합을 키로 사용하여 완전 동일 레코드의 중복을 측정한다D7-01 인코딩 일관성 — 파일 인코딩의 기준 인코딩 일치 여부
전제 조건 없음
측정식
n(기준 인코딩 준수 파일) / n(전체 파일)D7-02 기술적 유효성 — 파일 정상 개방 · 구조 유효 여부
전제 조건 없음
측정식
n(정상 개방 ∧ 사양 충족 파일) / n(전체 파일). 사양 충족은 파일 형식의 공식 사양에 따라 파싱이 완료되고 필수 구조가 유효한 경우로 판정한다산정
| 값 | 식 |
|---|---|
| 차원 점수 | Di = Σk (wk × Sk) / Σk wk |
| 최소 차원 점수 | min(Di) |
| 가중 평균 | Σi (Wi × Di) |
| 최소 측정 지표 점수 | Σ score(MMI) / n(MMI) |
| 가중치 재배분 | Wi′ = Wi / (1 − Wj) # Wj 는 측정하지 못한 차원들의 가중치 합 |
| 측정 충족률 (평가 범위) | Σ statusFactor(적용 대상 정식 필수 지표) / n(NOT_APPLICABLE 을 제외한 정식 필수 지표) |
Sk 는 해당 유형의 정식 필수 지표 가운데 측정을 완료한 지표의 점수다. 선택 지표와 미완료 지표는 분자와 분모 모두에서 제외한다. 차원 안에 완료된 정식 지표가 하나도 없으면 Di 를 null 로 기록한다.
부분 측정
적용 지표: D2-02 · D3-01 · D5-02. coverage = n(측정 가능 대상) / n(식별된 측정 대상). 전제를 충족한 대상만 모집단으로 삼는다. 측정하지 못한 대상은 분자와 분모 모두에서 제외한다. coverage 를 점수에 다시 곱하지 않는다. 부분 측정이 있으면 DM-2 가 성립하지 않는다 — 진단 성숙도는 DM-1 이 상한이다.
배타성 — 동일 결함의 지표 간 중복 집계 금지
| 결함 유형 | 담당 지표 |
|---|---|
| 단일 필드의 형식 위배 | D5-01 |
| 단일 필드의 범위 초과 | D5-02 |
| 두 필드 사이의 관계 위배 | D2-01 |
| 다중 필드의 계산 결과 불일치 | D2-03 |
| 비어 있는 셀 | D1-01 |
| 매핑되지 않은 코드 | D2-02 |
기준 인코딩
| 기준 | 미준수 | 측정 대상 아님 |
|---|---|---|
UTF-8 | EUC-KR · CP949 | 바이트 순서 표시의 유무 · 줄바꿈 문자의 차이 |
[제2부 부속서 A.1~A.4] [제2부 부속서 B.1~B.6]
상태값과 판정값
판정 결과를 적을 때 쓰는 값이다. 표준이 정한 세 층(진단 상태 · 지표 적용성 · 측정 완성도)이 기준 층이고, 사람이 읽는 말로 옮긴 표시층이 그 위에 있다. 표시층은 새 판정을 만들지 않는다.
층
| 층 | 답하는 질문 | 규범 | 근거 |
|---|---|---|---|
| 진단 상태 | 진단 진입 가능 여부 | 규범 | [제2부 부속서 B.1 표 B.1] |
| 지표 적용성 | 지표 측정 여부와 미측정 사유 | 규범 | [제2부 부속서 B.2 표 B.2] |
| 확인 결과 표시 | 항목(지표 · 기재 항목 · 요건)별 확인 결과를 나타내는 단일 표시값 | 표시층 | — |
| 판정하지 않음 사유 | 판정하지 않은 사유 | 표시층 | — |
| 측정 완성도 판정 | 요구된 지표의 측정 완료 정도 | 규범 | [제2부 부속서 B.5 표 B.4] |
진단 상태
| 값 | 뜻 |
|---|---|
DIAGNOSED | 진단 절차를 수행한 상태 |
SCHEMA_ONLY | 레코드가 1건도 없어 스키마만 존재하는 상태 |
FILE_BROKEN | 파일 개방이나 구조 파싱이 성립하지 않는 상태 |
SCHEMA_ONLY 와 FILE_BROKEN 에서는 진단 성숙도와 등급을 null 로 기록한다. 스키마 전용 상태는 첫 인스턴스를 적재하는 시점에 해소된다.
지표 적용성 · 규범적 계약
| 적용성 | 공식 점수 | statusFactor | 담당자가 할 일 |
|---|---|---|---|
APPLIED | 점수 | 1 | 없음 |
PARTIALLY_APPLIED | null | coverage | 나머지 대상의 기준 자료 확보 |
PRECONDITION_UNMET | null | 0 | 기준 자료 확보 후 측정 |
NOT_APPLICABLE | null | 산정에서 제외 | 조치 불필요 |
OPTIONAL_SKIPPED | null | 산정에서 제외 | 없음 |
공식 품질 지수와 공식 등급은 적용 대상 정식 필수 지표의 APPLIED 결과만 사용한다. 선택 지표를 측정하여 APPLIED 가 되어도 공식 산정에 포함하지 않는다. 공식 판정이 성립하려면 적용 대상 정식 필수 지표가 모두 APPLIED 여야 한다.
확인 결과 표시
| 표시 | 뜻 | 기준 층 대응 |
|---|---|---|
| 충족 | 측정·확인했고 기준을 충족 | APPLIED + 기준 충족 |
| 미충족 | 측정·확인했으나 기준 미달 | APPLIED + 기준 미달 |
| 미측정 | 적용 대상이지만 아직 측정하지 않음 | PRECONDITION_UNMET · PARTIALLY_APPLIED |
| 해당 없음 | 그 데이터 유형이나 목적에 적용되지 않음 | NOT_APPLICABLE · OPTIONAL_SKIPPED |
| 판정하지 않음 | 적용 기준이 없거나 선행 조건이 성립하지 않음 | 사유와 함께 적는다 |
- 0점은 「측정했고 낮음」이다. 미측정·해당 없음·판정하지 않음과 혼용하지 않는다.
- 판정하지 않은 것과 판정해서 미달인 것은 다르다. 「판정하지 않음」을 최하 등급이나 해당 없음으로 적지 않는다.
- OPTIONAL_SKIPPED를 해당 없음으로 표시할지는 확정 전이다 — 선택 지표는 적용 대상이지만 생략이 허용된 것이다.
판정하지 않음 사유
표시 형식: 판정하지 않음: <사유>
| 사유 | 뜻 |
|---|---|
| 기준 미등록 | 그 목적의 기준이 등록되지 않았다 |
| 적용 기준 미발행 | 점수는 있으나 등급으로 옮길 활성 공식 적용 기준이 없다 |
| 기준값 미발행 | 기준은 있으나 기준값이 발행되지 않았다 |
| 선행 조건 미충족 | 앞 단계의 조건을 충족하지 못했다 |
측정 완성도 판정 표시
| 결정표 결과 | 표시 |
|---|---|
DM-2 | DM-2 |
DM-1 | DM-1 |
DM-0 | DM-0 |
null(5행) | DM-0 미성립 |
null(1행) | 판정하지 않음 (진단 상태 예외) |
활용 목적과 자동 활용 조건
3단계는 활용 목적이 확정된 데이터에만 적용한다. 목적 유형은 표준이 정한 6개 값에서 고른다. 해당하는 목적이 없으면 3단계를 적용하지 않는다. [제1부 5.6]
활용 목적 6종
| 목적 | 용도 | 대표 데이터 |
|---|---|---|
ML 기계학습 | 예측·분류 모델 학습 | 정답 컬럼이 있는 표 형태 |
DL 심층학습 | 대규모 학습 | 이미지, 대용량 표·시계열 |
RAG 검색증강생성 | 근거 검색 기반 질의응답 | 문서 |
KG 지식그래프 | 개체와 관계로 연결·탐색 | 코드·분류체계가 있는 표 |
Stats 통계 분석 | 집계와 공표 | 표, 시계열 |
FineTuning 미세조정 | 언어모델 조정 | 지시문 · 응답 쌍 |
목적 선택 권고 권고
| 데이터 특성 | 우선 검토 목적 |
|---|---|
| 정답 컬럼(예측 대상 값)이 있는 표 | ML |
| 라벨이 붙은 이미지 | DL |
| 질의응답의 근거로 쓰는 문서 | RAG |
| 코드 · 분류체계로 다른 데이터와 연결되는 표 | KG |
| 추세 · 계절성을 분석하는 시계열 | Stats |
| 지시문과 응답이 쌍을 이룬 텍스트 | FineTuning |
목적별 사전 준비 항목 권고
목적별 세부 요건은 해당 목적에 등록된 기준이 정한다. [제4부 9.2]후속 부
| 목적 | 사전 준비 항목 |
|---|---|
ML | 정답 컬럼 지정 · 학습·검증 분할 기준 · 클래스별 건수 |
DL | 라벨 파일과 이미지의 대응 관계 · 촬영·수집 조건 |
RAG | 문서를 나눈 단위(조·항·문단) · 근거 위치 |
KG | 개체 식별자 · 사용한 분류체계와 코드표의 출처 |
Stats | 기준 시점 · 집계 단위 · 모집단 정의 |
FineTuning | 지시문–응답 쌍의 대응 관계와 출처 · 검수 여부 |
공통 규칙
- 3단계는 활용 목적이 확정된 데이터에만 적용한다.
- 목적 유형은 표준이 정한 6개 값 중에서 선택한다. [제1부 5.6]
- 목적별 산출물은 원본을 대체하지 않으며 원본과 함께 보존한다. [제1부 5.2]
- 어느 목적에 준비되었는지를 기재하고, 목적별 파일에도 체크섬을 기재한다.
목적 등급 표기: P-Tier N (<활용 목적 유형>) · 예: P-Tier 2 (KG)
자동 활용 적격을 위한 데이터 측 조건 8개 필수
[제5부 표 9-2]후속 부
| # | 조건 | 담당자가 할 일 |
|---|---|---|
| 1 | 목적에 맞게 준비된 데이터일 것 | 3단계까지 완료 · 목적별 준비 (3단계) |
| 2 | 현재 제공 중일 것 | 운영 상태를 최신으로 유지 |
| 3 | 공식 공개 상태일 것 | 공개 상태 표시 |
| 4 | 목적 등급이 있을 것 | 목적별 기준에 따른 판정 · 목적별 준비 (3단계) |
| 5 | 요구된 항목을 모두 측정했을 것 | 측정 완성도 DM-2 · 품질 측정 (2단계) |
| 6 | 품질 등급이 최소 기준 이상일 것 | 활성 공식 적용 기준으로 판정 · 품질 측정 (2단계) |
| 7 | 파일 체크섬이 일치할 것 | 파일 교체 시 체크섬 함께 갱신 |
| 8 | 이용 조건이 확인 가능할 것 | 라이선스 · 이용 조건 · 접근 권한 기재 |
데이터 측 조건이다. 실제 자동 활용에는 제공 시스템의 인터페이스·교환 방식·변환 절차의 적합성도 필요하며, 표준은 이를 별도 수준으로 규정한다 [제1부 표 6-1]. 조건을 충족하지 못해도 사람이 확인하여 찾고 내려받아 사용하는 것은 가능하다.
표준의 구성과 스펙
표준은 다섯 부로 구성된다. 제1부의 공통 개념을 바탕으로 제2부가 측정을, 제3부가 기록을, 제4부가 판정을, 제5부가 활용을 정한다. 이 가운데 제1~3부가 표준안 (TTAK 심의본 · 0.95 버전)이고, 제4 · 5부는 후속 부다. 요건은 스펙 문서가 정하며, 이 사이트는 스펙을 옮겨 싣지 않고 링크한다. 해설과 스펙이 다르면 스펙이 우선한다.
스펙 문서
| 부 | 역할 | 준거 문서 | 스펙 |
|---|---|---|---|
| 제1부 | 개념과 용어 · 준비 상태 · 데이터 유형 · 활용 목적 유형 | 표준안 | — |
| 제2부 | 품질 측정 · 등급화 · 지표 16종 · 진단 성숙도 | 표준안 | — |
| 제3부 | 메타데이터 · 데이터 설명서 항목 명세 · 제어 어휘 | 표준안 | — |
| 제4부 | 단계별 절차 · 확인 지점 · 목적 등급 · 이력 | 후속 부 — 표준 논의에서 채택 · 2026년 12월 제정 범위 밖 | — |
| 제5부 | 탐색 · 교환 · 에이전트 활용 · 이용자 피드백 | 후속 부 — 표준 논의에서 채택 · 2026년 12월 제정 범위 밖 | — |
이 사이트의 [제2부 8.1] 같은 표시는 스펙의 조항이다. 스펙 문서의 공개 시점은 개발 현황과 향후 공개에 있다.
이 사이트의 메뉴와 부
인용의 구분
스펙이 인용하는 외부 문서는 준수 의무에 포함되는 규범적 인용과 이해를 돕는 참고 문헌으로 나뉜다. 두 목록은 스펙 문서에 있다.
마니페스트 예시

예시 데이터(사업장 등록 정보 20건)의 데이터 설명서(마니페스트)다. 발견 계층에는 내 데이터 진단의 예시 입력을 그대로 수록했다. 에이전트는 이 문서 하나로 네 가지 판단을 시작한다.
판단별 판독 속성
| 판단 | 이 마니페스트에서 읽는 속성 |
|---|---|
| 적합성 | dct:description · csvw:tableSchema · dct:type |
| 신뢰성 | aird:lifecycleStatus · dct:accrualPeriodicity · spdx:checksum |
| 결합성 | dct:identifier · csvw:tableSchema |
| 사용 가능성 | dct:license · dct:rights · dct:accessRights |
발견 계층 — 1단계를 마친 마니페스트
발견 계층 23개 항목과 컬럼 스키마를 모두 채운 상태다. 체크섬은 example.csv의 실제 SHA-256이다.
{
"@context": [
"https://datahub.kr/ns/aird-context-3.0.jsonld",
{
"dct": "http://purl.org/dc/terms/",
"dcat": "http://www.w3.org/ns/dcat#",
"aird": "http://vocab.datahub.kr/def/aird/",
"aird-ml": "http://vocab.datahub.kr/def/aird-ml/",
"aird-kg": "http://vocab.datahub.kr/def/aird-kg/",
"csvw": "http://www.w3.org/ns/csvw#",
"dqv": "http://www.w3.org/ns/dqv#",
"prov": "http://www.w3.org/ns/prov#",
"spdx": "http://spdx.org/rdf/terms#",
"adms": "http://www.w3.org/ns/adms#",
"vcard": "http://www.w3.org/2006/vcard/ns#",
"rai": "http://mlcommons.org/croissant/RAI/",
"dpv": "https://w3id.org/dpv#",
"cr": "http://mlcommons.org/croissant/",
"sc": "https://schema.org/",
"void": "http://rdfs.org/ns/void#",
"dcatkr": "http://vocab.datahub.kr/def/dcat-ap-kr/",
"foaf": "http://xmlns.com/foaf/0.1/"
}
],
"@id": "https://datahub.kr/pid/ds-example-2026/manifest/1.0.0",
"@type": "dcat:Dataset",
"aird:lifecycleStatus": "http://vocab.datahub.kr/def/aird/lifecycle-status/Discoverable",
"dct:identifier": "https://datahub.kr/pid/ds-example-2026",
"dct:title": "예시 사업장 등록 정보",
"dct:description": "지역별 사업장의 등록 정보와 영업 상태를 수록한 예시 데이터셋이다. 이 표준의 적용 절차를 보이기 위하여 작성하였다.",
"dcat:keyword": [
"사업장",
"산업분류",
"지역",
"영업상태"
],
"dct:type": [
"http://vocab.datahub.kr/def/dcat-ap-kr/service-type/FILE",
"http://vocab.datahub.kr/def/aird/dataset-type/Structured"
],
"dct:language": [
"http://publications.europa.eu/resource/authority/language/KOR"
],
"csvw:tableSchema": {
"columns": [
{
"name": "bizId",
"datatype": "string",
"dc:description": "사업장 고유 등록번호. B-YYYY-NNNN 형식",
"required": true
},
{
"name": "bizName",
"datatype": "string",
"dc:description": "사업장 명칭"
},
{
"name": "industryCode",
"datatype": "string",
"dc:description": "한국표준산업분류 세세분류 코드"
},
{
"name": "regionCode",
"datatype": "string",
"dc:description": "행정표준코드 법정동 시군구 코드"
},
{
"name": "employeeCount",
"datatype": "integer",
"dc:description": "상시 종업원 수. 0 이상 100000 이하"
},
{
"name": "revenueBand",
"datatype": "string",
"dc:description": "매출 구간 코드. B1부터 B4까지"
},
{
"name": "registeredOn",
"datatype": "date",
"dc:description": "최초 등록일. ISO 8601-1 날짜"
},
{
"name": "closedFlag",
"datatype": "integer",
"dc:description": "폐업 여부. 0은 영업, 1은 폐업"
}
],
"primaryKey": "bizId"
},
"dct:creator": [
"https://data.example.go.kr/org/example-agency"
],
"dct:publisher": "https://data.example.go.kr/org/example-agency",
"dcat:contactPoint": {
"@type": "vcard:Contact",
"vcard:fn": "예시기관 데이터관리팀",
"vcard:hasEmail": "mailto:data@example.go.kr"
},
"aird:creationMethod": "http://vocab.datahub.kr/def/aird/creation-method/collected",
"dct:accrualPeriodicity": "http://publications.europa.eu/resource/authority/frequency/ANNUAL",
"dct:license": "http://vocab.datahub.kr/def/dcat-ap-kr/license/KOGL-1",
"dct:rights": "공공누리 제1유형. 출처를 표시하면 상업적 이용과 변형을 허용한다.",
"dct:accessRights": "http://publications.europa.eu/resource/authority/access-right/PUBLIC",
"dcat:distribution": [
{
"@type": "dcat:Distribution",
"dcat:accessURL": "https://data.example.go.kr/aird/example-registry/data/example.csv",
"dcat:mediaType": "text/csv",
"dct:format": "http://publications.europa.eu/resource/authority/file-type/CSV",
"spdx:checksum": {
"spdx:algorithm": "SHA-256",
"spdx:checksumValue": "7ad8add25d7a638322dd869f08b2fc7d64a4b12a3755c58ca9a10ee8646d78ea"
}
}
],
"dcat:theme": [
"http://vocab.datahub.kr/def/dcat-ap-kr/data-theme/INDUSTRY_EMPLOYMENT"
],
"dcat:landingPage": "https://data.example.go.kr/dataset/ds-example-2026",
"dcatkr:maintainer": {
"@type": "foaf:Agent",
"foaf:name": "예시기관 데이터관리팀"
}
}컬럼 설명의 dc:description은 dc 접두어를 외부 컨텍스트가 선언한다는 전제다. 이 문서의 로컬 컨텍스트에는 없다. 확인 중
이해 계층 — 2단계에서 더해지는 것 예시
같은 데이터를 진단한 결과를 이해 계층 속성으로 기록한 예시다. 활성 공식 적용 기준이 없어 공식 품질 등급과 적용 기준이 비어 있다. 이는 정상 결과이며, 에이전트는 빈 값을 0점이 아니라 「판정하지 않음」으로 해석한다. 측정 완성도는 예시 패턴의 임시 적용으로 DM-0이 성립하며, 결과는 잠정이다. 속성 표기는 표준이 발행할 스키마가 확정되면 그에 맞춘다.
{
"@id": "https://datahub.kr/pid/ds-example-2026/manifest/1.1.0",
"dcat:previousVersion": "https://datahub.kr/pid/ds-example-2026/manifest/1.0.0",
"aird:lifecycleStatus": "Discoverable",
"aird:dataType": "STRUCT",
"dqv:computedOn": "2026-09-03",
"aird:completeness": 1.0,
"aird:validity": 1.0,
"aird:uniqueness": 1.0,
"aird:machineReadability": 1.0,
"aird:diagnosticMaturity": "DM-0",
"aird:qualityTier": null,
"aird:thresholdProfile": null,
"aird:diagnosticReport": {
"@id": "https://datahub.kr/pid/ds-example-2026/report/2026-09-03",
"spdx:checksum": {
"spdx:algorithm": "SHA-256",
"spdx:checksumValue": "(결과서 파일의 SHA-256)"
}
},
"rai:knownLimitations": [
"폐업 신고 지연으로 closedFlag 가 실제보다 늦게 반영될 수 있다"
]
}검증된 사실 1건 예시 제안
진단으로 확인한 사실 1건을 측정값 1건으로 기재한 예다. 표준이 이미 사용하는 DQV 어휘를 따른다. aird:targetColumn · aird:referenceStandard · aird:validUntil은 제안된 속성이다.
{
"@type": "dqv:QualityMeasurement",
"dqv:isMeasurementOf": "aird:D2-02",
"dqv:computedOn": "2026-09-03",
"dqv:value": 0.997,
"aird:targetColumn": "regionCode",
"aird:referenceStandard": "행정표준코드 법정동 (버전 명시)",
"aird:validUntil": "2026-12-03"
}판독 방법은 판단별 필드와 처리, 속성 목록은 기재 항목에 있다. 스키마와 컨텍스트의 공개 현황은 개발 현황과 향후 공개에 있다.
기계 판독 자료
이 사이트의 원천 자료를 기계가 읽는 형식으로 공개한다. 화면과 같은 원천 파일에서 생성한다.
목록과 안내
| 자료 | 주소 |
|---|---|
| DCAT 카탈로그 (JSON-LD) | data/catalog.jsonld |
| 에이전트 안내 | llms.txt |
원천 자료 (JSON)
| 파일 | 주소 |
|---|---|
agent-needs.json | data/agent-needs.json |
indicators.json | data/indicators.json |
metadata-items.json | data/metadata-items.json |
purposes.json | data/purposes.json |
status-values.json | data/status-values.json |
terms.json | data/terms.json |
공개 주소 https://aird.datahub.kr · 콘텐츠 이용 조건 CC BY 4.0 · 오류 신고 hike.cau@gmail.com
내려받기
지금 내려받을 수 있는 자료입니다. 준비 중인 자료(표준 스펙 문서 링크 · 가이드 단일 문서 · 진단 도구 배포 버전 · 스키마와 컨텍스트)는 개발 현황과 향후 공개에 있습니다.
기계 판독 자료
용어 · 기재 항목 · 품질 지표 · 상태값 · 활용 목적을 JSON으로 제공합니다. 사이트 화면과 같은 원천에서 만듭니다. 목록과 형식은 기계 판독 자료에 있습니다.
사례 영상의 자막
| 영상 | 한국어 | 영어 |
|---|---|---|
| 반복 영상 · 홈 | loop.ko.vtt | loop.en.vtt |
| 사례 1 · 같은 이름, 다른 의미 | case1.ko.vtt | case1.en.vtt |
| 사례 2 · 같은 사실의 중복 집계 | case2.ko.vtt | case2.en.vtt |
| 사례 3 · 이용 가능 범위 판정 | w13.ko.vtt | w13.en.vtt |
| 참고 · 원래 좌표계 판정 | w11.ko.vtt | w11.en.vtt |
공개 도구
이 표준안을 적용하는 도구 가운데 현재 내려받거나 연결해 사용할 수 있는 도구입니다. 모두 공개 저장소에 있습니다. 개발 중인 도구는 개발 현황과 향후 공개에 있습니다.
공공데이터 렌즈 (public-data-lens)
표준안을 공공데이터포털 목록 메타데이터에 적용한 MCP 서버입니다. 에이전트가 활용 목적을 질의하면 관련 데이터를 검색하고, 목록 메타데이터의 완전성 · 최신성 · 측정 완성도를 판정 근거와 함께 반환합니다.
| 항목 | 내용 |
|---|---|
| 종류 | MCP 서버 |
| 주 이용자 | 에이전트·AI 개발자 (데이터 이용자) |
| 상태 | 베타 (v1.1) |
| 기능 | 검색 · 단건 조회 · 비교 · 월별 변경 추적 · 카탈로그 통계 · 파일 데이터의 컬럼 구조 · 예시값 관측 · 활용 계획 초안 조립 |
| 판정과 해석 | 판정: 버전 관리 규칙에 따른 서버 수행(재현 가능) · 목적별 해석: 에이전트 수행 |
| 데이터 | 공공데이터포털 목록 월간 스냅샷 — 2026-07 스냅샷 96,110건 (2026-10-05 확인) |
| 한계 | 목록 메타데이터 기반. 실제 데이터의 내용 · 품질 · 결합 가능성 보증 없음 |
| 저장소 | github.com/hike-lab/public-data-lens · MIT |
| 함께 볼 페이지 | 판단별 필드와 처리 · 기재 항목 |
카탈로그 변환기 (aird-tools · catalog-converter)
표준을 개발하면서 공개한 구현 도구 모음 가운데 현재 사용할 수 있는 도구입니다. 카탈로그 메타데이터를 표준의 기재 형식으로 변환합니다.
| 항목 | 내용 |
|---|---|
| 종류 | 변환 도구 |
| 주 이용자 | 데이터 제공 담당자 |
| 상태 | v0.1 |
| 기능 | 카탈로그 메타데이터 변환 |
| 판정과 해석 | 사용법 · 입력 형식: 저장소 설명 참조 |
| 한계 | 초기 버전. 데이터 설명서(마니페스트) 검증기 · 품질 평가기 · 변환 파이프라인은 개발 중(「개발 현황과 향후 공개」 참조) |
| 저장소 | github.com/hike-lab/aird-tools · MIT |
| 함께 볼 페이지 | 기재 항목 |
도구 정보는 2026-10-05에 확인했습니다.
개발 현황과 향후 공개
이 사이트의 탐색과 본문에는 현재 사용할 수 있는 것만 둡니다. 준비 중인 자료와 페이지는 이 표에 모읍니다.
| 항목 | 내용 | 주 이용자 | 상태 |
|---|---|---|---|
| 스키마와 컨텍스트 | 데이터 설명서(마니페스트) JSON Schema · JSON-LD @context · SHACL 형상 · 버전별 변경점 | 에이전트·AI 개발자 (데이터 이용자) | 개발 중 |
| 검증 도구와 API | 마니페스트 검증기 · 품질 평가기 · 변환 파이프라인 · 검증된 사실 조회 API | 에이전트·AI 개발자 (데이터 이용자) | 검토 중 |
| 진단 도구 배포 버전 | 「내 데이터 진단」과 같은 판정 규칙을 쓰는 명령행 진단 도구와 예시 입력 | 데이터 제공 담당자 | 개발 중 |
| 가이드 단일 문서 | 「가이드 · 데이터 제공」과 같은 내용의 PDF · docx — 사이트와 같은 원천에서 생성 | 데이터 제공 담당자 | 개발 중 |
| 그림 원본 파일 | 사이트 그림의 SVG · PNG | 모든 독자 | 검토 중 |
| 표준 스펙 문서 링크 | 제1~3부 스펙 문서의 주소 · 조항 표시에서 해당 부로 연결 | 모든 독자 | 공개 예정 |
| 조달 · 계약 요건 반영 방안 | 데이터를 구매 · 조달하는 조직이 계약 · 조달 조건에 AI 레디 데이터 요건을 반영한 문안과 사례 | 데이터를 구매 · 조달하는 조직 | 검토 중 |
| 준비 전과 후 | 같은 데이터의 준비 전후 측정 결과와 데이터 유형별 예제 | 데이터 제공 담당자 | 검토 중 |
| 판정 사례 | 입력 · 기대 판정 · 근거를 짝지은 판정 사례 — 표준 원문 대조 후 공개 | 모든 독자 | 검토 중 |
| 대응표 (DCAT-AP-KR · 포털) | AI 레디 데이터 기재 항목과 DCAT-AP-KR · 공공데이터포털 항목의 대응 | 모든 독자 | 검토 중 |
상태의 뜻
| 상태 | 뜻 |
|---|---|
| 검토 중 | 공개 범위와 형태를 결정하는 중입니다. |
| 개발 중 | 개발 중이며 공개 시점은 정해지지 않았습니다. |
| 공개 예정 | 내용은 준비되었고 공개 조건(표준 제정 · 배포처 개설 등)을 기다립니다. |
공개되면 해당 메뉴에 올리고 버전 이력에 기록합니다.
표준의 경과
표준의 핵심 판단이 언제, 어떤 문제 인식에서 나왔는지를 날짜순으로 적는다. 2025년 항목은 김학래 (중앙대학교 HIKE 연구실)가 작성 · 제안한 자료에서 개념만 옮겼고, 항목마다 지금 표준과 달라진 점을 함께 적는다. 당시 안은 현재 표준이 아니다.
문제 정의 2025년 8월 ~ 9월
2025-08 · 표준 관리 범위가 메타데이터에 한정되고 데이터 값은 포함하지 않는다
데이터를 세 층으로 진단했다 — 데이터 값(Level 0), 데이터셋 메타데이터(Level 1), 서비스 수준의 데이터(Level 2). 국제 메타데이터 표준은 Level 1에 적용되어 있지만 값에는 표준이 없어 데이터 간 연계가 어렵다고 판단했다
현재 표준은 기록(제3부)과 데이터 값의 품질 측정(제2부)을 함께 다룬다 — 품질 지표
2025-08 · 사람 중심 활용에서 사람과 AI의 공동 활용으로
데이터 제공에서 AI 활용까지의 준비 과정을 정제 · 구조화 · 계보 · 편향 최소화 · 통합 · 접근성의 여섯 단계로 그리고, 준비 결과를 제공 주체의 품질관리에 환류하는 구조를 두었다
현재 준비 단계는 데이터 설명서(마니페스트) 작성 · 품질 측정 · 목적별 준비의 세 단계이고, 단계마다 확인 지점과 산출물이 있다 — AI 레디 데이터란
2025-08 · 정의와 성숙도 단계의 제안
「추가 정제 없이 AI가 학습 · 추론 · 활용할 수 있는 데이터」를 정의로, 품질 → 학습 → 생성형 AI → 추론으로 올라가는 성숙도 단계와 단계별 평가 지표 초안을 제안했다
현재 표준은 단일 성숙도 단계를 두지 않는다. 측정 완성도 · 품질 등급 · 목적 등급을 따로 판정하고 합산하지 않는다 — 판정 절차
2025-09 · 현재 데이터와 AI 레디 데이터의 비교
제공 형식 · 품질관리 · 품질 기준 · 이용 대상 · 포털 기능의 다섯 축으로 비교했다
| 축 | 2025년 당시의 「현재 데이터」 | 2025년 당시의 「AI 레디 데이터」 | 현재 |
|---|---|---|---|
| 제공 형식 | CSV · Excel · API | JSON · Parquet · RDF · API | 형식보다 마니페스트와 품질 근거 우선 |
| 품질관리 | 메타데이터와 일부 규칙 | 데이터 값 전체와 의미 품질 | 메타데이터 기록과 데이터 값 측정의 병행 |
| 품질 기준 | 명확한 지표 없음 | 정확성 · 완전성 · 일관성 지표 관리 | 측정 방법은 표준이, 기준값은 적용 기준이 결정 |
| 이용 대상 | 사람 중심 | 사람과 AI의 공동 활용 | 기록만으로 에이전트가 판단할 수 있는지 여부 |
| 포털 기능 | 검색 · 내려받기 위주 | 질의응답 · 추천 API 같은 AI 활용 중심 | 표준의 범위 밖 — 표준의 대상은 데이터와 그 기록 |
당시 안에 있던 수치 기준값은 옮기지 않았다. 표준은 수치 기준값을 정하지 않는다
정의의 정밀화 2025년 10월
2025-10 · 구조 · 의미 · 신뢰정보
「기계가 판독할 수 있는 구조, 표준 코드 · 관계 정보 같은 의미, 출처 · 버전 · 편향 같은 신뢰정보를 갖추어 AI가 학습 · 추론 · 생성에 직접 활용할 수 있도록 준비된 데이터」로 정의를 다듬었다
현재 기재 항목과 어휘표 v0.10.5의 발견 · 이해 계층으로 구체화했다 — 기재 항목
2025-10 · 형식 중심 품질에서 의미 · 값 중심 품질로
날짜 형식 · 결측 같은 형식 점검을 넘어 표준 코드 적용과 값의 의미를 품질의 대상에 포함하고, 국제 기준(ISO/IEC 5259 등)과 정렬할 것을 제안했다
현재 품질 지표 16종, 다른 표준과 대응 관계 — 품질 지표 · 관련 표준과 대응
표준 준비로 전환 2025년 11월
2025-11-03 · 가이드라인 항목에서 표준 어휘로
AI 활용에 직접 기여하는 항목(품질 점수 · 편향 정보 · 결측 처리 방침 · 준비 단계)을 필수로, 행정 관리 항목을 선택으로 나누는 메타데이터 안을 내고, 다음 세 가지를 후속 작업으로 권고했다
| 2025년 11월의 권고 | 지금 표준 · 사이트 |
|---|---|
| ① 메타데이터 정의서와 검증 규칙(유효값 · 형식 검증) 정교화 | 기재 항목 · 판정 절차 |
| ② 국내외 표준 어휘(ISO/IEC 5259 · DCAT-AP-KR 등)의 적용 모델 설계 | 관련 표준과 대응 · 어휘표 v0.10.5 |
| ③ 여러 분야에 공통으로 쓰는 메타데이터 어휘 개발 | 발행 주체를 가리지 않는 범위 · AI 레디 데이터란 |
표준화와 공개 도구 2025년 11월 이후
2026 확인 중 · AI 레디 데이터 표준안 제1~3부
공통 개념(제1부) · 측정(제2부) · 기록(제3부)을 표준안으로 작성했다. 판정(제4부)과 활용(제5부)은 후속 부로 이어진다
현재 표준안 (TTAK 심의본 · 0.95 버전), 2026년 12월 제정 범위 — 표준의 구성과 스펙
2026 확인 중 · 표준 개발 도구의 공개
표준을 개발하면서 구현 도구 모음(aird-tools)을 공개 저장소에 게시했다
현재 사용 가능한 도구와 상태 — 공개 도구
2026 확인 중 · 표준안을 적용한 MCP 서버
공공데이터포털 목록 메타데이터에 표준안의 판정 일부를 버전 관리되는 규칙으로 적용한 MCP 서버(공공데이터 렌즈)를 공개했다
현재 사용 가능한 도구와 상태 — 공개 도구
2026-09-30 · AIRD 어휘표 v0.10.5
기재 항목의 이름 · 값 범위 · 필수 여부를 어휘표로 고정했다
현재 이 사이트의 기준 어휘 — 기재 항목
2026-10 · 발행 주체를 가리지 않는다
표준의 대상과 수요처를 공공데이터로 한정하지 않는다는 방침을 사이트 전체에 반영했다. 2025년 11월 권고 ③(분야 공통 어휘)의 방향이다
현재 공공기관 · 기업 · 민간 비영리의 데이터를 같은 절차로 다룬다 — AI 레디 데이터란
사이트 자체의 변경은 버전 이력에 있다.
버전 이력
가이드와 사이트의 버전 이력이다. 판단 근거가 된 결정 기록 가운데 공개할 수 있는 것을 요약한다.
| 일자 | 대상 | 변경 |
|---|---|---|
| 2026-10-06 | 해설 사이트 v6.9.2 | 사례 영상과 홈 반복 영상의 화면 글을 사이트 용어에 맞췄다 — 「설명서」 · 「표준 설명서」 · 「표준 프로파일」을 「마니페스트」로, 시연의 조건 기호(A · Bp · C)를 「데이터 파일만」 · 「포털 화면」 · 「마니페스트」로, 질문 번호를 Q11 · Q13으로 고쳤다. 시연 표지에서 모델 등급 표기를 내리고, 끝 화면에 「효과 확인 실험」 페이지를 적었다. 사례 2의 제목을 「같은 사실의 중복 집계」로 고쳤다. 자막(한국어 · 영어)을 같은 내용으로 고치고 기본으로 끄며, 홈 반복 영상에 일시 정지 버튼을 두고 움직임 줄이기 설정에서는 재생하지 않는다 |
| 2026-10-06 | 해설 사이트 v6.9.1 | 효과 확인 실험의 사전 등록을 첫 실행 전에 정정했다. 질문 번호를 Q01–Q15로 통일하고, 가설 표와 「알려진 한계와 대응」의 질문 참조를 질문 표의 정답 라벨에 맞췄다(H4 · H5). H1의 비교 조건을 「B(현재 포털 수준 — Bp · Bd)」로 적고, 대응 과제가 없는 H3은 이번 실행에서 판정하지 않는다. 같은 페이지의 문체를 다듬었다. 사이트 전체에 문체 규칙 v0.2를 적용했다 — 구어 동사(바뀌다 · 그래서 · 드러나다 등)와 작성자 · 담당자의 결정을 뜻하는 「정하다」를 문어로 바꾸고, 「동일한」을 「같은」으로 통일했다. 기계 판독 자료(JSON) 7종을 현재 원천으로 다시 생성했다 — 이전 판의 판정 사례 근거 · 용어 풀이 · 차원 이름(적시성)이 화면과 달랐다 |
| 2026-10-06 | 해설 사이트 v6.9 | 배포 기준 검토를 반영했다. 일반 웹 서버에서 바로 쓰는 완전한 HTML 문서를 따로 생성하고, 내 데이터 진단이 XLSX(첫 시트) · 세미콜론 · 탭 구분 파일을 읽으며 지원하지 않는 형식은 안내한다. 파일에서 알 수 있는 기재 항목 5개를 자동으로 채운다. 기술 문서 문체 규칙을 정하고 빌드가 검사한다 — 구어 · 번역체 · 비유 · 의문형 제목 · 이전 문서 체계의 장 · 부록 번호를 걷어 냈다. 페이지 사이의 사실 모순(측정 완성도 DM-0 · 측정 지표 수 · 평균 · 라이선스 값 14개 · 기재 항목 수)을 맞추고, 공개하지 않은 도구 · 파일 안내를 내렸다. 수집 경로가 없던 「도움이 되었습니까」를 내리고, 최종 수정일을 페이지마다 실제 변경일로 표시한다. 이전 · 다음 탐색은 독자 갈래 안에서 잇고 메뉴 끝에서 다음 메뉴로 넘어간다 |
| 2026-10-05 | 해설 사이트 v6.8 | 「공개 도구」 페이지를 더했다 — 표준안을 공공데이터포털 목록에 적용한 MCP 서버(공공데이터 렌즈)와 카탈로그 변환기. 「표준의 경과」 페이지를 더했다 — 2025년 8월의 문제 정의에서 2025년 11월 표준 준비로의 전환, 표준화와 공개 도구까지를 날짜순으로 적고, 항목마다 지금 표준과 달라진 점을 함께 적었다 |
| 2026-10-04 | 해설 사이트 v6.7.1 | 용어를 정리했다 — 데이터 설명서(마니페스트), 심의본 · 제정본, 버전, 페이지 · 목차. 내부 작업 용어와 구어 표현을 걷어 냈다. 「AI 레디 데이터란」의 비교 상자를 표준의 세 계층으로 고치고 데이터 유형별 표를 더했다. 그림 바탕과 본문 면을 구분하고, 밝은 화면에서 안 보이던 수치 설명과 어두운 화면의 버튼 글자를 고쳤다 |
| 2026-10-03 | 해설 사이트 v6.7 | 공개 버전에는 지금 쓸 수 있는 것만 두었다. 준비 중인 페이지와 자료를 「개발 현황과 향후 공개」 한 페이지로 모으고, 본문의 제작 기록을 걷어 냈다. 이 사이트에 대하여에 사이트의 정체성과 네 층(표준 · 해설과 가이드 · 도구 · 근거)을 적고, 표준의 지위 표기를 「표준안 · 후속 부」로 맞췄다. 홈 머리와 「AI 레디 데이터란」을 다시 쓰고, 가이드 목록을 묶음으로 나눴다. 페이지 골격은 절차 페이지에만 둔다 |
| 2026-10-03 | 해설 사이트 v6.6 | 표준의 대상과 수요처를 공공데이터로 한정하지 않는다는 방침을 반영했다. 「공공데이터는 첫 적용 대상」 서술을 「공공데이터 관측에서 출발했다」로 고치고, 시작하기 · 고유 식별자 · 도입 판단에 기업 데이터의 경우를 함께 적었다. 라이선스 값 목록을 어휘표 v0.10.5 기준으로 맞추고, 자체 이용약관처럼 목록에 없는 경우를 판정 사례 6건과 어휘표 개정 제안으로 남겼다 |
| 2026-10-01 | 해설 사이트 v6.5 | 페이지 안의 상자 · 표지 · 알림을 여섯 가지 구성 요소로 통일하고, 안내 페이지의 긴 표를 펼쳐 보기로 접었다 |
| 2026-10-01 | 해설 사이트 v6.4 | 옛 그림을 새 색 체계로 칠하고, 위쪽 바에 검색을 두었다. 데이터 설명서(마니페스트) 작성 페이지를 나누고, 따라가기 ①~④ 를 한 페이지로 모았다 |
| 2026-10-01 | 해설 사이트 v6.3 | 로고에서 온 색 체계와 고딕 한 가지 글꼴로 디자인을 다듬었다. 모든 글자 색이 접근성 대비 기준을 넘는다 |
| 2026-10-01 | 해설 사이트 v6.2 | About (English) 페이지를 없앴다 — 영문 버전은 한글 버전을 확정한 뒤 사이트 전체로 낸다 |
| 2026-10-01 | 해설 사이트 v6.1 | 직접 해 보는 요소를 더했다 — 홈의 「에이전트의 눈」, 1단계 점검표, 누르는 상태 도식, 용어 풀이. 표준 정합성 검사로 남은 옛 이름 13건을 고쳤다 |
| 2026-10-01 | 해설 사이트 v6.0 | 사이트의 틀을 하나로 바꿨다 — 위쪽 메뉴, 왼쪽은 지금 영역의 페이지, 오른쪽은 목차, 모든 페이지 같은 머리와 바닥글 |
| 2026-10-01 | 해설 사이트 v5.5 | 절이 셋 이상인 레퍼런스 페이지에 카드를 두고, 소개 페이지 끝에 「다음 단계」를 두었다. 시작하기 첫 페이지 · 준비 전과 후에도 골격을 두었다. 안내 층의 남은 해라체 문장을 고쳤다 |
| 2026-10-01 | 해설 사이트 v5.4 | 안내 페이지에 「이 페이지를 마치면 · 확인 · 다음 단계」 골격을 두고, 자주 묻는 질문을 한 원천으로 모았다. 마니페스트 예시를 레퍼런스로 옮기고, 이 사이트에 대하여에 발행 정보를 실었다. 이해 층에도 카드를 두었다 |
| 2026-10-01 | 해설 사이트 v5.3 | 시작하기 · 가이드 페이지 첫머리에 「이 페이지에서 하는 일」 카드를 두고, 개요 그림을 앞으로 옮겼다. 그림 출처를 심의본 제1~3부로 고쳤다 |
| 2026-10-01 | 해설 사이트 v5.2 | 왜 필요한가와 시작하기를 줄이고(긴 논거는 설계 근거로), 중복 표를 레퍼런스 연결로 바꾸고, 옛 절 번호를 뺐다 |
| 2026-10-01 | 해설 사이트 v5.1 | 모든 페이지에 유형 · 읽는 시간 · 도움 여부 · 최종 수정일 · 오류 신고를 두었다. 진단 화면 문구와 안내 페이지를 합쇼체로 바꾸고, 품질 측정을 측정과 결함 수정으로 나눴다 |
| 2026-10-01 | 해설 사이트 v5.0 | 사이트 구조를 소개 · 시작하기 · 가이드 · 이해 · 레퍼런스로 바꿨다(42페이지 · 옛 주소는 새 주소로 넘어간다). 안내 층의 문장을 합쇼체로 바꾸고, 홈 · 소개 · 사례 영상(한국어 · 영어 자막) · About (English) · 대응표 · 기계 판독 자료 페이지를 새로 만들었다. 기재 항목 레퍼런스는 어휘표 L1 · L2 를 그대로 보인다 |
| 2026-10-01 | 해설 사이트 v4.11 | 발견 계층 필수 항목을 어휘표 v0.10.5 데모 프로파일의 23개로 바꾸고, 속성 이름 · 값을 어휘표의 개념 URI 로 맞췄다. 진단 화면의 필수 목록 · 제어 어휘는 어휘표에서 동기화한다 |
| 2026-10-01 | 해설 사이트 v4.10 | 제정 범위를 제1~3부로 표시하고(제4 · 5부는 후속 부), 어휘표 v0.10.5 를 기준 어휘로 등록했다. 정보 모델 v0.10.5 의 그림 6장을 핵심 개념 · 마니페스트 예시 · 기재 항목에 실었다 |
| 2026-10-01 | 해설 사이트 v4.8 | 적용 기준은 표준 운영 주체가 운영 지침에 따라 발행한다는 심의본 모델로 바꿨다. 표준 부록 Ⅰ 의 예시 수치로 잠정 등급을 산출하고, 결과서 초안을 표 9-1 항목 이름으로 맞췄다. 제어 어휘 22종을 실었다 |
| 2026-10-01 | 해설 사이트 v4.7 | 원천을 TTAK 심의본과 대조했다 — 측정 엔진의 D5-03 · D6-01 · D7-01 · D7-02 를 심의본 규칙으로 바꾸고, 파일만으로 DM-0 이 성립한다는 점을 반영했다. 시리즈는 3개 부이며 제4 · 5부 인용은 소관을 대조 중이다. 심의본은 최종본과 다를 수 있다 |
| 2026-09-30 | 해설 사이트 v4.4 | 「효과를 확인하는 실험」에 「직접 돌려 보기」를 넣었다 — 같은 파일을 세 가지로 읽어 영업 중인 음식점 수가 0 · 528 · 851곳으로 갈리는 것, 측정 엔진이 기대 점수 7개와 일치하는 것을 이 페이지 안에서 계산해 보인다 |
| 2026-09-30 | 해설 사이트 v4.3 | 대조 실험의 주 자료를 가상 세계로 바꿨다 — 참값을 아는 데이터에 실제로 관측한 결함을 알려진 건수만큼 넣는다. 같은 데이터로 「내 데이터 진단」의 측정 엔진을 시험한다 |
| 2026-09-30 | 해설 사이트 v4.2 | 「효과를 확인하는 실험」을 추가했다 — 표준 마니페스트의 효과를 확인하는 대조 실험의 가설 · 조건 · 함정 · 채점 규칙을 실행 전에 공개한다(사전 등록). 결과는 실행 후 같은 페이지에 싣는다 |
| 2026-09-30 | 해설 사이트 v4.1 | 「내 데이터 진단」을 다시 만들었다 — 결과를 먼저 보이고, 추정을 줄이는 다음 작업의 효과를 계산하며, 컬럼 설명·레코드 키를 화면에서 정하고, 마니페스트 초안에 검증된 사실을 담는다. 판정 문구를 원천으로 옮겼다. 표와 안내 상자의 폭을 글줄에 맞췄다. 문장을 다듬되 의미는 바꾸지 않았다 |
| 2026-09-30 | 해설 사이트 v4 | 방문자의 세 가지 일(데이터 제공 · 에이전트 구현 · 도입 판단)을 입구로 메뉴를 개편했다. 자가진단 결과를 에이전트의 네 가지 판단으로 표시했다. 도입 판단 한 페이지, 판단별로 읽는 법, 마니페스트 예시를 신설했다. 제작 정보를 본문에서 분리했다. 스키마·검증 도구 메뉴를 추가할 예정이다. |
| 2026-09-30 | 해설 사이트 v3 | 도해 10종 추가 — 에이전트의 네 가지 판단, 에이전트 환경에서 표준이 맡는 자리, 판단별 적용 범위, 검증된 사실의 노출, 준비 상태의 전이, 세 판정의 분리, 측정 완성도 결정표, 상태값의 층, 다섯 부의 관계, 같은 점수·다른 기준. 결정표·적용 범위·상태 층은 원천에서 그림 |
| 2026-09-30 | 해설 사이트 v2 | 목적과 배경을 에이전트의 판단 네 가지(적합성 · 신뢰성 · 결합성 · 사용 가능성)로 다시 세움. 공공데이터를 첫 적용 대상으로 위치 조정. 「에이전트가 필요로 하는 것」 페이지 신설. 독자에 에이전트·AI 개발자 추가 |
| 2026-09-29 | 해설 사이트 v1 | 메뉴 8개로 구성. 준비 가이드를 분해해 절차만 남기고, 표와 목록은 원천 파일에서 생성. 스펙은 별도 문서로 두고 링크. 메뉴명을 「준비 가이드」로 정함 |
| 2026-09-29 | 가이드 용어·판정 정정 | 진단 성숙도의 쉬운 말을 「측정 범위」에서 「측정 완성도」로 변경 (표준의 「평가 범위」와 충돌). 평가 범위의 쉬운 말 「측정 충족률」 신설. DM-1 정의를 결정표 그대로 정정. 진단 도구의 DM 판정을 결정표 순서로 정정. 지표 적용성 5값 신설. 기준 인코딩 UTF-8 명시 |
| 2026-09-29 | 기재 항목 값 목록 | 갱신 주기 「수시·비정기」 코드를 IRREG로 정정. 반기 코드와 공공누리 라이선스 URI는 표준 원문 대조 필요로 표시 |
| 2026-09-29 | 상태값 | 가이드에 서로 다르게 있던 상태 목록 4벌을 하나의 체계로 묶는 통일안 초안 작성 (채택 전) |
| 2026-09-04 | 준비 가이드 초안 v0.9 | 표 형태·시계열 데이터의 실행 항목까지 수록 |
사이트 소개
이 사이트는 TTA 「AI 레디 데이터」 표준안 (TTAK 심의본 · 0.95 버전)의 제1~3부와 후속 부(제4 · 5부)를 설명하고 적용을 지원하기 위한 공개 사이트입니다. 표준의 요건과 판정 방법을 해설하고, 적용 가이드 · 도구 · 관측 근거를 함께 제공합니다. 중앙대학교 HIKE 연구실이 운영합니다.
사이트의 네 가지 구성
| 층 | 내용 | 사이트 내 위치 |
|---|---|---|
| 표준 | 요건. 규범 문서. 스펙이 정함 | 조항 표시 [제2부 8.1] · 표준의 구성과 스펙 |
| 해설 · 가이드 | 요건의 배경과 적용 절차. 새 요건을 만들지 않음 | AI 레디 데이터란 · 가이드 · 이해 메뉴 · 권고 표시 |
| 도구 | 공개 도구(MCP 서버 · 변환 도구) · 내 데이터 진단 · 30분 실습 · 기계 판독 자료 | 공개 도구 · 내 데이터 진단 · 30분 실습 · 기계 판독 자료 |
| 근거 | 관측 · 실행 기록 · 실험. 방법과 한계를 함께 기재 | 실측 · 실행 기록 · 설명용 예시 표시 · 효과 확인 실험 |
발행 정보
| 항목 | 내용 |
|---|---|
| 운영 | 중앙대학교 HIKE 연구실 |
| 표준 | AI 레디 데이터 표준안 (제1~3부) · 표준 번호 확정 전 |
| 제정 범위 | 2026년 12월 제정은 제1~3부입니다. 제4 · 5부는 후속 부입니다. |
| 어휘 | AIRD 어휘표 v0.10.5 (기준 어휘) |
| 콘텐츠 이용 조건 | CC BY 4.0 |
| 공개 주소 | https://aird.datahub.kr |
| 오류 신고 | hike.cau@gmail.com |
| 기계 판독 자료 | 기계 판독 자료 |
사이트의 지위
이 사이트의 내용은 법령이나 규정에 따른 의무사항이 아닙니다. 새로운 요건을 만들지 않습니다. TTA 「AI 레디 데이터」 제1~3부 표준안과 후속 부(제4 · 5부)의 요건을 해설하고 적용 가이드 · 도구 · 근거를 제공합니다. 공공기관 · 기업 · 민간 비영리 단체의 데이터에 모두 적용합니다.
준거 표준: TTA 「AI 레디 데이터」 제1~3부 표준안, 제4 · 5부 후속 부
제1~3부는 2026년 12월 제정 범위입니다. 표준 제정본에서 요건이나 식별자가 변경되면 이 사이트도 함께 갱신합니다.
사이트의 범위
| 제공 범위 | 제외 범위 |
|---|---|
| 확인 · 기재 항목 제시 | 새로운 의무 부과 |
| 항목별 근거와 판단 기준 표시 | 기준값 결정 (표준 운영 주체가 발행) |
| 오류 사례와 수정 사례 제시 | 특정 조직 · 데이터셋 평가 |
| 측정 결과 해석 방법 설명 | 조직 간 순위 산정 |
표와 목록의 작성 방식 및 표준 원문과 대조 중인 항목은 제작 방식과 검증 중인 항목에서 확인할 수 있습니다. 준비 중인 자료는 개발 현황과 향후 공개에, 표준이 만들어진 경과는 표준의 경과에 있습니다.
제작 방식과 검증 중인 항목
이 사이트의 제작 방식과, 표준 원문과 대조 중인 항목을 모았다. 본문에는 제작 정보를 두지 않는다.
제작 방식
- 표와 목록, 일부 그림은 스펙에서 추출한 원천 파일(YAML)에서 생성한다. 같은 사실은 한 원천에만 둔다.
- 절차 설명은 산문으로 두고, 산문 안에 원천의 사실을 다시 적지 않는다.
- 공식 기준값은 싣지 않는다. 표준안 제2부 부록 Ⅰ의 예시 프로파일(가중치 · 등급 구간 · 통과선 · 평가 범위 하한 · 더미값 패턴)은 「예시」로 표시해 운영 지침과 적용 기준의 발행 페이지에만 표로 싣는다. 예시 프로파일로 계산한 값은 내 데이터 진단의 잠정 등급(통과선 미달 사유 포함)과 등급 모의 계산의 「예시 가중치로 계산한 가중 평균」에 나타나며, 가이드와 판정 사례의 「가중 평균 0.925」도 예시 가중치로 계산한 값이다.
- 스펙이 개정되면 원천을 먼저 고치고 모든 페이지를 다시 생성한다.
원천 파일과 쓰이는 페이지
| 원천 | 쓰이는 페이지 |
|---|---|
glossary/aird-agent-needs.yaml | — |
glossary/aird-indicators.yaml | 판정 절차 · 설계 근거 · 적용 기준에 위임된 항목 · 품질 지표 · 상태값과 판정값 |
glossary/aird-terms.yaml | 판정 절차 · 용어집 |
glossary/aird-metadata-items.yaml | 기재 항목 |
glossary/aird-status-values.yaml | 설계 근거 · 상태값과 판정값 |
glossary/aird-purposes.yaml | 활용 목적과 자동 활용 조건 |
evals/agent-ab/protocol.yaml | — |
evals/agent-ab/questions.yaml | — |
evals/agent-ab/world/ | — |
glossary/aird-experiment-terms.yaml | — |
site/strings.ko.yaml | — |
samples/example/ | — |
content/guide/ | — |
site/history.yaml | 표준의 경과 |
site/tools.yaml | 공개 도구 |
content/standard/ | — |
표준 원문과 대조 중인 항목
본문에는 「확인 중」으로만 표시했다.
| 페이지 | 확인할 것 |
|---|---|
| 판단별 필드와 처리 | DCAT-AP-KR 판본과 dct:temporal · dct:spatial 의 우선순위(필수·권장·선택) — 2023 웹 명세(vocab.datahub.kr)의 속성 표에는 보이지 않아 DCAT-AP 2.1.0 상속인지 이후 버전 정의인지 확인 |
| 판단별 필드와 처리 | 공공누리 라이선스 URI — DCAT-AP-KR 통제 어휘는 license.do#01-tab, 이 사이트 예시는 license.do#01. 어느 표기를 따를지 |
| 판단별 필드와 처리 | 갱신 주기 「수시」 — DCAT-AP-KR은 CONT(continuous)로 대응시킨다. 포털의 「수시」(필요할 때)는 IRREG에 가깝다 |
| 판단별 필드와 처리 | 목적 등급의 속성명 — 용어집은 aird:purposeTier, 이해 계층 조건부 항목은 aird:purposeReadiness · aird:purposeAssessmentStatus |
| 판단별 필드와 처리 | 자동 활용 조건 2(현재 제공 중)·3(공식 공개 상태)에 대응하는 마니페스트 속성 |
| 판단별 필드와 처리 | 자동 활용 조건 8의 「확인 가능」이 기계 판독을 요구하는지 — 이 사이트는 요구한다고 해석했다 |
| 판단별 필드와 처리 | 식별자 — 어휘표 1.1.1 은 포털 등록 데이터의 dct:identifier 를 포털 목록키로 둔다. 목록키가 재등록 · 이관 때 바뀌는 경우를 어떻게 다룰지 |
| 판단별 필드와 처리 | 기업의 자체 이용약관 — 라이선스 값 목록(kr-license)에 값이 없다. 어휘표 개정 전까지 dct:license 를 어떻게 채울지 |
| 기재 항목 | 코드 표준 원문 대조 필요 — v0.9는 SEMIANNUAL로 적었음 |
| 기재 항목 | 라이선스 값 공간 확장은 어휘표 개정 제안. 확정 전까지 dct:license 를 어떻게 채울지 확인 중 |
| 상태값과 판정값 | 적용 기준 미발행 — v0.9 4.4의 「기준값 미발행」과 같은 사태인지 확인 필요 |
| 마니페스트 예시 | 예시 마니페스트의 dc: 접두어 — 로컬 @context 에 선언 없음. 외부 컨텍스트(aird-context-3.0)가 제공하는지 확인 |
| 표준의 경과 | 표준안 착수일 · 심의본 날짜 |
| 표준의 경과 | 저장소 첫 공개일 |
| 표준의 경과 | 명세 v1.0 동결일 |
상태값 정리안의 미결
- 「판정하지 않음」과 「해당 없음」의 공식 상태값이 표준에 있는가 (v0.9 표준 원문 대조 3번)
- 적용 기준 미발행과 기준값 미발행을 구분할 실익이 있는가
- OPTIONAL_SKIPPED의 표시층 대응
가이드 v0.9 상태 목록 대응
| v0.9 표기 | 정리안 |
|---|---|
| 데이터 요건 미충족 | item_status.unmet |
| 필수 항목 미측정 | item_status.not_measured |
| 적용 기준 미발행 | withheld_reason.criteria_unadopted |
| 적용 대상 아님 | item_status.na |
| 판정하지 않음: 기준 미등록 | withheld_reason.criteria_unregistered |
| 판정하지 않음: 기준값 미발행 | withheld_reason.threshold_unissued |
| 판정하지 않음: 선행 조건 미충족 | withheld_reason.precondition_unmet |
앞으로 공개할 것
준비 중인 페이지와 자료는 개발 현황과 향후 공개에 모았다.