데이터 분석

스프레드시트 이상치를 찾고 조정 보고서를 만드는 방법

AI 보조 분석으로 스프레드시트 예외를 조사하고 추적 가능한 조정 보고서를 작성합니다.

게시일 업데이트
스프레드시트데이터 품질조정이상 탐지

스프레드시트의 이상치가 곧 오류인 것은 아닙니다. 정상적인 예외, 시점 차이, 중복 거래, 변경된 식별자, 새 행을 조용히 누락한 수식일 수 있습니다. 따라서 신뢰할 수 있는 조정 절차는 특이한 셀을 강조하는 데서 끝나지 않습니다. 무엇이 서로 일치해야 하는지 정하고, 각 차이를 근거까지 추적하며, 그 차이를 어떻게 해결했는지 기록해야 합니다.

상황 진단

동일한 활동을 나타내야 할 두 보고서가 일치하지 않거나, 한 통합 문서에 불완전하거나 중복되거나 잘못 입력되었거나 일관되지 않아 보이는 값이 있을 때 이 방법을 사용합니다. 먼저 조정 질문을 평이한 문장으로 정하세요. 어떤 레코드가, 어떤 키로, 어느 기간에, 어떤 회계 또는 운영 규칙 아래 일치해야 하는지 묻습니다.

구조적 이상과 업무상 이상을 구분합니다. 구조적 문제에는 어긋난 열, 혼합된 날짜 형식, 수식 공백, 보이지 않는 공백 문자, 서로 다른 자료형으로 저장된 식별자가 포함됩니다. 업무상 이상에는 예상 밖의 환불, 다른 기간에 계상된 주문, 한 시스템에 누락된 정상 레코드가 포함됩니다. 이 구분에 따라 누가 항목을 해결할 수 있는지가 달라집니다. 데이터 담당자는 형식을 고칠 수 있지만, 업무상 처리 방식은 재무 또는 운영 책임자가 승인해야 합니다.

최종 보고서는 원천 범위, 매칭 규칙, 예외 유형, 근거, 처리 결과, 미해결 항목을 설명해야 합니다. 값이 특이하다는 이유만으로 사기이거나 잘못되었다고 단정해서는 안 됩니다.

필수 입력 자료

원천 데이터 세트의 읽기 전용 내보내기 파일, 추출 시각, 열 정의, 권위 있는 키 필드, 예상 보고 기간, 통화 및 시간대 규칙, 알려진 제외 사항을 수집합니다. 시스템 책임자가 제공한 통제 합계가 있다면 확보하세요. 시스템 사이에서 변경된 식별자의 대응표와 허용 오차, 취소 거래, 무효 처리, 지연 계상에 관한 정책도 모읍니다.

각 열의 의미와 허용 형식을 설명하는 데이터 사전을 만듭니다. 속성별로 어느 파일이 기준 자료인지 기록하세요. 한 자료는 거래 상태의 기준이고 다른 자료는 정산 상태의 기준이라면, 어느 한 파일이 두 상태를 모두 관장한다고 가정해서는 안 됩니다. 분석 전에 예외 식별자, 출처 참조, 일치 상태, 차이 유형, 관찰 근거, 제안 설명, 검토자, 처리 결과, 후속 조치로 보고서 구조를 정의합니다.

데이터 안전 준비

실제 운영 파일이 아니라 복사본에서 작업합니다. 매칭에 필요 없는 직접 식별자와 민감한 자유 서술 열을 제거하세요. 가능하면 계정 또는 고객 식별자를 일관된 토큰으로 바꿉니다. 토큰 대응표는 별도로 분리해 접근을 통제합니다. 선택한 AI 또는 분석 환경이 해당 데이터 등급에 승인되었는지 확인합니다.

원본 내보내기 파일을 편집하지 못하게 잠그고, 절차가 지원한다면 파일 체크섬을 계산하거나 기록합니다. 기밀 통합 문서 전체를 범용 채팅 도구에 붙여 넣지 마세요. 결정론적 비교에는 로컬 수식이나 스크립트를 우선 사용하고, AI는 정제된 예외 표본을 바탕으로 패턴을 설명하거나 조사 단계를 제안하거나 문서를 초안하는 데 활용합니다. 출처가 불분명한 파일의 매크로는 비활성화합니다. 분석을 위해 시트를 값으로 변환하기 전에 수식 원문을 별도로 보존합니다.

순차 작업 절차

원천 목록부터 시작합니다. 파일명, 시트명, 행 범위, 추출 시각, 책임자를 기록하세요. 어떤 표도 바꾸지 않은 상태에서 머리글, 빈 값 비율, 고유 키 수, 중복 키, 자료형, 날짜 범위, 수식 적용 범위를 프로파일링합니다. 값을 비교하기 전에 가져오기 문제부터 검토합니다.

정규화는 파생 작업표에서만 수행합니다. 공백을 제거하고, 키가 대소문자를 구분하지 않으면 표기를 통일하며, 명시된 로캘에 따라 날짜를 해석하고, 식별자의 앞자리 0을 보존합니다. 원본 필드와 정규화 필드를 모두 남기세요. 다른 분석가가 재현할 수 있도록 모든 변환을 규칙으로 문서화합니다.

매칭은 여러 단계로 정의합니다. 승인된 기본 키로 정확히 일치하는 레코드를 먼저 찾습니다. 남은 항목에는 명시된 허용 오차 정책과 함께 참조 번호, 날짜, 금액 같은 승인된 복합 키만 사용합니다. 언어 모델이 퍼지 매칭 결과를 최종 사실로 결정하게 해서는 안 됩니다. 후보를 제안할 수는 있지만 검토자가 확인해야 합니다. 결과는 정확 일치, 설명된 시점 차이, 정상적인 업무상 예외, 원천 데이터 결함, 중복 가능성, 불일치, 책임자 검토 필요로 분류합니다.

차이는 결정론적인 스프레드시트 수식이나 코드로 계산하고 원본 행 참조를 유지합니다. 예외 유형마다 표본을 살펴보고, 해당 규칙을 넓게 적용하기 전에 업무 책임자의 확인을 받으세요. 그런 다음 예외 하나당 한 행을 사용해 관련 원천 값, 발동한 규칙, 근거, 처리 결과가 들어간 조정표를 만듭니다. 행 수준 계보를 확보한 뒤에만 집계합니다.

전체 합계만 제시하지 말고 범위와 한계를 밝히는 경영진 요약을 작성합니다. 원천 결함은 시스템 책임자에게, 정책 질문은 해당 업무의 최종 책임자에게 보냅니다. 데이터는 승인된 시스템에서만 수정한 뒤 다시 내보내 전체 비교를 재실행합니다. 새 근거가 처리 결과를 뒷받침할 때에만 항목을 조정 완료로 표시합니다.

복사해 쓸 수 있는 프롬프트

```text 정제된 스프레드시트 프로파일과 예외 행을 검토하는 데이터 품질 분석가 역할을 하세요. 원천 값, 매칭 규칙, 설명, 수정 사항을 지어내지 마세요. 특이한 값은 오류의 증거가 아닙니다.

조정 질문: [질문] 원천 정의 및 책임자: [정의] 승인된 키와 정규화 규칙: [규칙] 허용 오차, 기간, 시간대, 통화 정책: [정책] 열 프로파일: [프로파일] 안정적인 행 참조가 있는 정제된 예외 표본: [표본]

다음을 반환하세요. - 매칭 전에 해결할 구조적 문제 - 제공된 근거가 뒷받침하는 예외 패턴 - 각 패턴에 대한 대안 설명 - 분석가가 실행할 수 있는 결정론적 검사 - 원천 책임자에게 물을 질문 - 범위, 규칙, 계보, 처리 결과, 한계를 포함한 조정 보고서 개요

모든 문장을 관찰, 추론, 미확인 중 하나로 표시하세요. 제공된 확인 없이 레코드를 오류, 사기, 조정 완료로 규정하지 마세요. ```

작업 예시

주문 내보내기 파일과 정산 내보내기 파일이 같은 참조 필드를 사용한다고 가정해 봅시다. 여러 주문이 일치하지 않습니다. 프로파일링 결과 주문 참조에는 앞자리 0이 있지만 정산 도구는 이를 숫자로 내보낸 사실이 드러납니다. 다른 차이는 보고 마감 시점 주변에 몰려 있고, 소규모 항목군에서는 서로 다른 상태 값과 함께 같은 참조가 반복됩니다.

분석가는 원본 참조를 보존하고 책임자가 승인한 텍스트 정규화 비교 키를 만든 뒤 정확 매칭을 다시 실행합니다. 앞자리 0이 있던 항목군은 이제 연결되지만, 조용히 제거하지 않고 구조적 표현 문제로 문서화합니다. 마감 시점 항목군은 재무 책임자가 계상 규칙을 확인할 때까지 시점 차이 후보로 남깁니다. 참조가 반복된 항목군은 자동 삭제하지 않고, 취소 거래 뒤 수정된 정산이 이어진 것인지 확인합니다.

보고서는 각 항목군, 검사 방식, 원천 행, 책임자의 결정, 처리 결과를 보여 줍니다. 모든 레코드를 억지로 일치시키는 매력적이지만 위험한 지름길을 피합니다. 근거가 불완전해 적절하게 미해결 상태로 남아야 하는 레코드도 있습니다.

검증 점검

모든 변환 전후에 행 개수와 통제 합계를 대조합니다. 정규화가 서로 다른 식별자를 합치거나 앞 문자를 떨어뜨리지 않았는지 확인하세요. 첫 번째와 마지막 데이터 행에서 수식 범위를 시험합니다. 숨겨진 행, 필터, 병합 셀, 오류 값, 수식 영역 안의 하드코딩된 상수를 확인합니다. 원천 책임자가 제공한 알려진 예로 날짜 해석을 다시 시험합니다.

조정 완료한 모든 예외에는 원천 참조와 승인된 규칙 또는 책임자 확인이 있어야 합니다. 퍼지 매칭이나 복합 매칭은 별도로 재검토합니다. 한 레코드가 여러 진단 유형에 나타날 수 있는지를 고려하면서 일치, 설명 완료, 미해결 집단의 합이 원래 모집단과 맞는지 비교합니다. 손대지 않은 내보내기 파일에서 전체 절차를 다시 실행해 재현성을 입증합니다. 두 번째 검토자가 예외 하나를 골라 최초 상태부터 처리까지의 경로를 원래 분석가에게 묻지 않고 재구성할 수 있어야 합니다.

실패 복구

정리 과정에서 합계가 달라지면 중단하고 각 변환 단계를 비교해 손실이나 중복이 생긴 지점을 찾습니다. 작업표를 기억에 의존해 수리하지 말고 읽기 전용 내보내기 파일에서 복원하세요. 키가 고유하지 않다면 매칭 전에 원천 책임자와 의도한 레코드 단위를 정합니다. 날짜나 소수점 해석이 모호하면 원시 텍스트를 보존하고 올바른 로캘 규칙을 확인합니다.

AI가 근거 없는 설명을 제안하면 보고서에서 제거하고 증거의 경계를 다시 명시합니다. 넓은 규칙이 일부 예시는 해결하지만 다른 곳에서 잘못된 매칭을 만든다면 그 규칙을 철회하고 해당 항목을 미해결 상태로 되돌린 뒤 더 좁은 결정론적 검사를 설계합니다. 원천을 수정할 수 없다면 예외, 위험, 책임자, 다음 검토 계기를 문서화합니다. 보고서를 완성된 것처럼 보이게 하려고 억지 조정 항목을 만들지 마세요.

재사용 가능한 최종 절차

원천 내보내기 파일을 고정해 목록화하고, 구조를 프로파일링하며, 레코드 단위와 권위 있는 필드를 정의합니다. 문서화된 정규화 복사본을 만들고 엄격한 규칙에서 조건부 규칙 순으로 승인된 매칭 규칙을 적용하세요. 모든 예외에 행 수준 계보를 보존합니다. 관찰된 차이와 제안 설명을 구분하고, 업무상 처리에는 책임자 승인을 받으며, 데이터는 권위 있는 원천에서만 수정한 뒤 깨끗한 내보내기 파일로 다시 실행합니다. 범위, 규칙, 해결 항목, 미해결 항목, 한계, 검토 책임을 함께 게시하고, 다음 조정에서도 즉흥적인 필터 대신 같은 통제 절차를 쓰도록 변환 기록을 보관합니다.