

80~90%는 비정형 데이터지만, 활용되는 건 18%

조사에 따르면 기업이 보유한 데이터의 80-90%는 비정형 데이터가 차지하고 있습니다. 비정형 데이터란 이메일, 문서, 이미지, 동영상 등 정해진 형식이 없는 데이터를 말합니다. 비정형 데이터는 엑셀이나 데이터베이스처럼 표로 정리해 다루기 어렵습니다.
AWS는 “비정형 데이터에 시장 트렌드, 고객 니즈 등의 인사이트가 담겨 있는 경우가 많지만, 이를 실제로 분석해 활용하는 기업은 약 18%에 그친다”고 지적합니다. 비정형 데이터는 정형 데이터와 달리 고정된 형식이 없어, 처리하려면 고급 AI/ML 기술과 데이터 파이프라인이 필요하기 때문입니다.
국내 상황도 다르지 않습니다. 세일즈포스가 국내 500개 기업을 포함해 전 세계 8,000개 기업을 조사한 결과에 따르면, 국내 기업의 84%가 데이터 기반 AI 활용의 중요성은 인식하면서도 61%는 실제 실행에 어려움을 겪고 있다고 답했습니다. 국내 데이터·분석 선도 기업들조차 기업 데이터의 15%가 사일로에 갇혀 접근조차 어렵다고 추정했습니다.
이 기술 장벽을 낮추기 위해 등장한 것이 AI 기반 자동화 도구입니다. 그런데 정작 도입을 검토하는 IT관리자들은 또 다른 벽 앞에서 멈춥니다.
IT관리자가 AI 자동화를 미루는 진짜 이유

결과를 다시 사람이 확인해야 한다는 부담
비정형 데이터는 정답이 딱 떨어지지 않아, AI가 처리한 결과라도 어떤 게 맞고 틀렸는지 가려내기가 쉽지 않습니다. 다큐먼트 AI 기업 로민의 CTO는 정확도가 아무리 높아도 어떤 결과가 틀렸는지 구분하지 못하면 결국 전체를 사람이 다시 확인해야 한다고 지적했습니다. 그의 표현을 빌리면, 이 경우 "업무 자동화율은 0%"가 되는 셈입니다.
즉 중요한 건 정확도 수치 자체가 아니라. 어떤 결과를 검토해야 하는지 시스템이 스스로 판단할 수 있는가입니다. 틀릴 수 있는 부분을 AI가 먼저 골라내 사람에게 넘길 수 있다면, 나머지는 안심하고 자동 처리에 맡길 수 있습니다.
데이터가 밖으로 나갈 수 있다는 우려
사진, 계약서, 회의록 같은 비정형 데이터에는 의료 정보, 개인정보, 재무 데이터처럼 민감한 내용이 섞여 있는 경우가 많습니다. 한편 국내 기업 보안 담당자·실무자의 64.5%가 LLM 도입 시 가장 큰 우려로 민감 데이터 유출을 꼽았습니다. 실제로 일부 AI 서비스는 입력 데이터를 모델 학습에 활용하거나 해외 서버에 저장하기도 합니다. 보안 문제가 해결되지 않는 한, 자동화 도입 자체가 미뤄질 수밖에 없는 것입니다.
두 가지 문제, Bizwork는 이렇게 답합니다

검수 부담에는 신뢰도 기반 분기
이 문제에는 오류 가능성이 높은 결과만 골라 사람에게 검수를 맡기는 '신뢰도 예측' 방식으로 접근할 수 있습니다. 전체를 다 확인하는 대신, AI가 확신하지 못하는 부분만 짚어주는 방식입니다. 문제는 걸러낸 항목이라도 사람이 문서를 처음부터 다시 훑어봐야 한다면, 검수 자체는 여전히 느리다는 점입니다. 핵심은 검수를 아예 없애는 게 아니라, 검수 대상을 확 줄이는 데 있습니다. 사람이 마지막으로 확인할 수 있는 구조 자체는 그대로 유지하되, 그 대상이 전체가 아니라 일부로 좁혀지는 것입니다. 즉, 신뢰도 예측으로 "무엇을 사람이 봐야 하는지"만 정확히 골라내면, 나머지는 안심하고 자동 처리에 맡기고 최종 검수는 사람이 하는 구조가 완성됩니다.
보안에는 온프레미스, 그리고 하이브리드
보안을 지키는 방법은 온프레미스, 또는 하이브리드(온프레미스+클라우드 결합)입니다. 온프레미스는 데이터가 물리적으로 회사 밖을 벗어나지 않아 유출 우려를 근본적으로 차단합니다. 하이브리드는 민감한 데이터만 온프레미스로 지키고 나머지는 클라우드로 처리해, 보안을 지키면서도 유연하게 확장할 수 있습니다. 어느 쪽을 택하든, 핵심은 같습니다. 민감한 데이터가 회사 밖으로 무분별하게 나가지 않도록 하는 것입니다. 즉, 검수 부담은 신뢰도 기반 분기로, 보안 우려는 하이브리드 배포로 각각 풀 수 있습니다.
Bizwork의 접근 방식

Bizwork는 비정형 데이터까지 처리하는 업무 자동화 AI 에이전트 플랫폼입니다.
1. 보안 우려에는 배포 방식의 선택권으로 대응합니다.
100% 온프레미스, 그리고 하이브리드 환경을 모두 지원합니다. 그리고 비정형 데이터 안에 섞여 있는 개인정보·등의 민감정보는 자동으로 마스킹 처리할 수 있습니다.
2. 기술 장벽에는 비정형 데이터 처리 범위 확장으로 대응합니다.
단순 반복 업무를 포함하여 사진, 스캔 문서 같은 비정형 데이터까지 처리하여 업무 자동화를 실현할 수 있습니다. 평균적으로 99%의 신뢰도로 비정형 데이터를 처리하고, 나머지는 사람이 최종 검수하는 구조입니다.
숫자로 증명된 사례

대량으로 쌓여있는 인물 사진 중, 중복 건이나 규격에 맞지 않는 사진이 섞여 있었습니다. 이를 담당자가 일일이 눈으로 확인하며 분류해야 했지만, 이 작업을 Bizwork가 얼굴인식 자동화를 구축하였습니다.
항목 | 결과 |
처리한 사진 수 | 128,543장 |
AI 자동 검증률 | 99.4% |
사람이 직접 확인해야 했던 비율 | 0.6% |
수만 장의 사진을 사람이 하나하나 눈으로 확인해야 했던 작업을 AI가 99.4%를 자동으로 판별하고, 사람은 나머지 0.6%만 검토하면 되는 구조로 만들었습니다.
비정형 데이터 활용률이 18%에 머무는 이유는 기술 장벽, 검수 부담, 보안 우려 세 가지가 겹치기 때문입니다. 2026년 업계 흐름은 "폐쇄망이냐 클라우드냐"의 이분법이 아니라 데이터 민감도별 하이브리드 배포로 옮겨가고 있습니다. Bizwork는 온프레미스와 클라우드를 함께 지원하고 민감정보는 자동 마스킹하며, 정형 업무를 넘어 사진·문서 같은 비정형 데이터까지 자동화 범위를 넓힙니다. 실제 사례에서 128,543장의 사진을 99.4% AI 자동 검증률로 처리한 결과가 이를 뒷받침합니다.
비정형 데이터 자동화는 이제 기술적으로 불가능한 일이 아닙니다. 관건은 검수 부담과 보안 우려, 두 가지 장벽을 어떻게 넘느냐였습니다. Bizwork는 신뢰도 기반 처리로 검수 부담을 줄이고, 온프레미스·하이브리드 배포로 보안을 지키면서 이 두 가지에 함께 대응합니다.



| References |
AWS 기술 블로그, "Bedrock Data Automation과 GraphRAG로 비정형 데이터 인사이트 강화하기", https://aws.amazon.com/ko/blogs/tech/bedrock-data-automation-graphrag/ IBM, "정형 데이터와 비정형 데이터 비교: 차이점은 무엇인가요?", https://www.ibm.com/kr-ko/think/topics/structured-vs-unstructured-data Databricks 블로그, "정형 데이터와 비정형 데이터: 주요 차이점 이해하기", https://www.databricks.com/kr/blog/structured-vs-unstructured-data 지티티코리아, "비정형 데이터 90% 시대...지능형 문서 처리 시장 급성장", https://www.gttkorea.com/news/articleView.html?idxno=25148 MIT 테크놀로지 리뷰 코리아, "세일즈포스, 한국 기업 데이터 활용 현황 조사…84% 인식, 61% 실행 난항", https://www.technologyreview.kr/deeptech/세일즈포스-한국-기업-데이터-활용-현황-조사84-인식/ IBM "AI 시대의 개인정보 보호 문제 살펴보기", https://www.ibm.com/kr-ko/think/insights/ai-privacy 아이티데일리, "로민 문서 AI, 정확도 아닌 자동화율로 봐야", https://www.itdaily.kr/news/articleView.html?idxno=240872 로민 공식 블로그, "업무 자동화율이란? 정확도 99%로도 업무 시간이 줄어들지 않는 이유", https://blog.lomin.ai/document-automation-rate 아이티데일리, "국내 기업 64%, LLM 도입 시 민감 데이터 유출 우려", https://www.itdaily.kr/news/articleView.html?idxno=230782 알약 블로그, "설문조사 통계로 알아본 생성형 AI 시대, 기업 보안의 현실과 해법", https://blog.alyac.co.kr/5517 windyflo 블로그, "온프레미스 AI 에이전트 보안 완전 가이드 — 데이터 유출 걱정 없이 도입하는 2026 체크리스트", https://blog.windyflo.com/blog/on-premise-ai-agent-security/ Open Network System, "온프레미스 AI란 무엇일까? 사내 데이터를 지키며 AI를 도입하려는 기업을 위한 망분리 가이드", https://open-network.co.kr/blog/onprem-ai-explainer
|
조사에 따르면 기업이 보유한 데이터의 80-90%는 비정형 데이터가 차지하고 있습니다. 비정형 데이터란 이메일, 문서, 이미지, 동영상 등 정해진 형식이 없는 데이터를 말합니다. 비정형 데이터는 엑셀이나 데이터베이스처럼 표로 정리해 다루기 어렵습니다.
AWS는 “비정형 데이터에 시장 트렌드, 고객 니즈 등의 인사이트가 담겨 있는 경우가 많지만, 이를 실제로 분석해 활용하는 기업은 약 18%에 그친다”고 지적합니다. 비정형 데이터는 정형 데이터와 달리 고정된 형식이 없어, 처리하려면 고급 AI/ML 기술과 데이터 파이프라인이 필요하기 때문입니다.
국내 상황도 다르지 않습니다. 세일즈포스가 국내 500개 기업을 포함해 전 세계 8,000개 기업을 조사한 결과에 따르면, 국내 기업의 84%가 데이터 기반 AI 활용의 중요성은 인식하면서도 61%는 실제 실행에 어려움을 겪고 있다고 답했습니다. 국내 데이터·분석 선도 기업들조차 기업 데이터의 15%가 사일로에 갇혀 접근조차 어렵다고 추정했습니다.
이 기술 장벽을 낮추기 위해 등장한 것이 AI 기반 자동화 도구입니다. 그런데 정작 도입을 검토하는 IT관리자들은 또 다른 벽 앞에서 멈춥니다.
결과를 다시 사람이 확인해야 한다는 부담
비정형 데이터는 정답이 딱 떨어지지 않아, AI가 처리한 결과라도 어떤 게 맞고 틀렸는지 가려내기가 쉽지 않습니다. 다큐먼트 AI 기업 로민의 CTO는 정확도가 아무리 높아도 어떤 결과가 틀렸는지 구분하지 못하면 결국 전체를 사람이 다시 확인해야 한다고 지적했습니다. 그의 표현을 빌리면, 이 경우 "업무 자동화율은 0%"가 되는 셈입니다.
즉 중요한 건 정확도 수치 자체가 아니라. 어떤 결과를 검토해야 하는지 시스템이 스스로 판단할 수 있는가입니다. 틀릴 수 있는 부분을 AI가 먼저 골라내 사람에게 넘길 수 있다면, 나머지는 안심하고 자동 처리에 맡길 수 있습니다.
데이터가 밖으로 나갈 수 있다는 우려
사진, 계약서, 회의록 같은 비정형 데이터에는 의료 정보, 개인정보, 재무 데이터처럼 민감한 내용이 섞여 있는 경우가 많습니다. 한편 국내 기업 보안 담당자·실무자의 64.5%가 LLM 도입 시 가장 큰 우려로 민감 데이터 유출을 꼽았습니다. 실제로 일부 AI 서비스는 입력 데이터를 모델 학습에 활용하거나 해외 서버에 저장하기도 합니다. 보안 문제가 해결되지 않는 한, 자동화 도입 자체가 미뤄질 수밖에 없는 것입니다.
검수 부담에는 신뢰도 기반 분기
이 문제에는 오류 가능성이 높은 결과만 골라 사람에게 검수를 맡기는 '신뢰도 예측' 방식으로 접근할 수 있습니다. 전체를 다 확인하는 대신, AI가 확신하지 못하는 부분만 짚어주는 방식입니다. 문제는 걸러낸 항목이라도 사람이 문서를 처음부터 다시 훑어봐야 한다면, 검수 자체는 여전히 느리다는 점입니다. 핵심은 검수를 아예 없애는 게 아니라, 검수 대상을 확 줄이는 데 있습니다. 사람이 마지막으로 확인할 수 있는 구조 자체는 그대로 유지하되, 그 대상이 전체가 아니라 일부로 좁혀지는 것입니다. 즉, 신뢰도 예측으로 "무엇을 사람이 봐야 하는지"만 정확히 골라내면, 나머지는 안심하고 자동 처리에 맡기고 최종 검수는 사람이 하는 구조가 완성됩니다.
보안에는 온프레미스, 그리고 하이브리드
보안을 지키는 방법은 온프레미스, 또는 하이브리드(온프레미스+클라우드 결합)입니다. 온프레미스는 데이터가 물리적으로 회사 밖을 벗어나지 않아 유출 우려를 근본적으로 차단합니다. 하이브리드는 민감한 데이터만 온프레미스로 지키고 나머지는 클라우드로 처리해, 보안을 지키면서도 유연하게 확장할 수 있습니다. 어느 쪽을 택하든, 핵심은 같습니다. 민감한 데이터가 회사 밖으로 무분별하게 나가지 않도록 하는 것입니다. 즉, 검수 부담은 신뢰도 기반 분기로, 보안 우려는 하이브리드 배포로 각각 풀 수 있습니다.
Bizwork는 비정형 데이터까지 처리하는 업무 자동화 AI 에이전트 플랫폼입니다.
1. 보안 우려에는 배포 방식의 선택권으로 대응합니다.
100% 온프레미스, 그리고 하이브리드 환경을 모두 지원합니다. 그리고 비정형 데이터 안에 섞여 있는 개인정보·등의 민감정보는 자동으로 마스킹 처리할 수 있습니다.
2. 기술 장벽에는 비정형 데이터 처리 범위 확장으로 대응합니다.
단순 반복 업무를 포함하여 사진, 스캔 문서 같은 비정형 데이터까지 처리하여 업무 자동화를 실현할 수 있습니다. 평균적으로 99%의 신뢰도로 비정형 데이터를 처리하고, 나머지는 사람이 최종 검수하는 구조입니다.
대량으로 쌓여있는 인물 사진 중, 중복 건이나 규격에 맞지 않는 사진이 섞여 있었습니다. 이를 담당자가 일일이 눈으로 확인하며 분류해야 했지만, 이 작업을 Bizwork가 얼굴인식 자동화를 구축하였습니다.
항목
결과
처리한 사진 수
128,543장
AI 자동 검증률
99.4%
사람이 직접 확인해야 했던 비율
0.6%
수만 장의 사진을 사람이 하나하나 눈으로 확인해야 했던 작업을 AI가 99.4%를 자동으로 판별하고, 사람은 나머지 0.6%만 검토하면 되는 구조로 만들었습니다.
비정형 데이터 활용률이 18%에 머무는 이유는 기술 장벽, 검수 부담, 보안 우려 세 가지가 겹치기 때문입니다. 2026년 업계 흐름은 "폐쇄망이냐 클라우드냐"의 이분법이 아니라 데이터 민감도별 하이브리드 배포로 옮겨가고 있습니다. Bizwork는 온프레미스와 클라우드를 함께 지원하고 민감정보는 자동 마스킹하며, 정형 업무를 넘어 사진·문서 같은 비정형 데이터까지 자동화 범위를 넓힙니다. 실제 사례에서 128,543장의 사진을 99.4% AI 자동 검증률로 처리한 결과가 이를 뒷받침합니다.
비정형 데이터 자동화는 이제 기술적으로 불가능한 일이 아닙니다. 관건은 검수 부담과 보안 우려, 두 가지 장벽을 어떻게 넘느냐였습니다. Bizwork는 신뢰도 기반 처리로 검수 부담을 줄이고, 온프레미스·하이브리드 배포로 보안을 지키면서 이 두 가지에 함께 대응합니다.
AWS 기술 블로그, "Bedrock Data Automation과 GraphRAG로 비정형 데이터 인사이트 강화하기", https://aws.amazon.com/ko/blogs/tech/bedrock-data-automation-graphrag/
IBM, "정형 데이터와 비정형 데이터 비교: 차이점은 무엇인가요?", https://www.ibm.com/kr-ko/think/topics/structured-vs-unstructured-data
Databricks 블로그, "정형 데이터와 비정형 데이터: 주요 차이점 이해하기", https://www.databricks.com/kr/blog/structured-vs-unstructured-data
지티티코리아, "비정형 데이터 90% 시대...지능형 문서 처리 시장 급성장", https://www.gttkorea.com/news/articleView.html?idxno=25148
MIT 테크놀로지 리뷰 코리아, "세일즈포스, 한국 기업 데이터 활용 현황 조사…84% 인식, 61% 실행 난항", https://www.technologyreview.kr/deeptech/세일즈포스-한국-기업-데이터-활용-현황-조사84-인식/
IBM "AI 시대의 개인정보 보호 문제 살펴보기", https://www.ibm.com/kr-ko/think/insights/ai-privacy
아이티데일리, "로민 문서 AI, 정확도 아닌 자동화율로 봐야", https://www.itdaily.kr/news/articleView.html?idxno=240872
로민 공식 블로그, "업무 자동화율이란? 정확도 99%로도 업무 시간이 줄어들지 않는 이유", https://blog.lomin.ai/document-automation-rate
아이티데일리, "국내 기업 64%, LLM 도입 시 민감 데이터 유출 우려", https://www.itdaily.kr/news/articleView.html?idxno=230782
알약 블로그, "설문조사 통계로 알아본 생성형 AI 시대, 기업 보안의 현실과 해법", https://blog.alyac.co.kr/5517
windyflo 블로그, "온프레미스 AI 에이전트 보안 완전 가이드 — 데이터 유출 걱정 없이 도입하는 2026 체크리스트", https://blog.windyflo.com/blog/on-premise-ai-agent-security/
Open Network System, "온프레미스 AI란 무엇일까? 사내 데이터를 지키며 AI를 도입하려는 기업을 위한 망분리 가이드", https://open-network.co.kr/blog/onprem-ai-explainer