· AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI Testing· Data Validation
AI Ready 데이터 검증· Software Testing
SW Testing언어(Language)
정보추출
OCR

N사는 인쇄 복합 문서 원문 PDF를 온라인 기사 데이터로 자동 전환하는 AI 서비스를 개발하고 있었습니다. 어려운 점은 오류가 한 단계에 그치지 않고 다음 단계로 이어진다는 데 있었습니다. 텍스트 인식이 틀리면 기사 내용 자체가 달라지고, 레이아웃 인식이 부정확하면 제목과 본문, 이미지와 캡션, 광고와 기사 영역이 뒤섞일 수 있습니다.
문장 연결이 어긋나면 단락 흐름이 깨지고, 카테고리 분류가 잘못되면 기사 탐색 품질에도 영향을 줍니다. 최종 결과만으로 품질을 판단하면 어느 단계에서 문제가 발생했는지 알 수 없어 개선 방향을 잡기 어려웠습니다.
와이즈스톤은 전환 과정을 텍스트 인식, 지면 구조 인식, 문장 흐름 복원, 기사 분류 네 단계로 나누어 검증했습니다. OCR 품질은 인쇄 복합 문서 원문에서 추출한 단락 이미지를 대상으로, AI가 반환한 문자열을 정답 데이터와 비교해 텍스트 일치 비율을 산출했습니다.
레이아웃 인식은 인쇄 복합 문서 원문 이미지를 대상으로 제목·본문·이미지·캡션·광고·표 등 다수의 지면 구성 요소에 대해 AI가 검출한 영역과 정답 영역의 중첩도(IoU)를 기준으로 일치 여부를 판정했습니다. 문장 연결성은 지면 배치로 인해 분리된 문장쌍을 문장 연결성 인식 모델에 입력해 연결 판단 결과를 정답 데이터와 비교했습니다.
뉴스 카테고리 분류는 정치·경제·사회 등 주요 카테고리를 기준으로 AI의 분류 결과와 정답 데이터를 비교해 분류 정확도를 산출했습니다.
৹ 인쇄 복합 문서 단락 이미지의 텍스트 인식 정확도
৹ 인쇄 복합 문서 원문 이미지의 레이아웃(지면 구성 요소) 인식 정확도
৹ 분리된 문장쌍의 연결성 판단 결과
৹ 뉴스 카테고리 분류 정확도
N사는 이번 검증을 통해 인쇄 복합 문서 PDF를 기사 데이터로 전환하는 과정의 각 단계가 목표 수준으로 동작하고 있음을 확인했습니다. 와이즈스톤은 전체 결과뿐 아니라 단계별 성능을 함께 점검함으로써, 문서 자동화 기술이 실제 서비스 환경에서도 안정적으로 활용될 수 있는지를 검증했습니다.