AKUODIGITAL Intelligence
AI Insight Case Study UseCase Product 무료 데모 신청
AI Insight

표 한 장은 어떻게 행·열로 복원될까|VLM 표 인식 뜯어보기

표는 글자를 읽는 문제가 아니라 구조를 복원하는 문제입니다. 괘선 없는 양식·병합 셀·페이지 분리에서 기존 OCR이 멈추는 지점을 짚고, 비전 언어 모델(VLM)이 표를 다르게 읽는 방식과 그 대가로 감수한 설계 선택을 정리했습니다.
악어디지털's avatar
악어디지털
Aug 18, 2026
표 한 장은 어떻게 행·열로 복원될까|VLM 표 인식 뜯어보기
Contents
표 인식은 왜 텍스트 추출보다 어려울까?기존 방식이 표에서 멈추는 지점비전 언어 모델(VLM)은 표를 어떻게 볼까?설계에서 감수한 세 가지지금도 어려운 표와 대응 방식

표가 들어간 PDF를 OCR(광학 문자 인식)에 넣었더니 숫자 순서가 뒤섞여 나온 적 있으신가요? 거래명세서 한 장을 떠올려 보겠습니다. 사람은 품목 행과 단가 열이 만나는 칸을 곧바로 찾습니다. 하지만, 시스템에게 그 칸은 좌표가 붙은 글자 뭉치일 뿐입니다. 글자는 멀쩡히 읽히는데 표만 무너지는 것. 인식률이 낮아서가 아니라 표는 구조를 복원하는 문제이기 때문입니다.

💡

표 인식(Table Extraction)이란?

문서 이미지에서 표의 경계와 행·열·셀 관계를 복원해, 각 값의 행·열 소속까지 구조화하는 처리입니다. 글자만 읽어 내는 텍스트 추출과는 목표가 다릅니다.

표 인식은 왜 텍스트 추출보다 어려울까?

텍스트 추출은 정답이 하나지만, 표는 정답 후보가 여러 개로 갈리기 때문입니다.

  • 선 없는 표 : 여백만으로 열을 나눈 양식이 많아, 열 경계를 추정해야 합니다.

  • 병합 셀 : 그룹 명이 세 행을 덮고 있으면, 아래 두 행이 어느 그룹 소속인지 따로 판단해야 합니다.

  • 줄바꿈 : 품목명이 길어 두 줄로 접히면 한 행이 두 행처럼 보입니다.

  • 페이지 분리 : 표가 다음 장으로 이어질 때 머리글이 반복되기도, 생략되기도 합니다.

기존 방식이 표에서 멈추는 지점

기존 OCR 파이프라인은 이미지 보정, 글자 영역 검출, 문자 인식, 후처리 규칙 적용으로 단계가 나뉘어 있습니다. 각 단계는 앞 단계의 출력만 받습니다.

문제는 구조 판단이 마지막 후처리로 밀린다는 점입니다. 이때 남는 정보는 글자와 좌표뿐이라, 행과 열을 다시 세우려면 "x좌표가 20픽셀 안이면 같은 열" 같은 임계값 규칙에 기대게 됩니다.

임계값은 양식 하나에는 잘 맞지만 거래처가 바뀌어 열 간격이 좁아지면 그대로 어긋납니다. 양식마다 규칙을 다시 잡는 작업이 반복되는 이유이자, 지능형 문서 처리(IDP)라는 개념이 나온 배경입니다.

비전 언어 모델(VLM)은 표를 어떻게 볼까?

VLM(비전 언어 모델)은 이미지와 텍스트를 하나의 모델 안에서 함께 처리하는 인공지능 모델로 문서를 글자 단위로 분해하기 전에, 페이지의 배치와 문맥을 시각 정보 그대로 해석합니다. 즉, 글자를 읽기 전에 페이지 전체를 한 번에 보고, 의미와 배치를 함께 판단하게 됩니다.

차이는 판단 순서에 있습니다. 단계형 파이프라인은 글자를 읽은 뒤 구조를 추정하지만, VLM은 구조를 본 상태에서 글자를 읽습니다. 즉, 열 머리글이 '단가'라는 사실과 아래 칸의 숫자 형식이 동시에 근거가 됩니다.

선이 없어도 열이 잡히는 이유가 여기 있습니다. 선 대신 값들이 같은 성격으로 줄지어 있다는 점을 근거로 삼습니다. 병합 셀의 빈칸도 오류가 아니라 위쪽 값의 적용 범위로 봅니다. 참고로, 페이퍼스고 AI에서는 이 판단이 AI 위자드 기능으로 이어집니다.

용어

정의

읽기 순서(Reading Order)

페이지 요소를 사람이 읽는 순서로 나열한 결과

셀 병합(Merged Cell)

둘 이상의 행이나 열을 하나로 묶은 칸

헤더 계층

대분류 아래 소분류가 붙은 2단 이상 머리글 구조

앵커(Anchor)

값의 위치를 특정할 때 기준으로 삼는 고정 문구

설계에서 감수한 세 가지

1. 연산량

페이지 전체를 시각적으로 해석하는 방식은 글자 영역만 잘라 쓰는 방식보다 무겁습니다. 대신, 양식별 규칙 정비 공수가 사라지게 됩니다.

2. 결정성

규칙 기반은 같은 입력에 늘 같은 출력을 냅니다. 모델 기반은 애매한 입력에서 판단이 흔들릴 수 있죠. 그래서 신뢰도가 낮은 셀은 사람 확인 경로를 기본값으로 둡니다.

3. 설명 가능성

왜 이 값을 여기에 넣었는지 규칙처럼 한 줄로 보여 주기 어렵습니다. 대신 추출값마다 원본 좌표를 함께 반환합니다.

지금도 어려운 표와 대응 방식

  • 3단 이상 헤더 계층 대·중·소분류가 겹친 통계 양식

  • 손글씨로 덧붙인 행 표의 일부인지 메모인지 모호한 경우

  • 회전·굴곡 스캔 제본된 장부를 펼쳐 찍어 열이 휘어 보이는 이미지

  • 수십 페이지로 이어지는 표 페이지 간 연결에 오차가 쌓이는 구간

아직 검토가 필요한 구간은 네 가지, 대응은 두 갈래입니다. 신뢰도 미달 항목만 검수 대기열로 보내거나, 원본 품질을 끌어올리는 방식입니다. 종이 원본이라면 문서 전자화 BPO에서 스캔·검수를 거쳐 그대로 이어집니다.

비정형 문서 20종 자체 검증 기준으로 추출 정확도는 98%에 가까우나, 문서 종류와 원본 상태에 따라 달라지니, 실제 양식으로 확인해 보시는 편이 정확합니다.

그리고 추출 결과는 API 형태로 활용이 가능하기 때문에 ERP 발주 화면이나 RPA 로봇, AI 에이전트에 중간 파일 없이 붙고, 데이터 반출이 어려운 환경에서는 온프레미스로 구축할 수 있습니다.

🔖

About Papers GO AI

Papers GO AI는 비정형 문서를 구조화된 디지털 데이터로 자동 변환하는 VLM 기반 AI-OCR 플랫폼입니다. 손글씨, 팩스, 영수증처럼 형태가 제각각인 문서도 샘플 한 건만 업로드하면 AI 위자드가 추출 템플릿을 자동으로 생성합니다. 분류·추출·검수, 그리고 시스템 연동까지 전 과정을 하나의 플랫폼에서 완성합니다.

서비스 자세히 보기

Share article
Contents
표 인식은 왜 텍스트 추출보다 어려울까?기존 방식이 표에서 멈추는 지점비전 언어 모델(VLM)은 표를 어떻게 볼까?설계에서 감수한 세 가지지금도 어려운 표와 대응 방식

©2026 AKUODIGITAL All Right Reserved.

RSS·Powered by Inblog