기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
문서 분석
Amazon Textract는 문서와 양식을 분석하여 감지된 텍스트 간의 관계를 확인합니다. Amazon Textract 분석 작업은 텍스트, 양식, 테이블, 쿼리 응답, 서명 등 5가지 범주의 문서 추출을 반환합니다. 인보이스 및 영수증 분석은 다른 프로세스를 통해 처리됩니다. 자세한 내용은 섹션을 참조하세요인보이스 및 영수증 분석.
텍스트 추출
문서에서 추출된 원시 텍스트입니다. 자세한 내용은 텍스트의 줄 및 단어를 참조하세요.
양식 추출
양식 데이터는 문서에서 추출된 텍스트 항목에 연결됩니다. Amazon Textract는 양식 데이터를 키-값 페어로 나타냅니다.
다음 예제에서 Amazon Textract에서 감지한 텍스트 줄 중 하나는 이름: Jane Doe입니다. Amazon Textract는 키(이름:)와 값(Jane Doe)도 식별합니다. 자세한 내용은 양식 데이터(키-값 페어)를 참조하세요.
이름: Jane Doe
주소: 123 Any Street, Anytown, USA
생년월일: 12-26-1980
키-값 페어는 양식에서 추출된 확인란 또는 옵션 버튼(라디오 버튼)을 나타내는 데도 사용됩니다.
남성: ☑
자세한 내용은 선택 요소를 참조하세요.
테이블 추출
Amazon Textract는 테이블, 테이블 셀, 테이블 셀 내의 항목, 테이블 제목 및 바닥글, 테이블 유형을 추출할 수 있습니다. 결과를 JSON, CSV 또는 TXT 파일로 반환하도록 Amazon Textract를 프로그래밍할 수도 있습니다.
| 이름 | 주소 |
|---|---|
|
Ana Carolina |
123 모든 타운 |
자세한 내용은 테이블을 참조하십시오. 테이블에서 선택 요소를 추출할 수도 있습니다. 자세한 내용은 선택 요소를 참조하세요.
문서 분석의 서명
Amazon Textract는 텍스트 문서에서 서명 위치를 감지할 수 있습니다. 이는 서명이 해당 위치에 있다는 확신과 함께 페이지에 서명 위치를 제공하는 경계 상자가 있는 지오메트리 객체로 반환됩니다. 서명 기능을 단독으로 사용하는 경우 Amazon Textract는 서명과 표준 텍스트 감지 결과를 모두 반환합니다. 서명 감지는 양식, 테이블 및 쿼리와 같은 다른 기능 유형과 함께 사용할 수 있습니다. 양식 및 테이블과 함께 사용할 때 서명은 각각 키-값 페어의 일부로 또는 테이블 셀 내에서 감지할 수 있습니다.
문서 분석의 쿼리
Amazon Textract로 문서를 처리할 때 분석에 쿼리를 추가하여 필요한 정보를 지정할 수 있습니다. 여기에는 "고객의 사회보장번호는 무엇입니까?"와 같은 질문 전달이 포함됩니다. Amazon Textract로. 그러면 Amazon Textract는 문서에서 해당 질문에 대한 정보를 찾아 나머지 문서 정보와 별도의 응답 구조로 반환합니다. 이 응답 구조에 대한 자세한 내용은 쿼리 응답 구조를 참조하세요. 쿼리 사용 모범 사례에 대한 자세한 내용은 섹션을 참조하세요쿼리 모범 사례. 쿼리는 단독으로 처리하거나 테이블 또는 양식FeatureType과 같은 다른와 조합하여 처리할 수 있습니다.
쿼리 예제: 고객의 SSN은 무엇입니까?
예제 답변: 111-xx-333
분석된 항목의 경우 Amazon Textract는 여러 블록 객체에서 다음을 반환합니다.
-
감지된 텍스트의 줄과 단어
-
감지된 항목의 콘텐츠
-
감지된 항목 간의 관계
-
항목이 감지된 페이지
-
문서 페이지의 항목 위치
사용자 지정 쿼리
Amazon Textract 문서 분석을 사용하면 자체 문서에 대해 훈련된 어댑터를 통해 모델 출력을 사용자 지정할 수 있습니다. 어댑터는 Amazon Textract 사전 훈련된 딥 러닝 모델에 연결하여 비즈니스별 문서에 맞게 출력을 사용자 지정하는 구성 요소입니다. 샘플 문서에 주석을 달거나 레이블을 지정하고 주석이 달린 샘플에서 어댑터를 훈련하여 특정 사용 사례에 맞는 어댑터를 생성합니다.
어댑터를 생성한 후 Amazon Textract는 AdapterId를 제공합니다. 단일 어댑터 내에 여러 어댑터 버전을 사용할 수 있습니다. AdapterVersion과 함께 AdapterId를 작업에 제공하여 생성한 어댑터를 사용하도록 지정할 수 있습니다. 예를 들어 동기 문서 분석을 위해 AnalyzeDocument API에 두 파라미터를 제공하거나 비동기 분석을 위해 StartDocumentAnalysis 작업을 제공합니다. 요청의 일부로 AdapterId를 제공하면 어댑터가 분석 프로세스에 자동으로 통합되고 이를 사용하여 문서에 대한 예측을 개선합니다. 이렇게 하면 AnalyzeDocument의 기능을 활용하는 동시에 자체 사용 사례에 맞게 모델을 사용자 지정할 수 있습니다.
어댑터 생성 및 사용에 대한 자세한 내용은 쿼리 응답 사용자 지정 섹션을 참조하세요. 에서 어댑터를 생성, 훈련 및 사용하는 방법에 대한 자습서는 섹션을 AWS Management Console참조하세요사용자 지정 쿼리 자습서.
문서 분석의 레이아웃
Amazon Textract를 사용하여 다양한 요소의 위치와 관련 텍스트 줄을 찾아 문서의 레이아웃을 감지할 수 있습니다. 이러한 요소는 단락, 목록, 헤더, 바닥글, 페이지 번호, 그림, 테이블, 제목 및 섹션 헤더입니다. 문서의 레이아웃을 분석할 때 Amazon Textract는 레이아웃 요소의 경계 상자 위치와 해당 요소의 텍스트를 반환합니다. 이 정보는 문서의 암시적 읽기 순서로 반환되어 위에서 아래로, 왼쪽에서 오른쪽으로 요소를 나열합니다.
동기 또는 비동기 작업을 사용하여 문서의 텍스트를 분석할 수 있습니다. 텍스트를 동기적으로 분석하려면 AnalyzeDocument 작업을 사용하고 문서를 입력으로 전달합니다.는 전체 결과 세트를 AnalyzeDocument 반환합니다. 자세한 내용은 Amazon Textract로 문서 텍스트 분석 단원을 참조하십시오.
텍스트를 비동기적으로 감지하려면 StartDocumentAnalysis를 사용하여 처리를 시작합니다. 결과를 얻으려면 GetDocumentAnalysis를 호출합니다. 결과는에서 하나 이상의 응답으로 반환됩니다GetDocumentAnalysis. 자세한 내용과 예제는 다중 페이지 문서에서 텍스트 감지 또는 분석 섹션을 참조하세요.
수행할 분석 유형을 지정하려면 FeatureTypes 목록 입력 파라미터를 사용할 수 있습니다. 목록에 테이블을 추가하여 테이블 셀, 셀 텍스트, 셀의 선택 요소 등 입력 문서에서 감지된 테이블에 대한 정보를 반환합니다. FORMS를 추가하여 키-값 페어 및 선택 요소와 같은 단어 관계를 반환합니다. 쿼리를 추가하여 Amazon Textract가 문서에서 찾고 질문-응답 쌍의 형태로 응답을 다시 받을 정보를 지정합니다. LAYOUT을 추가하여 문서의 레이아웃을 결정합니다. 모든 유형의 분석을 수행하려면에 TABLES, FORMS, QUERIES 및 LAYOUT을 추가합니다FeatureTypes.
문서에서 감지된 모든 줄과 단어는 응답에 포함됩니다( 값과 관련이 없는 텍스트 포함FeatureTypes).