View a markdown version of this page

连接 Confluence 数据中心数据源 - Amazon Bedrock

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

连接 Confluence 数据中心数据源

设置 VPC 连接并将证书存储在 AWS Secrets Manager 密钥中后,请在知识库中创建 Confluence 数据中心数据源。本页介绍如何使用 AWS 管理控制台 或 API 创建数据源,然后介绍您可以配置的连接器参数。

注意

首先完成 VPC 配置和身份验证设置。请参阅为数据源配置 VPC 连接和为 Confluence 数据中心设置基本或 PAT 身份验证。你需要 VPC 配置 ID 和秘密 ARN。

创建数据源

Console
将 Confluence 数据中心连接到您的托管知识库
  1. 在 “数据源” 下,为您的数据源提供一个名称。

  2. 从数据源下拉列表中选择 Confluence 数据中心。

  3. 在 VPC 配置下,选择到达您的 Confluence 数据中心实例的 VPC 配置,或选择添加 VPC 配置来创建一个。有关更多信息,请参阅 为数据源配置 VPC 连接。

  4. (可选)在应用程序上下文路径下,输入提供 Confluence 数据中心 REST API 的内容路径(例如,/wiki)。如果 REST API 是在 Web 根目录下提供的,则将其留空。

  5. (可选,仅限 HTTPS)在 TLS 证书下,为您的 Confluence 数据中心实例提供 TLS 证书的 Amazon S3 URI。

  6. 在 “身份验证” 下,选择 “基本身份验证” 或 “个人访问令牌”,然后选择保存匹配凭据的 AWS Secrets Manager 密钥。

  7. (可选)扩展同步范围以选择要抓取的实体类型(页面、页面附件、博客、博客附件、个人空间)。

  8. (可选)扩展实体 URL 以使用 URL-based 筛选来同步特定的 Confluence 空间、页面和博客。

  9. (可选)扩展 MIME 类型以包括或排除特定的 MIME 类型。

API

要创建 Confluence 数据中心数据源,请使用 Agents for Amazon Bedrock 构建时终端节点发送CreateDataSource请求。以下 AWS Command Line Interface 示例创建了一个使用基本身份验证的数据源。要改用个人访问令牌,请更改authType为PERSONAL_TOKEN。有关每个字段的描述,请参阅随后的连接器参数参考。

aws bedrock-agent create-data-source \ --name "Confluence-DataCenter-connector" \ --knowledge-base-id "your-knowledge-base-id" \ --data-source-configuration file://confluence-onprem-connector.json

该confluence-onprem-connector.json文件包含以下内容:

{ "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "connectorParameters": { "type": "CONFLUENCEONPREM", "version": "1", "aclEnabled": false, "connectionConfiguration": { "authType": "BASIC", "secretArn": "arn:aws:secretsmanager:us-west-2:123456789012:secret:bedrock-confluence-onprem-creds", "contextPath": "/wiki", "vpcConfiguration": { "vpcConfigurationId": "your-vpc-configuration-id" }, "certificateS3Path": { "s3BucketName": "my-cert-bucket", "s3KeyName": "confluence-dc-cert.pem" } }, "dataEntityConfiguration": { "crawlPage": true, "crawlBlog": true, "crawlPageAttachment": true, "crawlBlogAttachment": true }, "filterConfiguration": { "inclusionSpaceUrls": ["https://confluence.example.com/spaces/ENG/"] } } } }

对于托管知识库,CreateDataSource是异步的:操作完成后,数据源状态从过渡CREATING到AVAILABLE。

连接器参数

数据源配置使用以下连接器参数。要连接到 Confluence 数据中心,请将输入指定CONFLUENCEONPREM为连接器。connectorParameters有关换行字段connectorParameters(例如deletionProtectionConfiguration和mediaExtractionConfiguration),请参阅连接数据来源。

connectionConfiguration
字段 必填 描述
authType 是 身份验证类型。设置为BASIC或PERSONAL_TOKEN。请参阅身份验证方法。
secretArn 是 包含您的 Confluence 数据中心凭证的机 AWS Secrets Manager 密的 ARN。
vpcConfiguration 是 您的 Confluence 数据中心实例的私有网络路径。包含一个设置为知识库中 VPC 配置的 ID 的vpcConfigurationId字段。请参阅 为数据源配置 VPC 连接。
contextPath 否 提供 Confluence 数据中心 REST API 的应用程序上下文路径(例如,/wiki)。如果 REST API 是在 Web 根目录下提供的,则将其省略。
certificateS3Path 否 您的 Confluence 数据中心实例的 TLS 证书的位置,在您通过 HTTPS 进行连接时使用。包含s3BucketName和s3KeyName。
数据EntityConfiguration (可选)
字段 必填 说明
crawlPage 否 是否抓取页面。
crawlBlog 否 是否抓取博客文章。
crawlPageAttachment 否 是否抓取页面附件。只有当也crawlPagetrue是,才会爬行。
crawlBlogAttachment 否 是否抓取博客文章附件。只有当也crawlBlogtrue是,才会爬行。
crawlPersonalSpace 否 是否爬行个人空间。
注意

与 Confluence Cloud 不同,Confluence 数据中心不支持抓取存档空间或存档页面。

过滤器配置(可选)
字段 必填 说明
inclusionSpaceUrls 否 要包含的空格 URL。
inclusionPageUrls 否 要包含的页面网址。
inclusionMimeTypes 否 要包括的 MIME 类型。
exclusionMimeTypes 否 要排除的 MIME 类型。
maxFileSizeInMegaBytes 否 连接器接收的任何单个文件的最大大小(以兆字节为单位)。以数字字符串形式提供(例如,"50")。

更改身份验证方法

您可以使用UpdateDataSource操作或,使用新的authType和包含匹配凭据的密钥更新数据源,从而更改数据源的身份验证方法(例如,从 Basic 到个人访问令牌) AWS 管理控制台。

后续步骤

创建数据源后,将其同步以将内容摄取到您的知识库中。有关详细信息,请参阅同步数据来源。