Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Synchronisation d’une source de données
Après avoir créé votre base de connaissances, vous devez ingérer ou synchroniser vos données afin qu’elles puissent être interrogées. L'ingestion convertit les données brutes de votre source de données en intégrations vectorielles.
Avant de commencer l’ingestion, vérifiez que votre source de données remplit les conditions suivantes :
-
Vous avez configuré les informations de connexion pour votre source de données. Reportez-vous à la section Connecter une source de données. Vous configurez votre source de données dans le cadre de la création de votre base de connaissances.
-
Vous avez configuré le modèle d'intégration vectorielle que vous avez choisi. Consultez les modèles d'intégration vectorielle pris en charge. Vous configurez vos vectorisations dans le cadre de la création de votre base de connaissances.
-
Le format des fichiers est pris en charge. Pour plus d'informations, consultez la section Formats de document pris en charge.
-
Les fichiers ne dépassent pas la taille du fichier de tâche d'ingestion spécifiée dans Quotas de service et quotas de la référence AWS générale.
Chaque fois que vous ajoutez, modifiez ou supprimez des fichiers de votre source de données, vous devez synchroniser cette dernière afin qu’elle soit réindexée dans la base de connaissances. La synchronisation étant incrémentielle, Amazon Bedrock ne traite que les documents ajoutés, modifiés ou supprimés depuis la dernière synchronisation.
Pour découvrir comment intégrer vos données dans votre base de connaissances et les synchroniser avec vos données les plus récentes, choisissez l’onglet correspondant à votre méthode préférée, puis suivez les étapes :
- Console
-
Pour intégrer vos données dans votre base de connaissances et les synchroniser avec vos données les plus récentes
-
Connectez-vous à Amazon Bedrock AgentCore > Built-in Outils > Base de connaissances Console de gestion AWS et accédez à Amazon Bedrock.
-
Choisissez votre base de connaissances.
-
Dans la section Source de données, sélectionnez Synchroniser pour commencer l’ingestion de données ou la synchronisation avec vos données les plus récentes. Pour arrêter une source de données en cours de synchronisation, sélectionnez Arrêter. Une source de données doit être en cours de synchronisation pour arrêter la synchronisation de la source de données. Vous pouvez sélectionner à nouveau Synchroniser pour ingérer le reste de vos données.
-
Lorsque l’ingestion de données est terminée, une bannière verte apparaît en cas de réussite.
-
Vous pouvez choisir une source de données pour afficher son historique de synchronisation. Sélectionnez Afficher les avertissements pour savoir pourquoi une tâche d’ingestion de données a échoué.
- API
-
Pour intégrer vos données dans votre base de connaissances et les synchroniser avec vos données les plus récentes, envoyez une StartIngestionJob demande auprès d'un point de terminaison Agents for Amazon Bedrock build-time. Spécifiez knowledgeBaseId et dataSourceId. Vous pouvez également arrêter une tâche d'ingestion de données en cours d'exécution en envoyant une StopIngestionJob demande. Spécifiez dataSourceId, ingestionJobId et knowledgeBaseId. Une tâche d’ingestion de données doit être en cours d’exécution pour arrêter l’ingestion de données. Vous pouvez envoyer à nouveau une demande StartIngestionJob pour ingérer le reste de vos données lorsque vous serez prêt.
Utilisez les informations ingestionJobId renvoyées dans la réponse d'une GetIngestionJob demande avec un point de terminaison Agents for Amazon Bedrock au moment de la création afin de suivre l'état de la tâche d'ingestion. Spécifiez également knowledgeBaseId et dataSourceId.
-
Lorsque la tâche d’ingestion est terminée, l’élément status de la réponse indique COMPLETE.
-
L’objet statistics de la réponse renvoie des informations indiquant si l’ingestion a réussi ou non pour les documents dans la source de données.
Vous pouvez également consulter les informations relatives à toutes les tâches d'ingestion pour une source de données en envoyant une ListIngestionJobs demande auprès d'un point de terminaison Agents for Amazon Bedrock au moment de la création. Spécifiez le dataSourceId et le knowledgeBaseId de la base de connaissances dans laquelle les données sont ingérées.
-
Filtrez les résultats en spécifiant le statut à rechercher dans l’objet filters.
-
Pour effectuer un tri en fonction de l’heure à laquelle la tâche a été lancée ou du statut d’une tâche, spécifiez l’objet sortBy. Vous pouvez spécifier un ordre de tri croissant ou décroissant.
-
Spécifiez le nombre maximum de résultats à renvoyer en réponse dans le champ maxResults. Si le nombre de résultats est supérieur à ce que vous avez défini, la réponse renvoie un nextToken que vous pouvez envoyer dans une autre demande ListIngestionJobs afin de voir le lot suivant de tâches.
Définir un calendrier de synchronisation pour une source de données
Au lieu de démarrer manuellement une synchronisation chaque fois que votre contenu est modifié, vous pouvez définir un calendrier de synchronisation afin qu'Amazon Bedrock synchronise automatiquement une source de données à une fréquence récurrente. Les synchronisations planifiées permettent de maintenir votre base de connaissances à jour sans action manuelle. Vous définissez le calendrier de synchronisation lorsque vous connectez une source de données et vous pouvez le modifier ultérieurement en modifiant la source de données.
Vous pouvez choisir l'une des fréquences suivantes :
- On-demand
-
Le contenu est synchronisé uniquement lorsque vous démarrez une synchronisation manuellement. Aucune planification automatique n'est effectuée. Il s'agit de la fréquence par défaut.
- Chaque jour
-
Le contenu est synchronisé une fois par jour à une heure programmée automatiquement, qui peut varier.
- Hebdomadaire
-
Le contenu est synchronisé une fois par semaine, le jour de la semaine que vous spécifiez, à une heure planifiée automatiquement.
- Mensuel
-
Le contenu est synchronisé une fois par mois, le jour du mois que vous spécifiez, à une heure planifiée automatiquement. Choisissez un jour spécifique entre 1 et 28, ou choisissez la fin du mois.
Pour définir un calendrier de synchronisation pour une source de données, choisissez l'onglet correspondant à votre méthode préférée, puis procédez comme suit :
- Console
-
Lorsque vous connectez une source de données ou que vous modifiez une source de données existante, recherchez la section Calendrier de synchronisation et choisissez une fréquence :
-
Si vous choisissez Hebdomadaire, sélectionnez le jour de la semaine où la synchronisation s'exécute.
-
Si vous choisissez Mensuel, sélectionnez un jour spécifique du mois (1 à 28) ou sélectionnez la fin du mois.
Pour plus d'informations sur la connexion d'une source de données, voir Connecter une source de données.
- API
-
Pour définir un calendrier de synchronisation avec l'API, un AWS SDK ou le AWS CLI, incluez un syncSchedule objet dans managedKnowledgeBaseConnectorConfiguration (dansdataSourceConfiguration) lorsque vous envoyez un CreateDataSource ou une UpdateDataSource demande avec un point de terminaison Agents for Amazon Bedrock au moment de la création. Pour utiliser la synchronisation à la demande, syncSchedule omettez.
DanssyncSchedule, spécifiez exactement l'un des champs de fréquence suivants :
-
daily— Un objet vide ({}). Le contenu est synchronisé une fois par jour à une heure creuse choisie par le système.
-
weekly— Un objet avec un dayOfWeek champ obligatoire. Les valeurs valides sont SUNDAY, MONDAY, TUESDAY, WEDNESDAY, THURSDAY, FRIDAY et SATURDAY.
-
monthly— Un objet avec un dayOfMonth champ obligatoire. DansdayOfMonth, spécifiez exactement l'une des options suivantes :
-
dayNumber— Un jour précis du mois, du 1 au28.
-
lastDayOfMonth— Un objet vide ({}) qui exécute la synchronisation le dernier jour calendaire de chaque mois.
L'exemple suivant montre un programme dataSourceConfiguration qui planifie une synchronisation hebdomadaire le lundi :
"dataSourceConfiguration": {
"type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR",
"managedKnowledgeBaseConnectorConfiguration": {
"connectorParameters": {
"type": "CONNECTOR_TYPE",
"version": "1"
},
"syncSchedule": {
"weekly": {
"dayOfWeek": "MONDAY"
}
}
}
}
Pour effectuer une synchronisation le 15 de chaque mois, remplacez la syncSchedule valeur par la suivante :
"syncSchedule": {
"monthly": {
"dayOfMonth": {
"dayNumber": 15
}
}
}
Une fois que vous avez défini un calendrier, Amazon Bedrock exécute les synchronisations automatiquement à la fréquence que vous avez choisie. Vous pouvez toujours démarrer une synchronisation manuelle à tout moment. Pour suivre les tâches de synchronisation planifiées et manuelles, consultez l'historique de synchronisation sur la page des détails de la source de données. Pour plus d'informations, voir Afficher les informations sur les sources de données pour votre base de connaissances Amazon Bedrock.