Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Strategien zur Wiederholung von Serviceaufträgen in AWS Batch
Strategien zur Wiederholung von Serviceaufträgen ermöglichen es AWS Batch , fehlgeschlagene Serviceaufträge unter bestimmten Bedingungen automatisch zu wiederholen.
Serviceaufträge können aus verschiedenen Gründen mehrere Versuche erfordern:
-
Vorübergehende Serviceprobleme: Interne Servicefehler, Drosselung oder vorübergehende Ausfälle können dazu führen, dass Jobs bei der Übermittlung oder Ausführung fehlschlagen.
-
Fehler bei der Initialisierung des Trainings: Probleme beim Starten des Jobs, wie Probleme beim Abrufen von Bildern oder Initialisierungsfehler, können beim erneuten Versuch behoben werden.
Durch die Konfiguration geeigneter Strategien für Wiederholungsversuche können Sie die Erfolgsquote bei der Arbeit erhöhen und den Bedarf an manuellen Eingriffen verringern, insbesondere bei lang andauernden Trainingslasten.
Anmerkung
Wenn ein SageMaker Schulungsauftrag aufgrund unzureichender Kapazität fehlschlägt, wird der Auftrag automatisch AWS Batch wiederholt, bis die Kapazität verfügbar ist. Der letzte SageMaker Schulungsauftrag, der aufgrund unzureichender Kapazität fehlgeschlagen ist, wird beibehalten. Frühere SageMaker Schulungsaufträge, die aufgrund unzureichender Kapazität fehlgeschlagen sind, werden nach bestem Bemühen gelöscht.
Diese kapazitätsbasierten Wiederholungsversuche verbrauchen Ihre konfigurierten Wiederholungsversuche nicht. Ihre Wiederholungsstrategie behandelt in erster Linie andere Arten von Fehlern, wie Algorithmusfehler oder Serviceprobleme, die auftreten, nachdem ein Job in `STARTING` eingegeben wird.
Konfiguration von Wiederholungsstrategien
Strategien zur Wiederholung von Serviceaufträgen werden mithilfe von ServiceJobRetryStrategy konfiguriert. Dieses Programm unterstützt sowohl die Anzahl einfacher Wiederholungen als auch die Logik bedingter Wiederholungen.
Wiederholungs-Konfiguration
Die einfachste Wiederholungsstrategie gibt die Anzahl der Wiederholungsversuche an, die unternommen werden sollten, wenn ein Serviceauftrag fehlschlägt:
{ "retryStrategy": { "attempts": 3 } }
Mit dieser Konfiguration kann der Servicejob bis zu dreimal wiederholt werden, falls er fehlschlägt.
Wichtig
Der attempts Wert gibt an, wie oft der Auftrag insgesamt in den RUNNABLE Status versetzt werden kann, einschließlich des ersten Versuchs. Ein Wert von 3 bedeutet, dass der Job zunächst einmal versucht wird und dann, falls er fehlschlägt, bis zu 2 weitere Male wiederholt wird.
Versuchen Sie die Konfiguration mit evaluieren erneut OnExit
Sie können den evaluateOnExit Parameter verwenden, um Bedingungen anzugeben, unter denen Jobs wiederholt werden sollen oder unter denen sie fehlschlagen dürfen. Dies ist nützlich, wenn verschiedene Arten von Fehlern eine unterschiedliche Behandlung erfordern.
Das evaluateOnExit Array kann bis zu 5 Wiederholungsstrategien enthalten, die jeweils eine Aktion (RETRYoderEXIT) und Bedingungen angeben, die auf Statusgründen basieren:
{ "retryStrategy": { "attempts": 5, "evaluateOnExit": [ { "action": "RETRY", "onStatusReason": "Received status from SageMaker: InternalServerError*" }, { "action": "EXIT", "onStatusReason": "Received status from SageMaker: ValidationException*" }, { "action": "EXIT", "onStatusReason": "*" } ] } }
Diese Konfiguration:
-
Wiederholt Jobs, die aufgrund interner SageMaker AI-Serverfehler fehlschlagen
-
Schlägt sofort bei Aufträgen fehl, bei denen Validierungsausnahmen auftreten (Client-Fehler, die durch einen erneuten Versuch nicht behoben werden)
-
Beinhaltet eine Catch-All-Regel zum Beenden bei allen anderen Fehlertypen
Mustervergleich für Status, Grund und Grund
Der onStatusReason Parameter unterstützt den Mustervergleich mit bis zu 512 Zeichen. Muster können Platzhalter (*) verwenden und mit den von der SageMaker KI zurückgegebenen Statusgründen übereinstimmen.
Bei Serviceaufträgen wird den Statusmeldungen von SageMaker KI das Präfix „Status erhalten von SageMaker:“ vorangestellt, um sie von AWS Batch generierten Meldungen zu unterscheiden. Zu den gängigen Mustern gehören:
-
Received status from SageMaker: InternalServerError*- Interne Servicefehler abgleichen -
Received status from SageMaker: ValidationException*- Ordnen Sie die Fehler bei der Client-Validierung zu -
Received status from SageMaker: ResourceLimitExceeded*— Fehler bei der Ressourcenbeschränkung abgleichen -
*CapacityError*- Fehler im Zusammenhang mit der Kapazität abgleichen
Tipp
Verwenden Sie einen spezifischen Mustervergleich, um verschiedene Fehlertypen angemessen zu behandeln. Versuchen Sie es beispielsweise erneut mit internen Serverfehlern, schlagen Sie bei Überprüfungsfehlern, die auf Probleme mit den Auftragsparametern hinweisen, sofort fehl.