Acción del sistema operativo del navegador
La InvokeBrowser API proporciona un control directo a nivel del sistema operativo sobre las sesiones del navegador Amazon Bedrock AgentCore . Si bien el terminal de WebSocket-based automatización utiliza el DevTools protocolo Chrome (CDP) para interactuar con el navegador, InvokeBrowser funciona a nivel del sistema operativo y permite realizar acciones que el CDP no puede gestionar, como interactuar con los cuadros de diálogo de impresión, los atajos de teclado, los menús contextuales que aparecen al hacer clic con el botón derecho del ratón, las alertas y la captura de capturas de pantalla a pantalla completa. JavaScript
Descripción general de
El AgentCore navegador Amazon Bedrock ofrece dos formas de interactuar con una sesión de navegador:
-
WebSocket-based automatización (CDP): utiliza el DevTools protocolo Chrome a través de una WebSocket conexión. Es ideal para las tareas de automatización estándar del navegador, como navegar por las páginas, hacer clic en los elementos del DOM, rellenar formularios y extraer el contenido de la página. Bibliotecas como Playwright y Browser-Use se conectan a través de este punto final.
-
OS-level actions (InvokeBrowser): utiliza una API REST para realizar interacciones a nivel del sistema operativo mediante acciones del ratón, el teclado y las capturas de pantalla. Esto complementa el CDP al gestionar situaciones en las que la automatización a nivel del navegador es insuficiente.
Úselo InvokeBrowser cuando su agente necesite:
-
Interactúe con los cuadros de diálogo nativos del sistema operativo, como los cuadros de diálogo de impresión, los cuadros de upload/download diálogo de archivos o las solicitudes de autenticación que se encuentran fuera del DOM del navegador
-
Descarte las JavaScript alertas, confirmaciones o solicitudes que bloqueen la ejecución del CDP
-
Utilice atajos de teclado (por ejemplo, ctrl+a, ctrl+p) que activen el comportamiento OS-level
-
Interactúe con los menús contextuales representados por el sistema operativo al hacer clic con el botón derecho
-
Capture capturas de pantalla completas del escritorio que incluyan contenido fuera de la ventana gráfica del navegador, como notificaciones del sistema operativo o diseños de ventanas múltiples
-
Realice operaciones de arrastrar y soltar que abarquen todas las ventanas del navegador o entre el navegador y el escritorio
InvokeBrowser sigue el mismo patrón que InvokeCodeInterpreter: una sola operación unificada con un envío tipo acción. Envías una solicitud con exactamente una acción y recibes el resultado correspondiente.
Acciones admitidas
InvokeBrowser apoya los siguientes tipos de acciones a través del BrowserAction sindicato. Se debe establecer exactamente un miembro de acción por solicitud.
Acciones del ratón
Para todas las acciones del ratón, los valores de las coordenadas (x,y) deben estar estrictamente dentro de los límites de la ventana gráfica de la sesión del navegador. Los rangos válidos son 1 < x < ventana gráfica Width-2 y 1 < y < ventana gráfica. Height-2 El tamaño predeterminado de la ventana gráfica es de 1456 x 819 píxeles, que se puede configurar al iniciar una sesión mediante el parámetro. viewPort
| Action | Campos obligatorios | Campos opcionales | Description (Descripción) |
|---|---|---|---|
|
|
|
|
Haga clic en las coordenadas especificadas. |
|
|
|
— |
Mueva el cursor a las coordenadas especificadas. |
|
|
|
|
Arrastre desde la posición inicial hasta la final. |
|
|
|
|
Desplázate hasta la posición especificada. |
Acciones del teclado
| Action | Campos obligatorios | Campos opcionales | Description (Descripción) |
|---|---|---|---|
|
|
|
— |
Escriba una cadena de texto. Longitud máxima: 10 000 caracteres. |
|
|
|
|
Pulse una tecla N veces. |
|
|
|
— |
Pulse una combinación de teclas (por ejemplo, |
Acción de captura de pantalla
| Action | Campos obligatorios | Campos opcionales | Description (Descripción) |
|---|---|---|---|
|
|
— |
|
Capture todo el escritorio del sistema operativo (no solo la ventana gráfica del navegador). Formato: solo PNG. |
Consideraciones
-
ASCII-only entrada de texto: la
keyTypeacción solo admite caracteres ASCII. Non-ASCII los caracteres (como los caracteres Unicode o multibyte) se omiten durante la entrada. -
Sin validación del nombre de clave: las
keyShortcutaccioneskeyPressy no validan si se admiten los nombres de clave especificados. Si proporciona un nombre de clave no reconocido, la API devuelve el estado CORRECTO sin realizar la acción prevista. Consulta los nombres de clave compatibles que se indican más arriba. -
Nombres de clave admitidos: los nombres de las claves
keyPressykeyShortcutlas acciones deben estar en minúsculas. Las claves admitidas incluyen caracteres individuales (a0—z, —9) y claves con nombre comoenter,,tab,space,backspace,delete,escapectrl,alt.shift
Formatos de solicitud y respuesta
Solicitud
POST /browsers/{browserIdentifier}/sessions/invoke HTTP/1.1 x-amzn-browser-session-id: sessionId Content-type: application/json
El cuerpo de la solicitud contiene un action campo con exactamente un miembro del conjunto de BrowserAction uniones:
{ "action": { "mouseClick": { "x": 100, "y": 200, "button": "LEFT", "clickCount": 1 } } }
Respuesta
sessionIdSe devuelve a través del encabezado de x-amzn-browser-session-id respuesta. El cuerpo de la respuesta contiene un result campo con el resultado de la acción correspondiente.
En caso de éxito:
{ "result": { "mouseClick": { "status": "SUCCESS", "error": null } } }
En caso de error, el status campo se establece en ERROR y contiene una descripción del error. error
Ejemplos
Los siguientes ejemplos muestran cómo invocar acciones del navegador mediante la AWS CLI, el AWS SDK para Python (Boto3) y la API.