本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
容量和性能
Amazon Bedrock 提供灵活的容量选项,以满足您的工作负载要求和预算。了解按需套餐(Flex、Priority、Standard)、预留等级、批处理和跨区域推理之间的区别有助于优化性能和成本。
容量选项
| 容量类型 | 使用场景 | 主要特征 |
|---|---|---|
| On-Demand: Flex | 零星的低容量工作负载 |
|
| On-Demand: 标准 | 常规生产工作负载 |
|
| On-Demand: 优先级 | High-priority,延迟敏感型应用程序 |
|
| 预留等级 | 持续的高容量工作负载 |
|
| Batch | Large-scale,非时间敏感型处理 |
|
| Cross-Region 推断 | 可以在单个区域之外处理的工作负载 |
|
限制&配额
On-Demand 限额(按等级)
| Tier | 转速范围 | TPM 范围 | 节流风险 |
|---|---|---|---|
| 屈伸 | 10-100 | 5K-50K | 高 |
| 标准 | 100-500 | 50 K-150K | 中 |
| 优先级 | 500-1000+ | 150 K-300K + | 低 |
突发容量:适用于所有等级,以应对短暂的峰值
软限制:可通过服务配额申请提高
Model-specific: 实际限值因基础模型而异
预留等级限制
最低承诺:1 个模型单元
最大单位:特定账户和地区
Input/output 代币限额:基于购买的单位
在购买的容量内没有 RPM 限制
批处理限制
任务大小:每批最多 10,000 条记录
文件大小:最大 200 MB 的输入文件
处理时间:24 小时完成窗口
并行任务: Region-specific 配额
Cross-Region 推断
继承每个地区的按需等级限制
没有额外的配额开销
自动路由(无手动限额管理)
选择等级
决策框架
| 场景 | 推荐选项 | 为什么 |
|---|---|---|
| Development/testing | 屈伸 | 成本最低,非生产可接受 |
| 标准生产 | 标准 | 最佳性价比平衡 |
| 面向用户的关键应用程序 | 优先级 | 可靠性和性能高于成本 |
| 稳定的大容量负载 | 预留等级 | 承诺后可节省 30-50% |
| 批量数据处理 | Batch | 50% 折扣,非紧急工作负载 |
| Mission-critical 正常运行时间 | Cross-Region 推断 | 可用性 > 成本 |
优化策略
选择正确的 On-Demand 等级
对于大多数工作负载,从标准版开始
针对 dev/test 环境降级到 Flex
仅当限制影响用户时才升级到优先级
监控 CloudWatch 油门指标以为决策提供依据
过渡到预留等级
当持续负载超过按需成本的 40% 时
计算收支平衡:(每月按需成本)与(预留承诺)
最初使用 1 个月的承诺期
预留层可以与任何按需套餐一起使用
使用批处理
训练数据生成
内容审核积压
报告生成
数据丰富管道
组合方法
为基准流量预留等级
中度爆发的标准按需配置
关键高峰时段按需优先级
用于离线处理的批处理
对可以在单个区域之外处理的工作负载使用 Cross-Region 推理。
成本监控
比较等级成本:Flex < 标准 < 优先级
跟踪每个请求的令牌(优化提示)
使用 CloudWatch 指标进行使用和限制
为意外高峰设置账单警报
查看每月预留等级的使用情况
仅在出现限制时才评估等级升级