本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
关于运行和监控实验
在生产环境中进行实验需要仔细的监控和运营规划。逐步增加曝光率、验证实施情况和监控性能可以帮助降低风险并提高实验结果的可靠性。
运营注意事项
从低或 0% 的曝光量开始,然后逐渐增加曝光量
在让用户接受治疗之前:
验证治疗效果图
确认功能标志评估
验证指标和日志
使用治疗分配替代项测试仪器
从 0% 的曝光率开始有助于在影响用户之前发现实施问题。然后,您可以逐渐增加曝光率,从而在出现问题时限制回归的影响。通过验证负载增加下的实验行为,您可以在让所有受众接触变化之前监控实验结果和运营指标。
定义回滚程序
在开始实验运行之前,请确定:
什么时候应该停止运行
哪些指标表明行为不可接受
如何禁用治疗
您可以在 Datadog、New Relic CloudWatch 或 Dynatrace 等第三方监控工具中配置警报,以监控实验期间的页面加载时间、转化率或错误率等关键指标。如果警报触发,评估影响并决定是停止还是继续实验。有关配置警报的更多信息,请参阅监控部署以实现自动回滚。
协调部署
避免在活跃的实验运行期间引入重大的应用程序更改。对特征标志逻辑、后端系统或用户流的更改可能会使实验结果失效或使分析复杂化。如果需要更改,请停止当前运行并在应用更新后重新开始运行。
此外,限制影响相同用户或功能的重叠实验。重叠的实验可能会歪曲结果并引入相互冲突的行为。简而言之,当观众重叠时,应仔细协调实验。
有关您的应用程序如何从 AWS AppConfig Agent 检索分配的待遇(包括Entity-Id和Context标头)的详细信息,请参阅检索实验疗法。
性能注意事项
当您开始实验时,通过跟踪整个运行过程中的运行指标来监控应用程序性能。具体而言,监控:
延迟
错误率
吞吐量
资源利用情况
即使实验指标显示为阳性,治疗也可能会影响系统行为。逐步曝光有助于安全地识别这些问题。
验证客户端性能
对于 UI 实验,请监控:
页面加载时间
渲染性能
Client-side 错误
Device-specific 行为
不同的处理方法可能会对前端性能产生不同的影响。
操作原则
在实验进行时,请记住以下操作原则:
- 将实验视为生产变化
-
即使是小型实验也会影响应用程序的稳定性、性能、用户体验和数据质量。仔细监测和逐步曝光有助于降低风险,同时提高对实验结果的信心。
- 保持治疗一致性
-
在整个运行过程中,用户应获得相同的待遇。有关治疗设计的更多信息,请参阅关于对照和治疗。
- 验证仪器
-
在增加曝光率之前,请确认指标记录正确且日志中包含治疗信息。
- 监控特定实验指标
-
除了运营指标外,还要监控与实验直接相关的指标,例如:
转化率
功能参与度
Click-through 费率
错误频率
用户留存率
选择与实验目标一致的指标。