本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
關於執行和監控實驗
在生產環境中執行實驗需要仔細監控和營運規劃。逐漸增加暴露量、驗證實作和監控效能,有助於降低風險並改善實驗結果的可靠性。
營運考量事項
從低或 0% 曝光開始,並逐漸增加曝光
將使用者暴露於處理之前:
驗證處理轉譯
確認功能旗標評估
驗證指標和記錄
使用處理指派覆寫測試檢測
從 0% 曝光開始,有助於在影響使用者之前偵測實作問題。然後,您可以逐漸增加曝光,從而在發生問題時限制迴歸的影響。透過在不斷增加的負載下驗證實驗行為,您可以在向整個受眾公開變更之前監控實驗結果和操作指標。
定義轉返程序
開始實驗執行之前,請先判斷:
何時應停止執行
哪些指標表示不可接受的行為
如何停用處理
您可以在 CloudWatch 或第三方監控工具中設定警示,例如 Datadog、New Relic 或 Dynatrace,以在實驗期間監控關鍵指標,例如頁面載入時間、轉換率或錯誤率。如果警示觸發,請評估影響,並決定是否停止實驗執行或繼續。如需設定警示的詳細資訊,請參閱 監控部署以進行自動復原。
協調部署
避免在主動實驗執行期間引入主要應用程式變更。變更特徵標記邏輯、後端系統或使用者流程可能會使實驗結果失效或使分析複雜化。如果需要變更,請停止目前的執行,並在套用更新後啟動新的執行。
此外,限制影響相同使用者或功能的重疊實驗。重疊的實驗可能會扭曲結果並引入衝突行為。簡而言之,當對象重疊時,請仔細協調實驗。
如需應用程式如何從 AWS AppConfig 代理程式擷取指派處理的詳細資訊,包括 Entity-Id和 Context標頭,請參閱 擷取實驗處理。
效能考量
當您開始實驗時,請透過追蹤整個執行中的操作指標來監控應用程式效能。具體而言,監控:
延遲
錯誤率
輸送量
資源使用率
即使實驗指標顯示為正值,處理可能會影響系統行為。逐漸暴露有助於安全地識別這些問題。
驗證用戶端效能
對於 UI 實驗,監控:
頁面載入時間
轉譯效能
用戶端錯誤
裝置特定的行為
不同的處理方式可能會影響前端效能。
操作原則
當實驗正在執行時,請記住下列操作原則:
- 將實驗視為生產變更
-
即使是小型實驗也可能會影響應用程式穩定性、效能、使用者體驗和資料品質。仔細監控和逐漸暴露有助於降低風險,同時提高對實驗結果的信心。
- 維持處理一致性
-
使用者在整個執行期間應接受相同的處理方式。如需處理設計的詳細資訊,請參閱 關於控制和處理。
- 驗證檢測
-
增加曝光之前,請確認指標已正確記錄,且日誌包含處理資訊。
- 監控實驗特定的指標
-
除了操作指標之外,請監控與實驗直接相關的指標,例如:
轉換率
功能參與
點擊率
錯誤頻率
使用者保留
選擇符合實驗目標的指標。