Agentic Safety Playbook 參考
本頁把兩份可執行 playbook 整理為不可執行的繁中參考。查詢、門檻與動作名稱保留以便稽核,沒有建立資料庫連線、執行 SQL 或啟用任何審核動作。
協同留言調查
來源 investigation_coordinated_commenting.yaml 的 playbook_id 為 investigation_coordinated_commenting,版本 0.1,persona 是 investigation,權限為 recommend_only。
觸發條件是開啟中的 Report 指向內容,類別為 spam 或 coordinated_inauthentic_behavior。流程讀取檢舉、內容、作者訊號、同一空間最近 7 天最多 500 筆相鄰內容,以及既有群組。
走訪順序
1_load_report載入檢舉2_load_flagged_content載入被標記內容3_load_author_signals載入作者信譽、信任層級、裝置指紋與群組關係4_fan_out_siblings取得同一空間內的近期內容5_collect_near_duplicates比對相似雜湊或近似重複群組6_resolve_clusters查詢作者已有的群組6b_derive_fingerprint_cohort在沒有群組且至少有三個近似項目時,推導共用裝置的候選群組
建議規則
lone_spammer在近似項目少於 3 且作者信譽低於 0.3 時,建議將內容送往垃圾訊息移除路徑spam_ring在群組協調分數至少 0.8、群組信心至少 0.7,且近似項目至少 3 筆時,建議標記群組並送人工審查pre_cluster_ring在共用裝置候選使用者至少 3 名且近似項目至少 3 筆時,建議標記候選群組並送人工審查ambiguous_route_to_classification接住其他情況,送往needs_classification
輸出會建立 Case,記錄檢舉、群組、近似內容證據與負責審查者。YouTube 情境把 Space 視為影片、Content 視為留言、Actor 視為頻道。Discord 情境把 Space 視為頻道或伺服器、Content 視為訊息、Actor 視為使用者。
共用裝置或內容近似只能作為調查線索。來源權限為 recommend_only,不得由這份 playbook 直接停權或移除內容。
正式環境垃圾訊息自動處置
來源 production_spam_autoaction.yaml 的 playbook_id 為 production_spam_autoaction,版本 0.1,persona 是 production,權限標示為 auto_action。這項標示只反映來源設計,繁中參考頁不授予正式環境權限。
來源觸發條件包含垃圾訊息分類分數至少 0.95、沒有嚴重度為 critical 的危害標籤,且作者未經驗證。
來源限制
| 限制 | 值 |
|---|---|
| 每位作者每分鐘最多動作數 | 5 |
| 全域每小時最多動作數 | 10,000 |
| 最低 grounded confidence | 0.9 |
| 人工品質抽樣比例 | 0.02 |
| 禁止自動處理類別 | csam、violent_threats、off_platform_harm、self_harm |
| 禁止自動行動 | account_suspend、ban_from_space |
流程載入內容與即時訊號、作者信任資料、作者近期被處置次數,再計算 grounded_confidence。規則式路徑把 llm_uncertainty 設為 0.0,最後信心為 grounded confidence 乘以 1 減去 LLM 不確定度。
決策規則
bail_rate_limit在作者達到速率上限時,升級至協同留言調查bail_trusted_actor對trusted或partner使用者一律送人工審查auto_remove只在最後信心至少 0.9、垃圾訊息分數至少 0.95 且作者信譽低於 0.3 時,形成低嚴重度的content_removeescalate_default將未通過門檻的情況送往協同留言調查
來源在寫入 ModerationDecision 後保留可申訴狀態、抽樣人工品質檢查並發出稽核事件。YouTube 模板只允許處理影片下的留言,不含創作者最上層內容。Discord 模板只限公開頻道訊息,私訊須人工審查。
正式採用前最低條件
- 將來源中標記給整合者處理的查詢綁定實際資料結構,並進行唯讀測試
- 驗證計數查詢同時涵蓋直接針對作者及針對該作者內容的決策
- 由治理負責人核定門檻、禁止類別、行動範圍與申訴處理
- 建立全域與個別作者速率限制、停止開關、回復及事件稽核
- 先以影子模式及人工抽樣驗證錯誤率,再決定是否授權任何自動動作