Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

Agentic Safety Playbook 參考

本頁把兩份可執行 playbook 整理為不可執行的繁中參考。查詢、門檻與動作名稱保留以便稽核,沒有建立資料庫連線、執行 SQL 或啟用任何審核動作。

協同留言調查

來源 investigation_coordinated_commenting.yamlplaybook_idinvestigation_coordinated_commenting,版本 0.1,persona 是 investigation,權限為 recommend_only

觸發條件是開啟中的 Report 指向內容,類別為 spamcoordinated_inauthentic_behavior。流程讀取檢舉、內容、作者訊號、同一空間最近 7 天最多 500 筆相鄰內容,以及既有群組。

走訪順序

  1. 1_load_report 載入檢舉
  2. 2_load_flagged_content 載入被標記內容
  3. 3_load_author_signals 載入作者信譽、信任層級、裝置指紋與群組關係
  4. 4_fan_out_siblings 取得同一空間內的近期內容
  5. 5_collect_near_duplicates 比對相似雜湊或近似重複群組
  6. 6_resolve_clusters 查詢作者已有的群組
  7. 6b_derive_fingerprint_cohort 在沒有群組且至少有三個近似項目時,推導共用裝置的候選群組

建議規則

  • lone_spammer 在近似項目少於 3 且作者信譽低於 0.3 時,建議將內容送往垃圾訊息移除路徑
  • spam_ring 在群組協調分數至少 0.8、群組信心至少 0.7,且近似項目至少 3 筆時,建議標記群組並送人工審查
  • pre_cluster_ring 在共用裝置候選使用者至少 3 名且近似項目至少 3 筆時,建議標記候選群組並送人工審查
  • ambiguous_route_to_classification 接住其他情況,送往 needs_classification

輸出會建立 Case,記錄檢舉、群組、近似內容證據與負責審查者。YouTube 情境把 Space 視為影片、Content 視為留言、Actor 視為頻道。Discord 情境把 Space 視為頻道或伺服器、Content 視為訊息、Actor 視為使用者。

共用裝置或內容近似只能作為調查線索。來源權限為 recommend_only,不得由這份 playbook 直接停權或移除內容。

正式環境垃圾訊息自動處置

來源 production_spam_autoaction.yamlplaybook_idproduction_spam_autoaction,版本 0.1,persona 是 production,權限標示為 auto_action。這項標示只反映來源設計,繁中參考頁不授予正式環境權限。

來源觸發條件包含垃圾訊息分類分數至少 0.95、沒有嚴重度為 critical 的危害標籤,且作者未經驗證。

來源限制

限制
每位作者每分鐘最多動作數5
全域每小時最多動作數10,000
最低 grounded confidence0.9
人工品質抽樣比例0.02
禁止自動處理類別csamviolent_threatsoff_platform_harmself_harm
禁止自動行動account_suspendban_from_space

流程載入內容與即時訊號、作者信任資料、作者近期被處置次數,再計算 grounded_confidence。規則式路徑把 llm_uncertainty 設為 0.0,最後信心為 grounded confidence 乘以 1 減去 LLM 不確定度。

決策規則

  • bail_rate_limit 在作者達到速率上限時,升級至協同留言調查
  • bail_trusted_actortrustedpartner 使用者一律送人工審查
  • auto_remove 只在最後信心至少 0.9、垃圾訊息分數至少 0.95 且作者信譽低於 0.3 時,形成低嚴重度的 content_remove
  • escalate_default 將未通過門檻的情況送往協同留言調查

來源在寫入 ModerationDecision 後保留可申訴狀態、抽樣人工品質檢查並發出稽核事件。YouTube 模板只允許處理影片下的留言,不含創作者最上層內容。Discord 模板只限公開頻道訊息,私訊須人工審查。

正式採用前最低條件

  1. 將來源中標記給整合者處理的查詢綁定實際資料結構,並進行唯讀測試
  2. 驗證計數查詢同時涵蓋直接針對作者及針對該作者內容的決策
  3. 由治理負責人核定門檻、禁止類別、行動範圍與申訴處理
  4. 建立全域與個別作者速率限制、停止開關、回復及事件稽核
  5. 先以影子模式及人工抽樣驗證錯誤率,再決定是否授權任何自動動作