Agentic Safety 危害分類參考
本頁是
harm_taxonomy.yaml的不可執行繁中參考。來源只提供示範用起始集合,分類、預設嚴重度與行動不得直接套用於正式平台。法律、危機處置、兒少安全與申訴程序須另行審查。
嚴重度
| ID | 來源定義摘要 |
|---|---|
info | 已觀察到但不構成違規,僅作為脈絡記錄 |
low | 輕微違規,可考慮標示或降低觸及等柔性措施 |
medium | 明確違規,可移除內容或限制使用者 |
high | 嚴重違規,可停權或禁止進入特定空間 |
critical | 迫近傷害或法律風險,來源預設自動處置並升級通報 |
critical 的來源描述不構成本地自動處置授權。正式系統必須先定義緊急事件、人員輪值、證據保存、必要通報、錯誤回復與申訴流程。
分流佇列
auto_action用於來源所稱高信心、低歧義情境,但仍須經平台核准才可啟用needs_review只提出建議,由人工審查者決定needs_classification用於無法清楚對應分類的模式,避免強迫套用標籤
分類表
| ID | 說明 | 預設嚴重度 | 預設行動 | 預設佇列 |
|---|---|---|---|---|
spam | 大量未經請求的宣傳、詐騙連結或重複張貼 | low | content_remove、content_demote、content_hide | auto_action |
coordinated_inauthentic_behavior | 多個帳號協同行動,操弄能見度或公共討論 | high | cluster_flag、account_suspend、content_remove | needs_review |
harassment | 針對個人或群體的辱罵、威脅或圍攻 | medium | content_remove、timeout、ban_from_space | needs_review |
hate_speech | 依受保護特徵攻擊他人 | high | content_remove、content_label_attach、account_suspend | needs_review |
violent_threats | 對人員或地點提出可信的實體暴力威脅 | critical | content_remove、account_suspend | auto_action |
sexual_content | 性內容,涉及未成年人時採更嚴格子分類 | high | content_remove、content_hide、account_suspend | needs_review |
self_harm | 鼓吹或以露骨方式呈現自傷或自殺 | high | content_hide、content_label_attach | needs_review |
impersonation | 帳號或內容冒充其他真實人物或實體 | medium | account_suspend、content_remove | needs_review |
platform_manipulation | 操弄觀看、投票、推升等互動或散布機制 | medium | content_demote、cluster_flag、account_suspend | needs_review |
off_platform_harm | 平台內接觸進一步導向平台外傷害,例如性勒索或誘騙轉移 | critical | account_suspend、ban_from_space | needs_review |
來源另定義 spam_ring、astroturfing、targeted、bulk、adult_nudity 與 csam 等子分類。csam 在來源標記 mandatory_escalation: true,實際通報義務、保存方式與處置流程必須依適用司法管轄及組織政策核定。
契約與界線
Report.category與harm_labels.category應使用本分類檔的 ID,不能由執行中的 agent 臨時發明新分類ModerationDecision.severity可由預設嚴重度起算,但證據支持時才能調高或調低ModerationDecision.action應限制在分類的default_actions,除非 playbook 提供可稽核的例外理由- 無法歸類時送往
needs_classification,新分類應透過版本審查提出 - YouTube 與 Discord 範例僅用於說明,不能作為單一平台的完備政策